Qeexid
RLHF waxay tababartaa moodel abaal-marin (reward model) oo ka timaadda isbarbardhigyada aadanaha ee natiijooyinka, ka dibna waxay hagaajisaa LLM-ka (badanaa iyadoo la isticmaalayo PPO ama mid la mid ah) si uu dhibco sare u helo abaal-marintaas isagoo aan ka fogaan moodelka tixraaca ah.
Waa mid ka mid ah sababaha ugu waaweyn ee moodellada wada-hadalka ay u dareemayaan kuwo waxtar leh oo diida codsiyada dhibaataha leh — leh xaddidaad iyo eexo la yaqaan.
Si fudud
Aadanuhu waxay isbarbardhigaan laba qormood; tababare wuxuu bartaa waxa "wanaagsan" u eg yahay; ardaygu wuxuu ku celceliyaa inuu ka farxiyo tababarahaas isagoon illoobin sida loo qoro.
Halka aad ka aragto
- Habraacyada hoggaansiinta nooca InstructGPT / ChatGPT.
- Hagaajinta dookhyada dhawrka, ammaanka, iyo waxtarka.
Sida ay u shaqeyso
1.Ururi dookhyada
Aadanuhu waxay kala sarreeyaan ama qiimeeyaan natiijooyinka moodelka.
2.Tababar moodelka abaal-marinta
Saadaali natiijada ay aadanuhu jecel yihiin.
3.Hagaaji siyaasadda RL
Cusboonaysii LLM-ka si uu abaal-marinta ugu badiyo isagoo ku xaddidan xayiraadaha KL.
Maxay muhiim u tahay
- RLHF (iyo kuwa la mid ah sida DPO) waxay moodellada asalka ah u beddelaan kaaliyayaal la isticmaali karo.
Inta badan la khaldo
RLHF wuxuu moodellada ka dhigayaa run wax kasta.
Wuxuu hagaajiyaa dhibcaha dookhda — taasoo laga yaabo inay ku abaal marto codka kalsoonida halkii ay ku abaal marin lahayd sax-nimada xaqiiqda.