Dhammaan ereyada

RLHF

Barashada Xoojinta ee ka Timaadda Jawaab-celinta Aadanaha (Reinforcement Learning from Human Feedback) — u hoggaansiinta moodellada dookhyada aadanaha iyadoo la isticmaalayo tusaalooyin la kala sarreeyay iyo moodel abaal-marin.

Moodellada Luqadda Waaweyn2 daqiiqo akhris

Qeexid

RLHF waxay tababartaa moodel abaal-marin (reward model) oo ka timaadda isbarbardhigyada aadanaha ee natiijooyinka, ka dibna waxay hagaajisaa LLM-ka (badanaa iyadoo la isticmaalayo PPO ama mid la mid ah) si uu dhibco sare u helo abaal-marintaas isagoo aan ka fogaan moodelka tixraaca ah.

Waa mid ka mid ah sababaha ugu waaweyn ee moodellada wada-hadalka ay u dareemayaan kuwo waxtar leh oo diida codsiyada dhibaataha leh — leh xaddidaad iyo eexo la yaqaan.

Si fudud

Aadanuhu waxay isbarbardhigaan laba qormood; tababare wuxuu bartaa waxa "wanaagsan" u eg yahay; ardaygu wuxuu ku celceliyaa inuu ka farxiyo tababarahaas isagoon illoobin sida loo qoro.

Halka aad ka aragto

  • Habraacyada hoggaansiinta nooca InstructGPT / ChatGPT.
  • Hagaajinta dookhyada dhawrka, ammaanka, iyo waxtarka.

Sida ay u shaqeyso

  1. 1.Ururi dookhyada

    Aadanuhu waxay kala sarreeyaan ama qiimeeyaan natiijooyinka moodelka.

  2. 2.Tababar moodelka abaal-marinta

    Saadaali natiijada ay aadanuhu jecel yihiin.

  3. 3.Hagaaji siyaasadda RL

    Cusboonaysii LLM-ka si uu abaal-marinta ugu badiyo isagoo ku xaddidan xayiraadaha KL.

Maxay muhiim u tahay

  • RLHF (iyo kuwa la mid ah sida DPO) waxay moodellada asalka ah u beddelaan kaaliyayaal la isticmaali karo.

Inta badan la khaldo

  • RLHF wuxuu moodellada ka dhigayaa run wax kasta.

    Wuxuu hagaajiyaa dhibcaha dookhda — taasoo laga yaabo inay ku abaal marto codka kalsoonida halkii ay ku abaal marin lahayd sax-nimada xaqiiqda.