Qeexid
Barashada abaalmarinta waxay tababartaa agent si ay u kordhiso abaalmarinta guud ee ay heli karto iyadoo la falgashanaysa deegaanka. Si ka duwan barashada la kormeeray, ma jirto summad sax ah oo joogto ah heer kasta — waxaa jira oo kaliya jawaab celin ka dib falal.
RL waxay saldhig u tahay AI-yada ciyaaraha, xakameynta robotka, iyo hababka isku-habboonaynta sida RLHF ee moodeelada luqadda.
Si fudud
RL waa sida in eey lagu tababaro cunto: falal wanaagsan waxay helaan abaalmarin, kuwa xun ma helaan waxba (ama ciqaab). Isku day badan ka dib, eeygu wuxuu bartaa dabeecadaha faa'iido leh.
Halka aad ka aragto
- AlphaGo iyo agent-yada ciyaaraha ee ku barta iyaga oo isla ciyaaraya.
- Siyaasadaha robotics ee qabashada iyo dhaqdhaqaaqa.
- RLHF oo hagaya moodeelada wada-hadalka si loo helo jawaabaha la doorbiday.
Sida ay u shaqeyso
1.Fiiri xaaladda
Agent-ku wuxuu arkaa deegaanka hadda jira.
2.Qaad fal
Ku dooro fal siyaasad (strategy).
3.Hel abaalmarin
Jawaab-celin tiro ah ayaa muujinaysa guul ama fashil.
4.Cusboonaysii siyaasadda
Ku hagaaji falalka kordhiya abaalmarinta mustaqbalka.
Maxay muhiim u tahay
- RL waa sida nidaamyada AI-ga ay ku bartaan go'aannada isku-xigxiga marka summadaha yaraan yihiin laakiin natiijooyinka lagu qiimeeyi karo.
Inta badan la khaldo
RL waa isla mid la kormeerida fine-tuning.
Barashada la kormeeray waxay ku dayataa tusaalayaal summaysan; RL waxay hagaajisaa summad abaalmarin iyada oo ku salaysan sahamin (exploration).