Dhammaan ereyada

Barashada Abaalmarinta (RL)

Barasho ku salaysan isku day iyo qalad — agent-ku wuxuu qaataa falalka, wuxuu helaa abaalmarinno, waxaana uu si joogto ah u wanaajiyaa siyaasad (policy) waqti ka dib.

Barashada Mashiinka2 daqiiqo akhris

Qeexid

Barashada abaalmarinta waxay tababartaa agent si ay u kordhiso abaalmarinta guud ee ay heli karto iyadoo la falgashanaysa deegaanka. Si ka duwan barashada la kormeeray, ma jirto summad sax ah oo joogto ah heer kasta — waxaa jira oo kaliya jawaab celin ka dib falal.

RL waxay saldhig u tahay AI-yada ciyaaraha, xakameynta robotka, iyo hababka isku-habboonaynta sida RLHF ee moodeelada luqadda.

Si fudud

RL waa sida in eey lagu tababaro cunto: falal wanaagsan waxay helaan abaalmarin, kuwa xun ma helaan waxba (ama ciqaab). Isku day badan ka dib, eeygu wuxuu bartaa dabeecadaha faa'iido leh.

Halka aad ka aragto

  • AlphaGo iyo agent-yada ciyaaraha ee ku barta iyaga oo isla ciyaaraya.
  • Siyaasadaha robotics ee qabashada iyo dhaqdhaqaaqa.
  • RLHF oo hagaya moodeelada wada-hadalka si loo helo jawaabaha la doorbiday.

Sida ay u shaqeyso

  1. 1.Fiiri xaaladda

    Agent-ku wuxuu arkaa deegaanka hadda jira.

  2. 2.Qaad fal

    Ku dooro fal siyaasad (strategy).

  3. 3.Hel abaalmarin

    Jawaab-celin tiro ah ayaa muujinaysa guul ama fashil.

  4. 4.Cusboonaysii siyaasadda

    Ku hagaaji falalka kordhiya abaalmarinta mustaqbalka.

Maxay muhiim u tahay

  • RL waa sida nidaamyada AI-ga ay ku bartaan go'aannada isku-xigxiga marka summadaha yaraan yihiin laakiin natiijooyinka lagu qiimeeyi karo.

Inta badan la khaldo

  • RL waa isla mid la kormeerida fine-tuning.

    Barashada la kormeeray waxay ku dayataa tusaalayaal summaysan; RL waxay hagaajisaa summad abaalmarin iyada oo ku salaysan sahamin (exploration).