Buckets:
| import{s as pi,n as gi,o as fi}from"../chunks/scheduler.893fe8c9.js";import{S as ui,i as Li,e as a,s as l,c as m,h as di,a as s,d as n,b as r,f as mi,g as p,j as o,k as fn,l as $i,m as i,n as g,t as f,o as u,p as L}from"../chunks/index.b1df2166.js";import{C as xi,H as d,E as vi}from"../chunks/MermaidChart.svelte_svelte_type_style_lang.8f77b2d3.js";import{Q as De}from"../chunks/Question.ea6d4cb0.js";function ci(un){let $,je,qe,Ie,c,Se,R,Be,C,Ln="ပထမဆုံး စာမျက်နှာမှ ကြိုဆိုပါတယ်။",Ue,P,dn="ကျွန်တော်တို့ဟာ Reinforcement Learning (RL) ရဲ့ စိတ်လှုပ်ရှားဖွယ်ရာ ကမ္ဘာဆီကို ခရီးစတင်ပြီး၊ သင်နေ့စဉ်အသုံးပြုနေနိုင်တဲ့ Language Models တွေကို လေ့ကျင့်ရာမှာ ဒါက ဘယ်လိုတော်လှန်ပြောင်းလဲနေလဲဆိုတာ ရှာဖွေသွားမှာပါ။",Qe,x,$n='<p>ဒီအခန်းမှာ၊ ကျွန်တော်တို့ဟာ language models တွေအတွက် reinforcement learning ကို အဓိကထား လေ့လာသွားမှာပါ။ သို့သော်လည်း၊ reinforcement learning ဟာ language models တွေအပြင် အခြားသော applications များစွာရှိတဲ့ ကျယ်ပြန့်တဲ့ နယ်ပယ်တစ်ခုပါ။ သင် reinforcement learning အကြောင်း ပိုမိုလေ့လာချင်တယ်ဆိုရင် <a href="https://huggingface.co/courses/deep-rl-course/en/unit1/introduction" rel="nofollow">Deep Reinforcement Learning course</a> ကို ကြည့်ရှုသင့်ပါတယ်။</p>',Ke,w,xn="ဒီစာမျက်နှာက RL နဲ့ ပတ်သက်ပြီး သင်ဘယ်တုန်းကမှ မကြုံဖူးရင်တောင်မှ၊ ဖော်ရွေပြီး ရှင်းလင်းပြတ်သားတဲ့ နိဒါန်းတစ်ခုကို ပေးပါလိမ့်မယ်။ အဓိကအယူအဆတွေကို ခွဲခြမ်းစိတ်ဖြာပြီး Large Language Models (LLMs) နယ်ပယ်မှာ RL ဟာ ဘာကြောင့် ဒီလောက်အရေးပါလာတာလဲဆိုတာကို ကြည့်ရပါမယ်။",Ne,M,Je,H,vn="ခွေးတစ်ကောင်ကို လေ့ကျင့်ပေးနေတယ်လို့ မြင်ယောင်ကြည့်ပါ။ သင်က ခွေးကို ထိုင်ခိုင်းချင်တယ်။ သင်က “ထိုင်!” လို့ ပြောပြီး ခွေးက ထိုင်ရင် ဆုအဖြစ် မုန့်ပေးပြီး ချီးကျူးပါလိမ့်မယ်။ မထိုင်ရင်တော့ ညင်သာစွာ လမ်းညွှန်ပေးတာ ဒါမှမဟုတ် ထပ်ကြိုးစားတာမျိုး လုပ်ပါလိမ့်မယ်။ အချိန်ကြာလာတာနဲ့အမျှ ခွေးက ထိုင်ခြင်းကို ကောင်းမွန်တဲ့ ဆုလာဘ် (မုန့်နဲ့ ချီးကျူးခြင်း) နဲ့ ဆက်စပ်ပြီး သင် “ထိုင်!” လို့ ထပ်ပြောတဲ့အခါ ထိုင်ဖို့ ပိုပြီးဖြစ်နိုင်ချေရှိလာပါလိမ့်မယ်။ Reinforcement learning မှာ၊ ဒီ feedback ကို <strong>reward</strong> လို့ ကျွန်တော်တို့ ခေါ်ပါတယ်။",Ve,y,cn="အနှစ်ချုပ်ပြောရရင် ဒါက Reinforcement Learning ရဲ့ အခြေခံအယူအဆပါပဲ! ခွေးအစား ကျွန်တော်တို့မှာ <strong>language model</strong> (reinforcement learning မှာ ကျွန်တော်တို့က <strong>agent</strong> လို့ ခေါ်ပါတယ်) ရှိပြီး၊ သင့်အစား feedback ပေးတဲ့ <strong>environment</strong> ရှိပါတယ်။",We,T,Rn='<img src="https://huggingface.co/reasoning-course/images/resolve/main/grpo/3.jpg" alt="RL terms Process"/>',Xe,_,Cn="RL ရဲ့ အဓိကအစိတ်အပိုင်းတွေကို ခွဲခြမ်းစိတ်ဖြာကြည့်ရအောင်။",Ye,b,Ze,h,Pn="ဒါက ကျွန်တော်တို့ရဲ့ သင်ယူသူ (learner) ပါ။ ခွေးဥပမာမှာ၊ ခွေးက agent ပါ။ LLMs အခြေအနေမှာ၊ LLM ကိုယ်တိုင်က ကျွန်တော်တို့ လေ့ကျင့်ချင်တဲ့ agent ဖြစ်လာပါတယ်။ Agent က ဆုံးဖြတ်ချက်တွေ ချမှတ်ပြီး environment နဲ့ ၎င်းရဲ့ rewards တွေကနေ သင်ယူသူပါ။",et,k,tt,O,wn="ဒါက agent နေထိုင်ပြီး အပြန်အလှန်ဆက်ဆံတဲ့ ကမ္ဘာပါ။ ခွေးအတွက်ကတော့ သင့်အိမ်နဲ့ သင်ပါ။ LLM အတွက်ကတော့ environment က နည်းနည်း ပိုပြီး abstract ပါ – အဲဒါက သူအပြန်အလှန်ဆက်ဆံတဲ့ users တွေ ဖြစ်နိုင်သလို၊ ကျွန်တော်တို့ သူ့အတွက် သတ်မှတ်ထားတဲ့ simulated scenario တစ်ခုလည်း ဖြစ်နိုင်ပါတယ်။ Environment က agent ကို feedback ပေးပါတယ်။",nt,F,it,A,Mn="ဒါတွေက environment ထဲမှာ agent က လုပ်နိုင်တဲ့ ရွေးချယ်မှုတွေပါ။ ခွေးရဲ့ actions တွေက “ထိုင်”၊ “ရပ်”၊ “ဟောင်” စတာတွေလိုမျိုးပါ။ LLM အတွက်ကတော့ actions တွေက စာကြောင်းတစ်ကြောင်းမှာ စကားလုံးတွေ ထုတ်လုပ်တာ၊ မေးခွန်းတစ်ခုရဲ့ ဘယ်အဖြေကို ပေးရမလဲဆိုတာ ရွေးချယ်တာ ဒါမှမဟုတ် စကားဝိုင်းတစ်ခုမှာ ဘယ်လိုတုံ့ပြန်ရမလဲဆိုတာ ဆုံးဖြတ်တာမျိုးတွေ ဖြစ်နိုင်ပါတယ်။",lt,z,rt,G,Hn="ဒါက agent က action တစ်ခုယူပြီးတဲ့နောက် environment က agent ကို ပေးတဲ့ feedback ပါ။ Rewards တွေက များသောအားဖြင့် ကိန်းဂဏန်းတွေပါ။",at,q,yn="<strong>Positive rewards</strong> တွေက မုန့်နဲ့ ချီးကျူးခြင်းလိုပါပဲ – ဒါတွေက agent ကို “ကောင်းတယ်၊ မှန်ကန်တာတစ်ခု လုပ်ခဲ့တယ်!” လို့ ပြောပါတယ်။",st,E,Tn="<strong>Negative rewards</strong> (ဒါမှမဟုတ် penalties) တွေက ညင်သာတဲ့ “မဟုတ်ဘူး” လိုပါပဲ – ဒါတွေက agent ကို “ဒါက သိပ်မမှန်ဘူး၊ တခြားတစ်ခု ကြိုးစားကြည့်ပါ” လို့ ပြောပါတယ်။ ခွေးအတွက်ကတော့ မုန့်က reward ပါ။",ot,D,_n="LLM အတွက်ကတော့ rewards တွေကို LLM က သတ်မှတ်ထားတဲ့ task တစ်ခုမှာ ဘယ်လောက်ကောင်းကောင်း လုပ်ဆောင်နေလဲဆိုတာကို ထင်ဟပ်အောင် ဒီဇိုင်းထုတ်ထားပါတယ် – ဒါက သူ့ရဲ့ တုံ့ပြန်မှုဟာ ဘယ်လောက်အသုံးဝင်လဲ၊ မှန်ကန်လဲ၊ ဒါမှမဟုတ် အန္တရာယ်ကင်းလဲဆိုတာမျိုး ဖြစ်နိုင်ပါတယ်။",mt,j,pt,I,bn="ဒါက agent ရဲ့ actions တွေ ရွေးချယ်ဖို့ ဗျူဟာ (strategy) ပါ။ ဒါဟာ သင် “ထိုင်!” လို့ ပြောတဲ့အခါ ခွေးက ဘာလုပ်သင့်တယ်ဆိုတာ နားလည်ထားတာမျိုးပါပဲ။ RL မှာ policy ဟာ ကျွန်တော်တို့ တကယ်သင်ယူပြီး တိုးတက်အောင် လုပ်ဖို့ ကြိုးစားနေတာပါ။ ဒါက မတူညီတဲ့ အခြေအနေတွေမှာ agent က ဘယ် action ကို ယူရမလဲဆိုတာ ပြောပြတဲ့ စည်းမျဉ်းစည်းကမ်းများ သို့မဟုတ် function တစ်ခုပါ။ အစပိုင်းမှာ policy က random ဖြစ်နိုင်ပေမယ့်၊ agent က သင်ယူလာတာနဲ့အမျှ policy က ပိုမိုမြင့်မားတဲ့ rewards တွေကို ဖြစ်ပေါ်စေတဲ့ actions တွေကို ရွေးချယ်ရာမှာ ပိုကောင်းလာပါတယ်။",gt,S,ft,B,hn='<img src="https://huggingface.co/reasoning-course/images/resolve/main/grpo/1.jpg" alt="RL Process"/>',ut,U,kn="Reinforcement Learning က စမ်းသပ်မှုနဲ့ အမှား (trial and error) လုပ်ငန်းစဉ်ကနေတစ်ဆင့် ဖြစ်ပျက်ပါတယ်။",Lt,Q,On="<thead><tr><th>အဆင့်</th> <th>လုပ်ငန်းစဉ်</th> <th>ဖော်ပြချက်</th></tr></thead> <tbody><tr><td>၁။ Observation</td> <td>Agent က environment ကို လေ့လာသည်။</td> <td>Agent က သူ့ရဲ့ လက်ရှိအခြေအနေနဲ့ ပတ်ဝန်းကျင်အကြောင်း အချက်အလက်တွေကို ရယူသည်။</td></tr> <tr><td>၂။ Action</td> <td>Agent က သူ့ရဲ့ လက်ရှိ policy ကို အခြေခံပြီး action တစ်ခု ယူသည်။</td> <td>သူသင်ယူထားတဲ့ ဗျူဟာ (policy) ကို အသုံးပြုပြီး agent က နောက်ဘာလုပ်ရမလဲဆိုတာ ဆုံးဖြတ်သည်။</td></tr> <tr><td>၃။ Feedback</td> <td>Environment က agent ကို reward ပေးသည်။</td> <td>Agent က သူယူခဲ့တဲ့ action က ဘယ်လောက်ကောင်းလဲ ဒါမှမဟုတ် ဆိုးလဲဆိုတဲ့ feedback ကို ရရှိသည်။</td></tr> <tr><td>၄။ Learning</td> <td>Agent က reward ကို အခြေခံပြီး သူ့ရဲ့ policy ကို update လုပ်သည်။</td> <td>Agent က သူ့ရဲ့ ဗျူဟာကို ချိန်ညှိသည် - မြင့်မားတဲ့ rewards တွေဆီ ဦးတည်စေတဲ့ actions တွေကို အားဖြည့်ပြီး နည်းပါးတဲ့ rewards တွေဆီ ဦးတည်စေတဲ့ actions တွေကို ရှောင်ရှားသည်။</td></tr> <tr><td>၅။ Iteration</td> <td>လုပ်ငန်းစဉ်ကို ထပ်ခါတလဲလဲ လုပ်ဆောင်သည်။</td> <td>ဒီ cycle က ဆက်လက်ဖြစ်ပေါ်ပြီး agent ကို ဆုံးဖြတ်ချက်ချမှတ်မှုမှာ ဆက်တိုက်တိုးတက်အောင် လုပ်ဆောင်စေသည်။</td></tr></tbody>",dt,K,Fn="စက်ဘီးစီးတတ်ဖို့ သင်ယူတာကို စဉ်းစားကြည့်ပါ။ အစပိုင်းမှာ ယိုင်လဲတာမျိုး ဖြစ်နိုင်ပါတယ် (negative reward!)။ ဒါပေမယ့် သင် ဟန်ချက်ညီညီ စီးနင်းနိုင်တဲ့အခါ ကောင်းကောင်းခံစားရပါလိမ့်မယ် (positive reward!)။ ဒီ feedback ကို အခြေခံပြီး သင့်ရဲ့ actions တွေကို ချိန်ညှိပါ – အနည်းငယ် ကိုင်းတာ၊ ပိုမြန်မြန် နင်းတာ စသည်ဖြင့် – သင် ကောင်းကောင်းစီးတတ်လာတဲ့အထိပါပဲ။ RL ကလည်း အလားတူပါပဲ – အပြန်အလှန်ဆက်ဆံမှုနဲ့ feedback ကနေတစ်ဆင့် သင်ယူတာ ဖြစ်ပါတယ်။",$t,N,xt,J,An="အခု၊ RL ဟာ Large Language Models တွေအတွက် ဘာကြောင့် ဒီလောက်အရေးကြီးတာလဲ။",vt,V,zn='ကောင်းမွန်တဲ့ LLMs တွေကို train လုပ်တာက ခက်ခဲပါတယ်။ အင်တာနက်ကနေ ကြီးမားတဲ့ text အမြောက်အမြားနဲ့ train လုပ်နိုင်ပြီး စာကြောင်းတစ်ခုမှာ နောက်စကားလုံးကို ခန့်မှန်းရာမှာ သူတို့ဟာ အလွန်ကောင်းမွန်လာပါတယ်။ <a href="/course/chapter2/1">chapter 2</a> မှာ ကျွန်တော်တို့ သင်ယူခဲ့တဲ့အတိုင်း၊ ဒီလိုနည်းနဲ့ သူတို့က płynne နဲ့ သဒ္ဒါမှန်ကန်တဲ့ text တွေ ထုတ်လုပ်ဖို့ သင်ယူကြတာပါ။',ct,W,Gn="သို့သော်လည်း၊ ရိုးရှင်းစွာ płynne ဖြစ်နေရုံနဲ့ မလုံလောက်ပါဘူး။ ကျွန်တော်တို့ရဲ့ LLMs တွေက စကားလုံးတွေကို စုစည်းရာမှာ ကောင်းမွန်ရုံထက် ပိုဖြစ်စေချင်ပါတယ်။ ကျွန်တော်တို့က သူတို့ကို အောက်ပါအတိုင်း ဖြစ်စေချင်ပါတယ်-",Rt,X,qn="<li><strong>အထောက်အကူဖြစ်စေခြင်း (Helpful)</strong>: အသုံးဝင်ပြီး သက်ဆိုင်တဲ့ အချက်အလက်တွေကို ပံ့ပိုးပေးခြင်း။</li> <li><strong>အန္တရာယ်ကင်းစေခြင်း (Harmless)</strong>: အဆိပ်အတောက်ဖြစ်စေသော၊ ဘက်လိုက်သော ဒါမှမဟုတ် အန္တရာယ်ရှိသော အကြောင်းအရာများ ထုတ်လုပ်ခြင်းကို ရှောင်ရှားခြင်း။</li> <li><strong>လူသားနှစ်သက်မှုများနှင့် ကိုက်ညီခြင်း (Aligned with Human Preferences)</strong>: လူသားတွေက သဘာဝကျတယ်၊ အထောက်အကူဖြစ်တယ်၊ ဆွဲဆောင်မှုရှိတယ်လို့ ယူဆတဲ့ နည်းလမ်းတွေနဲ့ တုံ့ပြန်ခြင်း။</li>",Ct,Y,En="LLM တွေကို pre-training လုပ်တဲ့ နည်းလမ်းတွေက text data ကနေ နောက်စကားလုံးကို ခန့်မှန်းခြင်းအပေါ် အဓိကအားဖြင့် မှီခိုတာကြောင့်၊ ဒီကဏ္ဍတွေမှာ တစ်ခါတစ်ရံ အားနည်းချက်တွေ ရှိနေတတ်ပါတယ်။",Pt,Z,Dn='supervised training ဟာ structured outputs တွေ ထုတ်လုပ်ရာမှာ အလွန်ကောင်းမွန်ပေမယ့်၊ helpful, harmless နဲ့ aligned responses တွေ ထုတ်လုပ်ရာမှာတော့ ထိရောက်မှု နည်းပါးနိုင်ပါတယ်။ <a href="/course/chapter11/1">chapter 11</a> မှာ supervised training အကြောင်းကို ကျွန်တော်တို့ လေ့လာထားပါတယ်။',wt,ee,jn="fine-tuned models တွေက fluent နဲ့ structured text တွေ ထုတ်လုပ်နိုင်ပေမယ့်၊ အချက်အလက်အားဖြင့် မမှန်ကန်တာ၊ ဘက်လိုက်တာ ဒါမှမဟုတ် user ရဲ့ မေးခွန်းကို အထောက်အကူဖြစ်စေတဲ့ နည်းလမ်းနဲ့ တကယ်တမ်း မဖြေဆိုနိုင်တာမျိုး ဖြစ်နိုင်ပါတယ်။",Mt,te,In="<strong>Reinforcement Learning ကို ကြိုဆိုပါတယ်!</strong> RL က pre-trained LLMs တွေကို ဒီလိုလိုချင်တဲ့ အရည်အသွေးတွေကို ပိုမိုကောင်းမွန်အောင် fine-tune လုပ်ဖို့ နည်းလမ်းတစ်ခုကို ပေးပါတယ်။ ဒါဟာ ကျွန်တော်တို့ရဲ့ LLM ခွေးကို စကားလုံးတွေ płynnie ဟောင်တတ်တဲ့ ခွေးတစ်ကောင်ထက်၊ ကောင်းမွန်စွာ ပြုမူပြီး အထောက်အကူဖြစ်စေတဲ့ အဖော်တစ်ယောက် ဖြစ်လာအောင် ထပ်ဆောင်းလေ့ကျင့်ပေးတာနဲ့ တူပါတယ်။",Ht,ne,yt,ie,Sn="language models တွေကို alignment လုပ်ဖို့အတွက် အလွန်ရေပန်းစားတဲ့ နည်းလမ်းတစ်ခုကတော့ <strong>Reinforcement Learning from Human Feedback (RLHF)</strong> ပါ။ RLHF မှာ၊ ကျွန်တော်တို့ဟာ လူသား feedback ကို RL ထဲက “reward” signal အဖြစ် proxy အဖြစ် အသုံးပြုပါတယ်။ ဒါက ဘယ်လိုအလုပ်လုပ်လဲဆိုတာ ကြည့်ရအောင်-",Tt,le,Bn="၁။ <strong>လူသားနှစ်သက်မှုများ ရယူခြင်း (Get Human Preferences)</strong>: LLM က ထုတ်လုပ်ထားတဲ့ မတူညီတဲ့ တုံ့ပြန်မှုတွေကို input prompt တူတူအတွက် လူသားတွေကို နှိုင်းယှဉ်ခိုင်းပြီး သူတို့ ဘယ်တုံ့ပြန်မှုကို ပိုကြိုက်လဲဆိုတာ ပြောခိုင်းနိုင်ပါတယ်။ ဥပမာ၊ “ပြင်သစ်နိုင်ငံရဲ့ မြို့တော်က ဘာလဲ” ဆိုတဲ့ မေးခွန်းရဲ့ မတူညီတဲ့ အဖြေနှစ်ခုကို လူသားတစ်ယောက်ကို ပြသပြီး “ဘယ်အဖြေက ပိုကောင်းလဲ” လို့ မေးနိုင်ပါတယ်။",_t,re,Un="၂။ <strong>Reward Model တစ်ခုကို Train လုပ်ခြင်း (Train a Reward Model)</strong>: ဒီလူသားနှစ်သက်မှု data ကို အသုံးပြုပြီး <strong>reward model</strong> လို့ခေါ်တဲ့ သီးခြား model တစ်ခုကို train လုပ်ပါတယ်။ ဒီ reward model က လူသားတွေ ဘယ်လိုတုံ့ပြန်မှုမျိုးကို နှစ်သက်မလဲဆိုတာ ခန့်မှန်းဖို့ သင်ယူပါတယ်။ ဒါက helpfulness, harmlessness နဲ့ human preferences တွေနဲ့ alignment အပေါ်အခြေခံပြီး တုံ့ပြန်မှုတွေကို score လုပ်ဖို့ သင်ယူပါတယ်။",bt,ae,Qn="၃။ <strong>RL နဲ့ LLM ကို Fine-tune လုပ်ခြင်း (Fine-tune the LLM with RL)</strong>: အခု ကျွန်တော်တို့ reward model ကို ကျွန်တော်တို့ရဲ့ LLM agent အတွက် environment အဖြစ် အသုံးပြုပါတယ်။ LLM က တုံ့ပြန်မှုတွေ ထုတ်လုပ် (actions) ပြီး reward model က ဒီတုံ့ပြန်မှုတွေကို score လုပ် (rewards တွေ ပေး) ပါတယ်။ အနှစ်ချုပ်ပြောရရင်၊ ကျွန်တော်တို့ဟာ LLM ကို ကျွန်တော်တို့ရဲ့ reward model (လူသားနှစ်သက်မှုတွေကနေ သင်ယူထားတာ) က ကောင်းတယ်လို့ ယူဆတဲ့ text တွေကို ထုတ်လုပ်ဖို့ train နေတာပါ။",ht,se,Kn='<img src="https://huggingface.co/reasoning-course/images/resolve/main/grpo/2.jpg" alt="RL Basic Concept"/>',kt,oe,Nn="ယေဘူယျအားဖြင့်၊ LLMs တွေမှာ RL ကို အသုံးပြုခြင်းရဲ့ အကျိုးကျေးဇူးတွေကို ကြည့်ရအောင်။",Ot,me,Jn="<thead><tr><th>အကျိုးကျေးဇူး</th> <th>ဖော်ပြချက်</th></tr></thead> <tbody><tr><td>ထိန်းချုပ်မှု ပိုကောင်းခြင်း</td> <td>RL က LLMs တွေ ထုတ်လုပ်တဲ့ text အမျိုးအစားကို ပိုမိုထိန်းချုပ်နိုင်စေပါတယ်။ helpful ဖြစ်တာ၊ creative ဖြစ်တာ ဒါမှမဟုတ် concise ဖြစ်တာလိုမျိုး သီးခြားပန်းတိုင်တွေနဲ့ ပိုမို aligned ဖြစ်တဲ့ text တွေ ထုတ်လုပ်ဖို့ သူတို့ကို လမ်းညွှန်နိုင်ပါတယ်။</td></tr> <tr><td>လူသားတန်ဖိုးများနှင့် ပိုမိုကိုက်ညီမှု</td> <td>RLHF က အထူးသဖြင့် ရှုပ်ထွေးပြီး တစ်ခါတစ်ရံ subjective ဖြစ်တဲ့ လူသားနှစ်သက်မှုတွေနဲ့ LLMs တွေကို align လုပ်ဖို့ ကူညီပေးပါတယ်။ “ကောင်းမွန်တဲ့ အဖြေတစ်ခုက ဘာကိုဖြစ်စေသလဲ” ဆိုတာအတွက် စည်းမျဉ်းတွေ ရေးဖို့ ခက်ခဲပေမယ့်၊ လူသားတွေက တုံ့ပြန်မှုတွေကို အလွယ်တကူ ဆုံးဖြတ်ပြီး နှိုင်းယှဉ်နိုင်ပါတယ်။ RLHF က model ကို ဒီလူသားဆုံးဖြတ်ချက်တွေကနေ သင်ယူစေပါတယ်။</td></tr> <tr><td>မလိုလားအပ်သော Behavior များကို လျှော့ချခြင်း</td> <td>RL ကို LLMs တွေမှာ negative behaviors တွေ လျှော့ချဖို့ အသုံးပြုနိုင်ပါတယ်၊ ဥပမာ- toxic language ထုတ်လုပ်တာ၊ မှားယွင်းတဲ့ အချက်အလက် ဖြန့်ဝေတာ ဒါမှမဟုတ် biases တွေ ပြသတာမျိုးပါ။ ဒီ behaviors တွေကို penalize လုပ်တဲ့ rewards တွေကို ဒီဇိုင်းဆွဲခြင်းဖြင့်၊ model ကို ဒါတွေ ရှောင်ရှားဖို့ လှုံ့ဆော်နိုင်ပါတယ်။</td></tr></tbody>",Ft,pe,Vn="Reinforcement Learning from Human Feedback ကို ဒီနေ့ခေတ် လူကြိုက်အများဆုံး LLMs များစွာကို လေ့ကျင့်ရာမှာ အသုံးပြုခဲ့ပါတယ်။ ဥပမာ- OpenAI ရဲ့ GPT-4၊ Google ရဲ့ Gemini နဲ့ DeepSeek ရဲ့ R1 တို့ပါပဲ။ RLHF အတွက် ရှုပ်ထွေးမှုနဲ့ အဆင့်အတန်းအမျိုးမျိုးရှိတဲ့ နည်းလမ်းများစွာ ရှိပါတယ်။ ဒီအခန်းမှာ၊ ကျွန်တော်တို့ဟာ Group Relative Policy Optimization (GRPO) ကို အဓိကထား လေ့လာသွားမှာဖြစ်ပါတယ်။ ဒါဟာ helpful, harmless နဲ့ human preferences တွေနဲ့ aligned ဖြစ်တဲ့ LLMs တွေကို လေ့ကျင့်ရာမှာ ထိရောက်မှုရှိကြောင်း ပြသထားတဲ့ RLHF နည်းလမ်းတစ်ခုပါ။",At,ge,zt,fe,Wn="RLHF အတွက် နည်းလမ်းများစွာရှိပေမယ့် ဒီသင်တန်းက GRPO ကို အဓိကထားပါတယ်။ ဘာလို့လဲဆိုတော့ ဒါက language models တွေအတွက် reinforcement learning မှာ အရေးပါတဲ့ တိုးတက်မှုကို ကိုယ်စားပြုလို့ပါပဲ။",Gt,ue,Xn="RLHF အတွက် အခြားရေပန်းစားတဲ့ နည်းလမ်းနှစ်ခုကို အတိုချုံးကြည့်ရအောင်။",qt,Le,Yn="<li>Proximal Policy Optimization (PPO)</li> <li>Direct Preference Optimization (DPO)</li>",Et,de,Zn="Proximal Policy Optimization (PPO) ဟာ RLHF အတွက် ပထမဆုံး အလွန်ထိရောက်တဲ့ နည်းလမ်းတွေထဲက တစ်ခုပါ။ ဒါက policy gradient method ကို အသုံးပြုပြီး သီးခြား reward model တစ်ခုကနေ ရရှိတဲ့ reward ကို အခြေခံပြီး policy ကို update လုပ်ပါတယ်။",Dt,$e,ei="Direct Preference Optimization (DPO) ကို နောက်ပိုင်းမှာ ပိုမိုရိုးရှင်းတဲ့ နည်းလမ်းအဖြစ် ဖော်ထုတ်ခဲ့ပါတယ်။ ဒါက သီးခြား reward model တစ်ခု မလိုအပ်ဘဲ preference data ကို တိုက်ရိုက်အသုံးပြုပါတယ်။ အနှစ်ချုပ်ပြောရရင်၊ ပြဿနာကို ရွေးချယ်ထားတဲ့ တုံ့ပြန်မှုနဲ့ ပယ်ချခံရတဲ့ တုံ့ပြန်မှုတွေကြားက classification task အဖြစ် ပုံစံချတာပါ။",jt,v,ti='<p>DPO နဲ့ PPO ဟာ ၎င်းတို့ကိုယ်တိုင် ရှုပ်ထွေးတဲ့ reinforcement learning algorithms တွေဖြစ်ပြီး ဒီသင်တန်းမှာ ကျွန်တော်တို့ ဖော်ပြမှာ မဟုတ်ပါဘူး။ သင် ဒါတွေအကြောင်း ပိုမိုလေ့လာချင်တယ်ဆိုရင် အောက်ပါအရင်းအမြစ်တွေကို ကြည့်ရှုနိုင်ပါတယ်။</p> <ul><li><a href="https://huggingface.co/docs/trl/main/en/ppo_trainer" rel="nofollow">Proximal Policy Optimization</a></li> <li><a href="https://huggingface.co/docs/trl/main/en/dpo_trainer" rel="nofollow">Direct Preference Optimization</a></li></ul>',It,xe,ni="DPO နဲ့ PPO တွေနဲ့ မတူတာက GRPO က ဆင်တူတဲ့ samples တွေကို အုပ်စုဖွဲ့ပြီး အုပ်စုတစ်စုအဖြစ် နှိုင်းယှဉ်ပါတယ်။ group-based ချဉ်းကပ်မှုက အခြားနည်းလမ်းတွေနဲ့ နှိုင်းယှဉ်ရင် ပိုမိုတည်ငြိမ်တဲ့ gradients တွေနဲ့ ပိုကောင်းတဲ့ convergence properties တွေကို ပေးပါတယ်။",St,ve,ii="GRPO က DPO လို preference data ကို အသုံးပြုတာ မဟုတ်ပါဘူး၊ ဒါပေမယ့် model ဒါမှမဟုတ် function တစ်ခုကနေ reward signal ကို အသုံးပြုပြီး ဆင်တူတဲ့ samples အုပ်စုတွေကို နှိုင်းယှဉ်ပါတယ်။",Bt,ce,li="GRPO က reward signals တွေ ရယူရာမှာ ပြောင်းလွယ်ပြင်လွယ်ရှိပါတယ် – ဒါက reward model (PPO လိုပဲ) နဲ့ အလုပ်လုပ်နိုင်ပေမယ့်၊ သီးခြားတစ်ခုကို တင်းတင်းကျပ်ကျပ် မလိုအပ်ပါဘူး။ ဒါက ဘာလို့လဲဆိုတော့ GRPO က တုံ့ပြန်မှုတွေရဲ့ အရည်အသွေးကို အကဲဖြတ်နိုင်တဲ့ မည်သည့် function ဒါမှမဟုတ် model ကနေမဆို reward signals တွေကို ပေါင်းစပ်နိုင်လို့ပါပဲ။",Ut,Re,ri="ဥပမာ၊ ကျွန်တော်တို့ဟာ ပိုတိုတဲ့ တုံ့ပြန်မှုတွေအတွက် reward ပေးဖို့ length function တစ်ခုကို အသုံးပြုနိုင်ပါတယ်၊ ဖြေရှင်းချက် မှန်ကန်မှုကို စစ်ဆေးဖို့ mathematical solver ကို အသုံးပြုနိုင်ပါတယ်၊ ဒါမှမဟုတ် အချက်အလက်မှန်ကန်မှု ပိုမိုမြင့်မားတဲ့ တုံ့ပြန်မှုတွေအတွက် reward ပေးဖို့ factual correctness function ကို အသုံးပြုနိုင်ပါတယ်။ ဒီပြောင်းလွယ်ပြင်လွယ်ရှိမှုက GRPO ကို မတူညီတဲ့ alignment tasks တွေအတွက် အထူးသဖြင့် အသုံးဝင်စေပါတယ်။",Qt,Kt,Nt,Ce,ai="Module 1 ပြီးဆုံးသွားတဲ့အတွက် ဂုဏ်ယူပါတယ်။ Reinforcement Learning နဲ့ Large Language Models တွေရဲ့ အနာဂတ်ကို ပုံဖော်ရာမှာ ၎င်းရဲ့ အရေးပါတဲ့ အခန်းကဏ္ဍအကြောင်း ခိုင်မာတဲ့ နိဒါန်းတစ်ခုကို အခု သင်ရရှိခဲ့ပါပြီ။ RL ရဲ့ အခြေခံအယူအဆတွေကို သင်နားလည်ပါပြီ၊ LLMs တွေအတွက် ဘာကြောင့် အသုံးပြုရလဲဆိုတာကို သိပြီး၊ ဒီနယ်ပယ်ရဲ့ အဓိက algorithm တစ်ခုဖြစ်တဲ့ GRPO ကို သင်မိတ်ဆက်ခံခဲ့ရပါပြီ။",Jt,Pe,si="နောက် module မှာတော့ ကျွန်တော်တို့ လက်တွေ့ကျကျ လုပ်ဆောင်ပြီး ဒီအယူအဆတွေကို လက်တွေ့မှာ ဘယ်လိုအလုပ်လုပ်လဲဆိုတာ ကြည့်ဖို့ DeepSeek R1 paper ထဲကို နက်နက်နဲနဲ လေ့လာသွားမှာပါ။",Vt,we,Wt,Me,Xt,He,Yt,ye,Zt,Te,en,_e,tn,be,nn,he,ln,ke,rn,Oe,an,Fe,sn,Ae,on,ze,oi="<li><strong>Reinforcement Learning (RL)</strong>: Agent တစ်ခုက environment တစ်ခုနဲ့ အပြန်အလှန်ဆက်ဆံပြီး trial-and-error ကနေတစ်ဆင့် သင်ယူကာ rewards များကို အမြင့်ဆုံးရရှိစေမယ့် actions တွေကို ရွေးချယ်ဖို့ သင်ယူတဲ့ Machine Learning နယ်ပယ်တစ်ခု။</li> <li><strong>Language Models (LLMs)</strong>: လူသားဘာသာစကားကို နားလည်ပြီး ထုတ်လုပ်ပေးနိုင်တဲ့ အလွန်ကြီးမားတဲ့ Artificial Intelligence (AI) မော်ဒယ်တွေ ဖြစ်ပါတယ်။</li> <li><strong>Agent</strong>: Reinforcement Learning (RL) စနစ်တစ်ခုတွင် environment နှင့် အပြန်အလှန်ဆက်ဆံပြီး ဆုံးဖြတ်ချက်များချကာ သင်ယူသော အစိတ်အပိုင်း။</li> <li><strong>Environment</strong>: Reinforcement Learning (RL) စနစ်တစ်ခုတွင် agent နေထိုင်ပြီး အပြန်အလှန်ဆက်ဆံသည့် ကမ္ဘာ သို့မဟုတ် အခြေအနေ။ ၎င်းသည် agent ၏ actions များကို တုံ့ပြန်ပြီး rewards များကို ပေးသည်။</li> <li><strong>Reward</strong>: Reinforcement Learning (RL) တွင် agent ၏ action တစ်ခုပြီးနောက် environment က agent ကို ပေးသော feedback (များသောအားဖြင့် ကိန်းဂဏန်းတန်ဖိုး)။ Positive reward သည် ကောင်းမွန်သော action ကိုညွှန်ပြပြီး negative reward (penalty) သည် မကောင်းသော action ကိုညွှန်ပြသည်။</li> <li><strong>Action</strong>: Reinforcement Learning (RL) တွင် agent က environment ထဲ၌ လုပ်ဆောင်နိုင်သော ရွေးချယ်မှု သို့မဟုတ် လုပ်ဆောင်ချက်။</li> <li><strong>Policy</strong>: Reinforcement Learning (RL) တွင် agent ၏ strategy (ဗျူဟာ) ဖြစ်ပြီး သတ်မှတ်ထားသော အခြေအနေတစ်ခုတွင် မည်သည့် action ကို ရွေးချယ်ရမည်ကို ဆုံးဖြတ်ပေးသော စည်းမျဉ်းများ သို့မဟုတ် function တစ်ခု။</li> <li><strong>Trial and Error</strong>: စမ်းသပ်ခြင်းနှင့် မှားယွင်းခြင်း လုပ်ငန်းစဉ်မှတစ်ဆင့် သင်ယူခြင်းနည်းလမ်း။</li> <li><strong>Observation</strong>: Agent က environment ၏ လက်ရှိအခြေအနေနှင့် ပတ်ဝန်းကျင်အကြောင်း အချက်အလက်များကို ရယူခြင်း။</li> <li><strong>Feedback</strong>: လုပ်ဆောင်ချက်တစ်ခု၏ ရလဒ်နှင့်ပတ်သက်သော အချက်အလက်။</li> <li><strong>Learning</strong>: Agent က reward ကို အခြေခံပြီး သူ့ရဲ့ policy ကို ပြင်ဆင်ခြင်း။</li> <li><strong>Iteration</strong>: လုပ်ငန်းစဉ်တစ်ခုကို ထပ်ခါတလဲလဲ လုပ်ဆောင်ခြင်း။</li> <li><strong>Fluent Text</strong>: သဘာဝကျပြီး သဒ္ဒါမှန်ကန်သော စာသား။</li> <li><strong>Grammatically Correct Text</strong>: သဒ္ဒါစည်းမျဉ်းများနှင့် ကိုက်ညီသော စာသား။</li> <li><strong>Helpful</strong>: အသုံးဝင်ပြီး သက်ဆိုင်သော အချက်အလက်များကို ပံ့ပိုးပေးခြင်း။</li> <li><strong>Harmless</strong>: အဆိပ်အတောက်ဖြစ်စေသော၊ ဘက်လိုက်သော ဒါမှမဟုတ် အန္တရာယ်ရှိသော အကြောင်းအရာများ ထုတ်လုပ်ခြင်းကို ရှောင်ရှားခြင်း။</li> <li><strong>Aligned with Human Preferences</strong>: လူသားနှစ်သက်မှုများနှင့် ကိုက်ညီသော တုံ့ပြန်မှုများ။</li> <li><strong>Pre-training LLM Methods</strong>: LLM များကို ကနဦး လေ့ကျင့်သော နည်းလမ်းများ (များသောအားဖြင့် text data မှ နောက်စကားလုံးကို ခန့်မှန်းခြင်း)။</li> <li><strong>Supervised Training</strong>: Input data နှင့် ၎င်း၏ သက်ဆိုင်ရာ labels များပါဝင်သော dataset ကို အသုံးပြု၍ model ကို လေ့ကျင့်သော Machine Learning ပုံစံ။</li> <li><strong>Structured Outputs</strong>: သတ်မှတ်ထားသော ပုံစံ သို့မဟုတ် format ရှိသော output များ။</li> <li><strong>Fine-tuned Models</strong>: ကြိုတင်လေ့ကျင့်ထားပြီးသား model တစ်ခုကို သီးခြား task တစ်ခုအတွက် ထပ်မံလေ့ကျင့်ထားသော model များ။</li> <li><strong>Factually Incorrect</strong>: အချက်အလက်အားဖြင့် မမှန်ကန်သော။</li> <li><strong>Biased</strong>: ဘက်လိုက်မှုရှိသော။</li> <li><strong>Reinforcement Learning from Human Feedback (RLHF)</strong>: လူသား feedback ကို reward signal အဖြစ် အသုံးပြုပြီး language models များကို fine-tune လုပ်သော RL နည်းလမ်း။</li> <li><strong>Human Preferences</strong>: လူသားများ၏ နှစ်သက်မှု သို့မဟုတ် ရွေးချယ်မှုများ။</li> <li><strong>Proxy</strong>: မူရင်းအရာကို ကိုယ်စားပြုသော အရာ။</li> <li><strong>Reward Model</strong>: လူသားနှစ်သက်မှု data ဖြင့် လေ့ကျင့်ထားသော သီးခြား model တစ်ခုဖြစ်ပြီး LLM မှ ထုတ်လုပ်သော တုံ့ပြန်မှုများ၏ အရည်အသွေးကို ခန့်မှန်းပြီး score ပေးသည်။</li> <li><strong>Algorithmic Biases</strong>: AI algorithms များ၏ ဆုံးဖြတ်ချက်များတွင် ဒေတာ သို့မဟုတ် ဒီဇိုင်းကြောင့် ဖြစ်ပေါ်လာသော ဘက်လိုက်မှုများ။</li> <li><strong>Group Relative Policy Optimization (GRPO)</strong>: RLHF နည်းလမ်းတစ်ခုဖြစ်ပြီး ဆင်တူသော samples များကို အုပ်စုဖွဲ့ကာ ၎င်းတို့ကို အုပ်စုလိုက် နှိုင်းယှဉ်၍ policy ကို update လုပ်သည်။</li> <li><strong>Proximal Policy Optimization (PPO)</strong>: Policy gradient method ကို အသုံးပြုပြီး reward model မှ reward ကို အခြေခံ၍ policy ကို update လုပ်သော RLHF နည်းလမ်း။</li> <li><strong>Direct Preference Optimization (DPO)</strong>: သီးခြား reward model မလိုအပ်ဘဲ preference data ကို တိုက်ရိုက်အသုံးပြုပြီး classification task အဖြစ် framing လုပ်၍ policy ကို update လုပ်သော RLHF နည်းလမ်း။</li> <li><strong>Policy Gradient Method</strong>: Reinforcement Learning တွင် agent ၏ policy ကို တိုက်ရိုက် optimize လုပ်သော algorithm အမျိုးအစား။</li> <li><strong>Preference Data</strong>: လူသားများက မတူညီသော output များကို နှိုင်းယှဉ်ပြီး ပိုနှစ်သက်သော output ကို ရွေးချယ်ထားသော data။</li> <li><strong>Classification Task</strong>: ဒေတာအချက်အလက်များကို သတ်မှတ်ထားသော အမျိုးအစားများ သို့မဟုတ် အတန်းများထဲသို့ ခွဲခြားသတ်မှတ်ခြင်း လုပ်ငန်း။</li> <li><strong>Gradients</strong>: Model parameters များ ပြောင်းလဲသွားသောအခါ loss function ၏ တန်ဖိုး မည်သို့ပြောင်းလဲသည်ကို ပြသသော တန်ဖိုးများ။ Training လုပ်ငန်းစဉ်တွင် parameters များကို ချိန်ညှိရန် အသုံးပြုသည်။</li> <li><strong>Convergence Properties</strong>: Training လုပ်ငန်းစဉ်တစ်ခုက အမှန်တကယ် optimum သို့မဟုတ် ကောင်းမွန်သော solution သို့ ရောက်ရှိနိုင်သည့် အလားအလာနှင့် မြန်နှုန်း။</li> <li><strong>Length Function</strong>: စာသား၏ အရှည်ကို တိုင်းတာသော function။</li> <li><strong>Mathematical Solver</strong>: သင်္ချာဆိုင်ရာ ပြဿနာများကို ဖြေရှင်းပေးသော algorithm သို့မဟုတ် program။</li> <li><strong>Factual Correctness Function</strong>: စာသား၏ အချက်အလက်မှန်ကန်မှုကို အကဲဖြတ်သော function။</li>",mn,Ge,pn,Ee,gn;return c=new xi({props:{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"}}),R=new d({props:{title:"Reinforcement Learning နှင့် LLMs တွင် ၎င်း၏အခန်းကဏ္ဍ မိတ်ဆက်",local:"introduction-to-reinforcement-learning-and-its-role-in-llms",headingTag:"h1"}}),M=new d({props:{title:"Reinforcement Learning (RL) ဆိုတာ ဘာလဲ။",local:"reinforcement-learning-rl-ဆတ-ဘလ",headingTag:"h2"}}),b=new d({props:{title:"Agent",local:"agent",headingTag:"h3"}}),k=new d({props:{title:"Environment",local:"environment",headingTag:"h3"}}),F=new d({props:{title:"Action",local:"action",headingTag:"h3"}}),z=new d({props:{title:"Reward",local:"reward",headingTag:"h3"}}),j=new d({props:{title:"Policy",local:"policy",headingTag:"h3"}}),S=new d({props:{title:"RL လုပ်ငန်းစဉ် - စမ်းသပ်မှုနှင့် အမှား (Trial and Error)",local:"rl-လပငနစဉ---စမသပမနင-အမ-trial-and-error",headingTag:"h2"}}),N=new d({props:{title:"Large Language Models (LLMs) တွင် RL ၏ အခန်းကဏ္ဍ",local:"large-language-models-llms-တင-rl--အခနကဏဍ",headingTag:"h2"}}),ne=new d({props:{title:"Reinforcement Learning from Human Feedback (RLHF)",local:"reinforcement-learning-from-human-feedback-rlhf",headingTag:"h2"}}),ge=new d({props:{title:"GRPO (Group Relative Policy Optimization) ကို ဘာကြောင့် ဂရုစိုက်သင့်သလဲ။",local:"grpo-group-relative-policy-optimization-က-ဘကင-ဂရစကသငသလ",headingTag:"h2"}}),we=new d({props:{title:"မေးခွန်းများ",local:"မခနမ",headingTag:"h2"}}),Me=new d({props:{title:"၁။ Reinforcement Learning ၏ အဓိက အစိတ်အပိုင်းများက ဘာတွေလဲ။",local:"၁-reinforcement-learning--အဓက-အစတအပငမက-ဘတလ",headingTag:"h3"}}),He=new De({props:{choices:[{text:"Agent, Environment, Action, Reward, နှင့် Policy",explain:"မှန်ပါတယ်။ ဒါတွေက reinforcement learning system တစ်ခုကို ဖွဲ့စည်းထားတဲ့ အခြေခံအစိတ်အပိုင်းတွေပါ။",correct:!0},{text:"Model, Data, Loss Function, နှင့် Optimizer",explain:"ဒါတွေက supervised learning နဲ့ ပိုပြီး သက်ဆိုင်တဲ့ အစိတ်အပိုင်းတွေပါ။"},{text:"Input, Output, နှင့် Hidden Layers",explain:"ဒါတွေက neural network architecture ရဲ့ အစိတ်အပိုင်းတွေဖြစ်ပြီး RL အစိတ်အပိုင်းတွေ မဟုတ်ပါဘူး။"}]}}),ye=new d({props:{title:"၂။ Language Models တွေ train ဖို့ RLHF ရဲ့ အဓိက အကျိုးကျေးဇူးက ဘာလဲ။",local:"၂-language-models-တ-train-ဖ-rlhf-ရ-အဓက-အကကဇက-ဘလ",headingTag:"h3"}}),Te=new De({props:{choices:[{text:"ဒါက models တွေကို လူသားနှစ်သက်မှုတွေနဲ့ တန်ဖိုးတွေနဲ့ align လုပ်ဖို့ ကူညီပေးတယ်",explain:"မှန်ပါတယ်။ RLHF က လူသား feedback ကို အသုံးပြုပြီး models တွေကို ပိုမို helpful, harmless နဲ့ aligned behavior တွေဆီ ဦးတည်စေပါတယ်။",correct:!0},{text:"ဒါက models တွေကို text တွေ ပိုမြန်မြန် ထုတ်လုပ်စေတယ်",explain:"RLHF က အဓိကအားဖြင့် generation speed ကို တိုးတက်အောင် လုပ်တာ မဟုတ်ပါဘူး။"},{text:"ဒါက model ရဲ့ memory အသုံးပြုမှုကို လျှော့ချတယ်",explain:"RLHF က model efficiency ဒါမှမဟုတ် memory optimization ကို အာရုံစိုက်တာ မဟုတ်ပါဘူး။"}]}}),_e=new d({props:{title:"၃။ LLMs တွေအတွက် RL အခြေအနေမှာ၊ “action” ဆိုတာ ဘာကို ကိုယ်စားပြုလဲ။",local:"၃-llms-တအတက-rl-အခအနမ-action-ဆတ-ဘက-ကယစပလ",headingTag:"h3"}}),be=new De({props:{choices:[{text:"စကားပြောဆိုမှုတစ်ခုမှာ စကားလုံးတွေ ထုတ်လုပ်တာ ဒါမှမဟုတ် တုံ့ပြန်မှုတွေ ရွေးချယ်တာ",explain:"မှန်ပါတယ်။ LLMs တွေအတွက် actions တွေက များသောအားဖြင့် text generation ဆုံးဖြတ်ချက်တွေ ပါဝင်ပါတယ်။",correct:!0},{text:"model weights တွေ update လုပ်တာ",explain:"ဒါက training လုပ်ငန်းစဉ်ရဲ့ အစိတ်အပိုင်းတစ်ခုဖြစ်ပြီး RL အခြေအနေမှာ action မဟုတ်ပါဘူး။"},{text:"input tokens တွေ process လုပ်တာ",explain:"ဒါက model ရဲ့ လုပ်ဆောင်ချက်ရဲ့ အစိတ်အပိုင်းတစ်ခုဖြစ်ပြီး RL အခြေအနေမှာ action မဟုတ်ပါဘူး။"}]}}),he=new d({props:{title:"၄။ Language models တွေရဲ့ RL training မှာ reward ရဲ့ အခန်းကဏ္ဍက ဘာလဲ။",local:"၄-language-models-တရ-rl-training-မ-reward-ရ-အခနကဏဍက-ဘလ",headingTag:"h3"}}),ke=new De({props:{choices:[{text:"model ရဲ့ တုံ့ပြန်မှုတွေက လိုချင်တဲ့ behavior တွေနဲ့ ဘယ်လောက်ကိုက်ညီလဲဆိုတဲ့ feedback ကို ပေးဖို့",explain:"မှန်ပါတယ်။ Rewards တွေက model ကို ပိုမို helpful, truthful နဲ့ သင့်လျော်တဲ့ တုံ့ပြန်မှုတွေ ထုတ်လုပ်ဖို့ လမ်းညွှန်ပါတယ်။",correct:!0},{text:"model ရဲ့ vocabulary size ကို တိုင်းတာဖို့",explain:"Rewards တွေကို vocabulary knowledge ကို အကဲဖြတ်ဖို့ အသုံးပြုတာ မဟုတ်ပါဘူး။"},{text:"model ရဲ့ training speed ကို ဆုံးဖြတ်ဖို့",explain:"Rewards တွေက တုံ့ပြန်မှု အရည်အသွေးနဲ့ ပတ်သက်တဲ့ feedback ကို ပေးတာဖြစ်ပြီး training efficiency နဲ့ ပတ်သက်တာ မဟုတ်ပါဘူး။"}]}}),Oe=new d({props:{title:"၅။ LLMs တွေအတွက် RL အခြေအနေမှာ reward ဆိုတာ ဘာလဲ။",local:"၅-llms-တအတက-rl-အခအနမ-reward-ဆတ-ဘလ",headingTag:"h3"}}),Fe=new De({props:{choices:[{text:"တုံ့ပြန်မှုတစ်ခုရဲ့ အရည်အသွေးကို တိုင်းတာတဲ့ ကိန်းဂဏန်း score တစ်ခု",explain:"မှန်ပါတယ်။ Rewards တွေက တုံ့ပြန်မှု အရည်အသွေးနဲ့ ပတ်သက်တဲ့ feedback ကို ပေးပြီး model ကို လိုချင်တဲ့ behavior ဆီ ဦးတည်စေပါတယ်။",correct:!0},{text:"တုံ့ပြန်မှုတွေ ထုတ်လုပ်တဲ့ function တစ်ခု",explain:"Rewards တွေက တုံ့ပြန်မှု အရည်အသွေးနဲ့ ပတ်သက်တဲ့ feedback ကို ပေးတာဖြစ်ပြီး generation လုပ်ငန်းစဉ် ကိုယ်တိုင် မဟုတ်ပါဘူး။"},{text:"တုံ့ပြန်မှုတွေရဲ့ အရည်အသွေးကို အကဲဖြတ်တဲ့ model တစ်ခု",explain:"Rewards တွေက တုံ့ပြန်မှု အရည်အသွေးနဲ့ ပတ်သက်တဲ့ feedback ကို ပေးတာဖြစ်ပြီး evaluation model မဟုတ်ပါဘူး။"}]}}),Ae=new d({props:{title:"ဝေါဟာရ ရှင်းလင်းချက် (Glossary)",local:"ဝဟရ-ရငလငခက-glossary",headingTag:"h2"}}),Ge=new vi({props:{source:"https://github.com/huggingface/course/blob/main/chapters/my/chapter12/2.mdx"}}),{c(){$=a("meta"),je=l(),qe=a("p"),Ie=l(),m(c.$$.fragment),Se=l(),m(R.$$.fragment),Be=l(),C=a("p"),C.textContent=Ln,Ue=l(),P=a("p"),P.textContent=dn,Qe=l(),x=a("blockquote"),x.innerHTML=$n,Ke=l(),w=a("p"),w.textContent=xn,Ne=l(),m(M.$$.fragment),Je=l(),H=a("p"),H.innerHTML=vn,Ve=l(),y=a("p"),y.innerHTML=cn,We=l(),T=a("p"),T.innerHTML=Rn,Xe=l(),_=a("p"),_.textContent=Cn,Ye=l(),m(b.$$.fragment),Ze=l(),h=a("p"),h.textContent=Pn,et=l(),m(k.$$.fragment),tt=l(),O=a("p"),O.textContent=wn,nt=l(),m(F.$$.fragment),it=l(),A=a("p"),A.textContent=Mn,lt=l(),m(z.$$.fragment),rt=l(),G=a("p"),G.textContent=Hn,at=l(),q=a("p"),q.innerHTML=yn,st=l(),E=a("p"),E.innerHTML=Tn,ot=l(),D=a("p"),D.textContent=_n,mt=l(),m(j.$$.fragment),pt=l(),I=a("p"),I.textContent=bn,gt=l(),m(S.$$.fragment),ft=l(),B=a("p"),B.innerHTML=hn,ut=l(),U=a("p"),U.textContent=kn,Lt=l(),Q=a("table"),Q.innerHTML=On,dt=l(),K=a("p"),K.textContent=Fn,$t=l(),m(N.$$.fragment),xt=l(),J=a("p"),J.textContent=An,vt=l(),V=a("p"),V.innerHTML=zn,ct=l(),W=a("p"),W.textContent=Gn,Rt=l(),X=a("ul"),X.innerHTML=qn,Ct=l(),Y=a("p"),Y.textContent=En,Pt=l(),Z=a("p"),Z.innerHTML=Dn,wt=l(),ee=a("p"),ee.textContent=jn,Mt=l(),te=a("p"),te.innerHTML=In,Ht=l(),m(ne.$$.fragment),yt=l(),ie=a("p"),ie.innerHTML=Sn,Tt=l(),le=a("p"),le.innerHTML=Bn,_t=l(),re=a("p"),re.innerHTML=Un,bt=l(),ae=a("p"),ae.innerHTML=Qn,ht=l(),se=a("p"),se.innerHTML=Kn,kt=l(),oe=a("p"),oe.textContent=Nn,Ot=l(),me=a("table"),me.innerHTML=Jn,Ft=l(),pe=a("p"),pe.textContent=Vn,At=l(),m(ge.$$.fragment),zt=l(),fe=a("p"),fe.textContent=Wn,Gt=l(),ue=a("p"),ue.textContent=Xn,qt=l(),Le=a("ul"),Le.innerHTML=Yn,Et=l(),de=a("p"),de.textContent=Zn,Dt=l(),$e=a("p"),$e.textContent=ei,jt=l(),v=a("blockquote"),v.innerHTML=ti,It=l(),xe=a("p"),xe.textContent=ni,St=l(),ve=a("p"),ve.textContent=ii,Bt=l(),ce=a("p"),ce.textContent=li,Ut=l(),Re=a("p"),Re.textContent=ri,Qt=l(),Kt=a("hr"),Nt=l(),Ce=a("p"),Ce.textContent=ai,Jt=l(),Pe=a("p"),Pe.textContent=si,Vt=l(),m(we.$$.fragment),Wt=l(),m(Me.$$.fragment),Xt=l(),m(He.$$.fragment),Yt=l(),m(ye.$$.fragment),Zt=l(),m(Te.$$.fragment),en=l(),m(_e.$$.fragment),tn=l(),m(be.$$.fragment),nn=l(),m(he.$$.fragment),ln=l(),m(ke.$$.fragment),rn=l(),m(Oe.$$.fragment),an=l(),m(Fe.$$.fragment),sn=l(),m(Ae.$$.fragment),on=l(),ze=a("ul"),ze.innerHTML=oi,mn=l(),m(Ge.$$.fragment),pn=l(),Ee=a("p"),this.h()},l(e){const t=di("svelte-u9bgzb",document.head);$=s(t,"META",{name:!0,content:!0}),t.forEach(n),je=r(e),qe=s(e,"P",{}),mi(qe).forEach(n),Ie=r(e),p(c.$$.fragment,e),Se=r(e),p(R.$$.fragment,e),Be=r(e),C=s(e,"P",{"data-svelte-h":!0}),o(C)!=="svelte-18dfjvv"&&(C.textContent=Ln),Ue=r(e),P=s(e,"P",{"data-svelte-h":!0}),o(P)!=="svelte-10ecgip"&&(P.textContent=dn),Qe=r(e),x=s(e,"BLOCKQUOTE",{class:!0,"data-svelte-h":!0}),o(x)!=="svelte-5mivjg"&&(x.innerHTML=$n),Ke=r(e),w=s(e,"P",{"data-svelte-h":!0}),o(w)!=="svelte-1nfuq6g"&&(w.textContent=xn),Ne=r(e),p(M.$$.fragment,e),Je=r(e),H=s(e,"P",{"data-svelte-h":!0}),o(H)!=="svelte-pse1eq"&&(H.innerHTML=vn),Ve=r(e),y=s(e,"P",{"data-svelte-h":!0}),o(y)!=="svelte-sb86qk"&&(y.innerHTML=cn),We=r(e),T=s(e,"P",{"data-svelte-h":!0}),o(T)!=="svelte-sy5vgw"&&(T.innerHTML=Rn),Xe=r(e),_=s(e,"P",{"data-svelte-h":!0}),o(_)!=="svelte-d4w68j"&&(_.textContent=Cn),Ye=r(e),p(b.$$.fragment,e),Ze=r(e),h=s(e,"P",{"data-svelte-h":!0}),o(h)!=="svelte-7lbjk5"&&(h.textContent=Pn),et=r(e),p(k.$$.fragment,e),tt=r(e),O=s(e,"P",{"data-svelte-h":!0}),o(O)!=="svelte-1xqpify"&&(O.textContent=wn),nt=r(e),p(F.$$.fragment,e),it=r(e),A=s(e,"P",{"data-svelte-h":!0}),o(A)!=="svelte-ad92ii"&&(A.textContent=Mn),lt=r(e),p(z.$$.fragment,e),rt=r(e),G=s(e,"P",{"data-svelte-h":!0}),o(G)!=="svelte-1fz5ovd"&&(G.textContent=Hn),at=r(e),q=s(e,"P",{"data-svelte-h":!0}),o(q)!=="svelte-1uwjnzl"&&(q.innerHTML=yn),st=r(e),E=s(e,"P",{"data-svelte-h":!0}),o(E)!=="svelte-1o5tnbc"&&(E.innerHTML=Tn),ot=r(e),D=s(e,"P",{"data-svelte-h":!0}),o(D)!=="svelte-siwc8i"&&(D.textContent=_n),mt=r(e),p(j.$$.fragment,e),pt=r(e),I=s(e,"P",{"data-svelte-h":!0}),o(I)!=="svelte-xv7a3m"&&(I.textContent=bn),gt=r(e),p(S.$$.fragment,e),ft=r(e),B=s(e,"P",{"data-svelte-h":!0}),o(B)!=="svelte-t8x49h"&&(B.innerHTML=hn),ut=r(e),U=s(e,"P",{"data-svelte-h":!0}),o(U)!=="svelte-1ja5ucu"&&(U.textContent=kn),Lt=r(e),Q=s(e,"TABLE",{"data-svelte-h":!0}),o(Q)!=="svelte-1rkt3b2"&&(Q.innerHTML=On),dt=r(e),K=s(e,"P",{"data-svelte-h":!0}),o(K)!=="svelte-11qqu1n"&&(K.textContent=Fn),$t=r(e),p(N.$$.fragment,e),xt=r(e),J=s(e,"P",{"data-svelte-h":!0}),o(J)!=="svelte-154frws"&&(J.textContent=An),vt=r(e),V=s(e,"P",{"data-svelte-h":!0}),o(V)!=="svelte-1on34kw"&&(V.innerHTML=zn),ct=r(e),W=s(e,"P",{"data-svelte-h":!0}),o(W)!=="svelte-1njpahr"&&(W.textContent=Gn),Rt=r(e),X=s(e,"UL",{"data-svelte-h":!0}),o(X)!=="svelte-ndlsmn"&&(X.innerHTML=qn),Ct=r(e),Y=s(e,"P",{"data-svelte-h":!0}),o(Y)!=="svelte-1u06fsr"&&(Y.textContent=En),Pt=r(e),Z=s(e,"P",{"data-svelte-h":!0}),o(Z)!=="svelte-1iskgf7"&&(Z.innerHTML=Dn),wt=r(e),ee=s(e,"P",{"data-svelte-h":!0}),o(ee)!=="svelte-1ysfa3d"&&(ee.textContent=jn),Mt=r(e),te=s(e,"P",{"data-svelte-h":!0}),o(te)!=="svelte-921e2p"&&(te.innerHTML=In),Ht=r(e),p(ne.$$.fragment,e),yt=r(e),ie=s(e,"P",{"data-svelte-h":!0}),o(ie)!=="svelte-1l6ldvt"&&(ie.innerHTML=Sn),Tt=r(e),le=s(e,"P",{"data-svelte-h":!0}),o(le)!=="svelte-12r2h96"&&(le.innerHTML=Bn),_t=r(e),re=s(e,"P",{"data-svelte-h":!0}),o(re)!=="svelte-1u520yq"&&(re.innerHTML=Un),bt=r(e),ae=s(e,"P",{"data-svelte-h":!0}),o(ae)!=="svelte-1qdb3vf"&&(ae.innerHTML=Qn),ht=r(e),se=s(e,"P",{"data-svelte-h":!0}),o(se)!=="svelte-muml2l"&&(se.innerHTML=Kn),kt=r(e),oe=s(e,"P",{"data-svelte-h":!0}),o(oe)!=="svelte-1bpob8"&&(oe.textContent=Nn),Ot=r(e),me=s(e,"TABLE",{"data-svelte-h":!0}),o(me)!=="svelte-cwgf5q"&&(me.innerHTML=Jn),Ft=r(e),pe=s(e,"P",{"data-svelte-h":!0}),o(pe)!=="svelte-ywyd69"&&(pe.textContent=Vn),At=r(e),p(ge.$$.fragment,e),zt=r(e),fe=s(e,"P",{"data-svelte-h":!0}),o(fe)!=="svelte-ngcypm"&&(fe.textContent=Wn),Gt=r(e),ue=s(e,"P",{"data-svelte-h":!0}),o(ue)!=="svelte-xtlaks"&&(ue.textContent=Xn),qt=r(e),Le=s(e,"UL",{"data-svelte-h":!0}),o(Le)!=="svelte-19pdi9y"&&(Le.innerHTML=Yn),Et=r(e),de=s(e,"P",{"data-svelte-h":!0}),o(de)!=="svelte-tkk4d"&&(de.textContent=Zn),Dt=r(e),$e=s(e,"P",{"data-svelte-h":!0}),o($e)!=="svelte-jyzdzy"&&($e.textContent=ei),jt=r(e),v=s(e,"BLOCKQUOTE",{class:!0,"data-svelte-h":!0}),o(v)!=="svelte-q9kgfs"&&(v.innerHTML=ti),It=r(e),xe=s(e,"P",{"data-svelte-h":!0}),o(xe)!=="svelte-1xc2yc7"&&(xe.textContent=ni),St=r(e),ve=s(e,"P",{"data-svelte-h":!0}),o(ve)!=="svelte-1nzkqkl"&&(ve.textContent=ii),Bt=r(e),ce=s(e,"P",{"data-svelte-h":!0}),o(ce)!=="svelte-1pnf8pl"&&(ce.textContent=li),Ut=r(e),Re=s(e,"P",{"data-svelte-h":!0}),o(Re)!=="svelte-1wjv0ls"&&(Re.textContent=ri),Qt=r(e),Kt=s(e,"HR",{}),Nt=r(e),Ce=s(e,"P",{"data-svelte-h":!0}),o(Ce)!=="svelte-ehqmpo"&&(Ce.textContent=ai),Jt=r(e),Pe=s(e,"P",{"data-svelte-h":!0}),o(Pe)!=="svelte-kafnk1"&&(Pe.textContent=si),Vt=r(e),p(we.$$.fragment,e),Wt=r(e),p(Me.$$.fragment,e),Xt=r(e),p(He.$$.fragment,e),Yt=r(e),p(ye.$$.fragment,e),Zt=r(e),p(Te.$$.fragment,e),en=r(e),p(_e.$$.fragment,e),tn=r(e),p(be.$$.fragment,e),nn=r(e),p(he.$$.fragment,e),ln=r(e),p(ke.$$.fragment,e),rn=r(e),p(Oe.$$.fragment,e),an=r(e),p(Fe.$$.fragment,e),sn=r(e),p(Ae.$$.fragment,e),on=r(e),ze=s(e,"UL",{"data-svelte-h":!0}),o(ze)!=="svelte-z0yxlx"&&(ze.innerHTML=oi),mn=r(e),p(Ge.$$.fragment,e),pn=r(e),Ee=s(e,"P",{}),mi(Ee).forEach(n),this.h()},h(){fn($,"name","hf:doc:metadata"),fn($,"content",Ri),fn(x,"class","tip"),fn(v,"class","tip")},m(e,t){$i(document.head,$),i(e,je,t),i(e,qe,t),i(e,Ie,t),g(c,e,t),i(e,Se,t),g(R,e,t),i(e,Be,t),i(e,C,t),i(e,Ue,t),i(e,P,t),i(e,Qe,t),i(e,x,t),i(e,Ke,t),i(e,w,t),i(e,Ne,t),g(M,e,t),i(e,Je,t),i(e,H,t),i(e,Ve,t),i(e,y,t),i(e,We,t),i(e,T,t),i(e,Xe,t),i(e,_,t),i(e,Ye,t),g(b,e,t),i(e,Ze,t),i(e,h,t),i(e,et,t),g(k,e,t),i(e,tt,t),i(e,O,t),i(e,nt,t),g(F,e,t),i(e,it,t),i(e,A,t),i(e,lt,t),g(z,e,t),i(e,rt,t),i(e,G,t),i(e,at,t),i(e,q,t),i(e,st,t),i(e,E,t),i(e,ot,t),i(e,D,t),i(e,mt,t),g(j,e,t),i(e,pt,t),i(e,I,t),i(e,gt,t),g(S,e,t),i(e,ft,t),i(e,B,t),i(e,ut,t),i(e,U,t),i(e,Lt,t),i(e,Q,t),i(e,dt,t),i(e,K,t),i(e,$t,t),g(N,e,t),i(e,xt,t),i(e,J,t),i(e,vt,t),i(e,V,t),i(e,ct,t),i(e,W,t),i(e,Rt,t),i(e,X,t),i(e,Ct,t),i(e,Y,t),i(e,Pt,t),i(e,Z,t),i(e,wt,t),i(e,ee,t),i(e,Mt,t),i(e,te,t),i(e,Ht,t),g(ne,e,t),i(e,yt,t),i(e,ie,t),i(e,Tt,t),i(e,le,t),i(e,_t,t),i(e,re,t),i(e,bt,t),i(e,ae,t),i(e,ht,t),i(e,se,t),i(e,kt,t),i(e,oe,t),i(e,Ot,t),i(e,me,t),i(e,Ft,t),i(e,pe,t),i(e,At,t),g(ge,e,t),i(e,zt,t),i(e,fe,t),i(e,Gt,t),i(e,ue,t),i(e,qt,t),i(e,Le,t),i(e,Et,t),i(e,de,t),i(e,Dt,t),i(e,$e,t),i(e,jt,t),i(e,v,t),i(e,It,t),i(e,xe,t),i(e,St,t),i(e,ve,t),i(e,Bt,t),i(e,ce,t),i(e,Ut,t),i(e,Re,t),i(e,Qt,t),i(e,Kt,t),i(e,Nt,t),i(e,Ce,t),i(e,Jt,t),i(e,Pe,t),i(e,Vt,t),g(we,e,t),i(e,Wt,t),g(Me,e,t),i(e,Xt,t),g(He,e,t),i(e,Yt,t),g(ye,e,t),i(e,Zt,t),g(Te,e,t),i(e,en,t),g(_e,e,t),i(e,tn,t),g(be,e,t),i(e,nn,t),g(he,e,t),i(e,ln,t),g(ke,e,t),i(e,rn,t),g(Oe,e,t),i(e,an,t),g(Fe,e,t),i(e,sn,t),g(Ae,e,t),i(e,on,t),i(e,ze,t),i(e,mn,t),g(Ge,e,t),i(e,pn,t),i(e,Ee,t),gn=!0},p:gi,i(e){gn||(f(c.$$.fragment,e),f(R.$$.fragment,e),f(M.$$.fragment,e),f(b.$$.fragment,e),f(k.$$.fragment,e),f(F.$$.fragment,e),f(z.$$.fragment,e),f(j.$$.fragment,e),f(S.$$.fragment,e),f(N.$$.fragment,e),f(ne.$$.fragment,e),f(ge.$$.fragment,e),f(we.$$.fragment,e),f(Me.$$.fragment,e),f(He.$$.fragment,e),f(ye.$$.fragment,e),f(Te.$$.fragment,e),f(_e.$$.fragment,e),f(be.$$.fragment,e),f(he.$$.fragment,e),f(ke.$$.fragment,e),f(Oe.$$.fragment,e),f(Fe.$$.fragment,e),f(Ae.$$.fragment,e),f(Ge.$$.fragment,e),gn=!0)},o(e){u(c.$$.fragment,e),u(R.$$.fragment,e),u(M.$$.fragment,e),u(b.$$.fragment,e),u(k.$$.fragment,e),u(F.$$.fragment,e),u(z.$$.fragment,e),u(j.$$.fragment,e),u(S.$$.fragment,e),u(N.$$.fragment,e),u(ne.$$.fragment,e),u(ge.$$.fragment,e),u(we.$$.fragment,e),u(Me.$$.fragment,e),u(He.$$.fragment,e),u(ye.$$.fragment,e),u(Te.$$.fragment,e),u(_e.$$.fragment,e),u(be.$$.fragment,e),u(he.$$.fragment,e),u(ke.$$.fragment,e),u(Oe.$$.fragment,e),u(Fe.$$.fragment,e),u(Ae.$$.fragment,e),u(Ge.$$.fragment,e),gn=!1},d(e){e&&(n(je),n(qe),n(Ie),n(Se),n(Be),n(C),n(Ue),n(P),n(Qe),n(x),n(Ke),n(w),n(Ne),n(Je),n(H),n(Ve),n(y),n(We),n(T),n(Xe),n(_),n(Ye),n(Ze),n(h),n(et),n(tt),n(O),n(nt),n(it),n(A),n(lt),n(rt),n(G),n(at),n(q),n(st),n(E),n(ot),n(D),n(mt),n(pt),n(I),n(gt),n(ft),n(B),n(ut),n(U),n(Lt),n(Q),n(dt),n(K),n($t),n(xt),n(J),n(vt),n(V),n(ct),n(W),n(Rt),n(X),n(Ct),n(Y),n(Pt),n(Z),n(wt),n(ee),n(Mt),n(te),n(Ht),n(yt),n(ie),n(Tt),n(le),n(_t),n(re),n(bt),n(ae),n(ht),n(se),n(kt),n(oe),n(Ot),n(me),n(Ft),n(pe),n(At),n(zt),n(fe),n(Gt),n(ue),n(qt),n(Le),n(Et),n(de),n(Dt),n($e),n(jt),n(v),n(It),n(xe),n(St),n(ve),n(Bt),n(ce),n(Ut),n(Re),n(Qt),n(Kt),n(Nt),n(Ce),n(Jt),n(Pe),n(Vt),n(Wt),n(Xt),n(Yt),n(Zt),n(en),n(tn),n(nn),n(ln),n(rn),n(an),n(sn),n(on),n(ze),n(mn),n(pn),n(Ee)),n($),L(c,e),L(R,e),L(M,e),L(b,e),L(k,e),L(F,e),L(z,e),L(j,e),L(S,e),L(N,e),L(ne,e),L(ge,e),L(we,e),L(Me,e),L(He,e),L(ye,e),L(Te,e),L(_e,e),L(be,e),L(he,e),L(ke,e),L(Oe,e),L(Fe,e),L(Ae,e),L(Ge,e)}}}const Ri='{"title":"Reinforcement Learning နှင့် LLMs တွင် ၎င်း၏အခန်းကဏ္ဍ မိတ်ဆက်","local":"introduction-to-reinforcement-learning-and-its-role-in-llms","sections":[{"title":"Reinforcement Learning (RL) ဆိုတာ ဘာလဲ။","local":"reinforcement-learning-rl-ဆတ-ဘလ","sections":[{"title":"Agent","local":"agent","sections":[],"depth":3},{"title":"Environment","local":"environment","sections":[],"depth":3},{"title":"Action","local":"action","sections":[],"depth":3},{"title":"Reward","local":"reward","sections":[],"depth":3},{"title":"Policy","local":"policy","sections":[],"depth":3}],"depth":2},{"title":"RL လုပ်ငန်းစဉ် - စမ်းသပ်မှုနှင့် အမှား (Trial and Error)","local":"rl-လပငနစဉ---စမသပမနင-အမ-trial-and-error","sections":[],"depth":2},{"title":"Large Language Models (LLMs) တွင် RL ၏ အခန်းကဏ္ဍ","local":"large-language-models-llms-တင-rl--အခနကဏဍ","sections":[],"depth":2},{"title":"Reinforcement Learning from Human Feedback (RLHF)","local":"reinforcement-learning-from-human-feedback-rlhf","sections":[],"depth":2},{"title":"GRPO (Group Relative Policy Optimization) ကို ဘာကြောင့် ဂရုစိုက်သင့်သလဲ။","local":"grpo-group-relative-policy-optimization-က-ဘကင-ဂရစကသငသလ","sections":[],"depth":2},{"title":"မေးခွန်းများ","local":"မခနမ","sections":[{"title":"၁။ Reinforcement Learning ၏ အဓိက အစိတ်အပိုင်းများက ဘာတွေလဲ။","local":"၁-reinforcement-learning--အဓက-အစတအပငမက-ဘတလ","sections":[],"depth":3},{"title":"၂။ Language Models တွေ train ဖို့ RLHF ရဲ့ အဓိက အကျိုးကျေးဇူးက ဘာလဲ။","local":"၂-language-models-တ-train-ဖ-rlhf-ရ-အဓက-အကကဇက-ဘလ","sections":[],"depth":3},{"title":"၃။ LLMs တွေအတွက် RL အခြေအနေမှာ၊ “action” ဆိုတာ ဘာကို ကိုယ်စားပြုလဲ။","local":"၃-llms-တအတက-rl-အခအနမ-action-ဆတ-ဘက-ကယစပလ","sections":[],"depth":3},{"title":"၄။ Language models တွေရဲ့ RL training မှာ reward ရဲ့ အခန်းကဏ္ဍက ဘာလဲ။","local":"၄-language-models-တရ-rl-training-မ-reward-ရ-အခနကဏဍက-ဘလ","sections":[],"depth":3},{"title":"၅။ LLMs တွေအတွက် RL အခြေအနေမှာ reward ဆိုတာ ဘာလဲ။","local":"၅-llms-တအတက-rl-အခအနမ-reward-ဆတ-ဘလ","sections":[],"depth":3}],"depth":2},{"title":"ဝေါဟာရ ရှင်းလင်းချက် (Glossary)","local":"ဝဟရ-ရငလငခက-glossary","sections":[],"depth":2}],"depth":1}';function Ci(un){return fi(()=>{new URLSearchParams(window.location.search).get("fw")}),[]}class yi extends ui{constructor($){super(),Li(this,$,Ci,ci,pi,{})}}export{yi as component}; | |
Xet Storage Details
- Size:
- 67.9 kB
- Xet hash:
- 74f51d3a62a26e90e1e7c019ede5d5026f29ab5d4e4850f22c440c5657bb1065
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.