Buckets:
| import{s as kl,n as Ml,o as Ql}from"../chunks/scheduler.893fe8c9.js";import{S as Fl,i as hl,e as T,s as U,c as x,h as cl,a as g,d as e,b as n,f as Cl,g as s,j as i,k as Wt,l as yl,m as J,n as r,t as w,o,p}from"../chunks/index.b1df2166.js";import{C as Pl,H as a,E as _l}from"../chunks/MermaidChart.svelte_svelte_type_style_lang.9e292c4c.js";import{C as vl}from"../chunks/CodeBlock.445dce01.js";function dl(Xt){let m,gt,nt,it,O,xt,u,st,E,tl="Reinforcement Learning နဲ့ open-source AI ကမ္ဘာဆီ စိတ်လှုပ်ရှားဖွယ်ခရီးစဉ်ကို ကြိုဆိုပါတယ်။ ဒီအခန်းကို ကျောင်းသားတွေ Reinforcement Learning နဲ့ LLMs တွေမှာ သူ့ရဲ့အခန်းကဏ္ဍကို နားလည်စေဖို့ ရည်ရွယ်ပြီး ရေးသားထားတာပါ။",rt,R,ll='ဒီ AI နယ်ပယ်မှာ တိုးတက်မှုအသစ်တွေ ဖော်ဆောင်ပေးမယ့် <a href="https://github.com/huggingface/open-r1" rel="nofollow">Open R1</a> ဆိုတဲ့ အံသြဖွယ် community project အကြောင်းကိုလည်း ကျွန်တော်တို့ လေ့လာသွားပါမယ်။ အထူးသဖြင့်၊ ဒီသင်တန်းက ကျောင်းသားတွေနဲ့ သင်ယူသူတွေ <a href="https://github.com/huggingface/open-r1" rel="nofollow">Open R1</a> ကို အသုံးပြုနိုင်ပြီး ပံ့ပိုးကူညီနိုင်စေဖို့ ရည်ရွယ်ပါတယ်။',wt,$,ot,A,el="ဒီအခန်းမှာ၊ ရှုပ်ထွေးတဲ့ အယူအဆတွေကို နားလည်လွယ်တဲ့အပိုင်းတွေအဖြစ် ခွဲခြမ်းစိတ်ဖြာပြီး LLMs တွေကို ရှုပ်ထွေးတဲ့ ပြဿနာတွေမှာ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်စေဖို့ ဒီစိတ်လှုပ်ရှားဖွယ် project မှာ ဘယ်လိုပါဝင်နိုင်မလဲဆိုတာ ပြသပေးသွားမှာပါ။",pt,D,Jl="LLMs တွေဟာ generative tasks အများအပြားမှာ အလွန်ကောင်းမွန်တဲ့ စွမ်းဆောင်ရည်ကို ပြသထားပါတယ်။ ဒါပေမယ့် မကြာသေးမီကအထိ သူတို့ဟာ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်မှုများစွာ လိုအပ်တဲ့ ရှုပ်ထွေးတဲ့ ပြဿနာတွေမှာ အခက်အခဲတွေ ရှိခဲ့ပါတယ်။ ဥပမာ၊ ပဟေဠိတွေ ဒါမှမဟုတ် multiple steps of reasoning တွေ လိုအပ်တဲ့ သင်္ချာပြဿနာတွေကို ဖြေရှင်းရာမှာ အခက်အခဲ ရှိခဲ့ပါတယ်။",at,L,Ul="Open R1 က LLMs တွေကို ရှုပ်ထွေးတဲ့ ပြဿနာတွေမှာ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်နိုင်စေဖို့ ရည်ရွယ်တဲ့ project တစ်ခုပါ။ Reinforcement Learning ကို အသုံးပြုပြီး LLMs တွေကို “စဉ်းစား” စေဖို့နဲ့ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်စေဖို့ အားပေးခြင်းဖြင့် ဒါကို လုပ်ဆောင်ပါတယ်။",mt,I,nl="ရိုးရှင်းစွာပြောရရင်၊ model ကို အတွေးတွေနဲ့ output တွေ နှစ်ခုလုံးကို ထုတ်ပေးဖို့ လေ့ကျင့်ထားပြီး၊ အဲဒီအတွေးတွေနဲ့ output တွေကို သုံးစွဲသူက သီးခြားစီ ကိုင်တွယ်နိုင်အောင် စနစ်တကျ ဖွဲ့စည်းထားပါတယ်။",ft,C,Tl="ဥပမာတစ်ခု ကြည့်ရအောင်။ ကျွန်တော်တို့ကိုယ်တိုင် အောက်ပါပြဿနာကို ဖြေရှင်းဖို့ တာဝန်ပေးထားတယ်ဆိုရင်၊ ကျွန်တော်တို့ ဒီလိုစဉ်းစားမိနိုင်ပါတယ်။",Ot,v,ut,k,gl="အဲဒီနောက် ဒီအတွေးနဲ့ အဖြေကို သုံးစွဲသူက သီးခြားစီ ကိုင်တွယ်နိုင်အောင် စနစ်တကျ ဖွဲ့စည်းနိုင်ပါတယ်။ reasoning tasks တွေအတွက်၊ LLMs တွေကို အောက်ပါ format နဲ့ အတွေးတွေနဲ့ အဖြေတွေကို ထုတ်ပေးဖို့ လေ့ကျင့်နိုင်ပါတယ်။",Et,M,Rt,Q,il="သုံးစွဲသူတစ်ဦးအနေနဲ့၊ model ရဲ့ output ကနေ အတွေးနဲ့ အဖြေကို ထုတ်ယူပြီး ပြဿနာကို ဖြေရှင်းဖို့ အသုံးပြုနိုင်ပါတယ်။",$t,F,At,h,xl="ကျောင်းသားတစ်ဦးအနေနဲ့၊ Open R1 နဲ့ Reinforcement Learning ရဲ့ LLMs တွေမှာရှိတဲ့ အခန်းကဏ္ဍကို နားလည်ထားတာက အရေးကြီးပါတယ်၊ ဘာလို့လဲဆိုတော့…",Dt,c,sl="<li>ခေတ်မီဆန်းသစ်တဲ့ AI ကို ဘယ်လို ဖန်တီးတီထွင်လဲဆိုတာ သင့်ကို ပြသပေးလို့ပါ။</li> <li>လက်တွေ့လုပ်ဆောင်နိုင်တဲ့ သင်ယူမှုအခွင့်အလမ်းတွေနဲ့ ပံ့ပိုးကူညီခွင့်တွေ ပေးလို့ပါ။</li> <li>AI နည်းပညာက ဘယ်ကို ဦးတည်နေလဲဆိုတာကို နားလည်ဖို့ ကူညီပေးလို့ပါ။</li> <li>AI နယ်ပယ်မှာ အနာဂတ်အလုပ်အကိုင် အခွင့်အလမ်းတွေကို ဖွင့်ပေးလို့ပါ။</li>",Lt,y,It,P,rl="ဒီအခန်းကို အပိုင်းလေးပိုင်း ခွဲခြားထားပြီး တစ်ခုစီက Open R1 ရဲ့ မတူညီတဲ့ ကဏ္ဍတစ်ခုစီကို အာရုံစိုက်ထားပါတယ်။",Ct,_,vt,d,wl="Reinforcement Learning (RL) ရဲ့ အခြေခံများနဲ့ LLMs များကို လေ့ကျင့်ရာတွင် သူ့ရဲ့အခန်းကဏ္ဍကို ကျွန်တော်တို့ လေ့လာသွားပါမယ်။",kt,B,ol="<li>RL ဆိုတာဘာလဲ။</li> <li>LLMs တွေမှာ RL ကို ဘယ်လိုအသုံးပြုလဲ။</li> <li>DeepSeek R1 ဆိုတာဘာလဲ။</li> <li>DeepSeek R1 ရဲ့ အဓိက ဆန်းသစ်တီထွင်မှုတွေက ဘာတွေလဲ။</li>",Mt,j,Qt,H,pl='<a href="https://huggingface.co/open-r1" rel="nofollow">Open R1</a> ကို လှုံ့ဆော်ပေးခဲ့တဲ့ သုတေသနစာတမ်းကို ကျွန်တော်တို့ ခွဲခြမ်းစိတ်ဖြာသွားပါမယ်။',Ft,b,al="<li>အဓိက ဆန်းသစ်တီထွင်မှုများနှင့် ထူးခြားအောင်မြင်မှုများ</li> <li>Training လုပ်ငန်းစဉ်နှင့် Architecture</li> <li>ရလဒ်များနှင့် ၎င်းတို့၏ အရေးပါမှု</li>",ht,G,ct,S,ml="code ဥပမာတွေနဲ့ လက်တွေ့ကျကျ လုပ်ဆောင်သွားပါမယ်။",yt,q,fl="<li>Transformer Reinforcement Learning (TRL) library ကို ဘယ်လိုအသုံးပြုရမလဲ။</li> <li>GRPO training ကို ဘယ်လိုတည်ဆောက်ရမလဲ။</li>",Pt,z,_t,Y,Ol="Open R1 ကို အသုံးပြုပြီး model တစ်ခုကို ချိန်ညှိဖို့ လက်တွေ့အသုံးချမှုတစ်ခုကို ကျွန်တော်တို့ ကြည့်ရှုပါမယ်။",dt,N,ul='<li>TRL မှာ GRPO ကို အသုံးပြုပြီး model တစ်ခုကို ဘယ်လို train လုပ်ရမလဲ။</li> <li>သင်၏ model ကို <a href="https://huggingface.co/models" rel="nofollow">Hugging Face Hub</a> မှာ မျှဝေပါ။</li>',Bt,K,jt,V,El="ဒီအခန်းကနေ အကျိုးအများဆုံးရရှိဖို့အတွက် အောက်ပါအချက်တွေ ရှိထားရင် အကူအညီဖြစ်ပါလိမ့်မယ်။",Ht,Z,Rl="<li>Python programming ကို ကောင်းကောင်းနားလည်ထားဖို့။</li> <li>machine learning concepts တွေနဲ့ ရင်းနှီးဖို့။</li> <li>AI နဲ့ language models တွေအပေါ် စိတ်ဝင်စားမှုရှိဖို့။</li>",bt,W,$l="ဒါတွေထဲက အချို့ လိုအပ်နေရင်လည်း စိတ်မပူပါနဲ့ — ကျွန်တော်တို့ ဆက်လက်လုပ်ဆောင်ရင်း အဓိက အယူအဆတွေကို ရှင်းပြသွားမှာပါ။ 🚀",Gt,f,Al='<p>သင့်မှာ ကြိုတင်လိုအပ်ချက်တွေ အားလုံး မရှိဘူးဆိုရင်၊ <a href="/course/chapter1/1">သင်တန်း</a> ရဲ့ အခန်း ၁ ကနေ ၁၁ အထိကို လေ့လာကြည့်ပါ။</p>',St,X,qt,tt,Dl=`၁။ <strong>အစီအစဉ်အတိုင်း ဖတ်ရှုပါ</strong>: အပိုင်းတွေဟာ တစ်ခုနဲ့တစ်ခု ဆက်စပ်နေတာမို့ အစီအစဉ်အတိုင်း ဖတ်ရှုတာ အကောင်းဆုံးပါပဲ။ | |
| ၂။ <strong>မှတ်စုများ မျှဝေပါ</strong>: အဓိက အယူအဆတွေနဲ့ မေးခွန်းတွေကို ရေးမှတ်ပြီး <a href="https://discord.gg/UrrTSsSyjb" rel="nofollow">Discord</a> မှာ community ထဲက တခြားသူတွေနဲ့ ဆွေးနွေးပါ။ | |
| ၃။ <strong>Code ကို စမ်းသပ်ပါ</strong>: ကျွန်တော်တို့ လက်တွေ့ဥပမာတွေဆီ ရောက်တဲ့အခါ၊ သင်ကိုယ်တိုင် စမ်းသပ်ကြည့်ပါ။ | |
| ၄။ <strong>Community မှာ ပါဝင်ပါ</strong>: ကျွန်တော်တို့ ပံ့ပိုးပေးထားတဲ့ အရင်းအမြစ်တွေကို အသုံးပြုပြီး အခြားသင်ယူသူတွေနဲ့ ချိတ်ဆက်ပါ။`,zt,lt,Ll="Open R1 အကြောင်း ကျွန်တော်တို့ရဲ့ လေ့လာမှုကို စတင်ပြီး AI ကို လူတိုင်းလက်လှမ်းမီအောင် လုပ်ဆောင်ရာမှာ သင်ဘယ်လိုပါဝင်နိုင်မလဲဆိုတာ ရှာဖွေကြည့်ကြစို့။ 🚀",Yt,et,Nt,Jt,Il="<li><strong>Reinforcement Learning (RL)</strong>: Agent တစ်ခုသည် environment တစ်ခုအတွင်းမှ အပြန်အလှန်တုံ့ပြန်မှုများ (interactions) မှ သင်ယူပြီး ဆုလာဘ်များ (rewards) ကို အများဆုံးရရှိရန် ရည်ရွယ်သည့် Machine Learning နယ်ပယ်တစ်ခု။</li> <li><strong>Open-source AI</strong>: Source code ကို အများပြည်သူအား လွတ်လပ်စွာ အသုံးပြု၊ ပြင်ဆင်၊ ဖြန့်ဝေခွင့်ပြုထားသော Artificial Intelligence (AI) နည်းပညာ။</li> <li><strong>LLMs (Large Language Models)</strong>: လူသားဘာသာစကားကို နားလည်ပြီး ထုတ်လုပ်ပေးနိုင်တဲ့ အလွန်ကြီးမားတဲ့ Artificial Intelligence (AI) မော်ဒယ်တွေ ဖြစ်ပါတယ်။</li> <li><strong>Open R1</strong>: Hugging Face မှ စတင်ခဲ့သော community project တစ်ခုဖြစ်ပြီး LLMs များကို ရှုပ်ထွေးသော ပြဿနာများတွင် ဆင်ခြင်တုံတရားဖြင့် တွေးခေါ်နိုင်စေရန် ရည်ရွယ်သည်။</li> <li><strong>Generative Tasks</strong>: စာသားအသစ်များ၊ code သို့မဟုတ် အခြားဒေတာပုံစံများကို ဖန်တီးထုတ်လုပ်နိုင်သော အလုပ်များ။</li> <li><strong>Reasoning</strong>: ပြဿနာများကို ဖြေရှင်းရန် သို့မဟုတ် ဆုံးဖြတ်ချက်များချရန်အတွက် အချက်အလက်များကို ခွဲခြမ်းစိတ်ဖြာခြင်းနှင့် အသုံးချခြင်း လုပ်ငန်းစဉ်။</li> <li><strong>Puzzles</strong>: ဖြေရှင်းရန် ဉာဏ်စွမ်းလိုအပ်သော ပြဿနာများ သို့မဟုတ် ဂိမ်းများ။</li> <li><strong>Math Problems</strong>: သင်္ချာဆိုင်ရာ ပြဿနာများ။</li> <li><strong>Multiple Steps of Reasoning</strong>: ပြဿနာတစ်ခုကို ဖြေရှင်းရန်အတွက် ဆင်ခြင်တုံတရားဆိုင်ရာ အဆင့်များစွာကို ဖြတ်သန်းရခြင်း။</li> <li><strong>Agent</strong>: Reinforcement Learning environment တစ်ခုအတွင်း လုပ်ဆောင်ချက်များ (actions) ကို လုပ်ဆောင်သော entity။</li> <li><strong>Environment</strong>: Reinforcement Learning agent သည် အပြန်အလှန်တုံ့ပြန်သော စနစ် သို့မဟုတ် ကမ္ဘာ။</li> <li><strong>Rewards</strong>: Agent ၏ လုပ်ဆောင်ချက်များအပေါ် အခြေခံ၍ environment က ပေးသော တုံ့ပြန်ချက်များ သို့မဟုတ် အမှတ်များ။</li> <li><strong>Thoughts</strong>: LLM မှ ပြဿနာကို ဖြေရှင်းရန်အတွက် ထုတ်လုပ်သော အတွင်းပိုင်း ဆင်ခြင်တုံတရားဆိုင်ရာ အဆင့်များ။</li> <li><strong>Outputs</strong>: LLM မှ ပြဿနာ၏ နောက်ဆုံးအဖြေ သို့မဟုတ် တုံ့ပြန်ချက်။</li> <li><strong>Structure Thoughts and Outputs</strong>: LLM မှ ထုတ်ပေးသော အတွေးများနှင့် အဖြေများကို သီးခြားစီ ခွဲခြားသိမ်းဆည်းနိုင်သော ပုံစံဖြင့် စီစဉ်ခြင်း။</li> <li><strong>Extract</strong>: စာသား သို့မဟုတ် ဒေတာတစ်ခုမှ သီးခြားအစိတ်အပိုင်းများကို ထုတ်ယူခြင်း။</li> <li><strong>Cutting-edge AI</strong>: နောက်ဆုံးပေါ်နှင့် အဆင့်မြင့်ဆုံး Artificial Intelligence နည်းပညာများ။</li> <li><strong>Hands-on Opportunities</strong>: လက်တွေ့ကျကျ လုပ်ဆောင်နိုင်သော အခွင့်အလမ်းများ။</li> <li><strong>AI Technology</strong>: Artificial Intelligence နည်းပညာ။</li> <li><strong>Career Opportunities</strong>: အလုပ်အကိုင် အခွင့်အလမ်းများ။</li> <li><strong>DeepSeek R1</strong>: Open R1 ကို လှုံ့ဆော်ပေးခဲ့သော research paper တွင် ဖော်ပြထားသည့် reasoning model တစ်မျိုး။</li> <li><strong>Innovations</strong>: နည်းပညာ သို့မဟုတ် နည်းလမ်းများတွင် အသစ်အဆန်း ဖန်တီးတီထွင်မှုများ။</li> <li><strong>Breakthroughs</strong>: အရေးကြီးသော တိုးတက်မှုများ သို့မဟုတ် ရှာဖွေတွေ့ရှိမှုများ။</li> <li><strong>Training Process</strong>: Model ကို ဒေတာများဖြင့် လေ့ကျင့်ပေးသည့် လုပ်ငန်းစဉ်။</li> <li><strong>Architecture</strong>: Model တစ်ခု၏ layers များနှင့် ၎င်းတို့ ချိတ်ဆက်ပုံကို ဖော်ပြသော ဒီဇိုင်းဖွဲ့စည်းပုံ။</li> <li><strong>Results</strong>: Model ၏ စွမ်းဆောင်ရည် သို့မဟုတ် လုပ်ဆောင်မှုမှ ရရှိသော အချက်အလက်များ။</li> <li><strong>Significance</strong>: ရလဒ်များ၏ အရေးပါမှု သို့မဟုတ် အဓိပ္ပာယ်။</li> <li><strong>GRPO (Generalized Reinforcement Learning with Policy Optimization)</strong>: Reinforcement Learning algorithm တစ်မျိုး။ DeepSeek R1 တွင် အသုံးပြုထားသည်။</li> <li><strong>TRL (Transformer Reinforcement Learning) Library</strong>: Hugging Face မှ ထုတ်လုပ်ထားသော library တစ်ခုဖြစ်ပြီး Transformer models များနှင့် Reinforcement Learning ကို အသုံးပြုရန် ကူညီပေးသည်။</li> <li><strong>Setting up GRPO Training</strong>: GRPO algorithm ကို အသုံးပြု၍ model training အတွက် စနစ်တကျ ပြင်ဆင်ခြင်း။</li> <li><strong>Align a Model</strong>: Model ၏ output များကို လူသားနှစ်သက်မှုများ သို့မဟုတ် သတ်မှတ်ထားသော ပန်းတိုင်များနှင့် ကိုက်ညီအောင် ချိန်ညှိခြင်း။</li> <li><strong>Python Programming</strong>: Python programming language ဖြင့် code ရေးသားခြင်း။</li> <li><strong>Machine Learning Concepts</strong>: Machine Learning ၏ အခြေခံသဘောတရားများ။</li> <li><strong>Language Models</strong>: လူသားဘာသာစကား၏ ဖြန့်ဝေမှုကို နားလည်ရန် လေ့ကျင့်ထားသော AI မော်ဒယ်တစ်ခု။</li> <li><strong>Prerequisites</strong>: သင်တန်းတစ်ခုကို သင်ယူရန် သို့မဟုတ် အလုပ်တစ်ခုကို လုပ်ဆောင်ရန်အတွက် လိုအပ်သော ကြိုတင်ဗဟုသုတ သို့မဟုတ် ကျွမ်းကျင်မှုများ။</li> <li><strong>Discord</strong>: အွန်လိုင်း ဆက်သွယ်ပြောဆိုခြင်း platform တစ်ခု။</li> <li><strong>Hugging Face Hub</strong>: AI မော်ဒယ်တွေ၊ datasets တွေနဲ့ demo တွေကို အခြားသူတွေနဲ့ မျှဝေဖို့၊ ရှာဖွေဖို့နဲ့ ပြန်လည်အသုံးပြုဖို့အတွက် အွန်လိုင်း platform တစ်ခု ဖြစ်ပါတယ်။</li>",Kt,Ut,Vt,Tt,Zt;return O=new Pl({props:{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"}}),u=new a({props:{title:"ကျောင်းသားများအတွက် Open R1",local:"ကငသမအတက-open-r1",headingTag:"h1"}}),$=new a({props:{title:"ဘာတွေ သင်ယူရမလဲ",local:"ဘတ-သငယရမလ",headingTag:"h2"}}),v=new vl({props:{code:"JUUxJTgwJTk1JUUxJTgwJUJDJUUxJTgwJUJGJUUxJTgwJTk0JUUxJTgwJUFDJTNBJTIwJTIyJUUxJTgwJTgwJUUxJTgwJUJCJUUxJTgwJUJEJUUxJTgwJTk0JUUxJTgwJUJBJUUxJTgwJTkwJUUxJTgwJUIxJUUxJTgwJUFDJUUxJTgwJUI3JUUxJTgwJUJBJUUxJTgwJTk5JUUxJTgwJUJFJUUxJTgwJUFDJTIwJUUxJTgwJTk1JUUxJTgwJTk0JUUxJTgwJUJBJUUxJTgwJUI4JUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JTIwJUUxJTgxJTgzJTIwJUUxJTgwJTlDJUUxJTgwJUFGJUUxJTgwJUI2JUUxJTgwJUI4JUUxJTgwJTk0JUUxJTgwJUIyJUUxJTgwJUI3JTIwJUUxJTgwJTlDJUUxJTgwJUFEJUUxJTgwJTk5JUUxJTgwJUI5JUUxJTgwJTk5JUUxJTgwJUIxJUUxJTgwJUFDJUUxJTgwJUJBJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JTIwJUUxJTgxJTgyJTIwJUUxJTgwJTlDJUUxJTgwJUFGJUUxJTgwJUI2JUUxJTgwJUI4JTIwJUUxJTgwJTlCJUUxJTgwJUJFJUUxJTgwJUFEJUUxJTgwJTk1JUUxJTgwJUFCJUUxJTgwJTkwJUUxJTgwJTlBJUUxJTgwJUJBJUUxJTgxJThCJTIwJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTk1JUUxJTgwJUIxJUUxJTgwJUFCJUUxJTgwJTg0JUUxJTgwJUJBJUUxJTgwJUI4JTIwJUUxJTgwJUExJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJTk4JUUxJTgwJTlBJUUxJTgwJUJBJUUxJTgwJTk0JUUxJTgwJUJFJUUxJTgwJTg1JUUxJTgwJUJBJUUxJTgwJTlDJUUxJTgwJUFGJUUxJTgwJUI2JUUxJTgwJUI4JTIwJUUxJTgwJTlCJUUxJTgwJUJFJUUxJTgwJUFEJUUxJTgwJTlFJUUxJTgwJTlDJUUxJTgwJUIyJUUxJTgxJThCJTIyJTBBJTBBJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJUIxJUUxJTgwJUI4JTNBJTIwJTIyJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTk1JUUxJTgwJUIxJUUxJTgwJUFCJUUxJTgwJTg0JUUxJTgwJUJBJUUxJTgwJUI4JTIwJUUxJTgwJUExJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJUExJUUxJTgwJTlCJUUxJTgwJUIxJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJTgwJUUxJTgwJUJBJUUxJTgwJTgwJUUxJTgwJUFEJUUxJTgwJUFGJTIwJUUxJTgwJTlCJUUxJTgwJTk2JUUxJTgwJUFEJUUxJTgwJUFGJUUxJTgwJUI3JTIwJUUxJTgwJTk1JUUxJTgwJTk0JUUxJTgwJUJBJUUxJTgwJUI4JUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJUExJUUxJTgwJTlCJUUxJTgwJUIxJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJTgwJUUxJTgwJUJBJUUxJTgwJTk0JUUxJTgwJUIyJUUxJTgwJUI3JTIwJUUxJTgwJTlDJUUxJTgwJUFEJUUxJTgwJTk5JUUxJTgwJUI5JUUxJTgwJTk5JUUxJTgwJUIxJUUxJTgwJUFDJUUxJTgwJUJBJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJUExJUUxJTgwJTlCJUUxJTgwJUIxJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJTgwJUUxJTgwJUJBJUUxJTgwJTgwJUUxJTgwJUFEJUUxJTgwJUFGJTIwJUUxJTgwJTk1JUUxJTgwJUIxJUUxJTgwJUFCJUUxJTgwJTg0JUUxJTgwJUJBJUUxJTgwJUI4JUUxJTgwJTlCJUUxJTgwJTk1JUUxJTgwJUFCJUUxJTgwJTk5JUUxJTgwJTlBJUUxJTgwJUJBJUUxJTgxJThCJTIyJTBBJTBBJUUxJTgwJUExJUUxJTgwJTk2JUUxJTgwJUJDJUUxJTgwJUIxJTNBJTIwJTIyJUUxJTgxJTg1JTIy",highlighted:`ပြဿနာ: <span class="hljs-string">"ကျွန်တော့်မှာ ပန်းသီး ၃ လုံးနဲ့ လိမ္မော်သီး ၂ လုံး ရှိပါတယ်။ စုစုပေါင်း အသီးဘယ်နှစ်လုံး ရှိသလဲ။"</span> | |
| အတွေး: <span class="hljs-string">"စုစုပေါင်း အသီးအရေအတွက်ကို ရဖို့ ပန်းသီးအရေအတွက်နဲ့ လိမ္မော်သီးအရေအတွက်ကို ပေါင်းရပါမယ်။"</span> | |
| အဖြေ: <span class="hljs-string">"၅"</span>`,wrap:!1}}),M=new vl({props:{code:"JTNDdGhpbmslM0UlRTElODAlODUlRTElODAlQUYlRTElODAlODUlRTElODAlQUYlRTElODAlOTUlRTElODAlQjElRTElODAlQUIlRTElODAlODQlRTElODAlQkElRTElODAlQjglMjAlRTElODAlQTElRTElODAlOUUlRTElODAlQUUlRTElODAlQjglRTElODAlQTElRTElODAlOUIlRTElODAlQjElRTElODAlQTElRTElODAlOTAlRTElODAlQkQlRTElODAlODAlRTElODAlQkElRTElODAlODAlRTElODAlQUQlRTElODAlQUYlMjAlRTElODAlOUIlRTElODAlOTYlRTElODAlQUQlRTElODAlQUYlRTElODAlQjclMjAlRTElODAlOTUlRTElODAlOTQlRTElODAlQkElRTElODAlQjglRTElODAlOUUlRTElODAlQUUlRTElODAlQjglRTElODAlQTElRTElODAlOUIlRTElODAlQjElRTElODAlQTElRTElODAlOTAlRTElODAlQkQlRTElODAlODAlRTElODAlQkElRTElODAlOTQlRTElODAlQjIlRTElODAlQjclMjAlRTElODAlOUMlRTElODAlQUQlRTElODAlOTklRTElODAlQjklRTElODAlOTklRTElODAlQjElRTElODAlQUMlRTElODAlQkElRTElODAlOUUlRTElODAlQUUlRTElODAlQjglRTElODAlQTElRTElODAlOUIlRTElODAlQjElRTElODAlQTElRTElODAlOTAlRTElODAlQkQlRTElODAlODAlRTElODAlQkElRTElODAlODAlRTElODAlQUQlRTElODAlQUYlMjAlRTElODAlOTUlRTElODAlQjElRTElODAlQUIlRTElODAlODQlRTElODAlQkElRTElODAlQjglRTElODAlOUIlRTElODAlOTUlRTElODAlQUIlRTElODAlOTklRTElODAlOUElRTElODAlQkElRTElODElOEIlM0MlMkZ0aGluayUzRSUwQSVFMSU4MSU4NQ==",highlighted:`<think>စုစုပေါင်း အသီးအရေအတွက်ကို ရဖို့ ပန်းသီးအရေအတွက်နဲ့ လိမ္မော်သီးအရေအတွက်ကို ပေါင်းရပါမယ်။</think> | |
| ၅`,wrap:!1}}),F=new a({props:{title:"ဒါက ကျောင်းသားများအတွက် ဘာကြောင့် အရေးကြီးတာလဲ",local:"ဒက-ကငသမအတက-ဘကင-အရကတလ",headingTag:"h2"}}),y=new a({props:{title:"အခန်း၏ အကျဉ်းချုပ်",local:"အခန-အကဉခပ",headingTag:"h2"}}),_=new a({props:{title:"၁။ Reinforcement Learning နိဒါန်းနှင့် LLMs များတွင် ၎င်း၏ အခန်းကဏ္ဍ",local:"၁-reinforcement-learning-နဒနနင-llms-မတင-င-အခနကဏဍ",headingTag:"h3"}}),j=new a({props:{title:"၂။ DeepSeek R1 Paper ကို နားလည်ခြင်း",local:"၂-deepseek-r1-paper-က-နလညခင",headingTag:"h3"}}),G=new a({props:{title:"၃။ TRL တွင် GRPO ကို အကောင်အထည်ဖော်ခြင်း",local:"၃-trl-တင-grpo-က-အကငအထညဖခင",headingTag:"h3"}}),z=new a({props:{title:"၄။ Model တစ်ခုကို ချိန်ညှိရန် လက်တွေ့အသုံးချမှု",local:"၄-model-တစခက-ခနညရန-လကတအသခမ",headingTag:"h3"}}),K=new a({props:{title:"ကြိုတင်လိုအပ်ချက်များ",local:"ကတငလအပခကမ",headingTag:"h2"}}),X=new a({props:{title:"ဒီအခန်းကို ဘယ်လိုအသုံးပြုမလဲ",local:"ဒအခနက-ဘယလအသပမလ",headingTag:"h2"}}),et=new a({props:{title:"ဝေါဟာရ ရှင်းလင်းချက် (Glossary)",local:"ဝဟရ-ရငလငခက-glossary",headingTag:"h2"}}),Ut=new _l({props:{source:"https://github.com/huggingface/course/blob/main/chapters/my/chapter12/1.mdx"}}),{c(){m=T("meta"),gt=U(),nt=T("p"),it=U(),x(O.$$.fragment),xt=U(),x(u.$$.fragment),st=U(),E=T("p"),E.textContent=tl,rt=U(),R=T("p"),R.innerHTML=ll,wt=U(),x($.$$.fragment),ot=U(),A=T("p"),A.textContent=el,pt=U(),D=T("p"),D.textContent=Jl,at=U(),L=T("p"),L.textContent=Ul,mt=U(),I=T("p"),I.textContent=nl,ft=U(),C=T("p"),C.textContent=Tl,Ot=U(),x(v.$$.fragment),ut=U(),k=T("p"),k.textContent=gl,Et=U(),x(M.$$.fragment),Rt=U(),Q=T("p"),Q.textContent=il,$t=U(),x(F.$$.fragment),At=U(),h=T("p"),h.textContent=xl,Dt=U(),c=T("ul"),c.innerHTML=sl,Lt=U(),x(y.$$.fragment),It=U(),P=T("p"),P.textContent=rl,Ct=U(),x(_.$$.fragment),vt=U(),d=T("p"),d.textContent=wl,kt=U(),B=T("ul"),B.innerHTML=ol,Mt=U(),x(j.$$.fragment),Qt=U(),H=T("p"),H.innerHTML=pl,Ft=U(),b=T("ul"),b.innerHTML=al,ht=U(),x(G.$$.fragment),ct=U(),S=T("p"),S.textContent=ml,yt=U(),q=T("ul"),q.innerHTML=fl,Pt=U(),x(z.$$.fragment),_t=U(),Y=T("p"),Y.textContent=Ol,dt=U(),N=T("ul"),N.innerHTML=ul,Bt=U(),x(K.$$.fragment),jt=U(),V=T("p"),V.textContent=El,Ht=U(),Z=T("ul"),Z.innerHTML=Rl,bt=U(),W=T("p"),W.textContent=$l,Gt=U(),f=T("blockquote"),f.innerHTML=Al,St=U(),x(X.$$.fragment),qt=U(),tt=T("p"),tt.innerHTML=Dl,zt=U(),lt=T("p"),lt.textContent=Ll,Yt=U(),x(et.$$.fragment),Nt=U(),Jt=T("ul"),Jt.innerHTML=Il,Kt=U(),x(Ut.$$.fragment),Vt=U(),Tt=T("p"),this.h()},l(t){const l=cl("svelte-u9bgzb",document.head);m=g(l,"META",{name:!0,content:!0}),l.forEach(e),gt=n(t),nt=g(t,"P",{}),Cl(nt).forEach(e),it=n(t),s(O.$$.fragment,t),xt=n(t),s(u.$$.fragment,t),st=n(t),E=g(t,"P",{"data-svelte-h":!0}),i(E)!=="svelte-euqlcl"&&(E.textContent=tl),rt=n(t),R=g(t,"P",{"data-svelte-h":!0}),i(R)!=="svelte-1ws0z2x"&&(R.innerHTML=ll),wt=n(t),s($.$$.fragment,t),ot=n(t),A=g(t,"P",{"data-svelte-h":!0}),i(A)!=="svelte-1d3bq8f"&&(A.textContent=el),pt=n(t),D=g(t,"P",{"data-svelte-h":!0}),i(D)!=="svelte-6flr4m"&&(D.textContent=Jl),at=n(t),L=g(t,"P",{"data-svelte-h":!0}),i(L)!=="svelte-15py4um"&&(L.textContent=Ul),mt=n(t),I=g(t,"P",{"data-svelte-h":!0}),i(I)!=="svelte-i7yex9"&&(I.textContent=nl),ft=n(t),C=g(t,"P",{"data-svelte-h":!0}),i(C)!=="svelte-1bt0vyl"&&(C.textContent=Tl),Ot=n(t),s(v.$$.fragment,t),ut=n(t),k=g(t,"P",{"data-svelte-h":!0}),i(k)!=="svelte-nomc2r"&&(k.textContent=gl),Et=n(t),s(M.$$.fragment,t),Rt=n(t),Q=g(t,"P",{"data-svelte-h":!0}),i(Q)!=="svelte-1q0p329"&&(Q.textContent=il),$t=n(t),s(F.$$.fragment,t),At=n(t),h=g(t,"P",{"data-svelte-h":!0}),i(h)!=="svelte-1ly5uel"&&(h.textContent=xl),Dt=n(t),c=g(t,"UL",{"data-svelte-h":!0}),i(c)!=="svelte-167lmxx"&&(c.innerHTML=sl),Lt=n(t),s(y.$$.fragment,t),It=n(t),P=g(t,"P",{"data-svelte-h":!0}),i(P)!=="svelte-r43a8r"&&(P.textContent=rl),Ct=n(t),s(_.$$.fragment,t),vt=n(t),d=g(t,"P",{"data-svelte-h":!0}),i(d)!=="svelte-1kj1u6u"&&(d.textContent=wl),kt=n(t),B=g(t,"UL",{"data-svelte-h":!0}),i(B)!=="svelte-3v85mp"&&(B.innerHTML=ol),Mt=n(t),s(j.$$.fragment,t),Qt=n(t),H=g(t,"P",{"data-svelte-h":!0}),i(H)!=="svelte-1eawp9v"&&(H.innerHTML=pl),Ft=n(t),b=g(t,"UL",{"data-svelte-h":!0}),i(b)!=="svelte-1o99uns"&&(b.innerHTML=al),ht=n(t),s(G.$$.fragment,t),ct=n(t),S=g(t,"P",{"data-svelte-h":!0}),i(S)!=="svelte-15sw0dq"&&(S.textContent=ml),yt=n(t),q=g(t,"UL",{"data-svelte-h":!0}),i(q)!=="svelte-1chctq7"&&(q.innerHTML=fl),Pt=n(t),s(z.$$.fragment,t),_t=n(t),Y=g(t,"P",{"data-svelte-h":!0}),i(Y)!=="svelte-11ow858"&&(Y.textContent=Ol),dt=n(t),N=g(t,"UL",{"data-svelte-h":!0}),i(N)!=="svelte-1kbs00x"&&(N.innerHTML=ul),Bt=n(t),s(K.$$.fragment,t),jt=n(t),V=g(t,"P",{"data-svelte-h":!0}),i(V)!=="svelte-1op6m1i"&&(V.textContent=El),Ht=n(t),Z=g(t,"UL",{"data-svelte-h":!0}),i(Z)!=="svelte-5lpcqo"&&(Z.innerHTML=Rl),bt=n(t),W=g(t,"P",{"data-svelte-h":!0}),i(W)!=="svelte-1vcmvnu"&&(W.textContent=$l),Gt=n(t),f=g(t,"BLOCKQUOTE",{class:!0,"data-svelte-h":!0}),i(f)!=="svelte-1cxk0dw"&&(f.innerHTML=Al),St=n(t),s(X.$$.fragment,t),qt=n(t),tt=g(t,"P",{"data-svelte-h":!0}),i(tt)!=="svelte-1vrw4yh"&&(tt.innerHTML=Dl),zt=n(t),lt=g(t,"P",{"data-svelte-h":!0}),i(lt)!=="svelte-10pyge2"&&(lt.textContent=Ll),Yt=n(t),s(et.$$.fragment,t),Nt=n(t),Jt=g(t,"UL",{"data-svelte-h":!0}),i(Jt)!=="svelte-tfnjnd"&&(Jt.innerHTML=Il),Kt=n(t),s(Ut.$$.fragment,t),Vt=n(t),Tt=g(t,"P",{}),Cl(Tt).forEach(e),this.h()},h(){Wt(m,"name","hf:doc:metadata"),Wt(m,"content",Bl),Wt(f,"class","tip")},m(t,l){yl(document.head,m),J(t,gt,l),J(t,nt,l),J(t,it,l),r(O,t,l),J(t,xt,l),r(u,t,l),J(t,st,l),J(t,E,l),J(t,rt,l),J(t,R,l),J(t,wt,l),r($,t,l),J(t,ot,l),J(t,A,l),J(t,pt,l),J(t,D,l),J(t,at,l),J(t,L,l),J(t,mt,l),J(t,I,l),J(t,ft,l),J(t,C,l),J(t,Ot,l),r(v,t,l),J(t,ut,l),J(t,k,l),J(t,Et,l),r(M,t,l),J(t,Rt,l),J(t,Q,l),J(t,$t,l),r(F,t,l),J(t,At,l),J(t,h,l),J(t,Dt,l),J(t,c,l),J(t,Lt,l),r(y,t,l),J(t,It,l),J(t,P,l),J(t,Ct,l),r(_,t,l),J(t,vt,l),J(t,d,l),J(t,kt,l),J(t,B,l),J(t,Mt,l),r(j,t,l),J(t,Qt,l),J(t,H,l),J(t,Ft,l),J(t,b,l),J(t,ht,l),r(G,t,l),J(t,ct,l),J(t,S,l),J(t,yt,l),J(t,q,l),J(t,Pt,l),r(z,t,l),J(t,_t,l),J(t,Y,l),J(t,dt,l),J(t,N,l),J(t,Bt,l),r(K,t,l),J(t,jt,l),J(t,V,l),J(t,Ht,l),J(t,Z,l),J(t,bt,l),J(t,W,l),J(t,Gt,l),J(t,f,l),J(t,St,l),r(X,t,l),J(t,qt,l),J(t,tt,l),J(t,zt,l),J(t,lt,l),J(t,Yt,l),r(et,t,l),J(t,Nt,l),J(t,Jt,l),J(t,Kt,l),r(Ut,t,l),J(t,Vt,l),J(t,Tt,l),Zt=!0},p:Ml,i(t){Zt||(w(O.$$.fragment,t),w(u.$$.fragment,t),w($.$$.fragment,t),w(v.$$.fragment,t),w(M.$$.fragment,t),w(F.$$.fragment,t),w(y.$$.fragment,t),w(_.$$.fragment,t),w(j.$$.fragment,t),w(G.$$.fragment,t),w(z.$$.fragment,t),w(K.$$.fragment,t),w(X.$$.fragment,t),w(et.$$.fragment,t),w(Ut.$$.fragment,t),Zt=!0)},o(t){o(O.$$.fragment,t),o(u.$$.fragment,t),o($.$$.fragment,t),o(v.$$.fragment,t),o(M.$$.fragment,t),o(F.$$.fragment,t),o(y.$$.fragment,t),o(_.$$.fragment,t),o(j.$$.fragment,t),o(G.$$.fragment,t),o(z.$$.fragment,t),o(K.$$.fragment,t),o(X.$$.fragment,t),o(et.$$.fragment,t),o(Ut.$$.fragment,t),Zt=!1},d(t){t&&(e(gt),e(nt),e(it),e(xt),e(st),e(E),e(rt),e(R),e(wt),e(ot),e(A),e(pt),e(D),e(at),e(L),e(mt),e(I),e(ft),e(C),e(Ot),e(ut),e(k),e(Et),e(Rt),e(Q),e($t),e(At),e(h),e(Dt),e(c),e(Lt),e(It),e(P),e(Ct),e(vt),e(d),e(kt),e(B),e(Mt),e(Qt),e(H),e(Ft),e(b),e(ht),e(ct),e(S),e(yt),e(q),e(Pt),e(_t),e(Y),e(dt),e(N),e(Bt),e(jt),e(V),e(Ht),e(Z),e(bt),e(W),e(Gt),e(f),e(St),e(qt),e(tt),e(zt),e(lt),e(Yt),e(Nt),e(Jt),e(Kt),e(Vt),e(Tt)),e(m),p(O,t),p(u,t),p($,t),p(v,t),p(M,t),p(F,t),p(y,t),p(_,t),p(j,t),p(G,t),p(z,t),p(K,t),p(X,t),p(et,t),p(Ut,t)}}}const Bl='{"title":"ကျောင်းသားများအတွက် Open R1","local":"ကငသမအတက-open-r1","sections":[{"title":"ဘာတွေ သင်ယူရမလဲ","local":"ဘတ-သငယရမလ","sections":[],"depth":2},{"title":"ဒါက ကျောင်းသားများအတွက် ဘာကြောင့် အရေးကြီးတာလဲ","local":"ဒက-ကငသမအတက-ဘကင-အရကတလ","sections":[],"depth":2},{"title":"အခန်း၏ အကျဉ်းချုပ်","local":"အခန-အကဉခပ","sections":[{"title":"၁။ Reinforcement Learning နိဒါန်းနှင့် LLMs များတွင် ၎င်း၏ အခန်းကဏ္ဍ","local":"၁-reinforcement-learning-နဒနနင-llms-မတင-င-အခနကဏဍ","sections":[],"depth":3},{"title":"၂။ DeepSeek R1 Paper ကို နားလည်ခြင်း","local":"၂-deepseek-r1-paper-က-နလညခင","sections":[],"depth":3},{"title":"၃။ TRL တွင် GRPO ကို အကောင်အထည်ဖော်ခြင်း","local":"၃-trl-တင-grpo-က-အကငအထညဖခင","sections":[],"depth":3},{"title":"၄။ Model တစ်ခုကို ချိန်ညှိရန် လက်တွေ့အသုံးချမှု","local":"၄-model-တစခက-ခနညရန-လကတအသခမ","sections":[],"depth":3}],"depth":2},{"title":"ကြိုတင်လိုအပ်ချက်များ","local":"ကတငလအပခကမ","sections":[],"depth":2},{"title":"ဒီအခန်းကို ဘယ်လိုအသုံးပြုမလဲ","local":"ဒအခနက-ဘယလအသပမလ","sections":[],"depth":2},{"title":"ဝေါဟာရ ရှင်းလင်းချက် (Glossary)","local":"ဝဟရ-ရငလငခက-glossary","sections":[],"depth":2}],"depth":1}';function jl(Xt){return Ql(()=>{new URLSearchParams(window.location.search).get("fw")}),[]}class ql extends Fl{constructor(m){super(),hl(this,m,jl,dl,kl,{})}}export{ql as component}; | |
Xet Storage Details
- Size:
- 36.8 kB
- Xet hash:
- 93b7cc025971579a5f788a4143353e7fbd32870712c3ea059bbecbb930bd3a1a
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.