Buckets:

rtrm's picture
download
raw
36.8 kB
import{s as kl,n as Ml,o as Ql}from"../chunks/scheduler.893fe8c9.js";import{S as Fl,i as hl,e as T,s as U,c as x,h as cl,a as g,d as e,b as n,f as Cl,g as s,j as i,k as Wt,l as yl,m as J,n as r,t as w,o,p}from"../chunks/index.b1df2166.js";import{C as Pl,H as a,E as _l}from"../chunks/MermaidChart.svelte_svelte_type_style_lang.9e292c4c.js";import{C as vl}from"../chunks/CodeBlock.445dce01.js";function dl(Xt){let m,gt,nt,it,O,xt,u,st,E,tl="Reinforcement Learning နဲ့ open-source AI ကမ္ဘာဆီ စိတ်လှုပ်ရှားဖွယ်ခရီးစဉ်ကို ကြိုဆိုပါတယ်။ ဒီအခန်းကို ကျောင်းသားတွေ Reinforcement Learning နဲ့ LLMs တွေမှာ သူ့ရဲ့အခန်းကဏ္ဍကို နားလည်စေဖို့ ရည်ရွယ်ပြီး ရေးသားထားတာပါ။",rt,R,ll='ဒီ AI နယ်ပယ်မှာ တိုးတက်မှုအသစ်တွေ ဖော်ဆောင်ပေးမယ့် <a href="https://github.com/huggingface/open-r1" rel="nofollow">Open R1</a> ဆိုတဲ့ အံသြဖွယ် community project အကြောင်းကိုလည်း ကျွန်တော်တို့ လေ့လာသွားပါမယ်။ အထူးသဖြင့်၊ ဒီသင်တန်းက ကျောင်းသားတွေနဲ့ သင်ယူသူတွေ <a href="https://github.com/huggingface/open-r1" rel="nofollow">Open R1</a> ကို အသုံးပြုနိုင်ပြီး ပံ့ပိုးကူညီနိုင်စေဖို့ ရည်ရွယ်ပါတယ်။',wt,$,ot,A,el="ဒီအခန်းမှာ၊ ရှုပ်ထွေးတဲ့ အယူအဆတွေကို နားလည်လွယ်တဲ့အပိုင်းတွေအဖြစ် ခွဲခြမ်းစိတ်ဖြာပြီး LLMs တွေကို ရှုပ်ထွေးတဲ့ ပြဿနာတွေမှာ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်စေဖို့ ဒီစိတ်လှုပ်ရှားဖွယ် project မှာ ဘယ်လိုပါဝင်နိုင်မလဲဆိုတာ ပြသပေးသွားမှာပါ။",pt,D,Jl="LLMs တွေဟာ generative tasks အများအပြားမှာ အလွန်ကောင်းမွန်တဲ့ စွမ်းဆောင်ရည်ကို ပြသထားပါတယ်။ ဒါပေမယ့် မကြာသေးမီကအထိ သူတို့ဟာ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်မှုများစွာ လိုအပ်တဲ့ ရှုပ်ထွေးတဲ့ ပြဿနာတွေမှာ အခက်အခဲတွေ ရှိခဲ့ပါတယ်။ ဥပမာ၊ ပဟေဠိတွေ ဒါမှမဟုတ် multiple steps of reasoning တွေ လိုအပ်တဲ့ သင်္ချာပြဿနာတွေကို ဖြေရှင်းရာမှာ အခက်အခဲ ရှိခဲ့ပါတယ်။",at,L,Ul="Open R1 က LLMs တွေကို ရှုပ်ထွေးတဲ့ ပြဿနာတွေမှာ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်နိုင်စေဖို့ ရည်ရွယ်တဲ့ project တစ်ခုပါ။ Reinforcement Learning ကို အသုံးပြုပြီး LLMs တွေကို “စဉ်းစား” စေဖို့နဲ့ ဆင်ခြင်တုံတရားနဲ့ တွေးခေါ်စေဖို့ အားပေးခြင်းဖြင့် ဒါကို လုပ်ဆောင်ပါတယ်။",mt,I,nl="ရိုးရှင်းစွာပြောရရင်၊ model ကို အတွေးတွေနဲ့ output တွေ နှစ်ခုလုံးကို ထုတ်ပေးဖို့ လေ့ကျင့်ထားပြီး၊ အဲဒီအတွေးတွေနဲ့ output တွေကို သုံးစွဲသူက သီးခြားစီ ကိုင်တွယ်နိုင်အောင် စနစ်တကျ ဖွဲ့စည်းထားပါတယ်။",ft,C,Tl="ဥပမာတစ်ခု ကြည့်ရအောင်။ ကျွန်တော်တို့ကိုယ်တိုင် အောက်ပါပြဿနာကို ဖြေရှင်းဖို့ တာဝန်ပေးထားတယ်ဆိုရင်၊ ကျွန်တော်တို့ ဒီလိုစဉ်းစားမိနိုင်ပါတယ်။",Ot,v,ut,k,gl="အဲဒီနောက် ဒီအတွေးနဲ့ အဖြေကို သုံးစွဲသူက သီးခြားစီ ကိုင်တွယ်နိုင်အောင် စနစ်တကျ ဖွဲ့စည်းနိုင်ပါတယ်။ reasoning tasks တွေအတွက်၊ LLMs တွေကို အောက်ပါ format နဲ့ အတွေးတွေနဲ့ အဖြေတွေကို ထုတ်ပေးဖို့ လေ့ကျင့်နိုင်ပါတယ်။",Et,M,Rt,Q,il="သုံးစွဲသူတစ်ဦးအနေနဲ့၊ model ရဲ့ output ကနေ အတွေးနဲ့ အဖြေကို ထုတ်ယူပြီး ပြဿနာကို ဖြေရှင်းဖို့ အသုံးပြုနိုင်ပါတယ်။",$t,F,At,h,xl="ကျောင်းသားတစ်ဦးအနေနဲ့၊ Open R1 နဲ့ Reinforcement Learning ရဲ့ LLMs တွေမှာရှိတဲ့ အခန်းကဏ္ဍကို နားလည်ထားတာက အရေးကြီးပါတယ်၊ ဘာလို့လဲဆိုတော့…",Dt,c,sl="<li>ခေတ်မီဆန်းသစ်တဲ့ AI ကို ဘယ်လို ဖန်တီးတီထွင်လဲဆိုတာ သင့်ကို ပြသပေးလို့ပါ။</li> <li>လက်တွေ့လုပ်ဆောင်နိုင်တဲ့ သင်ယူမှုအခွင့်အလမ်းတွေနဲ့ ပံ့ပိုးကူညီခွင့်တွေ ပေးလို့ပါ။</li> <li>AI နည်းပညာက ဘယ်ကို ဦးတည်နေလဲဆိုတာကို နားလည်ဖို့ ကူညီပေးလို့ပါ။</li> <li>AI နယ်ပယ်မှာ အနာဂတ်အလုပ်အကိုင် အခွင့်အလမ်းတွေကို ဖွင့်ပေးလို့ပါ။</li>",Lt,y,It,P,rl="ဒီအခန်းကို အပိုင်းလေးပိုင်း ခွဲခြားထားပြီး တစ်ခုစီက Open R1 ရဲ့ မတူညီတဲ့ ကဏ္ဍတစ်ခုစီကို အာရုံစိုက်ထားပါတယ်။",Ct,_,vt,d,wl="Reinforcement Learning (RL) ရဲ့ အခြေခံများနဲ့ LLMs များကို လေ့ကျင့်ရာတွင် သူ့ရဲ့အခန်းကဏ္ဍကို ကျွန်တော်တို့ လေ့လာသွားပါမယ်။",kt,B,ol="<li>RL ဆိုတာဘာလဲ။</li> <li>LLMs တွေမှာ RL ကို ဘယ်လိုအသုံးပြုလဲ။</li> <li>DeepSeek R1 ဆိုတာဘာလဲ။</li> <li>DeepSeek R1 ရဲ့ အဓိက ဆန်းသစ်တီထွင်မှုတွေက ဘာတွေလဲ။</li>",Mt,j,Qt,H,pl='<a href="https://huggingface.co/open-r1" rel="nofollow">Open R1</a> ကို လှုံ့ဆော်ပေးခဲ့တဲ့ သုတေသနစာတမ်းကို ကျွန်တော်တို့ ခွဲခြမ်းစိတ်ဖြာသွားပါမယ်။',Ft,b,al="<li>အဓိက ဆန်းသစ်တီထွင်မှုများနှင့် ထူးခြားအောင်မြင်မှုများ</li> <li>Training လုပ်ငန်းစဉ်နှင့် Architecture</li> <li>ရလဒ်များနှင့် ၎င်းတို့၏ အရေးပါမှု</li>",ht,G,ct,S,ml="code ဥပမာတွေနဲ့ လက်တွေ့ကျကျ လုပ်ဆောင်သွားပါမယ်။",yt,q,fl="<li>Transformer Reinforcement Learning (TRL) library ကို ဘယ်လိုအသုံးပြုရမလဲ။</li> <li>GRPO training ကို ဘယ်လိုတည်ဆောက်ရမလဲ။</li>",Pt,z,_t,Y,Ol="Open R1 ကို အသုံးပြုပြီး model တစ်ခုကို ချိန်ညှိဖို့ လက်တွေ့အသုံးချမှုတစ်ခုကို ကျွန်တော်တို့ ကြည့်ရှုပါမယ်။",dt,N,ul='<li>TRL မှာ GRPO ကို အသုံးပြုပြီး model တစ်ခုကို ဘယ်လို train လုပ်ရမလဲ။</li> <li>သင်၏ model ကို <a href="https://huggingface.co/models" rel="nofollow">Hugging Face Hub</a> မှာ မျှဝေပါ။</li>',Bt,K,jt,V,El="ဒီအခန်းကနေ အကျိုးအများဆုံးရရှိဖို့အတွက် အောက်ပါအချက်တွေ ရှိထားရင် အကူအညီဖြစ်ပါလိမ့်မယ်။",Ht,Z,Rl="<li>Python programming ကို ကောင်းကောင်းနားလည်ထားဖို့။</li> <li>machine learning concepts တွေနဲ့ ရင်းနှီးဖို့။</li> <li>AI နဲ့ language models တွေအပေါ် စိတ်ဝင်စားမှုရှိဖို့။</li>",bt,W,$l="ဒါတွေထဲက အချို့ လိုအပ်နေရင်လည်း စိတ်မပူပါနဲ့ — ကျွန်တော်တို့ ဆက်လက်လုပ်ဆောင်ရင်း အဓိက အယူအဆတွေကို ရှင်းပြသွားမှာပါ။ 🚀",Gt,f,Al='<p>သင့်မှာ ကြိုတင်လိုအပ်ချက်တွေ အားလုံး မရှိဘူးဆိုရင်၊ <a href="/course/chapter1/1">သင်တန်း</a> ရဲ့ အခန်း ၁ ကနေ ၁၁ အထိကို လေ့လာကြည့်ပါ။</p>',St,X,qt,tt,Dl=`၁။ <strong>အစီအစဉ်အတိုင်း ဖတ်ရှုပါ</strong>: အပိုင်းတွေဟာ တစ်ခုနဲ့တစ်ခု ဆက်စပ်နေတာမို့ အစီအစဉ်အတိုင်း ဖတ်ရှုတာ အကောင်းဆုံးပါပဲ။
၂။ <strong>မှတ်စုများ မျှဝေပါ</strong>: အဓိက အယူအဆတွေနဲ့ မေးခွန်းတွေကို ရေးမှတ်ပြီး <a href="https://discord.gg/UrrTSsSyjb" rel="nofollow">Discord</a> မှာ community ထဲက တခြားသူတွေနဲ့ ဆွေးနွေးပါ။
၃။ <strong>Code ကို စမ်းသပ်ပါ</strong>: ကျွန်တော်တို့ လက်တွေ့ဥပမာတွေဆီ ရောက်တဲ့အခါ၊ သင်ကိုယ်တိုင် စမ်းသပ်ကြည့်ပါ။
၄။ <strong>Community မှာ ပါဝင်ပါ</strong>: ကျွန်တော်တို့ ပံ့ပိုးပေးထားတဲ့ အရင်းအမြစ်တွေကို အသုံးပြုပြီး အခြားသင်ယူသူတွေနဲ့ ချိတ်ဆက်ပါ။`,zt,lt,Ll="Open R1 အကြောင်း ကျွန်တော်တို့ရဲ့ လေ့လာမှုကို စတင်ပြီး AI ကို လူတိုင်းလက်လှမ်းမီအောင် လုပ်ဆောင်ရာမှာ သင်ဘယ်လိုပါဝင်နိုင်မလဲဆိုတာ ရှာဖွေကြည့်ကြစို့။ 🚀",Yt,et,Nt,Jt,Il="<li><strong>Reinforcement Learning (RL)</strong>: Agent တစ်ခုသည် environment တစ်ခုအတွင်းမှ အပြန်အလှန်တုံ့ပြန်မှုများ (interactions) မှ သင်ယူပြီး ဆုလာဘ်များ (rewards) ကို အများဆုံးရရှိရန် ရည်ရွယ်သည့် Machine Learning နယ်ပယ်တစ်ခု။</li> <li><strong>Open-source AI</strong>: Source code ကို အများပြည်သူအား လွတ်လပ်စွာ အသုံးပြု၊ ပြင်ဆင်၊ ဖြန့်ဝေခွင့်ပြုထားသော Artificial Intelligence (AI) နည်းပညာ။</li> <li><strong>LLMs (Large Language Models)</strong>: လူသားဘာသာစကားကို နားလည်ပြီး ထုတ်လုပ်ပေးနိုင်တဲ့ အလွန်ကြီးမားတဲ့ Artificial Intelligence (AI) မော်ဒယ်တွေ ဖြစ်ပါတယ်။</li> <li><strong>Open R1</strong>: Hugging Face မှ စတင်ခဲ့သော community project တစ်ခုဖြစ်ပြီး LLMs များကို ရှုပ်ထွေးသော ပြဿနာများတွင် ဆင်ခြင်တုံတရားဖြင့် တွေးခေါ်နိုင်စေရန် ရည်ရွယ်သည်။</li> <li><strong>Generative Tasks</strong>: စာသားအသစ်များ၊ code သို့မဟုတ် အခြားဒေတာပုံစံများကို ဖန်တီးထုတ်လုပ်နိုင်သော အလုပ်များ။</li> <li><strong>Reasoning</strong>: ပြဿနာများကို ဖြေရှင်းရန် သို့မဟုတ် ဆုံးဖြတ်ချက်များချရန်အတွက် အချက်အလက်များကို ခွဲခြမ်းစိတ်ဖြာခြင်းနှင့် အသုံးချခြင်း လုပ်ငန်းစဉ်။</li> <li><strong>Puzzles</strong>: ဖြေရှင်းရန် ဉာဏ်စွမ်းလိုအပ်သော ပြဿနာများ သို့မဟုတ် ဂိမ်းများ။</li> <li><strong>Math Problems</strong>: သင်္ချာဆိုင်ရာ ပြဿနာများ။</li> <li><strong>Multiple Steps of Reasoning</strong>: ပြဿနာတစ်ခုကို ဖြေရှင်းရန်အတွက် ဆင်ခြင်တုံတရားဆိုင်ရာ အဆင့်များစွာကို ဖြတ်သန်းရခြင်း။</li> <li><strong>Agent</strong>: Reinforcement Learning environment တစ်ခုအတွင်း လုပ်ဆောင်ချက်များ (actions) ကို လုပ်ဆောင်သော entity။</li> <li><strong>Environment</strong>: Reinforcement Learning agent သည် အပြန်အလှန်တုံ့ပြန်သော စနစ် သို့မဟုတ် ကမ္ဘာ။</li> <li><strong>Rewards</strong>: Agent ၏ လုပ်ဆောင်ချက်များအပေါ် အခြေခံ၍ environment က ပေးသော တုံ့ပြန်ချက်များ သို့မဟုတ် အမှတ်များ။</li> <li><strong>Thoughts</strong>: LLM မှ ပြဿနာကို ဖြေရှင်းရန်အတွက် ထုတ်လုပ်သော အတွင်းပိုင်း ဆင်ခြင်တုံတရားဆိုင်ရာ အဆင့်များ။</li> <li><strong>Outputs</strong>: LLM မှ ပြဿနာ၏ နောက်ဆုံးအဖြေ သို့မဟုတ် တုံ့ပြန်ချက်။</li> <li><strong>Structure Thoughts and Outputs</strong>: LLM မှ ထုတ်ပေးသော အတွေးများနှင့် အဖြေများကို သီးခြားစီ ခွဲခြားသိမ်းဆည်းနိုင်သော ပုံစံဖြင့် စီစဉ်ခြင်း။</li> <li><strong>Extract</strong>: စာသား သို့မဟုတ် ဒေတာတစ်ခုမှ သီးခြားအစိတ်အပိုင်းများကို ထုတ်ယူခြင်း။</li> <li><strong>Cutting-edge AI</strong>: နောက်ဆုံးပေါ်နှင့် အဆင့်မြင့်ဆုံး Artificial Intelligence နည်းပညာများ။</li> <li><strong>Hands-on Opportunities</strong>: လက်တွေ့ကျကျ လုပ်ဆောင်နိုင်သော အခွင့်အလမ်းများ။</li> <li><strong>AI Technology</strong>: Artificial Intelligence နည်းပညာ။</li> <li><strong>Career Opportunities</strong>: အလုပ်အကိုင် အခွင့်အလမ်းများ။</li> <li><strong>DeepSeek R1</strong>: Open R1 ကို လှုံ့ဆော်ပေးခဲ့သော research paper တွင် ဖော်ပြထားသည့် reasoning model တစ်မျိုး။</li> <li><strong>Innovations</strong>: နည်းပညာ သို့မဟုတ် နည်းလမ်းများတွင် အသစ်အဆန်း ဖန်တီးတီထွင်မှုများ။</li> <li><strong>Breakthroughs</strong>: အရေးကြီးသော တိုးတက်မှုများ သို့မဟုတ် ရှာဖွေတွေ့ရှိမှုများ။</li> <li><strong>Training Process</strong>: Model ကို ဒေတာများဖြင့် လေ့ကျင့်ပေးသည့် လုပ်ငန်းစဉ်။</li> <li><strong>Architecture</strong>: Model တစ်ခု၏ layers များနှင့် ၎င်းတို့ ချိတ်ဆက်ပုံကို ဖော်ပြသော ဒီဇိုင်းဖွဲ့စည်းပုံ။</li> <li><strong>Results</strong>: Model ၏ စွမ်းဆောင်ရည် သို့မဟုတ် လုပ်ဆောင်မှုမှ ရရှိသော အချက်အလက်များ။</li> <li><strong>Significance</strong>: ရလဒ်များ၏ အရေးပါမှု သို့မဟုတ် အဓိပ္ပာယ်။</li> <li><strong>GRPO (Generalized Reinforcement Learning with Policy Optimization)</strong>: Reinforcement Learning algorithm တစ်မျိုး။ DeepSeek R1 တွင် အသုံးပြုထားသည်။</li> <li><strong>TRL (Transformer Reinforcement Learning) Library</strong>: Hugging Face မှ ထုတ်လုပ်ထားသော library တစ်ခုဖြစ်ပြီး Transformer models များနှင့် Reinforcement Learning ကို အသုံးပြုရန် ကူညီပေးသည်။</li> <li><strong>Setting up GRPO Training</strong>: GRPO algorithm ကို အသုံးပြု၍ model training အတွက် စနစ်တကျ ပြင်ဆင်ခြင်း။</li> <li><strong>Align a Model</strong>: Model ၏ output များကို လူသားနှစ်သက်မှုများ သို့မဟုတ် သတ်မှတ်ထားသော ပန်းတိုင်များနှင့် ကိုက်ညီအောင် ချိန်ညှိခြင်း။</li> <li><strong>Python Programming</strong>: Python programming language ဖြင့် code ရေးသားခြင်း။</li> <li><strong>Machine Learning Concepts</strong>: Machine Learning ၏ အခြေခံသဘောတရားများ။</li> <li><strong>Language Models</strong>: လူသားဘာသာစကား၏ ဖြန့်ဝေမှုကို နားလည်ရန် လေ့ကျင့်ထားသော AI မော်ဒယ်တစ်ခု။</li> <li><strong>Prerequisites</strong>: သင်တန်းတစ်ခုကို သင်ယူရန် သို့မဟုတ် အလုပ်တစ်ခုကို လုပ်ဆောင်ရန်အတွက် လိုအပ်သော ကြိုတင်ဗဟုသုတ သို့မဟုတ် ကျွမ်းကျင်မှုများ။</li> <li><strong>Discord</strong>: အွန်လိုင်း ဆက်သွယ်ပြောဆိုခြင်း platform တစ်ခု။</li> <li><strong>Hugging Face Hub</strong>: AI မော်ဒယ်တွေ၊ datasets တွေနဲ့ demo တွေကို အခြားသူတွေနဲ့ မျှဝေဖို့၊ ရှာဖွေဖို့နဲ့ ပြန်လည်အသုံးပြုဖို့အတွက် အွန်လိုင်း platform တစ်ခု ဖြစ်ပါတယ်။</li>",Kt,Ut,Vt,Tt,Zt;return O=new Pl({props:{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"}}),u=new a({props:{title:"ကျောင်းသားများအတွက် Open R1",local:"ကငသမအတက-open-r1",headingTag:"h1"}}),$=new a({props:{title:"ဘာတွေ သင်ယူရမလဲ",local:"ဘတ-သငယရမလ",headingTag:"h2"}}),v=new vl({props:{code:"JUUxJTgwJTk1JUUxJTgwJUJDJUUxJTgwJUJGJUUxJTgwJTk0JUUxJTgwJUFDJTNBJTIwJTIyJUUxJTgwJTgwJUUxJTgwJUJCJUUxJTgwJUJEJUUxJTgwJTk0JUUxJTgwJUJBJUUxJTgwJTkwJUUxJTgwJUIxJUUxJTgwJUFDJUUxJTgwJUI3JUUxJTgwJUJBJUUxJTgwJTk5JUUxJTgwJUJFJUUxJTgwJUFDJTIwJUUxJTgwJTk1JUUxJTgwJTk0JUUxJTgwJUJBJUUxJTgwJUI4JUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JTIwJUUxJTgxJTgzJTIwJUUxJTgwJTlDJUUxJTgwJUFGJUUxJTgwJUI2JUUxJTgwJUI4JUUxJTgwJTk0JUUxJTgwJUIyJUUxJTgwJUI3JTIwJUUxJTgwJTlDJUUxJTgwJUFEJUUxJTgwJTk5JUUxJTgwJUI5JUUxJTgwJTk5JUUxJTgwJUIxJUUxJTgwJUFDJUUxJTgwJUJBJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JTIwJUUxJTgxJTgyJTIwJUUxJTgwJTlDJUUxJTgwJUFGJUUxJTgwJUI2JUUxJTgwJUI4JTIwJUUxJTgwJTlCJUUxJTgwJUJFJUUxJTgwJUFEJUUxJTgwJTk1JUUxJTgwJUFCJUUxJTgwJTkwJUUxJTgwJTlBJUUxJTgwJUJBJUUxJTgxJThCJTIwJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTk1JUUxJTgwJUIxJUUxJTgwJUFCJUUxJTgwJTg0JUUxJTgwJUJBJUUxJTgwJUI4JTIwJUUxJTgwJUExJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJTk4JUUxJTgwJTlBJUUxJTgwJUJBJUUxJTgwJTk0JUUxJTgwJUJFJUUxJTgwJTg1JUUxJTgwJUJBJUUxJTgwJTlDJUUxJTgwJUFGJUUxJTgwJUI2JUUxJTgwJUI4JTIwJUUxJTgwJTlCJUUxJTgwJUJFJUUxJTgwJUFEJUUxJTgwJTlFJUUxJTgwJTlDJUUxJTgwJUIyJUUxJTgxJThCJTIyJTBBJTBBJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJUIxJUUxJTgwJUI4JTNBJTIwJTIyJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTg1JUUxJTgwJUFGJUUxJTgwJTk1JUUxJTgwJUIxJUUxJTgwJUFCJUUxJTgwJTg0JUUxJTgwJUJBJUUxJTgwJUI4JTIwJUUxJTgwJUExJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJUExJUUxJTgwJTlCJUUxJTgwJUIxJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJTgwJUUxJTgwJUJBJUUxJTgwJTgwJUUxJTgwJUFEJUUxJTgwJUFGJTIwJUUxJTgwJTlCJUUxJTgwJTk2JUUxJTgwJUFEJUUxJTgwJUFGJUUxJTgwJUI3JTIwJUUxJTgwJTk1JUUxJTgwJTk0JUUxJTgwJUJBJUUxJTgwJUI4JUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJUExJUUxJTgwJTlCJUUxJTgwJUIxJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJTgwJUUxJTgwJUJBJUUxJTgwJTk0JUUxJTgwJUIyJUUxJTgwJUI3JTIwJUUxJTgwJTlDJUUxJTgwJUFEJUUxJTgwJTk5JUUxJTgwJUI5JUUxJTgwJTk5JUUxJTgwJUIxJUUxJTgwJUFDJUUxJTgwJUJBJUUxJTgwJTlFJUUxJTgwJUFFJUUxJTgwJUI4JUUxJTgwJUExJUUxJTgwJTlCJUUxJTgwJUIxJUUxJTgwJUExJUUxJTgwJTkwJUUxJTgwJUJEJUUxJTgwJTgwJUUxJTgwJUJBJUUxJTgwJTgwJUUxJTgwJUFEJUUxJTgwJUFGJTIwJUUxJTgwJTk1JUUxJTgwJUIxJUUxJTgwJUFCJUUxJTgwJTg0JUUxJTgwJUJBJUUxJTgwJUI4JUUxJTgwJTlCJUUxJTgwJTk1JUUxJTgwJUFCJUUxJTgwJTk5JUUxJTgwJTlBJUUxJTgwJUJBJUUxJTgxJThCJTIyJTBBJTBBJUUxJTgwJUExJUUxJTgwJTk2JUUxJTgwJUJDJUUxJTgwJUIxJTNBJTIwJTIyJUUxJTgxJTg1JTIy",highlighted:`ပြဿနာ: <span class="hljs-string">&quot;ကျွန်တော့်မှာ ပန်းသီး ၃ လုံးနဲ့ လိမ္မော်သီး ၂ လုံး ရှိပါတယ်။ စုစုပေါင်း အသီးဘယ်နှစ်လုံး ရှိသလဲ။&quot;</span>
အတွေး: <span class="hljs-string">&quot;စုစုပေါင်း အသီးအရေအတွက်ကို ရဖို့ ပန်းသီးအရေအတွက်နဲ့ လိမ္မော်သီးအရေအတွက်ကို ပေါင်းရပါမယ်။&quot;</span>
အဖြေ: <span class="hljs-string">&quot;၅&quot;</span>`,wrap:!1}}),M=new vl({props:{code:"JTNDdGhpbmslM0UlRTElODAlODUlRTElODAlQUYlRTElODAlODUlRTElODAlQUYlRTElODAlOTUlRTElODAlQjElRTElODAlQUIlRTElODAlODQlRTElODAlQkElRTElODAlQjglMjAlRTElODAlQTElRTElODAlOUUlRTElODAlQUUlRTElODAlQjglRTElODAlQTElRTElODAlOUIlRTElODAlQjElRTElODAlQTElRTElODAlOTAlRTElODAlQkQlRTElODAlODAlRTElODAlQkElRTElODAlODAlRTElODAlQUQlRTElODAlQUYlMjAlRTElODAlOUIlRTElODAlOTYlRTElODAlQUQlRTElODAlQUYlRTElODAlQjclMjAlRTElODAlOTUlRTElODAlOTQlRTElODAlQkElRTElODAlQjglRTElODAlOUUlRTElODAlQUUlRTElODAlQjglRTElODAlQTElRTElODAlOUIlRTElODAlQjElRTElODAlQTElRTElODAlOTAlRTElODAlQkQlRTElODAlODAlRTElODAlQkElRTElODAlOTQlRTElODAlQjIlRTElODAlQjclMjAlRTElODAlOUMlRTElODAlQUQlRTElODAlOTklRTElODAlQjklRTElODAlOTklRTElODAlQjElRTElODAlQUMlRTElODAlQkElRTElODAlOUUlRTElODAlQUUlRTElODAlQjglRTElODAlQTElRTElODAlOUIlRTElODAlQjElRTElODAlQTElRTElODAlOTAlRTElODAlQkQlRTElODAlODAlRTElODAlQkElRTElODAlODAlRTElODAlQUQlRTElODAlQUYlMjAlRTElODAlOTUlRTElODAlQjElRTElODAlQUIlRTElODAlODQlRTElODAlQkElRTElODAlQjglRTElODAlOUIlRTElODAlOTUlRTElODAlQUIlRTElODAlOTklRTElODAlOUElRTElODAlQkElRTElODElOEIlM0MlMkZ0aGluayUzRSUwQSVFMSU4MSU4NQ==",highlighted:`&lt;think&gt;စုစုပေါင်း အသီးအရေအတွက်ကို ရဖို့ ပန်းသီးအရေအတွက်နဲ့ လိမ္မော်သီးအရေအတွက်ကို ပေါင်းရပါမယ်။&lt;/think&gt;
၅`,wrap:!1}}),F=new a({props:{title:"ဒါက ကျောင်းသားများအတွက် ဘာကြောင့် အရေးကြီးတာလဲ",local:"ဒက-ကငသမအတက-ဘကင-အရကတလ",headingTag:"h2"}}),y=new a({props:{title:"အခန်း၏ အကျဉ်းချုပ်",local:"အခန-အကဉခပ",headingTag:"h2"}}),_=new a({props:{title:"၁။ Reinforcement Learning နိဒါန်းနှင့် LLMs များတွင် ၎င်း၏ အခန်းကဏ္ဍ",local:"၁-reinforcement-learning-နဒနနင-llms-မတင-င-အခနကဏဍ",headingTag:"h3"}}),j=new a({props:{title:"၂။ DeepSeek R1 Paper ကို နားလည်ခြင်း",local:"၂-deepseek-r1-paper-က-နလညခင",headingTag:"h3"}}),G=new a({props:{title:"၃။ TRL တွင် GRPO ကို အကောင်အထည်ဖော်ခြင်း",local:"၃-trl-တင-grpo-က-အကငအထညဖခင",headingTag:"h3"}}),z=new a({props:{title:"၄။ Model တစ်ခုကို ချိန်ညှိရန် လက်တွေ့အသုံးချမှု",local:"၄-model-တစခက-ခနညရန-လကတအသခမ",headingTag:"h3"}}),K=new a({props:{title:"ကြိုတင်လိုအပ်ချက်များ",local:"ကတငလအပခကမ",headingTag:"h2"}}),X=new a({props:{title:"ဒီအခန်းကို ဘယ်လိုအသုံးပြုမလဲ",local:"ဒအခနက-ဘယလအသပမလ",headingTag:"h2"}}),et=new a({props:{title:"ဝေါဟာရ ရှင်းလင်းချက် (Glossary)",local:"ဝဟရ-ရငလငခက-glossary",headingTag:"h2"}}),Ut=new _l({props:{source:"https://github.com/huggingface/course/blob/main/chapters/my/chapter12/1.mdx"}}),{c(){m=T("meta"),gt=U(),nt=T("p"),it=U(),x(O.$$.fragment),xt=U(),x(u.$$.fragment),st=U(),E=T("p"),E.textContent=tl,rt=U(),R=T("p"),R.innerHTML=ll,wt=U(),x($.$$.fragment),ot=U(),A=T("p"),A.textContent=el,pt=U(),D=T("p"),D.textContent=Jl,at=U(),L=T("p"),L.textContent=Ul,mt=U(),I=T("p"),I.textContent=nl,ft=U(),C=T("p"),C.textContent=Tl,Ot=U(),x(v.$$.fragment),ut=U(),k=T("p"),k.textContent=gl,Et=U(),x(M.$$.fragment),Rt=U(),Q=T("p"),Q.textContent=il,$t=U(),x(F.$$.fragment),At=U(),h=T("p"),h.textContent=xl,Dt=U(),c=T("ul"),c.innerHTML=sl,Lt=U(),x(y.$$.fragment),It=U(),P=T("p"),P.textContent=rl,Ct=U(),x(_.$$.fragment),vt=U(),d=T("p"),d.textContent=wl,kt=U(),B=T("ul"),B.innerHTML=ol,Mt=U(),x(j.$$.fragment),Qt=U(),H=T("p"),H.innerHTML=pl,Ft=U(),b=T("ul"),b.innerHTML=al,ht=U(),x(G.$$.fragment),ct=U(),S=T("p"),S.textContent=ml,yt=U(),q=T("ul"),q.innerHTML=fl,Pt=U(),x(z.$$.fragment),_t=U(),Y=T("p"),Y.textContent=Ol,dt=U(),N=T("ul"),N.innerHTML=ul,Bt=U(),x(K.$$.fragment),jt=U(),V=T("p"),V.textContent=El,Ht=U(),Z=T("ul"),Z.innerHTML=Rl,bt=U(),W=T("p"),W.textContent=$l,Gt=U(),f=T("blockquote"),f.innerHTML=Al,St=U(),x(X.$$.fragment),qt=U(),tt=T("p"),tt.innerHTML=Dl,zt=U(),lt=T("p"),lt.textContent=Ll,Yt=U(),x(et.$$.fragment),Nt=U(),Jt=T("ul"),Jt.innerHTML=Il,Kt=U(),x(Ut.$$.fragment),Vt=U(),Tt=T("p"),this.h()},l(t){const l=cl("svelte-u9bgzb",document.head);m=g(l,"META",{name:!0,content:!0}),l.forEach(e),gt=n(t),nt=g(t,"P",{}),Cl(nt).forEach(e),it=n(t),s(O.$$.fragment,t),xt=n(t),s(u.$$.fragment,t),st=n(t),E=g(t,"P",{"data-svelte-h":!0}),i(E)!=="svelte-euqlcl"&&(E.textContent=tl),rt=n(t),R=g(t,"P",{"data-svelte-h":!0}),i(R)!=="svelte-1ws0z2x"&&(R.innerHTML=ll),wt=n(t),s($.$$.fragment,t),ot=n(t),A=g(t,"P",{"data-svelte-h":!0}),i(A)!=="svelte-1d3bq8f"&&(A.textContent=el),pt=n(t),D=g(t,"P",{"data-svelte-h":!0}),i(D)!=="svelte-6flr4m"&&(D.textContent=Jl),at=n(t),L=g(t,"P",{"data-svelte-h":!0}),i(L)!=="svelte-15py4um"&&(L.textContent=Ul),mt=n(t),I=g(t,"P",{"data-svelte-h":!0}),i(I)!=="svelte-i7yex9"&&(I.textContent=nl),ft=n(t),C=g(t,"P",{"data-svelte-h":!0}),i(C)!=="svelte-1bt0vyl"&&(C.textContent=Tl),Ot=n(t),s(v.$$.fragment,t),ut=n(t),k=g(t,"P",{"data-svelte-h":!0}),i(k)!=="svelte-nomc2r"&&(k.textContent=gl),Et=n(t),s(M.$$.fragment,t),Rt=n(t),Q=g(t,"P",{"data-svelte-h":!0}),i(Q)!=="svelte-1q0p329"&&(Q.textContent=il),$t=n(t),s(F.$$.fragment,t),At=n(t),h=g(t,"P",{"data-svelte-h":!0}),i(h)!=="svelte-1ly5uel"&&(h.textContent=xl),Dt=n(t),c=g(t,"UL",{"data-svelte-h":!0}),i(c)!=="svelte-167lmxx"&&(c.innerHTML=sl),Lt=n(t),s(y.$$.fragment,t),It=n(t),P=g(t,"P",{"data-svelte-h":!0}),i(P)!=="svelte-r43a8r"&&(P.textContent=rl),Ct=n(t),s(_.$$.fragment,t),vt=n(t),d=g(t,"P",{"data-svelte-h":!0}),i(d)!=="svelte-1kj1u6u"&&(d.textContent=wl),kt=n(t),B=g(t,"UL",{"data-svelte-h":!0}),i(B)!=="svelte-3v85mp"&&(B.innerHTML=ol),Mt=n(t),s(j.$$.fragment,t),Qt=n(t),H=g(t,"P",{"data-svelte-h":!0}),i(H)!=="svelte-1eawp9v"&&(H.innerHTML=pl),Ft=n(t),b=g(t,"UL",{"data-svelte-h":!0}),i(b)!=="svelte-1o99uns"&&(b.innerHTML=al),ht=n(t),s(G.$$.fragment,t),ct=n(t),S=g(t,"P",{"data-svelte-h":!0}),i(S)!=="svelte-15sw0dq"&&(S.textContent=ml),yt=n(t),q=g(t,"UL",{"data-svelte-h":!0}),i(q)!=="svelte-1chctq7"&&(q.innerHTML=fl),Pt=n(t),s(z.$$.fragment,t),_t=n(t),Y=g(t,"P",{"data-svelte-h":!0}),i(Y)!=="svelte-11ow858"&&(Y.textContent=Ol),dt=n(t),N=g(t,"UL",{"data-svelte-h":!0}),i(N)!=="svelte-1kbs00x"&&(N.innerHTML=ul),Bt=n(t),s(K.$$.fragment,t),jt=n(t),V=g(t,"P",{"data-svelte-h":!0}),i(V)!=="svelte-1op6m1i"&&(V.textContent=El),Ht=n(t),Z=g(t,"UL",{"data-svelte-h":!0}),i(Z)!=="svelte-5lpcqo"&&(Z.innerHTML=Rl),bt=n(t),W=g(t,"P",{"data-svelte-h":!0}),i(W)!=="svelte-1vcmvnu"&&(W.textContent=$l),Gt=n(t),f=g(t,"BLOCKQUOTE",{class:!0,"data-svelte-h":!0}),i(f)!=="svelte-1cxk0dw"&&(f.innerHTML=Al),St=n(t),s(X.$$.fragment,t),qt=n(t),tt=g(t,"P",{"data-svelte-h":!0}),i(tt)!=="svelte-1vrw4yh"&&(tt.innerHTML=Dl),zt=n(t),lt=g(t,"P",{"data-svelte-h":!0}),i(lt)!=="svelte-10pyge2"&&(lt.textContent=Ll),Yt=n(t),s(et.$$.fragment,t),Nt=n(t),Jt=g(t,"UL",{"data-svelte-h":!0}),i(Jt)!=="svelte-tfnjnd"&&(Jt.innerHTML=Il),Kt=n(t),s(Ut.$$.fragment,t),Vt=n(t),Tt=g(t,"P",{}),Cl(Tt).forEach(e),this.h()},h(){Wt(m,"name","hf:doc:metadata"),Wt(m,"content",Bl),Wt(f,"class","tip")},m(t,l){yl(document.head,m),J(t,gt,l),J(t,nt,l),J(t,it,l),r(O,t,l),J(t,xt,l),r(u,t,l),J(t,st,l),J(t,E,l),J(t,rt,l),J(t,R,l),J(t,wt,l),r($,t,l),J(t,ot,l),J(t,A,l),J(t,pt,l),J(t,D,l),J(t,at,l),J(t,L,l),J(t,mt,l),J(t,I,l),J(t,ft,l),J(t,C,l),J(t,Ot,l),r(v,t,l),J(t,ut,l),J(t,k,l),J(t,Et,l),r(M,t,l),J(t,Rt,l),J(t,Q,l),J(t,$t,l),r(F,t,l),J(t,At,l),J(t,h,l),J(t,Dt,l),J(t,c,l),J(t,Lt,l),r(y,t,l),J(t,It,l),J(t,P,l),J(t,Ct,l),r(_,t,l),J(t,vt,l),J(t,d,l),J(t,kt,l),J(t,B,l),J(t,Mt,l),r(j,t,l),J(t,Qt,l),J(t,H,l),J(t,Ft,l),J(t,b,l),J(t,ht,l),r(G,t,l),J(t,ct,l),J(t,S,l),J(t,yt,l),J(t,q,l),J(t,Pt,l),r(z,t,l),J(t,_t,l),J(t,Y,l),J(t,dt,l),J(t,N,l),J(t,Bt,l),r(K,t,l),J(t,jt,l),J(t,V,l),J(t,Ht,l),J(t,Z,l),J(t,bt,l),J(t,W,l),J(t,Gt,l),J(t,f,l),J(t,St,l),r(X,t,l),J(t,qt,l),J(t,tt,l),J(t,zt,l),J(t,lt,l),J(t,Yt,l),r(et,t,l),J(t,Nt,l),J(t,Jt,l),J(t,Kt,l),r(Ut,t,l),J(t,Vt,l),J(t,Tt,l),Zt=!0},p:Ml,i(t){Zt||(w(O.$$.fragment,t),w(u.$$.fragment,t),w($.$$.fragment,t),w(v.$$.fragment,t),w(M.$$.fragment,t),w(F.$$.fragment,t),w(y.$$.fragment,t),w(_.$$.fragment,t),w(j.$$.fragment,t),w(G.$$.fragment,t),w(z.$$.fragment,t),w(K.$$.fragment,t),w(X.$$.fragment,t),w(et.$$.fragment,t),w(Ut.$$.fragment,t),Zt=!0)},o(t){o(O.$$.fragment,t),o(u.$$.fragment,t),o($.$$.fragment,t),o(v.$$.fragment,t),o(M.$$.fragment,t),o(F.$$.fragment,t),o(y.$$.fragment,t),o(_.$$.fragment,t),o(j.$$.fragment,t),o(G.$$.fragment,t),o(z.$$.fragment,t),o(K.$$.fragment,t),o(X.$$.fragment,t),o(et.$$.fragment,t),o(Ut.$$.fragment,t),Zt=!1},d(t){t&&(e(gt),e(nt),e(it),e(xt),e(st),e(E),e(rt),e(R),e(wt),e(ot),e(A),e(pt),e(D),e(at),e(L),e(mt),e(I),e(ft),e(C),e(Ot),e(ut),e(k),e(Et),e(Rt),e(Q),e($t),e(At),e(h),e(Dt),e(c),e(Lt),e(It),e(P),e(Ct),e(vt),e(d),e(kt),e(B),e(Mt),e(Qt),e(H),e(Ft),e(b),e(ht),e(ct),e(S),e(yt),e(q),e(Pt),e(_t),e(Y),e(dt),e(N),e(Bt),e(jt),e(V),e(Ht),e(Z),e(bt),e(W),e(Gt),e(f),e(St),e(qt),e(tt),e(zt),e(lt),e(Yt),e(Nt),e(Jt),e(Kt),e(Vt),e(Tt)),e(m),p(O,t),p(u,t),p($,t),p(v,t),p(M,t),p(F,t),p(y,t),p(_,t),p(j,t),p(G,t),p(z,t),p(K,t),p(X,t),p(et,t),p(Ut,t)}}}const Bl='{"title":"ကျောင်းသားများအတွက် Open R1","local":"ကငသမအတက-open-r1","sections":[{"title":"ဘာတွေ သင်ယူရမလဲ","local":"ဘတ-သငယရမလ","sections":[],"depth":2},{"title":"ဒါက ကျောင်းသားများအတွက် ဘာကြောင့် အရေးကြီးတာလဲ","local":"ဒက-ကငသမအတက-ဘကင-အရကတလ","sections":[],"depth":2},{"title":"အခန်း၏ အကျဉ်းချုပ်","local":"အခန-အကဉခပ","sections":[{"title":"၁။ Reinforcement Learning နိဒါန်းနှင့် LLMs များတွင် ၎င်း၏ အခန်းကဏ္ဍ","local":"၁-reinforcement-learning-နဒနနင-llms-မတင-င-အခနကဏဍ","sections":[],"depth":3},{"title":"၂။ DeepSeek R1 Paper ကို နားလည်ခြင်း","local":"၂-deepseek-r1-paper-က-နလညခင","sections":[],"depth":3},{"title":"၃။ TRL တွင် GRPO ကို အကောင်အထည်ဖော်ခြင်း","local":"၃-trl-တင-grpo-က-အကငအထညဖခင","sections":[],"depth":3},{"title":"၄။ Model တစ်ခုကို ချိန်ညှိရန် လက်တွေ့အသုံးချမှု","local":"၄-model-တစခက-ခနညရန-လကတအသခမ","sections":[],"depth":3}],"depth":2},{"title":"ကြိုတင်လိုအပ်ချက်များ","local":"ကတငလအပခကမ","sections":[],"depth":2},{"title":"ဒီအခန်းကို ဘယ်လိုအသုံးပြုမလဲ","local":"ဒအခနက-ဘယလအသပမလ","sections":[],"depth":2},{"title":"ဝေါဟာရ ရှင်းလင်းချက် (Glossary)","local":"ဝဟရ-ရငလငခက-glossary","sections":[],"depth":2}],"depth":1}';function jl(Xt){return Ql(()=>{new URLSearchParams(window.location.search).get("fw")}),[]}class ql extends Fl{constructor(m){super(),hl(this,m,jl,dl,kl,{})}}export{ql as component};

Xet Storage Details

Size:
36.8 kB
·
Xet hash:
93b7cc025971579a5f788a4143353e7fbd32870712c3ea059bbecbb930bd3a1a

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.