Buckets:

rtrm's picture
download
raw
47.9 kB
<meta charset="utf-8" /><meta name="hf:doc:metadata" content="{&quot;title&quot;:&quot;强化学习简介及其在大语言模型中的作用&quot;,&quot;local&quot;:&quot;强化学习简介及其在大语言模型中的作用&quot;,&quot;sections&quot;:[{&quot;title&quot;:&quot;什么是强化学习(RL)?&quot;,&quot;local&quot;:&quot;什么是强化学习rl&quot;,&quot;sections&quot;:[{&quot;title&quot;:&quot;智能体&quot;,&quot;local&quot;:&quot;智能体&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;环境&quot;,&quot;local&quot;:&quot;环境&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;动作&quot;,&quot;local&quot;:&quot;动作&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;奖励&quot;,&quot;local&quot;:&quot;奖励&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;策略&quot;,&quot;local&quot;:&quot;策略&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3}],&quot;depth&quot;:2},{&quot;title&quot;:&quot;强化学习的过程:试错法&quot;,&quot;local&quot;:&quot;强化学习的过程试错法&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;强化学习在大语言模型(LLMs)中的作用&quot;,&quot;local&quot;:&quot;强化学习在大语言模型llms中的作用&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;基于人类反馈的强化学习(RLHF)&quot;,&quot;local&quot;:&quot;基于人类反馈的强化学习rlhf&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;为什么我们关注GRPO(群体相对策略优化)?&quot;,&quot;local&quot;:&quot;为什么我们关注grpo群体相对策略优化&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;章末小测试&quot;,&quot;local&quot;:&quot;章末小测试&quot;,&quot;sections&quot;:[{&quot;title&quot;:&quot;1. 强化学习的核心组成部分有哪些?&quot;,&quot;local&quot;:&quot;1-强化学习的核心组成部分有哪些&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;2. 什么是使用RLHF训练语言模型的主要优势?&quot;,&quot;local&quot;:&quot;2-什么是使用rlhf训练语言模型的主要优势&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;3. 在大语言模型的语境下,强化学习中的“行动“是指什么?&quot;,&quot;local&quot;:&quot;3-在大语言模型的语境下强化学习中的行动是指什么&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;4. 在使用强化学习训练语言模型时,奖励的作用是什么?&quot;,&quot;local&quot;:&quot;4-在使用强化学习训练语言模型时奖励的作用是什么&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;5. 在大语言模型的语境下,强化学习中的“奖励”是指什么?&quot;,&quot;local&quot;:&quot;5-在大语言模型的语境下强化学习中的奖励是指什么&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3}],&quot;depth&quot;:2}],&quot;depth&quot;:1}">
<link href="/docs/course/pr_1213/zh-CN/_app/immutable/assets/0.e3b0c442.css" rel="modulepreload">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/entry/start.e9a4ad0c.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/scheduler.893fe8c9.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/singletons.7c7a7de8.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/index.bce52c8a.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/paths.59f00eb6.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/entry/app.a615bcac.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/preload-helper.00a0cfc8.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/index.2d09ebb4.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/nodes/0.d5282dd8.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/each.e59479a4.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/nodes/14.3631f675.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/MermaidChart.svelte_svelte_type_style_lang.fcdcb9db.js">
<link rel="modulepreload" href="/docs/course/pr_1213/zh-CN/_app/immutable/chunks/Question.6e77d2db.js"><!-- HEAD_svelte-u9bgzb_START --><meta name="hf:doc:metadata" content="{&quot;title&quot;:&quot;强化学习简介及其在大语言模型中的作用&quot;,&quot;local&quot;:&quot;强化学习简介及其在大语言模型中的作用&quot;,&quot;sections&quot;:[{&quot;title&quot;:&quot;什么是强化学习(RL)?&quot;,&quot;local&quot;:&quot;什么是强化学习rl&quot;,&quot;sections&quot;:[{&quot;title&quot;:&quot;智能体&quot;,&quot;local&quot;:&quot;智能体&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;环境&quot;,&quot;local&quot;:&quot;环境&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;动作&quot;,&quot;local&quot;:&quot;动作&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;奖励&quot;,&quot;local&quot;:&quot;奖励&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;策略&quot;,&quot;local&quot;:&quot;策略&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3}],&quot;depth&quot;:2},{&quot;title&quot;:&quot;强化学习的过程:试错法&quot;,&quot;local&quot;:&quot;强化学习的过程试错法&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;强化学习在大语言模型(LLMs)中的作用&quot;,&quot;local&quot;:&quot;强化学习在大语言模型llms中的作用&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;基于人类反馈的强化学习(RLHF)&quot;,&quot;local&quot;:&quot;基于人类反馈的强化学习rlhf&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;为什么我们关注GRPO(群体相对策略优化)?&quot;,&quot;local&quot;:&quot;为什么我们关注grpo群体相对策略优化&quot;,&quot;sections&quot;:[],&quot;depth&quot;:2},{&quot;title&quot;:&quot;章末小测试&quot;,&quot;local&quot;:&quot;章末小测试&quot;,&quot;sections&quot;:[{&quot;title&quot;:&quot;1. 强化学习的核心组成部分有哪些?&quot;,&quot;local&quot;:&quot;1-强化学习的核心组成部分有哪些&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;2. 什么是使用RLHF训练语言模型的主要优势?&quot;,&quot;local&quot;:&quot;2-什么是使用rlhf训练语言模型的主要优势&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;3. 在大语言模型的语境下,强化学习中的“行动“是指什么?&quot;,&quot;local&quot;:&quot;3-在大语言模型的语境下强化学习中的行动是指什么&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;4. 在使用强化学习训练语言模型时,奖励的作用是什么?&quot;,&quot;local&quot;:&quot;4-在使用强化学习训练语言模型时奖励的作用是什么&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3},{&quot;title&quot;:&quot;5. 在大语言模型的语境下,强化学习中的“奖励”是指什么?&quot;,&quot;local&quot;:&quot;5-在大语言模型的语境下强化学习中的奖励是指什么&quot;,&quot;sections&quot;:[],&quot;depth&quot;:3}],&quot;depth&quot;:2}],&quot;depth&quot;:1}"><!-- HEAD_svelte-u9bgzb_END --> <p></p> <div class="items-center shrink-0 min-w-[100px] max-sm:min-w-[50px] justify-end ml-auto flex" style="float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"><div class="inline-flex rounded-md max-sm:rounded-sm"><button class="inline-flex items-center gap-1 h-7 max-sm:h-7 px-2 max-sm:px-1.5 text-sm font-medium text-gray-800 border border-r-0 rounded-l-md max-sm:rounded-l-sm border-gray-200 bg-white hover:shadow-inner dark:border-gray-850 dark:bg-gray-950 dark:text-gray-200 dark:hover:bg-gray-800" aria-live="polite"><span class="inline-flex items-center justify-center rounded-md p-0.5 max-sm:p-0 hover:text-gray-800 dark:hover:text-gray-200"><svg class="sm:size-3.5 size-3" xmlns="http://www.w3.org/2000/svg" aria-hidden="true" fill="currentColor" focusable="false" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 32 32"><path d="M28,10V28H10V10H28m0-2H10a2,2,0,0,0-2,2V28a2,2,0,0,0,2,2H28a2,2,0,0,0,2-2V10a2,2,0,0,0-2-2Z" transform="translate(0)"></path><path d="M4,18H2V4A2,2,0,0,1,4,2H18V4H4Z" transform="translate(0)"></path><rect fill="none" width="32" height="32"></rect></svg></span> <span>Copy page</span></button> <button class="inline-flex items-center justify-center w-6 max-sm:w-5 h-7 max-sm:h-7 disabled:pointer-events-none text-sm text-gray-500 hover:text-gray-700 dark:hover:text-white rounded-r-md max-sm:rounded-r-sm border border-l transition border-gray-200 bg-white hover:shadow-inner dark:border-gray-850 dark:bg-gray-950 dark:text-gray-200 dark:hover:bg-gray-800" aria-haspopup="menu" aria-expanded="false" aria-label="Open copy menu"><svg class="transition-transform text-gray-400 overflow-visible sm:size-3.5 size-3 rotate-0" width="1em" height="1em" viewBox="0 0 12 7" fill="none" xmlns="http://www.w3.org/2000/svg"><path d="M1 1L6 6L11 1" stroke="currentColor"></path></svg></button></div> </div> <h1 class="relative group"><a id="强化学习简介及其在大语言模型中的作用" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#强化学习简介及其在大语言模型中的作用"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>强化学习简介及其在大语言模型中的作用</span></h1> <p data-svelte-h="svelte-xfn8ak">欢迎来到第一节!</p> <p data-svelte-h="svelte-ozlbrn">我们即将要开启我们的学习之旅,进入振奋人心的强化学习(RL)的世界,一起探索它是如何为语言模型的训练开创新范式 —— 这些模型或许正是你每天都在使用的呢</p> <blockquote class="tip" data-svelte-h="svelte-pcm9kn"><p>在本章节中,我们将会聚焦于用于语言模型的强化学习。当然,强化学习是一个涵盖广泛的领域,其应用远不止语言模型。如果你对学习更多强化学习相关的知识感兴趣,你可以查看<a href="https://huggingface.co/courses/deep-rl-course/en/unit1/introduction" rel="nofollow">深度强化学习课程</a></p></blockquote> <p data-svelte-h="svelte-194b1nc">本节旨在为你提供一份友好清晰的强化学习入门指南,即使你此前从未接触过也无妨。我们会逐一讲解其核心概念,并探讨为什么强化学习在大语言模型(LLMs)领域变得愈发重要。</p> <h2 class="relative group"><a id="什么是强化学习rl" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#什么是强化学习rl"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>什么是强化学习(RL)?</span></h2> <p data-svelte-h="svelte-1d2tdbk">想象一下你正在训练一只小狗,想教会它“坐下”这个指令。你会说“坐下”,如果小狗照做了,你就给它一点零食并给予表扬。如果它没有坐下,你可能会温柔地引导它,或者再试一次。久而久之,小狗逐渐学会将“坐下”这个动作与积极的奖励(零食和表扬)关联起来,并且在你下次发出指令时,他更可能听从。在强化学习中,我们称这种反馈为<strong>奖励</strong>(Reward)。</p> <p data-svelte-h="svelte-v48np5">简而言之,这就是强化学习背后的基本思想!不同之处在于,在实际的RL任务中,小狗被替换成<strong>语言模型</strong>(在强化学习中,我们会称之为<strong>智能体</strong>),而训练者的角色责备提供反馈的<strong>环境</strong>所取代。</p> <p data-svelte-h="svelte-7vw81u"><img src="https://huggingface.co/reasoning-course/images/resolve/main/grpo/3.jpg" alt="强化学习术语流程"></p> <p data-svelte-h="svelte-a4y35f">让我们来拆解一下强化学习的关键关键组成部分:</p> <h3 class="relative group"><a id="智能体" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#智能体"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>智能体</span></h3> <p data-svelte-h="svelte-1fepupt">智能体是我们的学习主体。在小狗的例子中,小狗就是智能体;在LLM的语境下,LLM本身就变成了我们想要训练的智能体。智能体负责做出决策,并从环境和和给予的奖励中学习。</p> <h3 class="relative group"><a id="环境" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#环境"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>环境</span></h3> <p data-svelte-h="svelte-1bj41is">环境是智能体所处并与之互动的世界。对于小狗来说,它的环境就是你的房子和身为训练者的你。对于LLM来说,环境则更为抽象 —— 它可能是与之交互的用户,也可能是我们专门为其设置的模拟场景。环境会向智能体提供反馈。</p> <h3 class="relative group"><a id="动作" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#动作"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>动作</span></h3> <p data-svelte-h="svelte-9x7tuz">动作(或行动)是智能体在环境中可以执行的选择。以小狗为例,其动作包括“坐下”、“站立”、“吠叫”等。对于LLM来说,动作则可能是:生成句子中的下一个词、从多个选项中选择一个答案来回答问题、或是决定如何在一段对话中回复。</p> <h3 class="relative group"><a id="奖励" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#奖励"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>奖励</span></h3> <p data-svelte-h="svelte-z4yll8">奖励是智能体执行动作之后,环境给予的反馈。奖励通常以数字形式表示。</p> <p data-svelte-h="svelte-r4eujo"><strong>正向奖励</strong>就像零食和夸奖 —— 它们告诉智能体:“真棒,你做得对!”</p> <p data-svelte-h="svelte-1ikwgbb"><strong>负向奖励</strong>(或者惩罚)更像是温和的否定 —— 它们提示智能体:“这个不太对,试试别的行动吧。” 对于小狗来说,零食就是奖励。</p> <p data-svelte-h="svelte-1oi9t4a">对于大语言模型,奖励的设计旨在反映模型在特定任务上的表现——比如回答是否有帮助(helpful)、是否真实(truthful),以及是否无害(harmless)。</p> <h3 class="relative group"><a id="策略" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#策略"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>策略</span></h3> <p data-svelte-h="svelte-1ag2k59">策略是智能体选择行动时所依据的决策准则。就像小狗需要理解当你喊“坐下”时,它应该怎么做一样。在强化学习中,策略正是我们真正试图学习和改进的核心。它可以是一系列规则,或者一个函数,用于指导智能体在不同的情境下应该采取什么行动。起初,策略可能是随机的,但随着智能体不断学习,策略会变得更擅长选择能带来更高奖励的行动。</p> <h2 class="relative group"><a id="强化学习的过程试错法" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#强化学习的过程试错法"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>强化学习的过程:试错法</span></h2> <p data-svelte-h="svelte-3lti6e"><img src="https://huggingface.co/reasoning-course/images/resolve/main/grpo/1.jpg" alt="强化学习的过程"></p> <p data-svelte-h="svelte-1bzbztr">强化学习通过试错过程得以实现:</p> <table data-svelte-h="svelte-121as2p"><thead><tr><th>步骤</th> <th>具体过程</th> <th>简介</th></tr></thead> <tbody><tr><td>1. 观察</td> <td>智能观察环境</td> <td>智能体获取其当前状态和周围环境的信息</td></tr> <tr><td>2. 行动</td> <td>智能体基于当前策略采取行动</td> <td>智能体运用已学到的策略决定下一步行动</td></tr> <tr><td>3. 反馈</td> <td>环境给予智能体奖励</td> <td>智能体收到其行动好坏的反馈</td></tr> <tr><td>4. 学习</td> <td>智能体根据奖励更新策略</td> <td>智能体调整其策略 —— 强化可以导致高奖励的行动,避免采取导致低奖励的行动</td></tr> <tr><td>5. 迭代</td> <td>重复此过程</td> <td>这个学习的循环为持续下去,帮助智能体持续不断地提升决策能力</td></tr></tbody></table> <p data-svelte-h="svelte-3fnoyc">回想一下学习骑自行车的过程。一开始你可能会摇摇晃晃甚至摔跤(负向奖励!)。但当你成功保持平衡并平稳地踩动踏板时,你会感觉非常愉快(正向奖励!)。你会根据这些反馈调整你的动作 —— 比如微微倾斜身体、加快蹬踏速度等等 —— 直到你完全学会骑车。强化学习的原理也是如此 —— 它正式通过交互和反馈来进行学习。</p> <h2 class="relative group"><a id="强化学习在大语言模型llms中的作用" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#强化学习在大语言模型llms中的作用"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>强化学习在大语言模型(LLMs)中的作用</span></h2> <p data-svelte-h="svelte-uta04b">那么,为什么强化学习对大语言模型如此重要?</p> <p data-svelte-h="svelte-1u1dy3n">当然,训练出真正优秀的大语言模型绝非易事。我们可以使用互联网上的海量文本来训练它们,使它们变得非常擅长预测句子中的下一个词。正如我们在<a href="/course/chapters/zh-CN/chapter2/1">第二章</a>所学,它们正是通过这种方式学会生成流畅且语法正确的文字。</p> <p data-svelte-h="svelte-ybc3hj">然而,仅仅是表达流利是不够的。我们希望大语言模型不仅能擅长组合词句,我们还希望它们可以具备以下特质:</p> <ul data-svelte-h="svelte-plbvax"><li><strong>有用</strong>:可以提供实用且相关的信息。</li> <li><strong>无害</strong>:避免生成有毒、有偏见或者伤害性的内容。</li> <li><strong>与人类的偏好对齐</strong>:以一种人类认为自然、有帮助和吸引人的方式回复。</li></ul> <p data-svelte-h="svelte-oz1scg">预训练大语言模型的方法主要依赖于让模型学会根据文本数据预测下一个词,常常容易在上述几个方面存在不足。</p> <p data-svelte-h="svelte-yqxq1">尽管有监督训练非常擅长生成结构化输出,但是在生成有用、无害和对齐的回复时还是会有些力不从心。我们在<a href="/course/chapters/zh-CN/chapter11/1">第十一章</a>深入探讨了有监督训练。</p> <p data-svelte-h="svelte-187z9jc">经过微调过的模型或许可以生成流利且结构化的文字,但它的回答仍可能有事实错误、带有偏见、或者没有真正有效地回答用户的问题。</p> <p data-svelte-h="svelte-87mca5"><strong>这时就需要强化学习了!</strong> 强化学习为我们提供了一种微调这些预训练大模型的方法,从而更好实现我们所期望的模型应具备的特性。它就像给我们的“大语言模型狗”进行额外的训练,让它变成一只举止得体、乐于助人的伙伴,而不是只知道流利地汪汪叫的狗!</p> <h2 class="relative group"><a id="基于人类反馈的强化学习rlhf" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#基于人类反馈的强化学习rlhf"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>基于人类反馈的强化学习(RLHF)</span></h2> <p data-svelte-h="svelte-1esxetq"><strong>基于人类反馈的强化学习(RLHF)</strong>是一种非常流行的对齐语言模型的技术。在RLHF中,我们以人类的反馈作为强化学习中的“奖励”信号。以下是它的工作原理:</p> <ol data-svelte-h="svelte-1rpbrda"><li><strong>收集人类偏好:</strong>我们会请人类比较大语言模型针对同一输入提示词生成的不同回复,并给出他们的偏好。比如,我们会评估者展示关于“法国的首都是哪里?”这一问题的两个不同的答案,并询问“哪个答案更好?”。</li> <li><strong>训练奖励模型</strong>:我们会使用这些人类偏好数据去训练一个独立的模型,称之为“<strong>奖励模型</strong>”。这个奖励模型会学习预测人类更喜欢哪一种回复,并学会基于实用性、无害性和与人类偏好的对齐程度对回复进行评分。</li> <li><strong>使用强化学习微调大语言模型</strong>:现在,我们可以使用这个奖励模型作为大语言模型智能体的环境。大语言模型生成回答(行动),然后奖励模型对这些回复打分(提供奖励)。本质上,奖励模型学习了人类的偏好,然后我们训练大语言模型去生成奖励模型认为好的文本,也就是人类偏好的文本。</li></ol> <p data-svelte-h="svelte-1ef5l0w"><img src="https://huggingface.co/reasoning-course/images/resolve/main/grpo/2.jpg" alt="强化学习基础概念"></p> <p data-svelte-h="svelte-6qxf18">从更宏观的视角来看,大语言模型使用强化学习有以下好处:</p> <table data-svelte-h="svelte-1mumwqn"><thead><tr><th>好处</th> <th>具体描述</th></tr></thead> <tbody><tr><td>增强可控性</td> <td>强化学习让我们能够更好地控制大语言模型生成的内容。我们可以引导模型生成更符合特定目标的文本,比如更有帮助、更有创意或者更简洁。</td></tr> <tr><td>加强与人类价值观的对齐</td> <td>RLHF技术尤其有助于大语言模型对齐一些复杂且通常主观的人类偏好。我们很难写下明确的规则来定义“什么是一个好的答案”,但人类却可以轻松判断和对比回复。RLHF正是让模型得以从这些人类的判断中学习。</td></tr> <tr><td>减少不良行为</td> <td>强化学习可以用于减少大语言模型的负面行为,比如生成有害言论、传播错误信息或者展示偏见。通过设计惩罚这些行为的消极奖励,我们可以矫正模型避免这些行为。</td></tr></tbody></table> <p data-svelte-h="svelte-cjvd84">基于人类反馈的强化学习已经被用于训练许多当今最受欢迎的大语言模型中,比如OpenAI的GPT-4、谷歌的Gemini、DeepSeek的R1模型。实现RLHF的技术范围很广,其复杂性和精妙程度又更有千秋。在本章中,我们会重点介绍<strong>群体相对策略优化(GRPO)</strong>算法,这是一种经证明能有效训练大语言模型、使其变得实用、无害并与人类偏好对齐的RLHF技术。</p> <h2 class="relative group"><a id="为什么我们关注grpo群体相对策略优化" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#为什么我们关注grpo群体相对策略优化"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>为什么我们关注GRPO(群体相对策略优化)?</span></h2> <p data-svelte-h="svelte-129ict8">实现RLHF的技术有很多,但本课程重点介绍GRPO,因为它代表了语言模型的强化学习领域的一项重大进展。</p> <p data-svelte-h="svelte-12adzmk">让我们先简要了解一下其他两种流行的RLHF技术:</p> <ul data-svelte-h="svelte-91mxcu"><li>近端策略优化(PPO)</li> <li>直接偏好优化(DPO)</li></ul> <p data-svelte-h="svelte-6pmc4a">近端策略优化(PPO)是最早的高效RLHF技术之一。它采用策略梯度方法,依据独立的奖励模型所提供的反馈来更新策略。</p> <p data-svelte-h="svelte-1n947bj">直接偏好优化(DPO)是后来发展出的、更为简化的技术,它不需要独立的奖励模型,而是直接使用偏好数据来训练。本质上,DPO将问题转化为一个分类任务:判断回复应该被采纳还是被拒绝。</p> <blockquote class="tip" data-svelte-h="svelte-tldlxz"><p>DPO 和 PPO 本身都是基于不同设计目的的复杂的强化学习算法,我们不会在本课程中深入讲解。如果你有兴趣进一步了解,可以查阅以下资料:</p> <ul><li><a href="https://huggingface.co/docs/trl/main/en/ppo_trainer" rel="nofollow">近端策略优化</a></li> <li><a href="https://huggingface.co/docs/trl/main/en/dpo_trainer" rel="nofollow">直接偏好优化</a></li></ul></blockquote> <p data-svelte-h="svelte-1kxpqay">区别于DPO和PPO,GRPO将相似的样本归为一组,并以组为单位进行比较。相比其他方法,这种基于组合的算法能够提供更稳定的梯度和更好的收敛特性。</p> <p data-svelte-h="svelte-hg8at">GRPO不像DPO那样直接使用偏好数据,而是通过从模型或者函数得来的奖励信号来比较相似样本组。</p> <p data-svelte-h="svelte-1nzyisk">GRPO在如何获取奖励信号方面非常灵活 - 它可以像PPO那样使用奖励模型,但并非绝对需要。这是因为GRPO可以从任何可以评估回复质量的函数或者模型中获取奖励信号。</p> <p data-svelte-h="svelte-176b7z">例如,我们可以使用一个计算长度的函数来奖励更简短的回复,用一个数学求解器来验证解答的正确性,或者用一个判断事实准确性的函数奖励事实准确性更高的回复。这些灵活性使得GRPO在处理各类不同的对齐任务时,展现了极强的通用性。</p> <hr> <p data-svelte-h="svelte-1iclkjr">恭喜你完成了模块1!你现在已经对强化学习以及其在塑造未来大语言模型的关键作用有了扎实的认知。你掌握了强化学习的基本概念,理解了它为什么被用于大语言模型,并初步认识了该领域的一个关键算法GRPO。</p> <p data-svelte-h="svelte-179gsth">在下一个模块中,我们将动手实践,深入研读DeepSeek R1的论文,看看这些概念是如何在实际中应用的。</p> <h2 class="relative group"><a id="章末小测试" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#章末小测试"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>章末小测试</span></h2> <h3 class="relative group"><a id="1-强化学习的核心组成部分有哪些" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#1-强化学习的核心组成部分有哪些"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>1. 强化学习的核心组成部分有哪些?</span></h3> <div><form><label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="0"> <!-- HTML_TAG_START -->智能体,环境,行动,奖励和策略<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="1"> <!-- HTML_TAG_START -->模型,数据,损失函数和优化器<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="2"> <!-- HTML_TAG_START -->输入,输出和隐藏层<!-- HTML_TAG_END --></label> <div class="flex flex-row items-center mt-3"><button class="btn px-4 mr-4" type="submit" disabled>Submit</button> </div></form></div> <h3 class="relative group"><a id="2-什么是使用rlhf训练语言模型的主要优势" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#2-什么是使用rlhf训练语言模型的主要优势"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>2. 什么是使用RLHF训练语言模型的主要优势?</span></h3> <div><form><label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="0"> <!-- HTML_TAG_START -->它能让模型更好地与人类偏好和价值观对齐。<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="1"> <!-- HTML_TAG_START -->它让模型更快地生成文本<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="2"> <!-- HTML_TAG_START -->它减少模型的内存占用。<!-- HTML_TAG_END --></label> <div class="flex flex-row items-center mt-3"><button class="btn px-4 mr-4" type="submit" disabled>Submit</button> </div></form></div> <h3 class="relative group"><a id="3-在大语言模型的语境下强化学习中的行动是指什么" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#3-在大语言模型的语境下强化学习中的行动是指什么"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>3. 在大语言模型的语境下,强化学习中的“行动“是指什么?</span></h3> <div><form><label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="0"> <!-- HTML_TAG_START -->生成单词或者在对话中选择回复<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="1"> <!-- HTML_TAG_START -->更新模型权重<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="2"> <!-- HTML_TAG_START -->处理输入词元<!-- HTML_TAG_END --></label> <div class="flex flex-row items-center mt-3"><button class="btn px-4 mr-4" type="submit" disabled>Submit</button> </div></form></div> <h3 class="relative group"><a id="4-在使用强化学习训练语言模型时奖励的作用是什么" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#4-在使用强化学习训练语言模型时奖励的作用是什么"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>4. 在使用强化学习训练语言模型时,奖励的作用是什么?</span></h3> <div><form><label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="0"> <!-- HTML_TAG_START -->根据模型生成的回复在多大程度上符合期望行为提供反馈信号<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="1"> <!-- HTML_TAG_START -->衡量模型的词库大小<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="2"> <!-- HTML_TAG_START -->决定模型训练速度<!-- HTML_TAG_END --></label> <div class="flex flex-row items-center mt-3"><button class="btn px-4 mr-4" type="submit" disabled>Submit</button> </div></form></div> <h3 class="relative group"><a id="5-在大语言模型的语境下强化学习中的奖励是指什么" class="header-link block pr-1.5 text-lg no-hover:hidden with-hover:absolute with-hover:p-1.5 with-hover:opacity-0 with-hover:group-hover:opacity-100 with-hover:right-full" href="#5-在大语言模型的语境下强化学习中的奖励是指什么"><span><svg class="" xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink" aria-hidden="true" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 256 256"><path d="M167.594 88.393a8.001 8.001 0 0 1 0 11.314l-67.882 67.882a8 8 0 1 1-11.314-11.315l67.882-67.881a8.003 8.003 0 0 1 11.314 0zm-28.287 84.86l-28.284 28.284a40 40 0 0 1-56.567-56.567l28.284-28.284a8 8 0 0 0-11.315-11.315l-28.284 28.284a56 56 0 0 0 79.196 79.197l28.285-28.285a8 8 0 1 0-11.315-11.314zM212.852 43.14a56.002 56.002 0 0 0-79.196 0l-28.284 28.284a8 8 0 1 0 11.314 11.314l28.284-28.284a40 40 0 0 1 56.568 56.567l-28.285 28.285a8 8 0 0 0 11.315 11.314l28.284-28.284a56.065 56.065 0 0 0 0-79.196z" fill="currentColor"></path></svg></span></a> <span>5. 在大语言模型的语境下,强化学习中的“奖励”是指什么?</span></h3> <div><form><label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="0"> <!-- HTML_TAG_START -->一个衡量回答质量的数值分数<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="1"> <!-- HTML_TAG_START -->一个生成回复的函数<!-- HTML_TAG_END --></label> <label class="block"><input autocomplete="off" class="form-input -mt-1.5 mr-2" name="choice" type="checkbox" value="2"> <!-- HTML_TAG_START -->一个评估回复质量的模型<!-- HTML_TAG_END --></label> <div class="flex flex-row items-center mt-3"><button class="btn px-4 mr-4" type="submit" disabled>Submit</button> </div></form></div> <a class="!text-gray-400 !no-underline text-sm flex items-center not-prose mt-4" href="https://github.com/huggingface/course/blob/main/chapters/zh-CN/chapter12/2.mdx" target="_blank"><svg class="mr-1" xmlns="http://www.w3.org/2000/svg" aria-hidden="true" fill="currentColor" focusable="false" role="img" width="1em" height="1em" preserveAspectRatio="xMidYMid meet" viewBox="0 0 32 32"><path d="M31,16l-7,7l-1.41-1.41L28.17,16l-5.58-5.59L24,9l7,7z"></path><path d="M1,16l7-7l1.41,1.41L3.83,16l5.58,5.59L8,23l-7-7z"></path><path d="M12.419,25.484L17.639,6.552l1.932,0.518L14.351,26.002z"></path></svg> <span data-svelte-h="svelte-zjs2n5"><span class="underline">Update</span> on GitHub</span></a> <p></p>
<script>
{
__sveltekit_k5k00v = {
assets: "/docs/course/pr_1213/zh-CN",
base: "/docs/course/pr_1213/zh-CN",
env: {}
};
const element = document.currentScript.parentElement;
const data = [null,null];
Promise.all([
import("/docs/course/pr_1213/zh-CN/_app/immutable/entry/start.e9a4ad0c.js"),
import("/docs/course/pr_1213/zh-CN/_app/immutable/entry/app.a615bcac.js")
]).then(([kit, app]) => {
kit.start(app, element, {
node_ids: [0, 14],
data,
form: null,
error: null
});
});
}
</script>

Xet Storage Details

Size:
47.9 kB
·
Xet hash:
33849c2276bf683029a146b05449add710a43da4ff758974340e508f9d9b5d2b

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.