news 2026/8/21 22:15:27

大模型学习基础(五) 强化学习(Reinforcement Learning,RL)初步

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
大模型学习基础(五) 强化学习(Reinforcement Learning,RL)初步

前面的文章简单介绍过,传统的监督学习所使用的数据集是(特征,标签),有“标签”即明确的知晓正确的输出应该是什么。而强化学习所面临的问题并不一定有严格的正确答案,而只是知晓一个大概正确的方向:如在下围棋时,第一步下在哪里?显然这个问题没有一个明确答案,这个时候使用强化学习显然比监督学习更加合适,因为监督学习需要的是具有明确答案作为标签的数据集。

强化学习的结构逻辑模型可以用上图简单表示:

三要素:1.Actor,即模型;2.Environment,环境 3.Action,即模型的输出

Environment输入Observation给Actor,Actor输出一个Action给Environment,Environment回复一个Reward(奖励)分数给Actor,接着继续把Observation交给Actor,如此循环。模型训练的要求就是使得Reward最大,代表我们找到了最优的模型。

对于模型来说,Environment输入Observation给Actor,即代表模型从环境中提取到了状态信息,根据这个状态信息模型来判断下一步的动作;而模型输出的是一个分类的结果,即多个动作对应多个不同的概率;在输出概率分布以后要添加一定的随机性,使得每次的输出结果具有差异性,然后选择最大概率所对应的动作。

模型在选择一个动作之后,这个动作实际是对Environment发生,相应的Environment会给模型一个回馈Reward,然后再给模型一个新的Observation,模型继续选择新的动作,循环此过程。这个过程中的Reward会被累积下来,Reward越大,代表模型做出的动作越好。用表示reward累计,因为我们希望R越大越好,所以R取反可以直接作为损失函数,使得最小化损失和最大化奖励统一起来。

整个强化学习的过程逻辑图如下:

需要注意的是,只有Actor本身是神经网络结构,而Env和Reward都是黑盒子,这意味着我们只能优化Actor的参数,而Env和Reward中的参数是无法优化的。有了通过Reward定义的损失函数,有了模型Actor,显然我们可以通过常规的深度学习的方法来优化Actor中的参数。

那么如何使得在给定S1时,模型能输出指定的值a?

这个时候的输出是可以明确的,这样的训练可以使用监督学习完成。可以通过经典的多分类问题思路来处理,即用交叉熵定义损失函数。如果不想要模型输出指定的值a,只需要对损失函数取反。

而实际的情况是,环境的状态S是由多个Si构成的,每训练一组S-a即训练一个多分类问题,把这些问题的损失函数(交叉熵)加在一起,即可训练出在不同的状态下应该使用什么动作。这里读者可能会有疑问:上述介绍的问题似乎都是监督学习问题,即可以明确正确输出的标签,与reward又有什么关联呢?这个问题将在下一讲给出答案。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 8:49:46

百度网盘资源解锁神器:告别提取码搜索烦恼的智能方案

百度网盘资源解锁神器:告别提取码搜索烦恼的智能方案 【免费下载链接】baidupankey 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 还在为百度网盘提取码而四处奔波吗?这款智能解析工具将彻底改变你的资源获取体验,让繁琐…

作者头像 李华
网站建设 2026/8/21 8:50:59

57.落地前准备-DDD项目团队分工与协作流程-附组织架构设计

57 落地前准备:DDD 项目的团队分工与协作流程 你好,欢迎来到课程的第五大部分——企业级落地。 在经历了前面四个阶段的学习之后,你已经掌握了从战略设计到战术设计,再到架构实现的 DDD 全套“武功秘籍”。 但是,我们都知道一个道理:再好的思想,如果不能在现实世界中…

作者头像 李华
网站建设 2026/8/21 5:37:13

62.性能优化-DDD架构下数据库优化与缓存设计-性能提升10倍+

62 性能优化:DDD 架构下的数据库优化与缓存设计 你好,欢迎来到第 62 讲。 在我们的 DDD 学习之旅中,我们一直将“模型的纯粹性”和“业务表达力”放在首位。我们推崇充血模型、小聚合、以及只通过 ID 引用等原则。 这些原则,为我们带来了清晰、健壮、可维护的领域模型。…

作者头像 李华
网站建设 2026/8/21 8:54:15

66.DDD面试高频题(上)-概念类问题拆解与回答模板-面试通过率提升80%

66 DDD 面试高频题(上):概念类问题拆解与回答模板 你好,欢迎来到第 66 讲。 经过整个课程的学习,你已经构建起了完整的 DDD 知识体系。现在,是时候将这些“内功”,转化为你在职场上最直接的“战斗力”了——面试。 在高端技术岗位的面试中,DDD 已经从一个“加分项”…

作者头像 李华
网站建设 2026/8/20 22:00:44

论文AI率从60%降到2.8%,只用5个免费查AI率和降AI率工具!

在论文、报告、内容创作越来越严格的时代,查AI率、检测AI率、降AI率 已经成为学生、写作者、博主的日常需求。很多同学因为 AI率过高被导师指出“AI痕迹太重”,甚至退回重写。本文今天一次性告诉你: 检测AI率应该注意什么 免费查AI率的网站有…

作者头像 李华