news 2026/8/21 7:07:01

强化学习第六课 —— SAC:熵驱动的更智能探索

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
强化学习第六课 —— SAC:熵驱动的更智能探索

目录

  1. 引言:不仅仅是为了赢
  2. 第一章:最大熵目标——混乱中的秩序
    • 2.1 传统 RL 的局限
    • 2.2 引入熵奖励:J(π)J(\pi)J(π)的重构
  3. 第二章:软策略迭代——数学推导的核心
    • 3.1 软值函数与软 Bellman 方程
    • 3.2 策略评估与策略提升
  4. 第三章:SAC 的工程实现——Actor 与 Critic 的共舞
    • 4.1 Critic:双 Q 网络与软目标更新
    • 4.2 Actor:高斯策略与重参数化技巧
    • 4.3 Tanh 变换带来的概率密度修正
  5. 第四章:自动化α\alphaα——让算法自己决定探索力度
  6. 第五章:SAC vs PPO vs TD3——谁是王者?
  7. 结语:随机性的胜利

1. 引言:不仅仅是为了赢

想象你在玩一个走迷宫游戏。

  • DDPG/TD3 (确定性策略)像是一个执着的赛车手,一旦发现了一条通往终点的捷径,它就会死死咬住这条路,哪怕这条路非常狭窄,哪怕稍微有一点扰动就会撞墙。
  • SAC (随机性策略)则像是一团流动的水。它也想去终点,但它倾向于填满所有通往终点的可行路径。如果一条路堵了,它自然流向另一条。

这就是 SAC 的核心哲学。传统的 RL 算法试图寻找一个最优动作,而 SAC 试图寻找一个最优分布。它认为:在回报差不多的情况下,保留的选择越多越好(熵越大越好)。

这种“留有余地”的思想,使得 SAC 成为了目前样本效率(Sample Efficiency)最高且最抗干扰的算法之一。


2. 第一章:最大熵目标——混乱中的秩序

2.1 传统 RL 的局限

标准的强化学习目标是最大化期望累积回报:
max⁡π∑tE(st,at)∼ρπ[r(st,at)] \max_\pi \sum_t \mathbb{E}_{(s_t, a_t) \sim \rho_\pi} [r(s_t, a_t)]πmaxtE(st,at)ρπ[r(st,at)]
这种目标函数导向的结果通常是一个确定性策略(Deterministic Policy),即π(a∣s)→1\pi(a|s) \rightarrow 1π(as)1(对于某个最优动作)。这导致 Agent 很容易放弃探索,过早收敛到局部最优。

2.2 引入熵奖励:J(π)J(\pi)J(π)的重构

SAC 基于最大熵强化学习框架。我们将目标函数修改为:

J(π)=∑t=0TE(st,at)∼ρπ[r(st,at)+αH(π(⋅∣st))] J(\pi) = \sum_{t=0}^{T} \mathbb{E}_{(s_t, a_t) \sim \rho_\pi} [r(s_t, a_t) + \alpha \mathcal{H}(\pi(\cdot | s_t))]J(π)=t=0TE(st,at)ρπ[r(st,at)+αH(π(st))]

这里的H(π(⋅∣st))\mathcal{H}(\pi(\cdot | s_t))H(π(st))是策略在状态sts_ts

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 1:58:26

【智慧时钟,万频随心】-------TKD泰晶科技

在当今科技发展日新月异的时代,电子设备的性能和稳定性至关重要。泰晶科技作为全球领先的晶体产品供应商,开发了一系列可编程晶振PXO,以其独特的性能优势为AI人工智能、汽车电子、通信设备(路由器、交换机、5G 基站)、…

作者头像 李华
网站建设 2026/8/21 20:43:38

10个MBA期末论文降AI率工具推荐!

10个MBA期末论文降AI率工具推荐! AI检测飘红,论文改写陷入两难 MBA学生在撰写期末论文时,常常会面临一个令人头疼的问题:AI检测系统显示“AI率过高”,导致论文被系统判定为非原创内容。这种焦虑不仅影响了论文的评分&a…

作者头像 李华
网站建设 2026/8/21 17:14:23

Godot引擎光照贴图烘焙:从问题诊断到完美解决方案

你是否曾在Godot项目中遇到过这样的困扰:场景光照要么生硬刺眼,要么昏暗无光;实时阴影消耗大量性能,导致游戏卡顿掉帧?作为技术教练,今天我将带你通过问题导向的方法,彻底掌握光照贴图烘焙的核心…

作者头像 李华
网站建设 2026/8/20 4:52:57

掌握LLM,全套方法就在这本书里

Part.1AI工程师都要会些什么?大语言模型(Large Language Model,LLM)技术的兴起,正在深刻影响软件的形态,开发者的工作也从实现业务逻辑、构建独立应用,转向以LLM为底层引擎快速搭建智能应用的模…

作者头像 李华
网站建设 2026/8/21 21:05:53

如何用Qwen3-VL-8B-Instruct实现边缘设备多模态AI部署新突破

如何用Qwen3-VL-8B-Instruct实现边缘设备多模态AI部署新突破 【免费下载链接】Qwen3-VL-8B-Instruct 项目地址: https://ai.gitcode.com/hf_mirrors/Qwen/Qwen3-VL-8B-Instruct 在当前AI应用向边缘设备迁移的趋势下,开发者面临的核心挑战是如何在有限计算资…

作者头像 李华
网站建设 2026/8/21 10:27:59

Excalidraw连线自动吸附机制优化路径规划

Excalidraw 连线自动吸附与路径规划的工程实践 在现代可视化协作工具中,图形连接的流畅性往往决定了用户的创作节奏。我们都有过这样的体验:拖动一条线试图连接两个模块时,线头总是在边缘“滑脱”,反复微调却难以对齐;…

作者头像 李华