范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「无模型策略预测和控制 – 时序差分学习」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。

时序差分预测

本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3

时序差分 (Temporal Difference,TD)和蒙特卡洛方法都利用经验来解决预测问题。给定策略 $\pi$ 的一些经验,以及这些经验中的非终止状态 $S_t$ ,一个适用于非平稳环境的简单的每次访问型蒙特卡洛方法可以表示为:

时序差分控制

$$ V\left(S_{t}\right) \gets V\left(S_{t}\right)+\alpha\left[G_{t}-V\left(S_{t}\right)\right] \label{eq:mc-update} $$

其中, $G_t$ 是时刻 $t$ 真实的回报, $\alpha$ 是步长参数,称之为常量 $\alpha$ MC。MC 需要等到一幕的结尾才能确定对 $V \left(S_t\right)$ 的增量(此时才能获得 $G_t$ ),而 TD 则只需要等到下一个时刻即可。在 $t+1$ 时刻,TD 使用观察到的收益 $R_{t+1}$ 和估计值 $V \left(S_{t+1}\right)$ 来进行一次有效更新:

Sarsa:同轨策略下的时序差分控制

$$ V\left(S_{t}\right) \gets V\left(S_{t}\right)+\alpha\left[R_{t+1}+\gamma V\left(S_{t+1}\right)-V\left(S_{t}\right)\right] \label{eq:td-update} $$

\begin{algorithm} \caption{表格型 TD(0) 算法,用于估计 $V \approx v_{\pi}$} \begin{algorithmic} \REQUIRE 待评估策略 $\pi$ \STATE 对于所有 $s \in \mathcal{S}^+$,任意初始化 $V \left(s\right)$,其中 $V \left(\text{终止状态}\right) = 0$ \FOR{每一幕} \STATE 初始化 $S$ \REPEAT \STATE $A \gets$ 策略 $\pi$ 在状态 $S$ 下做出的决策动作 \STATE 执行动作 $A$,观测到 $R, S'$ \STATE $V\left(S\right) \gets V\left(S\right)+\alpha\left[R+\gamma V\left(S^{\prime}\right)-V\left(S\right)\right]$ \STATE $S \gets S'$ \UNTIL{$S$ 为终止状态}

Q-Learning:离轨策略下的时序差分控制

TD 和 MC 方法都能渐进地收敛于正确的预测,但两种方法谁收敛的更快,目前暂时未能证明。但在如下的随机任务上,TD 方法通常比常量 $\alpha$ MC 方法收敛得更快。假设如下 MRP 所有阶段都同中心 C 开始,每个时刻以相同的概率向左或向右移动一个状态。幕终止于最左侧或最右侧,终止于最右侧时有 +1 的收益,除此之外收益均为零。

由于这个任务没有折扣,因此每个状态的真实价值是从这个状态开始并终止于最右侧的概率,即 A 到 E 的概率分别为 $\frac{1}{6}, \frac{2}{6}, \frac{3}{6}, \frac{4}{6}, \frac{5}{6}$ 。

期望 Sarsa

上图左侧显示了在经历了不同数量的幕采样序列之后,运行一次 TD(0) 所得到的价值估计。在 100 幕后,估计值已经非常接近真实值了。上图右侧显示了不同的 $\alpha$ 情况下学习到的价值函数和真实价值函数的均方根(RMS)误差,对于所有的 $s$ ,近似价值函数都被初始化为中间值 $V \left(s\right) = 0.5$ ,显示的误差是 5 个状态上运行 100 次的平均误差。

给定近似价值函数 $V$ ,在访问非终止状态的每个时刻 $t$ ,使用式 $\ref{eq:mc-update}$ 和 $\ref{eq:td-update}$ 计算相应的增量经验,产生新的总增量,以此类推,直到价值函数收敛。我们称这种方法为 批量更新 ,因为只有在处理了 整批 的训练数据后才进行更新。批量蒙特卡洛方法总是找出最小化训练集上均方误差的估计,而批量 TD(0) 总是找出完全符合马尔可夫过程模型的最大似然估计参数。因此,MC 在非马尔可夫环境中更加高效,而 TD 在马尔可夫环境中更加高效。

双学习

$$ \textbf{DP} \quad V\left(S_{t}\right) \leftarrow \mathbb{E}_{\pi}\left[R_{t+1}+\gamma V\left(S_{t+1}\right)\right] $$

$$ \textbf{MC} \quad V\left(S_{t}\right) \leftarrow V\left(S_{t}\right)+\alpha\left(G_{t}-V\left(S_{t}\right)\right) $$

值得单独记下的点

  • CS234: Reinforcement Learning http://web.stanford.edu/class/cs234/index.html ↩︎
  • UCL Course on RL https://www.davidsilver.uk/teaching ↩︎

落地时建议先做的 5 件事

  1. 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
  2. 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
  3. 多智能体只在单智能体触到上下文或专业边界时再拆。
  4. Token、微调和压缩都要有对照数字,避免口号式优化。
  5. 结论写成可检查清单:接口、超时、评测集、回滚版本。

和智能体产品怎么接

龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) CS234: Reinforcement Learning http://web.stanford.edu/class/cs234/index.html ↩︎;2) UCL Course on RL https://www.davidsilver.uk/teaching ↩︎;3) 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。;4) 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。;5) 多智能体只在单智能体触到上下文或专业边界时再拆。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「时序差分预测」,本文给出了什么结论?

在「时序差分预测」部分,要点是:,一个适用于非平稳环境的简单的每次访问型蒙特卡洛方法可以表示为: 时序差分控制 $$ V\left(S_{t}\right) \gets V\left(S_{t}\right)+\alpha\left[G_{t}-V\left(S_{t}\right)\right] \label{eq:mc-update} $$ 其中, $G_t$ 是时刻 $t$ 真实的回报, $\alpha$ 是步长参数,称之为常量 $\alpha$ MC。MC 需

关于「时序差分控制」,本文给出了什么结论?

在「时序差分控制」部分,要点是:\gamma V\left(S_{t+1}\right)-V\left(S_{t}\right)\right] \label{eq:td-update} $$ \begin{algorithm} \caption{表格型 TD(0) 算法,用于估计 $V \approx v_{\pi}$} \begin{algorithmic} \REQUIRE 待评估策略 $\pi$ \STATE 对于所有 $s \in \mathcal{S}^+$