范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「马尔可夫决策过程」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。

马尔可夫模型

本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3

$$ \mathbb{P} \left[S_{t+1} | S_t\right] = \mathbb{P} \left[S_{t+1} | S_1, \cdots, S_t\right] $$

马尔可夫过程

也就是认为当前状态捕获了历史中所有相关的信息。根据系统状态是否完全可被观测以及系统是自动的还是受控的,可以将马尔可夫模型分为 4 种,如下表所示:

马尔可夫链(Markov Chain,MC)为从一个状态到另一个状态转换的随机过程,当马尔可夫链的状态只能部分被观测到时,即为 隐马尔可夫模型(Hidden Markov Model,HMM) ,也就是说观测值与系统状态有关,但通常不足以精确地确定状态。马尔可夫决策过程(Markov Decision Process,MDP)也是马尔可夫链,但其状态转移取决于当前状态和采取的动作,通常一个马尔可夫决策过程用于计算依据期望回报最大化某些效用的行动策略。部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP)即为系统状态仅部分可见情况下的马尔可夫决策过程。

马尔可夫决策过程

$$ \mathcal{P}_{ss'} = \mathbb{P} \left[S_t = s' | S_{t-1} = s\right] $$

状态概率矩阵 $\mathcal{P}$ 定义了从所有状态 $s$ 到后继状态 $s'$ 的转移概率:

值得单独记下的点

  • 存在一个比其他策略更优或相等的策略, $\pi_* \geq \pi, \forall \pi$
  • 所有的最优策略均能够获得最优的状态价值函数, $v_{\pi_*} \left(s\right) = v_* \left(s\right)$
  • 所有的最优策略均能够获得最优的动作价值函数, $q_{\pi_*} \left(s, a\right) = q_* \left(s, a\right)$
  • Sutton, R. S., & Barto, A. G. (2018). Reinforcement learning: An introduction . MIT press. ↩︎
  • CS234: Reinforcement Learning http://web.stanford.edu/class/cs234/index.html ↩︎
  • UCL Course on RL https://www.davidsilver.uk/teaching ↩︎

落地时建议先做的 5 件事

  1. 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
  2. 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
  3. 多智能体只在单智能体触到上下文或专业边界时再拆。
  4. Token、微调和压缩都要有对照数字,避免口号式优化。
  5. 结论写成可检查清单:接口、超时、评测集、回滚版本。

和智能体产品怎么接

龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:本文为 《强化学习系列》 文章 本文内容主要参考自: 1.《强化学习》 1 2. CS234: Reinforcement Learning 2 3. UCL Course on RL 3

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 存在一个比其他策略更优或相等的策略, $\pi_* \geq \pi, \forall \pi$;2) 所有的最优策略均能够获得最优的状态价值函数, $v_{\pi_*} \left(s\right) = v_* \left(s\right)$;3) 所有的最优策略均能够获得最优的动作价值函数, $q_{\pi_*} \left(s, a\right) = q_* \left(s, a\right)$;4) Sutton, R. S., & Barto, A. G. (2018). Reinforcement learning: An introducti…;5) CS234: Rei…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「马尔可夫模型」,本文给出了什么结论?

在「马尔可夫模型」部分,要点是:S_1, \cdots, S_t\right] $$ 马尔可夫过程 也就是认为当前状态捕获了历史中所有相关的信息。根据系统状态是否完全可被观测以及系统是自动的还是受控的,可以将马尔可夫模型分为 4 种,如下表所示: 马尔可夫链(Markov Chain,MC)为从一个状态到另一个状态转换的随机过程,当马尔可夫链的状态只能部分被观测到时,即为 隐马尔可夫模型(Hidden Markov Model,HMM) ,也就是说观测值与系统状态有关

关于「马尔可夫过程」,本文给出了什么结论?

在「马尔可夫过程」部分,要点是:DP)也是马尔可夫链,但其状态转移取决于当前状态和采取的动作,通常一个马尔可夫决策过程用于计算依据期望回报最大化某些效用的行动策略。部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP)即为系统状态仅部分可见情况下的马尔可夫决策过程。 马尔可夫决策过程 $$ \mathcal{P}_{ss'} = \mathbb{P} \left[S_t = s' | S_{t