范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「流形学习」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。
降维
在之前的 博客 中,我们曾经介绍过 PCA 方法及其降维的作用。在原始数据中各个特征之间存在着一定的信息冗余,随着特征的不断增加就容易出现“维数灾难”的问题,因此降维的目的就是在尽可能多的保留原始信息的同时减少数据的维度。一般情况下我们将降维方法分为: 线性降维方法 和 非线性降维方法 ,线性降维方法的典型算法有:
在调研流形相关概念时,发现要想深一步的理解这些概念还是需要详细的了解微分几何相关的内容,鉴于本文的目的主要是介绍流形学习 (主要是降维角度) 的相关内容,因此我们对流形仅做一些粗略的介绍。
流形
“ 流形 ”是英文单词 Manifold 的中文译名,它源于德文术语 Mannigfaltigkeit,最早出现在 Riemann 1851 年的博士论文中,用来表示某种属性所能取到的所有值 7 。为了更好的理解流形,我们先引入几个概念:
拓扑结构 (拓扑) 任意给定集合 $X$ 上的一个 拓扑结构 (拓扑) 是 $X$ 的某些特定子集组成的集合 $\tau \subset 2^X$ ,其中那些特定子集称为 $\tau$ 所声明的 开集 ,同时满足如下性质:
流形学习
上图中给出了一些拓扑空间的示例,其中左侧 4 个为正确示例,右侧 2 个为错误示例。右上角的缺少了 {2} 和 {3} 的并集 {2, 3},右下角的缺少了 {1, 2} 和 {2, 3} 的交集 {2}。
同胚 两个拓扑空间 $\left(X, \tau_X\right)$ 和 $\left(Y, \tau_Y\right)$ 之间的函数 $f: X \to Y$ 称为 同胚 ,如果它具有下列性质:
MDS
如果拓扑空间是一个几何物体,同胚就是把物体连续延展和弯曲,使其成为一个新的物体。因此,正方形和圆是同胚的,但球面和环面就不是。用一幅图形象的理解同胚,例如下图所示的 咖啡杯 和 甜甜圈 8 :
最后我们回过头来解释到底什么是 流形 ?流形并不是一个“形状”,而是一个“空间” 9 。最容易定义的流形是 拓扑流形 ,它局部看起来象一些“普通”的欧几里得空间 $\mathbb{R}^n$ ,一个拓扑流形是一个局部同胚于一个欧几里得空间的拓扑空间。根据 Whitney 嵌入理论 10 ,任何一个流形都可以嵌入到高维的欧氏空间中。例如,地球的表面可以理解为一个嵌入 3 维空间的 2 维流形,其局部同胚于 2 维的欧式空间,对于一个球体的表面,用极坐标的形式可以表示为
ISOMAP
$$ \begin{equation} \begin{split} x &= r \sin \theta \cos \phi \\ y &= r \sin \theta \sin \phi \\ z &= r \cos \theta \end{split} \end{equation} $$
假设 $Y$ 为一个欧式空间 $\mathbb{R}^d$ 的一个 $d$ 维流形, $f: Y \to \mathbb{R}^D$ 为一个光滑嵌入,对于 $D > d$ ,流形学习的目的就是根据空间 $\mathbb{R}^D$ 中的观测数据 $\{x_i\}$ 重构 $Y$ 和 $f$ 的过程。隐含数据 $\{y_i\}$ 由 $Y$ 随机生成,通过光滑嵌入 $f$ 生成观测数据,即 $\{x_i = f\left(y_i\right)\}$ ,所以我们可以将流形学习的问题看做是对于一个给定的观测数据一个生成模型的反向过程 11 。
LLE
第一个为 瑞士卷 (Swiss Roll) ,其形状和我们日常生活中的瑞士卷相似;第二个为 S 形曲线 (S Curve) ;第三个为一个被 切断的球面 (Severed Sphere) 。
多尺度变换 (MDS, Multi-Dimensional Scaling) 3 是一种通过保留样本在高维空间中的不相似性 (Dissimilarity) 降低数据维度的方法,在这里不相似性可以理解为样本之间的距离。因此,根据距离的度量方式不同可以将其分为度量型 (metric) MDS 和 非度量型 (non-metric) MDS。度量型 MDS 通过计算不同样本之间距离的度量值进行降维,而非度量型则仅考虑距离的排序信息,在此我们仅对度量型 MDS 做简单介绍。
值得单独记下的点
- 主成份分析 (PCA, Principal Component Analysis) 1
- 线性判别分写 (LDA, Linear Discriminant Analysis) 2
- 多尺度变换 (MDS, Multi-Dimensional Scaling) 3
- 局部线性嵌入 (LLE, Locally Linear Embedding) 5
- 拉普拉斯特征映射 (LE, Laplacian Eigenmap) 6
- 空集和全集是开集,即 $\varnothing, X \in \tau$
- 反函数 $f^{−1}$ 也是连续的 ( $f$ 是开映射)
- 计算样本的距离矩阵 $\boldsymbol{D} = \left[d_{i, j}\right] = \left[dist \left(x_i, x_j\right)\right]$ 。
落地时建议先做的 5 件事
- 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
- 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
- 多智能体只在单智能体触到上下文或专业边界时再拆。
- Token、微调和压缩都要有对照数字,避免口号式优化。
- 结论写成可检查清单:接口、超时、评测集、回滚版本。
和智能体产品怎么接
龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:在之前的 博客 中,我们曾经介绍过 PCA 方法及其降维的作用。在原始数据中各个特征之间存在着一定的信息冗余,随着特征的不断增加就容易出现“维数灾难”的问题,因此降维的目的就是在尽可能多的保留原始信息的同时减少数据的维度。一般情况下我们将降维方法分为: 线性降维方法 和 非线性降维方法 ,线性降维方法的典型算法有: 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:在之前的 博客 中,我们曾经介绍过 PCA 方法及其降维的作用。在原始数据中各个特征之间存在着一定的信息冗余,随着特征的不断增加就容易出现“维数灾难”的问题,因此降维的目的就是在尽可能多的保留原始信息的同时减少数据的维度。一般情况下我们将降维方法分为: 线性降维方法 和 非线性降维方法 ,线性降维方法的典型算法有:
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 主成份分析 (PCA, Principal Component Analysis) 1;2) 线性判别分写 (LDA, Linear Discriminant Analysis) 2;3) 多尺度变换 (MDS, Multi-Dimensional Scaling) 3;4) 局部线性嵌入 (LLE, Locally Linear Embedding) 5;5) 拉普拉斯特征映射 (LE, Laplacian Eigenmap) 6。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「降维」,本文给出了什么结论?
在「降维」部分,要点是:: 在调研流形相关概念时,发现要想深一步的理解这些概念还是需要详细的了解微分几何相关的内容,鉴于本文的目的主要是介绍流形学习 (主要是降维角度) 的相关内容,因此我们对流形仅做一些粗略的介绍。 流形 “ 流形 ”是英文单词 Manifold 的中文译名,它源于德文术语 Mannigfaltigkeit,最早出现在 Riemann 1851 年的博士论文中,用来表示某种属性所能取到的所有值 7 。为了更好的理解流形,我们先引入几个概念:
关于「流形」,本文给出了什么结论?
在「流形」部分,要点是:曾经介绍过 PCA 方法及其降维的作用。在原始数据中各个特征之间存在着一定的信息冗余,随着特征的不断增加就容易出现“维数灾难”的问题,因此降维的目的就是在尽可能多的保留原始信息的同时减少数据的维度。一般情况下我们将降维方法分为: 线性降维方法 和 非线性降维方法 ,线性降维方法的典型算法有: 在调研流形相关概念时,发现要想深一步的理解这些概念还是需要详细的了解微分几何相关的内容,鉴于本文的目的主要是介绍流形学习 (主要是降维角度) 的相