嵌入模型做的事情很朴素:把离散符号放到连续空间里,让「靠近」开始有意义。词的位置来自它和谁一起出现;句子再把词的位置汇总;文章再按块汇总。你得到的不是摘要,是坐标。
生成时要注意
- 切块太大,坐标被多个主题拉扯;太小,丢掉上下文。
- 标题、小标题、代码块的权重不一样,一视同仁会脏。
- 同一篇文章的多块向量,检索时要能回溯到块,而不是只回到整篇。
嵌入一旦成为基础设施,就要版本化。模型升级等于搬家。旧索引必须重建,不能靠「差不多也能搜」混过去。
坐标一旦进了检索库,就变成站点的长期资产。资产要有清单:哪一版模型、哪一种切块、哪一天重建。缺这三样,出了错你只能重做全部。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是嵌入模型,它如何工作?
嵌入模型把离散符号如词语放到连续向量空间中,让语义相似的词在空间里靠近。词的位置来自它与其他词的共现,句子再汇总词的位置,文章按块汇总。这样,你得到的是语义坐标,而不是压缩摘要,便于后续搜索和分析。
为什么说嵌入是坐标而不是压缩?
嵌入的主要功能是提供词在语义空间中的位置坐标,让“靠近”有意义,支持相似性计算。它不像压缩那样减少数据大小,而是构建空间关系,用于检索和生成。正文强调你得到的是坐标,不是摘要。
生成嵌入时,切块大小不当会导致什么问题?
如果切块太大,坐标会被多个主题拉扯,导致语义模糊;如果太小,则会丢掉必要的上下文信息,影响嵌入质量。所以,切块需要平衡大小,避免这些陷阱,确保坐标准确。
如何处理文章中的标题、小标题和代码块?
正文指出标题、小标题和代码块的权重不同,不能一视同仁。需要区分处理,比如给予不同权重,否则会导致嵌入质量变差,出现“脏”数据。这有助于更精确地生成语义坐标。
为什么嵌入模型升级时需要重建索引?
因为模型升级相当于搬家,向量空间变化,旧索引不再准确。必须重建旧索引,不能依赖“差不多也能搜”混过去。资产要有清单:模型版本、切块方式和重建日期,否则出错只能重做全部。
检索中如何让多块向量回溯到具体块?
同一篇文章的多块向量,检索时要能关联到源块,而不是只返回整篇文章。这需要设计索引结构,确保每个向量可追溯,避免丢失上下文,提高检索精度。