嵌入模型做的事情很朴素:把离散符号放到连续空间里,让「靠近」开始有意义。词的位置来自它和谁一起出现;句子再把词的位置汇总;文章再按块汇总。你得到的不是摘要,是坐标。

生成时要注意

  • 切块太大,坐标被多个主题拉扯;太小,丢掉上下文。
  • 标题、小标题、代码块的权重不一样,一视同仁会脏。
  • 同一篇文章的多块向量,检索时要能回溯到块,而不是只回到整篇。

嵌入一旦成为基础设施,就要版本化。模型升级等于搬家。旧索引必须重建,不能靠「差不多也能搜」混过去。

坐标一旦进了检索库,就变成站点的长期资产。资产要有清单:哪一版模型、哪一种切块、哪一天重建。缺这三样,出了错你只能重做全部。

效率龙虾 会带着下面这段开聊

按文章《一个词怎么长成一篇文的坐标:嵌入不是压缩,是位置》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是嵌入模型,它如何工作?

嵌入模型把离散符号如词语放到连续向量空间中,让语义相似的词在空间里靠近。词的位置来自它与其他词的共现,句子再汇总词的位置,文章按块汇总。这样,你得到的是语义坐标,而不是压缩摘要,便于后续搜索和分析。

为什么说嵌入是坐标而不是压缩?

嵌入的主要功能是提供词在语义空间中的位置坐标,让“靠近”有意义,支持相似性计算。它不像压缩那样减少数据大小,而是构建空间关系,用于检索和生成。正文强调你得到的是坐标,不是摘要。

生成嵌入时,切块大小不当会导致什么问题?

如果切块太大,坐标会被多个主题拉扯,导致语义模糊;如果太小,则会丢掉必要的上下文信息,影响嵌入质量。所以,切块需要平衡大小,避免这些陷阱,确保坐标准确。

如何处理文章中的标题、小标题和代码块?

正文指出标题、小标题和代码块的权重不同,不能一视同仁。需要区分处理,比如给予不同权重,否则会导致嵌入质量变差,出现“脏”数据。这有助于更精确地生成语义坐标。

为什么嵌入模型升级时需要重建索引?

因为模型升级相当于搬家,向量空间变化,旧索引不再准确。必须重建旧索引,不能依赖“差不多也能搜”混过去。资产要有清单:模型版本、切块方式和重建日期,否则出错只能重做全部。

检索中如何让多块向量回溯到具体块?

同一篇文章的多块向量,检索时要能关联到源块,而不是只返回整篇文章。这需要设计索引结构,确保每个向量可追溯,避免丢失上下文,提高检索精度。