分词是把文本切成模型能消化的单元。按空格、正则、手工规则在黏着语、错别字和一句里两种语言时很快失效。「gooood」和罕见形态会撑爆词表,也会让模型从未见过整个词。子词方法在「语义完整」和「词表可控」之间折中。字节对编码的核心很土:先把词拆成字符,统计相邻对的频率,每次把最热的一对焊成新符号,写进合并表,再对语料重写。词表从字母长到常见词根和词缀。罕见词会被拆成见过的零件,而不是直接变成未知。

训练时先统计字符,再循环:数当前表示里所有相邻对,选出最高频的,生成新符号,按合并表重写所有词,直到达到预定合并次数或没有对可合。编码时对每个词从字符走,反复应用已学的合并。教学实现常常从左到右合「第一对能合的」,顺序不同切法就不同。合并太少,词被切得碎;合并太多,细节被焊死。俄语比英语形态多,同样语料下独特符号更多,这不是算法失灵,是语言本身更碎。

特殊符号要先占位:填充、未知、句首、句尾。批数据要补齐到固定长度,并用掩码告诉模型忽略填充,否则注意力会去给空白打分。教学实现会把「useless」切成难看的碎片,因为合并次数少、也不显式尊重词素边界。生产分词器靠超大语料和数万次合并把这类伤口磨平。真上线时直接用训练好的词表,不要从笔记本里的教学循环开始。

落地清单

  • 词表大小和最大长度由句子长度分布决定,先看直方图再拍超参。
  • 新领域先看未知率和切得过碎的比例,不要只看训练损失。
  • 大小写、表情和复合符号要单独定规则,正则不是万能的。
  • 对比两种分词器时,同时看序列长度、未知比例和同一句话的切法,而不是只看词表数字。

模型看见的不是你以为的词,是合并表允许它看见的那些碎片。词表一旦定死,后面所有层都在这个字母表上说话。

效率龙虾 会带着下面这段开聊

按文章《分词不要死磕整词:字节对编码靠合并高频字对,才能扛住罕见词》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:空格和正则碰到错别字、黏着语和中英混排就会爆词表。子词从字符出发,反复合并最常见的相邻对。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:训练时先统计字符,再循环:数当前表示里所有相邻对,选出最高频的,生成新符号,按合并表重写所有词,直到达到预定合并次数或没有对可合。编码时对每个词从字符走,反复应用已学的合并。教学实现常常从左到右合「第一对能合的」,顺序不同切法就不同。合并太少,词被切得碎;合并太多,细节被焊死。俄语比英语形态多,同样语料下独特符号更多,这不是算法失灵,是语言本身更碎。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 词表大小和最大长度由句子长度分布决定,先看直方图再拍超参。;2) 新领域先看未知率和切得过碎的比例,不要只看训练损失。;3) 大小写、表情和复合符号要单独定规则,正则不是万能的。;4) 对比两种分词器时,同时看序列长度、未知比例和同一句话的切法,而不是只看词表数字。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「落地清单」,本文给出了什么结论?

「落地清单」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。

实践AI智能系统时常见误区有哪些?

常见误区包括:① 只追工具不建流程;② 没有权限/审计边界就上生产;③ 缺少指标与回滚方案;④ 把演示效果当成稳定 SLA。针对AI智能系统,请以正文中的检查清单与约束条件为准,小范围验证后再扩面。