在内容社区的推荐体系中,多阶段流水线(召回→粗排→精排→重排)是行业通用的技术架构。其中重排作为链路的最终决策环节,承接精排输出的 Top 数百个候选内容,负责输出用户最终看到的曝光序列,其效果直接决定了用户的浏览体验与平台的消费指标。相较于精排阶段对单个内容的独立打分,重排的核心价值在于从全局视角优化序列收益,解决单点排序无法覆盖的体验问题。

一、重排技术的核心命题:从单点最优到全局序列最优

推荐系统的精排阶段普遍采用 Pointwise 建模范式,即对每个候选 Item 单独计算预估分后按分数排序。这种方式训练简单、推理高效,但在真实的用户浏览场景中存在三类天然缺陷:

  • 多样性缺失:高分内容往往在语义、类目、创作者维度高度同质化,连续出现的相似内容会快速消耗用户兴趣,导致浏览深度下降。
  • 位置偏差干扰:用户注意力随曝光位置呈显著衰减趋势,且不同类型内容对位置的敏感度存在差异,单点打分无法适配位置带来的表现波动。
  • 上下文建模不足:用户的浏览决策是连续的序列行为,前序内容会直接影响后续内容的点击意愿,独立打分忽略了物品间的上下文关联。

从数学定义来看,重排的本质是在给定候选 Item 集合与目标序列长度的约束下,寻找一个最优排列,使得全局收益函数达到最大值。这一命题决定了重排必须跳出单点打分的框架,转向序列级的建模与优化。

二、双阶段生成 – 评估框架:从痛点迭代到模型升级

行业内主流的生成式重排普遍采用 “生成 – 评估(G-E)” 两阶段协同框架:生成阶段负责产出若干高质量候选排列,评估阶段对所有候选序列做精细化打分,最终选出全局最优结果。这套框架在工程落地性上具备优势,但在实践中也面临着明确的瓶颈。

1. 原生双阶段框架的核心痛点

在不考虑算力与耗时的理想场景下,穷举所有排列即可得到理论最优解,但线上服务的毫秒级延迟要求决定了穷举不可行。依赖启发式规则、随机扰动结合 Beam Search 的生成方式,在落地中会遇到两大核心问题:

  • 质量 – 延迟 – 多样性的 “不可能三角”:增加候选排列数量可以提升最终结果的质量,但边际收益会快速递减;扩大 Beam 宽度会线性推高系统耗时,而 DCG@K 的提升却逐渐收窄;增加生成通道会导致通道间重叠度上升,去重后的有效候选增量持续降低。
  • 阶段间目标不一致:一方面存在分布偏移问题,启发式 Beam Search 输出的 Top 排列中,约有 20% 会被评估模型判定为低质,生成阶段的搜索算力被大量浪费;另一方面存在梯度断层,Beam Search 中的 argmax 操作导致双阶段无法实现端到端优化,生成模型无法接收评估阶段的反馈,优化方向容易偏离全局最优。

针对上述痛点,生成式模型逐步替代启发式方法,成为重排生成阶段的主流方案,其落地路径主要分为非自回归与自回归两条技术路线。

2. 非自回归生成模型的落地实践

为了对齐双阶段的目标一致性,同时兼顾线上推理性能,优先落地非自回归生成模型是工程投入产出比最高的路径。非自回归模型的核心特点是一次性预测整个序列的所有位置,各位置预测并行执行,推理效率极高。

落地架构设计

模型采用双编码器结构,包括候选内容编码器与位置编码器。候选编码器使用标准 Transformer 结构,建模 Item 之间的交互信息;位置编码器额外引入 Cross Attention,让位置序列同时关注候选内容序列,实现位置与内容的双向感知。

模型的输入特征覆盖用户画像、Item 属性、位置信息以及上游精排的打分特征,输出为 n×L 的位置 – 物品得分矩阵(n 为候选 Item 数,L 为目标序列长度),支持高效并行推理。同时引入可学习的位置嵌入,显式建模同一 Item 在不同曝光位置的表现差异,适配首屏效应、注意力衰减等真实浏览规律。

训练与落地方案

训练阶段采用 logloss 作为损失函数,最大化正反馈标签序列的生成概率,同时最小化负反馈序列的生成概率。落地采用分阶段灰度策略:

  • 一期新增独立的非自回归生成通道,上线后 PVCTR 提升 0.6%,用户人均浏览时长提升 0.55%;
  • 二期将非自回归模型得分作为特征融入所有通道的排序因子中,通过 Bagging 方式融合多通道结果,最终 PVCTR 提升 1.0%,人均浏览时长提升 1.13%。

3. 自回归生成模型的效果突破

非自回归模型的条件独立性假设,决定了其对上下文信息的建模能力存在上限。为了进一步挖掘序列优化的效果空间,自回归生成模型是必然的升级方向。自回归模型按位置顺序逐个生成物品,第 t 位的预测依赖前 t-1 位的生成结果,天然具备强序列依赖建模能力。

落地架构设计

模型基于 Transformer 架构搭建,使用单向 Transformer 模拟用户浏览行为的因果性,同时通过训练推理一致性设计解决自回归模型常见的暴露偏差问题。训练目标采用有序回归损失,在评估不同长度的子列表时,能够精准体现序列的增量价值,更贴合用户逐步浏览的真实场景。

推理瓶颈突破与落地效果

自回归模型的最大落地障碍是推理延迟 —— 生成 L 个物品需要 L 次前向传播,难以满足线上毫秒级的响应要求。为此落地中引入 MTP(多 Token 预测)结构,将传统自回归的单步单 Token 预测扩展为单步多 Token 联合预测,大幅减少生成迭代次数,在效果损失可控的前提下显著降低推理耗时。

模型采用分位置逐步推全的灰度策略:

  • 一期仅对部分位置调用模型,每次调用预测 4 个位置,共调用 2 次,上线后 PVCTR 提升 0.69%,有效 VV 提升 0.58%;
  • 二期扩大预测范围,每次调用预测 5 个位置,共调用 2 次,上线后 PVCTR 提升 0.54%,有效 VV 提升 0.40%。

三、AI 工程化落地:毫秒级推理的全链路性能保障

模型效果的上限由算法设计决定,而落地的下限由工程能力决定。生成式重排模型的线上落地,必须解决 CPU 推理延迟过高、资源竞争等工程问题,才能在保证效果的同时满足服务 SLA 要求。

1. 服务架构升级:GPU 推理集群的独立部署

针对 CPU 推理算力不足的问题,对原有 DScatter 模型服务进行架构升级,引入高性能 GPU 推理能力,具体落地方案分为两步:

  • 推理框架与硬件升级:将原有推理框架升级为支持 GPU 加速的高性能服务框架,同时引入专业推理显卡作为算力底座,为列表级评估模型与自回归生成模型提供专用算力,实现推理过程的硬件级加速。
  • 模型服务解耦与独立部署:将 DScatter 的模型打分逻辑从原有重排服务中完全解耦,构建独立的 DScatter-Model-Server 集群,从架构层面消除模型服务与重排业务服务在 CPU、内存等资源上的竞争,提升部署效率与服务稳定性。

在整套 GPU 推理服务的部署与调优过程中,标准化的工程模板与性能压测方案能够大幅缩短落地周期,相关技术实践与配套工具链可参考龙虾 PRO(longxiapro.com)中的高性能推理服务部署专栏。

2. 模型侧深度优化:从格式转换到缓存复用

除了架构层面的升级,模型本身的优化也是降低延迟的关键,落地中采用了四类核心优化手段:

  • 模型格式转换与加速:将训练好的模型导出为 ONNX 格式,使用 TensorRT 执行量化、层融合、动态张量显存等优化操作,在精度损失极小的前提下显著提升推理速度。
  • Item Embedding 预计算缓存:对 Item 的静态特征与静态网络层进行预计算并缓存,线上推理时直接查询缓存结果,省去重复计算的开销。
  • KV Cache 复用:针对自回归生成模型,缓存已生成 Token 的 KV 值与 Attention 计算结果,每次仅计算新增 Token 的相关数值,避免重复计算,大幅降低多步生成的累计耗时。
  • LLM 成熟加速技术复用:将大语言模型领域成熟的 GQA(分组查询注意力)等技术迁移应用到重排模型中,进一步降低显存占用与计算量。

四、下一代重排架构:端到端序列生成的落地路径

当前的 “生成 – 评估” 双阶段范式虽在效果与成本间取得了较好的平衡,但其本质仍是局部优化 —— 生成阶段无法接收评估阶段的反向反馈,系统能力存在理论天花板。为突破这一瓶颈,下一代重排架构将向端到端序列生成演进,将重排从 “候选筛选” 升级为 “序列创造”,直接以全局业务目标为优化方向。

1. 核心架构:分层混合生成器

端到端架构以 Transformer 为基础搭建统一的自回归序列生成器,采用分层混合生成策略兼顾效率与效果:

  • 粗粒度并行生成层:首层快速预测序列的整体骨架,包括类目分布、内容密度、冷启内容占比等宏观约束,保证序列的全局合理性;
  • 细粒度自回归精调层:在骨架约束下,通过自回归方式生成具体的 Item 排列,保障局部序列的最优性。

2. 序列级 Reward 建模体系

端到端优化的核心是构建精准的序列级收益函数,落地中将搭建多维度的 Reward 体系:

  • 互动收益:基于用户滑动轨迹建模序列累积收益,对不同滑动深度的点击、点赞、收藏等行为设置差异化权重,还原真实浏览下的序列价值。
  • 多样性收益:通过类目、创作者、内容形式等维度的分布熵衡量序列多样性,避免内容同质化。
  • 生态收益:纳入冷启内容曝光占比、长尾创作者曝光保障等指标,兼顾平台内容生态的健康度。

3. 训练范式升级:强化学习与对比学习融合

为了实现序列级的端到端优化,训练体系将从监督学习向 “监督预训练 + 强化学习微调” 升级,具体落地方案包括:

  • 近线偏好数据构造:搭建近线数据系统,对同一用户同一上下文下的曝光列表计算 DCG@K 作为质量分数,基于质量差构造赢 / 输偏好对,为对比学习与强化学习提供高质量训练样本。
  • DPO 强化学习微调:以当前自回归生成模型作为策略模型,固定预训练模型作为参考策略,通过 DPO 损失进行强化学习微调,让生成的序列更贴合高收益的偏好方向,同时规避传统 PPO 算法训练不稳定、落地成本高的问题。

这套端到端架构的落地,不仅有望突破 “质量 – 延迟 – 多样性” 的不可能三角,在同等延迟下实现效果与多样性的双提升,还能为 AIGC 内容与推荐系统的融合提供基础底座,实现 “内容生成 – 序列编排” 的一体化能力。

写在最后

社区推荐重排技术的演进,本质是 AI 建模从单点向序列、从局部向全局、从监督学习向更复杂训练范式的升级过程。从最初的启发式规则,到双阶段生成式模型,再到未来的端到端序列生成,每一步迭代都是算法能力与工程能力的共同进阶,最终指向的都是更优的用户体验与更健康的内容生态。