generate-rec-recall/2026-08-31-生成式召回研究增量周报-2026-08-31.md

生成式召回研究增量周报|2026-08-31

本期检查 2026 年 8 月 31 日 arXiv 公告批次,共精选 4 篇。没有发现新的 SID、向量量化或生成式解码专项工作;最强信号来自索引与表示层:动态时间过滤、选择性多模态对齐,以及用粗粒度召回加细粒度 late interaction 控制在线成本。

本期核心判断

第一优先级:直接影响召回与在线索引

1. TiGER:支持任意时间区间的版本化统一图索引

类型: arXiv 预印本;未确认公开代码
A Versioned Unified Graph Index for Dynamic Timestamp-Aware Nearest Neighbor Search

真正新增: TiGER 将不同时间版本的连边整合进一个图索引,使任意时间区间查询可以直接沿有效连边搜索,不需要先召回再过滤,也不需要为每个时间分段建立独立子图。作者将这一结构称为 integrated versioned connectivity。

主要结果: 相比后过滤和分段子图基线,论文报告 QPS 最高提升 5 倍且检索准确率基本不损失。摘要没有披露数据规模、具体硬件和尾延迟,暂不能直接外推到直播生产环境。

为什么重要: 直播主播集合具有强时间约束:开播、关播、商品状态和内容版本都持续变化。若先生成 SID 再按在线集合过滤,模型概率可能大量浪费在已经失效的候选上;时间感知索引可作为生成式召回的并行通道或候选校验层。

建议实验: 保持现有生成器不变,构建带 valid_from/valid_to 的主播 ANN 快照,对比 A:当前在线集合后过滤;B:按小时分片索引;C:统一版本化索引。统一候选规模,观察 Recall、无效候选率、unique coverage、QPS、p95/p99 和索引更新时间。

证据与复现: ⚠️ 仅预印本、未确认代码;5 倍 QPS 是作者离线实验结果,缺少生产 A/B。

2. PULSAR:先用压缩表示召回,再用细粒度 MaxSim 精排

类型: EMNLP 2026 Industry Track 已接收;生产系统报告
PULSAR: Pooled Unified Late-Interaction Search and Retrieval for Enterprise Visual Document RAG

真正新增: PULSAR 以视觉页面多向量为基础,先用紧凑 pooled summary 做第一阶段召回,再对少量候选使用更细粒度 pooled representation 执行精确 MaxSim。这样保留 late interaction 的局部匹配能力,同时避免全库读取全部 token 向量。

主要结果: 在 ViDoRe V3 上,中位向量检索延迟相对未池化方案降低 15.1 倍,NDCG@10 与 Recall@10 绝对损失低于 0.01;并发下 QPS 约提高 88 倍。生产中位向量检索延迟为 156 ms,系统已覆盖约 240 万页。

为什么重要: 它为主播多向量召回提供了可落地模板:粗粒度主播摘要负责大规模候选生成,封面局部、文本、语言或动态内容向量只在 Top-M 上做 late interaction。该路线也可作为 SID 生成召回的 verifier。

建议实验: 用户侧输出近期/长期两个兴趣向量,主播侧保留身份/封面两个向量;A 使用单向量 ANN,B 使用压缩摘要召回,C 在 B 的 Top-M 上增加 max/MaxSim 重排。报告 Recall、长尾与 unique coverage、额外显存、T4 p95/p99,并扫描 M=50/100/200。

证据与复现: ⚠️ 已接收且有真实生产规模,但无公开代码;88 倍 QPS 相对未池化基线,不能直接视为相对成熟 ANN 的收益。

第二优先级:表示选择与轻量建模

3. AMUR:只对齐真正与用户兴趣相关的模态信息

类型: CIKM 2026 已接收;代码公开
Information-Guided Selective Modality-Interest Alignment for Multimodal Recommendation · 代码

真正新增: AMUR 不默认文本、图像等模态都应被等权融合,而是从信息论角度增强与用户兴趣相关的模态共享信息,同时抑制弱相关信号,并保留模态特有的互补信息。实现上先用行为信号修正模态图,再做选择性跨模态对齐。

主要结果: 作者在三个公开数据集上报告优于多种多模态推荐基线,但摘要没有给出绝对指标、延迟或线上 A/B。代码基于公开 MMRec 框架,具备离线复现基础。

为什么重要: 这直接对应主播内容 embedding 中“大量特征与当前用户无关”的问题。若将所有内容特征直接 concat 后做 RQ-KMeans,码本可能优先编码强方差但弱偏好的信息,降低同前缀内的行为一致性。

建议实验: 在重建 SID 前训练一个轻量 modality gate,只允许用户行为可解释的视觉/文本/语言分量参与融合;对比等权融合、全局固定权重和用户条件门控。观察量化误差、每层码本熵、同前缀行为纯度、Recall 与 unique coverage。

证据与复现: ✅ CIKM 2026 已接收并公开代码;⚠️ 仅公开离线数据,无线上结果和生成式 SID 实验。

4. HubMixer:用少量潜在 Hub 处理异构特征交互

类型: 工业预印本;快手线上自报;未确认公开代码
HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation

真正新增: HubMixer 不让用户、物品、行为、上下文和业务 token 在原始异构空间中全量互相混合,而是先通过 cross-attention 归纳到少量 learnable hubs,在更干净的潜空间完成高阶交互,再让原 token 有条件地读取 Hub 结果。

主要结果: 作者报告多个工业离线任务优于强基线,并在快手短视频招聘业务中带来简历投递转化率 +5.48%,已完成生产部署。摘要未披露参数量、具体延迟、消融细节和代码。

为什么重要: 对浅层 Encoder,这比简单从 1 层增加到 2 层更有诊断价值:模型可能不是深度不足,而是所有历史 SID、action 和用户属性被无差别混合。少量 Hub 可以限制交互路径并控制 T4 成本。

建议实验: 保持 Encoder 层数为 1,将历史 SID、action 和用户属性压入 4/8/16 个 Hub,再回写到历史 token;对比原始 self-attention 和直接两层 Encoder。报告 Recall、unique coverage、Hub 使用熵、参数量、显存与 T4 p99。

证据与复现: ⚠️ 工业自报、无公开代码;线上任务是招聘转化,不是生成式主播召回。

本期建议优先级

  1. 先做 PULSAR 式 Top-M verifier: 不改 SID 和主生成器,仅增加多向量轻量重排,判断低覆盖是否能被局部交互修复。
  2. 再做 AMUR 式 modality gate: 在量化前剔除与行为弱相关的内容分量,观察同前缀纯度是否改善。
  3. 建立时间索引诊断: 分开记录生成器命中、在线有效性和索引新鲜度,避免将无效主播过滤损失归因给模型。
  4. HubMixer 最后测试: 若现有一层 Encoder 对用户属性/action 利用率低,再用少量 Hub 替代直接加深网络。

筛选说明