Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
NEWS 约 6 分钟

美团搜索3.0:LLM表征进排序

美团把 LLM 变成搜索排序信号:从识别同义表达,走向可复用的语义表征体系。

IMAGE — 美团技术团队

你搜“宠物 SPA+洗澡”,商家写的却是“萌宠清洁护理套餐”。人能看出两者说的是一回事,依赖关键词的搜索系统却可能错过。服务零售还有家政、丽人、休闲娱乐等大量细分品类,商品描述不统一,用户表达也很分散。美团这项工作的目标,就是让排序系统不只看“字面是否相同”,还看“意思是否接近”。

做法并不神秘:先让大语言模型(LLM)把搜索词、商家和商品压缩成一串数字,再把数字之间的相似程度交给原有排序模型。美团把这条演进路线称为“搜索 3.0”。以下时间、数据和效果均来自美团技术团队公开文章,尚无独立信源交叉验证。

先把大模型变成一种排序信号

搜索系统通常先找出一批可能相关的结果,再进行排序。精排模型——候选范围缩小后负责最后一轮细致打分的模型——可以综合语义、行为和质量等信号,但留给每次查询的计算时间有限。

美团没有让 LLM 直接接管整个排序过程,而是让它生成语义表征(embedding):把一段文字压成一个数字向量,意思越接近,向量通常也越接近。系统再计算 Query(用户搜索词)与商家或商品向量的 cosine 相似度。cosine 相似度衡量两个向量方向有多接近,可以粗略理解为一把“语义吻合度尺子”。

据美团团队介绍,服务零售搜索排序团队从 2025 年第四季度到 2026 年第二季度进行了三期实践:先验证单点特征,再升级表征体系,最后尝试跨场景迁移复用。三期共完成 3 个 Launch Review(上线评审),均已全量上线。文章称取得线上正向收益,但没有完整公开三期各自的实验数据,因此不能把上线本身视为外部验证。

第一期,先证明这条路能走

第一期选择一个小参数量开源 LLM,并进行全参数微调——把模型内部参数整体重新训练。文章没有披露具体模型名称和参数规模。

关键难题是:怎样分别得到搜索词和商家的向量,同时又让模型学习两者是否匹配?团队在输入中加入三个特殊 Token——模型可以学习的特殊标记。<|query|> 汇总搜索词,<|item|> 汇总商家信息,<|qi|> 汇总双方信息。

但三种标记放在同一段输入里,会发生“偷看答案”的问题。训练搜索词向量时,如果模型已经看到后面的商家信息,它生成的向量就不再独立;真正上线后,只输入搜索词,结果便可能失真。

团队用 Attention Mask 解决这一点。Attention Mask 是一张“哪些文字可以互相参考”的权限表。训练时,同一条输入经过三次独立计算:第一次只让 <|query|> 看搜索词,第二次只让 <|item|> 看商家信息,第三次才让 <|qi|> 看完整内容。这样得到的搜索词和商家向量可以分别生成、独立存储。

三个特殊标记在模型最后一层产生的中间结果,还会经过两层 MLP——一种负责压缩和变换数字的轻量神经网络——从模型原始维度依次变为 512 维和 64 维,中间使用 ReLU 与 LayerNorm,最终得到 64 维语义表征。

它如何学会“匹配”?

一期训练数据来自近两个月的服务零售精排日志,共 3,000 余万条。下单、点击但未下单、未点击样本的比例是 1:3:6。

训练同时完成两个任务:Loss_1 根据搜索词与商家向量的 cosine 相似度判断是否匹配;Loss_2 根据融合了双方信息的向量预测点击率。总目标为:

L=Loss1+Loss2

前一个任务要求独立向量本身有用,后一个任务则让它贴近下游排序所关心的用户行为。训练完成后,系统离线生成 Query 和商家向量,存入 Hive 表,并按天增量更新,因此不必在用户每次搜索时都现场运行 LLM。

相似度也没有作为一个连续数字直接送入精排。团队把它切成 10 个区间,为每个区间学习一个 12 维向量,再拼接进现有特征。这样做是为了方便精排模型组合特征,并降低对数值噪声的敏感程度。

美团文章报告称,离线评估中,点击 NDCG 提升 9bp,下单 NDCG 提升 13bp。NDCG 是衡量相关结果是否排得足够靠前的指标;bp 是万分之一。在线实验则在 2025 年 9 月 18 日至 10 月 1 日进行,覆盖 20% 流量、持续 14 天。团队称大盘搜索支付订单提升 0.20%,服务零售订单提升 0.27%;长尾 NDCG@5 提升 2.21 个百分点,长尾 BadCase@1 下降 2.96 个百分点。这些均为团队自报结果。

真正值得看的,是从特征走向体系

一期只解决了 Query 与商家的匹配,还没有纳入商品;全参数微调成本较高;训练目标偏向点击;三次独立计算也不够高效。二期因此把样本扩展为 Query、正商品、正商家、难负商品、难负商家五部分。“难负样本”指看起来很像正确答案、但用户没有选择的候选,它迫使模型学习更细的区别。

二期还转向对比学习——不只判断单个结果是否匹配,而是学习正样本应该比负样本更靠近 Query。这更贴近排序要解决的“多个候选谁更合适”。团队构建了 2,766 万条训练样本,并把微调方式改为 LoRA:只训练少量附加参数,以降低训练和维护成本。

文章还记录了两个克制但实用的发现:复杂任务指令不一定更好,精简的信息陈述加总结引导反而取得最佳效果;未经筛选地加入 CPV(商品属性)后,排序评估下降。至少在这组实验里,更多文字并不自动带来更好的语义表征。

局限与未知

  • 公开材料对二期后半段和三期方案的描述不完整,无法据此还原跨场景复用的具体实现与效果。
  • 一期披露了实验周期和部分指标,但没有提供置信区间等更完整统计信息;三期整体收益也没有逐期量化。
  • 材料称体系覆盖 Query、POI(商家)和 Deal(商品),但已完整展示的工程细节仍主要集中在一期的 Query—商家方案。

供稿材料 SOURCES — 1

← 返回 2026-08-22 · 数据板块