你收到一个数据包:里面既有数据库,也有PDF、JSON、图表和视频。问题只有一句人话,但答案藏在多个文件里,还要计算、核对和反复搜索。普通聊天机器人容易顾此失彼。Data Agent——能自主拆解数据任务、选择工具并整理答案的AI系统——要做的,则更像带着一支分析小队把整件事跑完。
据美团技术官方文章,大众点评技术部在2026 KDD Cup复杂数据分析Data Agents赛道获得冠军和季军。团队把内部“问点仔”项目积累的Agent Harness能力迁移到比赛中。Harness可以理解为智能体的运行框架:它不直接替模型思考,而是负责组织任务、调用工具、处理报错,让长流程真正跑得起来。
这份战报也与美团被KDD 2026收录的8篇论文放在一起发布。它们从推荐基础模型、奖励建模、智能体搜索,一路延伸到广告与训练系统,展示了同一个方向:怎样让模型从“能回答”走向“能在真实业务约束下完成任务”。本文涉及的成绩与效果均来自美团技术这一单一信源,尚无材料中的KDD Cup官方榜单或其他参赛方信息交叉验证。
夺冠方案,核心不是一条更长的提示词
比赛要求智能体接收异构多模态数据包,再回答高层次的自然语言问题。“异构”是说数据形态各不相同;“多模态”则意味着除了文字和表格,还可能出现图表、视频。难点不只是读懂单个文件,而是跨文件搜索证据、调用SQL或Python计算,并把中间结果汇总成答案。
团队搭建了一套完整的Agent运行时。主智能体先探索文件,再选择SQL、Python等分析工具执行任务。遇到错误或超时,系统会读取反馈、控制运行时间并自动重试。这个设计很朴素,却直接针对长链路任务的薄弱处:步骤一多,任何一次工具调用失败,都可能让后面的推理全部失效。
它还把部分难题交给专门的子智能体。多模态视频理解子智能体负责视频,非结构化文档ETL子智能体负责从难以直接查询的文档中抽取和整理信息。ETL指提取、转换、加载数据,可以把它理解为先把散乱材料收拾成便于分析的格式。主智能体再汇聚各路结果,完成综合判断。
因此,这套方案的重点不是押注一个模型包办所有事情,而是把任务拆成可执行、可检查、可恢复的流程。供稿没有披露具体成绩指标、排名判定依据、模型配置或各模块贡献,现阶段无法判断哪项设计对冠军结果最关键。
八篇论文,把两条技术线连了起来
第一条线是工业推荐。推荐系统决定“给谁展示什么”,但外卖、零售和广告等入口的数据与目标并不一致。MTFM尝试用一个推荐基础模型处理多个场景。基础模型先从大规模、多场景数据中学习通用表示,再适配具体任务,从而减少每个场景单独训练模型的重复成本。
MTFM把跨域数据转成不同类型的Token——模型处理信息的基本单位——避免预先强行对齐输入;同时通过样本聚合、注意力结构和系统优化降低训练成本。美团称,它已替换多个业务主场景各自的独立精排模型并完成全量上线,但供稿没有给出明确指标与增幅。
另一条线更接近Data Agent。LocalSearchBench用国内9座城市、6类服务和900道多跳问答任务,测试16款大语言推理模型。多跳问答指答案需要连续查找和组合多条信息。美团称,现有模型普遍存在信息不完整、可信度不足,以及工具调用和多步推理缺陷。这解释了为什么竞赛方案要把文件探索、工具执行和失败恢复都纳入系统设计。
CDRRM则研究奖励建模——把“一个结果有多好”变成模型可学习或可比较的分数。它先对比好答案与差答案,找出关键区别,再汇总成简洁的评分准则。美团称,该方法在三个基准上达到最先进水平,并仅用3000个样本,让未微调模型超过全量微调基线。供稿未提供基准名称、具体分数和实验表格,因此这一效果仍只能按官方摘要理解。它也不是战报中明确披露的夺冠组件,而是同批研究中与智能体评估密切相关的一条技术线。
其余论文继续处理真实系统中的约束:JTransNet面向联合广告拍卖;UME处理跨市场ETA预测;GRAD研究自动竞价;HMAF协调保证交付广告与实时竞价;MTGenRec补齐PyTorch在大规模稀疏Embedding训练上的能力。美团称,MTGenRec相对TorchRec获得1.6至2.4倍训练加速,并从8卡扩展到128卡时保持近似线性扩展。
为什么这份战报值得看
它把“智能体落地”拆成了几个不那么炫目、却更实际的问题:数据能否被读出来,工具能否正确执行,失败后能否恢复,多个专门模块能否协同,以及结果能否被可靠评价。模型能力只是其中一环。
推荐基础模型也在做相似的事:不再为每个入口单独搭一套系统,而是先构建共享能力,再处理场景差异。两条线最终都指向同一个工程目标——减少人工编排,同时让系统适应更多真实任务。
局限与未知
- 冠军、季军及论文效果均只见于美团技术官方文章,供稿没有KDD Cup官方榜单作交叉佐证。
- 战报没有披露成绩指标、模型选择、提示设计、成本,以及各子智能体的消融实验,无法复原完整“冠军配方”。
- 多项“显著提升”或“最先进水平”论断缺少明确基线、绝对增幅和统计检验,应等待论文全文、代码与后续技术博客补足。