训练大模型前,团队得先给海量语料“洗菜”:解析、清洗、去重、打分,再组装成训练样本。数据一多,结果往往散落在上百张表里,补一个特征也可能牵动整条流水线。蚂蚁集团的 OmniTable 试图把这件事简化:把文本、质量分、去重标记等字段汇集成一张逻辑宽表,同时允许底层数据继续分开存储和计算。
论文披露,OmniTable 已在生产环境管理超过 35 PB、3050 亿条训练数据;1 PB 约等于 1000 TB。在一项真实的 SFT(监督微调,即用整理好的示例继续训练模型)数据准备任务中,作者称端到端周期从约14天缩短到2.5天,约提速5.6倍,人工步骤也从45步降至12步。关键不只是“表变宽”,而是系统会记录每个特征的版本、依赖和来源,并自动补算缺失环节。该论文获 VLDB 2026 工业赛道最佳论文;这一赛道侧重经受真实生产规模与工程约束的系统成果。