把一张客户流失表交给传统机器学习系统,工程师通常要选算法、调参数,再反复训练。表格基础模型想省掉这套流程:它先在大量任务上预训练,拿到新表后直接参考其中已有的样本和答案,预测其余行。这叫上下文学习——模型临场从当前表格找规律,不一定更新全部参数。
最近,这条赛道突然拥挤起来。LimiX-2、TabPFN-3.5 和 Causilo 都宣称在 TabArena 达到或超过榜首水平;TabICLv2、Mitra-v2 等模型也在逼近。问题在于,它们采用的榜单快照、参赛范围和评测设置并不完全相同。因此,“榜首换人”更准确的理解是:旧秩序已被打乱,但统一口径下的新冠军尚未坐实。下文数字均来自各论文或官方仓库,效果表述也主要是作者自报。
LimiX-2换了一个观察角度
LimiX-2 于 9 月 15 日提交论文。作者称,它在 TabArena、TALENT 和 BCCO 三套基准上超过现有的数据集专用模型与表格基础模型。
它的新意不只是扩大模型和训练数据。常见表格模型关注的是:给定一行特征 和参考表 ,如何预测答案 ,也就是:
LimiX-2 的 Contextual Mechanism Networks(CMNs,可理解为“上下文机制网络”)试图学习更完整的联合结构:
打个比方,前一种思路像看着病人的指标直接猜诊断;后一种则试图同时理解指标与诊断是怎样共同产生的。它用 Context-Conditional Masked Modeling(CCMM,即根据上下文补全被遮住的信息)预训练,数据来自结构因果模型生成的合成表格,覆盖不同的关系图、生成机制和观测过程。
论文摘要还称,模型对特征的注意力能编码直接因果关系,并用于恢复“因果骨架”——变量之间哪些存在直接连接。不过,摘要没有给出逐项成绩、运行成本、模型规模和许可条件,暂时无法据此完成同口径复核。
第一名为什么出现了三个版本?
Causilo 给出的成绩最具体。其官方仓库称,在排除 system methods、使用默认八成员集成的官方 TabArena 流程中,它在 Full 总榜、分类榜和回归榜均列第一,Elo 分别为 1792.9、1771.8 和 2032.6;Lite 三项也均列第一。不过,这仍是单一官方来源。
同在 9 月 15 日提交的 TabPFN-3.5,则称自己刷新了 TabArena 标准表格预测的最佳水平,并扩展到时间或分组切分、包含字符串、文本和图像的表格,以及类别很多、列数很宽的数据。它没有在摘要中给出可与 Causilo 逐项对齐的 Elo。TabICLv2 的 9 月 16 日版本又称,无需调参便可在 TabArena 和 TALENT 超过 RealTabPFN-2.5。
这不一定是谁写错了。基准榜单会受数据集构成、切分方式、调参预算、是否集成和参赛模型集合影响;Elo 也会随对手与榜单更新而变化。Full、Lite、分类、回归和 Overall 混在一起比较,就像拿不同赛道的成绩排一张总表。
真正拉开差距的,不只精度
速度已经成为第二条战线。TabPFN-3.5-Fast 据作者称最高可比 TabPFN-3 快 3 倍,同时保留大部分精度增益;增加推理计算的 TabPFN-3.5-Thinking,则最高比上一代 Thinking 快 12 倍。
Causilo 仓库给出的本地 H100 测试中,每千行拟合和预测分别用时 2.504 秒与 0.251 秒;同一张表里的 TabPFN-3 为 4.18 秒与 0.686 秒。但 Causilo 拟合时平均峰值显存为 8.15 GiB,TabPFN-3 为 0.88 GiB。它用更多显存换来了更快处理,不能只看秒数。
模型大小也未必决定名次。Mitra-v2 只有 7700 万参数,约为 16 亿参数 TabFM 的 5%。论文称,它在完整 TabArena 上达到 TabFM 和 EXAONE Tabular 的同级表现,并明显超过 TabPFN-3。EXAONE Tabular 约 2100 万参数,在其引用的较早榜单快照中以 1755 Elo 位列总榜第二,仅低于 TabFM 的 1765。
能下载,不等于能商用
许可差异可能比几个 Elo 更影响企业选择。TabFM 的代码采用 Apache-2.0,但默认预训练权重只允许非商业、非生产用途。Causilo 同样把代码和权重分开:代码是 Apache-2.0,权重允许非商业研究;商业部署以及托管、API 或 SaaS 服务需要另行取得许可。EXAONE Tabular 的公开代码较宽松,已发布权重则限非商业用途。
Mitra-v2 的作者称,模型权重、推理与微调代码以及评测结果都以 Apache-2.0 发布。若企业需要自行部署或继续开发,这比“代码开源、权重受限”少一道许可门槛。这里必须分别检查代码与权重;一句“开源可用”远远不够。
为什么值得关注
较早的榜单还由 TabFM、EXAONE Tabular 和 TabPFN-3占据前列,如今多个基础模型同时争夺领先位置。竞争焦点也从单一精度,扩展到速度、显存、模型大小、复杂表格适应能力和商用条件。
TabArena 还公开说明了一层利益冲突:部分维护者同时开发榜上模型,另一些人受雇于商业机构。其应对方式是由相互竞争的机构共同维护,并公开代码、预测结果和评测流程。换句话说,每次“登顶”不仅在考模型,也在考排行榜能否让外界复核。
局限与未知
- 三个领先声明缺少共同快照、相同参赛范围和逐项成绩,现阶段不能确认唯一新榜首。
- LimiX-2 与 TabPFN-3.5 的摘要未披露足够的逐项分数、资源消耗及完整许可信息,无法做严格的精度—成本—商用对照。
- 榜单成绩不代表模型在每家公司的每张表上都最好;数据形态、延迟预算和许可条件仍需单独验证。