你可以把分布式训练想成一群人共同拼一幅巨型拼图:每个人手很快,但如果交换拼图片总要排队,整体速度仍由“递东西”决定。Meta这次解决的正是机器之间搬运数据的问题:不仅做训练芯片,还把网络硬件、传输协议和通信软件放在一起设计。以下信息均来自Meta Engineering,尚无外部独立印证。
把网络搬到芯片旁边
Meta称,MTIA 300是其首款内置NIC chiplets和通信卸载引擎的自研训练芯片。NIC(Network Interface Card)就是负责连接网络、收发数据的硬件;这里准确说是把NIC做成chiplet放进芯片系统,并不等于它与计算裸片必然单片集成。
MTIA 300面向ranking and recommendation models(排序与推荐模型)的训练和推理优化。这类任务既要访问大量稀疏数据,也要频繁跨设备通信。内置NIC可以缩短加速器与网络之间的数据路径;通信卸载引擎则接手拆包、传输协调或集合通信等工作,让训练核心少做“搬运”,多做模型计算。
协议和软件也一起改
另一块拼图是MetaRoCE。Meta将它描述为一套从头设计、面向AI工作负载、运行于普通以太网的RDMA传输协议。RDMA允许一台机器直接读写另一台机器的内存,尽量绕开CPU和操作系统的逐层处理,减少加速器等待数据的时间。
Meta同时发布了MetaRoCE规范、参考软件实现和合规测试。芯片一侧,公司还将MTIA 300的通信库HCCL与硬件通信能力协同设计。重点不在某个零件单独跑得多快,而在芯片、网络和软件能否用同一套节奏工作。
为什么值得关注
这次发布展示了一条完整路径:训练核心负责计算,NIC chiplets靠近网络入口,卸载引擎处理通信事务,HCCL组织软件调用,MetaRoCE负责机器间传输。推荐模型的瓶颈如果在数据搬运,单纯增加计算能力未必有效;协同设计试图优化整条链路。
局限与未知
- Meta声称MTIA 300训练推荐模型时优于通用GPU,但未披露性能数字、GPU型号、测试负载、集群规模或能效口径,不能视为已证实的普遍优势。
- 现有摘要未说明MetaRoCE发布物是否完整公开、采用何种许可证,以及能否与非Meta设备互操作。
- “普通以太网”“AI规模”和“从头设计”均是Meta的官方定位,目前缺少独立验证。