AI回答得快不快,往往取决于数据能否及时送到计算单元。Cerebras的新方案像是把计算和“草稿纸”放得更近:CS-4是一套机架级系统——把处理器、内存、互连和散热装进整套机柜——主攻AI推理,也就是让训练好的模型实际生成答案。
CS-4装有三颗晶圆级WSE-3 Turbo处理器。Cerebras不把晶圆切成许多小芯片,而是直接在整片晶圆上构建处理器,并利用更大的面积集成SRAM。SRAM是一种速度快、延迟低,但更占面积、成本更高的内存。公司称,单片设计还能缩短数据传输距离,减少多颗芯片之间来回搬运数据的负担。
Cerebras宣称,CS-4为每位用户提供的每秒token数可达GPU的30倍。token是模型生成文字时处理的基本单位,这项指标可粗略理解为回答的输出速度。它给英伟达主导的GPU路线增加了一个值得跟踪的架构变量;不过,材料没有披露具体对比的GPU型号、模型、成本与功耗,因此“业内最快”目前仍是公司自述。