大型语言模型怎样一句句写出回答,通常藏在庞大的软件系统里。gemma4.c反其道而行:据作者Critical_Physics8介绍,只需下载Google开放模型Gemma 4 E2B、编译一个约700行的C文件,就能让普通CPU生成文字。它更像一台拆掉外壳的教学发动机,让人从输入提示一路看到新token——模型处理文字的基本单位——如何产生。
这一个文件自己完成Tokenizer(在文字与token之间翻译)、Transformer计算、KV cache(保存先前计算结果,避免反复重算)、输出抽样和CPU计算,不让外部推理框架代办关键环节。作者还加入int8权重与激活值、OpenMP及AVX2等CPU优化;其自测在Ryzen 7 7700上处理512个输入token约为639 tok/s,随后生成约25.9 tok/s,并称快于llama.cpp。
它的价值不在通吃各种模型,而在刻意只支持这一款模型和CPU推理,把复杂度压到可以从main()逐行读完。性能数字目前仅见作者自述,但作为理解现代LLM推理栈与极简部署边界的样本,它足够具体。