像学骑车一样,AI 可能练了很久都不见起色,却在某一刻突然“会了”。奇怪的是,训练误差长期看又常按平滑的 Scaling Law(规模定律)下降。Ziyin 等人提出 Neural Quadratic Form(神经二次型),试图用同一套极简数学模型解释这两种看似矛盾的现象。
关键是抓住神经网络的对称性:同层神经元、注意力头或专家即使互换编号,功能通常不变。作者据此把近零初始化时的网络压缩成少数整体变量,架构差异则集中进一张“结构矩阵”。一个具体而反直觉的结果是:对 attention 层,二次近似里只有 value 和输出部分出现,query 与 key 要到四次项才进入。
在数据矩阵共享同一组特征方向时,这些整体变量遵循一种可求解的 Lotka–Volterra 动力学:不同学习模式依次启动;初始化越小,启动时间隔得越开,于是形成平台期和突然下降。大量模式挤在一起、无法逐个分辨时,阶梯又会合并成平滑幂律。作者用多种训练方法和架构做了数值验证,但这里解释的是误差随训练时间的规律,不涉及模型、数据或算力规模之间如何取舍。