把一套视觉 AI 搬进树莓派,通常像用现成导航开车;这个项目却拆掉导航,自己处理每一次计算和数据搬运。作者在 Raspberry Pi 4 上用 ARM64 汇编与 C,从零实现 YOLO26n 的模型推理——也就是让训练好的模型识别新图像——没有借助现成推理框架。它已经能给出正确的目标检测结果。
真正有价值的不是“汇编写了一个模型”,而是它完整碰到了推理引擎的底层难题。作者自行提取模型参数,重新设计适合计算流程的二进制内存布局,并实现卷积、注意力机制和检测等组件。为提速,项目还用了 ARM NEON——让一条指令同时处理多组数字——以及缓存分块、算子融合和定制计算内核,尽量少搬数据、多做计算。
结果也很克制:作者称,实际性能提升低于最初预期,供稿未披露具体速度。恰恰是这个落差让项目值得看——它直观展示了边缘 AI 的优化边界:写出更底层的指令,并不自动等于更快,内存布局、缓存利用和计算编排同样会决定最终表现。