Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
NEWS 约 4 分钟

旧手机芯片,也能跑起GPT

开发者逆向 RK3588 NPU,搭起无需厂商 SDK 的编译工具链,让 GPT-2 跑到自报 36 tok/s。

你手边可能有一块带 NPU 的单板电脑:芯片明明配了专门运行 AI 的计算单元,开发者却很难把常用模型搬上去。原因不是硬件不能算,而是通往硬件的道路常被厂商工具链封住。2026 年 8 月 18 日,一位开发者发布技术报告,称自己逆向了 Rockchip RK3588 的 NPU,并搭建开放编译器与运行时,让 GPT-2 和 SigLIP 可以不经厂商 SDK 部署到这块芯片上。

先说明信源边界:项目能力、技术细节和性能数字都来自同一位开发者的 Reddit 自述、报告与博客,目前没有独立第三方复现。标题里的“旧手机芯片”也不够准确。现有材料只说明 RK3588 是一款 SoC,常见于单板机等设备,并未证明它属于旧手机芯片。

先把黑箱的说明书补出来

NPU 是专门加速神经网络计算的处理器,常被集成进手机或单板电脑芯片。它通常比通用处理器更适合低功耗 AI,但“芯片里有 NPU”不等于“任何模型都能直接使用它”。开发者还需要知道怎样安排计算、怎样搬运数据,以及怎样向硬件下达命令。

这项工作的起点是逆向工程:通过观察软件和硬件的行为,还原厂商没有公开的格式与规则。作者称,他还原了 RK3588 NPU 执行的寄存器命令格式。寄存器可以理解成硬件控制面板上的一组开关;不知道每个开关的含义,软件就无法可靠地指挥芯片。

有了这份“说明书”,作者又构建了编译器和运行时。编译器负责把模型描述翻译成 NPU 能执行的命令;运行时则负责加载翻译结果、分配内存,并把任务真正提交给硬件。两者合起来,才形成一条绕开厂商 SDK 的模型部署路径。

从常用框架走到 NPU

据项目作者的技术报告,GPT-2 与 SigLIP 已能从 PyTorch、ONNX 和 JAX 三种入口部署到 RK3588 NPU。GPT-2 是文本生成模型;SigLIP 是处理图像与文字对应关系的视觉语言模型。这里更稳妥的理解是:项目打通了来自这些工作流的部署入口,并不等于已经原生、完整地支持三个框架的全部模型和功能。

这也不是一次突然完成的跳跃。作者在 2025 年曾尝试让同一 NPU 运行 SigLIP 视觉编码器。当时,他通过切分和重新铺排注意力计算,绕过编译器处理大型中间张量时出现的 32KB 限制。如今的新进展,是从“设法跑通一个模型组件”,走向编译器与运行时这一更通用的底层工具链。

36 tok/s,应该怎样看

作者报告 GPT-2 的生成速度达到 36 tok/s,也就是每秒生成约 36 个 token。token 是模型处理文字时使用的基本片段,不一定等于一个汉字或一个英文单词。这个数字说明项目至少在作者的软硬件配置下达到了可用的生成速度,但它还不能直接拿来和其他设备横向比较。

原因是现有材料没有交代 GPT-2 的具体版本、计算精度、上下文长度、测试环境和功耗,也没有说明 36 tok/s 只计算生成阶段,还是包含了读取提示词的时间。它更像一张项目方给出的阶段性成绩单,而不是经过统一条件验证的排行榜成绩。

报告还指出一个硬件瓶颈:RK3588 NPU 没有片上 SRAM——也就是紧挨计算单元、用于临时存放数据的高速内存。每次运算都需要在 DRAM 与 NPU 之间搬运数据。作者测得矩阵乘路径吞吐约为 1 GB/s,并认为完整上下文推理会受此限制。换句话说,计算单元即使有余力,也可能一直在等数据送到。

为什么值得关注

这项工作的意义不只在于“GPT-2 跑起来了”。它展示了一条更底层的路线:先还原硬件命令,再补上编译器和运行时,让原本依赖封闭厂商软件的 NPU 重新接入常见机器学习工作流。如果这套工具能够持续扩展,闲置或受限的边缘计算硬件就可能获得更长的可用期。

但“开放”目前仍是作者的表述。材料不足以确认代码是否真正开源、采用什么许可证,也无法判断编译器覆盖了多少算子和模型结构。

局限与未知

  • 所有结果都来自同一位开发者,尚无独立复现。
  • 36 tok/s 缺少完整测试口径,不能直接用于跨设备性能比较。
  • 项目的开源状态、许可证、框架支持范围和模型兼容性,现有材料均未说明。

供稿材料 SOURCES — 1

← 返回 2026-08-21 · 开源板块