同一个模型装进不同手机,llama.cpp过去可能仍用相近的线程数和上下文参数,像是不看车型就用同一套驾驶设置。ARPL想补上这双“眼睛”:程序启动后识别手机实际支持的ARM指令集扩展——芯片可直接执行、能加速矩阵和低精度计算的能力——以及CPU拓扑,也就是性能核、能效核如何分组,再据此配置llama.cpp。
作者称,这套运行时检测无需为每款设备单独编译或手动调参,还会推荐线程数,并按硬件能力调整Flash Attention和KV Cache量化等上下文设置。公开版本附有Android参考应用,通过JNI——连接Kotlin界面与C/C++推理引擎的桥梁——接入llama.cpp,并在Samsung S25 Ultra上构建和测试。不过,CPU、GPU与NPU之间的异构任务分配仍未完成;作者只表示现有改动在个人测试中已带来明显差异,没有披露具体性能数字。项目采用PolyForm Noncommercial许可证。