深度专题 FEATURES — 2
omlx:Mac本地推理开始分层存储
oMLX 把连续批处理、内存—SSD 缓存和菜单栏管理装进 Mac,让本地模型更像常驻服务。
audio.cpp扩建本地音频模型栈
audio.cpp 0.6 一次接入五个模型家族,正把本地语音与音乐工具收进同一套底座。
速览 BRIEFS — 8
REPO
一条命令匹配本机能跑的模型
llmfit 先读懂本机硬件,再从数百个模型中筛出真正跑得动的选择。
REPO
slime押注强化学习后训练扩展
THUDM 开源大模型强化学习后训练框架 slime,把训练、生成与奖励评估接入同一条数据流。
NEWS
3090把27B模型推到672 tok/s
RTX 3090单请求82 tok/s、峰值672 tok/s,另一套18GB量化方案让MTP可直接启用。
NEWS
Qwen的“推理强度”别调错了
Qwen 默认推理偏重;llama.cpp 的界面选项却可能只是在截断思考。
REPO
多Agent接力也要有长期记忆
ai-memory让不同厂商的编码Agent共享项目记忆,减少换工具后的重复交代。
REPO
本地多Agent框架登上趋势榜
Munder Difflin 把本机里的多个编码助手,组织成会分工、通信和记事的 AI 小团队。
REPO
把AI编程工具里的个人数据导出来
统一导出八类 AI 编程工具的历史数据,方便迁移、审计和自建记忆库。
NEWS
1.58比特模型又有回潮迹象
多款27B级三值模型再获关注,但低位宽能否换来可靠质量仍待验证。