深度专题 FEATURES — 1
125M模型,在设备上续写钢琴
125M 参数模型在 iPhone 上续写钢琴:关键不只在模型小,更在于怎样表示一颗音符。
速览 BRIEFS — 9
NEWS
Qwen 27B单请求冲到381 tok/s
单张RTX 3090上,Qwen 27B文档引用速度升至约381 tok/s,但只适合特定任务。
NEWS
NVIDIA把CUDA文档接进MCP
NVIDIA把最新CUDA文档接入编程Agent,减少AI按过期资料写GPU代码的风险。
REPO
ODS把个人电脑变成AI服务器
ODS把聊天、语音、RAG和生图打包,让个人电脑更快变成私有AI入口。
NEWS
Ornith的MTP头可能根本没训练
检查者称 Ornith 35B-A3B 的 MTP 头疑似未经训练,异常慢未必是推理引擎的问题。
NEWS
TinySearch允许借用现有浏览器
TinySearch 接入现有浏览器,让本地模型借用登录态检索网页
REPO
AI Infra Guard扫描MCP与Skills
腾讯把 Agent 外接工具、Skills、基础设施和越狱风险放进同一套红队扫描平台。
REPO
企业微信有了Agent友好的CLI
wecom-cli 把企业微信办公能力装进终端,方便脚本和 Agent 串起日常流程。
NEWS
IQ量化的AVX2预填充有望提速
llama.cpp待合并AVX2优化,瞄准IQ量化模型的大批量提示处理瓶颈。
NEWS
Huzzah尝试重做AI编程交互
Huzzah把持久伪代码当作需求源,尝试走出聊天与自动补全之外的第三条路。