深度专题 FEATURES — 3
vLLM把大模型专家卸到内存
社区版 vLLM 尝试把 MoE 专家放进系统内存,四卡运行前沿模型的门槛或可降低,但性能仍待验证。
Magnitude:先认硬件,再配模型
Magnitude 先看懂你的电脑,再推荐、调优本地模型,省下最磨人的适配试错。
OpenShip暴涨:自托管部署再升温
OpenShip把构建、发布和HTTPS收进一套自托管工具,但“暴涨”与行业回暖仍待数据验证。
速览 BRIEFS — 9
REPO
DeerFlow瞄准长任务SuperAgent
DeerFlow把研究、编码、沙箱与子Agent编排进同一套长任务框架。
NEWS
16GB显卡也能跑十万上下文
一张16GB AMD显卡,以约30 token/s跑27B量化模型,并容纳10万上下文。
NEWS
单张3090跑穿26万上下文
LlamAmpere 自测:单张 RTX 3090 跑 27B 模型,生成十万 token 仍超 95 TPS。
REPO
Vite插件开始复刻Next.js
vinext用Vite复刻Next.js接口,让既有应用有机会摆脱原构建链与部署绑定。
NEWS
IQuest-Q1押注15B激活参数
IQuest-Q1用320B总容量、每次约15B参数计算,押注Agent编程与多步工具调用。
REPO
本地会议助手把隐私放在首位
Meetily把转写和总结留在本机,敏感会议无需交给云端处理。
NEWS
九条提示规则最多省七成思考
给编码 Agent 加九条“思考纪律”,360轮测试中推理消耗最多降七成。
NEWS
Radeon核显迎来两成推理提速
Linux 7.4拟绕开部分内存访问开销,让Radeon核显跑本地模型快约两成。
NEWS
ModelScope CLI悄悄换了包
ModelScope 的 CLI 已迁至 modelscope-hub,照旧安装可能找不到命令。