深度专题 FEATURES — 3
Mac靠SSD流式运行480B模型
Slipstream 按需从 SSD 搬运 MoE 专家,让 36GB MacBook 越级跑大模型,也暴露了速度与存储瓶颈。
ModelExpress:模型冷启动压到两分钟
ModelExpress 让新 GPU 向现有副本取权重和缓存,特定测试中把模型启动从 8 分钟压到 1 分 44 秒。
DKV给本地长上下文压缓存
DKV 把本地大模型的 KV 缓存压缩做成 CLI,有限显存也有望尝试更长上下文。
速览 BRIEFS — 8
NEWS
浏览器小模型冲到1440 tok/s
LFM 2.5 230M借定制WebGPU后端,在RTX 3090浏览器中跑到约1400—1500 tok/s。
NEWS
Agent集群把推理提速六倍
AI Agent 集群自动改写 GPU 程序,40多小时将生成速度提升至约6倍
NEWS
27B模型以1比特跑上Jetson
27B 模型经 1-bit 量化压至 3.53 GiB,在 Jetson Orin NX 16GB 上完全离线运行。
REPO
PageIndex绕开向量库做RAG
PageIndex把长文档先整理成目录树,再让模型逐层推理检索,尝试绕开向量库与切块。
REPO
Worktrunk为并行Agent管工作树
给每个编码 Agent 一张独立工作台,用更短命令管理分支与目录。
NEWS
本地编码Agent有了验证浏览器
hwatu 给本地编码 Agent 配上验证浏览器,让网页改动从“看着像”变成可量化验收。
REPO
Strix开源AI渗透测试Agent
Strix让AI模拟黑客验证漏洞,还能生成补丁并接入开发流程。
REPO
终端自动补全也做成IDE体验
微软把 IDE 式命令补全搬进终端,长命令不必全靠记忆。