深度专题 FEATURES — 3
拆分式推理,先补网络拓扑课
TopKV让拆分式推理先看清GPU连接远近,再搬运庞大的KV缓存;思路关键,但性能仍待真机验证。
无解就停:教LLM放弃徒劳推理
CaRL教模型在越界时及时拒答:少编假答案,也少烧推理算力。
Auto-JEPA:自动驾驶不必重建世界
Auto-JEPA不预测整幅未来,只提炼会改变驾驶决策的信息,再从真实轨迹库中选路。
速览 BRIEFS — 8
PAPER
异构模型也能接力复用KV缓存
MoT把一个模型的“上下文草稿”翻译给另一个模型,减少多模型重复计算。
PAPER
Agent服务别再反复分词
TokTier记住长对话的分词结果,只修补新增末尾,把Agent的重复CPU工作压到毫秒级。
PAPER
推理早退开始按层动态决策
BLADE让模型边推理边判断是否“想够了”,并按不同隐藏层动态早退,减少重复验算。
PAPER
被删的KV信息还能重建
ResKV把被淘汰token的聚合影响压进残差缓存,在固定预算内补回注意力。
PAPER
机器人世界模型也要闭环纠偏
FBFM无需再训练,让机器人边行动边用真实观测纠正“想象”,减轻长程执行漂移。
PAPER
世界动作模型学会分开语义与时序
ST-WAM把任务语义与画面细节分开学,让机器人换背景、光照后仍能按顺序做事。
PAPER
空闲GPU同时服务与微调
DeltaServe把流量低谷变成微调窗口,让闲置GPU继续干活又不耽误用户请求。
PAPER
量化KV也能逐请求监测风险
WitCert给KV量化装上运行时风险表,逐请求判断是否需要回退。