像餐厅里,前台知道哪桌赶时间,后厨知道哪口锅正空着;两边若不通气,再聪明的安排也会互相添堵。运行 AI Agent——能多轮思考、调用工具并继续执行的系统——也有类似问题:Agent框架掌握任务依赖和优先级,推理引擎则掌握请求队列、GPU压力与缓存状态,过去这些信息难以系统互通。
HEAR为两层设计了一套双向协议:上层告知任务意图和执行要求,底层返回资源状态、能力与结果。最具体的一点是,它会同时考虑未来是否还要复用上下文,以及相关 KV cache 是否仍在显存中。KV cache是模型保存的历史计算结果;若刚删掉就要再用,系统只能重新计算。HEAR据此协调请求顺序和缓存保留,但不改变原有工作流或模型。
据作者实验,在内存受限、并发运行的 SCBench 上,这种调度带来 1.61 倍批处理加速,并将首个文字出现前的中位等待时间缩短至原来的约 1/2.23。研究型Agent测试中,作者报告端到端加速为 1.23 至 2.45 倍,且未观察到任务质量下降;这些结果仍限于论文所测的四个基准与配置。