让大模型写答案时,可以先请“小助手”起草,再由大模型批量验收,这叫投机解码。树式投机解码还会同时准备几种续写,但有个两难:小助手越轻便,起草越快却越容易猜错;能力更强的草稿模型更准,又可能吃掉省下的时间。TreeGraft的思路是,不必从头到尾只用同一个助手,而让快慢不同的多个草稿模型共同搭一棵候选树。
其中最关键的一步,是让较强的草稿模型重新查看被较弱模型低估的旧节点,找回此前没有展开的潜在路径;新分支接入时也不删除原有分支,保留仍可能被大模型接受的选择。系统再用一个轻量调度器,根据当前候选树决定何时值得调用较强模型。作者称,在10组模型搭配、6个基准上,TreeGraft相较两种固定使用单一草稿模型方案中表现更好的一种,平均提升15.1%,最高26.6%。