问企业 AI“年保费是多少”,答案可能就在文档的一行里。但常见的 RAG(先检索企业文档,再让大语言模型据此回答)仍会按完整流程跑三次模型:解析问题、筛选候选文档、生成带引文的答案。三次调用串行执行,也就是后一步必须等前一步,用户每次都要等约两秒,简单问题也不例外。
Angela Shi 的做法是先加一道“路由”——根据问题难度选择处理路径。系统直接读取检索阶段已有的关键词共现分数:如果某一行明显胜出,问题就走快速路径,跳过模型;如果答案不够明确,仍保留三次调用和核验。作者称,关键词匹配命中时可省下约两秒。关键并非一味少调用,而是留出足够的分数差距,避免把难题误送上捷径。文中数字来自作者在虚构保险经纪语料库上的可复现实验,尚不能直接代表真实企业环境。