Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
NEWS 约 1 分钟

少调几次LLM,RAG可能更快也更省

给简单问题设捷径:跳过不必要的模型调用,比换快模型更直接地降延迟和费用。

IMAGE — Towards Data Science

问企业 AI“年保费是多少”,答案可能就在文档的一行里。但常见的 RAG(先检索企业文档,再让大语言模型据此回答)仍会按完整流程跑三次模型:解析问题、筛选候选文档、生成带引文的答案。三次调用串行执行,也就是后一步必须等前一步,用户每次都要等约两秒,简单问题也不例外。

Angela Shi 的做法是先加一道“路由”——根据问题难度选择处理路径。系统直接读取检索阶段已有的关键词共现分数:如果某一行明显胜出,问题就走快速路径,跳过模型;如果答案不够明确,仍保留三次调用和核验。作者称,关键词匹配命中时可省下约两秒。关键并非一味少调用,而是留出足够的分数差距,避免把难题误送上捷径。文中数字来自作者在虚构保险经纪语料库上的可复现实验,尚不能直接代表真实企业环境。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 数据板块