如果要把约500万份法院判决整理成可查询的数据,逐份调用昂贵的大语言模型,成本很快会失控。一位开发者因此尝试用两个287M参数的编码器——专门把文字转成可分类、抽取的表示,而非生成长答案——分别完成实体抽取与多项选择分类。目标是找出人物、机构、法律、动作、金额和日期等信息,再汇入知识图谱,也就是用“实体—关系—实体”组织资料。
这套流程最具体的一点,是先让 Claude Sonnet 给约700份判决制作训练标签:每四句切成一个窗口,每个窗口调用四次,并要求按严格 JSON 格式返回词语位置;程序随后逐项核对这些位置是否真的对应原文。作者还把前文发现的实体和动作传给后续窗口,以保持同一对象的编号一致。小模型方案“基本可用”,但仍未追上教师 LLM;目前只是作者在 Reddit 公布的实践与求助,关系抽取尚未开始,摘要也未给出准确率或成本数字。