想比较全球矿山产量,麻烦不在“找到一个数字”,而在确认它究竟指什么:铜可能按千吨、百万磅或湿公吨披露,财年起止不同,产量还可能采用应付金属、含量金属或权益调整后的口径。一位关注大宗商品的 Reddit 用户因此尝试用 LLM,从分散的公司文件中搭建可供系统化研究使用的结构化数据库。
他的做法不是让模型直接填表,而是让 LLM 生成、监控和维护确定性的 ETL 代码——ETL 指从文件提取数据、统一口径,再装入数据库的流程。代理程序负责运行脚本;网站或 PDF 版式变化导致失败时,它会调查原因、修改并测试,处理不了再交给人工。这个“自修复管道”的价值,在于试图把 AI 用到最耗人的维护环节。
但案例也说明,生成表格只是起点。同一产品可能写成“copper concentrate”“cu conc”或“SX-EW cathode”,所有权比例和统计方式还可能藏在标题、脚注或上下文里。若没有实体解析和数据沿袭——记录每个数字来自哪份文件及如何转换——就难以证明数据正确。作者未披露覆盖范围、准确率或历史回填成本,因此目前更像一套值得观察的实作路径,而非已经验证的全球数据库。