给长期运行的Agent接上邮箱、代码库或文档库,麻烦不在第一次读取,而在后续更新:每来一封邮件、改一个文件,就把全部资料重新处理一遍,既慢又浪费;不及时处理,又会让Agent依据旧内容回答。CocoIndex想补上这层“活的数据引擎”,让新变化持续进入模型视野。
它采用增量计算——记录上次结果,只重算受影响的部分。以文档索引为例,首次运行完成全量导入;之后再运行,只为改过的文件重新切分文本并生成embedding(把文本转成便于检索的数字表示)。开发者用声明式配置写清目标数据应是什么样,系统负责追踪变化、传播更新并清除失效记录。项目核心以Rust编写,并采用Apache 2.0许可证。至于“可扩展到PB级”等生产能力,目前材料只有项目方自述,未提供独立测试数据。