一个 Agent 要搜资料、读 PDF、检查内容安全,还要调用大模型规划下一步,背后往往得接好几套模型服务,像为每种工具各建一个机房。开源项目 SIE 想把它们收进同一套自托管系统——也就是让模型运行在团队自己的服务器或云账户中——再通过统一 API(程序之间约定的调用接口)供 Agent 使用。
据项目介绍,一个 SIE 集群可服务 100 多种模型,覆盖检索、文档转 Markdown、结构化输出、安全检查和 Agent 循环。它只在任务到来时加载相应模型,并用 LRU 机制优先卸载最久未使用的模型,以便共享有限的内存和算力。接口兼容 OpenAI API,项目还附带负载均衡、自动扩缩容、监控面板,以及面向 GKE、EKS 和 AKS 的部署配置。
它真正值得关注的,不是又增加一款推理引擎,而是试图把多模型接入和生产运维合成一个问题处理。不过,现有材料未披露实际集群中的成本降幅、吞吐量或稳定性数据,能否比多套独立服务更省事,仍需真实部署验证。