给 AI 应用加一道“出厂质检”,过去常靠人反复提问:换个提示词会不会答错,接上资料库后会不会泄露内容,Agent 会不会被诱导越权。Promptfoo 想把这些零散检查变成可重复执行的测试,让团队在发布前批量发现问题。
它把提示词、RAG(让模型先检索外部资料再回答)和 Agent(能调用工具、执行多步任务的 AI 系统)的评测与红队测试放进同一套 CLI——也就是通过终端命令操作的工具。开发者用声明式配置写下测试对象、用例和判定标准,再运行评测或漏洞扫描;结果可以比较不同模型,也能生成安全漏洞报告。
更值得注意的是工程位置:Promptfoo 支持把检查接入 CI/CD,即代码每次变更后自动运行的构建与测试流程,还可在代码审查时检查与大模型有关的安全和合规问题。这样,Agent 安全测试就从上线前的临时抽查,变成日常流水线的一环。项目为 MIT 许可的开源软件;其仓库称评测在本地运行,提示词不会离开用户机器,但材料未披露具体漏洞检出率或误报表现。