把一张报错截图贴给只会读文字的 AI,它原本只能“看见”一个文件。ModLens 给 DeepSeek Harness 补上了这只眼睛:用户直接粘贴图片,插件先解析内容,再把结果交给纯文本的 DeepSeek 或 GLM 模型继续判断,不必先保存图片、手动传入路径。
关键不只是把图转成一段描述。按项目作者的说法,ModLens 会提供完整文字转录、按阅读顺序排列的布局区域,以及实体和关系列表。OCR——把图中文字转成文本——负责“读字”;布局分析保留标题、正文、控件等区域的位置关系;最后用 JSON——一种有层级的文本格式——整理成可引用的结构化证据。这样,编码 Agent 处理界面截图时,拿到的更像一份标注清楚的现场记录,而不是依赖模型猜图。
它也承接了 DeepSeek Harness“一切皆插件”的思路:安装一个插件,就能为确认属于纯文本的模型增加视觉入口,同时避开原生视觉模型。项目页称其已在 Claude Code、Codex、Pi 和 OpenCode 的真实设备上验证,但未披露识别准确率或系统性对比结果。