Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
REPO 590 STARS 约 1 分钟

DeepSeek Harness接上视觉证据

ModLens把截图拆成文字、布局与语义证据,让纯文本Agent也能处理视觉任务。

IMAGE — GitHub Trending(TypeScript·日榜)

把一张报错截图贴给只会读文字的 AI,它原本只能“看见”一个文件。ModLens 给 DeepSeek Harness 补上了这只眼睛:用户直接粘贴图片,插件先解析内容,再把结果交给纯文本的 DeepSeek 或 GLM 模型继续判断,不必先保存图片、手动传入路径。

关键不只是把图转成一段描述。按项目作者的说法,ModLens 会提供完整文字转录、按阅读顺序排列的布局区域,以及实体和关系列表。OCR——把图中文字转成文本——负责“读字”;布局分析保留标题、正文、控件等区域的位置关系;最后用 JSON——一种有层级的文本格式——整理成可引用的结构化证据。这样,编码 Agent 处理界面截图时,拿到的更像一份标注清楚的现场记录,而不是依赖模型猜图。

它也承接了 DeepSeek Harness“一切皆插件”的思路:安装一个插件,就能为确认属于纯文本的模型增加视觉入口,同时避开原生视觉模型。项目页称其已在 Claude Code、Codex、Pi 和 OpenCode 的真实设备上验证,但未披露识别准确率或系统性对比结果。


供稿材料 SOURCES — 1
01
liustack/modlens GitHub Trending(TypeScript·日榜) · REPO
原文 ↗

← 返回 2026-08-17 · 开源板块