Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.038 — 2026-08-11
NEWS 约 1 分钟

VLX-Seek用10B模型做具身视觉定位

10B开放模型把视觉定位改成“选区域”,让机器人更稳地找目标、拒绝不存在的目标。

IMAGE — r/LocalLLaMA 日榜

你让机器人找“左边的红杯子”,它不只要认出杯子,还得指出具体是哪一个;如果画面里没有,更不能随便框一个交差。VLX-Seek-1.5-10B 是一款面向这类具身场景的开放视觉语言模型(VLM——同时处理图像和文字的模型),规模为 10B,目标覆盖机器人、无人机、监控和巡检等边缘侧应用。

它最值得注意的改动,是不让模型直接生成边界框坐标。坐标数字格式正确,不代表位置真的准确。VLX-Seek 攧而先把候选区域变成可用语言指代的“区域 token”,再让模型选择、比较并引用对应区域。说白了,它把“现场报出四个坐标”改成“从已有选项中认准一个”,更贴近语言模型擅长的判断方式。模型还加入缺失目标的拒识训练,并用明确的 None 表示画面中没有所指物体,以减少错误定位。以上特性来自项目模型卡;材料未提供量化测试结果,实际定位精度与推理效率仍待进一步验证。


供稿材料 SOURCES — 1

← 返回 2026-08-11 · 开源板块