过去让 Grok 看内容,入口主要停在文字和图片。现在,用户可以直接上传视频,再用文字追问视频里发生了什么。Elon Musk 在 8 月 2 日转发相关演示并确认这一功能,随后称 Grok “可以分析任何视频”。
这一步值得注意,因为视频不只是很多张图片的集合。模型既要识别连续画面,也可能要处理语音或画面文字,还得理解事情发生的先后顺序。换句话说,Grok 的多模态能力——同时处理文字、图片、音频或视频等不同信息形式——正从静态内容进一步走向带有时间线的内容。对用户来说,操作方式并没有变复杂:像上传图片一样上传视频,然后直接提问。
不过,目前材料只展示并确认了功能入口,没有披露支持的视频时长、格式、声音处理方式,也没有提供准确率或复杂视频测试。因此,“任何视频”现阶段仍是 Musk 的表述,实际能力边界还有待更多使用结果验证。