你和朋友打开 Netflix,看到的可能是同一部《Squid Game》,入口却未必一样:有人看到突出角色的封面,有人看到另一张画面,也可能先看到一段自动播放的预览。平台要决定的不只是“给谁推荐哪部作品”,还要决定“用什么素材把它呈现给这个人”。
Netflix把封面图片、视频预览等视觉线索统称为 assets。为每位会员选择合适的 asset,就是素材个性化(asset personalization)。据 Netflix Technology Blog,MAPS 把多模态内容表征接入这项推荐任务,希望解决一个长期难题:新作品刚上线时,封面和预览几乎没有互动数据,个性化系统该凭什么作判断?
需要先说明,本文披露的信息全部来自 Netflix 自己的技术博客。原文没有给出 A/B 测试指标、提升幅度、样本规模和具体模型,部分系统介绍也因材料截断而不完整。因此,文中的效果只能视为 Netflix 的方向性陈述,而不是经过独立验证的结论。
旧系统认得编号,却不认识画面
Netflix称,过去的素材个性化模型主要把每个 asset 当作一个不透明的 ID。可以把它理解成货架上的商品编号:系统知道编号 A 曾被哪些人点开,却不知道 A 对应的是人物特写、群像,还是某个场景。
这种方法在积累了足够互动后可以工作。系统展示一个素材,观察点击或观看,再据此调整下一次选择。这构成推荐系统的反馈闭环。但新作品上线时,素材没有历史记录,编号本身又不包含内容,系统便遇到冷启动——新选项缺少反馈,无法只靠过去的数据判断谁会喜欢它。
Netflix过去的应对方式有两种。一是增加对新素材的“探索”,也就是主动给它们更多展示机会,以收集互动。二是暂时采用流行度启发式方法,优先选择整体表现可能更好的素材。后者简单,却忽略个人偏好;前者能积累数据,但个性化必须等待反馈逐渐形成。
这里还有一个容易忽略的问题:系统只能看到已经展示过的选项所产生的反馈。如果某张封面很少获得曝光,它缺少点击并不必然意味着用户不喜欢。既有展示策略本身会塑造后续数据,因此不能把曝光后的结果直接当成天然偏好。
给新素材一份“内容说明”
MAPS改变的关键,是把多模态 embeddings 接入推荐系统。多模态系统会联合处理图像、视频、文字等不同信息;embedding,通常译为“向量表征”,则是把素材内容压缩成一组可供模型比较和计算的数字特征。
换句话说,系统不再只拿到“这是 asset 123”,还拿到一份关于其内容的机器可读说明。Netflix博客把这种能力概括为模型可以“看见和听见”素材,但更准确的说法是:模型通过多模态 embedding 表征图片或视频预览中的内容,并据此判断不同素材之间的关联。
这一步对冷启动很重要。一个新 asset 虽然还没有自己的点击历史,却可以带着 embedding 进入系统。如果它在内容表征上与已有素材相关,模型便能把从相关素材中学到的会员偏好信号迁移过来。就像新书尚未有人借阅,图书馆仍可依据题材和内容特征,把它先放到可能感兴趣的读者面前,而不必等借阅记录从零积累。
Netflix称,这能显著减少素材个性化所需的互动历史,让个性化更接近作品上线时启动。不过博客没有披露“更早”究竟是提前多久,也没有量化“更少历史”具体少了多少。
从一种思路接到三个生产场景
Netflix披露,MAPS相关工作覆盖三个生产系统:artwork personalization,即为会员选择作品封面;query-aware artwork ranking,即结合查询语境对封面排序;以及 video preview personalization,即选择个性化的视频预览。
这三个场景说明,多模态理解并不是一个孤立的内容识别功能。它被接入了实际的素材选择链路:系统要理解候选素材,用会员偏好为它们排序,再从展示与互动中继续获得反馈。主编所说的“工程闭环”,正体现在这里——内容理解产生可计算的表征,表征进入大规模推荐,推荐结果又形成新的行为数据。
博客还提到一种低成本筛选新 embeddings 的方法,用于在投入完整的端到端集成和 A/B testing 之前判断候选表征。端到端集成,指让一种新表征真正贯穿数据、模型和线上推荐流程;A/B testing,则是把不同方案分配给不同用户群,比较实际效果。提前筛选可以减少试错成本,但现有材料没有说明具体筛选方法、评价标准或它与线上结果的相关程度。
为什么值得关注
MAPS有意思的地方,不是“AI能看封面”这件事本身,而是 Netflix 试图把内容理解变成推荐系统可直接使用的基础设施。旧模型主要等行为数据告诉它某个素材适合谁;新思路则让素材在第一次获得曝光前,就携带可迁移的内容信息。
这也把个性化往前推了一步。过去,系统常在“推荐哪部作品”上做选择;现在,同一部作品用哪张封面、哪段预览呈现,也成为独立的推荐问题。入口不同,用户接触作品的方式就不同。多模态 embedding 提供的,是在反馈尚未成熟时作初始判断的依据,而不是取消后续反馈闭环。
局限与未知
- 现有材料没有公开 A/B 测试指标、提升幅度、样本规模和上线时间,无法量化验证 Netflix 所称的“更早启动”和“更少互动历史”。
- 材料没有披露具体多模态模型、训练方式以及三个系统的详细架构,也不足以确认其覆盖范围和是否已全面上线。
- 所有效果论断均来自 Netflix 单一官方信源,尚无独立论文或第三方评测交叉印证。