给房源照片自动贴上“厨房”“卧室”等标签,看似简单,实际常有门口带出另一间房、客厅只占画面一角等模糊情况。Alma Media 团队要识别 23 类内容,同一张图还能有多个标签,因此选择了微调 SigLIP——一种把图片压缩成数字表示、再用于分类的视觉模型。
这个案例真正有用的,不是证明微调总有效,而是给出动手前的三个问题:任务能否用语言清楚描述,手里是否有足够且可靠的标签,处理规模是否值得承担训练与运行成本。厨房、浴室容易交给按提示词工作的视觉语言模型;HALLWAY、LOFT、ALCOVE 等边界较模糊的类别则更难说清。团队估计,自建分类器可能需要每类至少数千个样本;数据不足时,可先用外部模型生成标签,再清理其错误。
LoRA——冻结原模型大部分参数、只训练少量适配参数——能降低微调开销,却不能补救欠标注和弱基线。先比较提示分类、零样本分类或固定表征加简单分类器,仍是更稳妥的起点。