给商品、城市等类别分配 Embedding 维度,有点像给不同科目分课时:全都给一样多,简单但浪费;只看类别数量,也未必抓住真正复杂的部分。Embedding 是把离散类别变成一串可训练数字,维度越高,表达空间越大,但参数和数据需求也随之增加。过去这项选择常靠经验调参,这篇论文试图给出更明确的分配依据。
作者把总维度设为一笔固定预算,再衡量每个类别特征增加维度的收益和成本。收益由奇异值谱判断——它反映潜在表示中各个方向承载多少信息;尾部数值很小,说明继续加维度帮助有限。在论文采用的近似模型下,分给每个特征的维度,与“近似价值除以参数成本”的平方根成正比。换句话说,结构更丰富、每增加一维又没那么贵的特征,应该拿到更多容量。
这套规则同时顾及两种风险:维度太低会漏掉结构,维度太高则可能让有限样本撑不起过多参数。作者报告称,模拟中它比平均分配和按类别数量分配更有效,尤其在预算紧、不同特征差异大时;医疗数据实验也改善了预测准确性和概率校准。不过,材料未提供具体提升幅度。