想象一个健康应用:它要边尝试不同干预,边判断哪种对当前用户更有效,却不能把用户原始记录上传;其他地区积累的数据或许能帮忙,但人群构成又不一样。这项工作研究的正是这种两难:contextual bandit(根据用户或场景特征选择动作、观察效果的在线决策系统)如何在本地差分隐私下迁移学习。所谓本地差分隐私,是数据离开设备前先随机加噪,服务器看不到原始记录,代价通常是学习更慢。
据 arXiv,Yuheng Ma 等人的预印本于 2025 年 3 月提交。其关键设计是一套“jump-start”方案:在协变量漂移——旧数据与新场景的人群分布不同,但相同特征下的回报规律仍可共享——这一前提下,用重新加权的估计方法合并辅助数据;即使各辅助数据集采用不同强度的隐私保护,也能纳入同一框架。作者还给出匹配的 minimax lower bound(任何算法在最坏情况下都难以突破的误差下界),以支持算法达到 minimax optimality,即最坏情形下已近乎最优。摘要称合成与真实数据实验验证了方法,但未披露具体提升数字。