Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 61 约 6 分钟

AI分配难民:一场双盲随机试验

瑞士把难民安置建议交给算法与人工协作,并用双盲随机试验检验它是否真能改善就业。

把一个刚获准留在瑞士的家庭安置到哪里,通常先要满足各州容量和来源群体配额。但在几个都合规的州之间,哪一个更适合这家人就业?安置官员很难临场算清。瑞士移民事务国务秘书处(SEM)把这个问题交给算法辅助判断,又用一场双盲随机试验检验:机器给的建议,是否真的比近似既有流程的建议更好。

这项研究值得看,不只是因为结果为正。它把算法放进了真实政策流程,让人工保留最终决定权,再用随机分组追踪三年就业。公平约束、实际执行和因果证据,因此出现在同一个实验里。本文数字均来自 Bansak 等人的论文及其补充材料,目前缺少 SEM 官方数据或独立团队的第二信源。

AI不是直接决定谁去哪里

试验从2020年1月持续到2023年6月。约2,000个难民“案例”被随机分到两组。这里的案例是安置单位,可能是一名个人,也可能是一整个家庭,不能直接理解为2,000名难民。

处理组收到 GeoMatch 的建议。系统先用行政数据和机器学习,预测一个案例在瑞士26个州分别可能取得怎样的就业结果,再用“约束优化”寻找整体较优的匹配。约束优化可以理解为:不是只挑预测分数最高的州,而是在州容量、来源群体平衡等规则都必须满足的前提下排座位。

模型使用的个人特征包括性别、抵达年龄、婚姻状况、案例规模、抵达时间、国籍和母语。它缺少教育、职业经历、既往工作经验和当地语言能力等信息。模型约每季度用新增行政数据重新训练,但预测变量、模型类别、优化目标和约束结构保持不变。

对照组也会收到一个州的建议,只是这个建议不使用就业预测,而是在可用名额中随机选择,以近似原有程序。两组各自使用一套相同但彼此独立的州级及来源群体配额。这样,处理组不能靠挤占对照组的好位置获益,两组最终分到各州及各来源群体的总体比例也保持一致。研究比较的,是同一批座位能否排得更合适,而不是把更多人送去就业市场更强的州。

安置官员看到的界面和推荐格式相同,不知道建议来自算法还是对照程序;难民也不知道自己在哪一组。这就是论文所说的“双盲”。官员仍可推翻建议,实际遵从所显示建议的比例为97%。最终就业结果来自独立收集的行政登记记录。

抽签解决“到底是不是算法带来的”

随机试验的关键,是用抽签让两组在干预前尽量可比。研究还采用了“意向治疗分析”(ITT):无论官员最后是否照办,都按案例最初抽到的组来比较。它回答的不是“百分之百执行算法会怎样”,而是“把这套推荐制度引入现有流程,整体会怎样”。

预注册的主要指标,是安置后三年内,案例中成年成员有工作的月份占全部月份的比例。2020—2023年队列合并后,算法推荐组比对照组高2.2个百分点。对照组均值为22.3%,所以相对增幅约为10%。95%置信区间为增加0.05至4.33个百分点——置信区间表示,按这套统计方法估计,真实效果较可信的范围。下限非常接近零,因此这不是一个压倒性的结果。

效果也不是一开始就出现。两组在第一年的就业轨迹接近,之后算法组逐渐拉开差距。安置后第36个月,合并样本中“案例内至少一名成人正在就业”的比例提高5.2个百分点;对照组为47.7%,相对增幅约11%,95%置信区间为1.10至9.25个百分点。注意,这个数字是第36个月当月的就业率,不能和“三年内就业月份占比”互换。

疫情给算法上了一堂现实课

试验在2020年1月启动,随即撞上COVID-19疫情。模型最初从疫情前的数据学习,但劳动力市场、跨境流动和庇护流程很快发生变化。这就是“分布漂移”:好比根据过去路况规划路线,城市却突然大面积封路,原来的规律不再可靠。

论文对2022—2023年后疫情队列另作分析。在这批案例中,三年就业月份占比的ITT效应为增加3.9个百分点,约合17%,95%置信区间为1.11至6.68个百分点。诊断分析显示,算法在疫情期间和疫情后都把案例推向预测排名更高的州;区别在于,疫情期间这些排名与真实就业的关系较弱,疫情后才重新变得清晰。

不过,这个后疫情比较并非预先指定的主要分析,也不能拿来代表整个试验。不同队列面对的环境不同,较大的后期效果既可能说明预测重新对上现实,也提醒政策部门:算法不是部署后便可不管的固定规则,外部环境变化时,需要持续检查预测是否仍然有效。

真正重要的是“建议加人工”

这项试验检验的不是AI强制分配难民,而是算法建议加人工决策。算法负责处理人脑难以同时权衡的大量组合;官员保留最终权力,用系统没有记录的信息修正建议。这种安排也让试验更接近公共部门实际采用AI的方式。

论文称,第36个月的就业增益可与数百小时强化语言培训带来的效果相比,并把系统描述为低边际成本、可扩展的干预。其成本收益测算假设,每名接受干预的成年人增加50瑞士法郎运行成本,不计一次性开发和集成费用,据此得到约27∶1的毛财政收益成本比。这个估算依赖论文设定的财政价值和成本假设,不能当成已经在其他地区验证过的通用价格表;作者也明确说,算法匹配不能据此被理解为语言课程的替代品。

公平不能只看平均数

两套镜像配额是这项设计很扎实的一处:算法不能为了提高平均就业率,把处理组整体转移到更有利的州;国籍来源群体也要继续按规则保持平衡。论文的分布分析还显示,就业结果的改善不像只集中在一个狭窄区间。

但“平均效果为正”仍不等于算法对所有人都公平。算法公平关心的是:不同国籍、性别或家庭类型是否同样受益,谁更常被错误预测,谁承担机会损失。论文提到分布性检验,却没有在本文供稿所示结果中给出这些群体的完整效果数字。因此,这场试验证明了受约束的算法建议可以改善总体就业,却还没有穷尽公平问题。

局限与未知

  • 全样本主要效应的置信区间下限只有0.05个百分点,证据为正但接近统计显著性边界;后疫情队列的更大效果属于分队列分析。
  • 试验只覆盖瑞士特定制度、26个州及严格配额条件。模型使用的预测信息也较少,结果不能直接外推到其他国家或安置体系。
  • 当前报道依赖作者团队的一篇论文。虽然论文披露了低且平衡的失访率、预分析计划和多种稳健性检验,仍需 SEM 官方资料和独立复核来验证执行细节、成本假设与长期推广效果。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 数据板块