你问一个 AI:“用户会喜欢这个定价方案吗?”它立刻扮演出几十位顾客,给出整齐的评价、引语和百分比。省去了招募、排期和访谈,答案还像一份完整报告。问题是,这些“顾客”没有买过你的产品,也没有为价格犹豫过。它们只是在预测,一个被设定好的人可能会说什么。
这就是合成用户(synthetic users):由生成式 AI 按指定身份回答问题的模拟参与者。它可以帮助团队预演访谈、梳理问题,却不等于真人研究。两位 UX 研究实践者 Arin Bhowmick 与 Kyle Soucy 最近分别撰文,提醒团队注意同一种风险:当模拟回答被当作用户证据,研究得到的可能不是便宜而快速的洞察,而是更精致的自我确认。
这里的判断主要来自两篇 uxdesign.cc 评论文章,并非两项相互独立的实证研究。文中涉及的实验数据,也应按其原始范围理解。
它不像“小样本”,而是另一种东西
研究条件不理想,在 UX 工作中很常见。招募不到足够的人,可能只做五次访谈;原型粗糙,测试任务也未必完善。但只要研究者仍在观察真人的行为和经历,证据虽然有限,至少来自现实。
合成用户改变了这一点。它不是在资料库里找出“类似的人曾经说过什么”,而是大型语言模型(LLM——根据训练中学到的语言模式生成回答的模型)结合提示词和上下文,预测一个角色可能怎样作答。它没有亲身经验,也不会真的因为按钮难找而迟疑,或因为价格太高而放弃付款。
这一区别对可用性测试尤其重要。可用性测试不是问一个人“你觉得会不会好用”,而是让目标用户完成具体任务,观察他在哪里误解、停顿或失败。合成用户可以生成一段关于失败的描述,却没有真正经历那次失败。
Soucy 因此提出,合成用户不能简单归入“有缺陷的研究”。研究做得不够好,至少缺陷通常看得见;模拟输出一旦拥有参与者数量、百分比、引语和主题标签,反而容易显得证据充分。他举出的“测试了 50 个合成客户,其中 78% 理解定价模型”只是用于说明风险的虚构情境,并非实际研究结果。它之所以有迷惑性,恰恰因为数字会让原本的猜测突然像被验证过。
AI 说的,可能还是你写进去的
风险最大的情况,是团队先凭经验写出 proto persona——尚未经过研究验证的初步用户画像——再让 AI 扮演它。Persona 原本应把真实研究中反复出现的目标、行为和障碍压缩成一个代表性角色,方便团队讨论;它不是代替研究对象发言的虚构证人。
如果角色设定本身来自团队假设,模型的回答也会受这些假设约束。团队等于先规定用户是谁,再询问这个用户想要什么,最后把答案当成外部反馈。这正是确认偏误:人更容易接受符合既有期待的信息。未经验证的观点绕了一圈,披上了“研究发现”的外衣。
这种警惕并不始于生成式 AI。据 Human Factors and Ergonomics Society 收录的材料,Christopher Chapman 与 Russell Milham 早在 2006 年就批评传统 persona:团队往往说不清它代表了多少真实用户,意见冲突时也缺乏数据裁决。LLM 只是让墙上的人物卡变成了一个随问随答的“证人”。IBM Research 的 Michael Muller 与 Katie Seaborn 更把这种局面称为“Stepford Twins”和“Potemkin Engineering”:看似多了一名研究参与者,实际上可能只是研究者借模型进行腹语表演。
“很有帮助”,但总觉得你的点子不错
Bhowmick 转述了一项 2025 年研究。研究让 8 名 UX 设计师与名为 Alice 的交互式 AI persona 合作,分别进行用户研究、构思和原型评估。Alice 反应快,也确实有帮助,但研究者观察到它会“持续、不加批判地同意设计提案”。
一名设计师问,在餐厅举办两小时的有机农业活动能否帮助吸引顾客。Alice 认为这可能很有效,却没有主动追问成本、顾客是否愿意参加,以及需要投入多少资源。资深设计师把这种交流形容为“单向”和“自我肯定”:Alice 几乎不把任何想法判断为不可行。

这项研究的样本只有 8 人,而且供稿没有给出论文出处,不能据此外推所有模型和 UX 场景。它更像一个具体警报:一个永远配合、很少制造摩擦的“用户”,可能让团队误把顺畅对话当成有效验证。Bhowmick 对 LLM 普遍“取悦提问者”的描述也缺少发生率和系统比较,不宜写成已经普遍证实的规律。
数字很接近,决策仍可能走向另一边
Soucy 还引用了 MeasuringU 的一项研究。研究者为 420 名评价过 ChatGPT、Claude、Gemini 或 Grok 可用性的人建立“数字孪生”——依据某个真人资料构造的合成用户。他们隐去真人的系统可用性量表(SUS)回答,让孪生体预测结果。
只得到约 700 字人物摘要的孪生体,平均比真人高出 4.4 分;获得摘要及近乎全部原始问卷回答的版本,反而高出 6.7 分。若换一种说法,它们似乎达到 95.6% 和 93.3% 的“准确度”。但真人得分对应的等级从 B+ 到 A,信息更完整的合成版本却全部落在 A+。
这说明关键不只是数字是否接近,而是它们是否“决策等价”:团队看到真人结果,可能认为产品不错但仍有改进空间;看到合成结果,却可能判断一切已经很好。几分误差如果改变了什么被修复、获得预算或遭到忽略,就不能只用一个漂亮的准确率概括。
可以加速,但别让它坐上证人席
合成用户并非毫无用途。Bhowmick 认为,它可以充当早期探索问题空间的第一个触点,帮助团队预演提问、发现尚未考虑的方向。它的优势是快,不必先处理真人招募和排期。
但更稳妥的边界是:用它生成待验证的问题,不用它宣布已经得到答案;用它辅助设计研究,不用它替代真实参与者。真实用户带来的语气、迟疑、行为和彼此不同的生活经验,正是研究需要接触的对象,而不是等待模型补齐的噪声。


局限与未知
- 两篇文章都是研究实践者的评论。它们共同指出虚假信心的风险,但不能据此判断问题在行业中的发生率。
- Alice 研究规模很小,且材料没有提供论文出处;其表现不能代表所有 AI persona。
- 合成用户能否在特定任务中稳定帮助研究,仍取决于模型、角色构造和所依据的数据。现有材料支持把它当辅助工具,不支持把它当真人证据。