TL;DR
- •合成用户:90%以上的成本降低,在一个下午内生成100个观点,对A/B测试具有完美的一致性——但没有真实的情感或偶然性
- •真实用户:真实的反应,意外的洞察,具有辩护性的结果——但受到成本、可用性和地理位置的限制
- •获胜模式是顺序,而不是选择:合成用于发现和迭代,人类用于验证和发布前检查
合成用户与真实用户的辩论将用户体验研究社区分为两个阵营。其中一方将AI生成的研究参与者视为革命性的——终于,有一种方法可以在没有六位数预算和月长的招募周期的情况下测试想法。另一方将其视为危险的捷径:伪造的反馈伪装成洞察,准备让产品团队自信地走向错误的方向。
事实是,两个阵营都是部分正确的。合成用户确实将数周的研究压缩成数小时,并且它们确实缺乏真实的人类在真实背景下可以揭示的东西。将任何一种方法视为普遍优越的方法是真正的错误。
2026年最好的研究人员并没有选择一方。他们正在学习每种方法的强点、弱点以及如何将它们组合起来以使强点相互补充。本文概述了这种方法:清晰的定义,每种方法的诚实案例,具有真实成本和时间数据的四阶段集成框架,以及将有前途的混合工作流转变为研究戏剧的错误。
定义术语
在比较之前,首先要明确每个术语的含义——因为“合成用户”这个词被广泛使用,涵盖了从快速聊天机器人提示到严格校准的人物面板等一切内容。
真实用户
真实用户是招募用于研究的实际人类:采访、在可用性会话中观察、调查或组成焦点小组。他们仍然是验证的金标准,原因很简单——他们是最终会购买、使用、放弃或倡导您的产品的人。
- •真实响应: 真实的情感反应、沮丧、愉悦、犹豫
- •基于背景: 真实的约束、真实的设备、真实的干扰
- •受限于后勤: 可用性、成本、地理位置和调度所有限制了您可以运行多少研究
- •验证的金标准: 高风险决策前的最后一个词
合成用户
合成用户是基于人口统计和心理统计模型构建的AI生成的人物。每个人物都有一个配置文件——年龄、职业、态度、人格特征、目标——并以角色身份响应研究问题。配置良好,合成用户面板的行为更像一个充满不同人物的房间,而不是一个聊天机器人。有关完整的定义和技术的工作原理,请参阅什么是AI人物?
- •可配置: 定义您需要的确切细分,包括难以招募的细分
- •可扩展且可复制: 在十个概念变体上运行相同的面板并进行干净的比较
- •始终可用: 24/7,不需要调度,不会有无故缺席
- •正在出现的探索标准: 快速、廉价的第一步,然后是人类研究
合成用户的理由
合成用户的理由基本上是关于研究经济学的论点。当每个额外的观点几乎没有成本时,您可以在承诺之前探索更多的问题空间。
五个优势推动采用:
- ✓速度: 在一个下午内生成100个用户观点,而不是花费数周进行招募
- ✓规模: 在50个人口统计学细分中同时进行测试——这是一项如果使用人类会被禁止的研究设计
- ✓一致性: 同一个人物以相同的方式响应A/B变体,因此反馈中的差异反映了概念的差异,而不是采样噪音
- ✓成本: 与招募研究相比,每次会话的成本降低90%以上
- ✓可达性: 在不受招募挑战限制的情况下,接触到代表性不足的群体——大多数人类研究都偏向于最容易找到的人
采用率比您想象的更高
这已经不是一个边缘实践。根据User Interviews 2026年的用户体验研究状况,8%的用户体验研究人员已经经常使用合成用户,21%已经尝试过AI人物,71%预计在两年内采用。这种轨迹与十年前无人值守远程测试发生的事情相似:怀疑、安静的实验、然后快速的正常化。
同样的转变也可以在相邻的方法中看到——AI焦点小组正在被与人类小组在消费者偏好任务中进行基准测试。已发布的相关性很强,相对排名很好,但应该被视为方向性而不是保证(标题准确性数字通常被归一化,因此应该谨慎对待任何单个数字)——这是一种使方法从“有趣”转变为“可辩护”的校准工作。
真实用户的理由
上述所有内容都没有使真实用户变得可选。人类研究提供了五件合成用户无法完全复制的东西:
- ✓真实性: 真实的情感反应、身体语言、答案前的停顿告诉您比答案本身更多的信息
- ✓偶然性: 意外的洞察,这些洞察在任何训练数据中都没有——用户发明的变通方法、没有人设计的用例
- ✓问责制: 高风险决策、审计和监管背景下的可辩护研究
- ✓信任: 利益相关者对“真实”反馈的信心;一段真正客户挣扎的视频片段可以让高管们信服,这是合成转录无法做到的
- ✓边缘情况: 不寻常的工作流程、可访问性需求和文化细微差别,这些都是模型系统性地代表不足的
合成用户何时失败
有一些特定情况下,合成用户不仅表现不佳——它们还会积极地误导:
- ✗新产品类别: 如果没有先前的行为数据来建模,人物的响应是以假象为依据的推断
- ✗情感激发的话题: 医疗保健、丧亲之痛、财务压力——驱动行为的领域是感觉,而模型则使其变得平淡
- ✗监管背景: 任何需要人类证明的地方,合成数据都不能合格
- ✗微交互: 真实界面中的计时、摩擦和沮丧——人物无法处理点击目标
集成框架:顺序使用两种方法
实际问题不是“合成还是真实”——而是“哪种方法,在哪个阶段,花费多少钱”。这是高性能研究团队已经收敛的四阶段框架,具有每个阶段的典型预算和时间表。
第1阶段——发现:合成优先
在开始时,您知道的最少,错误的成本最低。这是合成用户闪耀的时刻。使用AI人物面板来探索问题空间,快速压力测试10-20个早期概念,并找出哪些方向值得人类投资。多人物辩论——怀疑者、乐观者、务实者辩论您的概念——在数小时内表面化了异议和热情模式。
- •成本: 500美元-2000美元
- •时间: 1-2周
- •输出: 值得真实研究预算的概念短列表
第2阶段——验证:以人类为中心
将人类研究集中在通过合成筛选幸存的顶级2-3个概念上。对每个概念进行深入研究,招募8-12名参与者,捕捉细微差别、情感和意外反应,这些是合成面板无法产生的。因为AI已经消除了弱候选项,每一美元的人类研究预算都落在了有真正机会发布的概念上。
- •成本: 10,000美元-30,000美元
- •时间: 3-4周
- •输出: 具有真实用户证据的验证方向
第3阶段——迭代:混合
改进是混合工作流程发挥作用的地方。首先使用合成用户对每个改进进行A/B测试,然后使用2-3名真实用户对每个迭代进行点对点检查。这将迭代周期从每月变为每日或每周——您在每次有意义的更改后重新进行测试,而不是将更改批量化为季度研究。
- •成本: 每个周期1000美元-5000美元
- •时间: 几天,而不是几周
- •输出: 具有记录的改进痕迹的精炼设计
第4阶段——发布前:人类验证
在发布之前,完全回到人类身上。使用目标用户进行最终的可用性研究,使用真正的辅助技术用户(永远不要模拟)进行可访问性审计,并为国际发布进行文化审查。这是“AI说它没问题”不是对任何人都可以接受的答案的阶段。
- •成本: 15,000美元-50,000美元
- •时间: 2-4周
- •输出: 由可辩护的证据支持的发布信心
决策矩阵:何时使用哪种方法
为了快速参考,以下是常见的研究目标如何映射到方法:
| 研究目标 | 合成 | 真实 | 两者 |
|---|---|---|---|
| 早期概念筛选 | ✓ | ||
| 功能优先级 | ✓ | ||
| 可用性测试 | ✓ | ||
| 情感反应 | ✓ | ||
| 人口统计学比较 | ✓ | ||
| A/B测试变体 | ✓ | ||
| 最终验证 | ✓ | ||
| 可访问性 | ✓ | ||
| 迭代改进 | ✓ | ||
| 预算有限的研究 | ✓ |
常见错误避免
大多数合成用户失败并不是技术的失败——而是流程的失败。反复出现的错误包括:
- ✗将合成用户用作唯一的研究方法 —— 探索没有验证就是昂贵的猜测
- ✗将AI响应视为事实 —— 合成反馈是假设生成器,而不是判决
- ✗跳过高风险发布的人类验证 —— 您最想削减的阶段是您最不能承受削减的阶段
- ✗在没有真实用户数据的情况下配置人物 —— 想象力创造的人物反映了您的假设
- ✗忽略训练数据的局限性 —— 如果您的用户在模型数据中没有很好地代表,他们的意见也不会被代表
- ✗在没有披露的情况下将合成数据呈现为“用户研究” —— 利益相关者在发现省略后会停止信任您的所有研究,包括人类部分
开始使用混合工作流程
您不需要在一夜之间彻底改变您的研究实践。有针对性的推出看起来像这样:
审计您的当前研究流程
绘制瓶颈在哪里——招募延迟、预算限制、从未测试的概念。这些差距是合成用户首先增加价值的地方。
确定低风险试点领域
从早期概念和内部项目开始,在那里,错误信号的成本很低,速度的收益很明显。
运行并行研究以校准
测试您已经使用真实用户回答过的问题。将合成结果与您的已知基线进行比较,以了解该方法在您的领域的准确性。
构建混合工作流程
采用四阶段框架:合成发现、人类验证、混合迭代、人类发布前检查。
记录和共享学习
记录合成反馈与现实相符和不相符的地方。该校准日志是随着时间推移赢得利益相关者信任的东西。
ArgumenTroupe的位置
ArgumenTroupe是为此工作流程的合成部分而构建的:真正存在分歧的人物面板——怀疑者、乐观者、务实者、devil's advocate、伦理学家——就您的概念进行结构化格式的辩论,并产生可以分析而不是单一混合答案的论点转录。团队将其用于上述发现和迭代阶段,然后将幸存者交给人类研究。请参阅团队在产品和用户体验研究中如何应用它。
常见问题
合成用户是否准确到可以用来做出产品决策?
对于方向决策——哪些概念要追求、哪些功能更重要、细分市场如何不同——是的,前提是人物是从真实客户数据配置的。关于AI面板的相关研究显示,在偏好任务中,人类面板的相关性很强(通常引用80-92%的数字,尽管标题数字通常是归一化的)。对于最终的去/留决策,请使用真实用户进行验证。
我应该在什么时候使用合成用户而不是真实用户?
使用合成用户进行早期概念筛选、功能优先级、人口统计学比较、A/B测试变体和预算有限的探索。使用真实用户进行可用性测试、情感反应、可访问性和最终验证。使用两者进行迭代改进。
如果我采用合成研究,我还需要多少真实用户?
计划在验证阶段为每个概念招募8-12名真实参与者,在每个迭代周期中招募2-3名点对点检查参与者,并在发布前进行完整的可用性和可访问性研究。合成用户减少了您需要人类的频率,而不是您是否需要他们。
我是否必须披露研究中使用了合成用户?
是的。请在报告和演示文稿中清楚地标记合成发现。利益相关者在后来发现省略时会损害对您整个研究计划的信任。最好将合成结果呈现为“AI模拟探索”,并附有明确标记的人类验证数据。
合成用户研究与传统研究相比的成本是多少?
合成发现阶段通常花费500美元-2000美元,而等效的人类研究花费10,000美元-30,000美元——每次会话的成本降低了90%以上。完整的混合计划仍然在验证和发布前阶段投资于人类研究,但总体预算大幅降低,因为AI在人类招募支出被消耗之前过滤掉了弱概念。
相关文章
准备将合成用户添加到您的研究堆栈中吗?
构建真正存在分歧的人物面板——并在本周运行您的第一个合成发现阶段。