TL;DR
- •单智能体数据生成收敛于一个声音;多智能体辩论之间的不同人格产生所需的变异和冲突
- •四种技术:对抗性对话、协作问题解决、人格化的变异和升级场景
- •实现是一个 5 步循环 —— 定义人格、框定可辩论的场景、运行变异的辩论、审查结构化的记录、导出和过滤 —— 通过多样性、连贯性、一致性和覆盖范围来衡量
请提供需要翻译的文本。
在合成数据管道中,有一种安静的失败模式:使用单一生成代理构建的人工智能训练数据集听起来都像是同一个人。让一个模型生成一万条客户对话,你会得到一万种最可能的客户的变体——相同的礼貌程度,相同的反对模式,相同的整洁解决方案。基于这些数据训练的模型在看起来像这些数据的情况下表现出色,但在面对真实用户时却会 stumble,因为真实用户比任何单一代理的想象更复杂、更愤怒、更困惑且更具多样性。
多智能体模拟从根本上解决了这个问题。与其让一个智能体生成互动的双方,不如让多个具有真正不同特征的AI角色——怀疑者、乐观者、务实者、辩论者——相互互动、争论和谈判。由此产生的数据包含了现实世界AI系统实际需要学习的内容:分歧、说服、挫折、修复,以及那些不共享剧本的人类之间千丝万缕的小摩擦。
本指南涵盖了为什么多智能体生成优于单智能体、四种核心仿真技术、使用ArgumenTroupe的逐步实现,以及告诉您合成数据集是否值得训练的质量指标。
为什么选择多智能体进行训练数据?
合成数据的转变不再是猜测 — Gartner 预测到 2026 年,75% 的企业将使用合成数据进行人工智能,而 合成数据研究 现在已成为一门标准学科。开放的问题不再是是否生成数据,而是如何生成足够多样化以便有用的数据。
多样性问题
单一代理生成有一个结构性上限。然而,无论模型多么强大,它都只从一个分布中进行采样:
- ✗同质变异 — 表面层次上对同一基础对话的释义,而不是实质上不同的互动
- ✗缺失多角度结构 — 真实的对话涉及目标、知识和情绪不同的各方;一个代理人同时扮演双方会将一种世界观泄露到双方中。
- ✗没有冲突或谈判模式 — 生成器过于合作地解决紧张局势,因此训练的模型从未学会如何应对无法被安抚的用户
- ✗代表性不足的边缘案例 — 不太可能但至关重要的交互在输出中仍然不太可能,正是模型在生产中失败的地方
多智能体优势
将不同的角色置于真实的互动中,转变了每一个弱点:
- ✓来自不同角色的自然变异 — 一个怀疑者和一个乐观者对同一情况的反应产生结构上不同的语言,而不是同义改写
- ✓真实的对话动态 — 中断、误解、澄清和话题漂移源于互动,而不是事先编写的。
- ✓新兴行为和模式 — 出现了谈判、联盟变化和让步,这些都是没有人促成的,因为它们源于相互冲突的目标。
- ✓系统化的边缘案例覆盖 — 指定一个角色作为困难案例(愤怒的客户,困惑的新手),边缘案例成为一个配置参数,而不是偶然的意外。
多智能体仿真技术
四种技术涵盖了大多数训练数据的需求。它们组合在一起——一个成熟的流程通常会在同一场景库中运行几种技术。
技巧 1:对抗性对话
一个代理提出建议;第二个代理进行批评。提议者必须辩护、完善或让步,每次交流都会生成一个提议-反对-回应的三元组。这是处理反对意见数据的最丰富来源——客户面对面和咨询模型最需要的模式,而有机数据集却最少包含。由于批评者被配置为无情,因此数据涵盖的反驳链远比礼貌的人类对话记录的要深得多。以这种方式构建的数据集教会模型的不仅是该说什么,还有如何在压力下坚持立场以及何时让步。
技术 2:协作解决问题
多个代理朝着共同目标努力——规划项目、诊断故障、起草文件。互动捕捉了协调语言:提出下一步、分配子任务、检查理解、在部分答案的基础上进行扩展。它还模拟了现实的轮流发言和贡献不对称,因为一个配置良好的团队包括一个主导声音、一个仔细的总结者和一个需要被引导的安静成员。使用这些数据训练的助手模型在处理多方线程和长期任务方面明显优于仅在一对一交流中训练的模型。
技术 3:基于角色的变体
相同的场景会重复运行,角色阵容各不相同。由一位耐心的退休人员、一位简洁的高管和一位焦虑的首次买家处理的退款请求,从一个场景定义中产生了三种结构上不同的对话——在人口统计和风格上的变化几乎没有边际创作成本。这是覆盖的主要技术:一次定义你的场景库,然后在由真实的AI角色档案构建的人物矩阵上进行应用。这也是测试模型是否服务于所有用户,而不仅仅是平均用户的诚实方式。
技术4:升级场景
在互动中,困难和冲突故意上升——一个轻微的问题变成了抱怨,变成了威胁,变成了对经理的要求。升级运行捕捉适应模式(随着风险上升语言如何变化)和解决策略(什么能缓和,什么会激化)。真实的日志包含很少完整的升级弧,因为大多数对话都提前结束;模拟可以每次生成完整的弧,包括恢复过程。对于安全关键和支持模型,这种技术生成了每个标记最重要的训练示例。
实施指南:使用ArgumenTroupe进行多代理数据生成
ArgumenTroupe 是为多角色讨论而构建的,这使它成为一个自然的生成引擎:你组建一个角色团队,让他们有争议的话题,然后收集结构化的辩论。无需编写脚本 — 整个流程通过配置运行。以下是端到端的工作流程。
定义你的角色团队
从基本角色开始——怀疑者、乐观者、务实者、反对者——并根据您的数据集需求扩展它们的角色:一个感到沮丧的长期客户,一个非技术性的新手,一个注重合规的经理。对于每个角色,您需要指定一个名称、一小部分特征(急躁、注重细节、厌恶风险),以及一个将他们的情况固定下来的背景描述。独特性是关键:如果两个角色会说同样的话,就合并它们,并添加一个不会这样说的角色。
将情境框架设定为可辩论的问题
多代理数据的丰富程度仅取决于提示中的紧张关系。将您库中的每个场景转换为角色可以真正产生分歧的内容——不是“讨论我们的退款政策”,而是“这个边缘退款是否应该被批准?”设置每次运行的参数:参与的角色、交换轮次的大致数量,以及必须出现的边缘案例(一次中断、一个事实更正、一个未解决的结局)。
进行辩论并改变配置
启动模拟并让剧团争论。然后用交换角色的方式重新运行相同的场景(基于角色的变体),添加一个评论者(对抗性对话),或提高赌注(升级)。每个配置都是来自同一场景投资的数据集的新切片。在进行时为每次运行标记其场景、角色阵容和预期结果——在生成时添加的元数据几乎是免费的,而事后重建则绝对不是。
查看结构化的转录文本
这是一个审议平台相较于原始模型循环的价值所在。ArgumenTroupe 将每个会议记录为结构化的论证记录——谁说了什么,回应了哪个观点,支持了哪个立场——而不是一段没有区别的文本墙。在论证层面浏览会议:检查角色是否保持在角色中,是否确实发生了分歧,以及对话是否以多种方式结束。丢弃或标记那些小组过早达成一致的会议——共识是合成多样性的失败模式。
导出并筛选用于培训
导出经过批准的成绩单及其元数据,然后应用标准的卫生检查:对空白、重复或不符合政策的内容进行自动过滤;对几乎相同的运行进行去重;对随机样本进行人工审核。将数据分为训练集、验证集和测试集——并保留真实的人类生成数据以进行最终评估,这样您可以将模型与现实进行比较,而不是与更多合成数据进行比较。该流程在我们的<a href="/use-cases/training-data-generation">训练数据生成用例</a>中从产品方面进行了描述。
多智能体数据的质量指标
生成是便宜的;知道你生成了什么才是学问。四个指标家族涵盖多智能体数据集:
- •多样性得分 — 语料库中的词汇和语义分布。如果你的对话嵌入紧密聚集,你的人格就会合并成一个声音,多代理的优势就消失了。
- •连贯性指标 — 每个回合是否回应了之前的内容?多智能体运行可能会漂移成平行独白;连贯性检查可以捕捉到智能体之间交谈失焦的记录。
- •角色一致性 — 在第2轮中的怀疑者在第20轮中仍然必须是怀疑者。不一致的角色会教会下游模型说话者身份是无意义的,这正破坏了您生成数据的信号。
- •覆盖分析 — 生成的映射与您的场景-角色矩阵及所需的边缘案例进行比较。矩阵中的空白在生产模型遇到您从未生成的单元格之前是静默的。
案例研究:客户服务机器人培训
考虑一个代表性的(复合)例子:一个团队正在为订阅产品构建一个客户服务助手。他们的第一个训练集是由单一代理生成的——一个模型在数千个工单中扮演客户和代理的角色。这个机器人在内部测试表现良好,但在真实客户面前表现不佳,呈现出一个明显的模式:它能够很好地处理礼貌、结构良好的请求,但在客户愤怒、模糊或对其第一个回答提出质疑时就崩溃了。训练数据几乎没有包含真正的反对意见,因为一个单一的代理在扮演双方时是以合作的方式解决自己的工单。
重建使用了多智能体模拟。一个角色小组——沮丧的高级用户、困惑的新手、寻找折扣的顾客、已经联系过支持两次的客户——在相同的场景库中与一个代理角色进行对抗,叠加了对抗和升级配置。新的数据集包含了缺失的结构:多轮反对链、升级、错误回答后的修复,以及未解决的对话。
在多智能体语料库上重新训练后,机器人的行为在数据变化的地方发生了变化:它不再对不满意的客户重复其第一个回答,学会在解决问题之前承认挫折,并在更合理的时刻升级到人类。这个一般性教训超越了支持机器人:模型学习其数据中存在的互动模式,而多智能体模拟目前是将这些硬性模式引入的最可控方式。有关更广泛的生成方法,请参阅我们的生成合成对话数据指南。
常见问题
多智能体模拟如何改进AI训练数据?
它用多个不同的角色取代单一的生成器——单一生成器从一个分布和一个声音中采样每次对话。生成的数据包含单一智能体生成系统性缺乏的分歧、谈判、升级和人口变异,这正是现实世界模型需要处理难以应对的用户和多方动态的材料。
单智能体和多智能体数据生成有什么区别?
单智能体生成使用一个模型生成对话的所有方面,因此双方秘密共享一个世界观,冲突得以过于合作地解决。多智能体生成为每一方分配一个不同配置的角色——怀疑者、乐观者、实用主义者、devil's advocate——因此,从交互本身而不是脚本中产生紧张、误解和适应。
如何使用多智能体AI创建训练数据?
遵循五步循环:定义一组不同的角色,将场景框定为可争议的问题,在改变角色阵容和冲突水平的同时运行辩论,审查结构化的记录以确保角色的一致性和真正的分歧,然后导出、过滤、去重和分割数据。始终将最终模型评估为保留的真实数据,而不是合成数据。
如果我使用多智能体模拟,是否仍然需要真实数据?
是的。多智能体模拟是规模层,而不是取代真实数据的东西。真实数据扮演两个不可替代的角色:它将角色配置基于实际用户的行为,并提供了一个保留的评估集,告诉你是否在合成数据上进行训练可以提高现实世界的性能。将合成数据和真实数据视为互补。
相关文章
生成能够反驳的训练数据
组装一个角色团队,运行结构化的辩论,并导出模型可以真正学习的记录。