MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件
arXiv编号:arXiv:2609.21325v1 [cs.AI]
摘要 多智能体系统包含协作、竞争博弈、混合动机交互,是大模型智能体重要研究方向,但目前缺少统一、大规模、场景丰富的标准化评测套件。本文提出MAgent‑Eval,一套面向大语言模型多智能体交互的大规模开源评测套件。数据集包含1200条完整多智能体交互实例,覆盖三大交互范式:纯协作、零和博弈、混合动机博弈;涵盖谈判、团队规划、密室逃脱、资源竞争、社会困境、道德权衡等12类现实世界场景。 MAgent‑Eval设计分层评测指标:包含单智能体个体能力指标、交互过程指标、全局系统级指标;同时提供可复现运行脚手架、参考评判脚本、标准化评估流水线。在10个主流大模型上开展大规模评测;实验揭示:模型在单智能体任务上的性能不能直接迁移预测多智能体交互表现;博弈对抗场景下,强单基座模型仍然会出现策略误判、被对手诱导等问题。消融实验分析智能体数量、信息不对称、角色分配对交互结果的影响。整套数据集、运行脚手架、评判脚本全部开源。
关键词 多智能体;多智能体评测;博弈;协作;混合动机;大语言模型智能体
目录
- 3.1 任务分类与场景
- 3.2 实例构造流程
- 3.3 交互环境脚手架
- 3.4 分层完整指标体系
- 3.4.1 个体智能体指标
- 3.4.2 交互过程指标
- 3.4.3 全局系统指标
- 4.1 被测模型集合
- 4.2 评测执行配置
- 4.3 对比参考基线
- 5.1 不同交互范式下模型整体表现
网硕互联帮助中心





评论前必须登录!
注册