云计算百科
云计算领域专业知识百科平台

MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件

MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件

arXiv编号:arXiv:2609.21325v1 [cs.AI]

摘要 多智能体系统包含协作、竞争博弈、混合动机交互,是大模型智能体重要研究方向,但目前缺少统一、大规模、场景丰富的标准化评测套件。本文提出MAgent‑Eval,一套面向大语言模型多智能体交互的大规模开源评测套件。数据集包含1200条完整多智能体交互实例,覆盖三大交互范式:纯协作、零和博弈、混合动机博弈;涵盖谈判、团队规划、密室逃脱、资源竞争、社会困境、道德权衡等12类现实世界场景。 MAgent‑Eval设计分层评测指标:包含单智能体个体能力指标、交互过程指标、全局系统级指标;同时提供可复现运行脚手架、参考评判脚本、标准化评估流水线。在10个主流大模型上开展大规模评测;实验揭示:模型在单智能体任务上的性能不能直接迁移预测多智能体交互表现;博弈对抗场景下,强单基座模型仍然会出现策略误判、被对手诱导等问题。消融实验分析智能体数量、信息不对称、角色分配对交互结果的影响。整套数据集、运行脚手架、评判脚本全部开源。

关键词 多智能体;多智能体评测;博弈;协作;混合动机;大语言模型智能体

目录

  • 引言
  • 相关工作
  • MAgent‑Eval评测套件设计
    • 3.1 任务分类与场景
    • 3.2 实例构造流程
    • 3.3 交互环境脚手架
    • 3.4 分层完整指标体系
      • 3.4.1 个体智能体指标
      • 3.4.2 交互过程指标
      • 3.4.3 全局系统指标
  • 实验设置
    • 4.1 被测模型集合
    • 4.2 评测执行配置
    • 4.3 对比参考基线
  • 主实验结果
    • 5.1 不同交互范式下模型整体表现
  • 赞(0)
    未经允许不得转载:网硕互联帮助中心 » MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!