云计算百科
云计算领域专业知识百科平台

DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Mode...

一、文章主要内容总结

本文提出了DrawingBench——一个用于评估智能体大语言模型(agentic LLMs)空间推理能力和UI交互能力的可验证基准框架。该框架通过要求模型生成基于鼠标操作的低级别GUI动作序列来完成绘图任务,实现对模型可信度的透明化评估,弥补了现有基准在空间交互任务中缺乏动作序列生成、细粒度UI控制和多轮反馈学习测试的不足。

核心构成
  • 数据集设计:包含250个多样化绘图提示,覆盖20个类别和4个难度等级(简单、中等、困难、极难),提示遵循清晰性、多样性、现实性和可测量性原则。
  • 绘图环境:提供1000×700像素画布,支持6种绘图工具、8种颜色和3种线条尺寸,模型需输出moveTo、click等4类鼠标动作序列。
  • 评估体系:基于8项客观标准(工具使用、颜色匹配、绘制段数、画布覆盖率等)和4类错误类型(语法错误、坐标错误等)进行确定性评分,支持多轮反馈机制(两回合交互,基于结构化反馈优化输出)。
  • 实验验证:对4个主流LLM(Claude-4 Sonnet、GPT-4.1、GPT-4.1-mini、Gemini-2.5 Flash)进行1000次测试,最终模型实现92.8%的完美得分率,结构化反馈平均提升3.2%性能(复杂场景最高提升32.8%)。
  • 关键发现

    <

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Mode...
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!