一、文章主要内容总结
本文提出了DrawingBench——一个用于评估智能体大语言模型(agentic LLMs)空间推理能力和UI交互能力的可验证基准框架。该框架通过要求模型生成基于鼠标操作的低级别GUI动作序列来完成绘图任务,实现对模型可信度的透明化评估,弥补了现有基准在空间交互任务中缺乏动作序列生成、细粒度UI控制和多轮反馈学习测试的不足。
核心构成
关键发现
<
本文提出了DrawingBench——一个用于评估智能体大语言模型(agentic LLMs)空间推理能力和UI交互能力的可验证基准框架。该框架通过要求模型生成基于鼠标操作的低级别GUI动作序列来完成绘图任务,实现对模型可信度的透明化评估,弥补了现有基准在空间交互任务中缺乏动作序列生成、细粒度UI控制和多轮反馈学习测试的不足。
<
评论前必须登录!
注册