云计算百科
云计算领域专业知识百科平台

CEQuest: Benchmarking Large Language Models for Construction Estimation

文章总结与翻译

一、文章主要内容

本文聚焦大型语言模型(LLMs)在建筑领域的应用评估,核心是构建并验证了专门用于评估LLMs在建筑图纸解读与工程量估算任务性能的基准数据集CEQuest,具体内容如下:

  • 研究背景:LLMs在通用领域表现出色,但在建筑等需专业知识的领域应用未充分探索。建筑行业经济规模庞大(全球万亿美元级),依赖建筑图纸等非结构化数据,却因数字化程度低存在效率低、成本超支等问题,亟需AI技术介入,但缺乏针对性的LLM评估工具。
  • 数据集CEQuest构建:
    • 由领域专家基于建筑估算教材、图纸解读指南及实际教学实践设计,含164个问题,涵盖5个主题领域:通用建筑知识、图纸元素识别、图纸组织与视图类型、空间推理与交叉引用、工程量计算与估算。
    • 问题类型分两类:101道(62%)选择题(3-6个选项)、63道(38%)判断题,以结构化JSON格式存储,每个问题包含问题ID、问题文本、正确答案、选项(选择题)等字段,将开源并鼓励社区贡献以持续完善。
  • 实验设计与结果:
    • 选取5个主流LLMs(开源的Gemma 3、Phi4、LLaVA、Llama 3.3,闭源的GPT-4.1),从准确率、执行时间、模型大小三方面评估,实验在含AMD Ryzen Threadripper PRO 7965WX CPU、256GB内存、两块NVIDIA RTX 3090 GPU的服务器上进行,重复5次取均值±标准差
  • 赞(0)
    未经允许不得转载:网硕互联帮助中心 » CEQuest: Benchmarking Large Language Models for Construction Estimation
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!