文章总结与翻译
一、文章主要内容
本文聚焦大型语言模型(LLMs)在建筑领域的应用评估,核心是构建并验证了专门用于评估LLMs在建筑图纸解读与工程量估算任务性能的基准数据集CEQuest,具体内容如下:
- 由领域专家基于建筑估算教材、图纸解读指南及实际教学实践设计,含164个问题,涵盖5个主题领域:通用建筑知识、图纸元素识别、图纸组织与视图类型、空间推理与交叉引用、工程量计算与估算。
- 问题类型分两类:101道(62%)选择题(3-6个选项)、63道(38%)判断题,以结构化JSON格式存储,每个问题包含问题ID、问题文本、正确答案、选项(选择题)等字段,将开源并鼓励社区贡献以持续完善。
- 选取5个主流LLMs(开源的Gemma 3、Phi4、LLaVA、Llama 3.3,闭源的GPT-4.1),从准确率、执行时间、模型大小三方面评估,实验在含AMD Ryzen Threadripper PRO 7965WX CPU、256GB内存、两块NVIDIA RTX 3090 GPU的服务器上进行,重复5次取均值±标准差
网硕互联帮助中心



评论前必须登录!
注册