文章主要内容与创新点总结
一、主要内容
本文聚焦大型语言模型(LLMs)在数学计算与推理中的准确性,旨在为其在数学教育中的可靠应用提供依据。研究选取4个LLM(OpenAI GPT-4o、o1,DeepSeek-V3、R1),针对算术(两个5位数相乘)、代数(含二次方程的代数文字题)、数论(丢番图方程求解)三类数学任务,在单智能体和双智能体两种配置下展开评估。
1. 研究设计
- 数据集构建:未采用标准基准数据集,而是通过项目模型(item models)和自动项目生成(AIG)技术构建具有挑战性的数学任务,每个任务类别生成10个实例,避免数据泄露问题。
- 模型配置:单智能体配置中,4个模型独立完成任务;双智能体配置中,GPT-4o与DeepSeek-V3通过交互式聊天协作解题、交叉验证并优化推理过程,每种配置均重复3次以确保可靠性。
- 评估方法:将解决方案拆解为独立步骤,依据预定义评分标准(CC:条件正确、PE:程序性错误、CE:概念性错误、IE:停滞错误)对步骤进行标注,标注先由o1模型完成,再经人类专家验证,同时采用条件评分法避免因前期步骤错误惩罚模型。
2. 核心研究结果
- 单智能体最终答案准确性:
- 算术任务:o1模型全程准确率100%,DeepSeek-V3从8/10提升至后续迭代的10/
网硕互联帮助中心



评论前必须登录!
注册