ConfTuner论文总结与关键部分翻译
一、文章主要内容
本文聚焦大语言模型(LLMs)在高风险领域(如科学、法律、医疗)中普遍存在的“过度自信”问题——即模型生成错误答案时仍表现出高置信度,这严重影响了人机协作的可靠性与信任度。为解决此问题,研究提出了ConfTuner,一种简单高效的微调方法,旨在让LLMs能以自然语言准确表达自身置信度(如“我有80%的把握认为……”)。
1. 核心背景与现有方法局限
- 问题核心:当前LLMs未被明确训练以校准置信度表达,导致过度自信,在高风险场景(如医疗诊断)中可能引发严重后果(例如标准LLM可能误判疾病却给出高置信度,而校准后的LLM能合理表达不确定性,辅助医生做出更安全决策)。
- 现有方法缺陷:
- 基于提示工程的方法:依赖精心设计的指令,但校准效果有限;
- 基于训练的方法:需用启发式生成的“代理置信度”(如相似问题的平均准确率、多响应一致性)作为标签,却存在“假设同类问题等价”“计算成本高”“引入模型偏见”等问题。
2. ConfTuner的核心设计
- 理论基础:借鉴传统机器学习中“恰当评分规则”(Proper Scoring Rules)的思想——优化此类规则(如Brier分数)的模
网硕互联帮助中心






评论前必须登录!
注册