大模型微调核心技术详解:LoRA与QLoRA原理、实战、差异及选型指南
摘要:随着大语言模型参数规模突破百亿、千亿级,传统全参数微调显存开销大、算力成本高、过拟合风险显著等问题愈发突出。参数高效微调...
摘要:随着大语言模型参数规模突破百亿、千亿级,传统全参数微调显存开销大、算力成本高、过拟合风险显著等问题愈发突出。参数高效微调...
作者:吴业亮 博客:wuyeliang.blog.csdn.net 1 PEFT技术核心原理 参数高效微调(Param...
文章浏览阅读22次。摘要:本文介绍了使用半精度模型(FP16/BF16)来优化深度学习模型内存占用的方法。通过PyTorch的torch_dtype参数可直接加...