云计算百科
云计算领域专业知识百科平台

HCIA - Al Solution 华为认证—— 7、大模型训练解决方案

目录

一、大模型训练基础特性

1. 计算效率瓶颈

二、昇腾大模型训练解决方案

1. CANN介绍

1)CANN定义

2)AI开发阻碍

3)AI发展趋势

4)昇腾AI基础软硬件平台

5)CANN目标

6)CANN黑科技

7)CANN编程接口

8)CANN五层架构

9)昇腾社区

10)CANN总体架构

2. HCCL集合通信库

1)HCCL定义

2)HCCL作用

3. Ascend C算子编程语言

1)Ascend C定义

2)Ascend C优势

4. AOL算子加速库

5. CANN使能能力

6. 大模型分布式训练三大能力

1)可部署

2)通信快

3)算得快

7. CANN支持并行策略

1)通用并行策略

2)重计算

8. MindStudio开发工具

1)MindStudio介绍

2)MindStudio功能

3)关键特性

4)功能全览

5)工程管理

6)推理一体化工具

7)模型训练

8)模型转换和调优

9)支持框架类型

9. AI应用使能套件

1)大模型使能套件

2)MindFormers

3)ModelZoo

4)Ascend工具库

三、昇腾大模型训练解决方案

1. ModelShow模型效果展示

2. 大模型分布式训练三大核心能力

3. HCCL集合通信库

4. Ascend C算子编程语言

5. 大模型使能套件

6. 大模型微调种类

7. 大模型训练计算资源需求

四、大模型微调方案

1. 大模型微调方案概述

2. 大模型微调种类

1)增量预训练

2)有监督微调

3)RLHF强化学习训练

3. 指令微调SFT

4. 对齐微调RLHF

5. 高效微调技术

6. 常见大模型微调方法

1)核心思想与分类

2)Prompt Tuning

3)P-Tuning

4)Prefix Tuning

5)LoRA

7. 主流微调技术对比

五、大模型微调开源工具

1. Huggingface Transformers

2. Huggingface PEFT

3. Huggingface TRL

4. DeepSpeed-Chat

5. MindPet

六、知识小结


一、大模型训练基础特性



00:00



1. 计算效率瓶颈



00:11



  • 核心问题: 训练千亿参数模型通常需要数千块算力芯片组成集群,这会引发一系列计算效率瓶颈。
  • 主要挑战:
    • 参数同步: 多芯片间需要频繁同步模型参数,通信开销巨大。
    • 带宽限制: 芯片间的数据传输带宽有限,成为性能提升的瓶颈。
    • 硬件异构性: 不同硬件具有不同的架构和性能特性,难以协同优化。
    • 算子亲和度低: 硬件适配性差,现有算子无法充分利用硬件能力。
    • 算子缺失: 部分关键计算操作缺乏对应的硬件加速算子,导致性能下降。
二、昇腾大模型训练解决方案



00:51



1. CANN介绍
1)CANN定义
  • CANN全称: Compute Architecture for Neural Networks,是昇腾针对AI场景推出的异构计算架构。
  • 核心定位: 在AI框架与硬件之间发挥承上启下的关键作用。
    • 对上: 支持多种AI框架(如MindSpore、PyTorch、TensorFlow等)。
    • 对下: 服务AI处理器与编程,是提升昇腾AI处理器计算效率的关键平台。
  • 编程接口: 针对多样化应用场景,提供高效易用的编程接口,支持用户快速构建基于昇腾平台的AI应用。
2)AI开发阻碍



01:41



  • 当前AI面临的主要阻碍:
    • 昂贵的AI算力设施: 硬件成本高。
    • 稀缺的AI专业人才: 人才门槛高。
    • 与日俱增的AI开发难度: 技术复杂度上升。
3)AI发展趋势



01:55



  • 未来AI发展趋势:
    • 超大模型: 不断涌现千亿参数量的超大模型。
    • 通用算法: 不断探索跨领域、多模态的通用算法。
    • 异构计算: 越发多样的CPU、GPU、NPU异构计算算力需求。
4)昇腾AI基础软硬件平台



02:23



  • 生态AI基础: 以基础软硬件平台为基础构建的人工智能计算产业。
  • 平台组成:
    • 硬件: 阿特拉斯系列硬件及伙伴硬件。
    • 架构: 异构计算架构CANN。
    • 框架: 全场景AI框架昇思MindSpore。
    • 工具: 昇腾应用使能MindX一站式开发平台、模型二次开发等。
  • 应用领域: 为能源、金融、交通、电信、智慧城市、制造、医疗等领域提供行业解决方案。
5)CANN目标



02:54



  • CANN核心目标: 作为昇腾AI硬件的使能异构计算架构,以提升用户开发效率和打造昇腾AI极致性能体验为目标。
    • 对上: 支持MindSpore、TensorFlow、PyTorch等多种AI框架。
    • 对下: 服务昇腾AI硬件,发挥承上启下的关键作用。
6)CANN黑科技



03:12



  • CANN关键技术: 通过多种“黑科技”充分释放昇腾AI处理器澎湃算力。
    • 自动流水: 自动流水算子深度融合。
    • 自适应梯度切分: 自适应梯度切分调优。
    • 智能计算调优: 智能计算调优等。
7)CANN编程接口



03:27



  • 多层次编程接口ACL: CANN针对多样化应用场景提供AscendCL(昇腾计算语言接口)。
    • 优势: 全场景、低门槛、高性能。
    • 目标: 支持用户快速构建AI应用和业务。
8)CANN五层架构



03:39



  • CANN自顶向下分为五部分:
  • 昇腾计算语言接口

    03:42

    

    • AscendCL: 昇腾计算开放编程框架,方便用户管理和使用昇腾软硬件资源,开发人工智能应用。
  • 昇腾计算服务层

    03:53

    

    • 功能: 提供昇腾算子库(如神经网络库、线性代数计算库等)和昇腾调优引擎,提升模型端到端运行效率。
  • 昇腾计算编译层

    04:05

    

    • 功能: 通过图编译器将用户输入的中间表达计算图编译成昇腾硬件可执行模型。
    • 辅助机制: 借助张量加速引擎TBE等自动调度机制,高效编译算子。
  • 昇腾计算执行层

    04:19

    

    • 功能: 负责模型和算子的执行,提供运行任务调度、计算单元运行管理等功能。
  • 昇腾计算基础层

    04:30

    

    • 功能: 为其上各层提供基础服务,如共享虚拟内存、设备虚拟化、主机设备通信等。
9)昇腾社区



04:40



  • 学习资源: 登录昇腾社区可获取丰富的AI学习资源、前沿技术分享。
  • 活动比赛: 提供多元化活动和比赛,为学习者提供施展舞台。
10)CANN总体架构



05:20



  • 架构总结: CANN向上支持MindSpore、PyTorch、TensorFlow等AI框架,向下服务Atlas系列AI处理器及编程。
  • 核心作用: 发挥承上启下的关键作用,是提升昇腾AI处理器计算效率的关键平台。
2. HCCL集合通信库



05:54



1)HCCL定义



05:58



  • HCCL全称: Huawei Collective Communication Library,是基于昇腾AI处理器的高性能集合通信库。
  • 核心功能: 提供单机多卡以及多机多卡间的数据并行、模型并行集合通信方案。
2)HCCL作用



06:29



  • HCCL三大作用:
    • 提升通信效率: 提升大规模并行计算的通信效率。
    • 降低调度开销: 降低调度开销,优化硬件资源利用率。
    • 并发流水执行: 实现计算与通信的并发流水执行,进一步提升性能。
3. Ascend C算子编程语言



06:59



1)Ascend C定义



08:28



  • Ascend C是什么: 昇腾CANN针对算子开发场景推出的编程语言。
  • 语言基础: 原生支持C/C++标准规范,兼具开发效率和运行性能。
  • 运行机制: 基于Ascend C编写的算子程序,通过编译器编译和运行时调度,在昇腾AI处理器上运行。
  • 核心价值: 开发者可以基于昇腾AI硬件,高效地实现自定义的创新算法。
2)Ascend C优势



09:03



  • 遵循C/C++标准

    09:06

    

    • 开发习惯匹配: 遵循C/C++编程规范,匹配用户开发习惯。
    • 编程方式: 开发者采用标准C++语法和类库API进行编程。
    • API分类:
      • 基础API: 对硬件能力进行抽象,开放芯片能力,保证完备性和兼容性。
        • 数据操作方式:
          • 整个Tensor参与计算。
          • Tensor前n个数据计算。
          • Tensor高维切分计算。
      • 高阶API: 调用多种基础API实现常用计算算法,提高开发效率。
  • 自动化流水并行调度

    09:59

    

    • 核心目标: 获得最优执行性能。
    • 并行调度方式:
      • 核间并行(SPMD): 支持Single Program Multiple Data数据并行,将数据拆分到处理器的多个计算核心上并行处理。
      • 核内流水并行: 将算子核内的处理程序分为多个流水任务(搬入、计算、搬出),在核内形成流水线。
        • 流水线机制: 当前任务对数据处理完成后,立即交由下一个任务,并开始对下一批数据的处理。
        • 阶梯式调度优势: 搬出和搬入任务不需要太多算力,通过阶梯式流水,算力可以更集中于计算任务,避免三部分同时计算导致算力分散。
  • 结构化核函数编程

    10:46

    

    • 核心目的: 简化算子开发逻辑。
    • 编程范式: 提供结构化的编程范式,将算子核函数的实现程序分解为更小、易于理解和管理的部分。
    • 矢量编程范式(三段式结构):
      • Stage1: CopyIn: 将输入数据从Global内存搬运到Local内存。
      • Stage2: Compute: 使用Local内存中的数据进行计算。
      • Stage3: CopyOut: 将计算结果从Local内存搬运回Global内存。
    • 开发效率: 该编程方式帮助开发者搭建编程框架,开发者可以聚焦算子的实现逻辑,极大提高编程效率。
  • CPU/NPU孪生调试

    11:15

    

    • 核心目的: 提升算子调试效率。
    • 孪生调试机制: CPU域模拟NPU域的行为,相同的算子代码可以在不同域进行调试。
    • CPU域调试:
      • 编译: 通过GCC编译器编译,生成CPU域的二进制文件。
      • 调试工具: 可以通过GDB等工具进行功能调试。
      • 调试重点: 主要调试精度问题。
    • NPU域调试:
      • 编译: 通过毕昇编译器编译,生成NPU域的二进制文件。
      • 调试工具: 通过仿真流水图或上板数据采集等方式进行性能调优。
      • 调试重点: 主要调试性能问题。
    • 工作流程: 在CPU上调整精度后,再到NPU上进行全力训练。
4. AOL算子加速库



14:32



  • AOL定义: AOL(Ascend Operator Library)是昇腾的算子加速库,为神经网络在昇腾硬件上的加速计算提供基础。
  • 核心功能: 提供一系列深度优化、硬件亲和的高性能算子,包括Neural Network、Digital Vision Pre-Processing等。
  • 调用方式: 通过单算子API(基于C语言)执行,无需提供IR(中间表示)定义,简化调用流程。
  • 开发者价值: 开发者无需纠结底层代码,直接通过API文档调用即可,高效赋能模型创新与应用。
5. CANN使能能力



15:37



  • CANN定位: 向下使能处理器并行加速,向上使能高效开发。
  • 并行加速能力:
    • 自动流水并行调度: 实现处理器并行加速。
    • 算子深度融合: 提升计算效率。
    • 整图下沉: 减少数据搬运开销。
    • 自适应梯度切分: 优化大模型训练。
  • 高效开发能力:
    • 兼容业界主流AI框架: 全面支持PyTorch等框架,同步社区版本发布。
    • 融合算子库: 支持FlashAttention等Transformer网络加速算子,多模型/多尺寸/多shape全面支持,精度与性能持平业界。
    • GPU生态迁移: 保持AI框架不变,模型可快速由GPU迁移至NPU运行,支持周级迁移。
    • Ascend C算子开发: 遵循C/C++标准规范,简化算子编程逻辑,自动获取最优调度,支持Transformer架构融合算子高效开发。
    • 全流程工具链: 提供从开发到部署的完整工具支持。
6. 大模型分布式训练三大能力



15:58



1)可部署



16:09



  • 核心目标: 在内存受限的显卡上成功部署大模型。
  • 实现方法: 通过合理的分布式切分策略和内存优化技术,让模型能够适配显存较小的显卡。
2)通信快



16:22



  • 核心目标: 优化集群中显卡之间的数据通信性能。
  • 关键挑战: 集群规模越大,通信域越大,通信耗时成为主要矛盾。
  • 优化方向: 降低通信延迟、解决数据通信拖尾问题、减少流水线气泡(bubble)占比。
3)算得快



16:32



赞(0)
未经允许不得转载:网硕互联帮助中心 » HCIA - Al Solution 华为认证—— 7、大模型训练解决方案
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!