课程简介
ChatGPT是一款由OpenAI开发的聊天机器人模型,它能够模拟人类的语言行为,与用户进行自然的交互。它的名称来源于它所使用的技术GPT架构,即生成式语言模型,是大语言模型的领导者。
大语言模型通过使用大量的训练数据来模拟人类的语言行为,并通过语法和语义分析,生成人类可以理解的文本。它可以根据上下文的语境,提供准确和恰当的回答,并模拟多种情绪和语气。这样,就可以让用户在与机器交互时,感受到更加真实和自然的对话体验。
大语言模型应用场景也很广泛。它可以用于处理多种类型的对话,包过对话机器人、问答机器人和客服机器人等。它还可以用于各种自然语言处理任务,比如文本摘要、情感分析和信息提取等。例如,在问答系统中,大语言模型可以提供准确的答案,解决用户的疑惑;在一个客服机器人中,他可以帮主用户解决问题,提供更好的服务体验。大语言模型的通用知识交互能力很强大,但是如果能让它们连接到自定义的数据和计算,就会有更多的实用价值。
此课程是尹立庆老师多年人工智能工作经验的分享,重点介绍大语言模型分布式训练技术、应用落地和未来发展趋势。
培训目标
大语言模型概述
深度解读大语言模型的原理、技术特性;
大模型分布式训练概述;
大模型分布式训练环境搭建;
大模型分布式训练代码开发;
大模型分布式训练实践;
介绍大语言模型实施落地技术;
英伟达GPU+CUDA架构;
深度解读GPU训练参数设置;
深度解读大模型微调;
深度解读大语言模型带来的技术变革与行业应用落地;
深度解读业界最新的大语言模型技术;
深度解读glm2_6b大模型;
深度剖析大语言模型的价值、应用场景;
课程重点探讨大语言模型的未来发展趋势;
培训对象:
本课程适合于对ChatGPT、大语言模型感兴趣的人员;
本课程适合于架构师、技术经理、高级工程师;
适合于企业科技研发人员和人工智能科学家;
培训方式:
以课堂讲解、演示、案例分析为主,内容偏实用,结合讲解与演示方式,循序渐进,辅以互动研讨、现场答疑、学以致用。
课程安排
课程时间:2天
课程内容
时间 内容 备注
第1天 大模型分布式训练概述(大模型分布式训练概述)(60分钟) 大模型分布式训练概述 大模型技术原理 大模型分布式训练框架 常用的分布式训练框架 Megatron-LM DeepSpeed Megatron-LM DeepSpeed 3D并行化实现万亿参数模型训练 DeepSpeed三种并行方法 数据并行训练 模型并行训练 流水线并行训练 ZeRO零冗余优化器 如何选择一款分布式训练框架 常见的分布式训练框架 TensorFlow PyTorch MindSpore Oneflow PaddlePaddle Megatron-LM(张量并行) DeepSpeed(Zero-DP) Colossal-AI(高维模型并行) Alpa(自动并行) 训练超大规模语言模型主要技术路线 GPU + PyTorch + Megatron-LM + DeepSpeed TPU + XLA + TensorFlow/JAX 参数高效微调(PEFT)技术 影响大模型性能的主要因素 衡量大模型水平 大模型分布式并行计算技术(大模型分布式并行计算技术)(60分钟) 大模型分布式并行计算技术 数据并行DP(Data Parallel) 分布式数据并行 DDP (Distribution Data Parallel) 张量并行 流水并行 G-pipe PipeDream virtual pipeline 梯度累加 激活检查点 ZeRO MPI、GLOO和NCCL等通信策略 大模型生态相关技术 英伟达GPU+CUDA架构(英伟达GPU+CUDA架构)(60分钟) 英伟达GPU+CUDA架构 英伟达集合通信库NCCL 通讯操作原语 广播Broadcast 数据散播Scatter 规约运算Reduce AllReduce 数据收集Gather AllGather ReduceScatter Nvlink 显存优化技术 重计算(Recomputation) Activation checkpointing(Gradient checkpointing) 卸载(Offload)技术 ZeRO-Offload ZeRO-Infinity 混合精度(BF16/FP16) 大模型分布式训练环境搭建(大模型分布式训练环境搭建)(60分钟) AI大模型分布式集群 AI大模型分布式集群通信 大模型分布式训练环境搭建 GPU服务器配置 CPU硬件配置清单 GPU硬件配置清单 AI处理器(加速卡) 安装依赖包 配置环境 人工智能分布式训练平台概述(介绍人工智能分布式训练平台)(30分钟) 人工智能分布式训练平台 人工智能分布式训练平台TensorFlow 人工智能分布式训练平台Pytorch 人工智能分布式训练平台Horovod 人工智能分布式训练平台Caffe 人工智能分布式训练平台Yolov5s 人工智能分布式训练平台MobileNet 人工智能分布式训练平台Pytorch部署规划(介绍人工智能分布式训练平台Pytorch部署规划)(30分钟) Pytorch概述 Pytorch的特征 PyTorch框架基础知识 PyTorch优缺点分析 Pytorch运行机制 Pytorch基础架构 Pytorch框架分布式部署硬件环境规划 什么是数据流图(Data Flow Graph)? Pytorch的应用场景介绍 PyTorch框架分布式环境搭建(PyTorch框架分布式环境搭建)(60分钟) PyTorch框架分布式环境搭建 Pytorch硬件配置要求 硬件环境准备 Pytorch软件下载 Pytorch软件安装 PyTorch环境配置 Pytorch分布式环境验证 Pytorch案例开发 Pytorch案例分布式环境训练
时间 内容 备注
第2天 人工智能TensorFlow分布式训练平台部署规划(介绍人工智能TensorFlow分布式训练平台部署规划)(60分钟) 为什么需要TensorFlow 什么是TensorFlow TensorFlow2.0概述 TensorFlow2.0的特征 TensorFlow2.0的层次结构(低阶、中阶、高阶API) TensorFlow Eager Execution(TensorFlow的核心概念) TensorFlow运行机制 TensorFlow基础架构 Tensorflow两种分布式架构模式 in-graph架构模式 between-gragh架构模式 同步更新和异步更新 参数服务器(paramter server) 工作服务器(worker) TensorFlow分布式部署硬件环境规划 什么是数据流图(Data Flow Graph)? TensorFlow的应用场景介绍 人工智能 深度学习 神经网络 卷积神经网络 递归神经网络 TensorFlow概念 计算图 张量 变量 取回 供给 TensorFlow2.0集成Keras 张量与操作 常用模型层 tf.keras三种构建模型的方式 TensorFlow2.0基本操作 神经网络正向传播与反向传播 Keras版本训练与自定义训练 AutoGraph详解 模型保存与加载 实操:Tensor操作、实现自动微分 采用自定义层实现逻辑回归分类器 人工智能TensorFlow分布式训练平台部署搭建(人工智能TensorFlow分布式训练平台部署搭建)(30分钟) 硬件配置要求 硬件环境准备 安装部署操作系统 网络配置规划 网络配置 TensorFlow Serving介绍 Tensorflow Serving技术架构 Tensorflow Serving使用教程 gRPC概述 服务器GPU环境部署TensorFlow分布式环境验证 TensorFlow案例开发 TensorFlow案例分布式环境训练 大模型分布式代码开发(大模型分布式代码开发)(30分钟) 大模型分布式代码开发 大模型结构 大模型算法 Transformer模型结构 仅编码器架构(Encoder-only) 仅解码器架构(Decoder-only) 编码器-解码器架构(Encoder-Decoder) 开源的大语言模型 ChatGLM-6B / ChatGLM2-6B GLM-10B/130B OPT-2.7B/13B/30B/66B LLaMA-7B/13B/30B/65B Alpaca(LLaMA-7B) BELLE(BLOOMZ-7B/LLaMA-7B/LLaMA-13B) Bloom-7B/13B/176B Vicuna(7B/13B) Baize LLMZoo MOSS baichuan-7B CPM-Bee 开源的多模态大模型 MiniGPT-4 LLaVA VisualGLM-6B VisCPM RLHF(人工反馈强化学习) RLHF开源工具 DeepSpeed Chat ColossalChat 大模型分布式训练实践(大模型分布式训练实践)(90分钟) 大模型分布式训练实践 大模型训练 参数高效微调 大模型推理加速 大模型评估 大模型评估方法 人工评估 LIMA Phoenix 使用GPT-4的反馈进行自动评估 Vicuna、Phoenix、Chimera、BELLE 指标评估(BLEU-4、ROUGE分数) ChatGLM-6B Chatbot Arena 大模型评估工具 OpenAI evals PandaLM 详细讲解分布式训练框架的原理和实践 重点讲解Megatron和DeepSpeed的实践 GPU训练参数优化(GPU训练参数优化)(60分钟) GPU训练参数优化 大模型训练并行技术 数据并行(PyTorch DDP) 模型/张量并行(Megatron-LM(1D)、Colossal-AI(2D、2.5D、3D)) 流水线并行(GPipe、PipeDream、PipeDream-2BW、PipeDream Flush(1F1B)) 多维混合并行(3D并行(数据并行、模型并行、流水线并行)) 自动并行(Alpa(自动算子内/算子间并行)) 优化器相关的并行(PyTorch FSDP) ZeRO(零冗余优化器) 重点讲解Megatron和DeepSpeed参数优化实践 大模型微调(大模型微调)(60分钟) 大模型微调 大模型微调的概念和意义 预训练模型的优势和应用场景 大模型微调基本原理 大模型微调方法 数据加载、模型训练、调参等常见操作的优化和加速方法 使用可视化工具进行模型训练过程的分析和调试 大模型微调的基本流程和关键步骤 常用的深度学习框架和工具 TensorFlow、PyTorch等常见深度学习框架 Parameter-Efficient Fine-Tuning (PEFT) 预训练阶段 目标任务准备 构建微调任务 PEFT微调 常用的PEFT方法 Adapter Tuning Prefix Tuning Prompt Tuning P-Tuning LoRA 案例剖析:应用大模型微调技术解决实际问题 深度解读glm2_6b大模型(深度解读glm2_6b大模型)(30分钟) 深度解读glm2_6b大模型 glm2_6b大模型的原理 GPT(Generative Pre-trained Transformer)架构 glm2_6b大模型数据集 glm2_6b大模型的部署 准备环境 安装依赖库 下载模型权重 加载模型 部署API或服务 调优和监控 glm2_6b大模型的训练 glm2_6b大模型的应用 自然语言处理 文本生成 机器翻译 问答系统
授课老师
尹立庆 某大型知名互联网企业首席架构
常驻地:北京
邀请老师授课:13439064501 陈助理

