getfromcode

mksz1003-AI大模型微调,从原理剖析到企业级落地实战

AI
课程简介

拆解微调底层原理与强化学习范式 许多开发者在面对大模型落地时,常陷入“调参玄学”或盲目全量训练的误区,既不清楚为何在部分场景下检索增强生成(RAG)优于微调,也不明白预训练阶段中数据并行、模型并行及三维并行背后的通信瓶颈与显存占用逻辑。本课程第一部分深入剖析了这些底层机制,不仅解释了 LoRA 低秩分解的数学直觉,还详细拆解了强化学习微调中 PPO、DPO…

已有 0 人浏览 发布 2026-10-06 更新 2026-10-06

拆解微调底层原理与强化学习范式

许多开发者在面对大模型落地时,常陷入“调参玄学”或盲目全量训练的误区,既不清楚为何在部分场景下检索增强生成(RAG)优于微调,也不明白预训练阶段中数据并行、模型并行及三维并行背后的通信瓶颈与显存占用逻辑。本课程第一部分深入剖析了这些底层机制,不仅解释了 LoRA 低秩分解的数学直觉,还详细拆解了强化学习微调中 PPO、DPO 及 GRPO 等算法的核心差异与适用边界。这种从原理切入的方式,旨在帮助具备 PyTorch 基础、熟悉张量运算的工程师,建立起对大模型训练全链路的系统认知,避免仅停留在 API 调用层面的浅层应用,从而在技术方案选型时拥有理论依据。

构建企业级 SFT 工程化实战能力

课程后半部分聚焦真实企业场景,以金融领域为例,展示了从数据集选择、清洗策略到 LoRA 微调参数配置、内存优化及早停机制实现的完整闭环。这里不再只是跑通代码,而是强调工程鲁棒性与可观测性。开发者需要重点关注训练过程中的核心监控指标,如学习率动态变化、训练损失与验证损失的收敛趋势,并学会利用 TensorBoard 进行可视化诊断与异常定位。这种实战模块要求读者具备排查训练不收敛、过拟合等实际问题的能力,将微调过程从一个黑盒操作转变为可控、可优化的工程系统,确保模型效果可量化、可复现。

建议学习顺序与资料配合策略

建议采取“先理后实”的学习路径:首先精读第一章中关于 LoRA 原理及预训练并行策略的内容,建立参数高效微调的理论底座;随后进入第七章,对照视频中的方案选型与数据构建逻辑,重点复现 LoRA 训练全流程。在学习过程中,务必配合资料包中的代码片段,手动调整 LoRA 秩数、目标模块等超参数,观察其对收敛速度和最终模型评估指标的具体影响。学完并能独立输出后,你应能针对特定垂直领域(如金融、医疗)独立搭建 SFT 微调 pipeline,实现从数据预处理、适配器训练、多指标监控到模型部署的标准化作业,并能根据监控反馈精准调整参数以解决实际业务中的效果瓶颈,具备独立交付微调项目的工程能力。

课程目录

📁 第1章 模型高效微调原理剖析
第1章 模型高效微调原理剖析文档.png [493.5 KB]
1-8 高效微调原理之预训练之数据并行.mp4 [26.7 MB]
1-3 高效微调原理之什么场景需要RAG?.mp4 [20.3 MB]
1-7 高效微调原理之预训练之网络通信.mp4 [18.3 MB]
1-6 高效微调原理之预训练的两个挑战.mp4 [25.2 MB]
1-10 高效微调原理之预训练之3D并行.mp4 [21.5 MB]
1-12 高效微调原理之LoRA原理.mp4 [94.1 MB]
1-9 高效微调原理之预训练之模型并行.mp4 [23.2 MB]
1-5 高效微调原理之预训练的流程.mp4 [39.2 MB]
1-11 高效微调原理之微调步骤.mp4 [28.4 MB]
1-1 课程介绍.mp4 [22.7 MB]
1-2 高效微调原理之什么场景需要微调?.mp4 [26.3 MB]
1-4 高效微调原理之微调和全量微调的区别.mp4 [32.8 MB]
📁 第2章 大模型强化学习原理剖析
第2章 大模型强化学习原理剖析必看.zip [1.8 MB]
2-2 强化学习微调之什么是PPO?.mp4 [20.8 MB]
2-3 强化学习微调之什么是RLHF?.mp4 [11.5 MB]
2-1 强化学习微调之什么是强化学习?.mp4 [35.7 MB]
2-4 强化学习微调之什么是DPO?.mp4 [26.6 MB]
2-5 强化学习微调之什么是GRPO?.mp4 [22.3 MB]
📁 第7章 企业金融大模型微调项目—SFT 方案设计与落地
第7章 企业金融大模型微调项目—SFT 方案设计与落地说明.zip [1.8 MB]
7-9 SFT 微调之数据集构建 - 数据构建策略.mp4 [19.4 MB]
7-22 SFT微调之LoRa微调-模型评估内存优化回调函数.mp4 [14.6 MB]
7-37 SFT微调之LoRa微调-微调效果评估之SFT模型部署.mp4 [45.4 MB]
7-7 SFT 微调之微调方案选型.mp4 [36.8 MB]
7-21 SFT微调之LoRa微调-基础模型加载.mp4 [39.0 MB]
7-17 SFT微调之LoRa微调-数据处理.mp4 [33.9 MB]
7-25 SFT微调之LoRa微调-模型微调的早停机制.mp4 [13.5 MB]
7-31 SFT微调之LoRa微调-核心监控指标之learning_rate分析.mp4 [29.0 MB]
7-5 SFT 微调之数据集选择.mp4 [29.2 MB]
7-12 SFT 微调之 LoRa 微调 - 微调技术方案选型.mp4 [50.3 MB]
7-29 SFT微调之LoRa微调-核心监控指标之train_loss分析.mp4 [56.7 MB]
7-30 SFT微调之LoRa微调-核心监控指标之eval_loss分析.mp4 [17.3 MB]
7-15 SFT微调之LoRa微调-微调基座模型下载.mp4 [16.0 MB]
7-36 SFT微调之LoRa微调-微调效果评估之评估效果说明.mp4 [18.1 MB]
7-18 SFT微调之LoRa微调-LoRA参数配置.mp4 [49.5 MB]
7-28 SFT微调之LoRa微调-TensorBoard可视化监控.mp4 [33.9 MB]
7-1 整体项目之项目背景.mp4 [30.6 MB]
7-35 SFT微调之LoRa微调-微调效果评估之Perplexity指标.mp4 [11.6 MB]
7-8 SFT 微调之数据集构建 - 数据集解析.mp4 [60.1 MB]
7-32 SFT微调之LoRa微调-核心监控指标之grad_norm分析.mp4 [27.4 MB]
7-3 整体项目之技术方案.mp4 [15.5 MB]
7-34 SFT微调之LoRa微调-微调效果评估之ROUGE指标.mp4 [25.2 MB]
7-23 SFT微调之LoRa微调-最佳模型保存函数.mp4 [30.3 MB]
7-4 SFT 微调之微调技术流程.mp4 [13.9 MB]
7-26 SFT微调之LoRa微调-微调的checkpoints机制设置.mp4 [8.6 MB]
7-11 SFT 微调之数据集构建 - 多轮数据集构建.mp4 [40.1 MB]
7-20 SFT微调之LoRa微调-创建数据整理器.mp4 [19.6 MB]
7-33 SFT微调之LoRa微调-多轮对话微调数据处理.mp4 [43.9 MB]
7-24 SFT微调之LoRa微调-最后模型保存函数.mp4 [25.1 MB]
7-6 SFT 微调之模型选型.mp4 [31.7 MB]
7-10 SFT 微调之数据集构建 - 单轮数据集构建.mp4 [60.6 MB]
7-19 SFT微调之LoRa微调-SFT微调参数配置.mp4 [44.4 MB]
7-2 整体项目之项目需求.mp4 [14.6 MB]
7-14 SFT微调之LoRa微调-微调环境构建.mp4 [21.4 MB]
7-13 SFT微调之LoRa微调-微调技术方案设计思考.mp4 [57.9 MB]
7-16 SFT微调之LoRa微调-数据样本初始化.mp4 [43.5 MB]
📁 第9章 企业金融大模型微调项目—GRPO 方案设计与落地
第9章 企业金融大模型微调项目—GRPO 方案设计与落地必看.png [493.5 KB]
📁 第4章 Llama-Factory 微调实战
第4章 Llama-Factory 微调实战文档.zip [1.8 MB]
4-3 Llama-Factory微调之模型和数据准备.mp4 [62.1 MB]
4-10 Text2SQL模型微调之数据处理.mp4 [41.9 MB]
4-4 Llama-Factory微调之LoRa微调实战.mp4 [37.2 MB]
4-9 Text2SQL模型微调之数据集准备.mp4 [22.4 MB]
4-8 Text2SQL模型微调之数据集格式说明.mp4 [25.8 MB]
4-12 Text2SQL模型微调之微调实战.mp4 [16.6 MB]
4-15 Text2SQL模型微调之基于DeepSpeed实战.mp4 [43.6 MB]
4-5 Llama-Factory微调之模型效果验证.mp4 [14.1 MB]
4-11 Text2SQL模型微调之数据集注册.mp4 [20.4 MB]
📁 第5章 微调医疗场景 Embedding 模型
第5章 微调医疗场景 Embedding 模型文档.zip [1.8 MB]
5-3 Embedding模型微调之基础模型选型.mp4 [16.3 MB]
5-5 Embedding模型微调之技术方案选型.mp4 [68.2 MB]
5-11 Embedding模型微调之微调数据准备核心逻辑.mp4 [66.8 MB]
5-12 Embedding模型微调之微调核心代码.mp4 [32.5 MB]
5-7 Embedding模型微调之基础模型校验.mp4 [20.3 MB]
5-6 Embedding模型微调之环境准备.mp4 [57.6 MB]
5-4 Embedding模型微调之数据集准备.mp4 [42.2 MB]
5-2 Embedding模型微调之适用场景剖析.mp4 [17.5 MB]
5-13 Embedding模型微调之微调效果检验.mp4 [25.3 MB]
5-9 Embedding模型微调之数据集清洗.mp4 [15.7 MB]
5-8 Embedding模型微调之数据集校验.mp4 [32.0 MB]
📁 第3章 大模型训练数据工程
第3章 大模型训练数据工程资料.png [493.5 KB]
3-2 大模型微调数据格式划分.mp4 [31.3 MB]
3-10 大模型微调数据集构建实操-构建SFT数据集.mp4 [30.1 MB]
3-4 大模型微调SFT数据集.mp4 [20.5 MB]
3-11 大模型微调数据集构建实操-构建偏好数据集.mp4 [17.7 MB]
3-3 大模型微调预训练数据集.mp4 [33.7 MB]
3-7 大模型微调数据集生成实战.mp4 [27.1 MB]
3-5 大模型微调偏好数据集.mp4 [13.7 MB]
3-8 大模型微调数据集工具部署.mp4 [20.7 MB]
3-1 大模型微调数据的重要性.mp4 [35.8 MB]
3-6 大模型微调COT数据集.mp4 [40.3 MB]
3-9 大模型微调数据集构建实操-构建COT数据集.mp4 [20.3 MB]
📁 第8章 企业金融大模型微调项目—奖励模型方案设计与落地
第8章 企业金融大模型微调项目—奖励模型方案设计与落地必看.png [493.5 KB]
8-5 奖励模型之微调数据集构建方案思考.mp4 [52.1 MB]
8-10 奖励模型之奖励模型选型.mp4 [73.3 MB]
8-6 奖励模型之微调数据集构建策略.mp4 [45.6 MB]
8-8 奖励模型之奖励模型训练路径分析.mp4 [28.3 MB]
8-9 奖励模型之基于RewardBench排行榜选型.mp4 [33.5 MB]
8-2 奖励模型之为什么选GRPO?.mp4 [29.8 MB]
8-1 奖励模型之需求背景分.mp4 [13.2 MB]
8-4 奖励模型之整体流程设计.mp4 [14.1 MB]
8-7 奖励模型之微调数据集构建脚本执行.mp4 [39.2 MB]
8-3 奖励模型之为什么GRPO必须微调奖励模型?.mp4 [31.0 MB]
📁 第6章 蒸馏专属大模型
第6章 蒸馏专属大模型说明.zip [1.8 MB]
6-1 模型蒸馏之蒸馏和微调的本质区别.mp4 [40.6 MB]
6-5 模型蒸馏之蒸馏流程剖析.mp4 [20.7 MB]
6-7 模型蒸馏之资源评估和服务器租赁.mp4 [23.2 MB]
6-14 模型蒸馏之模型蒸馏前后效果对比.mp4 [13.2 MB]
6-4 模型蒸馏之模型推理能力的重要性.mp4 [13.1 MB]
6-10 模型蒸馏之蒸馏数据格式说明.mp4 [21.6 MB]
6-12 模型蒸馏之蒸馏数据集准备.mp4 [65.4 MB]
6-13 模型蒸馏之基于Llama-Factory进行全量微调.mp4 [92.2 MB]
6-3 模型蒸馏之为什么蒸馏方案突然火了起来?.mp4 [32.4 MB]
6-6 模型蒸馏之全量微调工具推荐.mp4 [20.1 MB]
6-2 模型蒸馏之微调和全量微调的本质区别.mp4 [33.8 MB]
6-9 模型蒸馏之全量微调工具安装部署.mp4 [32.1 MB]
6-8 模型蒸馏之基础模型下载.mp4 [28.3 MB]
6-11 模型蒸馏之基础模型效果测试.mp4 [14.6 MB]
课程购买
课程价格
金币29.9
299金币限时优惠会员免费
销量:0
💎 开通会员每日免费下载,比单买更划算 →
支付成功后会自动显示下载资源云盘的链接!点击链接即可下载到本地。