边缘端AI部署的核心矛盾 资源受限下的模型落地 当前AI应用正加速向终端侧迁移,但移动端和嵌入式设备面临严酷的物理约束:内存带宽窄、计算单元能效比低、功耗预算严格受限。传统云端大模型直接移植至此类设备时,往往因推理延迟过高或内存溢出而无法实现实时响应。本课程聚焦于“高性能神经网络”与“AI芯片”的协同优化,解决的核心问题是如何在硬件天花板明确的条件下,通过…
当前AI应用正加速向终端侧迁移,但移动端和嵌入式设备面临严酷的物理约束:内存带宽窄、计算单元能效比低、功耗预算严格受限。传统云端大模型直接移植至此类设备时,往往因推理延迟过高或内存溢出而无法实现实时响应。本课程聚焦于“高性能神经网络”与“AI芯片”的协同优化,解决的核心问题是如何在硬件天花板明确的条件下,通过算法层面的精修与系统层面的调度,实现高精度与低功耗的平衡。它不同于云端训练侧的课程,重点不在如何训练更大的模型,而在于如何将现有模型高效编译、量化并映射到特定芯片架构的指令集上,使得推理过程能够流畅运行而非卡顿。
建议学员具备扎实的深度学习基础,熟悉卷积神经网络(CNN)、循环神经网络(RNN)或Transformer的基本结构及其数学原理,并对PyTorch或TensorFlow等主流框架有实际开发经验。初学者若缺乏底层计算机体系结构知识,应先补充缓存(Cache)层次、内存墙(Memory Wall)及数据局部性原理的相关概念,这些是理解高性能计算瓶颈的关键。学习路径上,不要一开始就陷入汇编代码的微调,建议先看通“模型压缩技术”模块,掌握量化(Quantization)、剪枝(Pruning)和知识蒸馏(Knowledge Distillation)的工程实现细节;随后切入“AI加速器架构”章节,理解NPU(神经网络处理单元)的数据流组织方式。只有明确了软硬件之间的映射关系,后续的优化策略才具备可落地性,避免盲目调参。
学完本课程后,你将具备独立完成端侧AI应用部署的能力。具体表现为:能够针对特定嵌入式板卡(如Jetson系列或专用AI加速卡)进行推理引擎的选型与配置;能熟练编写C++或Python胶水代码,将训练好的模型转换为芯片可执行的算子图;并具备根据Profiling工具反馈的性能数据,对热点算子进行针对性优化的能力。在资料配合练习方面,不要只阅读文档,必须动手复现资料包中的核心案例。例如,选取一个典型的视觉分类模型,分别尝试INT8量化与FP16混合精度部署,对比其在目标硬件上的耗时与内存占用变化。重点研读编译器自动转换(AutoTuning)的日志,理解框架如何将高层张量操作拆解为底层内存拷贝与计算指令。通过这种“修改-编译-测试-分析”的迭代练习,将理论知识转化为解决实际工程问题的肌肉记忆,最终实现从算法工程师向端侧系统工程师的角色延伸。
AI技术的一个趋势是在设备端上部署高性能的神经网络模型,并在真实场景中实时运行。如移动端/嵌入式设备,这些设备的特点是内存资源少,处理器性能不高,功耗受限,这使得目前精度最高的模型根本无法在这些设备进行部署和达到实时运行
AI芯片.png (50.76 KB, 下载次数: 0) 2022-8-31 15:58 上传 课程介绍: AI技术的一个趋势是在设备端上部署高性能的神经网络模型,并在真实场景中实时运行。如移动端/嵌入式设备,这些设备的特点是内存资源少,处理器性能不高,功耗受限,这使得目前精度最高的模型根本无法在这些设备进行部署和达到实时运行 课程目录: 第01周 1.轻量化网络结构设计 Lecture1 轻量化网络结构设计-1_ev .mp4 86.23M Lecture1 轻量化网络结构设计-2_ev .mp4 69.34M Lecture1 轻量化网络结构设计-3_ev .mp4 80.33M Lecture1 轻量化网络结构设计-4_ev .mp4 66.53M Lecture1 轻量化网络结构设计-5_ev .mp4 51.35M Lecture1 轻量化网络结构设计-6_ev .mp4 52.20M 2.实例分割相关的轻量网络并评估性能 Review1 实例分割相关的轻量网络并评估性能-1_ev .mp4 48.93M Review1 实例分割相关的轻量网络并评估性能-2_ev .mp4 65.90M 第02周 使用知识蒸馏完成检测网络的压缩 使用知识蒸馏完成检测网络的压缩-1_ev .mp4 79.45M 使用知识蒸馏完成检测网络的压缩-2_ev .mp4 54.64M 知识蒸馏优化、低秩分解优化 知识蒸馏优化、低秩分解优化-1_ev .mp4 78.32M 知识蒸馏优化、低秩分解优化-2_ev .mp4 92.44M 知识蒸馏优化、低秩分解优化-3_ev .mp4 84.83M 知识蒸馏优化、低秩分解优化-4_ev .mp4 50.42M 知识蒸馏优化、低秩分解优化-5_ev .mp4 58.20M 第03周 使用结构化剪枝完成一个网络结构的剪枝 使用结构化剪枝完成一个网络结构的剪枝-1_ev .mp4 68.86M 使用结构化剪枝完成一个网络结构的剪枝-2_ev .mp4 79.07M 网络剪枝 网络剪枝-1_ev .mp4 80.12M 网络剪枝-2_ev .mp4 51.62M 网络剪枝-3_ev .mp4 77.43M 网络剪枝-4_ev .mp4 95.07M 网络剪枝-5_ev .mp4 74.38M 第04周 uint8量化一个网络-1_ev .mp4 62.38M uint8量化一个网络-2_ev .mp4 81.67M 网络量化-1_ev .mp4 70.13M 网络量化-2_ev .mp4 108.74M 网络量化-3_ev .mp4 120.17M 网络量化-4_ev .mp4 71.51M 网络量化-5_ev .mp4 101.34M 第05周 就业分析+岗位推荐 就业分析+岗位推荐-1_ev .mp4 59.58M 就业分析+岗位推荐-2_ev .mp4 95.97M 了解openppll架构 了解openppll架构-1_ev .mp4 80.92M 了解openppll架构-2_ev .mp4 72.09M 神经网络编译器简介 神经网络编译器简介-1_ev .mp4 92.18M 神经网络编译器简介-2_ev .mp4 98.26M 神经网络编译器简介-3_ev .mp4 123.78M 神经网络编译器简介-4_ev .mp4 147.70M 神经网络编译器简介-5_ev .mp4 70.10M 第07周 ncnn-1_ev .mp4 108.34M ncnn-2_ev .mp4 148.43M ncnn-3_ev .mp4 131.69M ncnn-4_ev .mp4 74.96M ncnn-5_ev .mp4 91.43M 主题:使用ncnn进行离线量化并在eaidk310板子部署的demo-1_ev .mp4 108.55M 主题:使用ncnn进行离线量化并在eaidk310板子部署的demo-2_ev .mp4 158.39M