课程简介
🧑💻 适配人群 ✨ 实战营核心亮点(AI赋能·实战为王·落地无忧) 🗂️ AI数据全链路覆盖 :从数据采集、清洗、脱敏、治理,到标注、特征工程、数据 pipeline 搭建,全流程实战,无知识盲区 🤖 AI工具深度融合 :用AI赋能数据工程,掌握AI自动标注、智能清洗、特征挖掘工具,大幅提升数据处理效率,告别低效手工操作 🏢 企业级场景实战 :…
🧑💻 适配人群
✨ 实战营核心亮点(AI赋能·实战为王·落地无忧)
🗂️ AI数据全链路覆盖:从数据采集、清洗、脱敏、治理,到标注、特征工程、数据 pipeline 搭建,全流程实战,无知识盲区
🤖 AI工具深度融合:用AI赋能数据工程,掌握AI自动标注、智能清洗、特征挖掘工具,大幅提升数据处理效率,告别低效手工操作
🏢 企业级场景实战:贴合大模型训练、AI质检、智能推荐等真实商用场景,打造可落地的AI数据解决方案,拒绝Demo级项目
⚡ 高效数据 pipeline 搭建:掌握主流数据调度、存储、计算框架,搭建高可用、高并发的AI数据底座,支撑模型高效运行
🛡️ 数据治理与合规:吃透AI数据质量管控、数据脱敏、合规处理,解决数据脏、乱、差痛点,保障模型数据可靠性
🏆 高薪就业导向:对标大厂AI数据工程师招聘要求,打磨实战项目+面试话术,助力快速拿Offer、冲击高薪
📚 实战营完整学习体系(循序渐进·步步精通)
📌 第一阶段:AI数据工程基础入门(1-7天)
- AI数据工程核心认知:AI数据与传统数据差异、行业应用场景、岗位核心能力要求
- 基础环境搭建:Python数据处理、SQL进阶、大数据基础(Hadoop/Hive)环境配置
- AI数据基础知识:数据类型、数据质量标准、大模型数据需求解析
📌 第二阶段:AI数据采集与预处理(8-20天)
- 多源数据采集:结构化/非结构化数据采集、API对接、日志数据、爬虫实战
- AI数据清洗:脏数据处理、缺失值填充、去重、格式标准化,AI智能清洗实操
- 数据脱敏与合规:隐私数据脱敏、合规处理,规避AI数据合规风险
📌 第三阶段:AI数据标注与特征工程(21-35天)
- AI数据标注:文本/图像/语音标注规范、自动化标注工具实操、标注质量管控
- 特征工程实战:特征提取、筛选、转换、降维,适配AI模型的特征优化
- 数据集构建:训练集/测试集/验证集划分、数据增强,满足大模型训练需求
📌 第四阶段:企业级AI数据底座搭建(36-49天)
- 数据存储与计算:AI数据分层存储、分布式计算、数据仓库搭建
- 数据 pipeline 开发:数据调度、流批一体处理、自动化数据链路搭建
- 数据运维与监控:数据质量监控、链路排查、故障处理,保障数据稳定供给
📌 第五阶段:综合实战与就业冲刺(50-56天)
- 企业级项目实战:大模型预训练数据构建、智能推荐AI数据支撑、AI质检数据治理
- 项目优化与封装:代码优化、文档撰写、项目演示,打造简历硬核项目
- 面试赋能:高频考点精讲、简历优化、模拟面试,轻松应对大厂面试
1. **00 直播**
2. **01 第1周 从Demo到上线AI为什么不能直接用**
3. **02 第2周 输入确定性保障-数据盘点与数据契约(Data Contract)**
4. **03 第3周 采集与入湖一BatchCDCStream的组合拳**
5. **04 第4周 Lakehouse 底座-lceberg快照演进性能基线**
6. **05 第5周 Transform与语义层一把口径写进工程(给BI也给Agent用)**
7. **06 第6周 资产化数据工厂--编排、回填与可追溯**
8. **07 第7周 非结构化数据工程**
9. **08 第8周 从“搜得到”到“答得稳”检索x生成的一体化工程闭环**
10. **09 第9周 从“搜得到”到“答得稳”检索x生成的一体化工程闭环**
11. **10 第10周 从“可回答到“可执行”-AI行为的工程化约束与资产消费闭环**
12. **11 第11周 评测体系一自动化评测与RAGAS实战量化你的“炼丹”成果**
13. **12 第12周 全链路可观测性--OpenTelemetry与Tracing(故障定位的显微镜)**
14. **13 第13周 GraphRAG-处理跨文档关系与全局归纳的“升级解法”**
15. **14 第14周 治理与版本一-把数据像代码一样发布、回滚、追责**
16. **15 第15周 成本、性能与上线收官一-让系统能长期稳定跑**