机器学习
数据与 AI · 预计 8-12 周 · 4 阶段
机器学习是 AI 的核心基础。路线图从数学基础与建模流程开始,掌握经典监督/无监督算法,理解评估与调参,进阶特征工程与深度学习入门(PyTorch),最终完成一个可演示的 ML 项目。
学后可投:机器学习工程师算法工程师AI 应用工程师
学习进度:已完成 0 / 4 阶段0%
下一阶段目标:数学基础与建模流程(完成当前阶段后自动推进)
学习路线图按顺序学完每一阶段
点击阶段节点直达学习内容;绿色=已完成,彩色=当前阶段
1
当前阶段数学基础与建模流程
5-10 天难度 入门
核心知识点
线性代数(矩阵/向量)概率与统计基础机器学习问题定义数据划分与评估指标
本阶段学习内容
要点速记
- 问题分类:监督(分类/回归)/ 无监督(聚类/降维)
- 数据划分 train/val/test,分层抽样保类别比例
- 数据泄漏 = 用 test 信息训练,评估虚高上线崩
- 80% 时间在数据与特征,不是调模型
本阶段练习题(点击选项作答)
1. 房价预测属于?
2. 数据泄漏的危害是?
练习任务
- 用 numpy 实现矩阵运算练习
- 对房价数据集完成一次完整建模流程
本阶段验收标准
能讲清建模流程 7 步,并完成第一个基线模型
2
监督学习算法
7-14 天难度 初级
核心知识点
线性/逻辑回归决策树与随机森林SVM 与核函数KNN 与朴素贝叶斯
本阶段学习内容
要点速记
- 逻辑回归 = 线性输出过 sigmoid 变概率,损失用交叉熵
- 随机森林 = 多树投票,抗过拟合,表格数据默认首选
- 树模型不用归一化,天然处理缺失
- 特征重要性 feature_importances_ 帮助解释
本阶段练习题(点击选项作答)
1. 表格数据二分类的默认首选模型是?
2. 随机森林抗过拟合的关键机制是?
练习任务
- 用 scikit-learn 对比 5 个分类器在 iris 上的表现
- 手写线性回归梯度下降(numpy)
本阶段验收标准
能解释每种算法的原理/适用场景/优缺点
3
无监督学习与调参
7-14 天难度 中级
核心知识点
K-Means 与聚类评估PCA 降维交叉验证与网格搜索过拟合与正则化
本阶段学习内容
要点速记
- K-Means 选 k:肘部法则/轮廓系数;数据要归一化
- 交叉验证 k 折轮流验证,评估更稳
- GridSearchCV 网格搜索 + CV 选超参,最终测试集评估一次
- 过拟合信号:训练好验证差;对策正则/简化/早停
本阶段练习题(点击选项作答)
1. 聚类前为什么必须归一化?
2. 训练 0.99 验证 0.85 说明?
练习任务
- 对电商用户数据做聚类画像
- 用 GridSearchCV 完成一次模型调优
本阶段验收标准
独立完成一个含聚类+降维+调参的分析项目
4
深度学习入门(PyTorch)
10-20 天难度 高级
核心知识点
神经网络与反向传播PyTorch 张量与自动求导CNN 图像分类训练技巧(学习率/正则/早停)
本阶段学习内容
要点速记
- 神经网络 = 线性变换 + 非线性激活;反向传播链式法则算梯度
- 训练技巧:学习率调度/早停/shuffle/先小数据过拟合验证代码
- 迁移学习:冻结预训练前层,只训任务层——数据少时的默认起手式
- Adam 是默认优化器
本阶段练习题(点击选项作答)
1. 模型训练不收敛,首选排查项是?
2. 数据量少时图像任务的默认起手式是?
练习任务
- 用 PyTorch 实现 MNIST 手写识别
- 用迁移学习微调一个预训练模型
- 完成一个端到端 ML 项目并写报告
本阶段验收标准
完成一个可演示的 ML/DL 项目并开源报告
怎么学
学习方法与实操建议,配合路线图按阶段推进
- 1吴恩达课程(Coursera/B站)是最经典入门路径,配合笔记精学
- 2每个算法都要手动推一遍损失函数与梯度,再动手实现
- 3用 Kaggle 竞赛练手,重点看高分 Kernel 的思路
- 4数学(线性代数/概率)缺啥补啥,不必先学完再上手
学完能做什么
- 理解监督/无监督学习核心算法
- 用 scikit-learn 完成建模流程
- 读懂并复现经典论文/项目
面试常见问题6 题
常见误区
- 1只调库不推公式,面试一问就崩
- 2不学评估方法,模型好坏全靠感觉
- 3跳过特征工程,数据直接丢进模型
- 4数据集划分不当(泄漏),结果虚高
学习节奏建议
预计 8-12 周,共 4 个阶段。
每阶段按标注时长安排:先读参考文档掌握核心知识点,再完成练习任务,通过 验收标准后标记完成进入下一阶段。
当前为游客模式,进度保存在本设备;登录后可云端同步、多端续学。
当前进度
0%
0 / 4 阶段
进行中
进行中
下一阶段:数学基础与建模流程