机器学习是 AI 的基石。在这个阶段,目标是掌握数据处理、经典算法和模型训练的基本流程。
数据处理两大基石。NumPy 负责数值计算(矩阵运算、向量化),Pandas 负责数据清洗(缺失值处理、分组聚合、透视表)。
经典 ML 算法库。重点掌握:分类(SVM、决策树、随机森林)、回归(线性回归、岭回归)、聚类(K-Means、DBSCAN)、降维(PCA)。
深度学习框架入门。核心概念:Tensor(张量)、Autograd(自动微分)、nn.Module(神经网络模块)、DataLoader(数据加载)。
模型仓库与工具集。Transformers 库、Datasets、Trainer API,一行代码加载预训练模型。
| 概念 | 说明 |
|---|---|
| 监督学习 | 有标签数据,学习输入到输出的映射(分类、回归) |
| 无监督学习 | 无标签数据,发现数据内在结构(聚类、降维) |
| 过拟合 | 模型在训练集表现好、测试集表现差,泛化能力不足 |
| 交叉验证 | 将数据分成多份轮流训练和验证,评估模型稳定性 |
| 特征工程 | 从原始数据中提取有效特征,直接影响模型效果上限 |
建议:不用追求"精通所有算法"。理解核心思想、会用 API、能跑通一个完整的数据处理到模型评估流程——到这个程度就可以进入下一阶段。