机器学习基础

MLPyTorchScikit-learn

机器学习是 AI 的基石。在这个阶段,目标是掌握数据处理、经典算法和模型训练的基本流程。

学习路线

第一步

NumPy + Pandas

数据处理两大基石。NumPy 负责数值计算(矩阵运算、向量化),Pandas 负责数据清洗(缺失值处理、分组聚合、透视表)。

第二步

Scikit-learn

经典 ML 算法库。重点掌握:分类(SVM、决策树、随机森林)、回归(线性回归、岭回归)、聚类(K-Means、DBSCAN)、降维(PCA)。

第三步

PyTorch

深度学习框架入门。核心概念:Tensor(张量)、Autograd(自动微分)、nn.Module(神经网络模块)、DataLoader(数据加载)。

第四步

HuggingFace 生态

模型仓库与工具集。Transformers 库、Datasets、Trainer API,一行代码加载预训练模型。

关键概念

概念说明
监督学习有标签数据,学习输入到输出的映射(分类、回归)
无监督学习无标签数据,发现数据内在结构(聚类、降维)
过拟合模型在训练集表现好、测试集表现差,泛化能力不足
交叉验证将数据分成多份轮流训练和验证,评估模型稳定性
特征工程从原始数据中提取有效特征,直接影响模型效果上限

推荐资源

建议:不用追求"精通所有算法"。理解核心思想、会用 API、能跑通一个完整的数据处理到模型评估流程——到这个程度就可以进入下一阶段。

← 返回 AI 知识库