从经典神经网络到 Transformer 架构,从模型微调到部署优化——深度学习是现代 AI 的核心引擎。
图像处理的基石架构。核心思想:卷积核在图像上滑动,提取局部特征(边缘、纹理、形状),通过池化层降维,全连接层分类。ResNet 引入残差连接,解决了深层网络的梯度消失问题,使 100+ 层网络成为可能。
处理序列数据的经典架构。RNN 的问题:长序列导致梯度消失/爆炸。LSTM 引入"遗忘门、输入门、输出门"三重门控机制,选择性记忆和遗忘,有效缓解了长期依赖问题。
改变一切的架构。核心创新:自注意力机制(Self-Attention)——让每个词直接与序列中所有其他词交互,打破了 RNN 的串行瓶颈。Q(Query)、K(Key)、V(Value)三元组计算注意力权重。Multi-Head Attention 并行学习多种注意力模式。
| 方法 | 原理 | 适用场景 |
|---|---|---|
| Full Fine-tuning | 更新所有参数 | 数据充足、算力充足 |
| LoRA | 在权重矩阵旁训练低秩分解矩阵,原权重冻结 | 资源受限,最常用方案 |
| QLoRA | LoRA + 4-bit 量化,进一步降低显存 | 消费级 GPU(如 RTX 3090) |
| Prefix Tuning | 在输入前添加可训练的虚拟 Token | 多任务切换场景 |
处理图结构数据的深度学习分支。与 CNN(处理网格数据)、RNN(处理序列数据)不同,GNN 处理社交网络、分子结构、知识图谱等图数据。GraphSAGE、GAT 等模型逐步成为知识图谱领域的主流工具。
← 返回 AI 知识库