深度学习

DLTransformerLoRAGNN

从经典神经网络到 Transformer 架构,从模型微调到部署优化——深度学习是现代 AI 的核心引擎。

核心架构演进

CNN(卷积神经网络)

图像处理的基石架构。核心思想:卷积核在图像上滑动,提取局部特征(边缘、纹理、形状),通过池化层降维,全连接层分类。ResNet 引入残差连接,解决了深层网络的梯度消失问题,使 100+ 层网络成为可能。

RNN / LSTM(循环神经网络)

处理序列数据的经典架构。RNN 的问题:长序列导致梯度消失/爆炸。LSTM 引入"遗忘门、输入门、输出门"三重门控机制,选择性记忆和遗忘,有效缓解了长期依赖问题。

Transformer(2017)

改变一切的架构。核心创新:自注意力机制(Self-Attention)——让每个词直接与序列中所有其他词交互,打破了 RNN 的串行瓶颈。Q(Query)、K(Key)、V(Value)三元组计算注意力权重。Multi-Head Attention 并行学习多种注意力模式。

微调技术

方法原理适用场景
Full Fine-tuning更新所有参数数据充足、算力充足
LoRA在权重矩阵旁训练低秩分解矩阵,原权重冻结资源受限,最常用方案
QLoRALoRA + 4-bit 量化,进一步降低显存消费级 GPU(如 RTX 3090)
Prefix Tuning在输入前添加可训练的虚拟 Token多任务切换场景

模型量化与部署

图神经网络(GNN)入门

处理图结构数据的深度学习分支。与 CNN(处理网格数据)、RNN(处理序列数据)不同,GNN 处理社交网络、分子结构、知识图谱等图数据。GraphSAGE、GAT 等模型逐步成为知识图谱领域的主流工具。

← 返回 AI 知识库