Skip to content

深度学习与神经网络基础 ​

深度学习的知识可以按“表示—架构—训练—部署”组织:

输入表示→网络前向计算→损失→反向传播与优化→推理部署

本页是深度学习知识地图。详细推导和计算示例已拆到专题页,基础概率输出和经典机器学习损失则链接到机器学习笔记,避免重复定义。

一、知识体系 ​

层次核心问题典型内容
表示离散或原始数据怎样进入网络?Tokenizer、Embedding、Patch Embedding
架构信息怎样变换和交互?MLP、CNN、RNN、Attention、Transformer
目标模型为什么这样更新?Softmax、交叉熵、对比学习、扩散目标
优化梯度怎样稳定传播?反向传播、初始化、残差、归一化、优化器
工程怎样提高训练和推理效率?混合精度、量化、KV Cache、算子融合、CUDA

二、专题导航 ​

2.1 神经网络基础与经典架构 ​

神经网络基础与经典架构覆盖:

  • Tokenizer、BPE、WordPiece 和 Embedding;
  • MLP、ReLU、GELU、SiLU、SwiGLU;
  • CNN、卷积尺寸、参数量、池化、感受野;
  • RNN、LSTM、GRU 和长期依赖。

2.2 Attention 与 Transformer ​

Attention 与 Transformer覆盖:

  • Scaled Dot-Product Attention、Self-Attention 手算和 Causal Mask;
  • MHA、GQA、MQA、MLA、KV Cache、Cross-Attention 和 RoPE;
  • FlashAttention、Linear Attention、PagedAttention;
  • Transformer Block、LayerNorm、RMSNorm、残差和 FFN;
  • 反向传播、Softmax + 交叉熵、BERT、GPT、T5 和 BART。

2.3 训练、优化与部署 ​

训练、优化与部署工程覆盖:

  • Dropout、L1、L2 与交叉验证;
  • AdaGrad、RMSProp、Adam、AdamW 和梯度累积;
  • 初始化、混合精度、Loss Scaling;
  • Conv-BN Folding、训练/Prefill/Decode;
  • GPU Occupancy、Register Spilling、INT8、PTQ 和 QAT。

2.4 视觉、多模态与生成应用 ​

视觉、多模态与生成应用覆盖:

  • Vision Transformer;
  • BLIP-2 与 Q-Former;
  • 扩散模型少步采样;
  • 文档 Chunking、Embedding 和存储估算。

三、核心计算图 ​

一层神经网络可以写成:

a(ℓ)=W(ℓ)h(ℓ−1)+b(ℓ),h(ℓ)=ϕ(a(ℓ))

训练过程为:

forward→L→backward→θ←θ−η∇θL

反向传播负责计算梯度,优化器负责根据梯度更新参数;激活函数、初始化、归一化和残差连接共同影响梯度尺度,但没有单一组件能保证深层网络永不出现梯度消失或爆炸。

四、架构选择框架 ​

结构主要归纳偏置典型优势主要边界
MLP特征维度变换通用、结构简单不显式利用空间或顺序
CNN局部连接、权重共享图像局部模式和高效计算长距离关系需逐层扩大感受野
RNN/LSTM/GRU递归状态流式序列和传统时间建模长序列并行性较弱
Transformer内容相关的全局交互并行训练和长距离依赖全注意力成本随序列长度二次增长

深度学习速记

先画出张量形状和数据流,再检查损失与梯度;训练问题看数值尺度和优化状态,推理问题看激活、KV Cache、内存带宽和算子实现。

五、公式索引 ​

主题核心公式
线性层a=Wh+b
反向传播∇WL=gahT
Self-Attentionsoftmax(QKT/dk)V
卷积输出尺寸⌊(H+2P−K)/S⌋+1
卷积参数量KhKwCinCout+Cout
LayerNorm(x−μ)/σ2+ϵ,再乘 γ 加 β
Adamθt+1=θt−ηm^t/(v^t+ϵ)
KV Cache约为 2BLTNKVdhs

必背结论 ​

概念结论
激活函数隐藏层激活提供非线性;输出层 Sigmoid/Softmax 由标签形式决定
反向传播沿计算图反向应用链式法则;优化器与反向传播不是同一概念
AttentionQ,K 决定关注谁,V 决定取回什么;Softmax 结果是权重,不是最终输出
TransformerAttention 做跨 token 交流,FFN 对每个 token 使用共享参数独立加工
归一化LayerNorm 按 token 的 hidden dimension 归一化;BatchNorm 训练时依赖 batch 统计
训练与推理训练保存激活并反向传播;自回归推理复用 KV Cache,并受延迟和带宽约束
量化低比特表示降低存储和带宽,但需要校准并处理动态范围与离群值

使用 Markdown 与 VitePress 构建