Appearance
深度学习与神经网络基础
深度学习的知识可以按“表示—架构—训练—部署”组织:
本页是深度学习知识地图。详细推导和计算示例已拆到专题页,基础概率输出和经典机器学习损失则链接到机器学习笔记,避免重复定义。
一、知识体系
| 层次 | 核心问题 | 典型内容 |
|---|---|---|
| 表示 | 离散或原始数据怎样进入网络? | Tokenizer、Embedding、Patch Embedding |
| 架构 | 信息怎样变换和交互? | MLP、CNN、RNN、Attention、Transformer |
| 目标 | 模型为什么这样更新? | Softmax、交叉熵、对比学习、扩散目标 |
| 优化 | 梯度怎样稳定传播? | 反向传播、初始化、残差、归一化、优化器 |
| 工程 | 怎样提高训练和推理效率? | 混合精度、量化、KV Cache、算子融合、CUDA |
二、专题导航
2.1 神经网络基础与经典架构
神经网络基础与经典架构覆盖:
- Tokenizer、BPE、WordPiece 和 Embedding;
- MLP、ReLU、GELU、SiLU、SwiGLU;
- CNN、卷积尺寸、参数量、池化、感受野;
- RNN、LSTM、GRU 和长期依赖。
2.2 Attention 与 Transformer
- Scaled Dot-Product Attention、Self-Attention 手算和 Causal Mask;
- MHA、GQA、MQA、MLA、KV Cache、Cross-Attention 和 RoPE;
- FlashAttention、Linear Attention、PagedAttention;
- Transformer Block、LayerNorm、RMSNorm、残差和 FFN;
- 反向传播、Softmax + 交叉熵、BERT、GPT、T5 和 BART。
2.3 训练、优化与部署
训练、优化与部署工程覆盖:
- Dropout、L1、L2 与交叉验证;
- AdaGrad、RMSProp、Adam、AdamW 和梯度累积;
- 初始化、混合精度、Loss Scaling;
- Conv-BN Folding、训练/Prefill/Decode;
- GPU Occupancy、Register Spilling、INT8、PTQ 和 QAT。
2.4 视觉、多模态与生成应用
视觉、多模态与生成应用覆盖:
- Vision Transformer;
- BLIP-2 与 Q-Former;
- 扩散模型少步采样;
- 文档 Chunking、Embedding 和存储估算。
三、核心计算图
一层神经网络可以写成:
训练过程为:
反向传播负责计算梯度,优化器负责根据梯度更新参数;激活函数、初始化、归一化和残差连接共同影响梯度尺度,但没有单一组件能保证深层网络永不出现梯度消失或爆炸。
四、架构选择框架
| 结构 | 主要归纳偏置 | 典型优势 | 主要边界 |
|---|---|---|---|
| MLP | 特征维度变换 | 通用、结构简单 | 不显式利用空间或顺序 |
| CNN | 局部连接、权重共享 | 图像局部模式和高效计算 | 长距离关系需逐层扩大感受野 |
| RNN/LSTM/GRU | 递归状态 | 流式序列和传统时间建模 | 长序列并行性较弱 |
| Transformer | 内容相关的全局交互 | 并行训练和长距离依赖 | 全注意力成本随序列长度二次增长 |
深度学习速记
先画出张量形状和数据流,再检查损失与梯度;训练问题看数值尺度和优化状态,推理问题看激活、KV Cache、内存带宽和算子实现。
五、公式索引
| 主题 | 核心公式 |
|---|---|
| 线性层 | |
| 反向传播 | |
| Self-Attention | |
| 卷积输出尺寸 | |
| 卷积参数量 | |
| LayerNorm | |
| Adam | |
| KV Cache | 约为 |
必背结论
| 概念 | 结论 |
|---|---|
| 激活函数 | 隐藏层激活提供非线性;输出层 Sigmoid/Softmax 由标签形式决定 |
| 反向传播 | 沿计算图反向应用链式法则;优化器与反向传播不是同一概念 |
| Attention | |
| Transformer | Attention 做跨 token 交流,FFN 对每个 token 使用共享参数独立加工 |
| 归一化 | LayerNorm 按 token 的 hidden dimension 归一化;BatchNorm 训练时依赖 batch 统计 |
| 训练与推理 | 训练保存激活并反向传播;自回归推理复用 KV Cache,并受延迟和带宽约束 |
| 量化 | 低比特表示降低存储和带宽,但需要校准并处理动态范围与离群值 |