Appearance
大模型与 LLM 应用
大模型系统不只包含基础 Transformer,还包括训练扩展、参数适配、推理服务、评测和外部知识系统:
Tokenizer、Embedding、Attention、Transformer Block 和反向传播的基础定义参见深度学习与神经网络基础。本页只保留大模型系统层面的知识地图,避免重复解释基础神经网络公式。
一、系统分层
| 层次 | 主要职责 | 核心问题 |
|---|---|---|
| 基础模型 | 根据上下文预测 token | 规模、预训练目标、上下文能力 |
| 训练扩展 | 把模型训练到多卡多机 | 张量并行、流水线并行、序列并行 |
| 适配与对齐 | 让模型遵循任务和偏好 | SFT、LoRA、Prompt/Prefix Tuning、奖励 |
| 推理服务 | 低延迟地产生输出 | KV Cache、GQA/MLA、量化、批处理 |
| 外部知识 | 提供可更新的事实 | RAG、ANN、HNSW、重排、GraphRAG |
| 评测反馈 | 测量能力和质量 | Pass@k、LLM-as-a-Judge、长上下文测试 |
二、专题导航
2.1 大模型训练、适配与推理
大模型训练、适配与推理覆盖:
- 模型规模与涌现能力;
- MHA、GQA、MQA、MLA 和 KV Cache;
- FlashAttention、稀疏/近似注意力和序列并行;
- Megatron-LM 的张量并行;
- 预训练、SFT、对齐和 Temperature;
- LoRA、QLoRA、Prompt/Prefix Tuning 和 SmoothQuant。
2.2 Agent 与大模型评测
Agent 与大模型评测覆盖:
- 反思式 Agent 的最终结果奖励与修改成本;
- LLM-as-a-Judge 的长度、位置和风格偏差;
- MMLU、Pass@k、BLEU/ROUGE 的测量边界;
- Needle-in-a-Haystack、多针定位和跨段多跳推理。
2.3 RAG 与检索系统
- 文档切分、Embedding、召回、重排和生成;
- 精确搜索与 ANN;
- HNSW 的分层图、
、 和 ; - 稠密/稀疏混合检索;
- GraphRAG 的实体归一、关系遍历和跨文档聚合。
三、统一判断框架
| 问题 | 主要优化对象 | 典型判断 |
|---|---|---|
| GQA/MQA/MLA | 每个 token 的 KV Cache | 减少 KV Head 或压缩 K/V 表示 |
| FlashAttention | 注意力访存和中间结果 | 精确计算不变,减少 HBM 读写 |
| Sequence Parallelism | 单卡激活显存 | 序列分片,单卡下降但总工作量不消失 |
| LoRA/Prompt/Prefix | 可训练参数和任务适配 | 可学习参数注入位置不同 |
| SmoothQuant | 低比特量化条件 | 将部分 activation 动态范围压力迁移到 weight |
| HNSW | 候选召回效率 | 用少量 Recall 损失换取低延迟 |
| GraphRAG | 显式关系推理 | 需要实体、边、多跳或全局聚合时更有价值 |
| LLM-as-a-Judge | 开放式质量测量 | Judge 是带偏差的测量工具,不是天然真值 |
大模型系统速记
训练看参数、激活和通信;生成看 KV Cache、内存带宽和批处理;RAG 看召回、重排和证据使用;评测先确认指标究竟测量哪种能力。
四、公式索引
| 主题 | 核心公式 |
|---|---|
| 自回归预训练 | |
| Temperature | |
| LoRA | |
| LoRA 参数量 | |
| SmoothQuant | |
| Pass@k | |
| HNSW 召回 | 在延迟、内存和 Recall 之间调节搜索宽度 |
必背结论
| 概念 | 结论 |
|---|---|
| 预训练 | 从原始数据构造自监督目标,不要求人工逐条标注 |
| 涌现 | 非线性跃升依赖任务、指标和推理设置,不能把临界点绝对化 |
| PEFT | 冻结基础模型不等于没有激活显存;不同方法的关键差异是参数注入位置 |
| 推理优化 | FlashAttention 优化 IO,GQA/MLA 减少 KV Cache,PagedAttention 管理缓存碎片 |
| 评测 | 能力、对齐、文本重合和鲁棒性指标不能相互替代 |
| RAG | Embedding 负责表示,ANN/HNSW 负责召回,Reranker 负责精排,LLM 基于证据生成 |
| GraphRAG | “数据能画成图”不等于必须使用图;关键是查询是否需要显式关系 |