Skip to content

大模型与 LLM 应用 ​

大模型系统不只包含基础 Transformer,还包括训练扩展、参数适配、推理服务、评测和外部知识系统:

预训练模型→适配与对齐→推理服务→Agent / RAG→评测反馈

Tokenizer、Embedding、Attention、Transformer Block 和反向传播的基础定义参见深度学习与神经网络基础。本页只保留大模型系统层面的知识地图,避免重复解释基础神经网络公式。

一、系统分层 ​

层次主要职责核心问题
基础模型根据上下文预测 token规模、预训练目标、上下文能力
训练扩展把模型训练到多卡多机张量并行、流水线并行、序列并行
适配与对齐让模型遵循任务和偏好SFT、LoRA、Prompt/Prefix Tuning、奖励
推理服务低延迟地产生输出KV Cache、GQA/MLA、量化、批处理
外部知识提供可更新的事实RAG、ANN、HNSW、重排、GraphRAG
评测反馈测量能力和质量Pass@k、LLM-as-a-Judge、长上下文测试

二、专题导航 ​

2.1 大模型训练、适配与推理 ​

大模型训练、适配与推理覆盖:

  • 模型规模与涌现能力;
  • MHA、GQA、MQA、MLA 和 KV Cache;
  • FlashAttention、稀疏/近似注意力和序列并行;
  • Megatron-LM 的张量并行;
  • 预训练、SFT、对齐和 Temperature;
  • LoRA、QLoRA、Prompt/Prefix Tuning 和 SmoothQuant。

2.2 Agent 与大模型评测 ​

Agent 与大模型评测覆盖:

  • 反思式 Agent 的最终结果奖励与修改成本;
  • LLM-as-a-Judge 的长度、位置和风格偏差;
  • MMLU、Pass@k、BLEU/ROUGE 的测量边界;
  • Needle-in-a-Haystack、多针定位和跨段多跳推理。

2.3 RAG 与检索系统 ​

RAG、向量检索与 GraphRAG覆盖:

  • 文档切分、Embedding、召回、重排和生成;
  • 精确搜索与 ANN;
  • HNSW 的分层图、M、efConstruction 和 efSearch;
  • 稠密/稀疏混合检索;
  • GraphRAG 的实体归一、关系遍历和跨文档聚合。

三、统一判断框架 ​

问题主要优化对象典型判断
GQA/MQA/MLA每个 token 的 KV Cache减少 KV Head 或压缩 K/V 表示
FlashAttention注意力访存和中间结果精确计算不变,减少 HBM 读写
Sequence Parallelism单卡激活显存序列分片,单卡下降但总工作量不消失
LoRA/Prompt/Prefix可训练参数和任务适配可学习参数注入位置不同
SmoothQuant低比特量化条件将部分 activation 动态范围压力迁移到 weight
HNSW候选召回效率用少量 Recall 损失换取低延迟
GraphRAG显式关系推理需要实体、边、多跳或全局聚合时更有价值
LLM-as-a-Judge开放式质量测量Judge 是带偏差的测量工具,不是天然真值

大模型系统速记

训练看参数、激活和通信;生成看 KV Cache、内存带宽和批处理;RAG 看召回、重排和证据使用;评测先确认指标究竟测量哪种能力。

四、公式索引 ​

主题核心公式
自回归预训练−∑tlog⁡P(xt∣x<t)
Temperaturepi(T)=exp⁡(zi/T)/∑jexp⁡(zj/T)
LoRAΔW=(α/r)BA
LoRA 参数量r(din+dout)
SmoothQuantXW=(XS−1)(SW)
Pass@k1−(n−ck)/(nk)
HNSW 召回在延迟、内存和 Recall 之间调节搜索宽度

必背结论 ​

概念结论
预训练从原始数据构造自监督目标,不要求人工逐条标注
涌现非线性跃升依赖任务、指标和推理设置,不能把临界点绝对化
PEFT冻结基础模型不等于没有激活显存;不同方法的关键差异是参数注入位置
推理优化FlashAttention 优化 IO,GQA/MLA 减少 KV Cache,PagedAttention 管理缓存碎片
评测能力、对齐、文本重合和鲁棒性指标不能相互替代
RAGEmbedding 负责表示,ANN/HNSW 负责召回,Reranker 负责精排,LLM 基于证据生成
GraphRAG“数据能画成图”不等于必须使用图;关键是查询是否需要显式关系

使用 Markdown 与 VitePress 构建