Appearance
机器学习基础
机器学习可以沿着一条统一主线理解:
本页是机器学习知识地图和公式索引。经典监督模型、无监督表示学习和模型评估已经拆成专题页,避免把不同任务的假设、损失和指标混在同一张长页中。
一、学习范式
设样本为
| 范式 | 可用信号 | 主要目标 | 典型任务 |
|---|---|---|---|
| 监督学习 | 成对的 | 学习 | 分类、回归 |
| 无监督学习 | 只有 | 发现数据结构或分布 | 聚类、降维、密度估计 |
| 半监督学习 | 少量标签与大量无标签样本 | 同时利用标签和数据结构 | 标签昂贵的分类任务 |
| 强化学习 | 状态、动作、奖励、转移 | 最大化长期累计回报 | 控制、决策、游戏 |
二、专题导航
2.1 监督学习、损失与集成模型
- 线性回归、逻辑回归、Sigmoid、Softmax 与交叉熵;
- 多重共线性、Ridge、Lasso 和误差分布;
- SVM、核函数、朴素贝叶斯和树模型;
- Random Forest、Bagging、Boosting、GBDT、XGBoost 与 Stacking;
- 迁移学习和多任务学习。
2.2 降维、聚类与推荐系统
降维、聚类与矩阵分解覆盖:
- PCA、LDA、SVD、NMF 和 QR;
- K-Means、GMM、层次聚类、DBSCAN 和谱聚类;
- 欧氏距离、余弦相似度和聚类算法边界;
- 推荐系统中的潜在因子和缺失评分处理。
2.3 模型评估
模型评估与指标选择覆盖:
- MSE、RMSE、MAE、
和调整后的 ; - 混淆矩阵、Precision、Recall、F1、Accuracy 和 Specificity;
- Micro-F1、Macro-F1、Weighted-F1;
- 阈值、基准率、ROC-AUC、PR-AUC 和类别不平衡;
- 无监督聚类指标和 Pass@k。
三、统一建模框架
多数监督学习模型可以写成正则化经验风险最小化:
其中:
定义预测错误的代价; 控制模型复杂度; 平衡数据拟合与正则化; - 验证集负责选择模型和超参数,测试集只用于最终评估。
3.1 从假设到损失
| 假设或任务 | 常见目标 | 关键边界 |
|---|---|---|
| 高斯回归误差 | MSE / L2 | 对大误差和异常值更敏感 |
| 拉普拉斯回归误差 | MAE / L1 | 更稳健,但不是完全不受异常值影响 |
| 二分类概率建模 | Sigmoid + BCE | 标签为单个二元变量 |
| 互斥多分类 | Softmax + Cross-Entropy | 各类概率和为 |
| 多标签分类 | 多个 Sigmoid + BCE | 每个标签独立判断 |
| 最大间隔分类 | Hinge Loss | 典型于 SVM |
3.2 从任务到指标
| 任务 | 首先确认 | 常用指标 |
|---|---|---|
| 回归 | 误差单位、异常值和基线 | MSE、RMSE、MAE、 |
| 二分类 | 正类定义与 FP/FN 代价 | Precision、Recall、F1、ROC-AUC、PR-AUC |
| 多分类 | 类别是否平衡 | Accuracy、Micro/Macro/Weighted-F1 |
| 无监督聚类 | 是否有真实标签 | Silhouette、DBI、CH;有标签时可用 ARI/NMI |
| 代码生成 | 候选数量与测试覆盖 | Pass@k、执行成功率 |
机器学习速记
先判断监督信号,再选择模型假设和损失函数,最后用与业务错误代价匹配的指标评估泛化;训练集指标不能替代验证集和测试集。
四、公式索引
| 主题 | 核心公式 |
|---|---|
| 线性回归 | |
| 逻辑回归 | |
| 二元交叉熵 | |
| Ridge | |
| Lasso | |
| 贝叶斯公式 | |
| K-Means | |
| 回归评估 | |
| 分类评估 |
必背结论
| 概念 | 结论 |
|---|---|
| 模型选择 | 先看数据假设和错误代价,再看模型复杂度、训练成本和验证集表现 |
| 正则化 | L1 倾向稀疏,L2 倾向整体收缩;交叉验证不是正则化 |
| 回归指标 | MSE/RMSE/MAE 越小越好; |
| 分类指标 | Precision 主要受 FP 影响,Recall 主要受 FN 影响;阈值变化会产生取舍 |
| 类别不平衡 | Accuracy 可能虚高,应结合 PR-AUC、少数类指标和具体工作点 |
| 无监督评估 | 无标签时 Silhouette、CH 越大越好,DBI 越小越好 |