Skip to content

机器学习基础 ​

机器学习可以沿着一条统一主线理解:

监督信号→模型假设→损失与优化→泛化评估

本页是机器学习知识地图和公式索引。经典监督模型、无监督表示学习和模型评估已经拆成专题页,避免把不同任务的假设、损失和指标混在同一张长页中。

一、学习范式 ​

设样本为 x、标签为 y、模型为 fθ。

范式可用信号主要目标典型任务
监督学习成对的 (x,y)学习 x→y分类、回归
无监督学习只有 x发现数据结构或分布聚类、降维、密度估计
半监督学习少量标签与大量无标签样本同时利用标签和数据结构标签昂贵的分类任务
强化学习状态、动作、奖励、转移最大化长期累计回报控制、决策、游戏

二、专题导航 ​

2.1 监督学习、损失与集成模型 ​

监督学习、损失函数与集成模型覆盖:

  • 线性回归、逻辑回归、Sigmoid、Softmax 与交叉熵;
  • 多重共线性、Ridge、Lasso 和误差分布;
  • SVM、核函数、朴素贝叶斯和树模型;
  • Random Forest、Bagging、Boosting、GBDT、XGBoost 与 Stacking;
  • 迁移学习和多任务学习。

2.2 降维、聚类与推荐系统 ​

降维、聚类与矩阵分解覆盖:

  • PCA、LDA、SVD、NMF 和 QR;
  • K-Means、GMM、层次聚类、DBSCAN 和谱聚类;
  • 欧氏距离、余弦相似度和聚类算法边界;
  • 推荐系统中的潜在因子和缺失评分处理。

2.3 模型评估 ​

模型评估与指标选择覆盖:

  • MSE、RMSE、MAE、R2 和调整后的 R2;
  • 混淆矩阵、Precision、Recall、F1、Accuracy 和 Specificity;
  • Micro-F1、Macro-F1、Weighted-F1;
  • 阈值、基准率、ROC-AUC、PR-AUC 和类别不平衡;
  • 无监督聚类指标和 Pass@k。

三、统一建模框架 ​

多数监督学习模型可以写成正则化经验风险最小化:

θ^=arg⁡minθ[1n∑i=1nℓ(yi,fθ(xi))+λΩ(θ)]

其中:

  • ℓ 定义预测错误的代价;
  • Ω 控制模型复杂度;
  • λ 平衡数据拟合与正则化;
  • 验证集负责选择模型和超参数,测试集只用于最终评估。

3.1 从假设到损失 ​

假设或任务常见目标关键边界
高斯回归误差MSE / L2对大误差和异常值更敏感
拉普拉斯回归误差MAE / L1更稳健,但不是完全不受异常值影响
二分类概率建模Sigmoid + BCE标签为单个二元变量
互斥多分类Softmax + Cross-Entropy各类概率和为 1
多标签分类多个 Sigmoid + BCE每个标签独立判断
最大间隔分类Hinge Loss典型于 SVM

3.2 从任务到指标 ​

任务首先确认常用指标
回归误差单位、异常值和基线MSE、RMSE、MAE、R2
二分类正类定义与 FP/FN 代价Precision、Recall、F1、ROC-AUC、PR-AUC
多分类类别是否平衡Accuracy、Micro/Macro/Weighted-F1
无监督聚类是否有真实标签Silhouette、DBI、CH;有标签时可用 ARI/NMI
代码生成候选数量与测试覆盖Pass@k、执行成功率

机器学习速记

先判断监督信号,再选择模型假设和损失函数,最后用与业务错误代价匹配的指标评估泛化;训练集指标不能替代验证集和测试集。

四、公式索引 ​

主题核心公式
线性回归y^=wTx+b
逻辑回归p^=σ(wTx+b)
二元交叉熵−[ylog⁡p^+(1−y)log⁡(1−p^)]
RidgeSSE+λ‖w‖22
LassoSSE+λ‖w‖1
贝叶斯公式P(A∣B)=P(B∣A)P(A)/P(B)
K-Means∑i‖xi−μci‖22
回归评估MSE、MAE、R2
分类评估Precision、Recall、F1

必背结论 ​

概念结论
模型选择先看数据假设和错误代价,再看模型复杂度、训练成本和验证集表现
正则化L1 倾向稀疏,L2 倾向整体收缩;交叉验证不是正则化
回归指标MSE/RMSE/MAE 越小越好;R2 通常越大越好,但测试集可能小于 0
分类指标Precision 主要受 FP 影响,Recall 主要受 FN 影响;阈值变化会产生取舍
类别不平衡Accuracy 可能虚高,应结合 PR-AUC、少数类指标和具体工作点
无监督评估无标签时 Silhouette、CH 越大越好,DBI 越小越好

使用 Markdown 与 VitePress 构建