机器学习

发布于 2026-09-17

机器学习基础

从工程视角建立机器学习的全局认知,理解数据、训练、模型、推理、学习类型、训练过程、泛化与模型评估等核心概念及其关系。

机器学习(Machine Learning,ML)是人工智能的重要分支。其核心思想是:

不直接为所有情况编写明确规则,而是让模型从数据中学习规律,并利用这些规律处理新的数据。

从工程视角理解机器学习,最核心的主线:

Data → Training → Model → Inference → Output
数据     训练       模型      推理        输出

机器学习涉及大量算法、数学理论和工程技术,但对于理解 AI 系统而言,首先需要建立的是整体认知:模型是什么、模型如何从数据中学习、训练完成后如何使用,以及如何判断模型是否有效。

1. 核心流程

传统程序通常由开发者直接定义规则:

Rules + Data → Output
规则  + 数据 → 结果

例如:

if age >= 18:
    result = "adult"(结果 = 成年)

程序如何处理数据,主要由开发者编写的规则决定。

机器学习则有所不同:

Data + Target
      ↓
   Training
      ↓
     Model

训练完成以后:

New Data
   ↓
 Model
   ↓
Inference
   ↓
Prediction

即:

训练阶段从数据中学习参数,推理阶段使用已经学习到的参数处理新的输入。

这是理解机器学习最重要的基础模型。

2. 基础术语

术语中文含义
Dataset数据集用于训练、验证或测试的一组数据
Sample样本数据集中的一条数据
Feature特征描述样本的信息
Label标签样本对应的目标答案
Model模型从数据中学习得到的函数或参数化系统
Parameter参数模型在训练过程中学习得到的内部数值
Training训练使用数据不断调整模型参数的过程
Inference推理使用训练完成的模型处理新输入
Prediction预测模型根据输入得到的输出结果

例如预测房价:

Sample(样本)
├── 面积:120㎡
├── 房龄:5 年
├── 房间:3
└── 区域:A
 
Features(特征)
→ 面积、房龄、房间、区域
 
Label(标签)
→ 实际成交价格

模型通过大量类似数据学习:

Features → Price

最终可以对新的房屋信息进行价格预测。

3. 机器学习的基本类型

机器学习可以从不同角度分类。最基础的分类包括:

Machine Learning
├── Supervised Learning(监督学习)
├── Unsupervised Learning(无监督学习)
└── Reinforcement Learning(强化学习)

3.1 Supervised Learning

监督学习(Supervised Learning) 使用包含目标答案的数据训练模型。

训练数据通常可以理解为:

Input → Label

例如:

邮件内容 → 垃圾邮件 / 正常邮件
房屋信息 → 成交价格
图片     → 猫 / 狗

监督学习中最常见的两类任务是:

Supervised Learning
├── Classification(分类)
└── Regression(回归)

Classification

分类(Classification) 预测离散类别。

例如:

邮件 → Spam / Not Spam
图片 → Cat / Dog
交易 → Normal / Fraud

Regression

回归(Regression) 预测连续数值。

例如:

房屋信息 → 价格
天气数据 → 温度
历史销量 → 下一阶段销量

3.2 Unsupervised Learning

无监督学习(Unsupervised Learning) 的数据通常没有明确的 Label,模型尝试从数据本身发现结构或规律。

例如:

大量用户数据
     ↓
分析数据结构
     ↓
发现若干用户群体

常见任务包括:

Clustering                 聚类
Dimensionality Reduction   降维

其中聚类可以用于发现数据中自然形成的不同群体。

3.3 Reinforcement Learning

强化学习(Reinforcement Learning,RL) 通过与环境交互以及获得奖励信号学习行为策略。

基本结构:

Agent
  ↓
Action
  ↓
Environment
  ↓
Reward
  ↓
调整策略

核心概念包括:

Agent          智能体
Environment    环境
Action         动作
Reward         奖励
Policy         策略

强化学习关注的核心问题是:

在环境中采取什么行为,可以获得更高的长期奖励。

4. 模型是如何学习的

机器学习中的“学习”,本质上通常是 根据训练结果不断调整模型参数,使模型输出越来越接近目标结果。

一个典型训练循环可以抽象为:

Input
  ↓
Model
  ↓
Prediction
  ↓
Loss
  ↓
Gradient
  ↓
Optimizer
  ↓
Update Parameters
  ↓
下一轮训练

进一步可以表示为:

Forward Pass
    ↓
Prediction
    ↓
Loss
    ↓
Backpropagation
    ↓
Gradient
    ↓
Optimizer
    ↓
Parameter Update

4.1 Forward Pass

前向传播(Forward Pass) 是数据经过模型并产生预测结果的过程:

Input → Model → Prediction

例如:

图片
 ↓
神经网络
 ↓
Cat: 0.8
Dog: 0.2

4.2 Loss

损失(Loss) 用于衡量:

模型预测结果与目标结果之间存在多大的误差。

可以简单理解为:

Prediction + Target
        ↓
      Loss

通常希望训练过程中 Loss 逐渐降低。

Loss 的具体计算方式由 Loss Function(损失函数) 决定,不同任务会使用不同的损失函数。

4.3 Gradient

梯度(Gradient) 描述 Loss 相对于模型参数变化的方向和程度。

工程上可以先理解为:

梯度告诉训练过程:参数应该朝什么方向调整,才能使 Loss 降低。

不需要一开始掌握完整微积分推导,但需要知道梯度连接了:

Loss
 ↓
Gradient
 ↓
Parameter Update

4.4 Backpropagation

反向传播(Backpropagation) 是神经网络中计算各个参数梯度的核心机制。

它从 Loss 开始,沿计算过程反向传播:

Forward:
 
Input → Layer 1 → Layer 2 → Layer 3 → Prediction
                                         ↓
                                        Loss
 
Backward:
 
Loss → Layer 3 → Layer 2 → Layer 1
          ↓          ↓          ↓
       Gradient   Gradient   Gradient

因此可以简单理解:

Forward Pass 负责得到结果,Backpropagation 负责计算如何调整参数。

4.5 Optimizer

优化器(Optimizer) 根据 Gradient 更新模型参数。

关系可以理解为:

Gradient
   ↓
Optimizer
   ↓
Update Parameters

常见优化方法包括:

Gradient Descent
SGD
Adam
AdamW

第一阶段不需要掌握每种优化器的数学细节,只需要理解:

Gradient 提供参数调整的信息,Optimizer 决定如何利用这些信息更新参数。

5. Training 与 Inference

训练和推理是两个不同阶段。

Training

训练阶段:

Dataset
   ↓
Forward Pass
   ↓
Loss
   ↓
Backpropagation
   ↓
Gradient
   ↓
Optimizer
   ↓
Parameter Update

训练的核心特征是:

模型参数会发生变化。

Inference

推理阶段:

Input
  ↓
Trained Model
  ↓
Output

通常:

模型参数已经固定,只执行前向计算,不再通过反向传播更新参数。

因此可以建立一个非常重要的区别:

TrainingInference
训练模型使用模型
需要训练数据接收实际输入
计算 Loss通常不需要计算训练 Loss
需要 Gradient通常不需要 Gradient
需要 Backpropagation不需要 Backpropagation
更新 ParametersParameters 保持固定

这也是为什么模型的训练成本和推理成本是两个不同的问题。

6. 数据集的划分

训练模型不能只关注模型在训练数据上的表现。

数据通常会划分为:

Dataset
├── Training Set
├── Validation Set
└── Test Set

Training Set

训练集用于训练模型并更新模型参数。

Training Data → Parameter Update

Validation Set

验证集通常用于训练过程中评估模型、选择模型和调整超参数。

它不应该像训练集一样直接用于正常的参数更新过程。

Test Set

测试集用于训练完成后评估模型对未参与训练和调优的数据的处理能力。

因此:

Training Set
→ 学习
 
Validation Set
→ 调整与选择
 
Test Set
→ 最终评估

7. 泛化、欠拟合与过拟合

机器学习真正希望获得的不是:

模型把训练数据记得非常准确。

而是:

模型学习到了能够应用到新数据上的规律。

这种能力称为:

Generalization(泛化能力)。


7.1 Underfitting

欠拟合(Underfitting) 表示模型连训练数据中的规律都没有充分学习。

Training Performance    差
Validation Performance  差

可能意味着模型能力不足、训练不足或特征无法充分表达问题等。

7.2 Overfitting

过拟合(Overfitting) 表示模型过度适应训练数据,却无法很好地处理新的数据。

典型表现:

Training Performance    很好
Validation Performance  明显较差

可以简单理解为:

模型记住了训练数据中的大量细节,但没有获得足够好的泛化能力。

7.3 Good Fit

理想情况是模型既能够学习训练数据中的有效规律,又能够处理未见过的新数据:

Training Data
      ↓
Learn General Patterns
      ↓
Unseen Data
      ↓
Good Performance

因此:

Underfitting ←—— Good Fit ——→ Overfitting

而 Generalization 是理解这一系列问题的核心概念。

8. 模型评估

模型训练完成以后,需要通过 **Evaluation Metrics(评估指标)**判断模型效果。

不同任务使用的指标不同。

例如:

Classification
├── Accuracy
├── Precision
├── Recall
└── F1 Score
 
Regression
├── MAE
├── MSE
└── RMSE

8.1 Accuracy

准确率(Accuracy):

所有预测中,预测正确的比例。

Accuracy = 正确预测数量 / 总预测数量

例如:

100 个样本
90 个预测正确
 
Accuracy = 90%

但当不同类别的数据量严重不均衡时,仅看 Accuracy 可能产生误导。

8.2 Precision

**精确率(Precision)**关注:

模型预测为 Positive 的结果中,有多少是真的 Positive。

例如风险识别系统预测:

模型判断 100 个用户存在风险
其中实际 80 个确实存在风险
 
Precision = 80%

Precision 高意味着:

模型一旦报出来,通常比较可信。

8.3 Recall

**召回率(Recall)**关注:

所有真正的 Positive 中,有多少被模型成功找出来。

例如实际存在:

100 个风险用户
模型找出了其中 90 个
 
Recall = 90%

Recall 高意味着:

真正需要找到的目标,很少被漏掉。

8.4 F1 Score

Precision 和 Recall 经常存在权衡:

Precision ↑
可能意味着判断更加谨慎
 
Recall ↑
可能意味着覆盖范围更加宽泛

F1 Score综合考虑 Precision 和 Recall。

因此分类任务中经常同时观察:

Accuracy
Precision
Recall
F1

而不是只看单一指标。

9. 机器学习与深度学习

可以从整体上建立如下关系:

Artificial Intelligence
└── Machine Learning
    ├── Traditional Machine Learning
    │   ├── Linear Regression
    │   ├── Logistic Regression
    │   ├── Decision Tree
    │   ├── Random Forest
    │   ├── SVM
    │   └── ...
    │
    └── Deep Learning
        └── Neural Networks
            ├── CNN
            ├── RNN
            └── Transformer

其中:

Artificial Intelligence(AI)

是更大的领域,目标是让计算机系统表现出某些通常与智能相关的能力。

Machine Learning(ML)

通过数据学习规律,是实现 AI 的重要方法之一。

Deep Learning(DL)

是机器学习的重要分支,主要使用多层神经网络学习复杂的数据表示。

Transformer

是一种神经网络架构,是现代大语言模型和大量多模态模型的重要基础架构。

因此可以形成一个简化认知:

AI
↓
Machine Learning
↓
Deep Learning
↓
Neural Network
↓
Transformer
↓
LLM / Multimodal / Generative AI

需要注意,这是一条用于建立认知的简化主线,并不意味着所有生成式 AI 都必须基于 Transformer,也不意味着 AI 只有机器学习这一种实现方式。

10. 传统机器学习与现代生成式 AI

传统机器学习经常解决:

Input → Prediction

例如:

邮件 → 是否垃圾邮件
图片 → 对象类别
房屋 → 预测价格

现代生成模型更多处理:

Input → Generated Content

例如:

Text → Text
Text → Image
Image → Video
Text + Image + Audio → Video + Audio

虽然任务越来越复杂,但很多底层概念仍然来自同一套机器学习体系:

Data
Training
Model
Parameter
Loss
Gradient
Backpropagation
Optimizer
Generalization
Evaluation
Inference

因此理解机器学习基础,有助于理解后续的:

Neural Network
Transformer
Diffusion Model
VAE
LLM
Multimodal Model
Fine-tuning
LoRA
RLHF
Quantization
Inference

这些概念并不是彼此孤立的技术,而是建立在机器学习和深度学习体系之上的不同技术层次。

11. 最小知识地图

如果只保留机器学习最核心的知识骨架,可以压缩为:

Machine Learning
│
├── 1. Core Concepts
│   └── Data → Training → Model → Inference
│
├── 2. Learning Types
│   ├── Supervised Learning
│   ├── Unsupervised Learning
│   └── Reinforcement Learning
│
├── 3. Common Tasks
│   ├── Classification
│   ├── Regression
│   └── Clustering
│
├── 4. Training
│   └── Forward
│       → Loss
│       → Gradient
│       → Backpropagation
│       → Optimizer
│       → Parameter Update
│
├── 5. Data & Generalization
│   ├── Training Set
│   ├── Validation Set
│   ├── Test Set
│   ├── Underfitting
│   ├── Overfitting
│   └── Generalization
│
└── 6. Evaluation
    ├── Accuracy
    ├── Precision
    ├── Recall
    └── F1 Score

可以进一步压缩成一条主线:

准备数据
   ↓
选择学习任务
   ↓
建立模型
   ↓
Forward
   ↓
计算 Loss
   ↓
Backpropagation / Gradient
   ↓
Optimizer 更新 Parameters
   ↓
反复训练
   ↓
Validation / Evaluation
   ↓
获得 Trained Model
   ↓
Inference
   ↓
处理新的数据

12. 后续可以继续掌握的概念

完成这一基础框架后,可以逐渐补充以下原子概念:

Epoch
Batch
Batch Size
Iteration
Learning Rate
 
Loss Function
Gradient Descent
SGD
Adam / AdamW
 
Hyperparameter
Regularization
Dropout
Early Stopping
Data Augmentation
 
Cross Validation
Confusion Matrix
ROC / AUC
Data Leakage
 
Feature Engineering
Normalization
Standardization
 
Fine-tuning
Transfer Learning

不需要一次全部掌握。

更重要的是将每一个新概念放回整个机器学习流程中,明确它解决什么问题、处于什么位置、与哪些概念存在关系。

核心认知

机器学习可以先理解成:

通过数据和目标函数不断调整模型参数,使模型学习数据中的规律,并将这种规律应用于新的数据。

最核心的两个阶段是:

Training
数据 → 模型 → 预测 → Loss → Gradient → 更新参数
 
Inference
新数据 → 已训练模型 → 输出

学习机器学习基础的第一目标,不是记住大量算法或数学公式,而是建立这张全局地图。

当遇到一个新的机器学习概念时,可以先问三个问题:

  1. 它是什么?
  2. 它位于整个机器学习流程的哪个位置?
  3. 它解决什么问题?

能够把新的原子概念不断挂到这张地图上,就逐渐形成了完整的机器学习知识体系。