机器学习(Machine Learning,ML)是人工智能的重要分支。其核心思想是:
不直接为所有情况编写明确规则,而是让模型从数据中学习规律,并利用这些规律处理新的数据。
从工程视角理解机器学习,最核心的主线:
Data → Training → Model → Inference → Output
数据 训练 模型 推理 输出机器学习涉及大量算法、数学理论和工程技术,但对于理解 AI 系统而言,首先需要建立的是整体认知:模型是什么、模型如何从数据中学习、训练完成后如何使用,以及如何判断模型是否有效。
1. 核心流程
传统程序通常由开发者直接定义规则:
Rules + Data → Output
规则 + 数据 → 结果例如:
if age >= 18:
result = "adult"(结果 = 成年)程序如何处理数据,主要由开发者编写的规则决定。
机器学习则有所不同:
Data + Target
↓
Training
↓
Model训练完成以后:
New Data
↓
Model
↓
Inference
↓
Prediction即:
训练阶段从数据中学习参数,推理阶段使用已经学习到的参数处理新的输入。
这是理解机器学习最重要的基础模型。
2. 基础术语
| 术语 | 中文 | 含义 |
|---|---|---|
| Dataset | 数据集 | 用于训练、验证或测试的一组数据 |
| Sample | 样本 | 数据集中的一条数据 |
| Feature | 特征 | 描述样本的信息 |
| Label | 标签 | 样本对应的目标答案 |
| Model | 模型 | 从数据中学习得到的函数或参数化系统 |
| Parameter | 参数 | 模型在训练过程中学习得到的内部数值 |
| Training | 训练 | 使用数据不断调整模型参数的过程 |
| Inference | 推理 | 使用训练完成的模型处理新输入 |
| Prediction | 预测 | 模型根据输入得到的输出结果 |
例如预测房价:
Sample(样本)
├── 面积:120㎡
├── 房龄:5 年
├── 房间:3
└── 区域:A
Features(特征)
→ 面积、房龄、房间、区域
Label(标签)
→ 实际成交价格模型通过大量类似数据学习:
Features → Price最终可以对新的房屋信息进行价格预测。
3. 机器学习的基本类型
机器学习可以从不同角度分类。最基础的分类包括:
Machine Learning
├── Supervised Learning(监督学习)
├── Unsupervised Learning(无监督学习)
└── Reinforcement Learning(强化学习)3.1 Supervised Learning
监督学习(Supervised Learning) 使用包含目标答案的数据训练模型。
训练数据通常可以理解为:
Input → Label例如:
邮件内容 → 垃圾邮件 / 正常邮件
房屋信息 → 成交价格
图片 → 猫 / 狗监督学习中最常见的两类任务是:
Supervised Learning
├── Classification(分类)
└── Regression(回归)Classification
分类(Classification) 预测离散类别。
例如:
邮件 → Spam / Not Spam
图片 → Cat / Dog
交易 → Normal / FraudRegression
回归(Regression) 预测连续数值。
例如:
房屋信息 → 价格
天气数据 → 温度
历史销量 → 下一阶段销量3.2 Unsupervised Learning
无监督学习(Unsupervised Learning) 的数据通常没有明确的 Label,模型尝试从数据本身发现结构或规律。
例如:
大量用户数据
↓
分析数据结构
↓
发现若干用户群体常见任务包括:
Clustering 聚类
Dimensionality Reduction 降维其中聚类可以用于发现数据中自然形成的不同群体。
3.3 Reinforcement Learning
强化学习(Reinforcement Learning,RL) 通过与环境交互以及获得奖励信号学习行为策略。
基本结构:
Agent
↓
Action
↓
Environment
↓
Reward
↓
调整策略核心概念包括:
Agent 智能体
Environment 环境
Action 动作
Reward 奖励
Policy 策略强化学习关注的核心问题是:
在环境中采取什么行为,可以获得更高的长期奖励。
4. 模型是如何学习的
机器学习中的“学习”,本质上通常是 根据训练结果不断调整模型参数,使模型输出越来越接近目标结果。
一个典型训练循环可以抽象为:
Input
↓
Model
↓
Prediction
↓
Loss
↓
Gradient
↓
Optimizer
↓
Update Parameters
↓
下一轮训练进一步可以表示为:
Forward Pass
↓
Prediction
↓
Loss
↓
Backpropagation
↓
Gradient
↓
Optimizer
↓
Parameter Update4.1 Forward Pass
前向传播(Forward Pass) 是数据经过模型并产生预测结果的过程:
Input → Model → Prediction例如:
图片
↓
神经网络
↓
Cat: 0.8
Dog: 0.24.2 Loss
损失(Loss) 用于衡量:
模型预测结果与目标结果之间存在多大的误差。
可以简单理解为:
Prediction + Target
↓
Loss通常希望训练过程中 Loss 逐渐降低。
Loss 的具体计算方式由 Loss Function(损失函数) 决定,不同任务会使用不同的损失函数。
4.3 Gradient
梯度(Gradient) 描述 Loss 相对于模型参数变化的方向和程度。
工程上可以先理解为:
梯度告诉训练过程:参数应该朝什么方向调整,才能使 Loss 降低。
不需要一开始掌握完整微积分推导,但需要知道梯度连接了:
Loss
↓
Gradient
↓
Parameter Update4.4 Backpropagation
反向传播(Backpropagation) 是神经网络中计算各个参数梯度的核心机制。
它从 Loss 开始,沿计算过程反向传播:
Forward:
Input → Layer 1 → Layer 2 → Layer 3 → Prediction
↓
Loss
Backward:
Loss → Layer 3 → Layer 2 → Layer 1
↓ ↓ ↓
Gradient Gradient Gradient因此可以简单理解:
Forward Pass 负责得到结果,Backpropagation 负责计算如何调整参数。
4.5 Optimizer
优化器(Optimizer) 根据 Gradient 更新模型参数。
关系可以理解为:
Gradient
↓
Optimizer
↓
Update Parameters常见优化方法包括:
Gradient Descent
SGD
Adam
AdamW第一阶段不需要掌握每种优化器的数学细节,只需要理解:
Gradient 提供参数调整的信息,Optimizer 决定如何利用这些信息更新参数。
5. Training 与 Inference
训练和推理是两个不同阶段。
Training
训练阶段:
Dataset
↓
Forward Pass
↓
Loss
↓
Backpropagation
↓
Gradient
↓
Optimizer
↓
Parameter Update训练的核心特征是:
模型参数会发生变化。
Inference
推理阶段:
Input
↓
Trained Model
↓
Output通常:
模型参数已经固定,只执行前向计算,不再通过反向传播更新参数。
因此可以建立一个非常重要的区别:
| Training | Inference |
|---|---|
| 训练模型 | 使用模型 |
| 需要训练数据 | 接收实际输入 |
| 计算 Loss | 通常不需要计算训练 Loss |
| 需要 Gradient | 通常不需要 Gradient |
| 需要 Backpropagation | 不需要 Backpropagation |
| 更新 Parameters | Parameters 保持固定 |
这也是为什么模型的训练成本和推理成本是两个不同的问题。
6. 数据集的划分
训练模型不能只关注模型在训练数据上的表现。
数据通常会划分为:
Dataset
├── Training Set
├── Validation Set
└── Test SetTraining Set
训练集用于训练模型并更新模型参数。
Training Data → Parameter UpdateValidation Set
验证集通常用于训练过程中评估模型、选择模型和调整超参数。
它不应该像训练集一样直接用于正常的参数更新过程。
Test Set
测试集用于训练完成后评估模型对未参与训练和调优的数据的处理能力。
因此:
Training Set
→ 学习
Validation Set
→ 调整与选择
Test Set
→ 最终评估7. 泛化、欠拟合与过拟合
机器学习真正希望获得的不是:
模型把训练数据记得非常准确。
而是:
模型学习到了能够应用到新数据上的规律。
这种能力称为:
Generalization(泛化能力)。
7.1 Underfitting
欠拟合(Underfitting) 表示模型连训练数据中的规律都没有充分学习。
Training Performance 差
Validation Performance 差可能意味着模型能力不足、训练不足或特征无法充分表达问题等。
7.2 Overfitting
过拟合(Overfitting) 表示模型过度适应训练数据,却无法很好地处理新的数据。
典型表现:
Training Performance 很好
Validation Performance 明显较差可以简单理解为:
模型记住了训练数据中的大量细节,但没有获得足够好的泛化能力。
7.3 Good Fit
理想情况是模型既能够学习训练数据中的有效规律,又能够处理未见过的新数据:
Training Data
↓
Learn General Patterns
↓
Unseen Data
↓
Good Performance因此:
Underfitting ←—— Good Fit ——→ Overfitting而 Generalization 是理解这一系列问题的核心概念。
8. 模型评估
模型训练完成以后,需要通过 **Evaluation Metrics(评估指标)**判断模型效果。
不同任务使用的指标不同。
例如:
Classification
├── Accuracy
├── Precision
├── Recall
└── F1 Score
Regression
├── MAE
├── MSE
└── RMSE8.1 Accuracy
准确率(Accuracy):
所有预测中,预测正确的比例。
Accuracy = 正确预测数量 / 总预测数量例如:
100 个样本
90 个预测正确
Accuracy = 90%但当不同类别的数据量严重不均衡时,仅看 Accuracy 可能产生误导。
8.2 Precision
**精确率(Precision)**关注:
模型预测为 Positive 的结果中,有多少是真的 Positive。
例如风险识别系统预测:
模型判断 100 个用户存在风险
其中实际 80 个确实存在风险
Precision = 80%Precision 高意味着:
模型一旦报出来,通常比较可信。
8.3 Recall
**召回率(Recall)**关注:
所有真正的 Positive 中,有多少被模型成功找出来。
例如实际存在:
100 个风险用户
模型找出了其中 90 个
Recall = 90%Recall 高意味着:
真正需要找到的目标,很少被漏掉。
8.4 F1 Score
Precision 和 Recall 经常存在权衡:
Precision ↑
可能意味着判断更加谨慎
Recall ↑
可能意味着覆盖范围更加宽泛F1 Score综合考虑 Precision 和 Recall。
因此分类任务中经常同时观察:
Accuracy
Precision
Recall
F1而不是只看单一指标。
9. 机器学习与深度学习
可以从整体上建立如下关系:
Artificial Intelligence
└── Machine Learning
├── Traditional Machine Learning
│ ├── Linear Regression
│ ├── Logistic Regression
│ ├── Decision Tree
│ ├── Random Forest
│ ├── SVM
│ └── ...
│
└── Deep Learning
└── Neural Networks
├── CNN
├── RNN
└── Transformer其中:
Artificial Intelligence(AI)
是更大的领域,目标是让计算机系统表现出某些通常与智能相关的能力。
Machine Learning(ML)
通过数据学习规律,是实现 AI 的重要方法之一。
Deep Learning(DL)
是机器学习的重要分支,主要使用多层神经网络学习复杂的数据表示。
Transformer
是一种神经网络架构,是现代大语言模型和大量多模态模型的重要基础架构。
因此可以形成一个简化认知:
AI
↓
Machine Learning
↓
Deep Learning
↓
Neural Network
↓
Transformer
↓
LLM / Multimodal / Generative AI需要注意,这是一条用于建立认知的简化主线,并不意味着所有生成式 AI 都必须基于 Transformer,也不意味着 AI 只有机器学习这一种实现方式。
10. 传统机器学习与现代生成式 AI
传统机器学习经常解决:
Input → Prediction例如:
邮件 → 是否垃圾邮件
图片 → 对象类别
房屋 → 预测价格现代生成模型更多处理:
Input → Generated Content例如:
Text → Text
Text → Image
Image → Video
Text + Image + Audio → Video + Audio虽然任务越来越复杂,但很多底层概念仍然来自同一套机器学习体系:
Data
Training
Model
Parameter
Loss
Gradient
Backpropagation
Optimizer
Generalization
Evaluation
Inference因此理解机器学习基础,有助于理解后续的:
Neural Network
Transformer
Diffusion Model
VAE
LLM
Multimodal Model
Fine-tuning
LoRA
RLHF
Quantization
Inference这些概念并不是彼此孤立的技术,而是建立在机器学习和深度学习体系之上的不同技术层次。
11. 最小知识地图
如果只保留机器学习最核心的知识骨架,可以压缩为:
Machine Learning
│
├── 1. Core Concepts
│ └── Data → Training → Model → Inference
│
├── 2. Learning Types
│ ├── Supervised Learning
│ ├── Unsupervised Learning
│ └── Reinforcement Learning
│
├── 3. Common Tasks
│ ├── Classification
│ ├── Regression
│ └── Clustering
│
├── 4. Training
│ └── Forward
│ → Loss
│ → Gradient
│ → Backpropagation
│ → Optimizer
│ → Parameter Update
│
├── 5. Data & Generalization
│ ├── Training Set
│ ├── Validation Set
│ ├── Test Set
│ ├── Underfitting
│ ├── Overfitting
│ └── Generalization
│
└── 6. Evaluation
├── Accuracy
├── Precision
├── Recall
└── F1 Score可以进一步压缩成一条主线:
准备数据
↓
选择学习任务
↓
建立模型
↓
Forward
↓
计算 Loss
↓
Backpropagation / Gradient
↓
Optimizer 更新 Parameters
↓
反复训练
↓
Validation / Evaluation
↓
获得 Trained Model
↓
Inference
↓
处理新的数据12. 后续可以继续掌握的概念
完成这一基础框架后,可以逐渐补充以下原子概念:
Epoch
Batch
Batch Size
Iteration
Learning Rate
Loss Function
Gradient Descent
SGD
Adam / AdamW
Hyperparameter
Regularization
Dropout
Early Stopping
Data Augmentation
Cross Validation
Confusion Matrix
ROC / AUC
Data Leakage
Feature Engineering
Normalization
Standardization
Fine-tuning
Transfer Learning不需要一次全部掌握。
更重要的是将每一个新概念放回整个机器学习流程中,明确它解决什么问题、处于什么位置、与哪些概念存在关系。
核心认知
机器学习可以先理解成:
通过数据和目标函数不断调整模型参数,使模型学习数据中的规律,并将这种规律应用于新的数据。
最核心的两个阶段是:
Training
数据 → 模型 → 预测 → Loss → Gradient → 更新参数
Inference
新数据 → 已训练模型 → 输出学习机器学习基础的第一目标,不是记住大量算法或数学公式,而是建立这张全局地图。
当遇到一个新的机器学习概念时,可以先问三个问题:
- 它是什么?
- 它位于整个机器学习流程的哪个位置?
- 它解决什么问题?
能够把新的原子概念不断挂到这张地图上,就逐渐形成了完整的机器学习知识体系。