模型

发布于 2026-08-21

第一层:模型是什么?

从工程视角理解 AI 模型的基本构成,以及模型、架构、参数、权重、配置和 Tokenizer 等核心概念之间的关系。

核心问题:我们所说的“模型”究竟是什么?

主要概念:Model、Architecture、Parameters、Weights。

完整的模型生命周期示意:

界定

模型 在不同语境中含义并不完全相同。本文主要讨论大语言模型及多模态生成模型,并以 Hugging Face 上发布的模型仓库为工程实例。

语境“模型”通常指什么例子
机器学习语境由数据训练得到、能够根据输入计算输出的数学系统分类模型、语言模型、扩散模型
架构语境一种计算结构或设计方案Transformer、Decoder-only、Diffusion Transformer
权重语境某次训练得到的一组具体参数值Qwen3.8-27B 的权重
工程语境可下载、加载和运行的一整套模型资源Hugging Face 模型仓库

有时把“Transformer”叫模型,有时把一个 .safetensors 文件叫模型,也会把整个 Hugging Face 仓库叫模型。它们并不完全是同一层面的东西。

本文所说的“一个可以运行的模型”,主要采用工程语境:以训练后的权重为核心,加上架构实现、配置、Tokenizer 或 Processor 等配套资源。

概念

从概念上,或者脑海中的印象来讲:

  • 模型是一套能够根据输入计算输出的数学系统。它的架构规定了如何计算,参数的具体数值则通过训练获得。
  • 架构像一套预先设计好的计算框架,权重是训练过程中填入其中的大量数值;两者结合,才形成一个具备具体能力的模型。

抽象来说,模型是一个通过训练获得参数,并能够根据输入计算输出的数学系统。

从工程实现的角度来讲:

架构实现
+ 训练后的权重
+ 模型配置
+ Tokenizer / Processor
+ 推理框架
≈ 一个可以被加载和运行的模型
  • 其中“模型核心”:
模型核心 = Architecture + Trained Parameters
  • 可运行模型包:
可运行模型包 ≈
模型核心
+ Config
+ Tokenizer / Processor
+ Generation Config
+ Chat Template
  • 推理框架负责把模型包真正运行起来,例如:

    • Transformers
    • vLLM
    • llama.cpp
    • ComfyUI
    • Diffusers

架构示意

Model(模型)
│
├── Architecture(架构)
│   └── 规定模型由哪些计算模块组成,以及数据如何流动
│
├── Parameters / Weights(参数 / 权重)
│   └── 通过训练学习到的大量数值
│
├── Input Representation(输入表示)
│   ├── Tokenizer(文本)
│   └── Processor(图像 / 音频 / 视频)
│
└── Configuration(配置)
    ├── Model Config(模型结构配置)
    └── Generation Config(生成配置)

模型的不同状态:

分类维度常见状态
按训练阶段Pretrained、Instruction-tuned、Fine-tuned
按数值与部署形态BF16、FP16、FP8、INT8、INT4、Quantized
按完整程度Base、Pruned、Distilled
按用途或能力Text、Vision-Language、Embedding、Reranker

工程中的“模型”并不总是单独一个文件,而经常表现为一个由权重、配置、分词器、预处理规则和说明文档共同组成的模型仓库。

示例

以 Qwen3.8 模型为例,其结构,包含了权重文件、结构配置、Tokenizer、输入预处理规则以及生成配置等。

其中:

  • 架构配置和权重决定模型本身;
  • Tokenizer 与预处理配置负责把输入转换成模型可以接收的形式;
  • Chat Template 和 Generation Config 负责规范交互及生成行为;
  • Model Card 与 License 则负责说明模型的能力、用法和使用边界。

总结

模型是一套由架构和参数构成的计算系统;它通过训练获得权重,把输入转换为输出;训练结果被保存为模型仓库中的一组文件,最终由推理框架加载到内存和显存中运行。

架构规定模型“怎么算”,权重保存模型“学到了什么”。在工程中,它们还需要与配置、Tokenizer 或多模态 Processor 等资源配合,才能被正确加载和使用。