部署

发布于 2026-09-04

推理成本估算

通过 API 调用成本与 GPU 推理时间,快速估算 AI 模型的单次推理成本,并比较 API 与独立部署的成本差异。

API

以 MiniMAX H3 模型为例,API 价格如下:

模型分辨率计费规则刊例价
MiniMax H32K按秒计费0.8 元/秒
MiniMax H3768P按秒计费0.5 元/秒

公式:

Cost=API单价×实际调用量Cost=API单价 \times 实际调用量

得出:

一个视频768P API2K API
5 秒¥2.5¥4
10 秒¥5¥8
15 秒¥7.5¥12

自部署

云GPU/算力市场,参考 AutoDL RTX 4090 为例,价格是 ¥2.29/时,公式:

Cost=GPU价格×推理分钟数60Cost=GPU价格 \times \frac{推理分钟数}{60}

即:

Cost=2.29×推理分钟数60Cost=2.29 \times \frac{推理分钟数}{60}
单个任务耗时GPU 成本
2 分钟¥0.076
5 分钟¥0.19
10 分钟¥0.38
20 分钟¥0.76
30 分钟¥1.145
60 分钟¥2.29

抛开部署配置等时间,若 H3 本地推理稳定运行。

比如一个 10 秒的 768P 视频。

API ¥5 / 条
 
假设 4090 运行 10 分钟,成本是 ¥0.38。

理论差距: ¥5 / ¥0.38 ≈ 13.16 倍。

那么自部署的成本远低于官方 API,这里面没有考虑输入素材的成本等额外因素,不过只看 GPU 租赁成本,自部署可能便宜一个数量级。

总结

以上仅比较 API 调用成本与 GPU 租赁成本,不包含存储、网络、部署维护等其他成本。

真正关键的不是“生成一条”,而是“生成一条合格的、可用的视频”。

若平均生成 3 次才能得到一条可用视频。以 10秒 768P 视频为例。需要 ¥15 元的成本。

而根据上面的估算,独立部署的费用是:¥0.38 * 3 = ¥1.14。依旧非常具有性价比。

比较的指标应该是:一条符合生产要求的视频平均需要多少次 Generation,以及总 GPU 时间是多少。

可能用到的指标:

指标含义
Model模型 / 工作流
Output输出规格,如 10s / 768P
Inference Time单次推理耗时
GPU PriceGPU 每小时价格
API Cost同规格 API 成本

例如:

H3 FL2VA 4090 24G 864×480 10 秒 8 steps
 
平均推理:5 min
GPU:¥2.29/h

模型实测

模型GPU输出规格推理耗时GPU 成本API 成本
MiniMax H3 FL2VARTX 4090 24G10s / 768P--¥5
MiniMax H3 Ref2VARTX 4090 24G10s / 768P--¥5
..................