AI 概念

发布于 2026-08-19

Depth Map - 深度图

视频生成领域,Depth Map(深度图)是:把一帧二维画面转换成“每个像素距离摄像机有多远”的空间结构图。

视频生成领域,Depth Map(深度图)是:把一帧二维画面转换成“每个像素距离摄像机有多远”的空间结构图。

Depth Map

Depth Map

RGB 图像保存的是:(x,y)→(R,G,B)

Depth Map 保存的是:(x,y)→D

其中:D 表示这个像素对应物体的深度/距离信息。

视觉感受

  • 白/浅色 → 较近

  • 黑/深色 → 较远

  • 中间灰度 → 中等距离

注意:黑白对应远近并不是 Depth Map 的绝对规范,不同工具可能反过来;真正重要的是每个像素携带一个 depth value。

本质是:外观信息 RGB 转换为 空间几何信息 Depth。

如何生成

  1. 真实深度传感器直接测出来的。例如双目相机、LiDAR、ToF、结构光等。这种情况下 Depth 是真实传感器数据。

  2. 3D 软件直接渲染 Depth Pass / Z-Depth。例如 Blender 中已经存在完整的 3D 场景和摄像机,因此可以直接计算每个像素到摄像机的距离;

  3. 普通 RGB 视频通过 Depth Estimation Model 估算出来,流程是:原始视频 → 拆帧 → Depth 模型 → 每帧 Depth Map → Depth Video,给模型普通的一张 RGB 图片,它根据视觉线索推断:哪些东西近、哪些东西远,以及场景大致的三维结构;

价值

Depth Map 把大量“外观信息”扔掉,只留下:空间布局 + 物体轮廓 + 前后关系 + 运动 + Camera Motion。

尽量把参考视频中的“结构和运动”保留下来,同时削弱不希望模型照搬的外观细节。