视频生成领域,Depth Map(深度图)是:把一帧二维画面转换成“每个像素距离摄像机有多远”的空间结构图。
RGB 图像保存的是:(x,y)→(R,G,B)
Depth Map 保存的是:(x,y)→D
其中:D 表示这个像素对应物体的深度/距离信息。
视觉感受
-
白/浅色 → 较近
-
黑/深色 → 较远
-
中间灰度 → 中等距离
注意:黑白对应远近并不是 Depth Map 的绝对规范,不同工具可能反过来;真正重要的是每个像素携带一个 depth value。
本质是:外观信息 RGB 转换为 空间几何信息 Depth。
如何生成
-
真实深度传感器直接测出来的。例如双目相机、LiDAR、ToF、结构光等。这种情况下 Depth 是真实传感器数据。
-
3D 软件直接渲染 Depth Pass / Z-Depth。例如 Blender 中已经存在完整的 3D 场景和摄像机,因此可以直接计算每个像素到摄像机的距离;
-
普通 RGB 视频通过 Depth Estimation Model 估算出来,流程是:原始视频 → 拆帧 → Depth 模型 → 每帧 Depth Map → Depth Video,给模型普通的一张 RGB 图片,它根据视觉线索推断:哪些东西近、哪些东西远,以及场景大致的三维结构;
价值
Depth Map 把大量“外观信息”扔掉,只留下:空间布局 + 物体轮廓 + 前后关系 + 运动 + Camera Motion。
尽量把参考视频中的“结构和运动”保留下来,同时削弱不希望模型照搬的外观细节。