AI 概念
整理 AI 领域的原子化概念,从准确理解每一个基础概念开始,避免似是而非的认知,并通过概念之间的组合与关联,逐步建立系统的 AI 知识体系。
4 项内容
Encoder - 编码器
Encoder(编码器)是一个功能性角色,负责将输入转换为适合模型后续处理的内部表示。它不是某一种特定算法,其具体结构取决于模型与任务。
- Encoder 的核心是 Representation Transformation(表示转换):将输入 x 转换为内部表示 z;
- 在 AI 中,它可以是 Transformer、CNN、VAE Encoder 等不同实现,并广泛存在于文本、图像、音频和多模态模型中;
Depth Map - 深度图
视频生成领域,Depth Map(深度图)是:把一帧二维画面转换成“每个像素距离摄像机有多远”的空间结构图。
- RGB 图像保存的是:(x,y)→(R,G,B),Depth Map 保存的是:(x,y)→D,其中:D 表示这个像素对应物体的深度/距离信息;
- Depth Map 把大量“外观信息”扔掉,只留下:空间布局 + 物体轮廓 + 前后关系 + 运动 + Camera Motion;
- 价值:尽量把参考视频中的“结构和运动”保留下来,同时削弱不希望模型照搬的外观细节;
Super Resolution - 超分辨率
Super Resolution(超分辨率)是利用模型将低分辨率视觉内容重建为高分辨率视觉内容,并推断或生成缺失细节的 AI 任务。
- Super Resolution 不只是放大尺寸,而是尝试重建高分辨率细节。
- AI 超分通常是一次模型推理,可应用于图像和视频。
- Video Super Resolution 还需要关注连续帧之间的时间一致性。
Clay Render - 黏土渲染
了解 Clay Render 的概念和用途场景。
- Clay Render 直译为“黏土渲染”,指的是把模型渲染成统一的、没有材质/贴图的样子——通常是单色、哑光的表面(常见是灰色或白色),只保留形状、光影和体积感,像是用黏土捏出来的模型一样。