AI 视频创作需要面向自身工作流的 Blender 类工具

AI 视频模型正在降低画面生成门槛,但复杂镜头中的机位、走位、空间关系和节奏,仍难以仅靠 Prompt 精确表达。爱范儿对 updream 预演台的体验显示,面向 AI 视频工作流的 Blender 类工具,可能成为连接创作者意图与生成模型的重要控制层。

AI 视频生成已经能够在较短时间内完成写实人物、电影级光影、大型场景和复杂特效的画面生成,但“画面能生成”与“镜头能成立”仍然是两件事。人物从哪里入场、摄影机如何移动、遮挡何时发生、主体在什么时候被揭示,这些决定镜头叙事的因素,很难通过一段 Prompt 被精确传达。

AI 视频创作需要面向自身工作流的 Blender 类工具主题相关图片
来自网络

爱范儿在体验 updream 预演台时发现,这类工具的核心思路并不是继续增加提示词长度,而是先把镜头放进一个可视化的三维空间中进行预演。创作者可以上传场景参考图生成 3D 白模场景,再在其中摆放人物、设置摄影机、调整运动轨迹和关键帧,最后把预演结果作为参考交给视频模型生成。

这套流程解决的首先是空间表达问题。相比用自然语言描述“镜头从人物身后跟随,随后抬升并露出巨型机甲”,创作者可以直接在场景中安排人物和摄影机的相对位置,并通过轨迹与关键帧确定运动方式。对于环绕、跟拍、推拉、揭示和多机位切换等镜头,空间预演提供了一种比纯文本更直观的控制方式。

在爱范儿测试的机甲格纳库案例中,加入白模录像后,镜头的运动方向、抬升时机、人物距离和最终构图都比只使用 Prompt 时更稳定。白模并不能决定机甲的材质、灯光质感或最终视觉风格,这些仍然由参考图、提示词和视频模型共同完成。但它可以优先锁定“怎么拍”,把摄影机调度从生成模型的随机发挥中分离出来。

多人场景更能体现这种工具的价值。地铁站三人擦肩的镜头同时涉及人物的进入时间、行进方向、擦肩位置、旁观者站位和摄影机速度。预演工具可以通过时间线和关键帧调整这些关系,使人物位置、运动时间与镜头变化在生成前得到检查。三维空间因此成为一种适合表达位置、方向和时间关系的创作语言。

不过,面向 AI 视频的 Blender 类工具并不意味着传统 3D 软件会被直接替代。updream 预演台自动生成的更接近粗粒度白模,重点保留人物动作、动线、站位、运镜和切镜等信息;对于精细建模、完整结构和复杂资产,仍然可以导入创作者制作的细粒度白模。即使在动作设计上,白模也更适合表达人物从哪里移动到哪里,而挥拳姿态、闪避幅度和格挡细节仍需要视频模型根据提示词和人物参考完成。

这也说明,AI 视频工作流正在出现更明确的分工:参考图和 Prompt 负责人物外观、场景细节、情绪与风格,白模负责空间关系和摄影机调度,生成模型负责最终的材质、动作表现和画面重渲染。不同控制条件各自承担一类信息,可能比把所有要求压缩进一段文字更适合复杂镜头。

预演并不会成为所有 AI 视频创作的默认步骤。对于简单镜头,直接输入 Prompt 可能更快;而制作白模仍需要理解三维空间、摄影机、轨迹和关键帧。它更适合多人调度、长镜头、环绕跟拍、复杂空间运动、明确终点构图,以及单次生成成本较高的镜头。此时,预演提供的是一个成本更低的试错区,让创作者在消耗最终生成资源前发现机位、走位和节奏问题。

从产品方向看,AI 视频工具可能分化为两条路线:一类继续提高自动化程度,尝试从剧本一路生成到成片;另一类则为创作者提供更细致的机位、动作和空间控制。前者降低了完成作品的门槛,后者则试图保留并放大专业创作者的判断。Blender 类工具的意义,正是在模型负责生成画面的同时,为创作者保留一台可操作的虚拟摄影机。

当建模、运镜和渲染逐渐成为可调用的基础能力后,AI 视频创作的竞争重点可能会重新回到镜头设计本身。生成按钮之前的取景、调度和节奏控制,仍然决定了一个想法能否被准确地拍出来。面向自身工作流构建的 Blender 类工具,或许正是 AI 视频从“抽卡式生成”走向“可设计创作”的关键一步。