使用指南
这套工具的核心只有一件事:把你脑子里的画面,翻译成模型能准确执行的一段描述。 下面是最短的上手路径。
选对输入方式
- 文字成片:从零开始,最自由,也最考验描述功力。适合场景是新画面、无参考。
- 图片动起来:手上已经有一张满意的图,让它动。构图与色彩不会跑偏,最省事。
- 首尾帧过渡:知道画面从哪开始、到哪结束。适合改造对比、昼夜变化、变形转场。
- 参考图:需要同一个人物或同一件产品反复出现。最多 4 张,锁定一致性。
- 参考视频:看中了某条片子的运镜和节奏,把它套到新内容上。
描述怎么写
一句话描述能出片,但稳定性差。把下面六件事写全,成功率会明显提高:
- 主体:是谁 / 是什么,外形特征
- 动作:在做什么,怎么做
- 场景:在哪里,周围有什么
- 镜头:景别(特写 / 中景 / 远景)+ 运动(推 / 拉 / 摇 / 移 / 环绕 / 固定)
- 光线:什么光,从哪来,什么色温
- 质感:胶片颗粒 / 高对比 / 低饱和 / 赛璐璐 / 厚涂……
不想自己组织?直接用模板,它已经把镜头、光线、质感写好,只留下需要你决定的几个空。 更细的写法见描述写法。
参数怎么选
- 先用 480p / 720p 试稿。构图和运动方向对了,再用 1080p 出终版,能省不少积分。
- 画幅按投放渠道定:短视频平台用 9:16,横屏内容用 16:9,需要电影感用 21:9。
- 锁定镜头适合产品展示、延时、固定机位口播;要运镜就别开。
- 随机种子:填相同的数字 + 相同的描述,可以复现同一画面,方便做 A/B 对比。
素材要求
- 图片:JPG / PNG / WebP,不超过 10 MB,边长建议 300–6000 像素,宽高比 0.4–2.5
- 视频:MP4 / MOV,不超过 100 MB,时长 30 秒以内
常见问题
画面里的人脸变形了
把景别拉大一点(远景里的脸本来就没有足够像素),或者改用参考图模式并提供正面清晰的照片。
动作幅度太小,几乎是静止的
描述里明确写出动作的方向和幅度,比如「向前走两步后转身」比「走动」有效得多。 另外确认没有误开「锁定镜头」。
生成结果和描述关系不大
描述太长且要素冲突时,模型会取舍。删掉次要的形容词,保留主体、动作、镜头三项,再逐步加。