AI 视频生成
先选工作流,再选产品。文生视频、图生视频、把已有片段继续写下去,需要的能力和工具并不相同。
AI 视频生成已经能从文本、关键帧或已有片段做出短镜头,有的产品还能同步生成对白和环境声。它适合概念预演、短内容草稿和镜头试验,而不是替代拍摄、调色、声音设计和发行。
选型时更有效的问题是:你的输入是文字、静帧还是成片?要不要对白?要多长、要不要在同一个产品里剪?下面按这些环节整理当前仍可使用的工具与模型。
现在能做什么
常见能力包括:用一段描述生成短视频;把一张图做成有运动的镜头;指定起止关键帧;把已有视频继续往后写。部分模型开始把对白、口型和环境声放在同一次生成里。
仍然普遍存在的限制是:时长通常以秒计、物理和手部容易穿帮、角色跨镜头不一定稳、成片级调色和版权音乐仍要另做。把它当成「草稿机」比当成「自动导演」更符合现状。
先按工作流选,而不是先按品牌选
同一句「AI 视频」下面至少有四条路。混在一起比较,只会得到无法执行的结论。
- Text to Video:只有剧本或广告文案,要先看到镜头
- Image to Video:已有角色或产品静帧,要让它动起来
- Video continuation / Video to Video:已有片段,要延长、改风格或换镜头
- 带音频的生成:需要口播、对白或同步环境声,而不是后期另配
Text to Video
文生视频适合前期提案:先验证场景、运动和气氛,再决定要不要实拍或精修。提示应同时写清画面内容和运动,而不是只写形容词。
截至 2026 年 8 月,Runway 官方帮助中心将 Gen-4.5 作为当前文生视频与图生视频的重点模型,时长以秒计,具体计划与积分以官网为准。不要再把 Gen-3 Alpha 当成最新生成模型。
Image to Video
已有一张够清楚的静帧时,图生视频通常比纯文生更容易保住主体。提示应侧重运动、镜头和节奏,而不是把静帧里已经看见的内容再描述一遍。
Runway Gen-4.5 官方说明同时覆盖 Text to Video 与 Image to Video。Luma、Kling 等产品也提供从图像驱动运动的路径,具体比例、时长和队列以各自当前产品为准。
续写、编辑与一致性
「再长一点」和「再生成一条」不是同一件事。Black Forest Labs 的 FLUX 3 Video 官方文档把模式拆成文生视频、用关键帧钉住的图生视频,以及从已有片段继续写下去的 video continuation。它目前处于 Early Access,能力会变。
角色和场景一致性仍然是主要痛点。有的产品靠参考图或关键帧约束,有的靠在同一工作区里反复迭代。跨镜头保持同一张脸、同一件衣服,通常需要参考图工作流,而不是只靠更长的提示词。
音频方面:FLUX 3 Video 官方强调与画面同步的语音和环境声;Runway Gen-4.5 的帮助文档当前按无声视频生成来写控制项。需要口播时,不要默认所有视频工具都会出声。
Sora 现在处于什么位置
OpenAI 帮助中心写明:Sora 的网页与 App 体验已于 2026-04-26 停止;Sora API 计划于 2026-09-24 停止。它不再适合作为当前首选入口。
如果历史方案里还写着 Sora,应把它理解为已经结束的消费级产品和即将结束的 API,而不是 2026 年 8 月仍在推荐的视频工作流。
当前主要工具与模型
TodayAI 上可以继续从工具和模型页进入的,是仍有独立详情页的产品,而不是一份「最强榜」。
创作者工作区可从 Runway 入手,当前生成重点看 Gen-4.5。需要 API、关键帧或续写时,可阅读 BFL 的 FLUX 3 Video 文档(TodayAI 暂无单独的 FLUX 3 模型详情页)。Luma、Kling、Pika、Google Veo 等若你已在用,应回到各自产品页核对其当前模型名与配额。
- 先确认输入是文本、静帧还是视频
- 再确认要不要原生音频
- 最后才看品牌、积分和导出格式