Gemini Omni 1.1 Flash 发布:AI 视频能续写到 40 秒,360p 草稿便宜 2/3,过稿再上 4K

Gemini Omni 1.1 Flash 发布:AI 视频能续写到 40 秒,360p 草稿便宜 2/3,过稿再上 4K

做 AI 视频的人,大概都经历过同一种无力感:抽了二十次,终于出来一条满意的镜头,但你没法让它「接着往下演」。

想让镜头再往后走两秒?只能重新生成,而新生成的画面里,人物的脸、衣服的颜色、光线的方向全都变了。AI 视频过去最大的问题不是画质,是不可控——你只能抽,不能改;只能重来,不能接续。

8 月 27 日,Google 发布的 Gemini Omni 1.1 Flash,就是冲着「可控」这两个字来的。官方给它的定性是 production-ready(可用于生产)的更新,核心不是把视频做得更炫,而是让开发者能像剪片子一样,一段一段地把它「续」出来。

一、从「一次性生成」到「可接续创作」

Omni 1.1 Flash 是 Gemini 视频生成模型的生产级版本,通过 Gemini API 在 Google AI Studio 提供,企业侧走 Gemini Enterprise Agent Platform。它的新能力可以概括成五条:场景扩展、首尾帧插值、360p 草稿模式、4K 输出、视频参考。我们一个一个说。

二、场景扩展:模型终于「记得住」前 10 秒

这是最核心的一条。以前你想给视频续一秒,模型基本只看最后一帧或最后一秒的画面,所以续出来的部分很容易漂移——人物变脸、光线跳变、道具消失。

Omni 1.1 现在能分析最多 10 秒的前置上下文,是此前模型的十倍。续写方式是按 10 秒一个增量往后加,单条视频累计最长可以到 40 秒。

官方演示里有一段很有代表性:给一个镜头连着下三条不同的指令——先做电影感的推拉变焦(dolly-zoom),再做快速机械推镜怼到角色眼睛,最后让时间静止、镜头绕角色 360 度环绕。三条指令是接续在同一段视频上的,角色、场景、光影保持一致。

技术上,这靠的是状态化的多轮交互:API 调用时传入 previous_interaction_id,模型就知道你是在哪一条视频上继续。对做自动化流水线的人来说,这一点很关键——意味着 Agent 可以先规划一串分镜,逐段生成、逐段评估,最后再统一输出成片。

三、首尾帧插值:把运镜的控制权拿回来

第二条是指定起始帧和结束帧,模型在两帧之间生成连续视频。

这解决的是「镜头怎么动」的问题。过去运镜基本听天由命,现在你给它两个关键帧,中间的过程它来补。官方列举的适用场景包括:复杂的相机环绕、变焦过渡、无缝循环片段。

对做短视频、做片头、做产品展示的人来说,这个能力的实用度比「生成得更清晰」高得多——因为它让镜头语言变得可设计。

四、360p 草稿:成本结构被改写了

第三条容易被忽略,但对预算敏感的人可能最重要:360p 草稿模式。

官方数据是,相比 Omni 1.1 标准的 720p,360p 的生成速度最高快 60%,成本只有三分之一。用途很明确——快速原型验证、分镜脚本迭代、高速渲染。

为什么这条关键?因为 AI 视频真正的成本浪费不在「最后成片那一版」,而在「废掉的那些版本」。以前每一次试错都是按成片价格付费,现在你可以用 1/3 的价格先把分镜跑通,确认没问题了再上高分辨率。

五、4K 输出与视频参考

成片阶段,Omni 1.1 可以直接输出 1080p 或 4K 的成品。这里要如实说明:官方的表述是 upscaling(超分),也就是说 4K 是通过放大得到的,而不是原生 4K 渲染。对细节要求极高的画面,超分可能引入瑕疵,专业流程里建议加一道人工验收。

另外一条是视频参考:构建场景时可以引入参考视频片段(官方口径为最长 3 秒),用来保持画面的上下文背景与角色一致性。简单说,你可以拿一小段已有素材当「锚」,让新生成的内容贴着它走。

六、多少钱

按官方与国内媒体披露的定价(美元原价 + 折算人民币):

  • 360p:0.03 美元/秒(约 0.2 元人民币)
  • 720p:0.1 美元/秒(约 0.67 元)
  • 1080p:0.15 美元/秒(约 1 元)
  • 4K:0.3 美元/秒(约 2 元)

换算一下:一条 20 秒的 720p 视频,API 成本大约 13 元人民币。如果你走「360p 跑分镜 + 720p 出成片」的流程,实际花费还能再压一截。

七、谁已经在用,以及限制在哪

集成方面,Adobe 已把它整合进 Firefly 做视频编辑,Figma Weave 用它辅助镜头调度,Runway 用它提升从灵感到成片的流转效率。订阅侧,Google AI Plus、Pro、Ultra 用户现在可以在 Google Flow 里用到 Omni 1.1,场景扩展能力也在 Gemini app 上线。

限制要说清楚三条:单条视频累计上限 40 秒,长内容需要自己做拼接;4K 靠超分而非原生;预览版端点 gemini-omni-flash-preview 已被 GA 版本取代,还在跑预览版的开发工作建议尽快迁移。

八、这件事的真正意义

把这几条能力串起来看,Google 其实在把生成式视频从「一次性的创作玩具」改造成「可编程的生产组件」:先规划,再低成本试错,评估通过后上高分辨率,全程可以靠 API 串起来、不需要人在中间点确认。

对普通创作者来说,短期最实在的变化是——视频的成本大头从「试错」转移到了「成片」,而试错恰恰是过去最花钱的部分。40 秒的长度上限决定了它暂时还做不了长片,但做短视频素材、广告分镜、产品演示、创意预演,这套流程已经能跑通了。

最后一个问题:如果 AI 视频的成本降到一条几毛钱、镜头还能一段段续着设计,你觉得最先被改变的是哪个行业?广告、短视频、还是影视前期?评论区聊聊。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

发表评论