2026 年 7 月 16 日,Google 在 Workspace 旗下的 AI 视频编辑产品 Google Vids 上线了两项关键更新——Gemini Omni 模型驱动的自然语言视频编辑能力,以及全新的「个人 AI 分身」(Personal Avatars)功能。后者允许用户通过上传一张自拍和一段短语音,生成一个外观与声音都与本人相似的数字分身,直接根据用户输入的文字脚本「讲话」,整个过程无需本人录制。这一更新距离 Vids 第一次接入 AI 能力(2025 年 4 月)已经过去了一年多,也是 Google 在消费级 AI 视频分身赛道上对标 Zoom 等竞品的正式回应。
两项更新的落地,把 Vids 从「可以用 AI 但仍然要本人出镜的 AI 视频编辑器」,推进到了「本人可以完全不出镜」的下一个阶段。对于经常需要做产品演示、培训视频、客服讲解、季度汇报等内容的从业者,这一改变意味着他们的视频内容生产成本,可以从「写脚本 + 录制 + 剪辑」的完整链路,压缩到「写脚本 + 选一段自拍」这一极致简化的链路。
一、Google Vids 是什么:Workspace 旗下的 AI 视频编辑器
Google Vids 是 Google 在 2025 年 4 月正式发布的 AI 视频编辑应用,定位为 Workspace 协作套件的「视频方向」组件——与 Docs、Sheets、Slides 形成并列关系。它的核心使用场景,是让用户在 Google 生态内完成「写脚本 → 选素材 → 拼装 → 配音 → 输出」的视频内容全流程,而无需打开 Premiere、Final Cut 等专业视频编辑工具。
Vids 在 2025 年的早期版本里,就已经集成了多项 AI 能力:AI 故事板(storyboard)建议、AI 配乐、AI 配音、字幕自动生成等。但这些 AI 能力都集中在「辅助编辑」层面——它们让编辑过程更高效,但视频中需要出现的「人」,依然需要真人出镜。
2026 年 2 月,Vids 进一步接入了 Google 的视频生成模型 Veo 3.1,允许用户直接在 Vids 内通过文本提示生成视频片段。但 Veo 3.1 解决的是「无中生有生成视频片段」的问题,而不是「让本人出现在视频里而不需要录制」的问题。后者正是这次 7 月 16 日上线的「个人 AI 分身」要填补的空白。
从产品定位看,Vids 是 Google 在消费级视频创作工具赛道对 Microsoft Copilot、Canva、Synthesia、HeyGen 等对手的正面回应。它的差异化优势在于「深度集成在 Workspace 生态内」——用户可以用 Slides 做演示、用 Sheets 拉数据、用 Vids 做配套视频,整个流程不需要切换到任何外部工具。Gemini Omni 与 Personal Avatars 的加入,则进一步把 Vids 的能力边界从「辅助编辑」推到「全自动生成」。
二、个人 AI 分身:从预设到定制的关键升级
Personal Avatars 是这次更新中最具用户感知度的功能。它的使用流程极其简洁:用户上传一张自拍照片、一段 15 秒左右的语音样本,然后在 Vids 中输入希望分身「讲」的文字脚本——分身就会以用户的形象与声音,把这段文字以视频的形式讲出来。整个流程不需要本人出镜、不需要本人录像、不需要任何后期合成能力。
这一能力相比 Vids 之前已经提供的「预设分身」是一次量级跃迁。Vids 在 2025 年下半年推出过 12 个预设 AI 分身,每个分身有不同的外观与音色,用户可以选一个与自己形象接近的分身来代替自己出镜。但预设分身的局限非常明显:它不是「你」,而是一个长得像某个标准角色的「替身」,在涉及个人表达、品牌一致性、人设真实性的场景里,预设分身往往不能让人满意。
Personal Avatars 把这个限制彻底消除——它把分身的「外观 + 声音」两个维度,都从预设切换成了「基于用户自己上传」。这意味着每一位 Vids 用户都可以拥有一个专属于自己的数字分身,这个分身与本人在视觉与听觉上都高度相似,但又完全不需要本人在镜头前出现。
这种「分身即本人」的体验,在过去几年里一直是 Zoom、HeyGen、Synthesia 等专业 AI 视频工具的主打卖点,但它们大多需要付费订阅、API 集成或额外的渲染时间。Google 把同样的能力直接嵌入 Workspace 主力的 Vids 中,并且把它与 Gemini Omni 的自然语言编辑能力捆绑发布,意味着这个能力从今天开始就进入了数亿 Workspace 与 Google AI Pro/Ultra 用户的日常工具箱。
从产品逻辑上看,Personal Avatars 解决的是三类典型用户痛点:第一,需要频繁录制产品演示、销售讲解、客服视频的从业者,这些内容重复度高但每次都得出镜;第二,内敛、不愿意或不便出镜但又必须以「人」的形象出现的内容创作者;第三,跨国团队里语言与时区差异显著、无法集中录制的协作场景,每个成员都可以在自己的分身里讲同一个产品的不同语言版本。
三、Gemini Omni:自然语言编辑视频
Gemini Omni 是 Google 在 Gemini 系列里专门面向「视频内容生成与编辑」的模型,这次被首次集成进 Vids。它为 Vids 用户带来了两个层面的新能力。
第一个层面是从文本生成视频。用户可以用自然语言描述一个场景,Vids 会在 Gemini Omni 的驱动下生成对应的视频片段;用户也可以同时提供一张参考图(产品照片、概念草图等),让 Gemini Omni 把文本描述与参考图融合,生成更贴近用户意图的视频片段。这一能力是 Veo 3.1 的升级版——它在「理解自然语言描述」与「融合多种输入」上做了更深入的优化。
第二个层面是自然语言编辑已有视频。Gemini Omni 支持「逐步编辑」(step-by-step edits):用户可以上传一段已经存在的视频(无论是 Vids 生成的还是自己拍摄的),然后通过自然语言指令对视频做修改——例如「把背景换成日落」、「把灯光调暖一点」、「把第二段的速度放慢」。这种逐步编辑能力,意味着用户可以在不重做整段视频的前提下,针对具体不满意的地方做精细调整。
「逐步编辑」是 Gemini Omni 这次更新里最具实用价值的能力。在过去,AI 生成视频的最大痛点不是「生成」本身,而是「生成之后无法细调」——要么接受完整输出,要么重新生成。Gemini Omni 的逐步编辑能力,相当于给 AI 视频生成引入了一个「精细打磨」环节,大幅提升了 AI 生成视频的可控性与实用性。
Gemini Omni 的另一层价值,在于它把 Vids 从「单点工具」升级为「创作工作流」——用户可以在 Vids 内完成「构思 → 生成 → 编辑 → 输出」的全流程,而不需要把素材导出去做后期处理。这种端到端的能力整合,会让 Vids 在与其他 AI 视频工具的竞争中,获得显著的「工作流完整性」优势。
四、可用范围与限制:订阅、年龄与地区
Personal Avatars 与 Gemini Omni 这次的发布,采用了一个相对克制的可用性策略。
首先,这两个功能只向 Google AI Pro / Ultra 订阅用户 与 Google Workspace 企业客户 开放。这意味着普通 Google 账户与 Google AI 免费用户,暂时还无法使用这两个能力。Google 显然把 AI Pro / Ultra 当作「个人高级订阅」的主战场,试图用更强的 AI 能力去拉动高价值订阅的转化。
其次,Personal Avatars 明确限制为 18 岁以上用户,且仅在部分地区可用。这一限制反映了 Google 对「数字分身可能被滥用」的警惕——未成年人的形象被做成可被任意脚本驱动的 AI 分身,在伦理与法律上都存在显著风险。
第三,Personal Avatars 绑定了用户的 Google 账号,且严格限制为「本人 likeness」——这意味着用户只能为自己创建分身,而不能上传别人的照片来生成对方的分身。这条限制堵住了「伪造他人形象」的滥用路径,但同时也对「企业批量为员工创建分身」的场景带来一定限制。
第四,Google Vids 本身有一个「免费版」正在向所有用户开放,但免费版不含任何 AI 能力——这与 Microsoft 把 Copilot 全面铺开的策略形成对比。Google 选择了「AI 能力作为高级订阅的差异化卖点」路径。
这一可用性策略背后,是 Google 在 AI 能力商业化上「既要拉动订阅、又要控制滥用风险」的双重考量。从企业用户的角度看,这种克制是有利的——它意味着 Personal Avatars 在被大规模部署时,会有清晰的合规边界;从个人用户的角度看,这种克制也意味着 AI 视频分身距离「人人可用」还需要一些时间。
五、透明度设计:SynthID 水印的强制嵌入
Google 在这次更新里,特意强调了「透明度」(transparency)的设计——每个由 Vids 生成的视频,都会嵌入不可见的 SynthID 数字水印。这个水印的用途,是在事后可以验证某个视频是否由 Google AI 生成,而不影响视频本身的播放体验。
SynthID 是 Google 内部已经推进多年的「内容溯源」技术,过去主要应用于图像生成。把它扩展到视频生成领域,意味着 Google 在「生成式 AI 内容标识」这件事上,走到了行业前列。
这一设计选择的背后逻辑有两层。
第一层是合规层。全球多个主要市场已经在讨论或已经出台针对 AI 生成内容的标识法规——欧盟 AI Act 的相关条款、中国《生成式人工智能服务管理暂行办法》、美国部分州针对 deepfake 的立法,都要求 AI 生成内容必须带有可验证的标识。Google 在产品层面默认嵌入 SynthID 水印,等于把合规义务直接做进了产品功能里。
第二层是信任层。当 AI 生成的视频越来越多地进入公共传播渠道,社会对「这段视频是真是假」的辨识需求会越来越强烈。SynthID 这种不可见但可验证的水印,是目前最有可能被业界共同接受的「内容溯源」技术方案之一。Google 把 SynthID 作为 Vids 的默认配置,等于在用户层面也建立了「Google AI 生成的内容都是可溯源的」这一基础信任。
对于中国市场的从业者来说,SynthID 水印的强制性也意味着:如果未来国内视频平台对 AI 生成内容有类似要求,Google 的技术方案可能成为参照标准之一。
六、行业对比:Zoom、HeyGen 与 Microsoft 的类似路径
Google Vids 的这次更新,放到 AI 视频分身的行业地图上看,是一场「主流厂商入场」的标志性事件。
Zoom 在 2024 年就已经推出了「AI 头像」能力——用户可以创建自己的数字分身,在 Zoom Clips 等场景里代替本人出镜。Zoom 的优势在于「与企业视频会议场景深度绑定」,但局限是「只能在 Zoom 生态内使用」。
HeyGen 与 Synthesia 是这个赛道里的两家代表性创业公司。HeyGen 主打「多语言数字分身」,在跨境营销视频场景里占据显著份额;Synthesia 则更偏 B 端,深度服务于企业培训、内部沟通等场景。这两家公司的产品形态与 Google Personal Avatars 高度相似,但它们是独立的 SaaS 产品,需要额外的订阅与工作流集成。
Microsoft 的路径则更激进——它在 Microsoft 365 全家桶中嵌入了 Copilot 的 AI 能力,但 Microsoft 暂时没有推出与 Personal Avatars 完全对等的「本人数字分身」能力。Microsoft 在视频内容创作上更多依赖 Clipchamp 与 Designer,与 Vids 在 Google Workspace 中的位置相当。
Google 的入场改变了竞争格局的几个关键变量:第一,AI 视频分身从此进入了 Workspace 与 Google AI Pro/Ultra 这两个亿级用户群的工具箱;第二,Gemini Omni 的自然语言编辑能力,把 AI 视频生成的「可用性」抬到了一个新的水位;第三,SynthID 水印的默认嵌入,可能成为整个行业的内容溯源标准。
对 HeyGen、Synthesia 这类专业玩家来说,Google 的入场既是压力也是机会——压力在于 Workspace 用户从此不必再额外购买独立 SaaS;机会在于这些专业玩家可以在更垂直的场景(如多语言、高度定制化、品牌一致性等)上继续深耕。
七、挑战与未来:滥用、真实性与就业冲击
Personal Avatars 与 Gemini Omni 虽然带来了显著的效率提升,但也引出了几个不容忽视的挑战。
第一个挑战是滥用风险。即便 Google 已经把 Personal Avatars 限制为「仅本人 likeness」,这一限制本身也只能由用户自律来执行——技术上完全可能存在「绕过验证」的方法。AI 视频分身的滥用场景包括伪造他人讲话、虚假新闻、企业诈骗等。Google 把 SynthID 水印作为强制嵌入是关键的防御手段,但水印本身只能事后验证,无法实时阻止滥用。
第二个挑战是真实性的边界。当企业高管、专家学者、政府官员都可以用 AI 分身代替本人出镜,社会对「这个人是否真的说过这段话」的判断会变得困难。即使有 SynthID 水印,普通观众也很少会去主动验证每段视频的水印。这意味着 AI 视频分身的普及,会在公共传播领域引入一种新的「视觉真实性贬值」。
第三个挑战是对就业市场的冲击。AI 视频分身最容易替代的,是那些「需要频繁出镜但内容重复度高」的视频内容生产岗位——例如产品讲解视频、培训视频、客服讲解视频等。这些岗位的从业者,可能会在 AI 视频分身普及后,面临工作内容与岗位定位的重新调整。
第四个挑战是跨境合规的差异。Google 把 Personal Avatars 限制为「部分地区可用」,反映了一个现实:不同国家与地区对 AI 视频分身的合规要求差异巨大。在某些市场可以随时上线的能力,在另一些市场可能需要等待专门的合规审核通过。
从更宏观的视角看,Google Vids 这次的更新是「AI 视频创作平民化」过程中的一个重要节点——它让普通用户也可以在主流办公软件内,完成原本需要专业团队才能完成的视频内容生产。但这个节点的另一面,是社会需要同步建立对 AI 生成内容的辨识能力、监管能力与伦理共识。这两件事的推进速度,会决定 AI 视频分身在未来几年里,究竟是会成为一个高效的生产力工具,还是会成为新一轮虚假信息泛滥的入口。




我要评论