一场两小时的会议开完,最痛苦的不是开会本身,是整理纪要。
录音听一遍要两小时,边听边打字要四小时,中间还得反复倒回去听清某句话。采访、播客、课程、客户沟通——凡是涉及「把说的话变成文字」的场景,都在吃这份苦。
8 月 26 日,Google DeepMind 发布了 Gemini 3.5 Transcribe,官方称它是目前最精准的语音转文本模型。我们来看看它到底强在哪,以及普通人能怎么用。
一、先看硬指标
语音转文字最核心的指标是词错率(WER)。Gemini 3.5 Transcribe 的成绩是:非流式 2.6%,流式 4.0%(Artificial Analysis 评测口径)。
解释一下这两个数字的区别:非流式是拿到完整音频后再处理,准确率更高,适合录音转写、字幕生成;流式是边说边出字,延迟低但准确率略降,适合实时字幕、语音输入。
2.6% 的词错率意味着什么?一段 1000 字的录音,错字大约 26 个,而且大多是同音字、专有名词这类小错。这个水平已经接近人工听打的可用线——不是「完全不用改」,而是「改一改就能交」。
速度上,官方数据是与上一代 Chirp 3 相比,转写出稿快 70%。
二、比「转得准」更重要的三件事
词错率只是及格线。真正决定「能不能直接用」的,是转完之后还要做多少手工活。Gemini 3.5 Transcribe 在这块给了三个能力:
自动去填充词。口语里的「嗯」「啊」「那个」「就是说」会被自动剔除。这一条看着不起眼,但凡整理过口述内容的人都知道,清理这些填充词能占掉小一半的编辑时间。
自动格式化与修正。转出来的不是一坨连在一起的文字,而是带标点、分段合理的文本,还会顺手修正一些明显的语病和断句错误。
最多 3 说话人区分 + 词级时间戳。这是会议场景的关键。3 人以内的小型会议,它能分清谁说了什么;词级时间戳则让你可以精确跳转到某句话对应的音频位置,回听核对时非常省事。
三、85+ 语言与数字精准
语言支持方面,官方口径是 85 种以上语言自动识别,不需要你手动指定语种——这对于多语言混杂的场景(比如中英夹杂的会议)很实用。
另一个容易被忽略但很值钱的细节:邮编、订单号这类字母数字混排的内容,识别精度做了专门优化。做客服、物流、电商的人应该懂这个痛点——普通转写工具最容易翻车的就是订单号,错一位数字整单就废了。
四、两种 API,两种用法
接入方式上给了两套 API,对应两类场景:
- Live API:流式处理,边说边出字。适合实时字幕、直播、实时会议纪要、语音助手。
- Interactions API:预录音频处理。适合录音文件转写、播客字幕、采访整理、视频后期。
另外官方预告,Chrome 浏览器即将支持在任意网页用语音打字。这条如果落地,日常写文档、填表单、回邮件的输入方式会再变一次——毕竟说话比打字快得多。
五、要如实说明的局限
三个限制需要提前知道:
第一,目前处于公开预览阶段,不是正式 GA 版本,能力和价格都还可能调整。
第二,多语言的准确率比英文的最佳成绩低约 2 到 3 个百分点(FLEURS 基准)。也就是说中文表现会略逊于它最好的英文水平,但整体仍处于第一梯队。
第三,说话人区分上限是 3 人。超过 3 人的大会、多人圆桌,它分不清谁是谁。
六、谁最该试试
按实用度排序:
- 经常开会的人:会议纪要是最标准的场景,3 人以内的小会效果最好,加个「提取待办事项」的后处理就能直接发群里。
- 做采访、播客、课程的:录音转稿 + 时间戳,回听核对的成本大幅下降,顺带还能把字幕一起出了。
- 重度文字工作者:语音写周报、写初稿,配合自动去填充词和格式化,比纯键盘输入省力。
- 做跨境内容、多语言场景的:85+ 语言自动识别,省去手动切语种的麻烦。
说到底,语音转文字这个赛道已经卷了很久,竞争点早就不是「能不能转出来」,而是「转完之后还要改多久」。Gemini 3.5 Transcribe 的价值,主要落在后半句上。
最后一个问题想问你:如果语音输入足够准、还能自动排版去废话,你会把多少文字工作从键盘换成嘴?评论区说说你最想用语音替代掉的那件活。
关注「AI 智习室」,每天一条看得懂的 AI 情报。