如果你从没用过语音转文字,这篇是给你写的。不需要懂 API,不需要装软件,读完你就能把「说话」接进自己的日常工作流。 我们从一件最烦的事说起:会议纪要。 一、先搞清楚它能替你做什么 语音转文字工具的定位很明确:它负责把声音变成文字,不负责替你思考内容。所以正确的用法不是「录完扔进去就完事」,而是把它当成流程里的第一道工序。 以 Google 8 月 26 日发布的 Gemini 3.5 Trans…
一场两小时的会议开完,最痛苦的不是开会本身,是整理纪要。 录音听一遍要两小时,边听边打字要四小时,中间还得反复倒回去听清某句话。采访、播客、课程、客户沟通——凡是涉及「把说的话变成文字」的场景,都在吃这份苦。 8 月 26 日,Google DeepMind 发布了 Gemini 3.5 Transcribe,官方称它是目前最精准的语音转文本模型。我们来看看它到底强在哪,以及普通人能怎么用。 一、…
字节发布原生音视频全双工大模型 SeedRealtime:边看边听边说,对话节奏问题减少约 50%,已在豆包 App 全量上线。
开完一场 40 分钟的会,最让人头大的往往不是会议本身,而是会后那堆需要逐字核对的录音转写稿——同音词错得离谱、方言一句都听不懂、背景一吵直接乱码。而就在 8 月 4 日,腾讯混元正式发布了新一代语音识别模型 Hy ASR 3.0 preview,把”逐字转写”升级成了”理解语境”,连耳语、方言都能处理。对天天和录音、字幕、语音输入打交道的打工人来说…