什么是 GPT-Live-1
9 月 13 日,OpenAI 开放了 GPT-Live-1 的 API。它是一款”全双工”语音模型——区别于我们熟悉的”你说完、它再答”的轮次式对话,它能边听边说,持续处理进来的音频和要出去的音频,你可以随时插话、打断,像打一通真人的电话。
复杂的推理、搜索、调用工具这些重活,它交给后端的 GPT-6 Astra 去做,自己只负责”听和说”这一层。前后台分层,是它的设计思路。
和之前的语音模型差在哪
之前的 GPT-Realtime 是轮次式:你要等对方说完、停顿了,它才开始组织回答。GPT-Live-1 全双工之后,体验更接近真人——你中途纠正、追问,它立刻接上。
官方给出的 Full Duplex Bench 评测,比上一代 GPT-Realtime-2.1 提升了 30 个百分点。价格按分钟算:0.05 美元/分钟。
打工人能蹭到什么
- 会议记录:实时转写 + 自动总结,会开完要点就出来了,不用再会后花半小时扒录音。这点直接接我们整理的 AI 整理会议纪要场景,思路是一致的——把录音丢给 AI,拿回结构化纪要。
- 客服话术:小商家、个体户可以用它做自动应答、话术生成,把常见咨询挡在前面,省下盯屏的时间。
- 口语练习 / 访谈:需要练外语、做访谈的人,可以拿它当随时在线的陪练,打断纠错都顺。
现在能直接用吗
目前开放的是 API,开发者去接。同一天,HeyGen、Agora 就开源了基于 GPT-Live-1 的实时数字人、会议助手框架——也就是说,普通人最快是用上这些第三方产品,而不是直接在 ChatGPT 里点一个”语音助手”按钮。
和国内同类比,月之暗面的 Kimi、字节的豆包也都在做语音和会议方向;但 GPT-Live-1 这次主打的是”全双工 + 可打断 + 后台接强模型”,体验上限更高,代价是按分钟计费、且依赖开发者把它接进产品。
要现在追吗,还是再等等
如果你只是普通上班族,不用急着研究 API。真正的红利在”它进到你常用的工具里”那一刻——就像 Grok 进 Office、Kimi 进对话框那样。现在可以做的,是留意你常用的会议软件、客服系统什么时候接上这类语音能力,到时候直接开用,比自己搭一套省事得多。
两个提醒
- 按分钟计费,长会议、长客服会话成本要算清楚,别开着就忘。
- 涉及商业机密、个人隐私的会议,别随便接第三方语音服务,数据归谁要先看清。
结论
语音 AI 正从”你问我答”走向”陪伴式助手”。对打工人,最先落地的两件事很实在:开会少整理、客服少盯屏。等到它进到你常用的办公工具里,才是真正好用的时候。