你有没有遇到过这样的 AI 对话:你话还没说完,它抢着回答;你说完了,它又愣了半天才接话;旁边有人聊天,它还以为在跟它说话。这些”卡壳”问题,在 8 月 5 日字节跳动发布的新模型 SeedRealtime 上,被大幅改善了——官方评测显示,它的音视频对话节奏问题比传统方案减少了约 50%,而且已经全量上线豆包 App,普通用户今天就能免费体验。

SeedRealtime 是什么:AI 从”一问一答”升级到”边看边听边说”

过去和 AI 视频通话,大多是”级联系统”:先语音转文字,再让大模型理解,再转回语音,几个模块串联,延迟层层叠加,信息逐级损耗,对话体验像打电话打给了信号不好的地方。SeedRealtime 的不同之处在于,它用一套统一的端到端架构,把音频、视频和文本原生融合进同一个模型,能在连续的音视频流上同步完成感知、理解、决策与表达。

字节官方把它总结为三项核心突破:一是音视频联合理解,模型既能结合画面消除同音词歧义,也能看懂手势和指代;二是主动交互能力,发现画面状态变化(比如目标物体出现)会主动提醒,还能调用工具;三是流畅交互节奏,能分辨旁人闲聊和背景噪声,不会因为干扰误触发回应。

实测提升 50%:官方评测怎么说

端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半——”话未说完被抢断””话音已落却回应迟缓””被背景杂音与闲聊误触发”这类卡壳现象显著减少,单次对话能够顺畅完整交流的概率也有明显提升。

在官方演示的多个场景里,它的能力很直观:多人聚会中,它能识别不同人物身份并持续对应发言者;外国游客看不懂中文菜单和服务员介绍,它实时翻译讲解;在博物馆里,它能持续盯着画面,识别到指定文物后主动提醒;你操作咖啡机,它能根据画面变化实时纠错;在嘈杂的机场,它能区分你和旁人的对话,不被无关声音带偏。

3 步玩起来:豆包 App 今天就能体验

最关键的是,SeedRealtime 已经在豆包 App 全量上线,不需要申请、不需要付费,按下面三步就能用上:

  • 第一步:把豆包 App 更新到最新版本;
  • 第二步:在对话框中选择「打电话」功能;
  • 第三步:进入视频通话界面,开始和 AI 边看、边听、边聊。

官方项目主页是 seed.bytedance.com/seedrealtime,想了解技术细节的读者可以去看看。

对普通人和创作者意味着什么

对普通用户来说,这是 AI 交互形态的一次里程碑:从打字、到语音、再到”看着画面实时对话”,AI 终于开始像真人一样”看着你说话”。你可以拿它当随身的”第二双眼睛”——盯着文件讲重点、看着说明书帮操作、对着商品帮比价,都是现成的场景。

对内容创作者和开发者来说,信号更明确:字节率先把音视频全双工技术做到规模化落地,说明这个方向的技术门槛正在被快速拉平。接下来一段时间,国内各大厂大概率会集中跟进”实时多模态交互”能力,AI 对话产品会进入新一轮体验竞赛。

想体验的今天就可以去更新豆包了。你会用”边看边听边说”的 AI 做什么?评论区聊聊。


数据来源:字节跳动 Seed 官方博客(research.doubao.com,2026-08-05)、凤凰网科技、科创板日报/财联社、上证报·中国证券网、中华网(2026-08-05)。