如果给 AI 行业的一天排个序,今天(2026 年 7 月 24 日)几乎可以排进 2026 年最忙的日子之一。
8 条新闻,几乎涵盖了这个行业目前最核心的 4 条主线:模型迭代、Agent 产品化、Agent 基础设施、国产发力。它们不是分散在不同时间点发布——而是几乎在同一时段集中亮相,把整个 AI 圈的 2026 下半年节奏一起拉满了。
从影响面看,这 8 条里有 3 条是国际大厂的 Agent 基础设施级动作(OpenAI Presence / Cognition Devin Outposts / Google DeepMind Interactions API GA),有 3 条来自国内厂商的同日发布(DeepSeek V4 / 腾讯 Miora / 阿里 Qwen3Guard),剩下 2 条是模型和体验层面的硬升级(xAI Grok 4.5 / Hermes Agent v0.19)。
这篇综合稿把这 8 条串起来,让你一篇文章看完今天 AI 圈到底发生了什么。
一、时效头条:DeepSeek V4 全面替代旧接口,旧 chat/reasoner 今日停用
在 8 条新闻里,影响开发者最直接的一条是 DeepSeek V4 正式 GA——因为旧 chat / reasoner 接口今天就停用。
如果你还在用旧接口跑线上业务,今天的迁移窗口就是倒计时。DeepSeek 没有给「慢慢过渡」的余地,这种「GA 即停旧」的姿态,本身就说明了 V4 的成熟度,也说明 DeepSeek 已经把 V4 当作唯一的正式产品线。
具体看 V4 的产品形态。
双档模型:V4 Pro + V4 Flash
V4 Pro:面向复杂推理、长上下文、高难度任务,定位类似旧 reasoner,但推理深度和稳定性更强;V4 Flash:面向低延迟、高并发的常规对话与 Agent 调用,定位类似旧 chat,但响应速度和成本都更优。两档模型覆盖了从「思考」到「执行」的全部场景,开发者不再需要为不同任务切换多个模型。
自研 Harness 工具链
这才是这次发布的真正重头戏。DeepSeek 把过去一年散落在官方文档、开源项目、第三方教程里的 Agent 编排经验,打包成了一个完整的 Harness 工具链——涵盖 Agent 编排、工具调用、落地闭环 三大模块,也就是「Agent 怎么调度」「Agent 怎么用工具」「Agent 怎么真正跑通业务」三个核心问题。这意味着开发者不再需要自己手搓 Agent 框架,DeepSeek 直接给了一套官方参考实现。
迁移注意事项
旧接口今天停用,迁移到 V4 Pro/Flash 是必选项,不是可选项。接口签名、参数格式、调用方式都有调整,具体要查 DeepSeek 官方迁移文档。如果你的项目严重依赖旧接口的特性(比如 reasoner 的 thinking 字段),V4 Pro 的对应能力会更完整,Flash 会简化一部分推理过程。
💡 DeepSeek 这一步的真正信号不是 V4 本身有多强,而是它把「Agent 落地」这件事正式推到了模型厂商必须亲自做的位置。
(来源:DeepSeek 官方公告)
二、国产同日三连:DeepSeek V4 + 腾讯 Miora + 阿里 Qwen3Guard
今天国产 AI 厂商罕见地选择了「同日发布」——这本身就是一种竞争默契。三家分别从 基础模型 / 内容生产 / 安全护栏 三个完全不同的角度切入,几乎没有重叠,形成了一个完整的生态切片。
1. 腾讯 Miora:全量上线,定位「有记忆的 AI 创意智能体」
腾讯今天把 Miora 推到了全量上线阶段,定位是「有记忆、懂需求、多 Agent 协作的 AI 创意智能体」。
拆开看三个关键词。
有记忆:跨会话的状态沉淀。Miora 不像普通 Chatbot 那样「聊完即忘」,而是把用户的偏好、风格、历史决策沉淀下来,下次打开直接延续。
懂需求:对模糊需求的意图识别。用户不需要写 prompt 工程,Miora 会主动反问、补全需求,直到对齐。这种「反向确认」的设计,是腾讯从 C 端用户经验里提炼出来的——大部分普通用户最痛的不是「写不出好 prompt」,而是「不知道自己要什么」。
多 Agent 协作:不是单 Agent 写稿,而是策划 Agent、文案 Agent、配图 Agent、审校 Agent 协同工作。每个 Agent 专注一个环节,质量比单 Agent 一把抓更稳。
目标场景是内容生产——公众号、短视频脚本、营销文案、品牌内容。Miora 不是通用对话产品,它是腾讯针对「内容创作者」这个具体人群做的工具型 Agent。
2. 阿里 Qwen3Guard:Qwen 家族首款安全护栏模型
阿里今天发布的是 Qwen 家族的第一款安全护栏模型——Qwen3Guard。
这个发布标志着一个事实:当 Agent 真正进入生产环境,模型本身的能力反而不是最难的,安全护栏才是。
Qwen3Guard 的产品形态有两条线。
Gen 模式:对单次生成的内容做合规检测(输入检测、输出检测均可)。适合批量任务、脚本化流程。
Stream 模式:实时流式检测,边生成边判断风险等级,延迟在毫秒级。适合实时对话、在线客服、Agent 实时执行。
三尺寸:0.6B / 4B / 8B,覆盖从端侧到云端的不同部署需求。
- 0.6B:手机、浏览器插件、嵌入式设备
- 4B:边缘服务器、中小型企业本地部署
- 8B:云端高安全要求场景
为什么护栏模型突然变重要?因为 Agent 一旦接管业务操作,出错代价就不是「答错一道题」这么简单——可能是扣错款、发错邮件、删错数据。Qwen3Guard 把「检测 Agent 风险」做成了一个独立的、可插拔的模型层,而不是让主模型自己兼任。
3. DeepSeek V4:基础模型 + Harness 工具链
见第一节。DeepSeek 在国产三连里承担的是「基础模型 + Agent 框架」的角色——它和 Miora 的「内容生产工具」、Qwen3Guard 的「安全护栏」正好互补,三家在同一天形成了完整的「模型 + 应用 + 护栏」三角。
💡 国产 AI 的成熟标志不是「谁家模型最强」,而是「三家在不同生态位同时出新」——这种错位竞争远比同质化卷参数有意义。
(来源:DeepSeek / 腾讯 / 阿里云官方公告)
三、Agent 基础设施三连:OpenAI / Cognition / Google
如果说国产三连是「应用层密集上新」,那今天国际大厂的三个动作则是 Agent 基础设施层的集中成型。
1. OpenAI Presence:企业级语音/聊天 Agent 产品化
OpenAI 这次发布的 Presence 是一个完整的企业级 Agent 产品线,而不是单纯的 API 或模型。
关键能力有四个。
封装护栏:内置安全规则、敏感词、行为边界,企业不需要自己造轮子。
审批工作流:Agent 在执行敏感操作前自动触发人工审批(比如转账、发外部消息、改数据库)。审批不是「一刀切」,而是基于操作类型、金额、历史行为智能判断。
仿真评估:在 Agent 上线前用仿真环境跑大量场景,提前发现边界 case。这个能力对企业尤其重要——以前 Agent 上线就是「赌运气」,现在可以先在仿真环境跑几万条测试用例。
Codex 持续改进环:Agent 出错后,Codex 自动分析失败案例、生成改进补丁,形成一个「部署 → 监控 → 改进」的闭环。这意味着 Agent 不再是「上线即固化」的产品,而是「越用越好」的系统。
最值得关注的是这个数据:OpenAI 自有电话线已经用这套系统自助解决了 75% 的入站问题。
这意味着什么?意味着 Agent 不再是「辅助人类」的工具,而是直接接管一线服务的执行者。75% 这个数字是行业的一个重要分水岭——大部分企业的客服自动化率还在 30-50%,OpenAI 直接把天花板抬到了 75%。
2. Cognition Devin Outposts:编码 Agent 下沉到客户自有机房
Cognition 今天把 Devin 推到了一个新的阶段——Outposts Alpha,核心变化是执行层从云端下沉到客户自己的硬件。
具体支持的下沉目标有三种环境:Modal(无服务器 GPU 平台)、Devbox(容器化开发环境)、macOS M 系(苹果 Silicon 芯片 M1/M2/M3/M4)。
架构上,Cognition 做了一个清晰的拆分:
- 执行层(写代码、跑测试、部署)→ 客户自有机房/GPU
- 规划推理层(理解需求、拆任务、决策)→ 留在云端
这种「混合架构」解决了编码 Agent 的两个核心痛点。
数据安全:代码不进公有云,在客户环境里执行。对金融、医疗、政府这类行业来说,这是用 AI 编码的前提。
成本控制:推理贵的部分(规划)云端跑,执行便宜的部分本地跑。企业不用为整个 Devin 流程买单,只为推理付费。
对企业客户来说,Devin Outposts 意味着 AI 编码第一次可以走进代码保密要求严格的行业。
3. Google DeepMind Interactions API 正式 GA
Google 今天把 Interactions API 推到了 GA(General Availability),这是 Gemini 模型对外能力的统一入口。
Interactions API 把过去散落在多个接口的 Gemini 能力整合到了一起。
- 统一模型调用:不同 Gemini 模型(Pro/Flash/Lite 等)走同一套 API
- 托管 Agent:Google 直接提供可用的 Agent 模板,企业可以基于托管 Agent 二次开发
- 后台执行:长时间任务可以在后台异步跑,不阻塞前端
- 工具组合:把多个工具(搜索、计算、文件读取、第三方 API)组合成一个统一的工具集
- 多模态:文本、图像、音频、视频统一处理
同步升级:Managed Agents 和 Deep Research 在 Interactions API 里都有增强。Deep Research 是 Google 的「深度研究 Agent」产品,这次升级让它能调用更多工具、生成更长的研究报告。
💡 今天这三家国际大厂的共同点是:不再比模型本身,而是比「Agent 能不能真正进入企业生产环境」——Presence 给流程、Devin Outposts 给环境、Interactions API 给接口。
(来源:OpenAI / Cognition / Google DeepMind 官方公告)
四、模型与体验:xAI Grok 4.5 + Hermes Agent v0.19
最后两条新闻集中在模型能力和用户体验层面,是另外两个独立的看点。
1. xAI Grok 4.5 全平台推送
xAI 今天把 Grok 4.5 推到了全平台同步上线——iOS、Android、网页、X 端同时推送,这是 Grok 系列第一次做到「四端同时」。以前 Grok 的更新常常是「先 X 端、再网页、最后移动端」,这次统一推送,说明 xAI 在产品节奏上更成熟了。
Grok 4.5 的核心升级有四项。
长对话记忆:可以保持更长的对话上下文不丢信息。对长会议、长咨询这类场景特别有用。
意图跟随:用户中途切换话题、改需求,Grok 能跟上而不是「卡在原问题」。这个能力在 2026 年已经是 Agent 的标配,但各家实现差异很大,Grok 4.5 把这点作为重点升级说明它在真实用户场景里看到了痛点。
编程能力:代码生成、debug、解释三件套都做了增强。xAI 在编程赛道一直对标 Claude Code,Grok 4.5 是这一轮的回应。
长上下文:支持更长的输入和输出,适合处理长文档、长对话。
xAI 给 Grok 4.5 的官方定位是 「当前最聪明 Grok」——这种「最聪明」的措辞,在 2026 年的 AI 行业已经不是简单的营销话术,而是要拿出实打实的 benchmark 和真实场景效果才能站得住。
2. Hermes Agent v0.19「Quicksilver」+ Nous 15 亿融资
Nous Research 今天发布的 Hermes Agent v0.19 有一个非常硬核的代号——Quicksilver(水银,寓意「快如闪电」)。
核心升级有四项。
首词延迟降约 80%:用户发完消息到看到第一个字的等待时间,直接砍掉 80%。这是一个对体验影响极大的优化——以前的 Agent 普遍有 1-2 秒「冷启动」感,Quicksilver 把这个延迟压到了 200-300ms 量级,体感接近「真人在打字」。
默认智能审批:Agent 在执行敏感操作前不再每次都弹确认框,而是基于历史行为智能判断「这个操作是否需要审批」,常用操作自动放行,陌生操作才需要确认。这个设计在「安全」和「流畅」之间找到了一个更优的平衡点。
子代理后台持久执行:可以派生多个子 Agent 在后台持续跑,主 Agent 不阻塞。这个能力让复杂任务的并行处理成为可能。
跨会话技能沉淀:学到的技能、会话里的偏好,跨 session 保留,下次直接用。这意味着 Agent 开始有自己的「长期记忆」和「成长曲线」。
配套消息:Nous Research 传出以 15 亿美元估值进行新一轮融资。这个估值在独立 AI 研究公司里属于头部水准,也说明市场对 Hermes Agent 的商业前景认可。一个 15 亿估值的独立研究公司,在巨头夹击的 AI 行业里能跑出来,本身就是对「开源 + 商业化」路径的一次验证。
💡 Hermes Quicksilver 真正的信号不是「首词延迟降 80%」这个性能数字,而是「跨会话技能沉淀」这个产品哲学——Agent 开始有自己的「长期记忆」和「成长曲线」了。
(来源:xAI / Nous Research 官方公告)
五、今日三大趋势:基础设施成型、错位发力、体验为王
把 8 条新闻放在一起看,可以提炼出 2026 下半年 AI 行业的三个清晰趋势。
趋势 1:Agent 基础设施正在从「概念」变成「产品」
OpenAI Presence、Cognition Devin Outposts、Google Interactions API GA,这三件事加在一起意味着 Agent 已经有了完整的「产品栈」——上层有交互界面、中层有编排逻辑、下层有执行环境。今天之后,「能不能跑 Agent」不再是技术问题,而是「选哪一套产品」的商业问题。这个转变对企业 CIO 来说尤其关键——以前评估 AI 项目是「找团队做 PoC」,现在是「选厂商比对产品」。
趋势 2:国产 AI 从「卷参数」转向「错位生态」
DeepSeek V4(基础模型 + Harness)、腾讯 Miora(内容生产 Agent)、阿里 Qwen3Guard(安全护栏)——三家选择了完全不同的生态位。这种错位说明国产 AI 已经过了「谁家跑分高就赢」的阶段,进入了「看谁能在产业链里卡到独特位置」的新阶段。对开发者来说,这种错位其实是好事——可以同时用三家的产品而不冲突,形成国产 AI 工具栈。
趋势 3:体验成为新的竞争点
Grok 4.5 全平台推送、Hermes 首词延迟降 80%、OpenAI 75% 入站自助解决——这些数字背后是同一个信号:模型之间的能力差距在缩小,体验差距在放大。当 GPT-5、Claude 4、Gemini 2.5、Grok 4.5、DeepSeek V4 在 benchmark 上的差距已经收敛到个位数百分点,真正能拉开差距的就是「用户用起来爽不爽」。谁能给用户更顺畅的交互、更智能的审批、更快的响应,谁就能在下一阶段胜出。
💡 今天这 8 条新闻不是「AI 圈一天的信息」,而是「AI 圈 2026 下半年方向的一次集中预告」——Agent 基础设施成型、国产生态分化、体验成为新护城河。
(综合来源:DeepSeek / 腾讯 / 阿里云 / OpenAI / Cognition / Google DeepMind / xAI / Nous Research 官方公告)




我要评论