2026年7月底,智诊科技正式发布新一代医学大模型WiseDiag V3及全新升级的好伴AI。这一次升级的核心不是参数更大、分数更高,而是能力形态的根本转变:好伴AI从「能聊」升级为「能持续服务」。

通过模型、记忆、服务三大底层能力的同步跃迁,好伴AI正在将医疗AI从「单轮问答工具」推向「长期陪伴、主动组织、持续负责」的新阶段。这是一次技术路线的重新定调,也是一个行业拐点的到来。从此,模型不再只是一个知识引擎,而是成为能持续理解用户、对结果负责的「健康伙伴」。

一、凭什么是全球第一?标杆级评测成绩

WiseDiag V3在DoctorBench、MedBench、HealthBench、CMB-Exam等全球权威医疗AI评测中多次位列第一。在MedQA执业医师水平测试中取得93.6分,表现超越多款国际通用大模型。今年4月,德适生物发布的DoctorBench-LLM医学大语言模型榜单中,其V2版本就以77.0分位居前列,超过Gemini-3.1-Pro-Preview、GPT-5.4等国际模型。

更关键的是,在医疗场景零容错的要求下,WiseDiag V3将幻觉率控制在低于0.5%,远低于行业3%-5%的平均水平。报告解读准确率高达96.7%,面对紧急重症情况时模型能自动触发就医提示,坚守安全底线。

这样的成绩不是偶然的。它建立在智诊科技对医学AI的深度理解之上——医疗AI不只是把通用大模型搬到医院场景,而是要构建真正理解临床逻辑的专业引擎。

配图

二、从V2到V3:从「看得懂」到「会判断」

今年年初,智诊科技发布了WiseDiag V2。V2完成的一次关键升级,是让医疗AI从以文本问答为主,进一步具备对医学影像、报告、化验单和体征照片的多模态理解能力。它解决的是医疗AI「看得见、看得懂」的问题,为复杂医疗信息进入统一推理过程建立了底座。

但当模型真正进入家庭健康咨询和复杂病例分析时,仅仅「看懂信息」还不够。一个真实健康问题,往往同时涉及多个科室、既往病史、长期用药和不同时间点的检查结果。模型不仅要识别信息,还必须判断哪些线索更重要、哪些风险应优先排查,以及什么时候应该追问、什么时候必须保持谨慎。

因此,从V2到V3,WiseDiag的升级重点从「多模态认知」,进一步走向「综合医学判断与安全对齐」。

训练数据大幅扩充:医学继续预训练数据由800亿Tokens扩展至1000亿Tokens,覆盖科研、疾病、药学、标注问答、临床真实数据、规范、中医及书籍字典八大医学知识层。按整体数据规模换算,其中包括约27.5万篇论文、36万条优质医疗问答、25,200篇指南共识、2,360本医学书籍,并由50位医学专家参与监督对齐。

OPD多科室专家融合:WiseDiag V3在后训练体系中引入了OPD多科室专家融合与在线蒸馏机制。这一创新的训练方法,使得模型能够模拟多科室会诊的推理过程——当用户描述一个复杂症状时,模型会自动从内科、外科、影像科等不同专业角度进行交叉验证,最终给出综合判断。

慢思考推理引擎:模型通过医学思维链模拟「体征收集—鉴别诊断—治疗建议」的完整诊疗流程,能够准确区分「发烧38度三天」与「反复低热」等临床术语的细微差异,输出具备连贯性的深度临床洞察。

三、好伴AI:从「单轮问答」到「长期健康伙伴」

WiseDiag V3的发布,直接带来好伴AI的体验升级。它不再是一个随问随答的聊天机器人,而是一个具备持续服务能力的健康管家。

长期记忆网络:好伴AI搭载了多层长期记忆网络,能够记住用户的完整健康档案。从既往病史到用药记录,从体检报告到日常体征数据,模型在每次对话中都能调用历史信息,提供个性化的健康建议。这意味着用户不需要每次都从头描述自己的情况,AI已经「认识」你。

2000+专家数字分身:好伴AI目前已接入超过2000名专家的数字分身,复刻其诊疗逻辑与沟通风格。用户可以多时段在线咨询不同科室的专家分身,获得专业级的医学解释。这些数字分身不是简单的问答模板,而是基于真实专家的临床经验和诊疗风格构建的智能模型。

复杂报告解读:好伴AI能够精确解读各类医学检测单与最长两百页的复杂体检报告。注册用户数已突破百万,累计服务超千万人次。在实际应用中,曾出现AI预警急性肾结石的真实案例——模型在用户描述轻微腰部不适时,结合其既往尿检数据自动触发就医提示,最终确诊为早期肾结石。

四、开放平台:AgentOS赋能医疗机构

在个人用户端之外,智诊科技还推出了面向机构的医疗AgentOS平台。该平台结合MCP、Skill、OpenClaw、Harness等技术模块,支持医疗机构构建可配置、可追溯、可治理的医疗智能体。

配图

AgentOS的核心价值在于:机构无需从零训练医学模型,而是基于WiseDiag V3的能力底座,通过零代码或低代码方式快速搭建自己的智能体应用。无论是医院的智能导诊、体检中心的报告解读,还是药企的医学咨询,都可以在AgentOS上快速部署。

目前,协和、北大、交大、浙大等多所顶级医学院已申请试用AgentOS平台。这不仅验证了产品的技术可靠性,也体现了医疗行业对AI智能体落地的真实需求。

五、技术底座:底层创新支撑上层突破

WiseDiag V3的强大能力,建立在扎实的技术底座之上。其核心技术包括三大支柱:

Med-Embedding医学编码模型:这是智诊科技自研的医学语义编码模型,能够准确解析不同专业术语的细微差异。在医学领域,同一个症状可能有多种描述方式,不同科室对同一术语的理解也可能不同。Med-Embedding模型通过专门训练的医学语义空间,将这些差异统一映射到可计算的维度,确保信息解析的准确性。

慢思考推理引擎:不同于通用大模型的快速应答,WiseDiag V3的推理引擎采用分层推理策略。对于简单问题,模型快速响应;对于复杂病例,模型自动进入深度推理模式,模拟临床医生的鉴别诊断流程。这种「快慢结合」的推理策略,在保证用户体验的同时,不牺牲复杂病例的诊断质量。

多层长期记忆网络:记忆是医疗AI区别于通用AI的关键能力。WiseDiag V3的记忆网络分为短期对话记忆、中期病史记忆和长期健康档案三个层级,能够在保护用户隐私的前提下,实现跨会话的健康信息追溯。

六、国际对比:WiseDiag V3 如何超越 GPT-5.4 与 Gemini

在 DoctorBench 评测中,WiseDiag V3 的核心优势体现在两个维度。一是医学知识的深度覆盖:通用大模型虽然具备广泛的常识,但在面对中国真实的临床场景时,往往在术语理解、诊断路径和用药规范上存在偏差。WiseDiag V3 通过 1000 亿 Tokens 的专门医学语料训练,对 1.2 万种疾病和 40 万+诊疗路径实现了全覆盖,能够精确理解「心下痞满」「肝气郁结」等中医术语与西医诊断的对应关系。

配图

二是安全边界的严格把控。在 HealthBench 安全性专项评测中,WiseDiag V3 的「不建议自行处理」触发率比 GPT-5.4 高出近 40 个百分点,意味着它在不确定的情况下更倾向于建议就医,而非给出模棱两可的自行处理建议。这一设计理念源自智诊科技「安全第一」的核心原则——在医疗AI领域,保守比冒险更能保护用户的生命健康,而非给出可能存在风险的自行处理方案。对于医疗 AI 来说,「不乱说」比「说得多」更重要。

在 MedQA 执业医师水平测试中,WiseDiag V3 以 93.6 分超过 GPT-5.4 和 Gemini-3.1-Pro-Preview,这一成绩在国内医学 AI 领域具有标杆意义。它证明了通过垂直领域深耕,国产 AI 可以在专业维度实现对通用大模型的超越。

七、行业影响:医疗AI从「能聊」到「能干」

WiseDiag V3的发布,标志着中国医疗AI进入了一个新阶段。从技术路线来看,它证明了垂直领域大模型的正确方向——不是参数规模的军备竞赛,而是对行业场景的深度理解和服务能力。

在政策层面,工信部今年发布的《「小快轻准」数字化产品和服务培育指引(2026年版)》明确提出深化人工智能应用,鼓励产品向具备多模态感知、预测与自主执行的智能决策方向演进。WiseDiag V3的「能持续服务」形态,正是这一政策方向的最佳实践案例。

放眼全球,医疗AI正在成为各国AI竞争的重要赛道。中国医疗AI能在DoctorBench等国际权威评测中拿下全球第一,说明中国在AI+医疗这一垂直领域已经具备了世界级的竞争力。而好伴AI超过百万人注册、超千万人次服务的实际数据,则证明了中国的医疗AI不是停留在论文里的成果,而是真正进入了千家万户。

从产业角度看,WiseDiag V3的开辟了一条从「AI问答工具」到「AI健康伙伴」的产品演进路径。这条路径的关键在于:AI不仅要「知道答案」,还要「持续负责」。这不仅是技术能力的跃迁,更是产品理念的根本转变。

你准备好让你的健康档案有一个AI管家了吗?

参考来源:智诊科技官方发布、新智元报道、DoctorBench/MedBench公开评测数据、工信部政策文件。