先抛一个反直觉的事实:腾讯混元 8 月 28 日发布的 Hy4 preview,总参数 770B,每次推理只激活 49B,上下文 1M,API 输入定价 6 元每百万 token。
大,通常意味着贵。但这次是又大又便宜。中间的矛盾,靠一个叫 MoE 的架构给抹平了。
这篇不讲公式,只把三件事讲明白:MoE 稀疏激活到底省了什么、1M 上下文意味着什么、以及这次发布里真正值钱的那条信息是什么。
一、先理解「大」和「贵」为什么会绑在一起
传统的大模型是「稠密」的:不管你问它「今天天气怎么样」还是「推导一下这个物理公式」,它都会把全部参数从头到尾跑一遍。
这就像一家医院,不管你是来看感冒还是做心脏手术,都把全院所有科室的医生全部叫来会诊一遍。专业度确实高,但成本也高得离谱——绝大部分科室其实白来了。
所以长期以来,「模型越大」必然带来「单次推理越贵」。这就是过去大模型价格降不下来的结构性原因。
二、MoE 稀疏激活:把「全院会诊」改成「按需挂号」
MoE 是 Mixture of Experts 的缩写,翻译过来是「混合专家」。思路很朴素:把模型拆成很多个「专家」模块,每个专家擅长某一类问题,每次来一个问题时,只叫上真正相关的那几个。
对应到 Hy4 preview 的参数:总参数 770B 是它的知识总量,激活参数 49B 是每次实际干活的部分。49 除以 770,大约是 6.4%——也就是说,每处理一个 token,它只唤醒不到百分之七的参数。
这就解释了「又大又便宜」:知识储备按 770B 算(所以懂得多),算力开销按 49B 算(所以跑得快、成本低)。
当然天下没有免费午餐。MoE 的代价主要在工程上:你得先判断该派哪几个专家(路由机制),还得把 770B 的参数都塞进显存(省的是算力和时间,不是存储空间)。所以本地部署 MoE 模型,显存需求依然是按总参数算的。
三、1M 上下文:能装下什么
第二个数字是上下文长度 1M,也就是一百万 token。
换算一下:一百万 token 大约相当于几十万到近百万个汉字,粗略地说,是好几本中等篇幅的书、或者一个中型代码仓库的量级。
这对普通人的实际意义有两个:
第一,长文档不再需要切片。以前处理一份几百页的合同或一本书,得切成一段段分别喂进去,容易丢失跨段落的关联。现在可以整体塞进去,让它通读之后回答。
第二,跨文件任务变可行。腾讯在办公场景给的示例是:从 72 份文件里判断发票是否合规,从 3 份规章制度中找出当前生效的那一条,再据此甄别报销申请。这种「先跨文件检索、再按规则判定」的活儿,没有足够长的上下文是做不了的。
当然,上下文越长,推理开销通常也越高。这也是为什么「长上下文 + 低价格」同时出现,才值得关注。
四、成本账:6 元是怎么来的
把上面两条合起来算:49B 的激活量决定了单次推理的算力成本,MoE 的工程优化(比如算子融合、通信优化)进一步压缩开销,最终落到 API 定价上就是输入 6 元、输出 18 元、缓存命中 0.3 元每百万 token。
官方还提到一个数字:Hy4 preview 通过自主分析推理系统瓶颈、围绕算子融合与通信优化做多轮迭代,端到端吞吐相较基线提升了 31.8%,而且在不同上下文长度和并发度下都有稳定收益。这条数据很实在——吞吐提升直接反映在单位成本上。
五、真正的看点:模型开始参与「造自己」
前面讲的都是架构和成本,属于「参数层面」。这次发布里真正值得琢磨的,是另一条信息:Hy4 preview 在自身研发的全链路过程中发挥了实际作用。
具体是这么个闭环:模型提出方案 → 运行实验 → 根据结果继续迭代 → 实验产生的代码、日志和反馈进入下一轮探索。它参与优化的环节包括训练方法、数据策略、评估体系,甚至底层算子。
用一句话概括:它不只是一个被训练出来的产物,它开始参与训练自己的过程。
要如实说明的是,官方对这块的定性是「初步的递归自我改进闭环」——是雏形,不是已经成熟的自我进化。但方向比完成度更重要:如果这条路走得通,模型迭代的速度就不再只取决于人类工程师的数量。
六、科研侧的两个硬指标
顺带看两个能验证能力深度的数字:
- 结合 Hyra 模型,把三维 Blaschke-Lebesgue 这个百年经典问题的体积下界从 0.380799 推进到 0.41104,距离 Meissner 四面体猜想的最终证明只剩约 2% 的距离。
- 32,512 原子的磷脂双分子层分子动力学模拟,实现 2.02 倍加速,达到 54.9ms/step。
这两条普通人用不上,但它们是判断「这个模型的能力天花板在哪」的参考——能啃动这类问题的模型,处理常规生产力任务通常不会太差。
七、还有哪些没解决的问题
官方自己列出了不足:Hy4 preview 是早期版本,预训练与后训练仍有提升空间,已知问题包括复杂任务下的思考时间偏长。此外,腾讯内部盲测 2.99/4.00(对比 GLM 5.3 的 2.92 和 Kimi K3 的 2.94)属于自评口径,不等于第三方榜单排名。
按官方「preview 先行、正式版跟进」的节奏,正式版很快会来。自今年 2 月重建基础设施以来,混元大约每两个月迭代一次大版本——这个速度本身,也说明国产大模型的竞争已经进入什么阶段。
最后一个问题:你觉得大模型下一步会继续卷价格,还是转向卷「能不能真的替你干完一整件事」?评论区说说你的判断。
关注「AI 智习室」,每天一条看得懂的 AI 情报。