只用 65% 训练数据逼近 Qwen3:扩散模型要翻盘?

只用 65% 训练数据逼近 Qwen3:扩散模型要翻盘?

大模型训练的「效率天花板」可能要被打破了。8 月下旬,中国人民大学高瓴人工智能学院李崇轩、文继荣团队联合蚂蚁集团,发布了一项重量级研究:首次系统刻画了混合专家(MoE)扩散语言模型的扩展定律,并据此从头训练出新一代扩散语言模型 LLaDA MoE v2——只用了 Qwen3 同规模约 65% 的预训练词元,就在多项基准上逼近甚至超越 Qwen3 的水平。

这是扩散语言模型路线的一个重要里程碑。但很多人第一反应是:扩散模型不是用来生成图片的吗?怎么还跟大语言模型扯上关系了?这篇文章就用大白话讲清楚:扩散语言模型是什么、这项研究为什么重要、以及「少用 35% 的训练数据」意味着什么。

一、先搞清楚:扩散模型不是只用来画图的

你可能知道 Midjourney、Stable Diffusion 这类文生图工具,它们背后的技术就是扩散模型——从纯噪声出发,一步步「去噪」,最终得到一张清晰的图。

但扩散模型的应用不止于图像。近两年,研究者开始把同一套思路用到「生成文本」上:不再像 ChatGPT 那样一个词一个词地往后预测,而是像「去噪」一样,从一堆混乱的 token 里逐步恢复出通顺的文本。这类模型就叫「扩散语言模型」。

它的潜在优势很诱人:训练更高效、推理可并行、生成过程更可控。相比目前主流的自回归模型(一次只能吐一个词),扩散模型理论上能一次性生成整段内容,在效率和灵活性上有想象空间。但过去它的实际效果一直追不上自回归路线——直到这次研究。

二、这项研究做了什么:第一次把「扩展定律」画出来

这项研究最有价值的贡献,不是单纯发布一个更强的模型,而是首次系统刻画了「混合专家扩散语言模型」的扩展定律

「扩展定律」是 AI 领域的一个核心概念:它回答「数据和参数加到什么规模,模型能力会怎样增长」这类问题。过去几年,自回归模型的扩展定律已经被研究得很透——所以 OpenAI、Google 们敢大手笔堆数据、堆算力,因为知道「大力出奇迹」有规律可循。而扩散语言模型这边,一直缺少这样一张「地图」。

团队这次把扩散模型的「扩展地图」画了出来,然后照着地图,从头训练了 30B-A3B 参数的 LLaDA MoE v2(总参数 30B、激活约 3B)。结果相当能打:

数据效率:只用了 Qwen3 同规模约 65% 的预训练词元,就在多项基准上逼近 Qwen3 的水平——相当于别人学 10 本书,它看 6.5 本就能考出差不多的分数。

推理与代码:在 7 项推理和代码基准中,超越现有所有领先的扩散语言模型。

对 AI 行业来说,这意味着「扩散语言模型」这条路线,从「实验室玩具」迈向了「真正可竞争的路线」——而且它可能比自回归路线更省数据、更省算力。

三、为什么说「少用 35% 训练数据」是个大事

在大模型行业,算力和数据就是钱。OpenAI、Anthropic 们动辄百亿级的训练成本,其中很大一部分就是买数据、买算力。如果扩散语言模型能实现「同样效果、少 35% 的数据」,这意味着:

训练成本显著下降。数据获取、清洗、标注,以及对应算力的开销,都按比例减少。这对预算有限的研究机构和中小团队尤其友好——他们可以用更少的钱训练出接近一线水平的模型。

「数据墙」问题有了新解法。业界有个共识:高质量文本数据快被用完了。当数据不够用时,谁能用更少的数据训练出更强的模型,谁就掌握了下一个时代的入场券。扩散模型的高数据效率,正好打在「数据墙」这个痛点上。

国产模型路线的又一注脚。这次研究是中国高校(人大高瓴)+ 中国科技公司(蚂蚁集团)的合作成果,也说明在「如何更高效地训练大模型」这个底层问题上,中国团队已经有能力做出前沿贡献。

四、冷静看:扩散语言模型要「翻盘」了吗

要泼一点冷水:这项研究是重要里程碑,但扩散语言模型距离「全面取代自回归」还很远。目前的优势主要体现在数据效率和解码灵活性上,在综合能力、生态成熟度、工程工具链上,自回归路线仍然领先。扩散模型更多是「并行存在、逐步逼近」的竞争者,而非立刻的颠覆者。

但对 AI 学习者来说,理解这条路线很有价值——因为它代表了大模型发展的一个重要方向:当数据和算力的增长遇到瓶颈,效率优化就是下一个主战场。谁能用更少的资源训练出更强的模型,谁就站在了下一轮竞争的优势位置。

「只用了 65% 的数据就逼近 Qwen3」——这个数字背后,是扩散语言模型从理论走向工程的证明,也是大模型行业从「堆资源」走向「拼效率」的缩影。下一代的模型竞赛,或许不再是比谁算力大,而是比谁更「会省钱」。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

发表评论