大模型

大模型对比

130

清华 Zeva:不更新权重也能越用越聪明,成功率 26%→73%

机器人一直有个老大难问题:换个环境就「失灵」。在实验室里学会的操作,换个场地、换个工具,往往要重新采集数据、重新训练。9 月 1 日,清华 AIR(智能产业研究院)联手域变换发布了一个名为 Zeva 的模型,给出了一条完全不同的路:模型权重不用更新,机器人也能从自己的交互经验里持续学习,越用越聪明。 Zeva 是什么:首个实现 ICCL 的具身世界模型 Zeva 的定位是首个实现 In-Conte…

DeepSeek Vision 拆解:视觉编码器+Aligner 塞进 305B MoE

8 月 31 日 DeepSeek 开源了 V4 家族首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,新闻已经刷屏。但大部分报道只讲了「305B 参数、逼近 Opus 4.8」这些结论,很少有人拆开讲:这双「眼睛」在架构上到底怎么装进语言模型的?为什么它不给人类看图、专给 Agent 用?想本地跑起来,到底要什么配置?这篇从技术角度完整拆一遍。 架构:视觉编码器 + Al…

Runway 发布首个界面世界模型:不用写代码,界面边用边生成

现在的网页和 App,基本都遵循同一套逻辑:设计师画出界面,工程师把它翻译成代码,用户再按照开发者预先设计好的按钮、菜单和流程操作。8 月 31 日,Runway 公布了一个大胆的方向:如果界面不再由固定代码提前写死,而是由 AI 根据你的动作实时生成,会发生什么? 这个名为 Solaris 的系统,被 Runway 称为 Interface World Model,也就是「界面世界模型」。它不是…

DeepSeek 开源首个多模态模型:305B 免费商用,读屏能力逼近 Opus 4.8

过去我们聊多模态模型,第一反应都是「AI 看图说话」——你发一张照片,它给你描述一段话。但 8 月 31 日 DeepSeek 在 Hugging Face 开源的 V4 家族首款多模态模型 DeepSeek-V4-Flash-Vision-Exp,方向完全不一样:这双「眼睛」不是给人看图,而是专供 AI Agent 看屏幕干活。 305B 参数的「眼睛」,MIT 许可直接免费商用 先说硬指标。D…

大模型不靠蛮力:拆解混元 Hy4 的 MoE 稀疏激活 + 1M 上下文,看懂参数背后的成本与算力账

先抛一个反直觉的事实:腾讯混元 8 月 28 日发布的 Hy4 preview,总参数 770B,每次推理只激活 49B,上下文 1M,API 输入定价 6 元每百万 token。 大,通常意味着贵。但这次是又大又便宜。中间的矛盾,靠一个叫 MoE 的架构给抹平了。 这篇不讲公式,只把三件事讲明白:MoE 稀疏激活到底省了什么、1M 上下文意味着什么、以及这次发布里真正值钱的那条信息是什么。 一、…

Claude 能自己操作浏览器了:不会写代码也能接「网页自动化」私单,批量填表、抓数据、抢券全包

「我不会写代码,能不能接自动化的活?」 过去这个问题的答案很尴尬:能,但你得先学 n8n、学影刀、学一堆节点配置,学习曲线比想象中陡。8 月 26 日 Claude in Chrome 全面上线之后,答案变了一点——你把活儿说清楚,让 AI 自己在浏览器里点。 这篇不聊技术原理,只聊一件事:这个能力能变成什么服务,怎么接第一单,以及有哪些坑必须提前知道。 一、Claude in Chrome 现在…

打工人效率神器实测:Gemini 3.5 Transcribe 自动去「嗯啊」、自动格式化,会议纪要字幕采访稿一键出

一场两小时的会议开完,最痛苦的不是开会本身,是整理纪要。 录音听一遍要两小时,边听边打字要四小时,中间还得反复倒回去听清某句话。采访、播客、课程、客户沟通——凡是涉及「把说的话变成文字」的场景,都在吃这份苦。 8 月 26 日,Google DeepMind 发布了 Gemini 3.5 Transcribe,官方称它是目前最精准的语音转文本模型。我们来看看它到底强在哪,以及普通人能怎么用。 一、…

Gemini Omni 1.1 Flash 发布:AI 视频能续写到 40 秒,360p 草稿便宜 2/3,过稿再上 4K

做 AI 视频的人,大概都经历过同一种无力感:抽了二十次,终于出来一条满意的镜头,但你没法让它「接着往下演」。 想让镜头再往后走两秒?只能重新生成,而新生成的画面里,人物的脸、衣服的颜色、光线的方向全都变了。AI 视频过去最大的问题不是画质,是不可控——你只能抽,不能改;只能重来,不能接续。 8 月 27 日,Google 发布的 Gemini Omni 1.1 Flash,就是冲着「可控」这两个…

腾讯混元发布并开源 Hy4 preview:770B 总参 / 49B 激活 / 1M 上下文,输入只要 6 元,WorkBuddy 免费 2 周

先问一个问题:你觉得现在用一次「旗舰级」大模型,要花多少钱? 很多人的印象还停留在「能力越强越贵」。但 8 月 28 日腾讯混元发布的 Hy4 preview,把这个印象按在地上摩擦了一遍——770B 总参数、1M 上下文的旗舰模型,开源免费拿走,API 输入只要 6 元每百万 token,还有产品端限时 2 周免费。 这不是一个小版本更新,而是国产大模型第一次把「旗舰能力」和「白菜价格」同时摆到…

大模型降价,副业党受益:API 成本降 33% 意味着什么

标题里说”API 成本降 33%”,这个数字是准的——它特指这一轮最猛的一刀:OpenAI 把旗舰 GPT-5.6 Sol 的输出 token 从 30 美元砍到 20 美元,降幅正好 33%(输入降 20%),多家媒体 8 月 22 日已坐实。全行业不是都降 33%,而是 20%–33% 不等。对靠 API 吃饭的副业党来说,结论不变:用 AI 的成本,正在肉眼可见地变便…

刚刚!小米玄戒 O100 发布,手机本地跑大模型再提速

手机本地跑大模型这事儿,过去总卡在一个字上:慢。参数一大,云端来回传、显存带宽不够,体验就垮了。8 月 24 日,小米一口气发了三颗自研玄戒芯片,其中专门盯住”端侧大模型加速”的那颗——玄戒 O100——就是冲着这个瓶颈去的(来源:新华网客户端 xinhuanet.com,2026-08-25;21世纪经济报道,2026-08-25)。 玄戒 O100 到底是什么 玄戒 O…

Narralume:开源 AI 长篇小说写作工作室,副业新路子

写长篇小说最怕的不是写不出来,而是写出来了,自己却认不出——人设前后矛盾、时间线乱套、埋下的伏笔忘了收。当 AI 写作工具越来越多,一个更隐蔽的问题出现了:模型很会编,但也很容易”逻辑崩坏”。最近一个开源项目 NarraLume(中文名”叙灯”)给出了一种挺有意思的解法:它不追求让 AI 一口气写完全书,而是用软件工程里”类 Git&#8…

神秘模型「牛来」Ox Alpha 登顶 OpenRouter:免费百万上下文随便用

最近 AI 圈冒出一个谁都猜不出来历、却让开发者集体上头的模型:Ox Alpha。因为 “Ox” 是”牛”的意思,加上一部叫《牛来》的电影正好走红,国内网友干脆给它起了个接地气的中文昵称——”牛来”大模型。据多家媒体报道,这个匿名模型在 2026 年 8 月 20 日悄然上线大模型聚合平台 OpenRouter,短短几天就冲到…

只用 65% 训练数据逼近 Qwen3:扩散模型要翻盘?

大模型训练的「效率天花板」可能要被打破了。8 月下旬,中国人民大学高瓴人工智能学院李崇轩、文继荣团队联合蚂蚁集团,发布了一项重量级研究:首次系统刻画了混合专家(MoE)扩散语言模型的扩展定律,并据此从头训练出新一代扩散语言模型 LLaDA MoE v2——只用了 Qwen3 同规模约 65% 的预训练词元,就在多项基准上逼近甚至超越 Qwen3 的水平。 这是扩散语言模型路线的一个重要里程碑。但很…

Anthropic 官方发布《AI 原生 SDLC 实战手册》:Claude 怎么重构自家软件研发流程

AI 怎么帮企业做软件开发?各家大厂都在探索,但最权威的答案,通常藏在「他们自己怎么用」里。8 月 21 日,Anthropic 官方博客发布了一篇《AI 原生 SDLC 实战手册》,详细拆解了 Claude 是如何重塑自家软件开发生命周期(SDLC)的。 SDLC 是「软件开发生命周期」的缩写,覆盖从需求、编码、测试、评审到部署的完整流程。Anthropic 这篇官方手册的价值在于:它不是理论推…

Agent 最大短板是「健忘」?OpenAI 收购 Instant 补齐记忆层

如果 AI 智能体也有「最尴尬的时刻」,那一定是——昨天刚帮你排好日程、写好的代码、记住的需求,今天一开新会话,全部忘光。这不是段子,而是当前 AI Agent 最被吐槽的硬伤:没有跨会话的持久记忆。8 月 23 日,OpenAI 用一个动作试图补上这块短板——收购了被业内称为「AI 时代的 Firebase」的初创公司 Instant,整个团队并入 OpenAI。 这笔收购不是巨头随手的「买买买…

OpenAI 开源 Codex Harness:执行框架比模型更值钱?

「模型没换、得分翻了快 3 倍」——这句话在 AI 圈炸开,靠的不是新模型,而是一次开源。8 月 20 日,OpenAI 把自己智能体产品 Codex 的底层执行框架 Harness 全面开源了,代码挂在 GitHub 上,许可证 Apache-2.0,任何人可以拿去用、改、甚至放进自己的产品里。仓库目前已经积累了超过 10 万 star,成了最近一周开源圈最火的项目之一。 为什么要关注这件事?因…

技术书PDF一键生成Claude Code技能,开箱即学

打工人都懂一个痛:花钱买的技术书,翻完前几章就吃灰;真要用的时候,早忘光了。最近 GitHub 上有个新项目 book-to-skill 火了——上线几天就冲到 1154 星。它干的事特别戳痛点:把任意一本技术书 PDF,一键变成 Claude Code 的「技能(skill)」strong>,让 AI 替你把书「学透」、随用随查。书不再是摆设,成了你的私人 AI 助教。 一本书,一键变成你的 A…

小红书亲自下场做AI!dots3-note主打生活决策

你印象里的小红书,是种草笔记和攻略帖。但 8 月 16 日,小红书旗下的 dots 实验室悄悄干了一件「不像是小红书会干的事」——开源了一个大模型 dots3-note。而且它不是又一个通用聊天模型,而是主打一个很生活化的场景:帮你做模糊的生活决策。一个内容平台亲自下场做模型,这事儿挺值得聊。 小红书不晒笔记了,改做模型了 dots3-note 目前是 preview(预览版),已经在开源社区放出…

Anthropic藏了大招?内部Model 2比Mythos 5还猛

8 月 15 日,Anthropic 发布第二份《风险报告》(186 页),里面意外「自曝」了一款内部模型:代号 Model 2。它的能力整体超过了已发布的旗舰 Mythos 5,但 Anthropic 明确表示暂无对外发布计划。一款比旗舰还强、却不卖给你的模型,为什么存在?这背后是头部实验室对「能力、安全、商业」的精密算计。 一款没发布的模型,比已发旗舰还猛? 先说清楚事实:这不是传闻,是 An…

谷歌把价格砍半!Gemini 3.7 Flash成最聪明打工模型

大模型圈这周有点热闹。阿里开源、DeepSeek 涨价、OpenAI 上新,谷歌也没闲着——就在 Gemini 3.6 Flash 发布仅三周后,Google 又推出了 Gemini 3.7 Flash。官方给它的定位很直白:这是 Flash 系列里「到目前为止最聪明的工作马模型」,而且明说编程和 Agent 优先,聊天其次。更狠的是价格:直接砍半。 三天前刚发 3.6,现在又来 3.7 从 3.…

智谱今天发布 GLM-5.3:编程开源第一,还学会了网络安全

国产大模型的发布节奏越来越快了。8 月 14 日,智谱 AI 发布新一代基座模型 GLM-5.3,两个卖点迅速引发讨论:编程能力做到开源第一,同时涌现出网络安全能力。消息一出,”国产模型又卷出新高度”的话题在开发者圈子里迅速升温。 GLM-5.3 是什么? GLM-5.3 是智谱 AI 最新一代基座大模型,从官方发布信息看,它的核心升级集中在两个方向:一是编程能力,官方表示…

微软终于自研 AI 模型了:MAI-Thinking-1 推理模型首发

美国 AI 大厂的军备竞赛又添新玩家。8 月 12 日,微软正式发布其自研推理模型 MAI-Thinking-1——这是微软在自研大模型方向上的重要一步,标志着这家软件巨头正式加入”推理模型”的正面竞争。消息由微软 AI 业务负责人 Mustafa Suleyman 在官方渠道发布,随后迅速在 AI 圈刷屏,因为这件事的意义远超一款新模型本身。 微软的自研 AI 野心 长期…