DeepSeek 开源首个多模态模型:305B 免费商用,读屏能力逼近 Opus 4.8

DeepSeek 开源首个多模态模型:305B 免费商用,读屏能力逼近 Opus 4.8

过去我们聊多模态模型,第一反应都是「AI 看图说话」——你发一张照片,它给你描述一段话。但 8 月 31 日 DeepSeek 在 Hugging Face 开源的 V4 家族首款多模态模型 DeepSeek-V4-Flash-Vision-Exp,方向完全不一样:这双「眼睛」不是给人看图,而是专供 AI Agent 看屏幕干活。

305B 参数的「眼睛」,MIT 许可直接免费商用

先说硬指标。DeepSeek-V4-Flash-Vision-Exp 总参数量 305B,采用 MoE(混合专家)架构,每个 token 实际激活约 13B 参数——也就是说,它拥有接近旗舰级的容量,但推理时只动用一小部分,成本可控。模型基于 8 月的 V4-Flash-0731 底座,在原有语言模型基础上接入视觉编码器(Vision Encoder)和 Aligner 对齐模块,经过持续训练获得图像理解能力。

更关键的是许可:MIT License,权重完全开放,可以自由商用、修改、二次开发。这意味着个人开发者、中小团队都能把它下载到本地,用自己的数据微调,不再受 API 调用额度限制。

这双「眼睛」为什么是给 Agent 用的?

传统多模态模型主打视觉问答(VQA)——描述图片、回答问题。DeepSeek 这次为 Vision 版本划定的赛道完全不同:官方重点强调多模态 Agent 能力,让 Agent 直接读取网页截图、软件界面、图表等视觉信息,再结合工具调用继续执行任务。

换句话说:以前 Agent 只能「读字」,现在能「读屏」。比如让 AI 看着你的操作界面截图判断下一步、读一张数据图表后直接帮你调工具算结果、看一页网页截图后照着执行任务——这正是「AI 替你操作电脑」这类应用最缺的一块拼图。

模型原生支持 JPEG、PNG、GIF、WebP 四种图片格式,图片进入前会缩放处理,图片 token 上限为 384 个。

性能逼近 Claude Opus 4.8,官方措辞依旧克制

从官方公布的跑分看,加入视觉能力后,纯文本 Agent 能力基本不受影响:Terminal Bench 2.1 从 82.7 涨到 83.9,DeepSWE 从 54.4 涨到 59.3,甚至超过了 Claude Opus 4.8 的 58.0。

多模态 Agent 的提升更明显:ApexBench Pass@1 达到 36.5,Agents’ Last Exam 以 27.3 超过 Opus 4.8 的 25.7,ZeroBench Pass@5 也以 35.0 压过对手的 34.0。但 DeepSeek 并没有宣称「全面超越」:在 NL2Repo 项目上得分 57.7,明显落后于 Opus 4.8 的 69.7。官方表述很克制,只说「多模态 Agent 能力接近 Claude Opus 4.8」。

开源得很彻底:权重、推理代码、量化版一次给齐

这次开源不只是丢个权重文件。官方打包了模型权重、Tokenizer、Prompt Encoding 参考实现,以及一份最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark 等核心模块。社区跟进也很快,Hugging Face 页面上已经出现 7 个面向 llama.cpp、LM Studio、Ollama 的量化版本。

部署门槛方面,官方适配了 DeepSeek Harness 智能体框架,实现从视觉输入到工具调用的全链路闭环;本地部署约 128G 内存即可运行,支持 FP8 精度。

时间线藏着 DeepSeek 的商业节奏

值得注意的一个细节:8 月 21 日这个模型就先上线了 DeepSeek API,当时只能调用、不给权重,开发者可以通过 API 同时输入文字和图片,图片按 token 计费;十天后权重才正式开放。「先卖 API 再开源」的节奏,透露出 DeepSeek 以 API 服务为主的定位——开源权重既是生态策略,也是商业杠杆。

对普通人意味着什么

三点值得记住。第一,「让 AI 替你看屏幕操作电脑」的技术门槛被拉低了——305B 级别、MIT 许可、128G 内存可本地部署的多模态 Agent 模型,这是国产开源第一次给出完整方案。第二,开源生态的反超正在发生:继 H3、GLM 之后,DeepSeek 把「视觉」这块最后的关键拼图也补齐了,而且是一次性把推理栈一起开源,摆明了要进各类 Agent 框架和工具链。第三,模型标注为「Exp」实验版本,识别和图表理解能力强,但官方建议针对具体任务实测,不要假设所有图像任务都是生产级表现。

如果你在观望「本地跑一个能看屏幕的 AI 助手」,这个模型值得下载试试——毕竟,看得懂屏幕的 AI,离「自己干活」又近了一大步。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

发表评论