DeepSeek Vision 拆解:视觉编码器+Aligner 塞进 305B MoE

DeepSeek Vision 拆解:视觉编码器+Aligner 塞进 305B MoE

8 月 31 日 DeepSeek 开源了 V4 家族首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,新闻已经刷屏。但大部分报道只讲了「305B 参数、逼近 Opus 4.8」这些结论,很少有人拆开讲:这双「眼睛」在架构上到底怎么装进语言模型的?为什么它不给人类看图、专给 Agent 用?想本地跑起来,到底要什么配置?这篇从技术角度完整拆一遍。

架构:视觉编码器 + Aligner 塞进 305B MoE

DeepSeek-V4-Flash-Vision-Exp 不是从零训练的模型,而是基于 V4-Flash-0731 底座改造:在原有语言模型基础上,接入视觉编码器(Vision Encoder)和一个 Aligner 对齐模块,再经过持续训练获得图像理解能力。总参数量 305B,MoE 架构下每个 token 实际激活约 13B 参数——容量大、推理成本可控。

这次开源把推理栈也一起放了出来:模型权重、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark 六个核心模块。也就是说,你不仅能下载权重,还能看懂它每一层是怎么算的。

关键设计:为什么定位「给 Agent 读屏」而不是「给人看图」

传统多模态模型走的是 VQA 路线——输入一张图,输出一段描述,人来看。DeepSeek 这次刻意绕开了这条老路,官方口径是「多模态 Agent 能力」:让 Agent 直接读取网页截图、软件界面、图表等视觉信息,然后调用工具继续执行任务。

这个定位差异,是理解整个模型的关键。对 Agent 来说,「看图」的目的不是「欣赏」,而是「行动」:看到界面截图就知道下一步点哪里,看到图表就知道该调什么工具算结果,看到网页就知道照着执行什么任务。模型的输入输出设计、性能优化重心,全都围绕「读屏 → 行动」这条链路展开,而不是「看图 → 说话」。

性能细节:哪些涨了,哪些没涨

官方公布的跑分值得细看。纯文本 Agent 能力基本无损:Terminal Bench 2.1 从 82.7 涨到 83.9,DeepSWE 从 54.4 涨到 59.3,后者超过了 Claude Opus 4.8 的 58.0。多模态 Agent 能力提升明显:ApexBench Pass@1 达 36.5;Agents’ Last Exam 27.3,超过 Opus 4.8 的 25.7;ZeroBench Pass@5 35.0,压过对手的 34.0。

但有涨就有跌:NL2Repo 项目得分 57.7,明显落后于 Opus 4.8 的 69.7。官方表述克制,只说「多模态 Agent 能力接近 Claude Opus 4.8」。这提醒我们:榜单要拆开看,不同任务类型差异很大。

Agent「读屏」的三个典型场景

把「读屏」落到具体场景,更容易理解它的价值。一是软件测试:Agent 打开应用截图,识别界面状态,判断下一步操作是否符合预期,比纯文本断言覆盖的场景更广。二是旧系统流程自动化:很多企业系统没有开放 API,人工操作靠肉眼认界面,Agent 有了视觉能力,就能照着截图完成「看到按钮 → 点击 → 核对结果」的操作循环。三是数据看板解读:把图表截图丢给 Agent,它读取数值、趋势和异常,再决定调用什么工具做进一步分析。这三个场景的共同点是:信息以「画面」形式存在,而 Agent 要行动必须先「看懂画面」——这正是视觉模型与 Agent 结合的价值所在。

本地部署:128G 内存起步,社区量化版已就绪

部署门槛是很多人关心的。模型权重为 safetensors 格式,支持 FP8 精度,约 128G 内存即可运行——对个人开发者偏高,但对有本地部署需求的中小团队来说相对友好。社区跟进很快,Hugging Face 页面已出现 7 个面向 llama.cpp、LM Studio、Ollama 的量化版本,降低了在不同推理框架里跑起来的门槛。

输入侧,模型原生支持 JPEG、PNG、GIF、WebP 四种格式,图片进入前会缩放处理,图片 token 上限 384 个。

组合起来看:DeepSeek 正在攒一个完整的 Agent 技术栈

把时间线拉长看,DeepSeek 的布局其实很清晰:模型负责推理和工具调用(V4 系列)、Harness 负责长任务的持续执行、Vision 负责让 Agent 读屏幕——三个拼图合起来,就是一个「看得见、想得清、干得久」的 Agent 闭环。这次开源 Vision 的推理栈,就是在为这个闭环铺路:开发者可以在自己的框架里,把视觉能力接入任意 Agent 工作流。

上手建议

如果你是开发者,想本地跑一个「能看屏幕的 Agent」,现在就能动手:从 Hugging Face 下载权重,用官方的最小 PyTorch 推理实现或社区量化版跑通一次「截图输入 → 工具调用」的最小示例,再考虑接入自己的 Harness 或 Agent 框架。模型标注为 Exp 实验版本,识别与图表理解是强项,但生产环境建议先做针对性测试。看懂这双「眼睛」的架构逻辑,你也就看懂了多模态 Agent 这一轮技术浪潮的底层路径。

· · · · ·

关注「AI 智习室」,每天一条看得懂的 AI 情报。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

发表评论