8月21日,DeepSeek上线了一个新的实验模型DeepSeek-V4-Flash-Vision-Exp,最大的变化很好理解:DeepSeek终于可以直接看图了。
这件事情如果放在两年前,可能还算一个挺大的新闻,但到了今天,已经很难让人觉得新鲜。ChatGPT、Gemini、Claude早就支持图片输入,Google的多模态甚至已经做到了视频,DeepSeek现在才给V4加上Vision,怎么看都有点像是在补课。
而且严格来说,这也不是DeepSeek第一次做视觉模型。早在2024年,DeepSeek就发布过DeepSeek-VL,之后还有VL2、Janus这些多模态模型。真正不同的是,这次Vision终于进入了V4这条最核心的模型产品线,不再只是一个单独的研究模型。DeepSeek-V4-Flash-Vision-Exp可以直接处理图片、截图、图表和文档,也支持Tool Calls、Responses API以及Anthropic兼容接口,官方给它的定位也很明确,重点不是普通的图片问答,而是Multimodal Agent。
所以我看到这个模型的时候,第一反应并不是DeepSeek终于把“多模态”这门课补上了,而是想到前几天DeepSeek刚刚发布的Harness。
当时DeepSeek在官网上写了一个很简单的公式:
Agent = Model + Harness
模型负责智能,Harness让模型理解环境、使用工具,并且能够在真实环境里持续工作。现在再加上Vision,这个公式其实又完整了一点。
这几年做AI开发,我越来越明显地感觉到,Agent真正难的地方已经不只是模型够不够聪明,也不是会不会调用工具,而是它做完一件事情以后,能不能知道自己到底做成什么样了。
这恰恰是Vision对Agent真正重要的地方。
一、DeepSeek以前看不见,为什么Coding Agent照样很强?
这个问题其实挺有意思。
如果Vision是Agent非常重要的能力,那么DeepSeek V4过去一直只能接受文本输入,为什么它的Coding Agent能力还可以做得这么强?
原因是软件开发本来就是一个非常特殊的场景,大量信息天然就是文字。
Agent打开项目,读取的是代码;修改程序,操作的是文件;运行程序,看到的是Terminal;测试失败以后,返回的是错误日志。一个后端程序从修改代码、运行测试、发现错误,再到继续修改,整个反馈过程几乎都可以变成Token。
所以在这种环境里,AI其实并不需要真正“看见”什么。
DeepSeek自己做Harness的时候,甚至专门提供了一个Minimal Mode,只给模型一个Shell和一个文件编辑器,用这种极简环境来测试模型本身的Agent能力。V4 Flash此前在Terminal Bench 2.1已经做到82.7,新Vision版本进一步到了83.9。
但我自己在用AI做前端开发的时候,会很明显地遇到另外一个问题。
现在AI写React、Vue或者Flutter页面都已经没有太大问题,给它一个需求,它可以自己修改代码、启动程序,甚至发现编译错误以后继续修改。但代码最终在浏览器或者手机上变成什么样,它以前其实是不知道的。
比如一个按钮偏了,文字换行了,图片被拉伸了,某个弹窗挡住了下面的内容,这些问题都不会出现在Terminal里。
最后还是需要我看一眼,然后告诉它:“这里不对,再改一下。”
从这个角度看,人虽然已经不用自己写代码了,却仍然没有真正退出这个流程,因为人在给Agent充当眼睛。
这也是为什么我觉得DeepSeek这次补Vision,比“终于支持图片输入”要重要得多。
二、Agent真正需要的不是识图,而是知道自己做完以后发生了什么
我们以前理解多模态,经常是从Chatbot的角度理解的。
拍一张冰箱的照片,让AI告诉我里面有什么;上传一张财报,让它解释图表;旅游的时候拍一张菜单,让它翻译成中文。这些当然都是Vision的用途,但对于Agent来说,其实还有一个完全不同的需求。
Agent会行动,而行动会改变环境。
比如让AI订一张机票,它点击搜索以后,网页会出现新的结果;选择航班以后,又会进入新的页面;填写乘客信息以后,还可能弹出确认框。AI每做一步,都必须重新知道现在页面变成了什么样,否则它根本不知道下一步应该做什么。
OpenAI早期做Computer-Using Agent时,整个机制就是这样:模型先通过截图感知当前页面,进行推理以后操作鼠标和键盘,然后再拿到一张新的截图,继续下一轮判断。它实际上一直在重复“看一眼—做一下—再看一眼”的过程。
这和我们使用电脑其实没有本质区别。
我现在写这篇文章,如果点了一下保存按钮,也会下意识地看看页面有没有出现“保存成功”;改完一个网页,也会刷新以后看看结果。如果操作以后完全闭上眼睛,只按照自己脑子里想象的状态继续点下去,很快就会出问题。
AI Agent也是一样。
所以Vision对于Agent真正重要的,不是让它知道“一张图片里有什么”,而是让它知道:
我刚才做完这件事情以后,现在变成什么样了。
这个区别看起来不大,但它其实决定了Agent能不能形成真正的闭环。
以前做一个前端页面,流程可能是AI写代码,我看结果,再让AI修改;以后更完整的Agent则可以自己写代码、打开浏览器、截图、对照设计稿,发现差异以后继续修改,再重新截图检查。
人是不是可以彻底退出,今天当然还做不到,但至少少了一次必须由人完成的信息转换。
三、把V4、Harness和Vision放在一起,事情就变得有意思了
如果只看DeepSeek这次发布Vision,很容易理解成它终于开始追赶GPT、Gemini和Claude的多模态能力。但把过去几个月DeepSeek做的事情放在一起,我觉得看到的东西不太一样。
4月份发布V4的时候,DeepSeek已经把Agentic Coding作为一个重点能力来介绍,V4 Flash虽然比Pro小很多,但在简单Agent任务上已经能够接近Pro,而且速度更快、价格更低。DeepSeek当时还特别提到,V4已经被用于公司内部的Agentic Coding。
到了8月份,DeepSeek又自己做了Harness。
这件事情我之前专门写过。模型再强,如果怎么读代码、什么时候调用工具、如何管理上下文、失败以后怎么恢复这些事情做得不好,最后的Agent体验还是会有很大差别。所以DeepSeek不再只训练模型,而是开始往模型外面再走一层,把工具、Skills、Session、Sandbox、Subagent、Workflow这些能力都放进自己的Harness里。
现在Vision也来了,同时还有Files API。
一张图片可以先上传,然后在后面的Agent任务中反复引用;Responses API也可以直接接收图片。这意味着DeepSeek现在开始把以前分开的几件事情接起来:模型负责推理,Harness负责调用工具和执行任务,Files保存任务需要的信息,Vision则负责理解那些没有办法直接变成文本的环境状态。
当然,我并不认为这意味着DeepSeek已经有了一套完整的Computer Agent。Harness还是Developer Preview,Vision名字后面也还有一个Exp,现在连正式版都算不上。
但DeepSeek的方向已经越来越清楚了。
过去我们关注DeepSeek,更多是在讨论它的模型本身:参数多少、Benchmark多少、价格比OpenAI和Anthropic便宜多少。现在这些事情依然重要,但DeepSeek开始越来越多地解决另外一个问题:
怎么让模型真正把一件事情做完。
这其实也是整个AI行业过去一年最大的变化之一。
四、Vision放在Flash上,可能比跑分更值得关注
DeepSeek这次公布了不少Benchmark,Vision版本在ApexBench Pass@1上是36.5,Agents’ Last Exam是27.3,Chartography是64.3,ZeroBench Pass@5是35.0。与Claude Opus 4.8相比,这四项视觉相关评测是两项领先、两项落后,DeepSeek因此说自己的Multimodal Agent能力已经“接近Opus 4.8”。不过这些目前主要还是DeepSeek自己公布的数据,而且在NL2Repo、DSBench-Hard这样的任务上仍然存在比较明显的差距,所以现在就说DeepSeek视觉能力已经追平Claude,还为时过早。
相比这些跑分,我反而更关注另外两个数字。
第一个是这个Vision模型没有放在Pro上,而是放在了V4 Flash上;第二个是图片经过处理以后,每张最多只计算384个输入Token。
这两个选择很符合DeepSeek一直以来的思路。
普通用户和AI聊天,看一张图片可能只调用一次,但Agent不是这样。一个浏览器Agent完成一次任务,可能需要看几十次页面;一个前端Agent为了把页面调整到正确状态,也可能不断截图、比较、修改,再截图。如果每看一次都很贵,那么视觉能力再强,也很难真正放进大规模的Agent工作流里。
所以进入Agent时代以后,模型价格真正应该比较的,可能也不是单纯的每百万Token多少钱,而是完成一件事情最终需要多少钱。
这里面既包括模型能力,也包括成功率、执行轮数、缓存、Harness效率,现在又多了视觉成本。
这也是为什么DeepSeek把Vision先放进Flash很值得关注。它未必是在急着证明自己拥有世界上最强的视觉模型,更像是在继续做DeepSeek过去一直做的事情:把一个原本比较昂贵的能力,压到可以被大量调用的位置。
五、看得见以后,离真正“做完事情”还有很远
当然,有了Vision也不等于Agent就真的会用电脑了。
OpenAI早期的Computer-Using Agent已经拥有视觉、推理以及鼠标键盘操作能力,但在OSWorld这个真实电脑操作Benchmark上的成功率也只有38.1%,人类则是72.4%。原因并不难理解,看懂一个页面、知道按钮在哪里,与连续几十步都不出错,本来就是两件完全不同的事情。
一个Agent如果连续执行20步,每一步都只有一点点出错概率,最后累积起来也可能让整个任务失败。再加上网页弹窗、网络延迟、界面变化、验证码、权限和各种没有预料到的情况,真实世界远比Benchmark复杂。
所以我觉得,DeepSeek这次Vision真正值得关注的地方,并不是它已经把Computer Agent做成了,而是它终于补上了此前一个很明显的缺口。
这几年我们一直在给AI做一个越来越聪明的大脑。模型会推理、会写代码、会规划任务;随后又给它接上工具,让它可以搜索、读文件、运行程序。到了Agent这一步,它还必须能够感知自己的行为给外部世界带来了什么变化,否则再聪明的大脑,也很难独立把事情一直做下去。
从V4到Harness,再到这次Vision,DeepSeek正在把这些东西一点点接起来。
过去我们比较模型,总是在问谁回答问题更好;进入Agent时代之后,真正重要的问题可能会慢慢变成:它能不能自己看到发生了什么,发现事情没有按照预期发展以后继续修改,直到最后真的把结果交出来。
从这个角度看,DeepSeek这次补上的确实不只是多模态。
它开始给自己的Agent,补上一双眼睛。