月度归档: 2026 年 8 月

Kimi、GLM和Claude的差距,为什么每个人感受完全不同?

上一篇文章《这次真不慌了,Claude随时可以取消订阅》发出来以后,评论区里有不少读者反馈,在他们的实际使用中,Kimi、GLM、Qwen等国产模型,与Claude相比仍然存在明显差距,有些任务国产模型来回修改几次都做不好,换成Claude之后却很快就能完成。

这些反馈当然不能简单理解为不会使用AI,其中可能有很多同样从事软件开发的人。后来我想了一下,大家的感受之所以如此不同,可能并不是谁高估或者低估了某个模型,而是我们虽然都在谈AI Coding,实际交给AI完成的却不是同一种工作。

模型之间的能力差距真实存在,但不会平均地出现在所有任务中。任务越模糊、链条越长、需要模型自己做决定的地方越多,Claude等旗舰模型的优势越容易被感受到;任务越清晰、拆解越充分、人工控制越强,Kimi、GLM等模型与Claude之间的实际差距就越容易缩小。

同样叫AI Coding,实际可能是完全不同的工作

现在只要使用自然语言让AI修改代码,大家都会把它称为AI Coding,但这里面包含的工作跨度非常大。

最简单的一类,是在现有项目里增加字段、修改页面或补充接口,需求、架构和实现方式都比较清楚,AI主要负责执行。另一类则是让AI进入陌生代码库,自己寻找模块、判断问题并设计修改方案。

再往前一步,有些人给AI的甚至不是一项开发任务,而只是一个产品想法。技术选型、系统架构、数据库设计、模块拆分、测试和部署,全部需要模型与编程Agent自行完成。表面上都是“让AI做一个功能”,背后需要的能力却完全不同。

真正拉开差距的,往往不是一段代码能不能写出来,而是模型能不能在信息不完整时作出正确判断,能不能理解很多文件之间的关系,能不能在执行很久以后仍然记得最初目标,以及第一次方案失败后,能不能找到真正原因,而不是继续在错误方向上打补丁。

Anthropic对Claude Opus 4.6的介绍,重点就放在更谨慎的规划、更长时间的Agent任务、大型代码库以及代码审查和调试能力上;Claude Code本身也不只是聊天窗口,而是一套能够读取代码库、编辑文件和运行命令的完整编程Agent。它的优势不只是代码写得更漂亮,而是在复杂任务中更少走错方向。

模型真正昂贵的能力,是替人做决定

假如需求已经明确,数据结构和接口都设计完成,测试条件也写清楚,那么模型面对的是一道有标准答案的执行题。但如果用户只说“帮我增加一个会员系统”,模型就要自己判断会员分几级、权益如何配置、权限在哪里控制、数据表怎样设计,以及修改失败后如何回滚。后一个任务未必多写多少代码,却包含了更多需要判断的地方。

Claude等旗舰模型的价值,往往就体现在这些判断中。一次正确的架构选择或根因定位,可以省掉很多返工。对于需要AI长时间自主工作,或者无法逐步检查结果的人来说,这种差距会直接转化为成功率和最终质量。

Kimi和GLM也在向这个方向进步。Kimi K3已经把长程编程、百万Token上下文和Agent工作作为主要能力,GLM-5.2同样把长时间任务作为升级重点。国产模型也在努力承担更多原本需要人完成的规划与执行。

但从“能够完成不少编程任务”,到“能够在复杂项目中持续作出正确决定”,中间仍然有距离。也正是在这段距离上,不同人的感受开始分化。

我的开发经验,只是减少了模型需要做的决定

从我自己的使用情况来说,大多数时候确实用不到最强的模型。原因并不是我认为Kimi、GLM已经在所有能力上与Claude相同,而是很多最考验模型的工作,在调用AI之前已经由我完成了。

做一个系统时,我通常会先确定需求是否合理,选择技术方案,划分模块和接口,设计数据结构,再把工作拆成可以独立完成和验证的小任务。交给AI的往往不是“帮我做一个系统”,而是“按照现有架构完成这个模块,并通过这些测试”。

当任务被拆到这个程度,模型需要猜测的内容已经很少。它更像一个执行者,只需要理解局部上下文、遵守已有规则并产出代码。只要模型跨过了基本能力门槛,更强模型增加的推理和规划能力,就不一定能够同比转化成效率提升。有时我真正关心的反而是速度、价格、额度和是否可以随时切换。

这并不意味着开发经验越深,就越感觉不到差距。另一些资深开发者经常处理遗留系统、复杂重构或陌生技术栈,对代码质量要求也更高,自然更容易发现模型之间的差别。

所以,开发经验真正改变的是人与AI如何分工。有的人用经验提前消化了复杂性,让AI在一条比较清楚的轨道上执行;有的人则希望AI进入未知环境,自行寻找道路。即使同样是专业开发者,这两种工作方式也会带来完全不同的评价。

我们使用的不是模型,而是一整套系统

用户实际感受到的“Claude”“Kimi”或“GLM”,通常并不是单独一个模型,而是模型、Agent、上下文管理、工具调用、项目规范以及用户自身能力共同组成的结果。

同一个模型放进不同的编程Agent里,表现可能完全不同。Agent怎样搜索代码、什么时候压缩上下文、如何运行测试、失败后是否回退、能否记住此前决定,都会影响最后结果。2026年的一项Agent Harness研究,在不更换基础模型的情况下,通过改进工具、中间件和长期记忆,把Terminal-Bench 2的通过率从69.7%提高到77.0%;另一项研究也发现,不同Harness会让同一模型每完成一个任务的Token成本相差数十倍。

这说明我们经常把一整套系统的体验,归因到模型名字上。有人说Claude更强,比较的可能是Claude模型加Claude Code的完整能力;有人说国产模型已经够用,背后可能是成熟的项目规范、清楚的任务拆解和持续的人工检查。

模型比较当然有意义,但进入真实工作后,更合理的比较单位是模型与Agent的组合,以及它在具体约束下能够交付什么结果。

国产AI Coding真正要解决的,是降低对使用者经验的依赖

从开发者角度看,未来未必需要为所有任务都使用最强模型。明确、可验证、执行性强的工作,可以优先考虑速度和成本;模糊、复杂、跨模块和长时间任务,则更值得使用能力更强的旗舰模型。同一个项目里,让不同模型承担不同层级的任务,可能比选择一个“永远最好”的模型更符合实际。

但对国产AI Coding产品来说,仅仅让有经验的开发者觉得“已经够用”,还不是终点。更大的市场来自那些没有能力提前设计架构、拆解任务和检查代码的人。对他们来说,真正需要的不是一个更会写代码的聊天机器人,而是一个能够主动澄清需求、发现矛盾、制定计划、运行测试并在失败后纠正自己的完整Agent。

国产模型与Claude之间真正需要缩小的,也不只是排行榜上的几分,而是结果对使用者经验的依赖程度。即使用户没有把任务描述得非常准确,没有事先搭好架构,也不知道怎样判断生成的代码是否可靠,Agent仍然能够把项目带到一个基本正确的方向,这才是真正降低软件开发门槛。

所以,Kimi、GLM和Claude的差距确实存在,但它不是一个固定数字,更不会在每个人的工作里以同样方式出现。有人测试的是代码执行能力,有人测试的是架构和规划,有人测试的是长时间自主工作,还有人比较的是包含Agent和工作流在内的完整产品。

大家得出不同结论,不一定是谁判断错了,而是他们测试的能力不同。模型是否够用,从来不只是模型单方面的问题,它取决于任务需要模型做多少决定,也取决于人和Agent已经替它解决了多少问题。

DeepSeek V4 Flash只差GPT-5.6 Luna 1分,价格却低了一大截,AI模型开始争夺“用得最多”

7月30日,OpenAI宣布将GPT-5.6 Luna的API价格降低80%,输入价格降到每百万Token 0.20美元,输出价格降到1.20美元。一天之后,DeepSeek发布V4 Flash正式版。它没有扩大参数规模,只是在预览版基础上重新进行后训练,官方公布的多项Agent评测却超过了V4 Pro Preview,并继续维持每百万Token 0.14美元输入、0.28美元输出的价格。

两件事发生得很接近,很容易被理解成一场普通的模型价格战。但我觉得,真正的变化不是谁在排行榜上前进了几名,而是AI模型正在出现一种新的竞争标准:未来最重要的模型,未必是解决最难问题的那个,也可能是每天被调用最多、承担最多实际工作的那个。

DeepSeek V4 Flash争夺的,正是这个位置。

一、Flash已经不再意味着能力弱一档

过去各家公司名称里的Flash、Mini、Haiku,通常都代表一种明确定位:能力比旗舰模型弱一些,但速度更快、价格更低,适合摘要、分类、信息抽取和简单问答。真正复杂的推理、编码和Agent任务,仍然要交给更大的模型。

V4 Flash正式版开始打破这个边界。DeepSeek公布的九项Agent测试中,它全部超过V4 Pro Preview。Terminal Bench 2.1从72.1提高到82.7,DeepSWE从12.8提高到54.4。第三方机构Artificial Analysis的综合智能指数中,V4 Flash最高推理档得到50分,与Gemini 3.6 Flash处在同一区间,只比GPT-5.6 Luna最高推理档低1分。

这些数字不能被理解为DeepSeek已经全面超过闭源模型。它的代码Agent测试使用了尚未公开的Harness,其中两项还是内部测试集;V4 Flash也只支持文本,无法与Gemini 3.6 Flash的多模态能力直接相比。

但它至少证明,低价模型已经跨过“只能做简单任务”的门槛。在一部分编码、工具调用和自动化任务中,大部分工作可以交给一个足够可靠、成本足够低的模型,只有遇到困难时,才调用更强的模型。

二、真正夸张的不是分数,而是这个分数对应的价格

如果只看50分和51分,V4 Flash与GPT-5.6 Luna差距不大;把价格放进来,情况就完全不同了。

V4 Flash每百万输入Token为0.14美元,输出为0.28美元;降价后的Luna分别为0.20美元和1.20美元;Gemini 3.6 Flash则是1.50美元和7.50美元。V4 Flash的输入价格比Luna低30%,输出价格低约77%;与Gemini 3.6 Flash相比,输入价格低约91%,输出价格低约96%。

假设一个Agent系统每月消耗1亿输入Token和2000万输出Token,不考虑缓存和不同模型的Token效率,V4 Flash的理论账单约为19.6美元,Luna约44美元,Gemini 3.6 Flash约300美元。这个简化计算足以说明价格差异如何随调用规模被放大。

不过,API单价最低不等于每个任务的真实成本最低。Artificial Analysis完成同一套评测时,V4 Flash生成了约2.1亿输出Token,明显高于同类模型中位数,说明它仍然偏冗长;DeepSeek还预告未来会实行高峰时段双倍价格。

开发者以后比较模型,不能只看每百万Token多少钱,还要看任务成功率、工具调用和重试次数、缓存利用率以及运行时间。真正应该比较的单位,不再是Token,而是“每个成功任务的成本”。

三、Agent让低价模型第一次成为大市场

在聊天产品里,用户问一个问题,模型回答一次,单次价格差异通常没有那么敏感。但Agent为了完成“修改一个功能”“分析一批合同”这样的工作,可能先读取文件、制定计划,再搜索、调用工具、执行代码、检查结果,发现错误后重新修改。一次用户请求背后,可能发生几十次甚至更多模型调用。

模型不再只是回答问题,而是在持续消耗算力完成工作。这也是为什么OpenAI在Luna降价时,重点案例几乎都围绕Agent展开。Ramp把Luna作为后台Agent自动化的默认模型,Cognition用它配合更大的模型处理常规编程工作;OpenAI自己给出的方案,也是让Sol负责制定计划,再让Luna执行修改、编写测试和检查结果。Google对Gemini 3.6 Flash的定位,同样是多步骤Agent工作流和更少的推理轮次与工具调用。

未来的Agent很可能不会只使用一个模型。最强模型负责规划、判断和处理异常,便宜模型负责搜索、执行、验证和大量子任务。就像一家公司不会让最资深的专家处理所有基础工作,Agent也不会把每一步都交给最昂贵的模型。

在这种分工下,旗舰模型决定能力上限,真正产生海量调用的,反而可能是中间这一层:能力已经足够,价格又低到可以反复使用。V4 Flash与Luna争夺的,正是Agent背后这个不一定被用户看见、却可能消耗最多Token的执行层。

四、开放权重让竞争不只发生在价格上

V4 Flash还有一个Luna和Gemini不具备的条件:开放权重。它采用MIT许可证,拥有2840亿总参数、每个Token激活130亿参数,并提供vLLM、SGLang等部署方式。

开放权重经常被理解为企业可以本地部署,但大多数公司并没有能力低成本运行这样规模的模型。它更现实的意义,是让云厂商和推理平台能够部署,让企业根据价格、数据要求和稳定性选择供应商,并针对自己的任务进行优化。

即使企业最后仍然使用官方API,开放模型也会成为闭源模型定价的参照,让任何一家厂商都更难依靠能力领先长期维持高溢价。OpenAI刚把Luna价格降低80%,DeepSeek紧接着用更低的价格提供接近的智能水平。两者之间没有证据表明存在直接因果关系,但它们共同说明,中间层模型的价格正在快速被压低。

未来模型公司的利润,可能越来越难只来自Token本身,而要转向Agent框架、工具生态、企业数据、稳定服务、分发入口和完整产品。模型能力仍然重要,但单纯出售模型能力这件事,正在越来越像一门基础设施生意。

五、最强模型决定上限,便宜模型决定规模

DeepSeek V4 Flash仍然有明显边界。它不是多模态模型,官方API的全球覆盖、稳定性、延迟和企业支持仍需验证;Gemini的多模态和原生工具能力,Luna与Codex、ChatGPT Work以及OpenAI生态的结合,也不是Token价格能够完整体现的。

但这不影响它释放出的信号。过去一年,开放权重模型首先证明自己可以接近闭源模型的能力;现在,它们又开始证明,这些能力可以被压到极低价格,并进入原本只有商业闭源模型才能承担的Agent工作流。

在聊天时代,我们习惯问哪个模型最聪明;到了Agent时代,企业会越来越关心:哪个模型能够稳定完成任务,哪个模型可以运行一百万次,哪个模型失败后重试的成本仍然可控,哪个模型不会让一个看起来不错的产品,在扩大用户量之后失去商业可行性。

所以,DeepSeek V4 Flash不是在挑战最强模型。最强模型负责解决最困难的问题,也决定整个行业的能力上限。但AI真正进入企业流程、替代大量重复工作、支撑成千上万个Agent持续运行,靠的未必是排行榜第一名。

最强模型决定我们能把AI带到多高,而足够强、足够便宜的模型,决定AI最终能够铺到多广。DeepSeek现在争夺的,正是后一个市场:它未必总是用户主动选择的模型,却可能成为Agent背后被调用最多的那个模型。