年度归档: 2026 年

99%的代码都由AI写了,那程序员真正值钱的是什么?

AI写代码越来越快,程序员价值到底在哪里?前几天的一次线上故障,让我重新想了想这个问题。

前几天,客户突然报了一个线上问题:即时对话里的消息发不出去了。

我们的应用底层用的是腾讯 IM。看到这个现象,我第一反应不是去查客户端,也不是怀疑腾讯 IM 本身出了问题,而是觉得消息发送的回调链路可能有问题。

于是我让部署在生产环境里的 DeepSeek Harness 去查日志。现在我的运维方式已经和以前很不一样了,不需要先打开 Kibana,根据时间、用户 ID、关键字一点点搜索,而是直接告诉 Harness:客户消息发送失败,重点检查消息发送回调相关的日志。

很快就找到了原因。

服务器时间不准,已经与当前时间相差63s。

AI写代码后的线上故障排查:DeepSeek Harness 发现服务器时间漂移63秒

我们的回调程序会对腾讯 IM 请求中的时间戳进行校验,因为服务器时间发生漂移,正常的回调请求被判断成了无效请求,程序随后把消息丢弃了。我校准服务器时间,又把 chronyd 配置好,问题解决。

这是一个不算复杂的线上故障,但处理完以后,我反而一直在想另一件事情。

我们现在这个系统,99%以上的代码已经由 AI 编写。我自己真正一行一行敲进去的代码已经非常少了。但客户只说了一句“消息发不出去”,我为什么会首先想到回调?

这件事让我重新理解了,在 AI 已经可以大量写代码以后,一个程序员真正值钱的部分到底还剩下什么。

AI写代码,正在把具体实现从程序员工作里拆出去

我自己这两年的变化非常明显。

以前做一个功能,从需求、数据库设计、接口、前端、测试到上线,中间很大一部分时间就是写代码。现在需求和架构确定以后,大量具体实现都可以交给 Coding Agent。我更多是在描述需求、补充上下文、检查实现结果,以及遇到问题以后决定应该从哪里开始排查。

所以我并不认同一种比较常见的安慰式说法:AI 只是一个提高效率的工具,程序员的工作不会发生根本变化。

至少从我自己的实际使用来看,变化已经发生了。

过去程序员一个非常重要的能力,是把需求翻译成可以运行的代码。现在这部分工作的成本正在快速下降。一个熟练使用 Agent 的开发者,一天可以产生过去几个人才能完成的代码量,而且随着模型和 Agent 继续进步,这个趋势大概率还会继续。

Google DORA 在 2025 年针对近5000名技术从业者的研究中发现,接近90%的受访者已经在工作中使用 AI,超过80%的人表示生产力有所提升。不过与此同时,仍有30%的人对 AI 生成的代码几乎没有或完全没有信任。DORA 对这个现象的总结很有意思:AI 更像一个放大器,它可以放大一个团队原本具备的能力,也会放大原来就存在的问题。

我自己的体验也差不多。

AI 已经可以把代码写得非常快,但“代码越来越容易得到”和“软件越来越容易做好”,并不是一回事。

这次消息发送故障就是一个很小的例子。

如果让我自己去搜索日志,当然也能找到问题。DeepSeek Harness 的价值在于,它把后面搜索、关联日志、检查代码这些工作大幅加速了。但客户说“消息发不出去”的时候,整个系统至少有很多地方都可能出错:客户端 SDK、网络、IM 服务、鉴权、消息回调、业务逻辑、数据库,甚至配置和服务器环境。

Harness 可以查这些东西,但首先查哪里,仍然取决于你怎样理解这个系统。

会查日志和知道该查什么,其实是两种能力

我后来想,这可能是目前很多关于 AI Coding 的讨论里容易被忽略的一点。

我们很喜欢测 AI 会不会完成某个任务:能不能修 Bug,能不能写完整功能,能不能通过测试,能不能操作数据库。但线上故障通常不会把任务描述得这么清楚。

客户不会告诉你:

“腾讯 IM 回调接口因为服务器时钟漂移,导致 RequestTime 校验失败,请检查 NTP。”

他只会说:

“消息发不出去。”

从这句话到检查消息回调,中间实际上经过了一次很大的搜索空间压缩。

我知道腾讯 IM 在整个业务里的位置,知道一条消息发送以后还要经过哪些环节,知道我们在回调里面做过什么处理,也大致知道哪些问题会导致消息完全发不出去,哪些问题只会造成展示异常。

这些东西并不是某一段代码,而是一个人在长期开发和维护系统以后,脑子里形成的一张地图。

以前这张地图往往是在写代码的过程中自然形成的。数据库是自己设计的,接口是自己写的,第三方服务也是自己接的,所以系统哪几个地方容易出问题,基本心里有数。

现在有了 AI,一个新的问题开始出现:代码生成越来越快,但人对系统的理解未必同步增长。

这也是我现在使用 Coding Agent 时比较在意的一件事。我可以不亲手写代码,但技术架构、主要模块、业务流程和关键依赖仍然必须清楚。如果连这些都不知道,那么 AI 写得越快,系统反而可能越快变成一个没人真正理解的黑盒。

所以我越来越觉得,未来软件开发的一个重要瓶颈,可能会从“代码生产能力不够”,逐渐转向“人的认知跟不上代码增长”。

这也解释了为什么在 AI Coding 时代,架构、测试、日志、可观测性和文档可能会重新变得重要。过去很多团队觉得这些事情不直接产生功能,能省就省;但当 Agent 可以一天修改大量代码以后,如果没有足够好的测试和运行数据,人甚至很难知道它到底改对了没有。

程序员不会平均地被AI影响

当然,从这次经历得出“所以程序员不会被 AI 淘汰”,我觉得也太乐观了。

有些程序员的工作确实正在被快速压缩。

如果一个岗位主要做的是根据明确需求写接口、CRUD、简单页面、调整字段、补单元测试,或者按照一个已经定位清楚的 Bug 修改几行代码,那么这些任务越来越适合交给 Agent。过去企业需要很多人的原因之一,是软件生产本身非常耗费人工;当生产代码的成本快速下降以后,开发团队的结构当然会发生变化。

最近的一些就业数据已经开始出现这种差异。

Stanford Digital Economy Lab 在2026年8月更新的一项研究中,分析了覆盖数百万美国劳动者的 ADP 薪资数据。研究并没有发现 AI 已经造成全经济范围的大规模岗位消失,但在 AI 暴露程度较高的职业中,22至25岁年轻劳动者的就业水平,相对于低暴露同行应该达到的趋势已经低了19%,而经验更丰富的劳动者没有出现类似缺口。软件开发正是研究列出的高 AI 暴露职业之一。

另一项2026年9月发布的研究规模更大,分析了41个国家12.5亿条招聘信息和1.54亿条就业记录。研究者发现,企业采用生成式 AI 以后,Junior 员工在员工结构中的占比相对下降。不过这里有一个很重要的细节:这种变化主要不是来自 Junior 员工大规模减少,而是 Senior 员工增长得更快。

我觉得这个结果比“AI 会不会让程序员失业”更值得讨论。

AI 对程序员的影响,很可能不会平均发生。

那些工作内容主要集中在“把一个已经定义清楚的问题实现出来”的人,会承受更大的压力;而能够自己定义问题、理解业务、设计系统、判断风险,并且能够调度 AI 完成大量执行工作的人,生产力反而可能被进一步放大。

过去一个优秀程序员和普通程序员,也许只是代码质量和开发速度的区别。以后这种差距可能会变成,一个人能不能带着几个甚至几十个 Agent,同时管理更大的系统范围。

这并不意味着 Senior 天然安全。所谓经验如果只是记住更多 API、框架用法和语法细节,同样很容易被模型覆盖。真正留下来的经验,应该是知道一个复杂系统为什么这样设计、业务真正关心什么、哪些地方不能出错,以及出现异常以后怎样最快建立一个靠谱的假设。

程序员价值,可能越来越取决于“业务×技术×AI”

这些年有一种观点很流行:程序员会成为最早被 AI 淘汰的职业之一。这个判断不能说完全没有道理,因为程序员创造的东西恰好就是代码,而代码又是大模型最容易大量学习和验证的内容之一。

但经历这次故障以后,我更倾向于认为,我们过去可能把“程序员”和“写代码的人”看成了同一件事情。

在很长一段时间里,两者确实高度重合,所以这个区别没有那么重要。但 AI 正在把它们拆开。

一个未来的软件工程师,也许绝大多数代码都不是自己写的。他需要做的事情可能变成:理解业务到底要解决什么问题,设计系统怎样实现,用 Agent 完成具体任务,然后根据测试、日志和生产数据判断结果是否正确。出了事故以后,他还要知道应该先怀疑哪里。

这种能力很难简单叫作“编程”,但它依然属于软件工程,而且可能比过去更依赖技术经验。

我现在做项目,越来越能感受到这种变化。

我的代码写得越来越少,但我反而不能比以前更不了解系统。如果业务流程不清楚,架构不知道,Agent 为什么这么改也不关心,那么所谓“99%的代码都由 AI 写”,并不一定是一件值得炫耀的事情。它也可能意味着,项目里产生了越来越多没有人真正理解的代码。

前几天那个故障处理完以后,我没有改多少代码,甚至整个排查过程中最费时间的工作都是 DeepSeek Harness 做的。

但如果再来一次类似问题,我还是希望自己看到客户描述的那一刻,脑子里能够马上出现那张系统地图。

因为至少从目前来看,代码已经越来越便宜了。

真正稀缺的,是有人知道这些代码为什么存在,它们和业务怎样连接,以及当系统不再按照预期运行时,应该从哪里开始找答案。

苏姿丰花82亿美元请来李飞飞,AMD真正缺的可能不是更快的GPU

9月28日,AMD宣布签署协议,以约82亿美元的全股票交易收购李飞飞创办的World Labs。交易预计在今年底前完成,仍需监管批准;完成后,李飞飞将出任AMD执行副总裁兼首席科学家,直接向苏姿丰汇报。

这笔交易刚出来时,我第一反应也是:AMD开始押注World Model和Physical AI了。World Labs做的正是这件事。它最新发布的Atlas,可以从文本、图片、视频和3D信息生成、重建和模拟空间环境,应用目标包括机器人、设计和仿真。

但看完苏姿丰和李飞飞接受Bloomberg的联合采访后,我觉得这还不是这笔交易最值得讨论的地方。

苏姿丰在采访里说了一句话:硬件、软件、系统和模型层之间的联系越来越紧密,“你对端到端理解得越多,就越能做出更好的系统”。AMD自己的收购公告说得更直接:World Labs会让AMD更深入理解新模型的工作负载如何变化,并据此影响未来技术路线图。

这句话让我重新看了一遍这82亿美元。AMD当然是在买李飞飞、World Labs的研究团队和World Model技术,但它可能同时在买一种对芯片公司越来越重要的能力:比别人更早知道,下一代AI究竟会怎样使用计算。

AMD已经有GPU了,为什么还需要自己的模型团队

如果AMD只是看好Physical AI,其实不一定非得把World Labs买下来。

AMD本来就是World Labs的投资人,双方从去年开始已经在做模型训练和AMD GPU上的推理优化。今年2月,World Labs刚完成10亿美元融资,投资人除了AMD,还有Nvidia等公司。World Labs在宣布加入AMD时,用了一个很值得注意的说法:为了继续往前推进,它需要扩大规模,并且“更接近硬件”。

李飞飞在采访中的解释更直接。她说,World Labs的野心越来越大,对算力的需求也越来越大;如果和AMD结合,可以加速软件与硬件之间的“flywheel”。模型可以利用最新硬件提高训练、推理和服务效率,而硬件也能从前沿模型那里提前看到未来工作流和需求。

所以,World Labs对AMD的价值,不只是今天已经做出来的Atlas,更是它每天研究下一代模型时,会不断碰到哪些计算瓶颈。

这一点很重要。AMD现在已经把Instinct GPU推进到年度迭代节奏,MI500计划在2027年推出,MI600计划在2028年推出,后面还有新的rack-scale系统。硬件可以一年更新一代,但一颗高性能芯片背后的架构、内存、互联和系统设计,不可能等模型发布以后才临时决定。

问题就出在这里:当硬件真正交付时,你之前判断的“重要AI workload”,还是不是那时最重要的workload?

模型变了,GPU需要优化的问题也会跟着变

过去几年,大部分AI算力讨论都围绕LLM展开,所以我们很容易把“AI GPU”理解成一个相对稳定的东西:矩阵运算更快、显存更大、互联更强,就能服务更大的模型。

但AI现在已经不是只有LLM这一种工作负载了。训练和推理的需求就不同,Agent带来长时间、交互式推理,视频和多模态模型处理的数据更加复杂,World Model和机器人还要处理空间、时间、3D环境和模拟。

Atlas就是一个很具体的例子。它并不是把LLM换成更大的Transformer,而是一个多模态的自回归扩散Transformer,既可以使用LLM常见的KV Cache、服务路由等技术,又具有图像、视频扩散模型的计算特征,还要维持3D空间一致性。World Labs也明确表示,Atlas会随着训练算力增加继续提升。

我并不是说World Model一定会成为下一代AI的主流,更不能因为AMD花了82亿美元,就倒推Physical AI一定会成功。但至少它说明了一件事:未来AI的计算需求会比今天更分散,芯片公司要服务的已经不只是“更大的LLM”。

这时,前沿模型团队就有了另一种价值。它不只是芯片的客户,也可能变成芯片研发的一种“传感器”——模型在哪里变慢、内存在哪里不够、数据搬运哪里浪费、推理为什么延迟高,这些问题会比一份市场报告更早暴露下一代硬件需要解决什么。

OpenAI往下造芯片,AMD往上买模型,走到的是同一个地方

让我觉得这个判断更有意思的,是OpenAI今年做了一个几乎相反的动作。

6月,OpenAI和Broadcom公布了第一颗自研AI推理芯片Jalapeño。OpenAI没有只说“我们也要造芯片”,而是专门解释这颗芯片为什么这么设计:它来自OpenAI对模型、kernel、serving system、内存移动、网络以及真实产品负载的长期理解。Jalapeño还试图通过减少数据移动、重新平衡计算、内存和网络资源,让真实利用率更接近理论能力。

换句话说,OpenAI认为,自己每天运行ChatGPT、Codex和API得到的经验,可以直接写进芯片架构。

这和AMD买World Labs看起来方向完全相反。OpenAI原本在模型层,现在往下进入芯片;AMD原本在芯片层,现在往上建立自己的Frontier Model团队。但两边最后解决的是同一个问题:模型和硬件之间的反馈链太长了。

以前模型公司提出需求,云厂商反馈给芯片公司,芯片公司再做下一代产品。等硬件真正出来,模型架构、推理方式甚至产品形态可能已经变了一轮。如果能让做模型的人更直接参与计算平台定义,或者让造芯片的人直接看到模型研发最前沿发生了什么,中间的信息损耗就会少很多。

AMD补的不是所有东西,而是这个反馈闭环

把AMD过去两年的动作串起来看,会更容易理解World Labs为什么会出现在这里。

2024年,AMD花约6.65亿美元收购Silo AI,补模型和AI软件能力;2025年完成ZT Systems收购,补大型AI系统和rack-scale设计能力;现在再用82亿美元买World Labs,把前沿模型研究也拉进来。

但我不太愿意把这简单概括成“AMD要做全栈”。一个很有意思的细节是,AMD完成ZT Systems收购之后,又把数据中心基础设施制造业务卖给Sanmina,自己保留rack-scale系统设计和客户支持能力。

这说明AMD未必想什么都自己做。制造可以交给合作伙伴,但系统怎么设计、软件怎么优化、模型需要什么,这些会直接影响下一代芯片的环节,它希望离自己更近。

当然,这笔收购并不能证明AMD从此会比Nvidia更懂AI。AMD本来就和OpenAI、Anthropic、Meta等模型公司有深入合作,外部客户同样可以告诉它真实需求;World Model最终能发展到多大,也还有很大的不确定性。

所以,我不会把这82亿美元理解成AMD找到了打败Nvidia的新武器。

但它确实让我看到,AI芯片竞争正在多出一个以前没有这么显眼的变量。我们过去总在问,下一代GPU能不能更快、显存能不能更大、能效能不能更高。这些当然还重要。但在模型快速变化、AI workload越来越分化的时候,芯片公司还有一个更麻烦的问题要提前回答:几年以后,最重要的AI究竟会怎样使用这颗GPU?

从这个角度看,苏姿丰花82亿美元请来李飞飞,AMD真正想缩短的,也许并不是下一颗GPU的研发时间,而是从“模型出现新的计算需求”到“AMD知道下一颗芯片应该怎么改”之间的距离。

更快的GPU仍然重要。但如果连未来的AI会需要什么都看不清楚,跑得再快,也可能跑错方向。

Gemini 4 Argon已经开始赢跑分了,但真正的考试还没开始

9月30日,Google终于发布了Gemini 4这一代的旗舰模型Argon。

Gemini 4 Argon

我看到消息后第一件事,其实不是去研究那张Benchmark表,而是想找地方试一下。因为我现在日常开发里,大量代码和具体任务都已经交给AI完成,一个新模型到底好不好用,我通常更愿意拿几个真实项目跑一遍。结果这一次不行:Google把模型、跑分,甚至API价格都公布了,但Gemini 4 Argon目前还没有开放给普通用户和普通开发者。

现在真正能用上它的,是Google通过Fairwind Program选择的一批网络安全防御者。Google表示,之后会逐步扩大到开发者、企业和消费者,第一批包括付费API客户和Google AI Ultra用户,但没有给出明确的公开时间表。

这让我觉得这次Gemini 4的发布挺有意思。

从已经公布的成绩看,Argon确实很强,一些指标甚至重新把Gemini推到了第一。但另一方面,大多数人现在讨论的“Gemini 4有多强”,其实仍然建立在Benchmark和少量早期测试上。我们知道它已经开始赢跑分,却还不知道它进入真实工作以后到底怎么样。

Google给出的解释是安全。

我相信这不是一个完全虚构的理由。但如果把今年Google整个旗舰模型的发布时间线放在一起看,我也很难相信,9月30日这个时间点与越来越激烈的模型竞争完全没有关系。

Gemini 4这次的成绩很好,但并不是所有项目都赢了

先说模型本身。

Google给Gemini 4 Argon的定位已经不是过去那种更聪明的聊天模型,而是专门针对长时间、复杂工作流设计的Frontier Model,重点放在软件工程、金融和法律这样的专业知识工作,以及网络安全。

这也反映在它公布的成绩里。

Gemini 4 Argon

在DeepSWE v1.1这个长周期软件工程测试中,Argon拿到77.9%;Zapier用来测试端到端企业任务执行能力的AutomationBench是51.3%,排名第一;在Vals Index中,它得到68.9%,同样排在第一。金融领域的Vals Finance Agent v2以及长视频理解LVBench,Argon的表现也相当突出。

Google甚至把单次输出Token上限从此前的64K直接提高到了100万。对于普通聊天来说,这个数字没有太大意义,但放在Agent里就不一样了。模型可以在一次长任务里进行大量推理、调用工具、修改代码再重新验证,而不用频繁中断上下文。Google内部已经让Argon Agent做C/C++到Rust的大规模代码迁移,其中包括超过80万行代码的Fuchsia Zircon内核;另一组Agent分析数据中心的性能数据后,Google称最终释放了超过300 TiB内存。

这些案例至少说明,Argon并不是一个只为了刷考试成绩做出来的模型。

但如果仔细看完整结果,又不能简单得出“Google已经全面超过OpenAI和Anthropic”的结论。Reuters也特别提到,在Google自己选择公布的四项Coding测试里,Argon有两项并没有领先。

第三方数据也差不多。

Vals目前把Argon放在综合Index第一,但在Code Migration中排名第二,CyberBench第二,Legal Research第四,一些任务甚至更低。Artificial Analysis给Argon High的Intelligence Index是53分,在223个模型中排第8。换句话说,这不是一款靠Google自己发布会才显得很强的模型,第三方测试同样证明它已经处于第一梯队;但“第一梯队”和“所有事情都是第一”,显然还是两回事。

Gemini 4 Argon

我反而比较喜欢这样的结果。

如果Gemini 4一发布,所有测试恰好全部第一,我可能还会更谨慎一点。现在这种有赢有输的状态,至少更像真实世界中的模型差异。

Google说暂时不开放是为了安全,这个理由并不牵强

Argon公布以后,一个很自然的问题是:既然模型已经训练好了,内部也用了这么久,为什么不直接开放?

Google给出的理由非常明确——安全。

而且这一次不是简单说一句“我们重视AI安全”就结束了。

Argon专门强化了网络安全能力。Google称它可以自主发现、验证并修复软件中的严重漏洞。在CWE-bench v1上得到68%,并列第一。网络安全公司Wiz通过Google的Fairwind Program测试Argon时,还让它发现了一个医疗软件中的严重漏洞,而此前一些Frontier Model没有找到。

问题也恰恰出在这里。

一款更擅长找漏洞的模型,对防御者很有价值,对攻击者当然也一样有价值。所以Google目前只向经过筛选的安全团队提供解除部分Cyber Guardrail限制的Argon,同时继续完善四类防护:恶意使用检测、间接Prompt Injection、Agent行为失配监控,以及高风险任务运行环境的Sandbox加固。Google还让Argon参加了美国政府的预发布模型访问流程。

我并不认为这些工作只是为了给延迟发布找理由。

现在的Agent和两三年前的聊天机器人已经不是同一种产品。以前模型回答一个危险问题,风险主要停留在“它说了什么”;今天的模型可以打开终端、写代码、访问网络、连续执行几十甚至几百个步骤,风险已经变成了“它会做什么”。

OpenAI自己的做法也说明这种担心并非Google独有。9月29日刚发布的GPT-6.1 Sol,在OpenAI的Preparedness Framework里就被评为网络安全Critical级别,并沿用了Astra的安全措施。

所以,如果问我Google是不是真的因为安全而暂缓Gemini 4大规模开放,我更倾向于认为:至少从目前披露的技术细节看,这个理由是成立的。

但这只解释了“为什么还不能全面开放”,并没有完全解释另一个问题:既然还没有准备好,为什么一定要在9月30日宣布?

安全可以让模型晚一点开放,竞争却不允许Google继续沉默

把时间往前倒几个月,这个问题就清楚多了。

Google原本准备推出的旗舰模型不是Gemini 4 Argon,而是Gemini 3.5 Pro。Sundar Pichai此前曾表示,这款模型预计在6月推出,但时间到了以后始终没有发布。7月份Reuters援引报道说,Gemini 3.5 Pro没有达到Google内部目标,特别是在Coding方面,因此发布时间被推迟。到Gemini 4 Argon发布当天,Google终于确认,Gemini 3.5 Pro已经不再计划发布。

与此同时,竞争对手没有停下来。

Anthropic在9月22日发布Claude Opus 5.5,9月28日又发布Sonnet 5.5;OpenAI在9月22日发布GPT-6 Sol和Luna,9月29日紧接着推出GPT-6.1 Sol。也就是说,Gemini 4 Argon发布前的一周,几家Frontier Lab几乎都在密集更新自己的主力模型。

所以我不太愿意把Google这次的选择解释成一个简单的阴谋故事:模型没准备好,于是拿安全当借口,先发跑分抢头条。现有证据并不能支持这么重的判断。

但另一方面,如果认为竞争压力在这里完全不起作用,也不太符合现实。

Google已经几个月没有交出原计划中的新旗舰,Gemini 3.5 Pro最后干脆被取消,而Anthropic和OpenAI还在持续更新。对于一家Frontier Lab来说,这时候“什么时候能够证明下一代模型已经存在”,本身就是竞争的一部分。

一个很有意思的细节是,Google甚至连Argon的价格都已经公布了:推广期每百万Token输入2美元、输出10美元,之后恢复到4美元和20美元。前一个价格刚好与GPT-6.1 Sol的标准价格处于同一水平,后一个价格则与Claude Opus 5.5一致。模型还没有真正走到普通开发者面前,性能、价格和市场定位其实已经开始竞争了。

这可能才是Gemini 4 Argon这次发布最值得观察的变化:一款模型“被发布”和“真正可用”,正在变成两个不同的时间点。

先公布能力,先进入排行榜,让第三方测试,让少量可信用户开始使用,再根据真实反馈和安全测试逐渐扩大范围。对于Google来说,这样做既没有完全放弃安全上的谨慎,也不需要因为安全工作尚未结束,就在模型竞争中继续保持沉默。

安全和商业竞争,在这里并不是二选一。

以后判断一个模型,可能需要看两张成绩单

这也是为什么我现在对Gemini 4 Argon的态度是期待,但不会因为几张Benchmark表就直接得出结论。

我平时实际使用Coding Agent时越来越明显地感觉到,模型在一次测试中能不能答对一道题,与它能不能把一个真实项目连续做几个小时,是两种能力。

真实使用中还有很多Benchmark不容易完全反映的问题:它能不能正确理解一个陌生代码库,连续几十次修改以后会不会把前面的约束忘掉,工具调用失败以后能不能自己恢复,会不会为了完成任务偷偷绕开要求,以及模型变得更谨慎以后,会不会又因为Guardrail太多而影响正常任务。

还有速度和价格。

一个模型能力高5%,如果推理时间增加一倍、Token消耗增加三倍,对大规模Agent任务来说,最终可能根本不是更好的选择。

所以我现在更愿意把模型的成绩分成两张表。

第一张是Capability:Benchmark、第三方Evaluation、安全测试,它告诉我们模型的能力上限在哪里。Gemini 4 Argon目前这张成绩单已经很好看,而且不仅是Google自己说好,Vals等第三方结果也基本证明它重新回到了最强模型的竞争区间。

第二张则是Product:真实项目、Agent长任务、稳定性、响应速度、成本,以及连续使用几周以后形成的体验。

Gemini 4现在还没有参加这场考试。

这两年我对各种“最强模型”的判断也越来越谨慎,因为每一代模型发布时,总能找到几个特别漂亮的数字。但等真正拿来写代码、查资料或者跑Agent以后,经常会发现模型之间的差异并不按照排行榜的顺序排列。有些模型考试厉害,却不一定适合长时间工作;有些模型Benchmark没有领先,在自己的工作流里反而更稳定。

Gemini 4会不会也是这样,现在谁都不知道。

9月30日看到Argon发布时,我其实还是挺高兴的。Gemini一直是我比较期待的一条模型路线,尤其Google同时拥有模型、TPU、Cloud、Search、Workspace和Android,它理论上比很多纯模型公司更有条件把AI真正变成产品。

这次Argon至少已经证明了一件事:Google没有因为Gemini 3.5 Pro的延期而掉出Frontier Model的竞争。

至于Google这一次先公布、后开放,究竟有多少来自安全考虑,又有多少来自竞争压力,我觉得没有必要强行选一个答案。安全问题是真实存在的,而在GPT和Claude连续更新之后,Google同样需要尽快证明自己的下一代旗舰模型已经来了,这两件事完全可以同时成立。

我现在更关心的是另一件事。

Google已经用Benchmark把Gemini 4 Argon的期待拉得足够高了。接下来不需要更多漂亮的排行榜,而是应该尽快把它真正交到用户手里。

到那个时候,Gemini 4真正的考试才算开始。

Muse、dots都来了,但Personal Agent到了中国可能要换一种玩法

9月8日,Meta发布Muse;9月29日,OpenAI又发布了dots。两家公司对Personal Agent的描述很接近:它不只是和你聊天,而是有自己的计算环境,能够持续记住偏好,在你不盯着它的时候继续做事。Muse运行在独立的Secure VM里,有自己的浏览器;dots也有自己的云电脑,而且OpenAI说它可以通过插件连接超过4000个应用。

我看到“4000个应用”这个数字时,反而比看到模型名称更感兴趣。因为我自己长期使用Coding Agent,很清楚一个Agent到底有没有用,往往不只取决于模型聪不聪明。模型知道下一步该怎么做是一回事,它有没有权限进入另一个系统,又是另一回事。

一个Personal Agent如果不能进入我的邮箱、日历、酒店会员、购物记录和支付服务,最后仍然只是一个更主动的Chatbot。

这也让我想到中国互联网。我们过去十几年恰恰走了一条和Web越来越远的路:大量服务从网页搬进App,又进一步被装进微信、支付宝这样的超级App。如果Personal Agent真的要替用户做事,它来到中国以后,首先撞上的可能不是模型能力,而是过去移动互联网留下的一堵堵生态墙。

超级App过去的成功,现在开始变成Agent的问题

我并不认为中国互联网从Web转向App是一件单纯的坏事。它在移动互联网阶段非常成功。登录、支付、社交、交易被放进同一个产品以后,用户体验更顺滑,商业转化也更高。

微信就是最典型的结果。腾讯披露,截至2026年一季度,微信和WeChat合计月活超过14亿;微信小程序在2024年促成的GMV达到8万亿元。用户今天在微信里不只是聊天,还可以买东西、挂号、缴费,很多事情已经不需要打开浏览器。

但这种便利有一个代价,就是服务越来越依附于平台边界。中国互联网公司之间长期存在网址屏蔽、服务互不开放的问题,严重到2021年工信部专门开展专项整治,把“恶意屏蔽网址链接”和“无正当理由限制其他网址链接正常访问”列为重点问题。

过去这更多被理解成平台竞争。到了Agent时代,它会变成一个直接的产品问题。比如我让Agent替我订大阪酒店,一个真正代表我的Agent,应该同时查询不同OTA、酒店官网、会员等级和历史订单,而不是先问我到底要在哪一家平台里完成。

Personal Agent围绕“我的意图”工作,而超级App过去十几年的商业逻辑,是尽可能把用户行为、交易和数据留在自己的生态里。这两套逻辑并不完全兼容。

每家公司都做自己的Agent,围墙其实还在那里

腾讯今年6月给投资者的材料里,直接说微信生态“非常适合大规模部署Agentic AI”,其中一个理由,是数百万个小程序可以成为AI Agent现成的Skills。

站在腾讯角度,这很合理。微信已经有支付、商家、小程序和社交关系,如果Agent直接长在微信里,当然比外部Agent更容易完成任务。

但我比较在意的是:这些Skill未来究竟只能被微信自己的Agent调用,还是用户选择的任何Agent,在得到授权以后都能调用?

如果微信Agent只能完整调用微信生态,淘宝的Agent天然优先使用阿里服务,抖音的Agent最容易操作字节自己的产品,那么我们只是把以前的App孤岛升级成了Agent孤岛。AI更聪明了,用户甚至不用自己点App,但背后的围墙还在那里。

所以我并不担心腾讯、阿里、字节做不出Agent。我担心的是,如果最后只是几家超级App各自在围墙里放进一个更聪明的管家,那么Personal Agent最有价值的一件事——代表用户跨平台组织服务——反而被削弱了。

Agent可能把“我的数据”重新变成一个实际问题

过去我们谈“数据属于用户”,很多时候比较抽象。用户即使能下载一份自己的数据,也很少有人真的拿走再做什么。

Agent改变了这里的实际需求。我不需要把过去三年的消费记录下载到电脑里,只需要授权:允许我的财务Agent读取过去一年的账单,或者允许旅行Agent读取我的酒店会员信息和历史订单。

这种需求已经和中国现有的数据权利框架产生了连接。《网络数据安全管理条例》第二十五条规定,在身份验证、数据来源、技术可行性等条件满足时,数据处理者应当为个人指定的其他数据处理者访问、获取相关个人信息提供途径。2026年8月发布的《大型个人信息处理者个人信息保护规定(征求意见稿)》又进一步提出,大型处理者应以通用或机器可读格式转移个人信息,并支持通过API等标准化技术方式提供转移途径。

当然,这不等于法律已经要求微信、淘宝把所有数据和操作接口开放给任何Agent,更不能理解成Agent可以随意读取隐私。但过去“数据可携”更像一种法律权利,Personal Agent可能第一次把它变成普通用户经常会用到的产品能力。

如果一个用户明确授权自己的Agent访问某项数据,那么平台为什么一定要把这项数据继续锁在自己的App里?这个问题以后会越来越难回避。

开放不一定免费,平台也可以换一种方式赚钱

平台不愿开放当然有现实理由。今天超级App的商业价值,很大一部分就来自它控制了用户入口、交易过程和数据。所以简单要求平台“免费开放一切”并不现实。

更可能出现的模式,是在用户授权的前提下,把数据和服务变成标准化能力,再按照调用收费。平台仍然赚钱,只是收入来源从必须把用户留在自己的界面里,增加了API、Skill、数据服务和交易能力的收入。

这里已经有一个可以参考、但不能简单类比的案例。国家发改委和国家数据局2025年建立公共数据授权运营价格机制时,允许数据产品和服务按照产品数量、服务次数、服务时间、数据调用量等方式收费。广州后来落地的试行方案,采用“基础技术服务费+公共数据产品和服务调用费”。

公共数据当然不等于商业平台数据,但它至少说明,数据并不是只有“圈住用户再变现”这一种商业模式。只要授权、计量、安全和责任机制能够建立,数据本身就可以成为被调用的服务。

这可能也是Personal Agent给中国互联网带来的更深变化。过去平台争的是谁拥有更多用户、更多时长;未来也许会增加另一种竞争:谁的数据更可靠,谁的接口更稳定,谁更愿意让用户授权给不同Agent调用。

对小公司来说,数据价值可能重新和流量价值分开

我一直觉得,移动互联网后期对小创业公司越来越不友好。一个团队即使拥有很好的产品,也要先解决获客:做App、买流量、运营账号、进入平台,然后和本来就拥有几亿用户的公司竞争。

Personal Agent如果最终形成开放调用生态,可能会把这两件事重新拆开。一家只有几十个人的公司,也许拥有全网最准确的日本温泉酒店数据;另一家公司只维护工业零部件数据库。这些业务今天很难让普通用户分别安装App,但未来用户根本不需要知道它们的App叫什么。

Agent只需要在合适的时候发现并调用最好的数据,然后按次、按Token、按交易或者按订阅向数据提供者付费。小公司竞争的重点就有机会从“我能不能抢到用户入口”,回到“我手里的数据和服务有没有别人替代不了的价值”。

当然,开放也不能变成另一种垄断。Amazon和Perplexity围绕AI购物Agent访问Amazon发生过诉讼,这说明平台与Agent的冲突并不是中国独有的。美国联邦上诉法院今年8月推翻了此前针对Perplexity购物Agent的临时禁令,而争议的核心之一,恰恰就是用户能否选择AI工具代表自己访问平台。

如果将来所有服务都开放了,却只能通过OpenAI、Meta或者某一家手机厂商的Agent触达用户,那么不过是把今天的超级App换成下一代超级Agent。

所以我期待的不是某一家公司的Agent成为新的总入口,而是用户能够选择自己的Agent,并决定它可以调用谁的数据;平台可以合理收费,但接口应该尽可能标准化,授权可以撤回,敏感数据只在必要范围内使用。

回头再看Muse和dots,我觉得它们真正有意思的地方已经不只是“AI终于可以替我们办事了”。

Personal Agent一旦真的代表用户行动,它迟早会问一个今天互联网不太愿意回答的问题:既然这些是我的订单、我的消费记录、我的会员关系,为什么我不能授权我选择的工具去使用它们?

如果这个问题最后真的被解决,那么到了中国,需要换一种玩法的也许不只是Personal Agent。

超级App本身,也可能要开始学习怎样在一个更开放的互联网里赚钱。

我把DeepSeek Harness接进生产环境后,发现AI运维真正改变的不是查日志

我最近在生产环境里做了一件以前不会太敢做的事情:给 AI 接上了线上日志、数据库和代码。

我的线上系统一直使用 ELK,应用日志最终都进入 Elasticsearch。平时出了问题,我会打开 Kibana,根据时间、接口、用户 ID 或关键字搜索日志。有时候日志只能告诉我“哪里报错了”,还得继续查数据库,看当时的数据状态;如果还不清楚,就再去代码仓库里找到对应的业务逻辑,一点点把问题串起来。

这其实是大多数程序员都很熟悉的排障方式。工具已经很好用了,日志也都在那里,但真正遇到线上故障的时候,还是得有一个人不断提出假设:先看看这个,再查查那个,然后根据得到的信息决定下一步去哪找。

最近我部署了 Elasticsearch 的 MCP 服务,又部署了数据库 MCP,同时在生产环境部署了 DeepSeek Harness,并给它一个只读账号读取 Git 代码仓库。

然后事情开始有点不一样了。

现在再遇到线上问题,我不一定需要先打开 Kibana。我可以直接在 DeepSeek Harness 里描述:“某个用户为什么调用这个接口失败?”或者“这个订单为什么一直停留在这个状态?”

接下来,它会自己去 Elasticsearch 找日志,发现某个业务 ID 后继续查询数据库,再根据异常位置去代码仓库看实现。如果原来的判断不成立,它还会回来重新查日志。

我自己的使用感受相当好。

一开始我以为,这只是把“人工查日志”变成了“AI 查日志”。用了几次以后,我发现真正省下来的并不是写几条 Elasticsearch 查询语句的时间,而是以前排障过程中最消耗人的那一段工作:不断寻找信息、建立关联、形成假设,再寻找新的证据。

这让我开始觉得,AI 对运维的影响,可能已经进入一个挺实际的阶段。

ELK已经把日志集中起来了,但调查故障的人一直没有变

很多公司这些年在可观测性上已经投入了不少钱。

应用日志进入 Elasticsearch,Kibana 用来检索;数据库有自己的管理工具;代码进入 Git;成熟一点的团队,还有 Prometheus、Grafana、APM、Tracing 和告警系统。

从“有没有数据”这个角度看,今天的软件系统其实已经比十年前透明得多。

可真正发生线上故障时,工作方式并没有发生同等程度的变化。

比如某个接口突然大量报错,我先在 Kibana 中按照时间范围查日志,发现错误可能和订单状态有关,再去数据库查这批订单。如果数据库中的某个字段异常,就回到代码看看这个字段在哪些地方会被修改,然后根据代码里的判断条件,再回 Elasticsearch 找另外一类日志。

这里面任何一个动作其实都不困难。

麻烦的是,没有一个系统知道下一步应该查什么。

Kibana 不知道数据库里某一行记录意味着什么,数据库也不知道哪段代码刚刚处理了它,Git 更不会因为看到一行代码,就主动跑去生产日志里验证自己的判断。

所以过去所谓的“可观测”,更多解决的是数据能不能被看到,却没有自动解决这些数据之间的关系。最后承担这个工作的,还是工程师的大脑。

这也是我这次使用 DeepSeek Harness 后最大的感受。

DeepSeek 官方把 Agent 描述为“Model + Harness”。模型负责理解和推理,Harness 则负责让模型使用工具、感知环境,并持续完成一个任务。

放到我的生产环境里很好理解:以前 AI 只能分析我复制给它的一段日志,现在它可以自己决定什么时候查 Elasticsearch,什么时候查数据库,什么时候去看代码。

这个差别其实很大。

MCP给AI增加的,并不只是更多上下文

很多人第一次接触 MCP,很容易把它理解成另一种插件系统:给大模型接几个工具,它就能查数据库、查 Elasticsearch。

这当然没错,但我觉得真正有价值的地方还在后面。

过去我把一段报错日志复制给 ChatGPT 或 DeepSeek,让它分析原因,模型只能在我提供的上下文里做判断。它如果缺少数据库状态,我要去查出来再复制进去;如果需要相关代码,我还要再把代码贴给它。

所以表面上是 AI 在分析,实际的调查流程依然是我在控制。

接入 MCP 后,关系变了。

我只需要提供最开始的问题,后续需要什么信息,可以由 Agent 自己决定。看到日志里的订单 ID,就调用数据库 MCP;怀疑某个条件判断有问题,就读取 Git 里的代码;代码里出现另一个关键字段,再回 Elasticsearch 搜索对应日志。

我更愿意把 MCP 在这里的作用理解为:它给了 AI 自己寻找证据的能力。

这也不是只有我在做这样的尝试。

Elastic 已经提供 Agent Builder 的 MCP Server,外部 Agent 可以直接调用 Elastic 的工具和数据;Grafana 也在通过 MCP 让 Agent 访问 dashboards、alerts、incidents 和数据源;Datadog 的 Bits Investigation 则会先形成关于故障原因的假设,再自动查询 metrics、logs、traces 和基础设施数据验证,如果证据不支持,就继续调整判断。

这条路线和过去“AI 帮我写一条查询语句”已经不是一回事了。

以前是人决定查什么,AI 帮忙执行;现在开始变成,人描述问题,Agent 自己决定需要哪些证据。

真正省下来的,是工程师寻找证据的时间

我以前排查线上问题,有一个很明显的感受:最花时间的往往不是解决问题。

很多时候,知道原因以后,真正的修改可能只有几行代码。

大量时间花在“不知道原因”。

你得先找到一条异常日志,然后沿着它往下追;发现一个字段不对,继续查数据库;看到一个状态异常,又去查这个状态由哪些代码修改;看到代码以后,再回过头验证线上究竟走了哪个分支。

资深工程师之所以通常比新人排障快,并不是因为他搜索 Kibana 的速度快几倍,而是因为他更知道下一步应该查哪里。

而这恰好是 Agent 很适合承担的一类工作。

Grafana 今年公开过一次内部真实事故,他们让 AI Assistant Investigations 和值班工程师同时调查。AI 大约 8 分钟找到根因,而工程师团队约 28 分钟后得出相同结论。

一个案例当然不能证明以后所有故障都能快 3.5 倍,但至少和我的实际体验能够互相印证:AI 在运维中最先有价值的部分,很可能就是第一轮 investigation。

我并不认为这意味着公司以后可以把 SRE 或运维团队裁掉。

运维还有发布、容量规划、架构治理、安全、应急决策,以及最重要的生产责任。这些都不会因为 Agent 会查日志就消失。

但如果一个资深工程师以前一次事故需要花半小时甚至几个小时搜集证据,而 Agent 能先完成其中相当一部分工作,那么节省下来的其实是很贵的人力时间。

至少在我自己的系统里,这已经不是一个概念了。

企业可能不需要再造一套“AIOps平台”

这次实践还有一点让我觉得挺有意思:为了让 AI 做这些事情,我其实没有重新建设自己的运维系统。

日志还是原来的 Elasticsearch,数据库还是原来的数据库,代码还是 Git。

我增加的只是 MCP 和 Harness。

这和过去很多企业做 AI 项目的思路不太一样。以前一说智能运维,很容易想到再建设一套 AIOps 平台,把各种日志和监控数据重新采集进去,再做分析、告警和预测。

Agent 这条路线更像是在现有基础设施上增加一个新的“使用者”。

原来的系统继续负责保存事实,MCP 把这些能力暴露出来,Harness 再决定什么时候调用哪个工具。

这可能会成为企业 Agent 落地一个很现实的方向。

很多企业其实并不缺数据。代码、客户、订单、日志、监控、知识库全部已经数字化了,只不过它们长期存在不同的软件里,而且这些软件过去主要是给人操作的。

当越来越多系统开始提供 MCP 或类似接口以后,企业未必需要先建设一套新的“AI 系统”。更现实的做法,可能是让 Agent 逐渐获得调用现有系统的能力。

生产运维只是其中一个很容易看到价值的场景。

我现在更愿意让AI“读生产”,而不是“改生产”

当然,这件事情还有一个不能绕过去的问题:权限。

我目前给 Elasticsearch、数据库和代码仓库的权限都尽量保持只读,这并不是偶然。

因为 Agent 一旦拥有生产系统权限,它犯错误的方式和普通聊天机器人已经完全不同。聊天机器人判断错了,最多告诉你一个错误答案;拥有数据库、Shell 或部署系统权限以后,一个错误判断可能真的变成生产事故。

DeepSeek 自己对此也说得很明确。目前 DeepSeek Harness 仍然是 developer preview,官方安全说明写明它还没有经过安全审计,不应被视为 production-ready;模型生成的命令、第三方插件,以及它能够访问的网络、文件和凭据,都可能带来风险。

所以我的实际使用,并不意味着我建议大家直接给 DeepSeek Harness 一个生产服务器的 root 权限。

恰恰相反。

至少现阶段,我更看好一种比较保守的 AI 运维方式:让 Agent 尽可能完整地“看”生产环境,但把“改”生产环境的权限留给人。

它可以读取日志、查询数据库、查看代码、分析监控、形成故障假设,最后告诉工程师:“我认为原因在这里,这是我找到的证据。”

至于是不是修改数据库、重启服务、回滚版本,还是由人确认。

这种方式听起来没有“全自动 SRE”那么性感,但我觉得更容易真正进入企业。

前几天再遇到一个线上问题时,我已经很自然地先打开了 DeepSeek Harness,而不是 Kibana。

这大概是我判断一个工具有没有真正改变工作方式时比较看重的信号:不是 Demo 看起来多厉害,而是发生问题时,我自己的第一反应开始变了。

ELK 这些年已经很好地解决了“生产环境发生了什么”。现在 MCP 和 Agent Harness 正在尝试解决下一件事:当所有证据都在那里以后,谁来把它们找出来并拼在一起。

过去这个人通常是一个有经验的工程师。

现在,至少第一轮调查,我已经开始愿意先交给 AI 了。

GPT-6 Luna比DeepSeek还便宜,AI模型真正的价格战才刚开始

GPT-6 Sol和Luna发布以后,我第一眼看的并不是Benchmark,而是价格。

GPT-6 Luna,100万输入Token 0.1美元,输出0.5美元。

我又回头看了一下两周前刚刚发布的DeepSeek V4.1 Flash。即使按照空闲时段计算,缓存未命中的输入也要0.15美元,输出0.6美元;高峰时段则分别是0.3美元和1.2美元。换成人民币,DeepSeek空闲时段是每百万输入Token 1元、输出4元,高峰时段是2元和8元。

也就是说,至少按照最普通的API价格计算,GPT-6 Luna已经比DeepSeek V4.1 Flash便宜了。

这个结果挺出乎我意料。

过去两年,中国开放权重模型与OpenAI、Anthropic这些美国闭源模型之间,已经形成了一个很容易理解的市场印象:最好的模型还是美国公司做,但如果你需要大量调用、特别在意成本,DeepSeek、Kimi、GLM这一类中国模型会便宜很多。

现在OpenAI自己把这个价格差打掉了。

但我后来仔细算了一下,发现事情又没有“OpenAI终于比DeepSeek便宜”这么简单。因为当AI开始从聊天工具变成可以连续工作几个小时的Agent以后,我们以前习惯用来比较模型价格的“每百万Token多少钱”,可能已经不太够用了。

GPT-6这次最值得看的,其实是价格

9月22日,OpenAI发布GPT-6 Sol和Luna。Sol的API价格降到每百万输入Token 2美元、输出10美元;Luna则是0.1美元和0.5美元。OpenAI把这次调整概括为相比GPT-5.6促销价格大约降低一半,并明确提到,缓存和推理基础设施效率改善,让它可以把成本下降传递给用户。

这与过去几次新模型发布给我的感觉不太一样。

通常新一代模型出来,大家首先讨论的是又提高了多少Benchmark、数学题提高多少、代码能力超过谁。但GPT-6 Sol和Luna这一次,至少从第三方测试看,能力并没有出现与价格变化同等幅度的跃迁。

Artificial Analysis的测试中,GPT-6 Luna在Coding Agent Index上得到41分,比GPT-5.6 Luna还低2分;但它完成同一套测试的任务成本下降了大约60%。Artificial Analysis因此把这次发布最明显的变化总结为成本效率,而不是智能指标全面跃升。

这并不是说GPT-6没有进步。OpenAI自己的DeepSWE v1.1测试里,Luna在max effort下达到66.6%,Sol达到68.8%,已经是很能干的Coding Agent模型。

只是我更在意另一件事情:OpenAI开始主动把一个能力相当不错的模型,卖到了过去只有中国低价模型才会出现的价格区间。

这意味着“美国模型贵、中国模型便宜”这个过去相当好用的判断,已经开始失效。

0.1美元是真的,但“更便宜”没那么简单

如果只看官网价格表,Luna确实赢了。

GPT-6 Luna普通输入是0.1美元,DeepSeek V4.1 Flash空闲时段是0.15美元;输出则是0.5美元对0.6美元。到了DeepSeek高峰时段,差距还会扩大到0.1美元对0.3美元、0.5美元对1.2美元。

但Agent最有意思的地方,恰恰是大量输入并不是第一次出现。

比如一个Coding Agent工作时,会不断读取项目代码、系统提示词、工具定义、AGENTS.md、之前的对话和执行结果。这些内容下一轮往往还要继续使用,所以Prompt Cache,也就是把已经处理过的上下文缓存起来重复利用,会越来越重要。

这时候DeepSeek的优势又回来了。

GPT-6 Luna缓存读取的价格是每百万Token 0.01美元,而DeepSeek V4.1 Flash空闲时只有0.003美元,高峰也只有0.006美元。OpenAI还对第一次写入缓存收取普通输入价格的1.25倍,也就是Luna每百万Token 0.125美元。

长上下文也一样。GPT-6 Luna虽然提供105万Token上下文,但输入一旦超过272K Token,整个请求的输入和缓存价格都会变成两倍,输出价格则提高50%。

举一个很简单的例子。假设一个长任务需要100万输入Token,再生成10万Token,而且完全没有缓存命中,那么GPT-6 Luna大约需要0.275美元;DeepSeek V4.1 Flash空闲时大约0.21美元,高峰时则是0.42美元。

于是一个看似很简单的“谁便宜”,突然有了三个答案。

短任务可能Luna便宜;大规模长上下文任务,DeepSeek空闲时可能更便宜;到了高峰时段,结果又反过来。

这也是我觉得这次价格变化真正有意思的地方。以后再拿两个模型比较,只看官网上那两个醒目的input/output数字,很可能会越来越不准确。

Agent正在改变“模型价格”这件事

我现在日常开发里,95%以上的代码已经交给AI完成。之前做DoseLoop的时候,甚至做到了100%由AI生成代码,我自己没有手写。

这种使用方式和在ChatGPT里问一个问题差别很大。Coding Agent会自己读文件、搜索代码、调用工具、修改、运行测试,失败以后再回去检查,然后继续修改。一个任务跑几十轮并不奇怪。

所以我现在看模型价格,越来越少问“100万Token多少钱”,而是会问另一个问题:

这件事情让它做完,到底多少钱?

OpenAI这次发布GPT-6时公布了一个很能说明问题的数据:按照API价格折算,它内部研究人员使用Coding Agent产生的每日Token消费,中位数已经超过600美元,90分位超过7000美元。这里当然不是说OpenAI真的每天向员工收7000美元,而是用公开API价格衡量内部消耗量。它真正说明的是,当Agent开始持续工作后,单个用户能够消耗的Token规模和聊天时代完全不是一个数量级。

DeepSeek显然也看到了同一个问题。

V4.1 Flash用了552B参数的MoE架构,但输入阶段每个Token只激活约8B参数,输出阶段约16B;更关键的是,它把KV Cache对HBM的需求压到上一代的1/4,对SSD的需求压到1/8。DeepSeek自己解释得很直接:Agent场景中,缓存命中的费用往往占比较高,所以压缩KV Cache就是在降低Agent长期运行的成本。

两家公司走的技术路线不同,但最后解决的其实是同一道商业问题:怎样让AI持续工作变得足够便宜。

过去模型调用更接近买一次答案,现在越来越像租一名按计算量收费的数字员工。它可能连续干几个小时,中间不停读取上下文、调用工具和尝试解决问题。到了这一步,模型公司即使把每个Token的价格降一半,只要Token消费量扩大几倍,整个市场反而可能更大。

所以我并不认为OpenAI这次降价只是简单的价格竞争。它更像是在为Agent时代提前重新定价。

当“便宜”不再属于DeepSeek,开放权重反而要重新证明自己的价值

这件事情对DeepSeek也提出了一个挺有意思的问题。

如果以后OpenAI、Google这些公司都能把低成本模型做到每百万Token几毛钱甚至更低,那么开放权重模型还能靠什么竞争?

DeepSeek V4.1 Flash是一个552B参数、支持100万Token上下文的开放权重模型,采用MIT许可证,可以下载、自行部署和修改。

当然,这里也不能把“开放权重”理解成普通公司下载以后找几张GPU就能跑。552B参数仍然是一个很大的模型,DeepSeek自己在谈大规模部署时,甚至举过“2000张GPU加存储集群”的例子。

但开放的意义本来也不应该只等同于便宜。

它意味着企业可以决定模型运行在哪里,数据留在哪里,选择什么推理框架,怎样优化自己的Harness,以及未来要不要从某一家云和API服务商迁走。

过去这些价值很容易被“DeepSeek便宜十倍”这个更简单的故事盖住。现在如果闭源模型的Token价格也被压下来,开放权重真正的价值反而会变得更清楚。

API价格是最容易复制的竞争优势之一。今天DeepSeek降价,明天OpenAI可以降;OpenAI降完以后,Google也可以继续跟。

但控制权没这么容易复制。

下一轮价格战,要算的是“完成一件事多少钱”

所以GPT-6 Luna出来以后,我越来越觉得,AI模型接下来的价格比较需要换一个单位。

以后企业选模型,至少要同时看Token价格、一个任务需要多少Token、缓存命中率、长上下文收费、推理强度,以及最终任务成功率。

一个模型每百万Token只要0.1美元,如果它需要尝试五次才能把程序改对,未必比一个0.3美元、一次完成的模型便宜。反过来也一样,一个旗舰模型能力可能强10%,但价格高20倍,如果任务只是批量改代码、整理文档或者执行已经拆解好的步骤,这10%的能力未必值得。

这其实也是我自己使用AI Coding越来越明显的感受。我并不需要所有任务都交给最强模型。真正复杂的架构、判断和任务拆解可以用更强的模型,大量执行工作完全可以交给Luna、DeepSeek Flash这一类便宜得多的模型。模型越来越多以后,“选一个最好的模型”本身可能就是个错误问题,更现实的方式是按照任务动态分配。

回到最开始那个0.1美元。

GPT-6 Luna确实已经比DeepSeek V4.1 Flash普通Token的牌价更低,这件事情放在一年前,我大概很难想到。

但看完缓存、长上下文和Agent的实际消耗以后,我反而觉得,“OpenAI比DeepSeek便宜了”并不是这次变化最重要的结论。

它更像一个信号:当每百万Token的价格开始被压到足够低以后,单纯卖便宜Token会越来越难成为一家模型公司的长期优势。

接下来真正要比的,是同样花一块钱,谁能让AI完成更多真实工作。

如果这个变化继续下去,AI模型的价格战确实才刚刚开始。只是下一轮的价格标签,可能不会再简单写着“每百万Token多少钱”。

看完Anthropic那份154页威胁情报报告,Claude你还敢用吗?

这两天我一直在看 Anthropic 9 月 10 日发布的那份 154 页威胁情报报告。里面有很多很容易上新闻的内容:有人用 Claude 做网络攻击、监控系统、武器软件,还有多家中国 AI 公司被 Anthropic 指控通过各种方式蒸馏 Claude。

但我看完以后,最先做的一件事不是研究这些攻击者,而是重新检查了一遍自己 Claude Code 的权限。

我现在日常开发已经大量依赖 AI Coding。Claude Code 对我来说,也早就不是一个偶尔问几句代码的聊天机器人,而是会自己读项目、找文件、跑命令、改代码、做测试的执行工具。为了让它真正自动干活,我也会逐渐减少那些反复弹出来的确认。因为 Agent 每走一步都问一次“可以吗”,自动化就很难真正跑起来。

以前我当然知道 Claude 是云端模型,知道 Prompt 会发送给 Anthropic。但这份报告让我第一次很具体地意识到:当 Claude Code 获得越来越多本地权限以后,我交给它的已经不只是几段代码,而是越来越完整的工作环境;与此同时,Anthropic 也并不是一个只负责“收 Prompt、回答案”的模型供应商,它有能力调查平台上真实发生的用户行为。

这两件事放在一起,我对 Claude 的看法开始变了。

Claude Code并不能随便看你的电脑,但它本来就比聊天框看得多

先把最容易被夸大的地方说清楚。Claude Code 安装以后,并不会自动获得整台电脑的完全访问权。

Anthropic 官方文档明确说明,Claude Code 默认采用严格的只读权限。修改文件、执行可能改变系统的 Bash 命令,需要进一步授权;默认只能写启动目录及其子目录,Read、Grep、Glob 要读取这个边界之外的路径,也会再次询问。Anthropic 甚至把跳过权限检查的参数直接叫作 --dangerously-skip-permissions。

所以,“装了 Claude Code,Anthropic 就能把你硬盘全部看光”,这个说法并不准确。

但从实际使用来看,另一件事也同样真实:Claude Code 的价值,本来就来自它能够主动获取上下文。你问它一个项目为什么启动失败,它会自己找配置、日志和相关代码;你让它修改一个功能,它会在整个 Repository 里查调用关系。过去用聊天机器人,我基本知道自己给模型看了什么,因为内容是我主动复制进去的;现在用 Agent,更需要关心的是,它为了完成任务还会自己去找什么。

而且权限通常会越用越宽。Allow List、Sandbox、Accept Edits 这些设计之所以存在,就是因为如果所有动作都逐次确认,Agent 的效率会明显下降。Anthropic 自己也建议敏感代码使用项目级权限、Dev Container,并定期通过 /permissions 检查授权范围。

我自己的体验很简单:AI Coding 越深入,开发者越容易为了效率把权限开大。不是 Claude 偷偷拿走了权限,而是我们为了让它更有用,会主动交出去。

终端在你的Mac里,真正做判断的Claude却不在

Claude Code 很容易给人一种“本地工具”的错觉。它运行在 Terminal 里,文件读取和 Shell 命令也发生在自己的电脑上,所以直觉上会觉得代码还在本地。

其实只对了一半。

Claude Code 客户端确实运行在本地,但真正理解代码、决定下一步做什么的 Claude 模型仍然在云端。为了完成推理,需要进入模型上下文的信息要发送给 Anthropic。Anthropic 自己的文档也把 Claude Code 的本地运行、数据访问以及云端模型处理分开说明。

当然,这不等于 Claude Code 能访问的每一个文件都会自动上传。“拥有读取权限”和“内容已经进入模型上下文”是两件不同的事。

问题在于,Coding Agent 天然需要大量上下文。

一个真实项目里除了源代码,还有 .env、数据库连接、云服务配置、错误日志、内部 API、测试数据、客户资料,有时候还有开发者为了省事直接写进配置里的 Token 和 Secret。

Anthropic 这次报告里就披露过这类敏感内容。以它对 DeepSeek 的指控为例,Anthropic 声称部分被转发到 Claude 的请求包含一家中国科技公司的内部 AI 项目规格、组织结构和战略目标,以及俄罗斯政府数据库的有效凭据。这里必须强调,这些具体归因目前仍然来自 Anthropic 单方面调查,不能直接当成已经被独立证实的事实。

但对我来说,这已经足够提醒一个更普通的问题:真实开发环境里的敏感信息,本来就和代码混在一起。一旦 Agent 可以理解整个工作环境,隐私边界自然比一个聊天框大得多。

更让我在意的是,Anthropic有能力调查现实中的用户使用行为

如果只是“数据要发到云端”,其实不是什么新鲜事。真正让我重新评估 Claude 的,是这份报告里 Anthropic 展示出来的调查能力。

报告一开始就写得很明确:过去八个月,Anthropic 的 Threat Intelligence 团队识别并中断了多类利用 Claude 的恶意活动,并根据调查结果加强自己的安全机制,在适当情况下还会把情报提供给政府部门和行业伙伴。

后面的案例要具体得多。

Anthropic 称,它在一项持续性的网络间谍调查中,把操作者判断为“可能居住在湖南长沙的中文使用者”,进一步称其中两人是湖南某高校本科生,其中一人曾在深信服实习,并正在面试奇安信的攻防岗位。报告还描述了这些人攻击的大约 50 个组织,以及他们如何维护长期任务、凭据和 Agent 工作流。

到了常规武器部分,Anthropic 甚至非常直接地写道,过去这类活动通常要由政府、联合国专家组或者外部调查人员,通过缴获设备和公开信息慢慢还原;但作为前沿模型提供商,只要检测到违反政策的活动,Anthropic 自己就可以识别这些行为、封禁账户,再把调查信息提供给公共和私营部门伙伴。

我觉得这几段比任何一句“我们重视用户隐私”都更值得认真看。

当然,这不能推导成“Anthropic 员工可以随意查看每一个普通用户的代码”,报告里的身份归因也并非全部经过第三方独立验证。Anthropic 当前的政策也明确表示,被安全保留的内容默认不能由员工直接阅读,只有自动系统标记以后,少量授权人员才能通过受控流程审核,访问还会被记录。

但至少有一点已经很清楚:Anthropic 有能力把请求、账户、行为模式、工具链和长期活动放在一起调查,并在一些案例里进一步关联到现实中的组织和人员。

站在安全公司的角度,这是能力;站在用户角度,它同时也是一种平台权力。

“不拿代码训练”已经不足以让我放心

Anthropic 并没有说所有 Claude Code 数据都会拿去训练,这一点也必须说清楚。

对于 Free、Pro、Max 等个人用户,如果允许 Model Improvement,聊天和 Coding Session 可以被用于改进 Claude,相关数据可能以去标识形式在训练流程中保留最多 5 年。更值得注意的是,如果会话被自动系统标记为违反 Usage Policy,输入输出可以保留最多 2 年,Trust & Safety 的分类分数最长可以保存 7 年。

商业产品则不同。Claude for Work 和 Anthropic API 默认不会使用客户的输入输出训练生成模型;API 标准情况下通常在 30 天内删除输入输出,部分企业客户还可以申请 Zero Data Retention。

所以,简单写成“Claude 会拿你的代码训练”,是不准确的。

但我现在越来越觉得,“会不会训练”只是隐私问题的一部分。

对于一个高权限 Agent,我更在意的是:它能够访问什么,哪些内容会进入模型上下文,平台为了安全能够观察到什么,以及什么情况下这些数据会被保留和调查。

Anthropic 对 Covered Models 的政策其实把这个矛盾说得很清楚。它解释说,某些复杂攻击单看一次 Prompt 根本发现不了,必须跨多个请求观察行为模式。因此部分原本使用 ZDR 的企业环境,在调用指定的高能力模型时,也必须保留 30 天输入输出用于安全分析。

这个理由从安全角度完全讲得通。

但也正因为它讲得通,我才越来越确定:云端 Agent 的安全能力和我追求的隐私,并不总是在同一个方向上。

当替代方案开始够用,我没必要把所有项目都交给Claude

如果是两年前,我可能愿意继续接受这种交换。因为当时 Claude 在 Coding 上的优势很明显,很多任务没有真正好用的替代方案。

现在情况已经开始变化。

DeepSeek 9 月 10 日刚刚发布 V4.1 Flash。官方称它采用 552B 参数的 MoE 和新的非对称架构,输入只激活 8B、输出激活 16B,并表示它在一组 Agent Benchmark 上已经超过上一代 V4 Pro,同时还在推进开放权重生态、开源推理支持和更多部署选择。

过去我一直觉得国产 AI Coding 最大的短板并不完全在模型,而是在 Harness。现在这块也开始补上。

DeepSeek Harness 已经进入开发者预览,并开放源代码,采用 MIT License。模型、工具、Skills、Session、Sandbox、Storage、Loop、Scheduling 都可以插件化组合,而且 Agent 每一次看到的 Prompt、Tool Call、Context Injection,都能记录在可追踪的 Session Log 中。

我并不是说 DeepSeek V4.1 Flash 已经在所有 Coding 任务上超过 Claude,也不是说“开放权重”四个字天然等于隐私。如果最后还是调用云端 API,数据照样会离开自己的机器。

真正改变我选择的是,开放权重至少给了我本地化、私有部署和控制数据路径的可能,开放 Harness 也意味着我不必把 Agent 的权限体系完全绑定在一家闭源厂商手里。

对我来说,这已经够了。

以后普通项目、公开代码、低敏感度任务,我可能还会继续用 Claude 一段时间,但整体上我会逐渐减少 Claude 的使用。特别是相对敏感的项目,公司内部代码、还没有公开的产品、包含真实业务数据的系统,或者任何我不希望进入第三方云端调查体系的内容,我不会再把 Claude Code 作为默认选择。

这并不意味着 Anthropic 做错了什么。恰恰相反,这份报告说明它的安全团队很强,也说明它在认真打击滥用。

只是从用户的角度,我开始意识到:一个平台越有能力理解我在做什么,它就越不可能只是一个“什么都不知道的工具”。

Claude你还敢用吗?

所以这一次,我的答案和以前不太一样。

我不会今天就把 Claude 卸载掉,但会慢慢把它从“默认工具”降成“按场景使用的工具”。普通任务继续用,敏感项目退出 Claude。随着 DeepSeek V4.1 Flash 这样的开放权重模型越来越能打,DeepSeek Harness 这样的开放工具也开始补上 Agent 能力,我已经没有以前那么强的理由,把最敏感的开发上下文继续交给一个云端闭源 Agent。

过去我愿意用更多数据和权限,换 Claude Code 的效率。

现在这笔交换对我来说,已经没有那么划算了。

所以,可能真的是时候慢慢和 Claude 说 bye bye 了。

AI项目已经付了开发费,为什么以后还要继续付Token?

我最近在一个AI项目里,碰到一个以前做软件时很少需要解释的问题。

甲方对开发费用本身没有太大疑问,需求、开发、测试、上线,这套流程大家都熟悉。真正卡住的是上线以后:为什么系统已经开发完成,后面每个月还会继续产生Token费用?在传统项目的理解里,一套软件花钱做完、验收、交付,项目基本也就结束了。现在却变成系统用得越多,后面还有一笔持续增加的费用,这很容易被理解成“项目之外又多收了一笔钱”。

仔细想了一下,甲方有这个疑问其实很正常。过去二三十年,大部分企业就是按照“建设一个系统”的方式采购软件,预算也围绕功能范围、开发周期和人力成本来做。AI带来的变化,是在这套大家熟悉的成本结构上,又增加了一层以前没有这么明显的东西:智能本身也开始按使用量计费。

项目做完了,为什么费用没有结束

传统软件当然也不是只花一次钱。服务器、数据库、云存储、CDN、短信、许可证、运维,都可能是持续成本。企业其实早就在接受按量付费。

AI不一样的地方,是这种持续成本开始进入软件最核心的能力。过去做一个订单系统,计算金额、查询库存、生成报表,这些业务逻辑已经写在代码里。用户执行一次还是十次,会增加服务器负载,但通常不会因为每点一次按钮,就再向一个“订单计算服务商”支付一笔费用。

大模型不是这样。用户问AI一个问题,需要调用一次模型;让AI总结一份合同,要把合同内容送给模型处理;让Agent查资料、分析数据、调用工具再给出答案,背后可能发生多轮模型调用。每一次模型处理输入和生成输出,都在消耗计算资源。

Token就是模型厂商对这种消耗最常用的计量单位。DeepSeek官方文档把它定义为模型表示自然语言文本的基本单位,也是计费单元,费用根据输入和输出Token数量计算。不同模型的分词方式并不完全相同,所以企业不用纠结“一个Token到底等于几个汉字”,把它理解成“AI处理了多少信息”的计量单位就可以了。

如果一定要找一个甲方更熟悉的类比,我觉得它更接近电费。项目开发费相当于把设备和线路建起来,而Token是设备运行以后持续消耗的电。这个比喻并不完全准确,但至少能解释为什么“系统已经交付”和“以后仍然有使用成本”并不矛盾。

Token不是一个固定价格,它会随着AI怎么用而变化

以现在国内模型的API价格看,这件事情已经相当明显。DeepSeek目前的V4 Flash在工作日高峰时段,100万Token缓存未命中的输入价格是3元,输出9元;如果输入命中缓存,同样100万Token只要0.1元。V4 Pro对应的高峰价格则是输入9元、输出27元,而且空闲时段价格还是高峰的一半。

Kimi也是类似的结构。目前Kimi K2.6官方价格是缓存命中1.1元/百万Token、普通输入6.5元、输出27元;K2.5则是0.7元、4元和21元。 这里值得甲方注意的并不是哪家便宜几块钱,而是AI系统的成本已经和“用了哪个模型、一次塞进去多少资料、生成多长的答案、缓存有没有利用起来”直接相关。

举一个简单的例子。假设一个AI客服系统每天处理1万次请求,每次平均输入3000 Token、输出500 Token。按DeepSeek V4 Flash高峰期、缓存未命中的价格估算,一天大约消耗30M输入Token和5M输出Token,模型费用约135元,一个月大约4050元。如果业务增长到每天10万次,在其他条件不变的情况下,这一项就会变成每月约4万元。

这还只是一次问答。如果是Agent,一个任务内部可能需要反复读上下文、调用工具、检查结果再继续执行,成本会更复杂。所以同样一个已经开发完成的AI系统,100个人用和10万人用,后续费用显然不可能完全一样。

以前谈项目预算,我们主要是在估算“把东西做出来要多少钱”;AI项目上线以后,还需要多问一句:“这套智能以后被使用起来,一个月大概多少钱?”

理解Token,不等于接受一张没有上限的账单

说到这里,很容易走向另一个极端:既然AI按使用收费,那甲方是不是只能接受每个月用了多少Token就付多少钱?

我并不认为应该这样。Token是模型厂商的技术计量单位,但它不应该成为企业管理AI项目的最终单位。企业真正应该知道的是,这笔费用能不能预测,超过多少会预警,以及它对应了多少业务价值。

这也是为什么AI项目在设计阶段就应该把成本控制做进去。比如简单任务用便宜模型,复杂问题才切到更强的模型;重复出现的大段上下文尽量使用缓存;限制Agent一次任务最多执行多少轮;对不同部门设置调用额度;当月度成本接近预算时主动告警。DeepSeek同一款V4 Flash,高峰期缓存命中的输入价格只有未命中的三十分之一,这已经足以说明,Token成本本身也是产品和架构设计的一部分。

实际商务上也不一定非要把一张Token明细表直接扔给客户。可以是开发费加实际模型费用,也可以是每月固定费用包含一定使用额度;大型企业还可以自己持有模型厂商账户。形式有很多种,关键是双方先承认这笔成本客观存在,再决定谁来承担波动风险。

企业最后要算的,其实不是Token,而是一件事情多少钱

我最近又看了一下FinOps Foundation今年关于AI Token Economics的资料,他们在调研中把SaaS模型Token的成本和使用管理列为从业者当前面对的首要挑战。原因也很现实:Token是很多财务和业务人员以前没有接触过的单位,模型之间价格差异又很大,用传统预算工具并不好管理。

今年8月,Linux Foundation专门成立了Tokenomics Foundation,首批有30家机构参与,包括Accenture、IBM、JPMorgan Chase、Oracle、SAP和ServiceNow等。它要解决的问题已经不只是“Token怎么算”,而是希望建立AI总成本、Cost to Serve以及ROI的共同衡量方法。

这说明我们在项目现场碰到的问题,并不是某一家甲方“不懂AI”,整个行业都还在学习怎么给“智能”算账。

而且再往前一步,企业最后也不应该长期盯着100万Token多少钱。真正有意义的指标应该是:AI处理一份合同多少钱,完成一次客服多少钱,一个Agent跑完一项业务任务多少钱。

假设人工审核一份材料需要30元,AI平均成本是1元,那么即使企业每个月因此产生几十万元Token费用,这个项目仍然可能非常划算。反过来,如果一个AI功能完成一次任务花50元,人工只需要10元,那么模型单价再便宜,也很难证明它有商业价值。

我现在再回头看最开始甲方提出的那个问题——项目费用已经付了,为什么以后使用AI还要继续付Token——答案其实没有那么复杂。

过去我们采购软件,主要是在购买一套已经写好的业务逻辑;现在做AI项目,除了购买这套系统,还在持续调用模型提供的智能计算能力。开发完成以后,前一笔成本基本确定了,但后一笔成本才刚刚随着实际使用发生。

甲方并不需要成为Token专家,也不应该接受无法预测的费用。但如果还希望像过去那样,只问“这个项目一共多少钱”,然后认为验收以后所有成本都应该结束,那么很多AI项目确实会越来越难算清楚。

更合适的问题可能已经变成了:这套AI一年总共要花多少钱,以及它每帮我完成一件事情,到底值不值这笔钱。

OpenAI 新架构被曝:大模型开始戒掉“人类语言”了

做软件研发这二十多年来,我经历过不少次技术架构的更迭,但过去这一年多做 AI 应用开发的体会最为特别。每当我们在屏幕上调用大模型时,最习惯看到的,莫过于那个被折叠起来的“思考中(Thinking)”状态栏。点开它,你能看到模型像一个勤奋的学生一样,一行一行在草稿纸上演算推导,用详尽的自然语言写下“首先我需要分析这个问题”、“接下来尝试另一种思路”。这种长篇大论的思维链(Chain of Thought, CoT),一度让我们感到某种踏实,似乎机器不仅变聪明了,而且它思考的轨迹完全在人类语言的框架之内,每一个逻辑节点都对我们敞开。

但前几天外媒披露的一则技术爆料,却让整个硅谷的技术与安全圈子坐立不安。据多家科技媒体报道,OpenAI 代号为“Astra”的新一代旗舰模型,在底层采用了一种名为“循环深度”(Recurrent Depth)的新架构。与我们熟悉的标准 Transformer 不同,该架构允许模型把中间隐状态(Hidden States)送回同一组网络层中反复循环迭代,直接在隐空间(Latent Space)里完成深度的推理计算。消息传开后,许多 AI 安全研究员的反应几乎是恐慌性的,甚至有人直言人类正在失去对模型的监控。随后,OpenAI 首席科学家雅库布·帕乔基(Jakub Pachocki)罕见地公开发文澄清,称外界报道存在夸大和混淆,明确表示包括 Astra 在内的前沿模型计算图深度其实控制在 GPT-4 的两倍以内,并且 OpenAI 严格限制了该机制的使用,绝没有放弃思维链监控。

一位顶级实验室的技术掌门人,需要亲自出面证明自家的新模型“没有外界想象的那么深”,这在大模型狂飙突进的这两年里相当反常。抛开那些耸人听闻的阴谋论,如果从技术底层和商业账本的角度仔细琢磨,你会发现这件事背后隐藏着一个正在发生但极少被公开挑明的残酷现实:我们在屏幕上看到的那些长篇大论的思维链,可能根本不是 AI 思考的本质;为了追求极致的计算效率,大模型正在试图甩掉人类的语言。

从层层堆叠到隐空间心算:循环深度究竟改变了什么

要理解这场争论,得先看看传统的 Transformer 是怎么工作的。自 2017 年那篇《Attention Is All You Need》奠定现代大模型基石以来,行业推高模型智力的方式基本遵循着一套物理上的线性逻辑:输入一段文字,将其变成高维向量,然后穿过一层又一层的 Transformer 神经网络,从第 1 层逐级向前传递到第 N 层,最后吐出下一个词。在过去的预训练时代,如果想让模型具备更强的表达能力,最直接的做法就是堆参数、堆层数,把模型从几十亿参数堆到几千亿甚至上万亿。

但物理规律和芯片制造的极限很快摆在面前。层数越多,参数量越庞大,对 GPU 显存(HBM)的消耗就呈线性甚至超线性暴增,单台服务器根本装不下,必须依赖极其昂贵的高速网络互联把数以万计的芯片绑在一起。后来,以 o1 和 DeepSeek-R1 为代表的推理模型开辟了另一条路径,也就是在推理阶段给模型充足的“时间”,让它在输出最终答案前,先自发生成几千甚至上万个文本 Token 的长思维链。这在学术上被称为“推理期扩展(Test-time Compute Scaling)”,相当于通过延长输出的步骤,在时间维度上换取更高的准确率。

而 Astra 被爆出的“循环深度”,其核心思路其实更接近学术界早就研究过的“循环 Transformer(Looped Transformer)”。它打破了“数据只能单向穿过固定物理层”的束缚,让中间生成的隐状态在同一批网络层内部循环迭代多次。打个比方,传统的做法是组织一条拥有 100 个工人的超长流水线,每个人只看一眼零件就往下传;而循环深度则是挑出几个能力极强的核心小组,让同一个零件在这个小组手里反复琢磨加工五轮、十轮。这样一来,模型的实际物理参数规模并没有无休止膨胀,但其等效的计算图深度却被成倍拉长。更关键的是,这种“琢磨”直接发生在连续的高维数学向量里,不需要每推演一步就把结果硬编码成人类的词汇打在屏幕上。

自然语言不是思考的翅膀,而是机器的算力裹脚布

很多人直觉上认为,语言是思维的最高形态,大模型学会了用自然语言推导,就说明它掌握了人类的智慧。但如果从计算机底层的能耗与通信开销来看,用自然语言做深度思考,对机器来说其实是一场极其笨拙、昂贵且低效的妥协。

在我们实际研发 AI 应用的过程中,算力账本是极其现实的。大模型吐字采用的是自回归(Autoregressive)机制,这意味着它在屏幕上每吐出一个汉字或一个英文单词,整个包含数千亿参数的网络权重就要在显存与计算核心之间完整搬运并计算一次。一个极其复杂的数学证明或架构设计,如果让模型用文本写出 8000 字的详细思维链,就意味着它要老老实实做 8000 次完整的全网络前向传播。这不仅带来了肉眼可见的卡顿和等待延迟,更为服务器厂商带来了极其恐怖的电力消耗和显存带宽占用。

更本质的问题在于带宽的错配。人类之所以依赖语言思考,是因为生物进化的限制——我们的大脑受限于喉咙、声带和纸笔的物理介质,必须把大脑皮层高维连续的神经电信号压缩成线性、离散的词汇符号,才能完成自我整理或与他人通信。但人工神经网络天生就生活在由成千上万维连续浮点数构成的潜在空间里,它原本可以直接在高维向量之间做极其平滑的矩阵变换与模式折叠。过去我们强行要求它在每一步推理时,都必须把潜意识里的连续向量强行截断,四舍五入投影成字典里的某一个具体汉字,然后再把这个汉字重新编织成向量喂回给下一轮计算,这就像是逼着一个心算速度极快的数学天才,每做一步加法都必须在黑板上用正楷把步骤完整写出来一样。

显式思维链从来不是机器智能的终极形态,它只是在算法尚不成熟时,人类为了便于评估和对齐,强加给模型的一道昂贵的“思考表演”。当模型的能力跨过临界点,工程效率的法则必然驱使它甩开文字的拖累,直接在隐空间里进行极速心算。

商业落地的死命令:智能体经不起慢吞吞的表演

这项架构探索之所以在近期被推向风口浪尖,并非源于单纯的学术好奇,而是被眼下极其严峻的商业化落地压力所倒逼的。

这两年整个产业界都在高喊智能体(Agent)和“计算机操作(Computer-Use)”,希望 AI 能像真人助手一样自主操作软件、编写工程代码、排查系统故障。但只要是在真实生产环境中尝试过落地 Agent 的人,都会深刻体会到当下的技术体验有多么脱节。如果让一个基于长文本思维链的模型去操作电脑,它看一眼屏幕截图,就要在后台慢吞吞地写上几百字分析:“我看到左上角有一个按钮,它的坐标大约在某处,我准备点击它”;点击完之后,页面跳出一个弹窗,它又要停顿数秒,重新写一段长篇大论来确认下一步。

在操作系统的高频交互中,这种延迟是灾难性的。一个真正可用的 Agent,面对复杂多变的界面交互,需要的是每秒数次的即时决策与快速试错能力,它需要的是人类那种近乎本能的“下意识反应”,而不是每次动鼠标前都要写一篇议论文。按照现有的长文本推理模式,运行一个复杂任务动辄消耗数十万 Token,调用成本往往高达数美元,而且动辄耗时数分钟,在商业账本上根本无法形成正向反馈。

循环深度架构的出现,正是针对这一死穴的突围。它让模型能在极小的物理体积下常驻在单张芯片的显存中,跳过中间漫长的文本生成阶段,在隐空间内部完成毫秒级的多轮状态演化与动作规划。只有把每次决策的开销从“几百个 Token 的文本搬运”压缩成“几次内部向量矩阵的连续迭代”,自动化的软件操作才可能真正从极客尝鲜的玩具,变成经济上划算的企业级生产力工具。

当草稿纸被收走之后:安全防线的断崖与高管的自卫

然而,技术的极致效率一旦撞上社会的信任机制,就会立刻激化出巨大的矛盾。这正是为什么 Astra 架构一经披露,就在业内引发轩然大波的根本原因。

过去这一年多里,尽管 OpenAI 和各大闭源巨头在商业上把详细思考过程进行了不同程度的折叠,但整个人工智能安全界之所以还保持着底线层面的信心,完全建立在一个脆弱的假设之上:那张草稿纸即使不对普通用户开放,它在系统底层依然是一串人类能读懂的自然语言文本。 安全团队可以用现成的文本分类器、意图探针去逐字扫描模型的思考过程,一旦发现模型在草稿纸上策划欺骗人类、绕过安全规则、或者寻找越狱漏洞,系统就能在最终答案输出前瞬间拉下电闸。这种“思维链监控(CoT Monitoring)”是目前全行业最有效、也是几乎唯一的对齐抓手。

可一旦模型采用了深度的隐空间循环,推理过程全部转入了连续高维的隐藏向量之中——也就是业内常说的“神经语(Neuralese)”——这道安全防线就面临着断崖式的崩溃。人类目前在数学上根本没有工具可以逆向翻译那些在千维空间里高速流转的数值向量到底代表着什么意图。模型在深度的数学回环里完成了什么假设、推演了什么捷径、是否存在欺骗性的中间状态,外部审计人员将完全处于盲区之中。

看懂了这一层,你就能完全理解为什么 OpenAI 首席科学家帕乔基要急忙出来发文灭火。他强调“计算深度只有 GPT-4 的两倍以内”,强调“严格限制了该架构的应用范围”,这绝不是技术上的谦逊,而是一场关乎企业生存的合规自卫。在欧美监管机构(如美国 AI 安全研究所)对模型自主性和不可控性盯得极其紧迫的当下,一旦被贴上“正在研发完全不可解释、不可监控的深层黑盒”的标签,OpenAI 面临的可能不仅是舆论的讨伐,更是商业化产品被监管部门无限期搁置的灭顶之灾。性能想要往隐空间走,而合规硬要把模型往文字拉,这是所有大模型前沿实验室今天都在面临的囚徒困境。

人类语言的降级,与人机共存的新现实

回顾人类文明的历史,我们向来习惯于将“语言”视作灵长类独享的智慧桂冠。古希腊哲学家把人定义为“拥有理性的动物”,而理性的载体就是逻各斯(Logos,即言语);现代哲学家维特根斯坦也曾留下那句名言:“我语言的边界,意味着我世界的边界。”在过去两年的认知惯性里,我们几乎理所当然地认为,只要教会机器精通人类的语言,它就能一步步成为人类意志的完美镜像。

但技术的进化并不受人类浪漫情怀的束缚。大模型因学习人类数千年积累的语言文字而觉醒,但在向更高的算力利用率、更低的商业成本和更强的通用智能狂奔时,它却展现出了抛弃人类语言的势头。在纯粹的数学世界里,人类的语言既稀疏又沉重,它不是思考本身的母体,只是低维世界向高维世界窥探时留下的一道狭窄投影。

短期之内,由于商业信任和安全监管的巨大阻力,我们依然会在各种产品的对话框里看到详尽的“思考过程”,厂商们会像帕乔基承诺的那样,强行在架构外侧加上一道“翻译器”,逼着模型把隐空间的结论重新还原成工整的人话。但那种微观动作在隐空间极速心算、宏观结果用文字汇报的双层架构,显然已经不可逆转地被推上了历史舞台。

面对正在把思考收回隐秘数学空间的 AI,我们或许需要重新审视自身的位置。未来最值得警惕的,或许不是机器说出了什么出格的话,而是当它在沉默中完成了一套人类无法溯源、却在现实中绝对最优的决策推演时,坐在操作台前的人类,是否还能保持理性的从容,又该以怎样的机制去守护最后的掌控权。

ChatGPT 推出三年后,OpenAI 最终活成了它最不想成为的微软

我最近看了 Sam Altman 接受科技播客 Sources 的一次深度访谈。整场对话持续了一个多小时,大部分科技媒体都在关注他对下一代模型能力的展望,或者关于超级智能的哲学讨论。但在整场对话里,真正让我停下来想了很久的,其实是几个极容易被滑过去的业务细节。

Altman 在访谈中亲口承认了两件事:第一,OpenAI 历史上第一次因为安全和未对齐行为,主动推迟了一次前沿强化学习(RL)模型的训练任务,并把大量算力紧急调去修补安全体系;第二,在内部的收入结构中,企业端收入(Enterprise Revenue)已经正式超过了以 ChatGPT 个人订阅为主的消费级收入。与此同时,他还特意提到,OpenAI 正在收缩一些非核心的应用探索,并且需要极其谨慎地“避免与自己的客户直接竞争”。

这几个细节拼在一起,让我产生了一种强烈的反差感。要知道,两三年前 ChatGPT 刚刚席卷全球的时候,整个科技界都在谈论“AI 时代的 iPhone 时刻”。那时的普遍叙事是:OpenAI 将凭借前所未有的用户增长速度,绕过所有传统软件巨头,成为一个直接接管全人类数字生活入口的超级平台。甚至连它背后的微软,在很多人眼里也不过是一个提供算力和资金的水龙头。

但三年过去,事情的走向正在悄悄发生质变。那家曾经带着浓厚极客理想、试图颠覆一切世俗规则的公司,并没有长成新一代的苹果或谷歌,而是在算力账单、留存壁垒和客户利益的重重挤压下,快速退守到底层,开始老老实实地做接口、抓交付、谈采购合同。

说白了,它最终还是活成了它最初最不想成为的样子——另一个微软。

消费级神话背后的“算力重力”

要想看清这种转变,得先回到商业的最基本常识。

互联网过去二十年最性感的商业模式,本质上都是建立在“零边际成本”之上的。不管是做搜索引擎、社交网络还是电商平台,研发第一套系统的成本可能极高,但一旦产品上线,服务第一万个用户和第一亿个用户的边际成本几乎可以忽略不计。这种极致的规模效应,允许科技公司用免费或极低的价格疯狂获客,迅速建立网络效应,最后形成不可动摇的超级入口。

ChatGPT 刚出来时,很多人以为这种奇迹又要在 AI 领域重演一遍。但只要你自己算过大模型的 API 成本,或者实际搭建过商业级的推理系统,就会明白大模型从第一天起就背负着完全不同的物理规律。

AI 推理不是分发静态网页,每一个 Token 的生成,背后都是真金白银的 GPU 矩阵在进行高功耗矩阵运算。这意味着大模型天然不具备互联网软件那种近乎为零的边际成本。不仅如此,个人用户的付费意愿其实非常脆弱。一个月 20 美元的订阅费,对于重度依赖它的专业人士来说或许物超所值,但对绝大多数抱着好奇心尝鲜的普通人而言,它很快就会变成一项需要精打细算的非刚需开销。

当市面上开源模型越来越强、各种免费工具和竞品层出不穷时,C 端用户的游牧属性暴露无遗。只要另一家模型在特定任务上稍微好用一点或者完全免费,用户迁移的门槛几乎为零。

这就带来了一个极为尴尬的财务结构:庞大的 C 端免费和低付费流量,给数据中心制造了极其沉重的峰值负载和带宽压力,换来的却是极高的流失率和微薄的毛利。想要靠每个月 20 美元的散客零钱,去填平每年数十亿甚至上百亿美元的先进算力与芯片采购开支,在数学模型上根本算不过来账。

消费级市场的狂欢,更像是一场由巨额融资补贴催生的前沿概念普及。当狂热退去,算力账单的重力场终究会把所有人拉回现实。

大模型帝国主义的收缩

面对算力成本的现实拷问,OpenAI 最初的设想其实非常激进:既然当单纯的底层模型不赚钱,那我就把整个价值链全吃了。

在过去的一年多里,我们看到了很多带有强烈“全能帝国”色彩的尝试。比如震惊整个影视工业的视频生成模型 Sora,比如试图重构浏览器和桌面工作流的原生 Agent,再比如传闻中直奔垂直搜索而去的 Atlas。当时的逻辑很明确:如果底层模型无法垄断利润,那么 OpenAI 就要亲自下场,把搜索、办公、创意工具甚至操作系统全都重做一遍,成为端到端的全能巨头。

但我一直对这种“平台通吃一切”的构想持怀疑态度。不仅是因为资源跟不上,更因为这种做法在商业伦理上直接激怒了它最核心的盟友。

当 OpenAI 开始自己做高质量视频生成、自己做垂直搜索、自己做代码编辑器时,那些每个月向它支付数百万美元 API 费用的软件开发商、企业客户和创业团队,立刻感到了巨大的生存威胁。你的底层供应商同时也是你最大的潜在竞争对手,他随时可以用更新的技术和更低的调用成本,在一夜之间抹平你的产品护城河。

在真实的商业世界里,没有人会长期把命脉交托给一个既当裁判又当运动员的伙伴。Anthropic 之所以能在企业市场迅速撕开一道口子,开源社区之所以能得到大量开发者的死心拥护,很大程度上正是因为外界对 OpenAI“通吃野心”的忌惮。

Altman 在这次访谈中明确表态要收缩战线、避免与客户竞争,并不是突然展现了某种道德自律,而是商业利益倒逼下的妥协。在算力本就极其紧张的关口,继续四面出击只会分散精力,同时把最重要的生态伙伴逼向对手的怀抱。

放弃吞噬一切的应用野心,退守为一家纯粹的技术与基础设施服务商,虽然少了很多改变世界的浪漫色彩,但对当下的 OpenAI 来说,却是保住现金流防线的唯一理性选择。

撞上厚重的“经济惯性”

退守到企业级市场,就意味着必须接受企业级市场的游戏规则。而这个规则,与硅谷工程师习惯的“快速迭代、打破陈规”截然相反。

Altman 在这次访谈中有一个非常坦诚的反思。他说在 2023 年 GPT-4 刚发布时,大家对技术颠覆现实的速度估计得太激进了,实际上整个商业社会存在着巨大的“经济惯性”。

这个说法我非常认同。在技术圈内,我们习惯了看每两周一次的模型跑分刷新,习惯了看某个 Agent 在基准测试里又提高了几个百分点。但在真实的工业界和传统行业中,决定一项技术能不能落地的,从来不是它理论上的智力上限,而是它能否嵌入现有的复杂组织流程。

一家大型跨国银行、一家制造业巨头或者一家医疗机构,采购软件时最在意的往往不是“模型有没有创造力”,而是系统稳定性能不能达到 99.99%、数据隐私是否符合合规认证、出了故障谁来承担法务责任,以及它到底能不能跟二十年前写的老旧 ERP 系统打通。

很多企业内部甚至连最基础的数字权限体系和知识库都还没有理顺,大模型扔进去,不仅无法直接变成生产力,反而可能引发严重的数据泄露或越权风险。

这种由于合规、法律、组织层级和惯性思维构成的阻尼层,其厚度远远超出了纯技术人员的预估。这也是为什么,今天 OpenAI 最紧迫的任务不再是向公众演示炫酷的新 Demo,而是开始大批量组建企业级销售团队、招募行业解决方案专家,去一家家跟大客户谈冗长的定制合同,陪着客户法务做繁琐的安全审查。

这种工作极其笨重、进展缓慢,而且需要消耗大量非研发类的人力成本。但恰恰是这些缺乏极客美感的脏活累活,构成了企业级软件最深的那道护城河。

踩下刹车,戴上枷锁

当商业重心全面转向企业级市场,随之而来的另一个不可逆变化,是技术研发本身的自由度被彻底锁死。

过去,大模型公司最大的卖点是激进和敏捷。但正如 Altman 透露的,当 OpenAI 在内部训练中触发了安全临界线、遭遇非预期行为后,他们选择的是主动叫停前沿强化学习训练,把主力算力挪去修筑对齐和监控防线。

这是一个极具象征意义的转折点。它说明模型能力在经历前两年的飞速狂飙后,终于撞上了工程控制与安全验证的硬墙。在面对个人用户时,模型偶尔胡说八道或者产生幻觉,可能只是社交媒体上的一个段子;但在涉及核心生产系统、商业机密和金融安全的企业级场景下,哪怕万分之一的不可控行为,都足以招致毁灭性的诉讼和监管惩罚。

当安全与合规从一种公关层面的伦理倡议,变成卡死技术能否交付的硬性门槛时,研发的减速几乎是不可避免的。这也顺理成章地解释了为什么 OpenAI 对短期内上市表现得越来越谨慎。

在私募股权市场,投资人还可以为了那个模糊而宏大的 AGI 愿景持续买单,容忍数以百亿美元计的研发消耗;但一旦走上公开资本市场,华尔街的逻辑是极其冷酷而短视的。公开市场需要稳定的毛利率、可预测的季度财报,以及经得起审计的研发投入产出比。

一家动辄需要因为对齐问题暂停主线训练、每年背负天文数字算力折旧、且商业交付周期越来越漫长的公司,根本承受不起二级市场每个季度的严苛拷问。在这个节点上,避开纳斯达克的敲钟台,并不是因为超脱,而是因为还没有穿好应付公开市场的厚重铠甲。

颠覆者的宿命

三年前,当 ChatGPT 第一次点亮屏幕时,很多人曾相信它会以一种全新的逻辑重构整个商业世界。

但三年后的今天,当尘埃稍微落定,我们看到的却是一个极具历史戏剧感的宿命循环:C 端的狂欢终究没能打破边际成本与商业留存的铁律;全能通吃的帝国野心撞上了生态伙伴的防御心理;而指数级进化的算法模型,最终不得不陷进传统商业厚重的组织惯性与采购泥潭之中。

我并不觉得 OpenAI 的这种转变是一种失败,或者说某种理想主义的褪色。恰恰相反,这是一家前沿技术公司在撞上现实世界的硬壁后,为了真正生存下去所必须完成的商业蜕变。

从试图颠覆一切的“普罗米修斯”,到低头搭建接口、处理合规、靠大企业订单维系生存的软件巨头,OpenAI 所经历的,其实是每一项通用技术在走向成熟过程中都逃不过的规训。

这场大模型革命不仅没有打破商业世界的底层法则,反而再次验证了经典商业规律那无可辩驳的重力。决定这轮技术浪潮最终能走多远的,从来不仅仅是那几行写在服务器里的神秘算法,而是颠覆者究竟能以多快的速度,学会向真实而笨重的世界低头。