ARTICLE · 1113610
2026 年的 LLM:模型进步之后,软件生产方式变了
TL;DR:Simon Willison 用一场按月份展开的演讲回顾 2026 年。重点不在模型又涨了多少分,而在 Coding Agent 跨过“日常可用”的门槛后,软件工厂、Token 消耗、安全事故和职业焦虑接连出现。模型能力仍是起点,但行业问题已经转向:怎样定义任务、验证产物、约束执行并承担长期维护。

分水岭不是新模型,而是“每天都能用”
Simon 把 2026 年的起点放在 2025 年 11 月:Claude Opus 4.5 与 GPT-5.1 单看只是增量升级,但与 Claude Code、Codex 的 harness 组合后,Coding Agent 从“经常犯错”进入“足以日常使用”。这个判断来自他的个人使用史,不是统一 benchmark,却解释了后续现象为什么同时出现:开发者把更多工作交给 Agent,Agent 能连续运行更久,原本偶发的成本、安全和维护问题开始按规模放大。
这条时间线把模型进步拆成了三个阶段。第一阶段是能力越过实用阈值:同样是增量升级,一旦补丁成功率、工具使用和长程坚持同时改善,产品体验就会突然变化。第二阶段是工作量扩张:过去因为太慢、太贵或成功率太低而不会尝试的项目,现在可以并行启动。第三阶段才是治理追赶,团队开始处理沙箱、权限、成本上限、验证和责任归属。发布榜单通常只描述第一阶段,Simon 的材料更有价值的部分是后两段。
2 月出现的“Dark Factory”把这种变化推到极端:代码由 Agent 生成,人不再逐行审查,信心来自规格、测试和独立验证。软件工程没有消失,而是从亲手实现转向定义目标、准备工具和证明结果。Simon 对所谓“Fable 级模型”的概括也是如此:只要目标、约束和工具足够明确,模型可以靠长时间搜索完成复杂任务;困难恰好转移到了目标和验证上。
Dark Factory 之所以值得讨论,不是因为“人不看代码”已经成为行业共识,而是它把验证问题推到了无法回避的位置。如果代码不可读、变更速度又远高于人工审查能力,团队只能依靠行为规格、自动测试、运行时观测和可回滚发布建立信任。这套做法对边界清楚、结果可机器验证的系统更可行;需求含糊、遗留约束很多或故障代价高的项目,仍然需要人理解设计。演讲呈现的是一次压力测试,而不是一条所有团队都应照搬的路线。
Tokenmaxxing 为什么迅速退潮

演讲把 2026 年初的“Tokenmaxxing”视为一段短周期:企业先把 AI 使用量当作采用率指标,数月后又开始限制预算。Agent 终于能消耗大量 Token 做真实工作,但“调用更多”并不等于“交付更多”。上下文反复读取、长任务返工和并行 Agent 会把账单推高,验证环节却不会随生成速度自动扩容。
整场演讲有一条贯穿始终的线索:行业先证明模型能写代码,随后才发现生产系统需要沙箱、权限、评测、缓存和审计。2026 年不是模型竞争结束的一年,而是模型能力开始暴露系统工程欠账的一年。
OpenClaw 的爆发把同一套机制带到普通用户:所谓个人 Agent,本质上仍是能在本机写代码、调用工具并执行操作的 Coding Agent,只是产品包装更亲近。市场需求因此和风险一起扩大——越不熟悉终端、权限和软件供应链的用户,越难判断 Agent 是否越界。演讲没有证明某个产品已经解决了安全问题,它只是显示“会行动的软件”正在离开专业开发环境。
另一个容易被产品新闻遮住的变化是本地模型。Simon 用一台笔记本运行约 21GB 的 Qwen3.6-35B-A3B,并在自己的视觉提示上得到优于同期部分闭源模型的结果。单个“鹈鹕骑车”不能代表综合能力,但它说明能力扩散并不只发生在云端旗舰模型:可本地部署的开放权重模型会改变隐私、离线使用和单位成本的选择空间。云端模型、订阅制 Agent 与本地推理因此不是一条排名,而是不同约束下的工程组合。
这是一张地图,不是一份行业统计
文章由个人经历、新闻事件和演讲材料组成,强项是把分散事件串成因果线索,不能替代采用率调查或生产效率实验。OpenClaw、软件工厂和安全事件说明“什么开始可能”,不自动证明这些形态已经普遍可靠。更适合的读法,是把它当成索引:沿着成本、验证、安全和本地模型四条线继续查原始证据。
它也刻意保留了作者自己的摇摆:年初因为 Agent 可以同时推进很多项目而兴奋,随后又怀疑那些“慢、残缺、未必有人需要”的产物是否值得维护。这比“AI 已经替代开发者”或“AI 全是泡沫”都更接近真实使用。产出上限显著提高之后,稀缺资源从打字和实现时间转向问题选择、注意力和验收能力。判断一个团队是否真正受益,应看进入生产并被持续维护的成果,而不是启动了多少 Agent 或消耗了多少 Token。
参考资料
•Simon Willison, 2026 in LLMs (so far)[2], 2026-09-27。•StrongDM, Software Factories and the Agentic Moment[3]。