乐于分享
好东西不私藏

大模型进步太快,反而拖慢了AI软件爆发?

大模型进步太快,反而拖慢了AI软件爆发?
过去半年,我对 Agent 最直观的感受,来自一件很具体的事:做 PPT。

最开始,它做出来的东西更像小学生作业。

字能放上去,也知道配几张图,但配色、排版和信息层级都比较随意。你可以说它“会做”,但不能拿去见客户。

后来,它开始能做一般性的商业 PPT。

封面、目录、图表、总结页都有了,结构也像一份正式汇报。但它做的只是“通用的专业”,还不是“针对一家公司的专业”:没有公司的模板和品牌规范,也不真正理解这次汇报是给谁看的。

再后来,只要上传公司模板,它已经可以沿着模板完成一整套 PPT。配色、字体、版式和品牌元素基本统一,内容也能根据汇报要求重新组织。

经过人工检查和少量修改,基本可以商用。

半年时间,从不能商用,到基本可以商用。

这个变化给我的感受,不只是方便,而是震撼。

因为它说明,大模型的进步已经不只是“更会回答问题”,而是在快速跨过真实工作的交付门槛。

但这也让我想到一个反常识的问题:

既然模型越来越强,为什么真正站稳脚跟的 AI 应用软件仍然不多?

我的判断是:大模型进步太快,既给了应用软件能力,也让应用软件面临快速折旧。

今天需要一家软件公司专门开发的功能,几个月后,可能就会变成大模型的原生能力。

一、这不是错觉:模型正在从“会说”走向“会交付”

先看几组近半年的数据。

2025 年 12 月发布的 GPT-5.2,在 GDPval 真实知识工作评测中,达到或超过行业专业人士的比例为 70.9%。到 2026 年 4 月发布 GPT-5.5 时,这个数字已经提高到 84.9%。

GDPval 测试的不是选择题,而是演示文稿、财务表格、文档等真实工作成果。

同一时期,模型操作电脑的 OSWorld-Verified 得分从 47.3%提高到 78.7%;深度搜索能力 BrowseComp 从 65.8%提高到 84.4%。

长上下文的进步更快。2026 年 3 月,GPT-5.4 在 51.2 万至 100 万 Token 的 Graphwalks BFS 测试中得分为 9.4%;不到两个月后,GPT-5.5 提高到 45.4%。

到了 2026 年 7 月,GPT-5.6 又把重点推向更长时间的任务、更强的工具调用,以及用更少 Token 完成复杂工作。

单项评测不能直接等同于真实生产力。模型跑分很高,也不代表它能稳定完成所有企业任务。

但把这些指标放在一起看,方向已经很清楚:

模型正在从“生成一段内容”,走向“理解任务、调用工具、操作软件、检查结果并交付完整成果”。

PPT 能力的三次跨越,只是这条曲线在我工作中的一个投影。

以前,一款 PPT 软件要分别开发大纲生成、版式推荐、图表制作和品牌模板适配。现在,越来越多能力可以由通用模型直接完成。

大模型不再只是软件的发动机。

它正在长出方向盘、仪表盘,甚至一部分车身。

二、模型进步越快,AI 软件的“功能折旧”越快

传统软件开发有一个默认前提:底层能力相对稳定。

数据库、操作系统和编程语言也会升级,但软件公司通常可以围绕一个相对稳定的底座,持续打磨产品、积累客户,再用几年时间收回研发投入。

AI 应用面对的环境完全不同。

假设一家创业公司发现,大模型不会制作符合企业模板的 PPT。于是它投入人员,开发模板识别、版式匹配、图表生成和自动校验。

产品刚做出来,新一代模型已经可以直接读取模板,生成整套汇报。

原来需要一个团队开发的核心功能,突然变成模型的一次升级。

这就是 AI 应用面临的特殊风险:

研发投入还没有完成商业回收,产品能力已经被上游模型免费“批发”了。

一款 AI 软件的价值,可以简单拆成三个部分:

AI 软件价值 = 模型暂时不会的能力 + 数据与流程整合 + 客户信任与交付责任

当模型快速进步时,第一项会不断缩水。

如果一家公司的主要价值只是提示词、对话框和一层简单工作流,它的产品边界就会被模型不断侵蚀。

今天还是一款独立产品,明天可能只是大模型菜单里的一项功能。

这不是一般的软件迭代,而是产品的地基在不断升高。

房子当然可以继续盖,但开发者很难判断:哪些楼层值得自己砌,哪些很快会被地基直接顶上来。

三、钱已经进场,企业却不敢把产品形态押死

最初,我以为软件公司没有大规模投入 AI。

但数据并不支持这个判断。

Menlo Ventures 对约 500 名美国企业决策者的调查和市场测算显示,2025 年企业生成式 AI 支出约 370 亿美元,是 2024 年的 3.2 倍;其中约 190 亿美元流向应用层,占比超过一半。

传统软件公司也不是没有拿到收入。

Salesforce 披露,截至 2026 财年末,Agentforce 的年度经常性收入已经达到 8 亿美元,同比增长 169%,累计签署超过 2.9 万笔交易。

所以,更准确的说法不是“钱没有进入 AI 软件”,而是:

钱已经进场,产品也大量涌现,但大部分企业仍在试点,真正进入核心流程并形成稳定回报的项目还不多。

麦肯锡 2025 年全球调查显示,88%的受访组织已经在至少一个业务职能中经常使用 AI,但只有大约三分之一开始在企业范围内规模化。

只有 39%的受访者认为 AI 已经对企业层面的息税前利润产生影响,而且其中大多数认为贡献不足 5%。

Gartner 在 2025 年初的一项调查中发现,19%的受访者表示所在组织已经对 Agentic AI 进行重大投入,42%选择保守投入,还有 31%仍在观望或不确定。

Gartner 同时预测,到 2027 年底,超过 40%的 Agent 项目可能因为成本上升、价值不清或风险控制不足而被取消。

需要强调,这是预测,不是已经发生的结果。

但它反映了企业的真实顾虑:

不是 Agent 没有能力,而是很多项目还不能稳定回答三件事——能省多少钱,出了错谁负责,规模扩大后成本是否可控。

因此,软件公司的“审慎”,更多体现在产品策略,而不是停止花钱。

先把 AI 嵌入现有产品,而不是轻易另起炉灶;先做插件、Copilot 和局部 Agent,再决定是否重构主产品;保持底层模型可以替换,不把全部能力押在一家模型公司和一个版本上;优先进入效果可以计算、失败可以兜底的场景,而不是一开始就追求全自动。

这不是消极。

这是在地基快速变化的时候,主动保留选择权。

四、AI 应用很多,真正稀缺的是商业闭环

现在的 AI 应用并不少。

真正稀缺的,是模型升级以后,仍然有理由单独存在的应用。

一款 AI 产品要从演示走向商业化,至少要跨过四道门槛:

技术可行 → 产品有用 → 客户付费 → 公司盈利

大模型的进步,解决了第一道门槛,也在快速改善第二道门槛。

但后面两道门槛,不能靠模型参数自动解决。

企业真正购买的不是“模型很聪明”,而是一个能安全放进组织、可以稳定交付的结果。

这背后包括专有数据、系统连接、权限管理、审计记录、异常处理、人工确认、售后服务和最终责任。

这也是为什么,AI 应用最先在少数场景形成规模。

Menlo Ventures 的测算显示,2025 年企业部门级 AI 支出中,编程工具达到 40 亿美元,占了一半以上;医疗是最大的垂直 AI 市场,支出约 15 亿美元,其中环境式医疗记录工具约 6 亿美元。

编程和医疗看起来相差很远,却有几个共同点:任务高频,结果相对容易检查,节省的时间可以计算,而且软件能够嵌入明确的工作流。

换句话说:

AI 应用不是在“模型最聪明的地方”率先爆发,而是在“价值最容易验收的地方”率先爆发。

五、AI 软件不必等到大模型停止进步

最初,我的判断是:AI 软件可能要等到大模型基本触及能力边界,或者能力进步变得相对可预期之后,才会真正爆发。

现在看,这句话需要改一半。

等待大模型触及最终边界,可能没有意义。

我们不知道边界在哪里,也不知道什么时候能够到达。即使模型的总体能力继续上升,它在某个具体场景里的表现,也可能提前进入可用区间。

软件真正需要等待的,不是模型停止进步,而是三个变量在具体场景中变得可预期:

第一,能力可预期。明确任务的成功率足够高,失败方式可以识别。

第二,成本可预期。Token、推理时延、人工复核和实施成本,能够被产品收费覆盖。

第三,边界可预期。哪些能力会由通用模型提供,哪些能力必须由行业软件长期承担,逐渐变得清晰。

只要这三个条件成立,应用公司就不必等待模型到顶。

相反,它应该尽早进入客户流程。因为真正的壁垒,往往不是模型本身,而是在使用过程中形成的数据、连接、权限、组织习惯和结果责任。

判断一款 AI 软件有没有长期价值,可以问一个简单的问题:

如果明天大模型能力再提高一倍,这款软件会更值钱,还是会被直接替代?

如果答案是被替代,它卖的可能只是模型暂时不会的功能。

如果答案是更值钱,它通常掌握了模型之外的东西:进入了客户的关键业务流程,能够合法调用专有数据,连接复杂的既有系统,处理权限、审计、安全和失败恢复,并对一个可以验证的结果负责。

模型越强,这类软件能够调用的能力越强,交付成本反而可能越低。

它不是和模型争夺功能,而是把模型变成自己的生产资料。

结语:模型拿不走的东西,才是软件真正的价值

半年时间,Agent 做 PPT 从小学生水平走到基本可以商用,说明大模型的能力曲线仍然非常陡峭。

这条曲线一方面不断打开新场景,另一方面也不断让旧的产品设计失效。

于是,我们看到了一个看似矛盾的阶段:AI 应用数量很多,资金投入也不少,但企业仍在大量试点,软件厂商也不敢轻易把未来押在一个固定的产品形态上。

真正的 AI 软件爆发,不会等到大模型完全停止进步。

它会先发生在那些即使模型继续进步,也拿不走核心价值的地方。

模型负责变聪明。

软件负责进入流程、组织数据、控制风险并交付结果。

大模型的边界,决定软件今天能做什么;模型拿不走的东西,才决定软件明天值多少钱。

数据来源与口径说明

文中模型评测主要采用模型厂商披露数据。不同评测的任务集、推理强度和运行环境不同,不宜跨基准直接比较;公开评测也不能等同于企业生产环境中的稳定性。Menlo Ventures、麦肯锡和 Gartner 数据来自调查、市场测算或预测,适合观察趋势,不代表所有企业的实际情况。

声明:本文仅用于软件产业、AI 技术变革与商业模式研究,不构成任何投资建议。