夜雨聆风学习资料网

ARTICLE · 1120955

深度分析 | AI 智能体:高投入,低回报?

深度分析 | AI 智能体:高投入,低回报?

AI 智能体:高投入,低回报?

核心摘要:迄今为止,AI Agents(AI 智能体)的经济效益尚未跟上狂飙的投资步伐。这凸显了一个冷酷的事实:如果在缺乏明确商业案例和可衡量成果的情况下盲目部署智能体,企业将面临极其沉重的成本负担。

Shutterstock 

AI 已经全面席卷商业世界,但迄今为止的实际战绩却有些令人大跌眼镜。

根据麦肯锡(McKinsey)的研究数据,如今已有 89% 的企业在日常运营中常态化使用 AI,其中大多数企业至少正在尝试部署 AI 智能体。然而,高普及率与实际的“经济成功”之间,依然横亘着一道巨大的鸿沟。

“我们发现,只有 37% 的企业认为其 AI 项目对息税前利润(EBIT)产生了积极影响,更不用说那些尚处于探索阶段的新型智能体部署了,”麦肯锡在《2026 年技术趋势展望》中如此写道。

这个问题之所以尤为致命,是因为 AI 智能体在开启前所未有商业可能性的同时,也让 IT 系统的复杂度和成本呈指数级飙升。麦肯锡在研究中指出,为了让智能体可靠地执行任务,企业必须对现有的底层技术栈进行伤筋动骨的升级改造。

此外,在日常运营阶段,资源消耗也是一个无底洞。与简单的聊天机器人(Chatbot)一问一答的交互相比,基于智能体的工作流在计算上要密集得多,因为它们依赖于反复的推理循环(Inference loops)、工具调用(Tool calls)、数据检索(Retrieval steps)以及跨系统协调(Cross-system coordination)。

据麦肯锡测算,单个智能体工作流消耗的计算资源,是典型聊天机器人查询的 5 到 30 倍。报告指出,在近期的一项定向调查中,高达 93% 的受访者表示这种极高的算力开销直接导致了他们的 AI 预算严重超支。

一、智能体的效率正在逐步进化

不过,麦肯锡也坦言,这种糟糕的投入产出比未必是永久性的定局。代理式 AI(Agentic AI)目前仍处于婴儿期,一旦该技术发育成熟并深度嵌入企业骨干网络,企业从中攫取的红利必将大幅跃升。

报告强调,目前 Anthropic 和 OpenAI 发布的最新智能体开发工具,已经显著改善了模型调用外部工具以及与计算机底层交互的能力。与此同时,像 LangChain 旗下的 LangGraph这类开源框架,补齐了复杂的编排逻辑与“人机协同(Human-in-the-loop)”控制机制,帮助有效引导智能体完成更加冗长、复杂的企业级工作流。

衡量技术演进的一个关键指标,是 AI 智能体从头到尾独立处理长周期、高复杂度任务的能力正在持续增长。麦肯锡引用了非营利组织“模型评估与威胁研究中心”(METR)的基准测试结果,该机构专门对 AI 模型成功独立完成任务的“时间跨度(Timeframe)”进行评测。对于 Claude Opus 4.6 模型,METR 预估其在软件工程任务上实现 50% 成功率的基准时间跨度约为 12 小时。这意味着,对于此类体量的庞大任务,系统在半数情况下能够实现全自动闭环交付。

然而,麦肯锡在报告初版中似乎误读了这一数据的本质:正如 METR 研究员 Sydney Von Arx 在接受《麻省理工科技评论》(MIT Technology Review)采访时澄清的那样,这里的“12 小时”是指人类平均完成该任务所需的时间,而非 AI 的运算耗时。因此,该指标衡量的是模型所能攻克的“任务复杂度天花板”,而非单纯的处理速度。

Von Arx 解释说,她起初也怀疑用“人类耗时跨度”是否是完美的衡量标准,但她和同事们观察到,顶级模型能够驾驭的任务时间跨度一直在随着时间推移而不断延长——且这种技术跃迁的速度正在肉眼可见地加快。

“外界可以随意猜测这种测试指标是否严谨合理,但技术进化的宏观趋势摆在那里,”这位 AI 专家断言。

METR 官方数据图表,直观展示大语言模型 LLM 在处理复杂软件工程任务能力上的性能飙升趋势

二、盲目引入智能体,反而拖累软件开发生产力

AI 智能体在软件开发领域的潜力被寄予厚望。麦肯锡预估,若能成功实现规模化部署,它们将为全球企业解锁近一万亿美元的附加业务价值。

其潜在收益远不止于“生成代码速度更快”。未来的智能体能够自主分析业务需求、生成底层代码、执行自动化测试、精准定位 Bug,甚至直接接管部分部署流水线。分析师眼中的终局,不仅是让单个开发者进化为“超级个体”,更是对整个产品研发全生命周期的彻底重塑。

然而在骨感的现实中,目前只有极少数企业触及了这一高优目标。麦肯锡的研究揭示,在利用 AI 智能体进行软件开发的企业中,仅有四分之一真正实现了开发周期的显著缩短(麦肯锡将“超过四分之一的团队实现生产力翻倍”定义为显著进步)。

开发者个体之间利用 AI 的能力鸿沟也令人咋舌:研究指出,约 80% 使用 AI 工具的普通开发者,其生产力仅仅提升了约 3%;相比之下,排名前 20% 的顶尖开发者(10x 程序员),生产力飙升了高达 55%。

更令人警醒的是:研究揭示,在开发团队草率引入编码智能体(Coding Agents)后,竟有 30% 的公司实际整体生产力出现了不升反降的诡异现象。似乎每个程序员都在凭“感觉”与 AI 配对编程,但这并没有直接转化为确切的业务交付价值。

三、质胜于量:重估 AI 产出的真实价值

导致生产力倒退的一个核心症结在于,虽然 AI 工具让代码产出量呈井喷式暴增,但这并不能与“高可用、低维护成本的软件”画等号。一项关键研究表明,在 AI 工具的加持下,代码编写的活动量狂涨了 180%,然而最终成功上线的发布版本(Releases)数量,却仅微增了可怜的 30%。大量由 AI 生成的冗余代码变成了需要人工排雷的技术债。

这迫使企业必须紧急重塑核心考核指标:经济效益绝不由“生成的代码行数”或“与 AI 交互的指令数”决定,而是由整个研发流水线的“最终业务交付成果(Outcome)”来拍板。

除此之外,开发者对 AI 的“信任危机”同样在蔓延。据麦肯锡统计,全球约有 46% 的开发者对 AI 工具的输出准确性持“积极的不信任”态度。三分之一的人在原则上愿意有限度相信,而对输出结果抱有“极大信心”的开发者比例,低至微乎其微的 3%。

尽管初期落地磕磕绊绊、暗礁密布,但资本市场对该赛道的重金押注却在疯狂加码。麦肯锡的数据显示,流向“基于智能体的软件开发解决方案”供应商的风投资金,从 2023 年几乎可以忽略不计的极低规模,狂飙至 2025 年的约 50 亿美元。

进入 2026 年上半年,这一赛道的总价值更是直接击穿了 610 亿美元大关——这主要归因于 SpaceX 极其震撼地以 600 亿美元(全股票交易方式)直接收购了现象级 AI 编程工具平台 Cursor。在真金白银的催化下,2024 年至 2025 年间,智能体相关专家的职位招聘需求同比暴增了 221%。

💡 技术名词速览 (Tips)

  • AI Agents (AI 智能体):超越了传统的“一问一答”对话模型(如早期的 ChatGPT)。智能体能够理解复杂的业务目标,自主进行任务拆解、规划,并主动调用外部工具(如数据库、API)来执行多步操作,从而独立完成任务闭环。

  • Inference (推理):大模型接收用户输入后,进行计算并生成输出结果的实时过程。每一次智能体的行动规划或内容生成都需要消耗推理算力,是企业部署 AI 时最大的持续性硬件成本来源。

  • Human-in-the-loop(HITL/ 人机协同):一种保障 AI 安全与质量的架构设计。即在 AI 执行高风险或高复杂度任务的过程中,设置“人类审核节点”,要求 AI 在关键步骤必须停下来等待人类专家的审批或修正后,才能继续执行下一步。

  • LangChain / LangGraph:极具统治力的大模型应用开发开源框架。LangChain 帮助开发者将大模型与外部数据和工具相连;而其衍生项目 LangGraph 则专门用于构建支持循环、分支及复杂状态管理的“多智能体(Multi-agent)”工作流。

  • Coding Agents (编码智能体):专精于软件工程垂直领域的 AI 智能体(例如 Cursor 的底层引擎)。它们不仅能补全代码,还能阅读整个项目的代码库上下文、自主运行终端命令、修复编译错误并提交代码版本。

相关学习资料