乐于分享
好东西不私藏

AI这么强,为什么老板还不敢放手?

AI这么强,为什么老板还不敢放手?
过去两年,我们一直在问:模型够不够聪明?但企业真正卡住的地方,往往不是模型不会说,而是它能不能被放心地放进真实工作流。

发生了什么

AI智能体正在从“会聊天的工具”,变成“能接任务、调工具、看结果、改错误”的工作系统。

这背后有一个很关键但不太大众化的概念:Agent Harness。直译有点拗口,可以先把它理解成“智能体的工作底盘”。

模型像大脑,Harness像一套让大脑安全干活的身体、办公室和管理制度。它决定AI能在哪里运行,能调用哪些工具,记住什么,忘掉什么,什么时候该停下来验收,哪些动作必须先问人,出了错怎么追踪。

一句话:真正的AI智能体,不只是一个更强模型,而是“模型+工作底盘”。

为什么这件事很重要

第一,模型聪明,不等于任务可靠。

很多人用AI时都有类似体验:让它写一段文案、改一段代码、总结一份材料,效果不错;但一旦任务变长,比如“帮我把一个项目从需求拆解到上线”“持续跟踪客户消息并提醒我”“自动处理一个跨部门流程”,它就容易忘上下文、走偏、重复劳动,甚至在错误基础上继续发挥。

问题不一定是模型智商不够,而是它缺一套稳定的工作环境。

公开开发者拆解里有个很有意思的数据:Claude Code某版本源码约50万行,其中直接和模型交互的核心代码只占很小一部分,大量代码都在做约束、权限、上下文、工具运行、任务管理和结果回流。换句话说,一个好用的AI编程助手,真正重的部分不是“问模型一句话”,而是把模型装进一套可控系统里。

这就像请了一个很聪明的新同事。你不能只给他说“把公司运营好”,然后转身离开。你需要给他权限边界、资料入口、审批流程、工作台、检查机制和交接文档。AI也是一样。

第二,企业要的不是炫技,而是可控、便宜、安全。

AI智能体一旦进入生产力场景,就会碰到三个现实问题。

先是成本。长任务会消耗大量上下文和调用量。如果每次都把所有材料塞给模型,账单很快就会不好看。所以成熟的系统会把提示词拆成静态部分和动态部分:通用规则可以缓存,个性化信息按需加载;旧对话可以压缩,关键操作完整保留。不是让AI“知道一切”,而是让它在正确时间看到正确材料。

再是安全。真正能干活的AI会接触代码、文件、数据库、内部系统,甚至可能触发外部操作。没有权限控制和沙箱隔离,它就像一个拿着万能钥匙的实习生,效率很高,风险也很高。成熟的Harness会在工具调用前做权限判定:允许、拒绝,或者必须询问用户;执行命令时放进隔离环境,避免一次误操作扩大成事故。

最后是验收。很多AI失败不是因为一开始不会做,而是做完以后不知道自己错了。可观测性和评估机制,就是让AI能看见运行结果、日志、截图、指标,并把这些结果带回下一轮决策。一个AI改完网页后,最好能像人一样打开页面、点一遍、看报错,而不是自信地宣布“已经完成”。

第三,智能体竞争会从模型参数,转向系统工程。

过去大家比的是模型榜单:谁推理强,谁上下文长,谁价格低。接下来更重要的问题会变成:谁能让AI稳定完成6小时、6天甚至6个月的任务?

这就需要记忆、工具、编排、权限、评估、多智能体协作一起上。

例如记忆,不只是“记住你喜欢喝冰美式”。对工作型AI来说,真正有价值的是记住你的项目结构、写作风格、审批习惯、常用资料位置、历史决策原因。时间越久,它越像你的长期助手。也正因为如此,记忆会成为平台粘性的来源:当一个AI越来越懂你的工作流,你迁移到另一个平台的成本就会变高。

再比如多智能体协作。未来一个复杂任务可能不是一个AI从头干到尾,而是规划者、执行者、评估者分工:一个拆目标,一个动手做,一个专门挑错。人类从“亲自做每一步”,变成“设计任务、看关键节点、处理例外情况”。

行业怎么看

围绕Harness,行业里其实有两派声音。

一派认为,模型会越来越强,今天很多外部框架都会被模型自己吸收。就像早期大家写复杂提示词,后来推理模型变强后,一些提示词技巧变得没那么重要。未来模型可能原生学会规划、调用工具、自我纠错,外层系统会被打薄。

另一派认为,模型再强,也需要确定性的边界。尤其在企业场景里,权限、审计、成本、数据隔离、跨系统协作,不可能全靠模型“自觉”。这些东西更像公司的流程制度,不会因为员工更聪明就消失。

我更倾向于中间判断:底层、通用、重复的能力会被模型吸收,但越靠近真实业务,Harness越重要。模型会吞掉一部分“脚手架”,但新的复杂任务又会长出新的系统工程。

所以它不是一个固定产品名,而是一条趋势:AI从聊天窗口走向工作现场,外部控制系统就会变得越来越关键。

对你有什么影响

如果你是普通白领,这件事意味着一个很现实的变化:以后评估AI工具,不能只看“回答聪不聪明”,还要看它“能不能接住你的工作”。

一个真正有用的AI工具,至少要回答几个问题:

它能不能接入你的文件、邮件、表格、代码库或业务系统?它能不能记住长期偏好,而不是每次都从零开始?它能不能解释自己做了什么、花了多少成本、哪里失败了?它在动关键数据前,会不会先问你?它做完以后,有没有验收和回滚机制?

对管理者来说,问题也变了。

不是“要不要让员工用AI”,而是“公司有没有一套让AI安全上岗的底盘”。没有这套底盘,AI越强,越像一个无法审计的黑箱;有了这套底盘,AI才可能从个人提效工具,变成部门级生产力系统。

这也解释了为什么很多公司喊了很久AI转型,却总停在试用阶段。聊天机器人很容易部署,能跑业务的智能体很难落地。难点不在演示视频,而在权限、流程、成本、数据和责任边界。

接下来会怎样

未来一两年,AI产品大概率会出现一个明显分化。

一类产品继续拼模型能力和价格,把AI做成更聪明、更便宜的问答入口。另一类产品会把重点放在工作底盘:记忆系统、工具市场、权限中心、审计日志、沙箱环境、评估平台、多智能体协作。

真正值得关注的不是某个新名词,而是一个判断标准:AI有没有从“会说”变成“可托付”。

当你看到一个AI产品说自己能当智能体,不妨多问一句:它有没有记忆?有没有权限?有没有沙箱?有没有验收?有没有失败恢复?有没有成本控制?

如果这些都没有,它可能只是一个更会聊天的模型。

如果这些都有,它才开始像一个能进办公室的数字同事。


觉得有用?点个「在看」,我们每天追踪AI前沿,帮你把信息差变成竞争力。