ARTICLE · 1095062
当AI热潮退去,一定别急着停止探索
今年3月,OpenClaw掀起了一阵“养虾”热。各地组织体验活动,大厂密集跟进,原本属于技术圈的Agent,突然成了许多人想试一试的新东西。围绕下一代工作入口的争夺,也随之展开。
那时,人们对它抱有很大的期待:只要交代清楚,电脑就能自己干活。那些耗费时间、反复操作、迟迟不想动手的事情,似乎终于有了可以托付的对象。
半年过去,再回头看,气氛已经变了。至少在我接触的工作环境里,一些曾经被热烈讨论的“龙虾”工具,后来渐渐没了动静。最初的问题是“它还能做什么”,现在更多的疑问变成了“折腾这么久,到底有什么用”。
我能理解这种失望。一个工具让人花了时间,付了费用,最后却没有完成承诺的工作,当然应该接受批评。但是,我不太愿意就这样停下来。试过几次,碰到一些问题,便认定AI不过如此,这个结论下得有些早。
一款产品退场之后
最近,腾讯QClaw宣布将于2026年12月24日停止服务,同时提供向WorkBuddy迁移的安排。从3月上线,到9月宣布停运,这个消息很容易让人联想到一轮热潮的结束。不过,公告里的迁移安排也值得留意:腾讯仍然保留着Agent服务,只是在调整承载这些服务的产品。
一款产品退出,可能涉及定位、成本、内部资源分配,也可能确实没有找到足够有价值的使用场景。仅凭停运这件事,我们还无法判断究竟是哪一种原因,更不能顺势认定整个方向已经走不通了。
与此同时,新的尝试仍在发生。9月,Meta发布了个人Agent产品Muse。按照官方介绍,它运行在独立的云端环境中,可以跨应用处理任务,并在发送邮件、购买商品等敏感操作前征求用户许可。这些设计能否在日常使用中稳定兑现,还需要检验,但它至少说明,围绕个人Agent的探索并没有随着某一款产品退场而结束。
从OpenClaw到Codex,再到Muse,我不急着给它们排出一条谁取代谁的进化路线。对使用者来说,更值得关心的是,个人的事情,究竟交给哪个工具更合适?它能做到什么程度?哪些地方仍然需要我介入?
产品的名字可以换,使用方式也可以改。没有必要为了证明自己当初的判断正确,守着一个不好用的工具;同样,也不必因为某个工具让人失望,就把此前积累的经验一起扔掉。
失望究竟发生在哪里
最初接触Agent时,我们很容易高估它的独立工作能力。看过一次流畅的演示,便觉得自己的工作也能照样交出去。
可演示结束之后,麻烦才刚刚开始。Anthropic在关于长任务Agent的工程文章中,就记录过一些很具体的问题:任务跨越多个工作阶段后,Agent可能接不上此前的进度,也可能在事情尚未完成时过早宣布成功。让它连续、可靠地做事,仍然需要额外的工程设计。
这些缺陷不能全归咎于用户。一个产品宣称开箱即用,却要求普通人自己解决大量配置和维护问题,用户没有义务替它完成剩下的产品开发。对于某些任务,手动做完确实比反复纠正AI更省事,承认这一点并不丢人。
但另一方面,我也越来越觉得,有些失望值得再往下追问一步。
譬如,想让AI做一份经营分析,我们可能上传一张表,说一句“分析一下为什么下降了”,然后等待一份足够专业的报告。可这份报告要给谁看,要支持什么决策,数据口径有没有调整,哪些变化与节假日有关,哪些判断需要额外证据,这些事情并没有因为文件上传成功,就自动交代清楚。
我们自己做分析时,脑子里带着许多背景知识,也会在过程中不断核对和修正。把任务交给AI时,却很容易把这些条件省略掉,只留下最后一句要求。
我现在愿意花更多时间去弄清楚:一次任务失败,究竟卡在模型能力,还是缺少资料?是工具无法访问必要的系统,还是任务本身就没有说清楚?如果连失败发生在哪里都不知道,换一个产品重试,很可能只是再失望一次。
这也是我关注Harness的原因。这个词听起来有些技术化,实际指的是围绕模型搭建的工作环境:它从哪里获取资料,怎样调用工具,如何保存进度,出了错如何恢复,完成后又怎样检查。OpenAI分享Codex的工程实践时,也将大量工作放在了这些环节上,包括整理可访问的知识、明确约束,以及建立测试和反馈机制。
这些事情没有“输入一句话,交付一个完整项目”那么令人兴奋,却更接近日常工作的实际情况。
当然,我也不赞成无限折腾。如果一个流程维护了很久,依然比自己做更慢,就应该停下来,换一种办法,或者暂时搁置。继续探索,需要对具体问题有耐心,也需要对无效投入保持警觉。
商业回报应该追问,个人学习也值得继续
谈到AI,总会遇到一个问题:投进去这么多钱,什么时候能获得回报?
这个问题完全合理。投资人需要回报,企业需要收入,使用者也需要确认付出的费用是否值得。不能只因为一项技术足够新,就要求所有人无限期地等待。未来值得期待,也无法替今天的每一笔投入作担保。
把这些质疑简单看来可以归为浮躁,但长期看,持续追问成本、可靠性和实际收益,才有可能让产品离真实需求近一点。
站在个人的角度,我们面对的选择没有那么宏大。
我使用一个AI工具,并不需要先证明它背后的公司一定会成为商业上的赢家。我更关心的是,在自己的工作中,它能否减少一些重复劳动,能否帮助我完成过去做不了的事情,能否让我更充分地理解一个问题。把沟通、检查、返工的时间都算进去之后,结果是否仍然值得。
这笔账,和一家企业投入巨额资金建设算力基础设施的账,显然不能混在一起算。
有的产品商业前景尚不清晰,但已经能解决我的具体问题;有的产品声势很大,对我却没有多少帮助。我完全可以取消不值得的订阅,停止没有收益的尝试,同时继续学习和使用其他工具。
支持AI发展,也不需要替每一个AI产品辩护。
对我来说,保持探索还有一层价值:很多判断只有亲手做过才会形成。知道一个任务在哪一步容易出错,知道什么样的资料能帮助它完成工作,知道怎样辨别一份看似完整、实际缺乏证据的结果,这些经验很难只靠阅读产品介绍获得。
当然,其中也会有过时的部分。今天花很大力气解决的配置问题,可能明天就被一次产品更新抹平了。我并不觉得所有折腾都能留下价值。值得保留的,是对任务更清楚的理解,以及对结果更严格的判断。
熟练的工作,逻辑变了
我仍然看好AI,但不愿把这种判断写成一张确定的未来时间表。
模型会发展到什么程度,Agent能承担多少工作,哪些岗位会发生怎样的变化,现在都不适合轻易下结论。尤其是“学会AI就不会被替代”这样的保证,我并不相信。工具变强以后,连今天花心思搭建Agent的工作,也可能变得更容易,甚至不再需要人工参与那么多。
正因为如此,学习AI也不能只停在熟悉几个产品、记住一些操作技巧上。
我更愿意从自己反复遇到的问题出发,尝试让AI参与其中,再根据结果调整做法。一份需要经常更新的分析,一项繁琐的资料整理,一个过去因为技术门槛而迟迟没有动手的想法,都可以成为起点。做完之后,再问问自己:到底省了什么,增加了什么,又产生了哪些新的麻烦?
相比不断收集新工具,我更希望把少数事情做得扎实一些。也希望在使用AI的过程中,保留独立思考的习惯。不能因为它总能给出一份流畅的答案,就省略了自己形成判断的过程。
前些天读到《我不得不把才华埋葬在昨天》,我对这个标题印象很深。文中谈及从亲手编写算子,转向借助Agent完成工作的变化。
它让我想到,面对技术变化,难受的有时不只是对未来收入的担忧。一个人花了很多年,终于把一件事做得熟练、漂亮,也从中获得了认可。突然有一天,完成这件事的方式变了,自己最珍惜的那部分手艺,不再需要被同样程度地使用。即使知道新方法更有效,也很难立刻释然。
我不觉得这种情绪需要被嘲笑。我们可以舍不得过去,也可以给自己一点适应的时间。
但我不愿为了维护对旧有能力的自信,拒绝了解正在发生的变化。过去的经验未必全部失效,它们还可以帮助我判断结果、发现问题、提出更好的要求。只是,这些经验需要在新的做事方式里,重新找到用处。
写下这些文字时,我正在国外旅行。这次,我没有带上厚重的电脑。就这趟旅行需要处理的交付而言,Agent已经能够承担其中的大部分工作。
这当然不代表所有人的工作都可以这样完成,也不代表结果从此无需检查。交出去的任务,仍然需要有人判断是否完成、是否可靠。但对我来说,这已经是一种很具体的改变:有些过去必须坐到电脑前才能处理的事情,现在有了别的完成方式。
相比关于未来的宏大争论,个人需要从已经发生的小变化里,形成自己的判断。
这趟旅行,我已经少带了一台电脑。接下来AI还能帮我做些什么,是一个值得持续探讨的话题。