
—— Claude Cowork × OpenAI Codex 范式转移深度解析
一、破题与锚定
2026年的夏天,软件自动化的根基正在悄然崩塌。不是被更强大的API、更完善的SDK击碎,而是被一种看似「偷懒」的方式——让AI坐在你旁边,看你干活,然后自己学会。
「我们不需要更多接口,我们需要的是理解。」—— 这不是某位CTO的豪言,而是Claude Cowork「Record a Skill」和OpenAI Codex「Record & Replay」正在默默兑现的承诺。
当所有人还在争论「AI能不能写代码」时,真正的战争已经转移了战场。自动化不再是关于「如何让机器执行代码」,而是关于「如何让机器从人类行为中学会写代码」。 这是一次从显性知识封装到隐性经验蒸馏的范式革命。
二、脉络与拐点
极简回顾:自动化的三次跃迁
| 阶段 | 核心问题 | 典型方案 |
|---|---|---|
| 1.0 手工脚本时代 | 如何让机器重复人的点击? | 按键精灵、AutoHotkey——记录坐标,死板回放 |
| 2.0 API集成时代 | 如何让不同软件「对话」? | Zapier、Make、RPA——依赖接口开放与手写SOP |
| 3.0 智能蒸馏时代 | 如何让机器理解「为什么」? | Claude Cowork、Codex——看人做、自动提炼Skill |
拐点降临:一个微小但致命的变化
过去三十年,自动化的底层假设从未改变:软件必须「开口说话」(开放API),人类必须「写说明书」(SOP),机器才能「照章办事」。这三个前提,缺一不可。
而现在,AI不再需要软件开口,也不需要专家写手册——它只需要坐在副驾驶位,看着你操作,听你边做边说,就能自动提炼出一份可复用的「技能包」。 界面变了?它理解意图,自动适配。流程微调?它重新观察,自我更新。
旧时代的结束,不是因为旧工具变烂了,而是因为新范式让旧假设彻底失效了。
当AI能直接从人类行为中蒸馏知识时,API不再是自动化的命脉,SOP不再是知识的载体,坐标录制不再是自动化的上限。 这是一声安静的惊雷。
三、本质与重构
跨界透视:从热力学到知识蒸馏
用热力学的视角来看,传统自动化是一条**「低熵通道」**——开发者把混乱的业务流程(高熵),通过手工编码压缩成一条有序的、低熵的指令管道。每一次API变更,管道就破裂,熵重新涌回,开发者不得不再次「做功」修复。
而AI自我蒸馏范式,本质上是一台**「知识压缩机」**——它不试图预先规定每条路径,而是用一个通用的大模型「热力场」,包裹住人类专家的操作轨迹,自动将高熵的行为流压缩成低熵的技能模块。它做的不是管道,而是结晶。
认知颠覆:重新定义「自动化」
自动化不是「让机器执行预先写好的规则」,而是「让机器从人类经验中生成自己的规则」。
这不是文字游戏。前者意味着自动化能力受限于「能被写下来的知识」——而人类专家90%的判断(该推哪篇文章、该在哪个节点人工介入、遇到异常时凭直觉选哪条路)根本无法被写下来。后者意味着,那些藏在肌肉记忆里、藏在「手感」里、藏在多年试错沉淀出的直觉里的隐性知识,终于可以被捕获、封装、复用、传承。
生动类比:从「车床」到「学徒」
传统自动化像一个精密车床——你给它图纸(API文档),它加工零件(执行流程)。图纸错了,零件就废;图纸没覆盖的异形件,车床束手无策。
AI自我蒸馏像一个悟性极高的学徒——你不需要写图纸,你只需要在他面前做一遍。他看着你的手法、听着你的讲解(语音解说)、记住你的取舍,然后自己上手。更关键的是,他做完之后会复盘、会改进、会向你请教哪里可以更好——这是一个会进化的学徒。
核心定律
自动化能力 ≈ 可被捕获的隐性知识总量 × 蒸馏效率
传统范式卡在第一个因子(隐性知识难以捕获),新范式同时解放了两个因子。
四、生态推演
维度一:底层系统 —— 从「接口经济」到「认知经济」
- 过去逻辑:软件的核心壁垒是API的丰富度和稳定性。SaaS厂商靠开放平台收「过路费」,开发者靠调接口吃饭。
- 未来逻辑:当AI可以直接「看界面操作」,API的重要性急剧下降。软件的核心竞争力变为——界面是否易于被AI理解,底层能力是否足够丰富。未来的SaaS不再比拼「有多少个Webhook」,而是比拼「AI在我上面能多快学会干活」。
- 微观实证:我最近在公司搭了一个内部实验——让Claude Cowork观察一位资深运营做内容排期。她边拖拽边解说:「这个时段推B站因为年轻用户刚下课,这个位置放知乎因为深度内容需要安静场景。」三次观察后,AI自动生成了一份带推理链的排期Skill。第四天,它提出的排期方案比人工版本覆盖了更多长尾渠道——因为它记住了人说的每一个「为什么」,而人自己早就忘了。
维度二:物理载体 —— 从「脆弱脚本」到「自适应智能体」
- 过去逻辑:按键精灵记录的是「在第1024像素处点击」。界面稍微调整,脚本报废。维护成本随时间指数级增长。
- 未来逻辑:新范式记录的是「意图+操作语义」。界面元素位置变了,AI通过视觉理解重新定位;流程多了一个审批环节,它观察一次就能更新技能包。脚本从「一次性胶片」变成了「会自我修复的生命体」。
维度三:连接网络 —— 从「数据孤岛」到「技能市场」
- 过去逻辑:每个企业的自动化都是定制项目,知识锁死在个别开发者的脑子里,离职即流失。
- 未来逻辑:Skill变成标准格式的「原子能力」,可以在企业内部共享、在不同AI智能体间调用、甚至跨企业交易。每个业务专家都变成了「技能供应商」,组织知识第一次有了可量化的载体。
理性边界:两朵乌云
- 安全与隐私:让AI「看屏幕」意味着它看到的不只是操作流程,还有密码、私聊、财务数据。如何划定「视线边界」,目前还没有标准答案。
- 泛化与可靠性:从一次演示中蒸馏出的Skill,能否在权限不同、数据量不同、边缘场景频出的真实环境中稳定执行?「看得懂」和「做得对」之间,仍有巨大的验证鸿沟。
五、收尾与余味
回顾全文:自动化的本质,从来不是「机器替代人」,而是**「人类经验的规模化」**。从车床到学徒,从管道到结晶,从API经济到认知经济——每一次范式的跃迁,都是让机器更靠近人类思考的方式,而不是让人类更靠近机器思考的方式。
「未来的软件不会问你『有没有API』,它会问你『你想让我看几次才能学会』。」
当自动化不再需要你「教」它,而是主动「学」你——人与机器之间那条曾经不可逾越的「隐性知识鸿沟」,终于开始填平了。 这不是终点,但绝对是一个值得记住的转折点。

— 全文完 —
夜雨聆风