你有没有过这种时刻,想教会 AI 一个你天天在做的操作,结果光是把步骤讲清楚就花了一个小时。我跟你说,我上周就干过这事。想让智能体帮我整理周报,我先写「打开后台,点开报表,筛选上周数据,导出 CSV,再套模板」,写到这里我已经开始怀疑人生了。最气人的是,写完它照做,第三步就崩了,因为界面上那个按钮叫「导出表格」不叫「导出 CSV」。真的就是一声叹息。
所以当我看到微软开源的 Skill Recorder 时,第一反应是,这玩意怎么不早点出来。它的思路特别朴素,你负责做,它负责看。你打开电脑正常干一遍活,录屏软件把你的点击、窗口切换、访问的页面全部记下来,如果你愿意还可以顺便录一段语音讲解。然后 AI 根据这段真实操作,自动反推你的意图和步骤,生成一份智能体能直接用的技能文件。整个过程不用写一行代码,不用解释任何细节,你只要「做一遍」就行。
这个项目叫 Skill Recorder,是微软官方 7 月底放出来的,GitHub 地址在 github.com/microsoft/skill-recorder,发布当天就上了 trending,现在 510 个星。名字起得很直白,技能录像机。它要做的事情,就是把「教 AI 干活」这个过去极度反人性的事情,压缩成「录一遍」。
WECHATIMGPH_0
先说说它到底怎么用。整个流程分 4 个阶段,录、析、规、建,官方叫 Record、Analyze、Plan、Create。
第一步录制。打开应用点一下录制键,或者从任何界面按快捷键,macOS 是 Command+Shift+R,Windows 是 Ctrl+Shift+R。然后你就正常干活,录屏软件在后台安静记录你的屏幕、鼠标、窗口切换和页面跳转。语音讲解是可选的开着的,默认关,你愿意边做边讲就打开麦克风,语言和麦克风都能在录制中随时切换。
第二步分析。活干完了,点 Analyze,GitHub Copilot 就开始干活,它把刚才那段时间线里的窗口标题、URL、截图、语音转的文字拼在一起,还原出你「整体想干什么」加「按顺序干了什么」。这一步是核心,它理解的是意图,不是死记硬背坐标。你录一次「给新客户建账号」,它学到的是「建账号这个流程」,而不是「在屏幕 1300 像素处点一下」。
第三步规划。AI 给出意图和步骤列表后,你可以随便改,增删、排序、调整都行,它还顺手把里面的固定值,比如某个网址、某个仓库名,抽出来变成可以编辑的变量,而不是写死在每一步里。你审完,它才开始生成。
第四步创建。生成出来的是标准格式的技能文件,1 份 SKILL.md 放在本地的技能目录,或者1 份 automation.json 用于定时自动执行。有意思的是,它生成的步骤不是让你回放录屏时的鼠标轨迹,而是优先用智能体自己的原生工具,比如 gh 命令行、网页抓取这种,所以它学的是「任务逻辑」,不是「屏幕像素」。你录一遍提交一个表单,它能推广到提交所有类似的表单。
这里我得插一句实话,它跟传统的宏录制完全是两码事。按键精灵那种录的是坐标和延时,窗口一挪就废。Skill Recorder 录的是语义,Copilot 会把「操作背后的逻辑」提炼出来,生成的是人类能读、AI 能懂、还能改的文档。你看它生成的技能文件,其实吧,就是一份 Markdown 写的小手册,标题、触发条件、输入参数、执行步骤、验收标准,清清楚楚。
安装也不复杂,但得有点心理准备。它现在发布的是源码版,没有现成的安装包,你要去 GitHub Releases 页复制一条安装命令,它会自动下载固定的 Node.js 运行时,拉取对应版本的源码,在你机器上现场编译,然后生成一个叫 Skill Recorder 的应用图标。macOS 是主力支持,Windows 11 也能用,需要你有 GitHub 账号并且开通了 Copilot,因为分析和生成都得靠 Copilot CLI 来完成。
说到限制,我得坦诚讲,这还远远不是个成熟产品。我自己读它源码和文档的时候,发现几个坑。第一,它目前只会生成单文件技能,references、scripts 这些配套目录还不支持,复杂技能还是得手动补。第二,录制期间数据都在本地,但点 Analyze 那一刻,窗口标题、URL、剪贴板预览、截取的画面、语音内容会发到 GitHub 的云端处理,所以录之前它都会提醒你,别录密码、令牌、密钥这些敏感信息。第三,自动脱敏功能还没做好,GitHub 上有个相关 pull request 还挂着 DO NOT MERGE 的标记。第四,依赖里有一些 npm 安全告警,官方自己也说,不建议在正式工作电脑上随便装。所以现在正确的姿势是,拿个隔离环境,用假数据先玩。

这玩意最让我感慨的,是它出现的时间点。你发现没有,过去这两周,录屏教 AI 这个方向突然就挤进来 3 家巨头。7 月 21 号 OpenAI 的 Codex 上线了 Record & Replay,搜狐那篇报道的标题起得特别传神,说「这哪是 AI,是数字学徒啊」。7 月 24 号 Anthropic 给 Claude 桌面端 Cowork 也推了 Record a Skill 录屏教学,面向付费用户全量开放。然后 7 月 29 号,微软把 Skill Recorder 开源了。三家巨头,两周之内,不约而同盯上了同一件事。
你想想看,这背后其实是一个共识,教 AI 干活的门槛,已经从「会不会写代码」降到了「会不会做事」。以前你想让 AI 帮你自动处理一个业务流程,要么会写代码,要么会写复杂的提示词,要么得啃一堆文档。现在三家给出的答案一模一样,你做一遍,它就会了。这个转变,比任何模型参数都重要。就像当年照相机从「要懂光圈快门」变成「按一下就行」,自动化这事,也到了「按一下就行」的门口。
当然,跟 Codex 和 Claude 那两个闭门产品比,微软这步棋有它的特殊性,它把整个项目开源了。你可以看到它完整的源码、测试、评估框架,甚至能自己改。而且它生成的技能是标准格式,SKILL.md 和 automation.json,那结果就是,这些技能文件可以跨工具流通,你在微软这套体系里录的技能,理论上别家智能体也能读。这种开放姿态,倒是挺符合微软最近在智能体生态上的打法,把底座做出来,让生态自己长。
顺着这个再聊聊适用人群。我觉得最受益的,反而不是程序员。程序员本来就会写脚本,录屏对他们来说是锦上添花。真正会尖叫的,是那些天天在网页后台和办公软件里做重复操作的人,运营、财务、HR、客服,他们的日常工作里有大量「打开某系统,填表,提交,再打开下一个」的流程。这些人不会写代码,但他们的经验恰恰是最值钱的,因为里面全是踩过坑才知道的隐性判断,比如某个特殊格式的客户数据该怎么判定,某个系统报错该怎么兜底。以前这些经验只能靠交接文档传承,文字写出来还会丢细节,现在录一遍屏加一段语音,全给你沉淀成 AI 能执行的技能了。

我自己试完的体感是,这玩意最妙的地方在于,它逼你把工作流程想清楚。你录屏的时候不能瞎点,得按逻辑来,录完 AI 帮你复盘出步骤,你还能顺便检查一下自己平时是不是绕了弯路。这哪是教 AI,这是借着教 AI 把自己的活也重新梳理了一遍。反正我是真觉得,这种「演示即编程」的方向,说到底就是接下来一年里自动化工具的主流玩法。
最后说一句,微软这个项目现在还挂着 experimental 的标签,issue 区里也有人反馈录制会崩、文档模板没改完这些毛病。但方向是对的,而且开源意味着它会以社区能看见的速度进化。我建议你找个周末,拿个不重要的账号,录一遍你平时最烦的那个流程,感受一下「做一遍 AI 就会了」是什么体验。反正我已经在盘算,下周一那份周报,要不要直接让它来。
夜雨聆风