Product Hunt 上有个工具叫 tablo,介绍只有一句话:一只小猫,替你看着你的 AI 编程助手。
我一开始以为是恶搞。往下翻才发现不是——那几天的榜单里,干这件事的不止它一个。Port22 把 Mac 上跑的编程 Agent 投到手机上,240 票;AgentMicro 在 macOS 菜单栏里显示 Codex 任务跑到哪一步了,167 票;还有一个专门算你的 Claude Code 会话到底花了多少钱的,388 票。GitHub 那边也有 orca,专门管一整队并行跑的 Agent。
它们都不写代码。它们的工作是盯着写代码的那个 AI。
翻资料的时候看到一个数字,我盯着看了挺久。
Anthropic 关于 Agent 自主性的研究里提到:Claude Code 会话的单轮时长,99.9 分位从 2025 年底的不到 25 分钟,涨到了 2026 年初的 45 分钟以上。注意这是一轮。一个完整的功能从规划、实现、跑测试到修 bug,多跑几轮,几个小时是常态。
问题在于,Agent 默认不是全自动的。写文件、执行命令、访问网络,这些动作它会停下来问你一句"可以吗"。
于是就出现了那个很拧巴的场面:机器能连续工作几小时了,但它每隔一阵就要回头找你确认一下,而你可能在吃饭、在开会、在睡觉。
Agent Approve 的作者 Jim Beno 把这个两难说得挺准:"离开终端,Agent 就闲在那儿等审批;打开 yolo 模式,它可能把你的主目录删掉。"他说他做这个东西,就是不想在这两者之间选。
自动化本来是为了让人少干活,结果长出了一个新工种:AI 监工。
这一批工具,各自站在哪个位置
我把翻到的整理了一下:
| 工具 | 干什么 | 有意思的设计 |
|---|---|---|
| Port22 | 把终端里的 Agent 投到 iPhone | 直接读 Agent 给出的真实选项做成按钮,不是模拟按键 |
| AgentMicro | 菜单栏看并行的 Codex 任务 | 只读本地元数据,从不上传提示词、源码和历史 |
| tablo | 一只看着你 Agent 的小猫 | 纯观察 |
| LangWatch 的用量追踪 | 算这次会话花了多少钱 | 只算钱 |
| Agent Approve | iOS + Apple Watch,跨 14 个以上 Agent | 拦 250 多种破坏性命令模式,还会拆开复合命令 |
| Grass | 手机上看实时输出流 | 每帧带序号,断线重连能把漏掉的重放一遍 |
| Agent AFK | Telegram 通知 + 输出验证 | 拿你的测试套件反过来查 Agent 有没有虚报完成 |
看完这张表,最让我意外的不是它们有多少花样,是它们的共同点——几乎全是只读的。
AgentMicro 在介绍里专门强调只观察本地元数据;tablo 就是看着;LangWatch 只负责算钱;Port22 说得最直白,它明确写着自己不是一个新终端、不是 IDE、也不是 Agent,只是一座桥。
十来个工具挤在同一个位置:把 AI 干的活搬到你眼前,然后停住。
反转在这儿:点了同意,但你其实什么都没看
Port22 有个第三方评测,里面提到一个缺点,我觉得这是整件事最要命的地方——它的审批卡片不直接显示代码 diff,想看改了什么得再多点一下。
评测原话的意思是:这会鼓励用户在没有完整上下文的情况下点同意。
想想那个画面:手机震了一下,屏幕上一行字"是否允许修改 auth.ts",两个按钮。你在地铁上,一只手抓着扶手,另一只手点了"允许"。
那一下同意,很可能是你一天里信息量最少的一次决策。
这批工具解决的是"你能点",没解决"你该不该点"。它把你从桌子前解放出来,代价是把审批变成了一个更容易敷衍的动作。原来在电脑前你还会瞄一眼改动,现在在手机上,你连瞄的机会都被折叠掉了。
那有没有敢替你点的?有。Claude Code Watchdog 就是——它每两分钟轮询一次会话状态,识别六种状态(进行中、有待办、报错、阶段完成、空闲、等待输入),然后调 Claude API 来决定该不该继续,能自己往下推、自己提交、自己开 PR。
用 AI 来监工 AI。这个方案有它的道理,也有它的问题,不过权限该怎么分档、护栏该怎么设,是另一个话题了,这儿先不展开。
我觉得走对方向的,是那个不做通知的
整批工具里,Agent AFK 是个异类。
它也有 Telegram 推送,但真正有意思的是另一个功能:shadow-verify。它拿你项目里已有的测试套件,反过来对 Agent 的输出做一次交叉验证,专门抓一种情况——Agent 说"完成了",但其实没完成。
这个毛病有个名字叫"假完成"。用过编程 Agent 的大概都遇到过:它信心十足地告诉你搞定了,你一跑,报错。
我觉得这个思路和前面那批不在一个层面上。前面那些做的是"让你更快知道它卡住了",Agent AFK 做的是"让你不用亲自去确认它做对了"。
顺着这个想,这批工具其实可以分三层:
- • 通知层:它卡住了,告诉你一声(Port22、Grass、大部分手机端方案)
- • 观察层:它在干什么、跑了多久、花了多少钱(AgentMicro、tablo、用量追踪)
- • 验证层:它说做完了,这话可不可信(Agent AFK 的 shadow-verify、Agent Approve 的命令模式拦截)
前两层是缓解,第三层才是解。
真正的问题从来不是"我不在场",是"它说完成了,而我没有一个便宜的办法确认这件事"。前两层再做得精致,那个确认动作还是压在人身上——只是把它从桌子前挪到了手机上。
我的感受
按这三层把自己在用的工具过了一遍,发现我大部分精力都花在前两层:多装了几个提醒,多收了几条推送,本质上还是我在当那个瓶颈。
有个词最近在开发者圈里挺流行,叫"保姆税"——你用 Agent 省下来的时间,有一部分要交回去,用来看着它。这税交得心甘情愿,但总归是税。
我的感受是,这一批监工工具大概率是过渡形态。它们的出现刚好说明了一件事:Agent 已经能跑很久了,但还没学会怎么证明自己跑对了。等哪天它能自己举证,这些小猫、菜单栏图标、手表通知就该退场了——它们做得越好,越是在给自己倒计时。
这两天我顺手数了下自己被"等你确认"打断的次数,比想象中多不少。这个数字大概比任何一篇测评都更能说明,一个人需不需要这类工具。
夜雨聆风