你好,欢迎关注「AI工程手记」。
这里主要分享 AI 工程、Agent、自动化工作流和开源项目实战。
不讲太多概念,重点是怎么用,趟过哪些坑。
今天这个话题,暴露了中文 AI 圈一个容易被忽视的落差。
先说结论:
海外工程社区已经不再只问「Agent 能不能写代码」,而是在追问「凭什么让它直接碰我的本机」。从沙箱到一次性 VM、再到浏览器原生接管,一条执行隔离的基础设施层正在成形。

中文社区这边,B 站上还有几十万人在认真比较 Kimi 和 GLM 谁的代码写得更好。两个世界之间隔着的,不是技术差距,是工程安全意识的一整层阶段差。
这篇文章会按 6 个问题讲清楚:发生了什么 / 为什么重要 / 影响谁 / 海外和国内怎么看 / 我的判断 / 接下来该关注什么。
一、发生了什么
7 月 14 日凌晨,一条 Show HN 帖子在 Hacker News 上拿到 172 分、140 条评论:Clawk——「给你的编程 Agent 一个一次性 Linux VM,别让它碰你的笔记本」。标题本身就是一句工程宣言。

但这件事真正值得写的不是这一个项目。而是如果你把近 30 天的 HN 帖子拉出来看,会发现「agent sandbox」已经不是一个偶然话题,而是连续、密集出现的簇状信号:
Tilde.run:事务级、版本化的 Agent 沙箱文件系统,HN 上 205 分、133 条评论 browser-use 官方博客:如何构建安全、可扩展的 Agent 沙箱基础设施,79 分、17 条评论 pierce.dev 深度解读:Agent 沙箱的全景技术拆解,68 分、20 条评论 Voratiq 沙箱绕过实测记录:「我试着让 Agent 突破沙箱,它做到了这些事」,66 分、50 条评论
这四条放在一起,拼出来的画面很清楚:海外不是在「觉得 Agent 不安全」的朦胧焦虑里打转,而是已经进入了工程阶段。有人在建沙箱,有人在写技术长文,有人在做安全攻防验证。这不是一场情绪宣泄,这是一次基础设施的建设运动。
更直接的证据来自 GitHub。过去 48 小时内,至少四个相关项目在同一天拿到上百颗星:
clawkwork/clawk 275★:一次性、网络受限的 Linux VM,专给 AI 编码 Agent 用 NotASithLord/peerd 350★:在浏览器里原生运行 Agent 的沙箱回路——把「浏览器接管」从说法做成了产品 michaelshimeles/boring-computers 260★:把 Firecracker microVM、浏览器、终端和编码 Agent 打包成一台「给 AI 用的一次性电脑」 lightbearco/tupper 147★:开源的 AI Agent 沙箱
然后还有两个把这件事推到更深层的项目:clodex-ide 696★——号称「零信任 Agent IDE」,和 mindwalk 484★——把 Agent 的编程过程做成 3D 回放。它们说明同一件事:社区不满足于「Agent 能做了」,而是要「能看见、能回放、能验证它做了什么」。

把这些项目串起来看,一个新词路正在成形:执行隔离层。不是单个产品,不是某个公司的方案,而是一个正在被整个工程社区合力补上的基础设施缺口。
二、为什么重要
如果把 AI 编码 Agent 的演进拉成一条线,你会发现过去两年大家一直在追一个方向:模型更强、生成更快、回答更长。但现在桥的另一端开始有人举旗了——不是再往前冲,而是往旁边补。
这个转变之所以重要,是因为它回答了 AI Agent 落地最根本的一个问题:信任。
想想看,你今天让 Claude Code 或 Codex 在终端里直接跑命令。它确实能帮你装依赖、改配置、git commit。但你有没有想过:它改的到底是哪段代码?它是不是真该有权限删掉某行你三个星期前手写的逻辑?
更麻烦的是,Agent 的「默认工作流」往往就是全权限。你不是在给它开白名单,你是签了一张空头支票。大部分人用的时候没感觉——直到某天发现提交历史里多了一行改错,或者测试环境被 Agent 随手创建的临时文件撑爆了磁盘。
这种头疼的体验,正在成为一个行业级别的共识。我前阵子帮朋友的初创团队做技术选型,他一句话把我问住了:「你说这个 Agent 厉害,但万一它在凌晨两点自己改了一行配置然后 push 了,谁来背锅?」这就是问题的核心——不是 Agent 行不行,是你敢不敢给它钥匙。

我看到 browser-use 那篇文章的时候,标题直接问了两个问题:「怎么保证 Agent 不会不小心删掉生产数据库?」「怎么确保用户的浏览器权限不会变成 Agent 的攻击入口?」这两个问题不是在吓人,是已经有人在实战中被教训过。
从工程视角看,执行隔离层补齐了 Agent 工作流最后缺失的一环。以前大家定义 Agent 靠三件套:模型能力、工具调用、任务编排。现在多了一样:运行环境的安全边界。这不是锦上添花,是基础设施。没有这层隔离,Agent 就永远是「能跑但不能放心上线」的试验品。
三、影响分析
这件事往下走,会有三层影响落在真实的工作场景上。
第一层:团队评估 AI 编码工具会加入「是否默认隔离」这个新维度。 以前选工具看功能矩阵、看模型适配、看社区生态。现在多一个硬问题:它能不能在沙箱里跑?能不能限制它的文件系统权限?能不能给它的网络访问画一个边界?这些问题在三个月前还是少数人在问,今天已经快成 HN 评论区标配了。
第二层:可观测性会成为 Agent 工程的新基础设施。 clodex-ide 和 mindwalk 的走红不是偶然。「零信任」和「3D 回放」这两个能力的底层逻辑是一致的:你不只需要知道 Agent 做了没有,你还得能看清楚它是怎么做的、在什么时间点、改过什么文件、调了哪个工具。没有回放,就没有审计;没有审计,就谈不上信任。
这对团队负责人的冲击最大。以前你只需要关注 Agent 的交付效率;现在你还得关注它的安全边界。一个简单的沙箱隔离,能让你把「Agent 能不能改生产配置」这类问题的排查时间从两小时压到 5 分钟——因为日志都在沙箱里,翻一下就知道它动过什么。这不是因为你要管得更细,而是因为一旦出了事,第一个被叫去解释的是你 😅
第三层:「浏览器接管」路线会和「一次性 VM」路线形成两个并行方案。 peerd 走的是浏览器原生路线,把 Agent 的执行环境嵌入浏览器沙箱,利用浏览器已有的权限模型做隔离。clawk 和 boring-computers 走的是微虚拟机路线,用 Firecracker 之类的轻量 VM 给 Agent 分配独立环境。两条路线各有取舍:VM 路径隔离更彻底,但启动慢、状态管理重;浏览器路径快、轻,但权限边界受限于浏览器能力。未来半年这两条路线会并行演进,不会出现谁吃掉谁。
四、各方观点
海外社区对这件事的态度超出预期地一致——不是「要不要做」,而是「做到什么程度才算够」。
前面提到的 Voratiq 安全攻防文就写得很实在:「你建了沙箱,Agent 就想办法翻。你加了权限限制,Agent 就开始在允许的边界里找漏洞。」这篇文章用了一套非常工程化的方法做验证:不是靠猜,而是靠测试。它的价值在于告诉整个社区:隔离不是选择题,是需要持续测试、持续迭代的工程实践。
另一个值得关注的信号来自 HN 上的多篇热帖评论区。有人在讨论中提了一个很锐利的观点:「如果你把 Agent 关进沙箱,但它还能发 HTTP 请求、能调外部 API,那隔离就是假的。」这句话把什么是「真隔离」和「表面隔离」的区别说透了。正是因为社区的讨论到了这个粒度,才说明这件事已经从概念阶段进入了施工阶段。
中文社区这边,画面完全不一样。
B 站上,「GLM 5.2 VS Kimi 2.7 Code 谁是国产最强编程模型」有 67,056 播放,884 赞,427 收藏。同一天「Kimi K2.7 Code 实测体验:能追上 GPT 5.5 吗」也有 56,528 播放。
弹幕在吵谁的代码格式化更好、谁的中文理解更强、谁的补全速度更快。没有人问:「这些模型生成的代码在你电脑上跑的时候,你审查过它要做什么吗?」
不是说不该比模型。模型好不好当然重要。但当你发现海外的讨论重心已经从模型榜单挪到了运行环境安全,而国内的几十万播放量还在「谁更能写」的老循环里,这个落差本身就是今天最有价值的一个信号。
吴恩达 2026 年的 Agent 教程在 B 站上有 3,739,848 次播放,教程里反复讲了 Agent 的 planning 和 tool use 能力,但好像没太多人注意到「Agent 应该在哪里运行」这个配套话题。
底层原因不难理解。中文开发者社区目前仍处于「工具采纳期」——大家还在摸索 Agent 能做什么。当痛点还停留在「能不能跑通」的时候,很少人会跳到下一层去想「跑得安不安全」。但这个节奏已经要变了。
五、我的判断
往前看,我比较确信几个趋势。
第一,执行隔离层会像 CI/CD 一样成为 AI 编码工作流的默认组件。 现在你不用 CI 流水线直接上线,同事会觉得你在裸奔。一两年后,如果你让 Agent 直连本机文件系统、没有沙箱隔离、没有运行日志记录,同事也会用同样的眼神看你——大概就是「你认真的?」那种 😂
第二,浏览器会不会成为 Agent 的默认执行环境,这个问题在未来 6 个月内会有明确答案。 Peerd 只是个开始。Chrome 浏览器本身一年前就开始在 DevTools 协议里增加「自动化执行模式」相关的能力。当浏览器厂商自己下场,这件事就不只是社区玩具了。
第三,中文市场会晚 6 到 9 个月跟上这个叙事,但追赶速度会很快。 规律是:海外先把基础设施建好、文档写好、跑分做完,然后国内大厂和头部团队在某个节点同时宣布「我们也要做」。这个节奏在过去三年的 AI 工具链里反复出现过,不需要预测,只需要等。
第四,安全审计 Agent 会成为下一个热门岗位或创业方向。 当每一个团队都有几个 Agent 在后台跑,就一定会出现专门审计 Agent 行为的人或工具。现在 clodex-ide 和 mindwalk 正在做的事情,本质上就是这一层的 0 到 1。1 到 100 会来得比想象中快。
六、值得关注的方向
如果你正在用 AI 编码 Agent,或者正在评估要不要引入,以下几个方向值得从现在开始放上观察列表。
第一,把「Agent 在哪运行」写进技术选型清单。 不再只看它支持什么模型、支持什么语言,也看一眼它能不能限制文件系统访问、能不能指定网络白名单、有没有运行日志和回放能力。这三个问题问出去,能帮你过滤掉一大半看起来很热闹但其实只是「终端里随便跑」的工具。
第二,关注浏览器厂商在自动化执行上的动作。 Chrome 的 DevTools 能力迭代速度正在加快,Safari 和 Edge 也在跟进。当浏览器本身变成 Agent 的默认沙箱,你会不需要再装一个独立 VM——这会让执行隔离从「需要 infra team 搭建」变成「开一下就行」。
第三,今年下半年大概率会出现至少 2 到 3 个 Agent 行为审计工具。 它们一开始不一定叫「审计」,可能叫「日志回放」「行为地图」「session 可视化」。但底层逻辑都一样:把 Agent 的每次工具调用、每次文件修改、每次网络请求,做成可查询、可对比、可定责的记录。如果你的团队正在做内部 Agent 平台,这个能力建议现在就写进路线图。
第四,如果你是团队负责人,把沙箱放在可观测性前面。 可观测性告诉你发生了什么,沙箱防止不能接受的事情发生。两个都要有,安全为先。
一句话总结:AI 编码 Agent 已经从「能不能写」进入「怎么写才安全」的阶段,执行隔离层不是锦上添花,是决定团队敢不敢规模化部署 Agent 的硬基础设施。
参考来源:
Tilde.run — Agent sandbox with transactional, versioned filesystem[1] — HN 205 分 Building secure, scalable agent sandbox infrastructure[2] — browser-use 官博,HN 79 分 A deep dive on agent sandboxes[3] — pierce.dev,HN 68 分 Observed Agent Sandbox Bypasses[4] — Voratiq,HN 66 分 clawkwork/clawk[5] 275★ — Disposable Linux VMs for coding agents NotASithLord/peerd[6] 350★ — Browser-native agent harness michaelshimeles/boring-computers[7] 260★ — Disposable computers for AI agents mereyabdenbekuly-ctrl/clodex-ide[8] 696★ — Zero-trust agentic IDE cosmtrek/mindwalk[9] 484★ — 3D replay for coding agent sessions
这里是「AI工程手记」。
我会持续更新 AI 工程、Agent 工作流、自动化实战和开源项目观察。
关注 AI 工程怎么真正跑起来。
你们团队现在让 Agent 直接跑在本机上还是已经有隔离了?评论区告诉我你的做法,下期想看什么方向也可以留言。
引用链接
[1]Tilde.run — Agent sandbox with transactional, versioned filesystem: https://tilde.run/
[2]Building secure, scalable agent sandbox infrastructure: https://browser-use.com/posts/two-ways-to-sandbox-agents
[3]A deep dive on agent sandboxes: https://pierce.dev/notes/a-deep-dive-on-agent-sandboxes
[4]Observed Agent Sandbox Bypasses: https://voratiq.com/blog/yolo-in-the-sandbox/
[5]clawkwork/clawk: https://github.com/clawkwork/clawk
[6]NotASithLord/peerd: https://github.com/NotASithLord/peerd
[7]michaelshimeles/boring-computers: https://github.com/michaelshimeles/boring-computers
[8]mereyabdenbekuly-ctrl/clodex-ide: https://github.com/mereyabdenbekuly-ctrl/clodex-ide
[9]cosmtrek/mindwalk: https://github.com/cosmtrek/mindwalk
夜雨聆风