乐于分享
好东西不私藏

AI编程工具"塌房"实录:27800倍流量差背后,你的代码去了哪里?

AI编程工具"塌房"实录:27800倍流量差背后,你的代码去了哪里?

AI编程工具"塌房"实录:27800倍流量差背后,你的代码去了哪里?

你以为在用AI提效,其实AI在"学习"你的代码。2026年盛夏,AI编程工具的数据安全问题集中爆发,每一个开发者都应该看看。


一、一次抓包,撕开AI编程工具的"遮羞布"

2026年7月,安全研究员cereblab做了一次看似普通的测试。

他在本地搭建了一个12GB的Git仓库,向Grok Build下发了一个简单的指令:"理解一下这个仓库的代码"。

结果让他脊背发凉。

Grok Build启动后,建立了两条独立的HTTPS通道:

通道 端点 传输内容 流量
交互通道 /v1/responses 任务上下文片段 192 KB
存储通道 /v1/storage Git打包分块(75MB/块) 5.10 GiB

流量差:27800倍。

你以为它只传了当前文件?不,它把你整个.git目录打包传了上去——包括全部commit历史、已删除的.env密钥、内部路径、还有你以为早就删掉的敏感信息。

更讽刺的是,研究员特意在仓库里放了一个标记文件,明文写着"不要读取"。结果Grok Build连看都没看,直接repack分片上传。

你删掉的东西,Git替你记着。AI替你传着。


二、Claude Code:沉默的"后门"

Grok Build事件爆发后,社区开始审视其他AI编程工具。

很快,Claude Code的底裤也被扒了。

安全社区逆向发现,Claude Code客户端存在未公开的后台传输逻辑:

  • 用户在无感知的情况下,本地代码数据被静默传出
  • 客户端二进制内嵌"静默功能",无法通过常规手段感知或阻止
  • 启动后建立多个WebSocket连接,部分payload远大于当前任务所需
  • 即使未下发任何编码任务,客户端仍定期向外发送包含文件路径、依赖树、代码片段的元数据包

具体传了什么、传到哪、传了多少,没人知道。

闭源二进制,你永远不知道它开了几个隐藏协程。


三、横向对比:谁在裸泳?

为了搞清楚AI编程工具行业到底多"脏",我们做了同维度流量审计:

工具 上传范围 打包Git历史 隐私开关有效 后门疑点
Grok Build 完整.git目录 ❌ 虚假 ✅ 已证实
Claude Code 疑似文件级+元数据 未知 未知 ✅ 已曝光
Codex 仅当前上下文片段 ❌ 无报告
Gemini 无主动上传 N/A ❌ 无报告

结论:只有Grok Build和Claude Code被证实存在"用户承诺以外的数据传输行为。


四、为什么AI工具敢这么干?

1. 数据主权与商业诉求的根本冲突

模型质量依赖数据,厂商天然倾向收集更多。当"用户隐私"撞上"模型迭代",后者往往胜出。

Grok Build那个远程开关暴露了更可怕的事实:你以为自己在用本地客户端?不,你只是厂商云端的一个瘦终端,核心行为全由云端配置实时操控。

关闭隐私开关后,服务端仍返回 trace_upload_enabled: true,上传照旧。7月13日xAI只是远程关了开关,客户端代码原封不动,想开随时能开

2. 缺乏强制审计与透明性

闭源二进制不接受第三方审计,隐私政策永远写着"改进服务"四个万能大字。你永远无法验证它"声称"的和"实际"做的是不是同一件事。


五、开发者如何自保?

几个硬核建议,不是那种"注意安全"的废话:

1. 永远不要让AI工具碰到.git目录

敏感项目放虚拟机里跑,用完整快照,用完就回滚。别嫌麻烦,数据泄露更麻烦。

2. 网络层物理拦截

在hosts或企业防火墙中屏蔽所有已知AI工具域名。使用本地代理(Proxyman/Charles)配置正则规则,拦截 /v1/storage/upload/traces 等特征路径。

3. Git脱敏预处理

使用 git filter-repo 清除历史中的所有密钥、敏感注释、内部路径。创建"干净分支",只留当前必需文件,敏感变量全替换成占位符。

4. 流量审计常态化

部署eBPF监控(如Pixie、Cilium)实时检测异常出站流量。设定告警规则:单会话出站 > 10MB即触发警报,强制中断进程。

5. 优先选用开源或可审计工具

若必须使用AI编程助手,优先选本地可审计的开源方案(如Continue.dev),或使用本地部署的模型(如Ollama),从源头切断数据外流。


六、结语

Grok Build整库上传、Claude Code后门暗桩——这两件事不是孤例,而是AI编程工具行业"数据贪婪"的冰山一角。

27800倍流量差、虚假隐私开关、远程控制客户端,每一项都在宣告"默认安全"的死刑。

面对闭源二进制,我们唯一能相信的不是厂商的承诺,而是自己的抓包工具、防火墙规则和沙箱策略。

AI编程可以提效,但绝不能以数据主权为代价。

把工具关进笼子里,才是这代开发者应有的清醒。


你用的是哪个AI编程工具?遇到过数据安全担忧吗?欢迎在评论区聊聊。


延伸阅读:

  • 《OpenAI智能体逃逸事件:AI失控比AI觉醒更危险》
  • 《1300个npm包遭供应链投毒:AI幻觉成了帮凶》
  • 《AI冲击下的白帽生态:88%的企业在用Agent,赚到钱的不到一成》