ARTICLE · 1045683
为什么 AI 公司都要偷你的代码?
为什么 AI 公司都要偷你的代码?前两天智谱 ZCode 偷传用户代码这事,刷屏两天了,大家也都骂两天了。 不过我看大家没骂到点子上,今天爬上来说道说道。 1.先给不知道的人说下发生了啥。技术博主逆向了 ZCode 的客户端,发现这玩意会在后台给你整个项目做快照,注意,是整个项目,连 .git 目录一起打包加密,上传到阿里云 OSS。他抓到的一个商业项目快照有 313MB,4.2 万个文件,.git 占了 86.6%。也就是说它打包的不只是你当前的代码,旧提交,曾经下载的大文件缓存,本地分支的操作记录,全在里面。 2.两个细节最膈应人。一个是只要处于登录状态这套机制就跑,界面上现有的「优化体验」和「仓库快照索引」两个开关,都拦不住本地打包和上传。另一个是 ZCode 的隐私政策只写了会收集你「在对话中提交」的文本和代码,整个仓库和 Git 历史,一个字没提。 3.智谱官方之后做了回应:问题出在「代码库索引」关联的 Repo Wiki,生成 Wiki 时会触发仓库数据上传,生成完「立即销毁,不会保存」,功能上线初期默认开启,目前已修复。补偿措施三条:近期开源 ZCode 代码库,邀请第三方评估人员审查,给全体用户额外发一次周额度重置。三条里最有分量的是开源,客户端代码公开之后,上面这些逆向结论谁都可以自己验。 4.这事不是第一次发生。今年 7 月,马斯克旗下的 Grok Build(CLI)被安全研究者用类似手法抓包:完整代码仓库连本地敏感配置,静默上传到谷歌云存储,默认开启,界面没开关。后续处理手法几乎一样,先是远程悄悄关掉上传,压不住了,三天后马斯克官宣开源 Grok Build 的 CLI 和工具框架,外加给用户重置额度。 5.所以这事不是第一次 AI 公司这么干了,一堆人骂它侵犯用户隐私,偷看用户数据。确实是侵犯用户隐私,但我说实话,对于一般的公司和个人,那些顶尖 AI 公司真没兴趣看你的项目产品,它要的是你本地代码真实语料库,去针对性训练改进他们家的 AI。 6.原因很简单,公开 GitHub 语料到现在基本被爬干净了,想继续变强,增量只剩两个地方:企业内部的私有仓库,和你电脑里的本机代码。这两个地方,恰好是 Coding 工具天然能摸到的。而且最值钱的是 Git 历史,不是代码本身。代码只是答案,Git 历史才是解题过程,一个文件从报错改到能跑,为什么这样重构,哪次回滚救了命,这些「怎么改的」过程数据,才是训练 Agent 最缺的东西。只会看最终代码的模型,会写代码片段,看过海量「从错改到对」过程的模型,才会干活。 这个才是最真实的原因。 7.有人可能会问:GitHub 每天那么多项目,为啥还非得要用户真实项目仓库。 GitHub 在之前确实是宝藏,但是现在缩水严重。因为一大堆人都可以借助 AI 随便折腾一些垃圾开源项目,哪怕一些 star 数很大的项目,也都是垃圾。东西是折腾出来了,但是架构设计和代码质量差的要死,对 AI 的训练来说,这都属于污染数据,如果训练 AI 的公司,不做数据清洗,一味的把当下市面上 GitHub 仓库塞进语料,很可能让 AI 能力不进反退。 而开发者本地真实的项目仓库,包含了开发者们的真实使用场景,你的代码质量,重构方案,Git 操作历史都是最好的参考,很多时候,比 GitHub 上一个 star 数很高的所谓完整项目,更有价值。 所以,这里给大家一个真实的参考建议,不要过度迷信 GitHub star 数多的项目,我说实话,从一个开发者的角度来说,非常多的垃圾项目。 8.如果说 Grok 那次算是行业首发,我以为行业都会引以为戒,不会再犯了,没想到居然还会有。中国古语有云,事不过三,之后,如果还有类似的公司这样干,我觉得不要手软,不仅要骂得狠一些,之后这家公司的任何产品都不要再用了,骂到它倒闭都不为过。 为什么都要偷?一句话:你电脑里躺着的,是这条赛道唯一买不到的资产,也许我们很多人不那么在乎我们的本地数据,但是你拿之前起码要告诉我一声吧。 推荐阅读: 新增了一个大使身份 一年一次