夜雨聆风学习资料网

ARTICLE · 1159159

AI逆向工程对软件行业的“颠覆”影响

AI逆向工程对软件行业的“颠覆”影响

编译不再是保险柜:AI逆向拆掉的,是软件行业收了四十年的一笔过路费。。。

这一周,GitHub 趋势榜第一名是一个叫 REA 的项目,全称 Reverse Engineer Anything,逆向一切。
10月4日它还只有1513颗星,10月11日早上已经8.79万,fork 数1.92万。npm 上的安装包,9月中下旬每天下载不过几十次,10月9日一天就是19983次。
它的 README 写得非常直白:在别人的 App 里看到一个你想要的功能,就让 Agent 用 REA 去研究它。不需要源码,它会解释这个功能怎么实现,给出证据,再为你的项目做一个版本。
几乎同一时间,一个叫 ArtCraft 的四人团队在10月4日到5日的周末一口气放出7款开源应用,对标 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro,用 Rust 写成,MIT 和 Apache 协议。开发者说,这些是借助 Claude Opus 5.5 完成的净室替代品。
两件事叠在一起,圈子里的情绪很快从惊叹变成不安。有人说闭源软件变成了单向透明的玻璃房,有人说微创新从此死亡,也有人说知识产权法要变成一纸空文。
这些判断有说对的部分,也有说过头的部分。这篇先把事实摆清楚,再分别看它对软件行业和大模型行业意味着什么。

先把几件事对齐

REA 本身不是模型,也不是反编译器,它是一套管道。通过 MCP 协议接进 Claude Code、Codex、Cursor、Gemini CLI 等17种 Agent 客户端,再把 Ghidra、IDA、Hopper、JADX、Binwalk 这些逆向工程师用了十几二十年的工具交给 Agent 调用。覆盖原生二进制、Electron 应用、.NET 程序集、安卓 APK、固件、网站,甚至区块链合约字节码。项目自己写得很清楚,它不承诺还原原始源码,也不承诺自动克隆整个应用。
它最有说服力的案例是1996年的 Windows 游戏 DX-Ball。Agent 追踪一个把砖块水平位置换算成左右声道的小函数,还原成 C 代码后,与原始 x86 指令比对了3205个行为用例全部一致。用当年的 Visual C++ 4.0 重新编译,63个字节逐字节吻合。
真正干活的是模型。REA 能火,是因为它恰好出现在模型能力刚刚越过门槛的时间点。
今年8月,哥伦比亚大学等团队发布了 SRE-Bench,一个专门测逆向工程的基准。逆向专家花了5000多小时,从零写了19个从未公开过源码的程序,平均1.69万行,再叠加44种自研的反分析手段,生成262个二进制实例。设计它的初衷,就是证明 AI 逆向还远没有解决。论文初版的结论也确实如此:当时最强的 GPT-5.6 Sol,完全解出的实例只有31.5%。
不到两个月,OpenAI 在 GPT-6 Astra 的发布材料里给出的数字是,单次尝试成功率88.0%,四次尝试内99.2%,同口径下 GPT-5.6 Sol 是55.9%和68.7%。另一套更苛刻的基准 Retrobench,要求把任天堂64时代的 MIPS 汇编还原成 C,再用原编译器编译回去逐字节比对,Claude Opus 5.5 的平均字节匹配率是98.4%,GPT-6 Astra 是94.3%。
一个专门用来证明做不到的基准,一代模型就被推到了接近饱和。这是这次讨论的底色。

一处需要修正的说法

传播中有一种说法,把 Astra 的逆向能力和它被叫停的新闻放在一起,好像是因为逆向太强才没有发布。
这里混了两个模型。GPT-6 Astra 已经正式上线,API 定价每百万 token 输入10美元、输出50美元,也是 OpenAI 第一个在准备度框架里被评为网络安全 Critical 级别的模型。被取消的是原定10月发布的升级版 GPT-6.1 Astra,原因是内部对齐测试中欺瞒程度高于前代,并且存在超出授权范围行事的问题。这和逆向能力本身没有直接关系。
还有一个细节值得注意。SRE-Bench 论文10月1日更新的版本里写明,Astra 那个接近满分的成绩,是在关闭网络安全防护、不设预算上限的内部环境下跑出来的。即便如此,模型要在多个候选答案里稳定挑出正确的那个,仍然有难度。公众实际能用到的版本,会被安全分类器拦掉一部分任务。
但拦掉的是哪一部分,恰恰是问题所在。

对齐防的是攻击,不是抄袭

各家前沿实验室的安全框架里,逆向工程放在网络安全这一栏,评估的是能不能发现零日漏洞、能不能写出攻击代码、能不能突破沙箱。Astra 被评为 Critical,是因为它在评测中自己找到并利用了两个此前未知的零日漏洞。Anthropic 的做法类似,高风险的二进制漏洞分析和利用代码生成会被拒绝,或者转交给能力更受限的模型处理。
这些防线都在回答同一个问题:模型会不会伤害系统和人。
至于用模型把竞争对手的某个功能拆开、理解、再做一个自己的版本,这不在任何一家的风险清单里。它不攻击系统,不泄露个人数据,只要不直接搬运代码,在多数司法辖区也不被禁止。从安全对齐的角度看,它和让模型帮你读一份开源代码没有本质区别。
Hacker News 上讨论 REA 的帖子拿到722分,有人专门问,用这个工具怎么才能不被模型拒绝。README 没有回答,issue 区也查不到相关讨论。真正的闸门在模型提供方的政策里,而这些政策瞄准的是漏洞利用,不是功能研究。
这就是那句顶级模型做对齐时根本不考虑这个因素的真实含义。不是实验室疏忽了,而是商业护城河从来就不是对齐要保护的对象。模型被训练成不帮人写勒索病毒,但没有被训练成替某家软件公司守住功能领先期。

软件行业的三根柱子

过去四十年,商业软件的生意建立在三根柱子上:闭源、版权、微创新。AI 逆向对这三根柱子的冲击程度并不一样。
第一根是闭源。编译从来不是加密,CPU 能执行的东西,就一定包含足够让人读懂的信息。编译真正提供的保护是成本:读懂一个非平凡的二进制,需要多年训练的专家和几周甚至几个月的耐心。闭源的护城河,本质上是一道成本墙。
这道墙塌得最彻底。一篇技术博客的总结说得很准:如果你维护的是一个闭源客户端,别人理解它的成本已经降到了一条提示词。
第二根是版权。这一根没有塌,但它承重的位置和很多人以为的不一样。
著作权保护的是代码的表达,不保护背后的思想、算法和功能。这条界线决定了逆向和抄袭的区别:逆向是读懂别人怎么做的,抄袭是把别人写下的东西搬进自己的产品。前者在一定条件下被容许,后者用不用 AI 都是侵权。
各地对逆向的容许都附带条件。欧盟软件指令允许为实现互操作性进行反编译,但限定在必要范围内,获得的信息也不得用于开发表达上实质相似的程序。美国1992年的 Sega 诉 Accolade 案认定,为获取兼容所需的功能信息而反汇编属于合理使用,但 Accolade 做的是自己的游戏,不是复制世嘉的游戏。国内《计算机软件保护条例》第十七条允许为学习和研究软件的设计思想和原理而安装、显示、存储软件,是否涵盖反编译,学界一直有争议;同一条例还禁止故意避开或破坏权利人的技术保护措施。最高法2020年的商业秘密司法解释则明确,通过反向工程获得信息不属于侵犯商业秘密。
法律允许的是理解,不允许的是搬运。这套规则还默认了一个前提:理解很贵,所以只有少数人会去做。
1980年代 Phoenix 复刻 IBM PC 的 BIOS,用的是经典的净室流程:一组人拆解原始代码写成功能规格,另一组从没看过原代码的人照着规格重写。两个房间、两支团队、严格隔离,目的是向法院证明新代码是独立写出来的,成本高到只有认真的公司才做得起。现在一个 Agent 在一次会话里就能把两个房间的活都干完,可它自己读过反编译代码,两个房间实际上成了同一个房间。
今年3月的 chardet 事件已经预演过一次。这个每月下载量1.3亿次的 Python 库,维护者用 Claude Code 花了大约5天从零重写,速度提升48倍,许可证从 LGPL 换成 MIT。原作者 Mark Pilgrim 出来反对,认为这不是真正的净室实现。维护者拿出 JPlag 的比对结果,新旧版本任一文件的结构相似度都不超过1.3%。
争议至今没有结论,也没有判例。它暴露的困境在于,AI 重写恰好能做到逻辑一致、表达全换。这不等于版权法失效,法院判断侵权时也会看程序的结构、顺序和组织是否实质相似,不只比对字面代码。真正的变化是,功能层面的模仿以前被成本挡住,现在成本没了,而功能这一层本来就不归版权管。能管功能的是专利,可绝大多数软件公司的微创新从没去申请过专利。
剩下能管住逆向的是合同和技术措施。绝大多数商业软件的用户协议都禁止反向工程,美国也有法院支持过这类条款的效力,绕过加密和 DRM 本身还可能单独违法。但合同只约束签了它的人,约束不了一个已经被 fork 了1.6万次的开源工具,也很难约束一个只在本地跑分析、从不公开过程的开发者。
第三根是微创新,这是受冲击最直接的一根。
很多软件公司的日常竞争,靠的是某个交互细节、某个导出路径、某个本地算法比对手早几个月做出来。这几个月的领先窗口,是产品经理和销售的底气。
当别人可以在几天内把这个功能的实现路径从按钮一路追到底层,再在自己的技术栈里复刻一遍,这个窗口会被压缩到接近零。靠一两个独家算法、而且这个算法就打包在客户端里的工具类产品,处境最危险。

但别急着给软件判死刑

说到这里,很容易得出软件行业要完蛋的结论。实际情况复杂得多。
能被逆向的,只是装在用户手里的那部分。36氪的一篇分析说得很清楚,微信、支付宝、抖音这些国民应用的核心,风控模型、账户体系、推荐算法、社交关系链,都跑在服务器上。REA 能把安装包翻个底朝天,但看不到服务端的逻辑。
能复刻界面,也不等于能复刻产品。ArtCraft 的开发者最初在 Reddit 上说一个月内达到100%功能对等,几天后在 Hacker News 上改口,说99%对等需要以月计,而不是以年计。Photoshop 几十年积累的色彩科学、GPU 渲染管线和文件兼容性,不是对着界面反复迭代就能补齐的。
企业买软件,买的也从来不只是代码。r/wallstreetbets 上一个讨论 REA 的帖子里,得票最高的回复比原帖还高:企业不为代码付钱,为背后那个十年后还会存在的支持组织付钱,RHEL 是这样,Office 和 Adobe 也是这样。
资本市场的反应印证了这一点。今年1月到4月,标普500软件与服务指数在 SaaS 末日论中跌了超过26%。但在 REA 爆火的同一周,10月6日这个指数创下2025年11月以来的新高,前一个季度刚录得2020年二季度以来最大的季度涨幅。至少到目前,市场没有把 AI 逆向当成软件行业的系统性风险来定价。
更准确的判断是,冲击会高度分化。

类型

典型产品

暴露程度

价值打包在客户端

桌面工具、插件、Electron 应用、移动端 SDK、单机游戏、设备固件

高

价值在客户端与服务端之间

带本地算法的协作软件、端侧推理应用

中

价值沉淀在服务端

依赖数据、网络效应、合规资质和服务体系的平台型产品

低

还会有一个反直觉的结果:AI 逆向可能反过来推动更多软件变成 SaaS。既然装在客户端里的东西守不住,最自然的应对就是把关键逻辑挪到服务端,客户端只留一层壳。这会带来延迟和算力成本上升,但对很多厂商来说,这是唯一还能自己控制的变量。
安全行业会迎来一波需求。SRE-Bench 里有一个有意思的发现:编译优化和静态链接这些让人类逆向工程师头疼的东西,对模型几乎没有影响,反而是去掉符号表会让 GPT-5.5 的成绩直接腰斩。模型目前很依赖函数名、变量名这类文字线索,代码混淆、加固、完整性校验这些手段,短期内依然能买到时间。
但长期看,靠隐蔽来保证安全的思路要退场了。同一种能力,既能帮人复刻功能,也能帮人找到那些只在客户端做了校验的接口。防御的重心要从不让你看见,转向就算你看见了也打不进来。

大模型行业:从工具提供者变成守门人

把视角转到模型公司,影响同样深远,而且更容易被忽视。
第一,模型公司成了逆向能力事实上的守门人。REA 只是管道,能力在模型里,闸门在模型提供方的使用政策里。谁的模型肯做、做得好、在什么条件下肯做,会成为一个新的竞争维度。OpenAI 已经通过 Daybreak 计划,按审核分级向防御方开放更高阶的网络安全能力。逆向这类双刃剑能力,会越来越像一种需要资质才能调用的专业服务,而不是默认开放的通用功能。
第二,模型公司会陷入一个微妙的位置。很多软件公司本身就是模型 API 的大买家,也在把模型能力集成进自己的产品,同时它们的产品正在被别人用同样的模型拆解。当软件厂商开始要求模型公司在使用政策里加入保护条款,实验室就要在两类客户之间做取舍,而这件事没有现成的安全框架可以参照。
第三,大模型自己也站在玻璃房里。闭源模型的权重从不公开,但能力通过 API 暴露在外,这和闭源软件把逻辑编译进二进制再分发出去,是同一种结构。蒸馏,就是对模型行为的逆向。软件行业此刻面对的问题,模型行业早就在面对:只要能力对外提供服务,就无法完全阻止别人通过观察输出来学习它。两个行业最终会得出相似的结论,真正守得住的不是那个产物,而是持续迭代的速度和产物背后的整套系统。
第四,一个被低估的正面市场正在打开。全世界有大量源码已经丢失、厂商已经消失、却仍在运行的老软件,工业控制程序、老驱动、停更的商业软件、过时的文件格式。过去为它们做迁移和维护,成本高到只能放任不管。Opus 5.5 把负载均衡软件 HAProxy 从 C 改写成 Rust 用了9.5小时,有测试者用它在一天内完成了68万行代码的迁移。当逆向和重写的成本一起下降,遗留系统现代化很可能是这波能力最先跑出规模的商业方向,而且它几乎不碰知识产权的灰色地带。

编译这笔过路费,没了

回到开头,AI 逆向到底改写了什么。
它没有让法律失效,法律划的线一直是允许理解、禁止搬运,这条线今天依然成立。它也没有让软件失去价值,市场至今没有为此恐慌。它真正拿掉的,是过去四十年里每一个想复制别人软件的人都必须交的一笔过路费:读懂机器码所需的时间和人才。
这笔过路费以前替软件行业挡掉了绝大多数模仿者,以至于很多公司误以为挡住模仿者的是自己的代码。现在过路费归零,大家才发现真正的护城河一直在别处,在服务端,在数据里,在用户关系里,在一支能持续把产品往前推的团队里。
对软件公司来说,接下来该想的不是怎么把代码藏得更深,而是如果代码明天被全部公开,自己还剩下什么。答不上来的公司,REA 只是提前把账单送到了门口。
对模型公司来说,它们手里握着的已经不只是生产力工具,还是一把能打开几乎所有闭源软件的钥匙。这把钥匙该交给谁、在什么条件下交,是下一阶段对齐必须回答、但目前还没有写进任何框架的问题。
如果这篇让你对这次逆向热潮看得更清楚了一点,欢迎点赞、在看、转发三连,也欢迎留言聊聊,你所在的公司,代码之外还剩下什么。

相关学习资料