免费的 AI Agent,能进项目干活了!
每天对ChatGPT说“继续”
ChatGPT订阅额度改成每5小时重置后,我的真实工作状态变成了这样。
每天早上,ChatGPT的额度恢复。我打开昨天没干完的任务,敲两个字:继续。
它开始干活。读文件,改代码,跑测试,一干就是二十多分钟。额度用完,它停了。
然后我来:审核它写的代码。看逻辑对不对,看有没有乱改框架,看测试是不是真通过。审完。
五小时后额度恢复,再来一遍。

继续和限额
本来想再买Token,让它接着干。
但买完会员,再买Token,然后让AI替我上班。
算着算着,我纯在自费上班!
只能去看看那些免费的AI Agent,到底怎么样。
找了四个免费的
这次凑了四组免费选手:
- WorkBuddy + Hy3(国内大厂)
- OpenCode + Ox Alpha(开源网红)
- Antigravity + Gemini 3.7 Flash(国际巨头)
- Kilo + Auto Free(自动选免费渠道)
再加一个付费对照组:ChatGPT + GPT-5.6 Sol。
这几个东西,都不是只会聊天的AI。它们可以打开项目、读文件、修改代码、安装依赖、运行命令。理论上,都能干活。
Benchmark就不跑了,干活不看这个。直接上一个专为AI可读可写设计的开发框架:Cyber AI Forge。
先让它们“读”。看看能不能读懂一个真实项目。
然后让它们“写”。不是补一行代码,也不是改个按钮颜色,是直接从数据库、后端、接口写到前端页面。
看它们能不能干活。
先读项目
五个Agent,完全相同的提示词:
项目是干什么的;核心模块有哪些;一个请求怎么跑起来;新增“每日工作清单”应该改哪些地方;暂时不要写代码;800字以内;不允许泛泛介绍技术栈。

统一提示词
先说最直观的结果,字数:
- WorkBuddy:1700字
- Ox Alpha:1200字
- Antigravity:3900字
- Kilo:1800字,还顺手把技术栈介绍了一遍
- ChatGPT:806字,唯一一个没超太多的
要求800字,没一个听话的。最离谱的Antigravity直接干到3900字,翻了近五倍。
现在的AI,项目能不能读懂先不说,“少说一点”是真的很难。
不过抛开字数,五个Agent基本都读懂了Forge。
它们知道业务功能应该放在Platform,不应该动Foundation;知道前后端要共享接口契约;知道要建数据库表和迁移;也知道后端、前端、菜单和文档分别该放哪。
但AI最擅长的事情,就是把答案说得像那么回事。
开始干活
统一需求,新增“每日工作清单”:
用户每天有自己的工作项;支持新增、完成、取消完成、删除;默认查询当天;登录用户只能操作自己的数据;遵守现有模块、接口和数据库规范;不允许修改框架公共基础能力。是否补测试、异常处理和文档,由Agent自己判断。存在关键歧义,可以向我提问。
五个相同的项目。五个相同的Prompt。让它们自己跑。
只有报错或卡住时才介入,把每次介入都记下来。
WorkBuddy:一个问题都没问
零次主动提问,很快就说完成。
页面看着还行,但构建直接报错。修完构建,新增工作项又报错。再修完,列表不显示了。它自己排查了半天,方向还找错了,最后是我直接把问题位置拍给它才改对。改完再验,切换日期没有真正过滤数据,单元测试也没全过。
不问问题,不一定是全懂了。也可能是根本没有发现问题。

检查了一堆都没问题,乱猜了个错误,但是猜错了
Kilo:一直在修,最后还是没修好
Kilo是另一个极端。主动问了5个问题,态度很好,但结果不行。
需要说明,Kilo自动选择了免费组中的 Step 3.7 Flash模型。
额外给它发了4次报错,甚至直接告诉过它问题在哪。单元测试倒是跑通了,但运行时报错。它没有生成数据库迁移,也没提醒我。修到后来触发了最大输出限制,我点“继续”,接着失败。还把代码提交到了上层仓库。
代码一直在增加,错误也一直在增加。最后功能还是不能用。
Antigravity:测试全绿,页面全白
Antigravity开局看起来还不错:自动装依赖,自动生成迁移,单元测试全部通过,项目也起来了。
然后前端白屏。
我查下来是多语言适配问题导致运行时错误。正让它修,Gemini免费周额度耗尽。从自带的Gemini 3.7 Flash切到Claude Opus4.6接着干,给我来一句“代码没有问题”。最后我人工定位直接指出问题位置,才把白屏修掉。功能最终是通过了,但页面很丑,交互也不好用。

Ox Alpha:免费的,真把活交回来了
Ox Alpha主动问了6个问题,大部分有价值。只有一个软删除的问题,Forge框架规范写了的所有数据默认软删除,他还来问做软删还是真删,算个小瑕疵。
自动装依赖,自动写代码和测试,自动生成数据库迁移。发现Git有问题,自己处理了。发现要求做归档审查,自己补了。多语言问题报错,我只说有报错,它自己定位、自己修复。我没有告诉它问题在哪。
验收结果:六项要求全部实现,多用户数据隔离通过,可以直接合并代码。

ChatGPT:付费对照组
主动问了3个问题;没有报错;不需要我指问题;Git问题、数据库迁移、补测试、归档审查、菜单配置,全部自己搞定。六项要求和多用户隔离全过,UI完成度也是五个里面最高的。可以直接合并代码。

确实更稳。但额度又没了。
又开始等下一个五小时。
总成绩
过程写完了,最后放表:
四个免费的,一个代码可以合并;付费的,也可以合并。
免费的Agent,能进项目干活了吗?
免费的Agent已经不是玩具了。至少这次,真有一个把活干完,交了回来。
“能写代码”和“能干活”的区别,不在谁写的代码多,而在遇到问题时:有的Agent会自己继续检查、定位、修复,一路把活干到能合并;有的写着写着,就变成了我帮它排错、帮它找文件、帮它把剩下的活干完。
当然,这次它们能这么快读懂项目,也不全是Agent的功劳。Forge(Cyber AI Forge)的目录、模块、接口、文档和开发规范,本来就是为AI可读可写设计的。AI要进项目干活,项目自己也得先把话说清楚。这一点,很多老项目其实做不到,至于是不是值得为了AI重构项目,那是另一个话题。
至于ChatGPT……
我的额度应该快恢复了。我要去再跟它说一句:
继续。
夜雨聆风