乐于分享
好东西不私藏

免费的 AI Agent,能进项目干活了!

免费的 AI Agent,能进项目干活了!

免费的 AI Agent,能进项目干活了!

每天对ChatGPT说“继续”

ChatGPT订阅额度改成每5小时重置后,我的真实工作状态变成了这样。

每天早上,ChatGPT的额度恢复。我打开昨天没干完的任务,敲两个字:继续

它开始干活。读文件,改代码,跑测试,一干就是二十多分钟。额度用完,它停了。

然后我来:审核它写的代码。看逻辑对不对,看有没有乱改框架,看测试是不是真通过。审完。

五小时后额度恢复,再来一遍。

继续和限额

本来想再买Token,让它接着干。

但买完会员,再买Token,然后让AI替我上班。

算着算着,我纯在自费上班!

只能去看看那些免费的AI Agent,到底怎么样。

找了四个免费的

这次凑了四组免费选手:

  • WorkBuddy + Hy3(国内大厂)
  • OpenCode + Ox Alpha(开源网红)
  • Antigravity + Gemini 3.7 Flash(国际巨头)
  • Kilo + Auto Free(自动选免费渠道)

再加一个付费对照组:ChatGPT + GPT-5.6 Sol。

这几个东西,都不是只会聊天的AI。它们可以打开项目、读文件、修改代码、安装依赖、运行命令。理论上,都能干活。

Benchmark就不跑了,干活不看这个。直接上一个专为AI可读可写设计的开发框架:Cyber AI Forge

先让它们“读”。看看能不能读懂一个真实项目。

然后让它们“写”。不是补一行代码,也不是改个按钮颜色,是直接从数据库、后端、接口写到前端页面

看它们能不能干活。

先读项目

五个Agent,完全相同的提示词:

项目是干什么的;核心模块有哪些;一个请求怎么跑起来;新增“每日工作清单”应该改哪些地方;暂时不要写代码;800字以内;不允许泛泛介绍技术栈。

统一提示词

先说最直观的结果,字数:

  • WorkBuddy:1700字
  • Ox Alpha:1200字
  • Antigravity:3900字
  • Kilo:1800字,还顺手把技术栈介绍了一遍
  • ChatGPT:806字,唯一一个没超太多的

要求800字,没一个听话的。最离谱的Antigravity直接干到3900字,翻了近五倍。

现在的AI,项目能不能读懂先不说,“少说一点”是真的很难。

不过抛开字数,五个Agent基本都读懂了Forge。

它们知道业务功能应该放在Platform,不应该动Foundation;知道前后端要共享接口契约;知道要建数据库表和迁移;也知道后端、前端、菜单和文档分别该放哪。

但AI最擅长的事情,就是把答案说得像那么回事。

开始干活

统一需求,新增“每日工作清单”:

用户每天有自己的工作项;支持新增、完成、取消完成、删除;默认查询当天;登录用户只能操作自己的数据;遵守现有模块、接口和数据库规范;不允许修改框架公共基础能力。是否补测试、异常处理和文档,由Agent自己判断。存在关键歧义,可以向我提问。

五个相同的项目。五个相同的Prompt。让它们自己跑。

只有报错或卡住时才介入,把每次介入都记下来。

WorkBuddy:一个问题都没问

零次主动提问,很快就说完成。

页面看着还行,但构建直接报错。修完构建,新增工作项又报错。再修完,列表不显示了。它自己排查了半天,方向还找错了,最后是我直接把问题位置拍给它才改对。改完再验,切换日期没有真正过滤数据,单元测试也没全过。

不问问题,不一定是全懂了。也可能是根本没有发现问题。

检查了一堆都没问题,乱猜了个错误,但是猜错了

Kilo:一直在修,最后还是没修好

Kilo是另一个极端。主动问了5个问题,态度很好,但结果不行。

需要说明,Kilo自动选择了免费组中的 Step 3.7 Flash模型。

额外给它发了4次报错,甚至直接告诉过它问题在哪。单元测试倒是跑通了,但运行时报错。它没有生成数据库迁移,也没提醒我。修到后来触发了最大输出限制,我点“继续”,接着失败。还把代码提交到了上层仓库。

代码一直在增加,错误也一直在增加。最后功能还是不能用。

Antigravity:测试全绿,页面全白

Antigravity开局看起来还不错:自动装依赖,自动生成迁移,单元测试全部通过,项目也起来了。

然后前端白屏

我查下来是多语言适配问题导致运行时错误。正让它修,Gemini免费周额度耗尽。从自带的Gemini 3.7 Flash切到Claude Opus4.6接着干,给我来一句“代码没有问题”。最后我人工定位直接指出问题位置,才把白屏修掉。功能最终是通过了,但页面很丑,交互也不好用。

Ox Alpha:免费的,真把活交回来了

Ox Alpha主动问了6个问题,大部分有价值。只有一个软删除的问题,Forge框架规范写了的所有数据默认软删除,他还来问做软删还是真删,算个小瑕疵。

自动装依赖,自动写代码和测试,自动生成数据库迁移。发现Git有问题,自己处理了。发现要求做归档审查,自己补了。多语言问题报错,我只说有报错,它自己定位、自己修复。我没有告诉它问题在哪

验收结果:六项要求全部实现,多用户数据隔离通过,可以直接合并代码。

ChatGPT:付费对照组

主动问了3个问题;没有报错;不需要我指问题;Git问题、数据库迁移、补测试、归档审查、菜单配置,全部自己搞定。六项要求和多用户隔离全过,UI完成度也是五个里面最高的。可以直接合并代码。

确实更稳。但额度又没了。

又开始等下一个五小时。

总成绩

过程写完了,最后放表:

Agent
主动提问
用户发送报错
用户是否指出问题
是否切换模型
最终结果
WorkBuddy + Hy3
0次
2次
需要人Review和修复
OpenCode + Ox Alpha
6次
1次
可以直接用
Antigravity + Gemini
2次
2次
需要人Review和修复
Kilo + Auto Free
5次
4次
未完成
ChatGPT + GPT-5.6 Sol
3次
0次
可以直接用

四个免费的,一个代码可以合并;付费的,也可以合并。

免费的Agent,能进项目干活了吗?

免费的Agent已经不是玩具了。至少这次,真有一个把活干完,交了回来。

“能写代码”和“能干活”的区别,不在谁写的代码多,而在遇到问题时:有的Agent会自己继续检查、定位、修复,一路把活干到能合并;有的写着写着,就变成了我帮它排错、帮它找文件、帮它把剩下的活干完。

当然,这次它们能这么快读懂项目,也不全是Agent的功劳。Forge(Cyber AI Forge)的目录、模块、接口、文档和开发规范,本来就是为AI可读可写设计的。AI要进项目干活,项目自己也得先把话说清楚。这一点,很多老项目其实做不到,至于是不是值得为了AI重构项目,那是另一个话题。

至于ChatGPT……

我的额度应该快恢复了。我要去再跟它说一句:

继续。


桀士实验室,和你一起研究技术,也研究如何更好地工作与生活。感谢点赞关注。