AI 自主写游戏自动玩,最全大模型实测效果与费用对比AA (aardio autos)今天发布的版本有较大改进。当其他 Agent 还在 Shell 命令行里苦苦挣扎读写文件出错,不小心清空了 C 盘等问题,在 AA里 AI 已经可以流畅地自主写游戏 …… 自己玩游戏了,全程自主操作。 最重要的是 AA 的运行环境只有几 MB,下载开箱即用。不需要任何复杂的配置,鼠标点几下就会用。最古老的 XP 电脑都能流畅运行(不需要安装任何其他东西)。 今天我们就顺手使用 AA 对全部主流模型做一次测试与对比。 全部大模型都只用了 6 个字提示词“写个见缝插针” 测试过程全程无人干预,完全由 AI 自主编码、测试、运行游戏、自己写自己玩 …… 遇到网络故障也自己修复自己重试。 所有 AI 大模型(无论能力强弱)都可以全自主编写程序,遇到任何问题全部都 100% 自主解决。 以下是测试总结,位置靠上的模型效果更好,位置靠右费用成本更高。 在 AA 新版里用 DeepSeek 4 Pro ( 推理强度= xhigh) “写个见缝插针” 的效果如下图(GIF 画质受限,实际效果非常 惊艳,吊打 Claude Fable 5 肯定没问题。 测试过程的思考风格与平时差别很大,怀疑是撞到了什么隐藏实力的版本 ),本次测试费用 ¥0.88 AA 新版里 GPT 5.6 Sol( 推理强度= max) “写个见缝插针” 的效果如下图,配色比上次的截图效果低调,但仅凭在内存里手绘就可以将 UI 细节做得很精致。本次测试费用 ¥16 DeepSeek Flash( 推理强度= max)在新版 AA 里测试 “写个见缝插针”的 效果截图如下 , 本次测试费用 ¥0.25 AA 最新版本中 GPT 5.6 Luna( 推理强度= max) 测试 “写个见缝插针”的 效果截图如下, 本次测试费用 ¥0.27 Gemini Flash 3.6(推理强度=high) 在 AA 新版中测试“写个见缝插针”的效果截图如下,测试费用 0 元(AI Studio 免费)。很多人以为 Gemini 弱 —— 这其实是很大的一个误解。Gemini 最大的问题就是不愿意调用工具(而 Agent 是一个勤能补拙的环境),例如这个任务,它调用了几次工具就立即交付代码了,有的模型调用几十次工具做得还不如它。
Kimi3(推理强度=max) 在 AA 新版中测试“写个见缝插针”的效果截图如下 ,本次测试费用 ¥4.2 Hy3(推理强度=high)大模型在 AA 中AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.28 豆包家的最新模型是 Doubao Seed Evolving , 号称持续进化、滚动升级,高频迭代,没有版本号 …… 让我们也来试试它到底如何。 注意火山的 openai / responses 协议都存在不兼容的字段,我已经做了处理,请先升级到 aardio 最新版本。 AA 最新版 Doubao Seed Evolving 模型(推理强度= high) 测试“写个见缝插针”的效果截图如下 ,本次测试费用 0 元(火山协作计划每天有几百万免费 tokens)。 Doubao Seed Evolving 实际定价与 GLM 5.2 在同一梯队。 Claude Fable 5(推理强度=xhigh) 在 AA 最新本 测试“写个见缝插针”的效果截图如下,本次测试费用 ¥56 元 。每一个像素都散发着美元烧焦的味道 。
GLM 5.2 (推理强度=high) 在 AA 最新本 测试“写个见缝插针”的效果截图如下,本次测试费用 ¥5.8 元。有一个缺陷:绘图区覆盖了窗口标题栏。 Qwen 3.8 Max (推理强度=max), 在 AA 最新本 测试“写个见缝插针”的思考时间有点长。估计超过了半小时,其他模型最多几分钟就完成任务),因为我想看看它想这么久到底会写出什么效果,所以一直等待没有点中止。最后输出的成果截图如下。本次测试费用 ¥12.62