乐于分享
好东西不私藏

AI 自主写游戏自动玩,最全大模型实测效果与费用对比

AI 自主写游戏自动玩,最全大模型实测效果与费用对比
AA (aardio autos)今天发布的版本有较大改进。当其他 Agent 还在 Shell 命令行里苦苦挣扎读写文件出错,不小心清空了 C 盘等问题,在 AA里 AI 已经可以流畅地自主写游戏 …… 自己玩游戏了,全程自主操作。
最重要的是 AA 的运行环境只有几 MB,下载开箱即用。不需要任何复杂的配置,鼠标点几下就会用。最古老的 XP 电脑都能流畅运行(不需要安装任何其他东西)。
今天我们就顺手使用 AA 对全部主流模型做一次测试与对比。
  • 全部大模型都只用了 6 个字提示词“写个见缝插针”
  • 测试过程全程无人干预,完全由 AI 自主编码、测试、运行游戏、自己写自己玩 …… 遇到网络故障也自己修复自己重试。
  • 所有 AI 大模型(无论能力强弱)都可以全自主编写程序,遇到任何问题全部都 100% 自主解决。
以下是测试总结,位置靠上的模型效果更好,位置靠右费用成本更高。
▶ DeepSeek 4  Pro
在 AA 新版里用 DeepSeek 4  Pro推理强度=xhigh)“写个见缝插针” 
的效果如下图(GIF 画质受限,实际效果非常惊艳,吊打 Claude Fable 5 肯定没问题。测试过程的思考风格与平时差别很大,怀疑是撞到了什么隐藏实力的版本),本次测试费用 ¥0.88 
▶ GPT 5.6 Sol
AA 新版里 GPT 5.6 Sol(推理强度=max) “写个见缝插针” 的效果如下图,配色比上次的截图效果低调,但仅凭在内存里手绘就可以将 UI 细节做得很精致。本次测试费用 ¥16 
▶ DeepSeek 4  Flash
DeepSeek Flash(推理强度=max)在新版 AA 里测试“写个见缝插针”的效果截图如下本次测试费用 ¥0.25 
▶ GPT 5.6 Luna
AA 最新版本中 GPT 5.6 Luna(推理强度=max) 测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.27
▶ Gemini Flash 3.6

Gemini Flash 3.6(推理强度=high) 在 AA 新版中测试“写个见缝插针”的效果截图如下,测试费用 0 元(AI Studio 免费)。很多人以为 Gemini 弱 —— 这其实是很大的一个误解。Gemini 最大的问题就是不愿意调用工具(而 Agent 是一个勤能补拙的环境),例如这个任务,它调用了几次工具就立即交付代码了,有的模型调用几十次工具做得还不如它。

▶ Kimi3
Kimi3(推理强度=max) 在 AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥4.2 
▶ Hy3
Hy3(推理强度=high)大模型在 AA 中AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.28
▶ Doubao Seed Evolving 
豆包家的最新模型是 Doubao Seed Evolving , 号称持续进化、滚动升级,高频迭代,没有版本号 ……  让我们也来试试它到底如何。
注意火山的 openai / responses 协议都存在不兼容的字段,我已经做了处理,请先升级到 aardio 最新版本。
AA 最新版 Doubao Seed Evolving 模型(推理强度=high)测试“写个见缝插针”的效果截图如下,本次测试费用 0 元(火山协作计划每天有几百万免费 tokens)。Doubao Seed Evolving  实际定价与 GLM 5.2 在同一梯队。
▶ Claude Fable 5

Claude Fable 5(推理强度=xhigh) 在 AA 最新本测试“写个见缝插针”的效果截图如下,本次测试费用 ¥56 元。每一个像素都散发着美元烧焦的味道 。

▶ GLM 5.2 
GLM 5.2 (推理强度=high) 在 AA 最新本测试“写个见缝插针”的效果截图如下,本次测试费用 ¥5.8 元。有一个缺陷:绘图区覆盖了窗口标题栏。
▶ Qwen 3.8 Max

Qwen 3.8 Max (推理强度=max), 在 AA 最新本测试“写个见缝插针”的思考时间有点长。估计超过了半小时,其他模型最多几分钟就完成任务),因为我想看看它想这么久到底会写出什么效果,所以一直等待没有点中止。最后输出的成果截图如下。本次测试费用 ¥12.62