上一篇(OpenClaw "养虾"日记 1——初步接触)记录了初步使用的体验。这一篇专门讨论模型:OpenClaw 本身只是 harness,任务完成质量取决于背后的模型。我从 2 月底用到现在,模型配置先后经过本地模型、火山方舟 Token Plan、MiniMax Token Plan 三个阶段,以下是各阶段的实测结论。
一、本地模型:Agent 场景不可用
上一篇测试了 Mac Mini M4 16G 上三款本地工具(Ollama、LM Studio、oMLX),对比详见上一篇。这里只补充结论:本地模型可以应对日常问答,但在 Agent 调用场景下基本不可用。
原因在于 Agent 的调用方式:单个任务回合会连续多次调用模型,任何一步输出质量下降或工具调用出错,整个任务就会失败。这个规模的本地模型,在输出准确性和工具调用可靠性上都达不到要求。
结论:16G 内存的机器,不值得再在本地模型上投入时间,直接使用在线 API。
二、火山方舟 Token Plan:订阅一个月后取消
上一篇提过火山方舟 Lite 套餐(40 元/月)。后来我订阅了方舟 Token Plan,完整使用了一个月,结论如下:
火山自家模型(豆包系列):响应速度可以接受,但模型能力不足,复杂任务的完成度明显偏低。 第三方模型(GLM、Kimi、MiniMax 等):按倍率折算额度,响应速度也无法支撑 Agent 调用。
关于倍率机制:方舟 Token Plan 采用 AFP 积分制,不同模型对应不同的消耗系数,较强的第三方模型系数可达 9 倍左右。以 Small 套餐为例,标称 2200 万 token,实际调用第三方模型时可用量只有 200 多万。

价格(2026 年 8 月查询,随时可能调整):
对 Agent 场景来说,这个平台两头都不合适:自家模型快但能力不够,第三方模型能力够但倍率高、速度不可用。订阅一个月后,我评估性价比不成立,取消了。
三、现在的主力:MiniMax Token Plan
取消火山之后,我转到 MiniMax,从 M2.7 用到现在的 M3。
我订阅的是 Starter 档,29 元/月。这一档已经下架,新用户无法购买,老用户按原价保留。现行三档为 Plus、Max、Ultra:

价格(2026 年 8 月查询,随时可能调整):
我的实际用量,从 M2.7 时期的每月约 3 亿 token,增长到 M3 时期的接近 10 亿。29 元档目前可以覆盖,但套餐有 5 小时滚动窗口和周窗口限制,偶尔会触发限流,等待窗口重置即可恢复。
M3 有两个明确的问题。
一是能力上限。常规任务、既定流程、批量操作都能可靠完成;一旦涉及方案设计、多约束条件的权衡这类复杂任务,成功率明显下降。这类任务我目前仍然交给 ChatGPT。现在的分工是:OpenClaw + M3 处理流程性工作,ChatGPT 处理复杂问题。
二是响应速度持续下降。早期单回合数秒返回,现在经常需要等待数分钟,期间只能先处理其他事情。原因未知,可能与用户量增长或限流策略调整有关,但趋势是确定的。
三是价格与能力的性价比。29 元 Starter 档目前可以覆盖我的用量,但这一档已经下架,新用户买不到。以 M3 当前能力来看,复杂任务仍需依赖 ChatGPT,主力模型只能干流程性工作——这种情况下,49 元的 Plus 档我认为不值得,同等预算可以考虑其他厂商的模型方案。换句话说,我继续用 MiniMax,很大程度上是因为 29 元老档还留着;如果现在要按 49 元重新订阅,我会重新选。
四、免费 API:大部分不值得投入时间
这段时间我也测试了不少第三方免费 API,包括厂商赠送额度和各类中转站。结论:

NVIDIA NIM(build.nvidia.com):测试的免费 API 中可用性最高。免费调用 MiniMax M2.7 等开源模型,限速 40 次/分钟,无需信用卡。高峰期偶有 429 限流,作为备用方案可用。 Google Gemini 免费层:免费额度在 2025 年底下调了 50-80%,Flash 档约 10 次/分钟、250 次/天。无法支撑 Agent 的多轮高频调用,应急问答可以。 其他赠送额度 / 中转站:普遍存在响应速度慢、额度有限、上下文仅 100K 出头的问题,无法满足 Agent 需求。
我的建议:不必为这类免费额度投入注册和调试时间。以我的实测,配置和验证一圈下来耗时半天以上,最终仍然要回到付费主力加一两个备用方案的组合。
五、我当前的模型配置

日常主力:MiniMax M3(Token Plan,29 元已下架档,老用户保留) 复杂任务:ChatGPT 备用:NVIDIA NIM(M2.7)、Gemini 免费层 本地模型:不再使用
注:29 元档已下架。以 M3 当前能力,49 元 Plus 档性价比偏低,新用户建议对比其他厂商后再决定。
总结
五个月的使用下来,我的一个基本判断是:OpenClaw 的体验上限主要由模型决定,harness 本身的折腾空间反而是次要的。模型选择没有一劳永逸的方案,我这段时间的三次切换(本地 → 火山 → MiniMax),每次都是在当时的选项里取最优。
另外三点观察,供参考:M3 的响应速度在持续下降,说明低价订阅档的服务质量存在不确定性;M3 的能力上限决定了它只适合做流程性工作,49 元的新档性价比偏低,订阅前值得横向对比其他厂商;免费 API 中真正能用的极少,评估这类方案时,配置和调试的时间成本应该计入。
夜雨聆风