乐于分享
好东西不私藏

打通OpenClaw第一关,选择合适的大模型

打通OpenClaw第一关,选择合适的大模型
两个指令,花费近20元。(详见上一篇“装好OpenClaw第三天,两个简单指令消耗七百万Tokens”)
这件事促使我开始认真研究大模型选择的门道。从看不懂模型名字,到摸清什么任务用什么模型,中间踩了不少坑,也摸出了一些经验。
这一篇,就是把这些实操经验分享出来。

第一步:了解各家大模型

看懂模型代号

第一次打开OpenClaw的配置文件~/.openclaw/openclaw.json,看到模型名字长这样:
"qwen/qwen3.5-plus": { "alias": "Qwen"}
"qwen/kimi-k2.6": {}
乍一看不明白,按照结构拆开看就清楚了,标准结构是这样的:
"provider/model": {"alias": "自定义简称"}
其中:
  • provider:  模型供应商,qwen是指通义千问,类似的模型供应商还有deepseek、moonshot、volcengine等。
  • model:具体模型名称,qwen3.5-plus是通义千问3.5的plus版本,类似的模型名称还有deepseek-v4-pro、kimi-k3、doubao-seed-2.0-pro等。
  • alias:自定义模型简称,便于标识即可。
模型名称有个一般性规律:同一系列通常分Mini、Flash、Plus、Pro几个档次。Mini最轻最便宜,Pro最强最贵。Flash介于Mini和Plus之间,主打速度快、轻量化。

主要模型供应商

OpenClaw支持国内外主流的模型供应商,比如anthropic、openai、google等境外知名模型供应商,以及deepseek、moonshot、volcengine、qwen、zai、minimax等国内知名模型供应商。
对于日常场景,选用国内供应商即可满足使用要求:
  • 在境内调用境外模型供应商提供的大模型需要采取特殊的措施,比较麻烦,速度较慢;
  • 国内供应商提供的大模型性能直追境外大模型,近期kimi-k3震撼出世,更是缩小了境内外大模型的差距;
  • 像我这样,踏足AI世界不久的使用者,国内供应商的大模型足以覆盖全部使用要求,目前不涉及编程,基本用不上anthropic/claude-opus-4-6、openai/gpt-5.6。
当然,如果没有网速、支付和预算方面的限制,以上选型建议可以忽略,直接上最强模型。

申请各模型供应商的API_key

申请国内主流模型供应商API_key的网址,列举如下:
模型供应商
申请API_key网址
deepseek
https://platform.deepseek.com
moonshot
https://platform.kimi.com/
zai
https://open.bigmodel.cn/
minimax
https://platform.minimaxi.com/
bailian
https://bailian.console.aliyun.com/
volcengine
https://console.volcengine.com/ark/

需要说明的是,这里的网址,不是配置模型的baseurl的网址。

第二步:不同任务,选用不同模型

打开聊天界面,看着模型选择菜单里密密麻麻排列着几十个模型名字,一时间不知道选哪个更合适。
最后,随便点一个,或者保留默认值。
我最初就是这样的,没有明确的选择方法,就选了系统默认的那个大模型。因此也付出了代价。
不同的任务,选用不同的大模型
或许会更快,或许会更便宜,或许两者兼得。
经过摸索,我按任务需要的模型能力将OpenClaw可执行的任务分成6大类,再加上2个特殊场景,每类任务或场景分别选用1~2个最适合的模型。
一、基础对话 & 轻量问答(经济级轻模型

任务特征

短上下文、无复杂工具调用、单轮简单输出、高频低消耗

典型场景

  1. 日常闲聊、简单常识问答、术语解释、短句翻译
  2. 心跳自检、状态巡检、后台轻量定时心跳任务
  3. 简短摘要、一句话总结、关键词提取、消息压缩
  4. 终端命令行简短交互、状态反馈

适配模型

专用模型:doubao-seed-2.0-mini、qwen3.6-flash
"你好""谢谢""帮我记一下"——这类消息不需要深度思考,用最便宜的模型就行。
日常聊天、简单提醒全走它。别嫌它"低端",简单消息用Mini回复,在这类任务中,Mini与Pro的表现没什么区别,但成本差了几十倍。
二、信息检索 & 数据处理 (轻量化抽取模型)

任务特征

信息抽取为主,低创意、固定输出格式

典型场景

  1. 联网搜索、网页抓取、事实抽取、实体识别、数据清洗
  2. CSV/Excel 结构化转换、数据库查询、表格提取
  3. Memory 知识库检索、向量摘要、文档分块压缩

适配模型

专用模型:qwen3.6-flash、deepseek-v4-flash
搜索整理、信息提取、长文总结、表格整理——需要一定的理解能力,但不需要深度推理。
Flash速度快、价格低,处理结构化任务够用。每天整理资讯、提取要点、总结长文,稳定又便宜。
三、文本创作 & 长内容处理(长文本均衡模型)

任务特征

超长文本输入输出、弱代码、强语义连贯、中等推理需求

典型场景

  1. 文案写作、小说 / 演讲稿 / 报告、方案标书、公众号长文
  2. 万字文档精读、合同解析、论文润色、批量文本格式化
  3. 知识库内容整理、记忆库批量清洗、长对话归档总结
  4. 多语种长篇翻译、结构化报表生成

适配模型

专用模型:qwen3.7-plus、doubao-seed-2.0-pro
写小说、写公众号文章、改写文案——需要中文表达能力强,有一定创意。
通义千问的中文能力是强项,Plus版本在创作和长文本处理上表现均衡。说句实话,论绝对性能它可能不是最强,但中文表达的"味道"对,写出来的东西不像翻译腔。
四、代码工程任务(代码专用模型)

任务特征

多文件上下文、工具密集调用、长逻辑链式推理

典型场景

  1. 代码生成、接口开发、完整脚本
  2. 代码调试、报错修复
  3. 项目架构设计
  4. 完整工程自动执行(读文件、改源码、运行调试工具)

适配模型

专用模型:deepseek-v4-flash、glm-5.2
这些任务对模型的逻辑能力要求高,但不需要最强的推理。
自然语言编程场景中,设计项目架构时,用deepseek-v4-flash;真正生成代码、调试代码用glm-5.2。
五、深度逻辑推理 & 复杂规划(旗舰推理模型)

任务特征

极高上下文窗口、多轮自我校验、多层级思维链、多子 Agent 协同

典型场景

  1. 多步骤复杂方案拆解、长链路 Agent 任务规划
  2. 数学推导、逻辑证明、商业分析、架构评审、复杂决策
  3. 多智能体编排、子任务分发与结果融合
  4. 行业深度分析、上万字资料归纳、复杂业务规则推演
  5. 疑难问题根因分析、多约束条件最优解计算

适配模型

专用模型:deepseek-v4-pro、kimi-k3
战略分析、投资决策、多步骤规划、数学计算——这类任务需要最强的推理能力,不能省。
Deepseek-v4-pro和kimi-k3推理能力对标国际顶级模型,处理复杂分析时切到它们。
六、多模态 & 视觉理解(视觉专用模型)

任务特征

带图像 / 媒体输入、依赖视觉编码能力

典型场景

  1. 图片解析、OCR 图文理解、图表数据分析、截图内容解读
  2. AI 图像生成、插画 / 海报文案配合、视频脚本、音频描述
  3. 多模态输入问答(图文混合提问)、PDF 带图表解析

适配模型

专用模型:doubao-seed-2.0-lite、qwen3.5-omni-flash
图片识别、视频理解、音频解析——需要多模态能力。
这类任务我目前用得少,豆包和通义都有多模态版本,在各自的供应商平台就能调用。
特殊场景一、工具 / 自动化定时任务(后台静默轻模型)

任务特征

后台静默运行、低延迟优先、无需高创意、固定流程

典型场景

  1. Cron 定时任务、周期报表自动生成、定时邮件推送
  2. 浏览器自动化、网页批量抓取、数据定时入库
  3. 后台监控告警、定时文件同步、静默数据采集
  4. 独立隔离会话执行、无用户实时交互

适配模型

专用模型:doubao-seed-2.0-mini、qwen3.6-flash
定时打卡、数据抓取、状态检查——后台自动执行的任务。
这类任务的关键不是模型多强,而是便宜和稳定。能用Mini解决的就用Mini,能用Flash解决的就用Flash。
后台任务最怕的不是模型不够强,是跑着跑着成本失控。用最便宜的模型跑最简单的任务,这是自动化能长期运行的前提。
特殊场景二、隐私本地离线任务(本地私有化模型)

任务特征

不可调用云端 API,依赖 Ollama本地部署模型

典型场景

  1. 敏感企业内网数据、本地文件处理、隐私文档解析
  2. 禁止外网 API 调用、本地硬件离线运行需求
  3. 内部涉密知识库、本地自动化流程

适配模型

专用模型:本地开源模型,ollama + qwen2.5-7b
如果有隐私需求,完全离线、数据不外传——用本地模型,Ollama跑7B模型是目前最现实的方案。
经实测,对于采用集成显卡的笔记本电脑,云端模型的速度是本地模型的20~30倍,终端交互时,本地模型是一个字一个字地往外蹦,交互体验较差。没有好显卡就算了,等硬件跟上再玩。

小结

任务类型
推荐模型
基础对话
doubao-seed-2.0-mini/qwen3.6-flash
检索处理
qwen3.6-flash/deepseek-v4-flash
文本创作
qwen3.7-plus/doubao-seed-2.0-pro
代码技术
glm-5.2/kimi-k2.7-code
深度推理
deepseek-v4-pro/kimi-k3
多模态
doubao-seed-2.0-lite/qwen3.5-omni-flash
自动化任务doubao-seed-2.0-mini/qwen3.6-flash
隐私离线ollama+qwen2.5-7b

(斜体为特殊场景,选模型原则跟主分类不同:自动化看"便宜稳定",离线看"硬件能力"。)

第三步:OpenClaw配置模型

选好模型之后,需要在OpenClaw中进行设置,推荐直接编辑openclaw.json文件。

配置模型供应商

打开~/.openclaw/openclaw.json,找到models.providers字段,每个模型供应商是一个独立配置块。以DeepSeek为例:
"models": {  "providers":{    "deepseek": {        "baseUrl": "https://api.deepseek.com",        "apiKey": "deepseek_apikey",        "api": "openai-completions",        "models": [          {            "id": "deepseek-v4-flash",            "name": "deepseek-v4-flash",            "contextWindow": 1024000,            "maxTokens": 393216,            "input": ["text"],            "cost": {              "input": 1,              "output": 2,              "cacheRead": 0.02,              "cacheWrite": 2            }          },          {            "id": "deepseek-v4-pro",            "name": "deepseek-v4-pro",            "contextWindow": 1024000,            "maxTokens": 393216,            "input": ["text"],            "cost": {              "input": 3,              "output": 6,              "cacheRead": 0.025,              "cacheWrite": 6            }          }        ]     }  } }
逐项解释:
  • deepseek(最外层key):供应商标识,自定义命名,后续Agent配置里用deepseek/deepseek-v4-pro这样的格式引用
  • baseUrl:API接口地址,每家供应商不同,每个模型供应商的接口文档中会有说明。
  • apiKey:按前述方法申请的apikey。安全提醒:实际使用时API Key应该放在.env文件里,不要明文写在配置文件中
  • api:API协议类型。openai-completions表示兼容OpenAI接口格式,国内大部分供应商都支持
  • models:该供应商下可用的模型列表
    • id:模型ID,这个是具体模型的唯一标识,严格填写模型供应商提供的ID。
    • name:显示名称,在OpenClaw聊天界面显示的名称,可以自定义
    • contextWindow:上下文窗口大小(单位:token),DeepSeek-v4是1M(100万token)
    • maxTokens:模型支持的最大输出上限,该模型是393216
    • input:支持的输入类型,text表示纯文本
    • cost:计费信息(元/百万token),OpenClaw用这个字段追踪和统计使用成本
    • input:输入价格
    • output:输出价格
    • cacheRead:缓存命中价格(远低于正常输入价格)
    • cacheWrite:缓存写入价格
每个模型供应商都要这样配一遍,百炼、火山方舟、智谱、Kimi,格式一样。
国内主流模型供应商baseurl,列举如下:
模型供应商
配置用的baseurl
deepseek
https://api.deepseek.com
moonshot
https://api.moonshot.cn/v1
zai
https://open.bigmodel.cn/api/paas/v4
minimax
https://api.minimaxi.com/v1
bailian
https://dashscope.aliyuncs.com/compatible-mode/v1
volcengine
https://ark.cn-beijing.volces.com/api/v3
需要说明的是,这里的baseUrl适用于按量付费方式。如果申请了Token Plan、Agent Plan或Coding Plan等套餐,需要改为套餐对应的baseUrl。

配置模型核心参数

为进一步提升任务与大模型的匹配程度,改善大模型的输出内容,需要额外设定两个参数:模型温度、重复惩罚。

模型温度(temperature)

  • 控制模型回答的"放飞程度",温度越低越严谨,温度越高越有创意。
  • 模型温度的设定范围为[0,2],大模型默认温度为1.0,可以在调用时修改。
  • 每个模型固定一个温度,每类任务不单独设温度,设置多Agent,也不单独设温度。这样不管做什么任务,切到哪个模型,温度都跟着模型走,不用来回调。
踩坑实录:我一开始的想法是按任务类型设温度——分析任务设0.3,创作任务设0.7。但问题来了:一个Agent只有一个温度设置,切到不同模型时温度不会跟着变。用通义Plus写东西时温度0.3偏死板,切到DeepSeek做分析时温度0.7又不够精准。手动来回改太麻烦。

重复惩罚

  • 有时候模型会重复说同一句话,绕来绕去,俗称“车轱辘话”。
  • 为减少“车轱辘话”,可设置两个参数:frequency_penalty(频率惩罚),降低已出现过的词的重复概率;presence_penalty(话题惩罚),鼓励模型聊新话题。
  • 实际使用中,只调一个,不要同时调,我选择调"frequency_penalty"。
  • frequency_penalty设定原则:
  1. 0~0.3:允许适度重复,适合强调要点
  2. 0.4~0.6:显著减少重复,适合长文、文案
  3. >0.8:可能语句不通顺,慎用
  4. 一般设0.3-0.5就有明显改善。设太高会让回答跳跃,缺乏连贯性。
对于上述模型,模型参数建议设定如下:
模型名称
temperature
frequency_penalty
对应任务类型
deepseek-v4-flash
0.4
0.3
信息检索/代码技术
deepseek-v4-pro
0.2
0.4
深度推理
qwen3.6-flash
0.3
0.3
信息检索
qwen3.5-omni-flash
0.3
0.3
多模态
qwen3.7-plus
0.7
0.3
文本创作
doubao-seed-2.0-mini
0.5
0.3
基础对话
doubao-seed-2.0-lite
0.3
0.3
多模态
doubao-seed-2.0-pro
0.7
0.3
长文本创作
glm-5.2
0.4
0.3
代码技术
kimi-k3
0.2
0.4
深度推理
打开~/.openclaw/openclaw.json,找到agents.defaults.models字段,在每个具体模型配置中增加params字段。以deepseek-v4-flash为例:
"agents": {  "defaults": {    "models": {      "deepseek/deepseek-v4-flash": {        "params": {          "temperature": 0.4,          "frequency_penalty": 0.3        }      }    }  }}
无论通过哪个供应商调用,同一个模型的这两个参数设定都一致。

配置主辅模型

最后,所有配置的具体模型,需要在agents.defaults.models字段中显式声明,Agent才能调用和切换,同时告诉Agent用哪个模型:
{  "agents": {    "defaults": {      "models": {        "bailian/qwen3.6-flash": {},        "volcengine-agent-plan/deepseek-v4-flash": {},        "deepseek/deepseek-v4-flash": {},        ···        "ollama/qwen2.5:7b-instruct-q4_K_M": {}      },      "model": {        "primary": "volcengine-agent-plan/deepseek-v4-flash",        "fallbacks": [             "bailian/qwen3.6-flash",          "deepseek/deepseek-v4-flash"        ]      }    }  }}
  • primary:主力模型,日常用这个
  • fallbacks:备选链,很重要,主力挂了自动切换
  • 我一开始没配fallback,结果火山方舟断线后,Agent直接罢工,什么也干不了,有时做了一部分的工作得重新再来。后来学乖了,配了2个跨供应商的备选——火山方舟挂了走百炼,百炼挂了走DeepSeek直连。
  • 跨供应商是关键,同供应商的模型往往一起挂。

写在最后

配置好模型之后,OpenClaw v2026.7.1版支持在聊天界面随时切换,界面如下图所示。
单击聊天界面右下角的按钮,在弹窗界面,按模型供应商、按具体模型选择后,单击“保存”即可实现切换。
回到开头那个"20元"的故事。后来我把日常聊天的模型从千问Plus换成了千问Flash,再后来换成豆包Mini,同样的内容,成本从几元降到了几乎为零。
不是Plus不好,是用错了地方。
牛刀用来杀鸡,不是刀的问题,是选刀的问题。
选模型这件事,我踩坑踩出来的经验,总结出来就几句话:
  • 不同任务选不同的模型——简单聊天、深度推理、创作写作,各用各的模型
  • 温度跟着模型走——每个模型一个固定温度,不用按任务来回调
  • 备选链不能少——主力模型会挂,fallback是保障
如果你也在用OpenClaw,或者刚开始接触大模型,希望这篇能帮你少走几步弯路。