乐于分享
好东西不私藏

OpenClaw + MiniMax 全模态配置指南:语音对话 + AI 绘图一键搞定

OpenClaw + MiniMax 全模态配置指南:语音对话 + AI 绘图一键搞定

MiniMax Token Plan × OpenClaw 配置指南

2026 国内 AI Coding Plan 终极横评:养虾时代的选套餐指南之前老周发布了一篇coding plan 的介绍,有不少朋友问到了老周到底怎么用token plan配置一个全模态能听语音、会说话、会生图的龙虾。本篇老周将为你一一揭晓。

注意如果你的龙虾已经配置过模型,可以直接把这篇扔给龙虾让他自动配置。


前置要求

  • 用户已安装 OpenClaw
  • 用户已订阅 MiniMax Token Plan 并获得 API Key(以 sk-cp- 开头)

配置步骤

步骤 1:获取 Token Plan API Key

操作:访问 MiniMax 平台订阅 Token Plan

  1. 前往 platform.minimaxi.com(国际版)或 platform.minimax.io(国内版)注册/登录
  2. 在左侧导航栏找到「Token Plan」入口,选择适合的套餐:
    • Starter (¥29/月):轻度使用,仅文本
    • Plus (¥49/月):需要语音/图像
    • Max (¥119/月):需要视频/音乐
  3. 完成支付后,进入「账号设置 → API Key」页面,复制以 sk-cp- 开头的 Token Plan Key

注意区分国内/国际版

  • 国内用户:platform.minimax.io → API Host: https://api.minimax.io
  • 海外用户:platform.minimaxi.com → API Host: https://api.minimaxi.com

步骤 2:在 OpenClaw 中接入 MiniMax

操作:在 OpenClaw 控制台中配置 MiniMax 模型

方式
操作步骤
适合人群
OAuth 授权登录
点击「连接 MiniMax」→ 跳转授权页面一键登录
新手推荐
API Key 手动配置
在「模型设置」中填入 sk-cp- 开头的 Token Plan Key
开发者

手动配置步骤

  1. 打开 OpenClaw 控制台,进入「设置 → 模型提供商」
  2. 选择 MiniMax,点击「添加 API Key」
  3. 粘贴第一步获取的 sk-cp-xxxx Key
  4. 在「默认模型」中选择 MiniMax-M2.7 作为对话模型

步骤 3:安装 minimax-multimodal Skill

操作:在对话中发送以下消息,让 Bot 自动安装

clawhub.ai/MiniMax-AI-Dev/minimax-multimodal 帮我安装这个多模态工具集

预期结果

  • ✅ speech-2.8-hd 模型可用
  • ✅ 语音合成正常
  • ✅ FFmpeg 已安装
  • ✅ 环境变量已写入 ~/.bashrc

Skill 包含的能力

  • TTS 语音合成(Speech 2.8)
  • 图像生成(image-01)
  • 音乐生成(Plus/Max 套餐)
  • 视频生成(Max 套餐)

步骤 4:配置 TTS 语音合成

安装完成后,TTS 能力已自动启用。

标准语音回复

帮我用语音说:欢迎来到我的频道,我是你的 AI 助手。

多音色混合朗读

/tts --mode multi[旁白]: 这是一个风雨交加的夜晚[角色A·女声]: 你听到了吗?外面有奇怪的声音[角色B·男声]: 不用担心,我去看看

声音克隆(可选):

  1. 用户上传 10~30 秒清晰录音
  2. 执行 /voice clone --file [录音文件] --name [音色名称]
  3. 之后可用 --voice [音色名称] 调用

飞书语音气泡(飞书用户必选): 飞书平台的语音气泡只接受 Opus 格式,而 TTS 默认输出 MP3,直接发送会变成文件附件。需要额外安装 Skill:

clawhub.ai/feishu-voice-bubble-generation 帮我安装飞书语音气泡 Skill

Telegram 无需此步骤,原生支持语音气泡。


步骤 5:配置 STT 语音输入识别

问题:OpenClaw 默认不带 STT 引擎,需要单独安装。

操作:发送以下消息安装 mlx-whisper

帮我安装 mlx-whisper 并配置好语音输入识别

预期结果

  • ✅ mlx-whisper 安装完成
  • ✅ 转录脚本已创建
  • ✅ STT 音频识别已开启
  • ⚠️ 提示重启 Gateway

重要:安装完成后必须重启 Gateway,音频管线不支持热加载。

重启方式

  • 在 OpenClaw 设置中手动重启,或
  • 告诉用户「请重启 Gateway」

步骤 6:测试 AI 图像生成

安装 minimax-multimodal Skill 后,图像生成能力已自动启用。

文字生图

/imagine 一只赛博朋克风格的猫咪,坐在霓虹灯闪烁的城市屋顶,夜晚,高清,4K

参考图生图

/imagine --ref [已上传的图片] --prompt "将这张图改为水彩画风格" --strength 0.7

完整配置流程回顾

  1. ✅ 访问 MiniMax 平台,订阅 Token Plan,获取 sk-cp- API Key
  2. ✅ 在 OpenClaw 中接入 MiniMax(OAuth 或手动填入 Key)
  3. ✅ 把 clawhub.ai/MiniMax-AI-Dev/minimax-multimodal 链接发给 Bot,Bot 自动完成安装
  4. ✅ (飞书用户)安装 feishu-voice-bubble-generation Skill
  5. ✅ 安装 mlx-whisper 并配置 STT,完成后重启 Gateway

配置完成后的能力

能力
状态
说明
🎙️ TTS 语音合成
✅ 可用
Speech 2.8 模型,支持多音色、克隆
👂 STT 语音输入
✅ 可用
mlx-whisper 本地识别,<2s 响应
🖼️ 图像生成
✅ 可用
image-01 模型,文生图/图生图
💬 智能对话
✅ 可用
MiniMax M2.7 编程模型

完整对话闭环: 语音输入 → STT 识别 → MiniMax 思考 → TTS 合成 → 语音气泡回复


实际效果示例

以下是在两个主流平台上的真实配置截图:

💙 飞书平台示例

Skill 安装 → 语音合成 → 图像生成,全部一键完成

✈️ Telegram 平台示例

TTS 语音气泡 + 图像生成 +TTS支持语音识别,原生支持无需额外配置

写在最后

以上就是完整的 MiniMax Token Plan × OpenClaw 配置指南。按照这个流程,你的 Bot 就能同时具备语音合成、语音识别和 AI 图像生成能力,实现真正的全模态交互。

如果在配置过程中遇到问题,欢迎在评论区留言讨论。


🚀 MiniMax Token Plan 惊喜上线! 新增语音、音乐、视频和图片生成权益。邀请好友享双重好礼,助力开发体验!

好友立享 9 折专属优惠 + Builder 权益,你赢返利 + 社区特权!

👉 立即参与:https://platform.minimaxi.com/subscribe/token-plan?code=1m120uWvV3&source=link


欢迎关注「老周」,获取一手 AI 资讯和实用教程 👋