乐于分享
好东西不私藏

每日开源精选-不下载模型、不调云 API, 纯本地把音乐算出来

每日开源精选-不下载模型、不调云 API, 纯本地把音乐算出来

作曲得下载大模型?

不下载模型、不调云 API,纯本地把音乐算出来

算法作曲 · SoundFont渲染 · 零云依赖

sirruf/music-gen-skill

本地作曲开源

📦 4 Parts + Conclusion

👉 滑动

PART 01

算法作曲

不是文生音乐

PART 02

两条路线

MIDI 与合成

PART 03

怎么用

工具链安装

PART 04

依赖清单

零云 API

PART ///

写在最后

掌控每个音符

别人拼文生歌,它反过来把音乐算出来

MIDI 算法作曲 + SoundFont 渲染,在你自己的电脑上确定性产出 WAV/MP3

你想要的也许不是「再来一个 Suno」,而是能攥在自己手里、可反复修改、出结果可预测的作曲工具。这正是 sirruf/music-gen-skill 的定位:它是一个 Claude Code Skill,用你系统里本来就有的普通工具,把「写歌」变成一段可编辑、可重跑的本地工作流

本文基于其 GitHub 仓库整理,协议为 MIT(© Artem Kolesnikov)

01

PART

算法作曲,不是文生音乐

POSITIONING · 先把边界划清楚

先说清楚边界,免得预期错位:这个 Skill 是算法作曲 + 采样器渲染不是那种「描述一句风格就出一首带人声的歌」的模型

作者在原文档里就很诚实——它不会「生成一首像某位歌手的歌」。如果你要的是文生音乐,该去用本地 MusicGen / audiocraft 或 Suno 这类模型与服务。

music-gen-skill 的价值在于完全确定性——同一段脚本永远产出同一段音频,而且每一个音符都可编辑

✦ 适合场景

想要一段可控的钢琴 loop、和弦进行、鼓点、音效,而又不想被黑盒模型绑架的时候。

02

PART

两条路线:编曲与合成

TWO PATHS · MIDI 与直接合成

它提供两条产出路线,按你要的是乐器还是音效来选。

MIDI 路线(默认)

Claude 用 python3 + mido 写出 .mid 文件,再用 fluidsynth 或 timidity 加一个 GM SoundFont,渲染成真实采样乐器(钢琴、弦乐、贝斯、鼓等,靠 General MIDI 音色号指定)。

直接合成路线

用 sox 或 ffmpeg 合成音调、蜂鸣、警报、扫频这类非音乐音效,不需要 SoundFont。

MIDI 路线给的是真乐器声音,直接合成路线适合做 quick SFX。两条路最终都能交付 .wav 或 .mp3

03

PART

装好工具链就能让它写歌

SETUP · 两步装好,开口就用

安装分两步——先放 Skill,再装工具链

...bash

# 1. 把 skill 放进 Claude Code 的 skills 目录

cp -R music-gen ~/.claude/skills/music-gen

# 2. 装系统工具链(macOS)

brew install fluid-synth sox ffmpeg

pip install mido

# 再放一个 GM SoundFont 到下面这个路径

~/.local/share/soundfonts/FluidR3_GM.sf2

装好后,只要跟 Claude 说「写一段 A 小调 80 BPM 的 8 小节平静钢琴 loop」「做个带贝斯和鼓的欢快 jingle 导出 MP3」「生成 2 秒上升激光音效」,Skill 就会自动触发,作曲、渲染,再把文件路径连同 tempo、调性、配器一起交还给你

仓库里还带了 scripts/render.sh(自动探测渲染器 + 定位 SoundFont)和 scripts/melody_example.py(钢琴、弦乐、贝斯、鼓的多轨参考曲),不想从零写,直接改它就行。

04

PART

依赖清单:全是本地二进制

DEPENDENCIES · 零云 API

这是它和「云端音乐 AI」最根本的区别——没有任何云 API,也不下载大模型权重,全靠系统里这几个老牌命令行工具。

依赖
作用
必需度
python3 + mido
写 MIDI
必需
fluidsynth
 或 timidity
MIDI 渲染成音频
必需(推荐前者)
GM SoundFont
提供采样音色
必需(最常缺)
ffmpeg
导出 MP3
按需
sox
直接合成音效
按需

!踩坑提示 🕳

最常被漏掉的是那个 GM SoundFont(例如 FluidR3_GM.sf2),少了它渲染器就发不出声。

不确定装齐没?跑一句自检命令,它会逐行告诉你还差哪个、路径在哪

CMDbash scripts/render.sh --check

///

LAST

写在最后

CONCLUSION · 掌控每一个音符

music-gen-skill 适合「想掌控每一个音符、又在意隐私和确定性」的人。它不性感、不出人声、不能一键出爆款,但它在你自己的机器上、用你自己的工具、产出你可编辑的文件

这对做游戏音效、视频配乐、练耳学习的人来说,反而更省心。如果你受够了黑盒音乐模型的「每次都不一样」,不妨把它装上,从那个 8 小节钢琴 loop 示例改起

协议 MIT(© Artem Kolesnikov)。安装即 cp -R 到 ~/.claude/skills/music-gen,再用 brew 或 apt 装 fluid-synth sox ffmpeg 与 pip install mido。记得补一个 GM SoundFont 才能出声。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING