MiniMax Music 3.0是一款由MiniMax于2026年8月开源权重的AI音乐生成模型,总参数约111亿,主要用于从创意描述和歌词一次生成包含作曲、编曲、演唱、制作的完整歌曲,支持最长5分钟输出和最低8GB显存本地部署,适用于歌曲创作、短视频与播客配乐、音乐类产品二次开发等场景。
| 基础信息 | 内容 |
|---|---|
| 开发方 | MiniMax |
| 开源时间 | 2026年8月13日(API版7月16日上线) |
| 总参数量 | 约111亿(Global LLM 8B + Local LLM 0.6B + Flow模块2.4B + VAE 1.23亿) |
| 最长生成时长 | 5分钟完整歌曲 |
| 输出规格 | 32kHz、16-bit立体声WAV(API版返回44.1kHz MP3) |
| 本地显存需求 | 全精度24GB+,CPU卸载约22GB,逐层流式最低8GB |
| API价格 | $0.15/次(最长5分钟),与music-2.6同价 |
| 许可证 | MiniMax Music 3.0 Community License(无地域限制) |
| 产品定位 | 生产级全能开源音乐生成模型 |
| 适用人群 | 音乐创作者、短视频/播客内容团队、语音音频开发者 |

MiniMax Music 3.0核心能力与性能
Music 3.0的API版其实在2026年7月16日就已上线,8月13日开放的是模型权重本身。一次生成就能产出结构完整、带人声演唱的成品歌曲——前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏一个不落,这在开源音乐模型里是第一次。
一次生成完整歌曲
拿一段歌词加一段风格描述,就能得到五分钟的成品歌。模型能守住音乐主题、节奏、歌声身份和编曲推进,不会唱到副歌就”忘了”主旋律。人声部分更像真实演唱而非机器合成,官方把这一代的核心目标定为”理解创作者的表达意图,并在五分钟里持续贯彻”。
控制方式分两条通道:结构化描述(caption)分全局元数据、人声细节、编曲三段,可指定音色、唱法、气声、假音、和声编排,甚至Auto-Tune和延迟效果,以及乐器进出点;歌词支持[Verse]、[Chorus]、[Bridge]等结构标签,模型按标签调整强度和断句。API还提供纯器乐开关(is_instrumental),歌词长度10到1000字符。
双LLM分工架构
大模型管结构,小模型管音质,是Music3架构的关键取舍。音频先经8层RVQ(残差向量量化)分级表示:第一层只存核心语义和结构,用16384个大码本;后七层补声学细节,各1024个码本。8B的Global LLM(从Qwen3-8B初始化)逐帧预测第一层,负责整首歌的长程结构;0.6B的Local LLM在帧内预测其余七层,把细粒度声音补齐。
这个分工直接解决了一个工程难题:5分钟歌曲按25帧/秒要生成上万token,单模型全包代价太大;分层后8B大模型每帧只需前向一次。最后由2.4B的Flow-Matching模块和1.23亿参数的Flow-VAE解码器还原出32kHz立体声波形。
本地部署门槛与生态
8GB显存就能跑,是这次开源最实用的细节。Hugging Face仓库约57.4GB,全精度推理需24GB以上显存,开CPU卸载约22GB,逐层流式方案最低8GB。官方参考实现用两张CUDA GPU分工(一张跑Qwen3和RVQ生成,一张跑Flow Matching和波形解码)。推理框架支持SGLang-Omni、diffusers和ComfyUI 0.33.0以上版本——ComfyUI当天就出了支持工作流。
MiniMax Music 3.0与Suno v5.5对比
| 对比维度 | MiniMax Music 3.0 | Suno v5.5 |
|---|---|---|
| 开发方 | MiniMax | Suno |
| 模型定位 | 开源权重音乐基座模型 | 在线音乐生成服务 |
| 权重开源 | 是(Hugging Face/GitHub/ModelScope) | 否,仅在线服务 |
| 使用方式 | 本地部署 + API + ComfyUI | 网页/App订阅制 |
| 单次价格 | $0.15/次(API,最长5分钟) | 按订阅套餐计费 |
| 本地部署 | 支持,最低8GB显存 | 不支持 |
| 二次开发 | 支持微调与商业授权改造 | 不支持 |
两条路线服务不同人群。Suno代表了开箱即用的在线体验,站内Suno v5.5评测适合只想快速出歌的用户;Music3的价值在于权重在自己手里——可以微调出专属曲风、嵌进自家产品、离线批量生产,且$0.15一次的API价格对批量场景很友好。
许可方面有个值得注意的细节:MiniMax Music 3.0 Community License没有地域排除条款,而十一天前H3视频模型的许可排除了美欧英韩。对面向全球市场的团队,Music3的商用确定性更高。
MiniMax Music 3.0应用场景与适用人群
- 短视频与播客配乐:批量生成结构完整、可商用的原创歌曲,替代版权音乐采购;纯器乐模式适合做BGM。
- 音乐创作辅助:职业创作者用它快速验证动机和编曲想法,caption级控制能精确到和声编排与效果器。
- 产品集成与二次开发:游戏、社交、教育类App把Music3嵌入自家流程,微调出品牌专属音色和曲风。
适合谁用:需要批量原创音乐的内容团队、想微调专属模型的开发者、预算有限但要求商用的独立创作者。不必跟风的情况:只是偶尔出一两首歌的个人用户,在线服务更省事;追求顶级录音棚音质的职业制作,AI生成仍需后期精修。
如何使用MiniMax Music 3.0
- 最快体验:MiniMax官方API,$0.15一次生成最长5分钟,返回44.1kHz MP3,限速120请求/分钟。
- 本地部署:从Hugging Face或ModelScope下载权重(国内ModelScope更快),参考GitHub仓库的双卡推理脚本;显存不足按22GB(CPU卸载)到8GB(逐层流式)三档选择。
- ComfyUI工作流:升级到0.33.0以上版本,加载官方模板即可把Music3接进现有视频/音频流水线。
- 二次开发:diffusers与SGLang-Omni两条工程路线,仓库同时提供Tokenizer、调度器等全部组件。
MiniMax Music 3.0的官方资源
- 官网博客页:MiniMax Music 3.0: Next-Generation Open-Weights, Production-Ready & Versatile Music Model
- GitHub仓库:https://github.com/MiniMax-AI/MiniMax-Music3
MiniMax Music 3.0开源许可与已知局限
商用要看清Community License的具体条款。许可证允许使用、复制、修改、合并、发布、分发和再许可,且无地域排除,但商业化部署前建议通读协议原文,确认自己场景下的义务。
局限:32kHz的输出规格低于录音室标准(API版44.1kHz),专业发行需要后期处理;生成5分钟长曲时对提示词的结构描述要求高,标签写不好段落衔接会生硬;双卡参考实现意味着单卡用户的速度和显存要自己权衡;模型以英文生态文档为主,中文提示的细节控制在社区里还在摸索。
常见问题
MiniMax Music 3.0本地部署需要什么显卡?
全精度推理需要24GB以上显存;开CPU卸载约22GB;用逐层流式方案最低8GB即可运行。官方参考实现是双卡分工(GPU0跑Qwen3和RVQ生成,GPU1跑Flow Matching和波形解码),单卡可用但速度和显存需自行权衡。ComfyUI 0.33.0以上有现成工作流。
MiniMax Music 3.0可以商用吗?
可以,但需遵守MiniMax Music 3.0 Community License。许可证允许使用、修改、分发和再许可,且没有H3视频模型那种美欧英韩地域排除。商业化部署前建议通读Hugging Face模型页的协议原文,确认自己场景的义务。
MiniMax Music 3.0怎么收费?
本地部署权重免费。API按次计费:$0.15一次、最长生成5分钟,与music-2.6同价,限速每分钟120次请求。对比订阅制在线服务,批量生产场景下按次计费通常更划算。
MiniMax Music 3.0和Suno怎么选?
要开箱即用的创作体验选Suno这类在线服务;要权重在手、可微调、可嵌入产品、可离线批量生产选Music3。Music3还提供$0.15/次的API,适合构建自动化内容流水线。
MiniMax Music 3.0能生成多长的歌?
最长5分钟。模型按25帧/秒、上限9000声学帧设计,能完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏,并在整首歌里保持主题、节奏和人声身份的一致性。
浙公网安备33010202004812号