MiniMax Music 创作工作室 写词 → 挑风格 → 出成品 → 不听就换一版
检测中…
1

歌词

直接粘贴歌词,不用写任何标签
0 0 预计自然长度
← 想更长就加重复,不用多写词

段落结构(可自由增删改)

器乐段(前奏/间奏)正文可留空

最终提交的歌词

(点「智能编排段落」后显示)
2

风格设置

16 项全部中文下拉 · 共 5 组
音乐骨架
情绪与结构
人声设定
音色与质感
改动它只换旋律与编曲走向,风格与歌词不变
3

生成

想要成品的旋律,就得直接生成成品
🎛️ 风格样片
30–90 秒 · 20 步草稿 · 约 2 分钟
只听风格 / 音色 / 编曲气质对不对味
💿 生成成品
完整长度 · 30 步精修 · 约 6–13 分钟
出片后自动播前 45 秒,那就是成品的真开头
⚠️ 一个已实测确认的限制:样片不能用来挑旋律。
原因:配额(时长)会写进模型的条件编码,所以「60 秒样片」和「3 分钟成品」本质上是 两首不同的歌——实测两者波形相关性 ≈ 0.017,与「两首毫不相干的歌」的基线 0.011 无异。 想听成品的旋律走向,只能把成品生成出来。
依据:同 seed 下只改配额(60→207 秒),相关性掉回随机水平;只改步数(20→30 步)仍保留 15 倍于基线的相关性(0.161)。
每版用不同随机种子,编曲走向不同
判断编曲与音色,45–60 秒足够;但别用它判断旋律
时长配额 预计耗时 段落 / 歌词
快捷键:Ctrl + Enter 开始

调参原理(本机实测标定,非猜测)

想知道为什么这么设,点开看

① 时长配额 = 目标时长 × 1.15(实测标定)

max_duration 不只是"最长能多长",它同时是 KV cache 的预分配容量。 配额越大,逐帧生成越慢——这是本机最大的一个速度杠杆。
另有一条重要规律:它是上限不是目标,模型判定唱完了会自己发结束标记提前收尾。

判断该调大还是调小,看日志里 AR 的收尾帧数 ÷ 配额: >90% 说明被卡住(该调大);70~90% 是甜蜜点(保持);<70% 说明配额浪费(该调小)。

⭐ 五档配额实测(同歌词 29 行 / 同 seed / 同风格)

配额帧数收尾帧利用率成品时长总耗时
180 秒4501433896.4%2:53.510:41
207 秒5176480192.8%3:12.012:19
225 秒5626495688.1%3:18.212:41
277 秒6926410659.3%2:44.2 ↓11:00
300 秒7501410654.7%2:44.2 ↓20:33

两个必须记住的规律:
配额 ≤ 约 225 秒是"线性区":成品时长 ≈ 配额 × 0.88~0.96,给多少用多少。
配额 ≥ 约 277 秒会"塌方":模型提前收尾到约 164 秒的自然长度, 配额给得越大,成品反而越短(277 与 300 秒都只出 164.2 秒,收尾帧完全相同)。
所以本页把配额硬锁在 235 秒。想要更长的歌,唯一有效手段是加歌词段落 (实测边际收益约 3.2 秒/行),而不是调大配额。

② 官方硬性上限

项目上限说明
音频时长360 秒MAX_AUDIO_FRAMES=9000 ÷ 25 帧/秒,即 6 分钟封顶
帧率25 帧/秒时长 = 帧数 ÷ 25,配额帧数 = 时长 × 25 + 1
显存峰值≈5.6 GBDiT 走 689-token 滑窗分块,显存与时长几乎无关

③ 耗时结构与代码依据

阶段占比是否随时长增长依据
AR 逐帧生成85%线性增长(主要成本)ar.py 逐帧自回归
扩散采样13%基本恒定dit.py 滑窗 + 重叠归一化
音频解码2%弱增长VAE 纯卷积上采样

④ 哪些"加速功能"真的有用

状态手段说明
有效精准配额 / 精简段落 / 降步数 / 分块解码配额精准是收益最大的一项
已自动生效CUDA graph + flash 解码内置在 AR 路径里,无需手动开
收益极小sage 注意力 / int8 注意力 / int8 DiT只能作用到扩散采样那 13%,端到端 <2%
完全不生效块稀疏注意力 / TE-Speed / 块交换 / 显存保留都是给视频管线设计的,音乐路径调不到

结论:把「目标时长」这一项调对,收益比折腾那一堆加速节点大十倍。 本页已按实测公式自动帮你算好配额与预估耗时。