1
歌词
直接粘贴歌词,不用写任何标签
行 0
字 0
预计自然长度 —
▶
段落结构(可自由增删改)
器乐段(前奏/间奏)正文可留空
▶
最终提交的歌词
(点「智能编排段落」后显示)
2
风格设置
16 项全部中文下拉 · 共 5 组
改动它只换旋律与编曲走向,风格与歌词不变
3
生成
想要成品的旋律,就得直接生成成品🎛️ 风格样片
30–90 秒 · 20 步草稿 · 约 2 分钟
只听风格 / 音色 / 编曲气质对不对味
只听风格 / 音色 / 编曲气质对不对味
💿 生成成品
完整长度 · 30 步精修 · 约 6–13 分钟
出片后自动播前 45 秒,那就是成品的真开头
出片后自动播前 45 秒,那就是成品的真开头
⚠️ 一个已实测确认的限制:样片不能用来挑旋律。
原因:配额(时长)会写进模型的条件编码,所以「60 秒样片」和「3 分钟成品」本质上是 两首不同的歌——实测两者波形相关性 ≈ 0.017,与「两首毫不相干的歌」的基线 0.011 无异。 想听成品的旋律走向,只能把成品生成出来。
依据:同 seed 下只改配额(60→207 秒),相关性掉回随机水平;只改步数(20→30 步)仍保留 15 倍于基线的相关性(0.161)。
原因:配额(时长)会写进模型的条件编码,所以「60 秒样片」和「3 分钟成品」本质上是 两首不同的歌——实测两者波形相关性 ≈ 0.017,与「两首毫不相干的歌」的基线 0.011 无异。 想听成品的旋律走向,只能把成品生成出来。
依据:同 seed 下只改配额(60→207 秒),相关性掉回随机水平;只改步数(20→30 步)仍保留 15 倍于基线的相关性(0.161)。
时长配额—
预计耗时—
段落 / 歌词—
▶
调参原理(本机实测标定,非猜测)
想知道为什么这么设,点开看① 时长配额 = 目标时长 × 1.15(实测标定)
max_duration 不只是"最长能多长",它同时是 KV cache 的预分配容量。
配额越大,逐帧生成越慢——这是本机最大的一个速度杠杆。
另有一条重要规律:它是上限不是目标,模型判定唱完了会自己发结束标记提前收尾。
判断该调大还是调小,看日志里 AR 的收尾帧数 ÷ 配额: >90% 说明被卡住(该调大);70~90% 是甜蜜点(保持);<70% 说明配额浪费(该调小)。
⭐ 五档配额实测(同歌词 29 行 / 同 seed / 同风格)
| 配额 | 帧数 | 收尾帧 | 利用率 | 成品时长 | 总耗时 |
|---|---|---|---|---|---|
| 180 秒 | 4501 | 4338 | 96.4% | 2:53.5 | 10:41 |
| 207 秒 | 5176 | 4801 | 92.8% | 3:12.0 | 12:19 |
| 225 秒 | 5626 | 4956 | 88.1% | 3:18.2 | 12:41 |
| 277 秒 | 6926 | 4106 | 59.3% | 2:44.2 ↓ | 11:00 |
| 300 秒 | 7501 | 4106 | 54.7% | 2:44.2 ↓ | 20:33 |
两个必须记住的规律:
① 配额 ≤ 约 225 秒是"线性区":成品时长 ≈ 配额 × 0.88~0.96,给多少用多少。
② 配额 ≥ 约 277 秒会"塌方":模型提前收尾到约 164 秒的自然长度,
配额给得越大,成品反而越短(277 与 300 秒都只出 164.2 秒,收尾帧完全相同)。
所以本页把配额硬锁在 235 秒。想要更长的歌,唯一有效手段是加歌词段落
(实测边际收益约 3.2 秒/行),而不是调大配额。
② 官方硬性上限
| 项目 | 上限 | 说明 |
|---|---|---|
| 音频时长 | 360 秒 | MAX_AUDIO_FRAMES=9000 ÷ 25 帧/秒,即 6 分钟封顶 |
| 帧率 | 25 帧/秒 | 时长 = 帧数 ÷ 25,配额帧数 = 时长 × 25 + 1 |
| 显存峰值 | ≈5.6 GB | DiT 走 689-token 滑窗分块,显存与时长几乎无关 |
③ 耗时结构与代码依据
| 阶段 | 占比 | 是否随时长增长 | 依据 |
|---|---|---|---|
| AR 逐帧生成 | 85% | 线性增长(主要成本) | ar.py 逐帧自回归 |
| 扩散采样 | 13% | 基本恒定 | dit.py 滑窗 + 重叠归一化 |
| 音频解码 | 2% | 弱增长 | VAE 纯卷积上采样 |
④ 哪些"加速功能"真的有用
| 状态 | 手段 | 说明 |
|---|---|---|
| 有效 | 精准配额 / 精简段落 / 降步数 / 分块解码 | 配额精准是收益最大的一项 |
| 已自动生效 | CUDA graph + flash 解码 | 内置在 AR 路径里,无需手动开 |
| 收益极小 | sage 注意力 / int8 注意力 / int8 DiT | 只能作用到扩散采样那 13%,端到端 <2% |
| 完全不生效 | 块稀疏注意力 / TE-Speed / 块交换 / 显存保留 | 都是给视频管线设计的,音乐路径调不到 |
结论:把「目标时长」这一项调对,收益比折腾那一堆加速节点大十倍。 本页已按实测公式自动帮你算好配额与预估耗时。