AI 音乐示例
八个提示词,逐条拆解。每个都展示返回了什么、哪条指令起了决定作用、以及去掉那条指令后会发生什么。
一句话
A 音轨,速度 — . 伴奏, .
lo-fi hip hop, 78 BPM, warm and unhurried. Instrumental, vinyl crackle, highs rolled off.
01 · 纪录片 / 旁白
能在旁白下“消失”的底床
提示词
Restrained documentary underscore, 72 BPM, A minor. Felt piano, sustained cello, light shaker. Steady with no builds, instrumental, midrange kept sparse for voiceover.
返回了什么
一段慢而平的素材,几乎没有动态起伏。钢琴低位、轻声,大小提琴在下方拉长音,沙锤只负责计时不抢戏。没有进入也没有解决——它只是继续,这正是让人声能在上面稳稳说十分钟而不疲劳的原因。
为什么这样写有效
“No builds” 是承重指令。少了它,几乎每个模型都会在第一分钟某处加个起伏,因为大多数训练数据都是“起—落”。“Midrange kept sparse” 是第二条:让编曲别碰 300 Hz 到 3 kHz,这正是语音所在。两者合起来,音乐就变成了底床。
改一处试试
去掉 “no builds” — 40 秒左右会冒出一段起伏,正好在你最不想分散旁白注意力的时候把注意力拉走。
02 · 短视频
半秒就抓住人的短循环
提示词
Punchy 15-second loop, 145 BPM, half-time trap feel. Detuned bell melody, 808 slide on the downbeat, crisp hi-hat triplets, one vocal chop stab. Hook lands immediately, loops seamlessly.
返回了什么
紧凑、直接的 15 秒。铃声型在第一小节就把自己说清,不是一路铺垫;808 滑到重拍,镲把空隙都填满。它在开始处结束,所以循环点听不出来。
为什么这样写有效
“Hook lands immediately” 把默认反过来。不管它,模型会写前奏,因为歌都有前奏——而在短视频里,前奏是大家划走前听不到的那段。“Half-time” 是另一个关键词:145 BPM 不加它会很躁;加了它,底鼓和军鼓以半速落下,这首曲目听起来是厚重不是飞快。
改一处试试
删掉 “half-time” — 同样 145 BPM 就读成了鼓打贝斯的能量,而不是陷阱的重量——删除一个词就换了完全不同的流派。
03 · 流媒体 / 学习
能扛六小时的音乐
提示词
Chilled lo-fi, 92 BPM, F major. Dusty swung drums slightly behind the beat, warm Rhodes chords, soft sub-bass, faint vinyl crackle, highs rolled off. One level throughout, instrumental, loops seamlessly.
返回了什么
温暖、轻微糊化的循环,里面没有“事件”。鼓比网格慢半拍之微,Rhodes 四小节往复,黑胶噪铺在底下当纹理。它没有任何可被记住的东西——这是规格,不是失败。
为什么这样写有效
“Slightly behind the beat” 把它和普通 chill 区分开。完美量化的 lo-fi 听着像机器;那点拖沓才是这个类型。“Highs rolled off” 和 “vinyl crackle” 要的正是别的风格会去掉的伪影——lo-fi 就是由它拿走什么来定义的。“One level throughout” 是耐久指令:任何峰值到第三小时都会变烦。
改一处试试
加上 “with a melodic lead” — 它会变成好听的“主角”而不是“背景”——第一次播放更好,直播到第五小时更糟。
04 · 广告
恰好在 30 秒结束的 30 秒
提示词
Thirty-second advertising bed, 120 BPM, C major. Plucked synth, light claps, rising sweep at 22 seconds, resolved chord landing exactly at 30 with a clean stop, not a fade. Instrumental, midrange open for voiceover.
返回了什么
明亮、干净、不拥挤的 30 秒,结构清晰:前 20 秒稳住,上升扫频推进,然后一记和弦落下并戛然而止。没有淡出、没有尾巴——就在你买的那一拍结束。
为什么这样写有效
“Clean stop, not a fade” 是让它可用的指令。淡出会逼着剪辑切在衰减的音上,那是能听出来的。把扫频的位置点名(“在 22 秒”)会给编曲一个里程碑去构建,比空喊“来个 build”靠谱太多。直接按目标长度生成胜过从更长的曲目里裁,因为裁会切断乐句。
改一处试试
改要 15 秒 — 编曲会压缩而不是截断——扫频会挪到 10 秒左右,结尾仍然准点落下。
05 · 写歌
一个副歌真的能“抬起来”的歌
提示词
Contemporary pop, 102 BPM, F# minor. Female vocal, conversational verses, pre-chorus lift, big open chorus with stacked harmonies. Piano and programmed drums in verses, guitars entering in the chorus. Two verses, chorus twice, bridge, final chorus.
返回了什么
一首有结构的歌,而不是循环。主歌贴近、收着,用钢琴和程序鼓;预副歌收紧;副歌用吉他和分层和声铺开。桥段在最后一遍副歌前换一次视角。
为什么这样写有效
明确的结构——“两段主歌、副歌两遍、桥段、最后一遍副歌”——才能避免生成只是一个反复的片段。另一个关键指令是配器分层:说清楚副歌里有哪些声部进来,让副歌靠编配变大而不是靠音量,这才是实体唱片里制造提升感的办法。
改一处试试
移除“前副歌提升” — 副歌还是会到,但着陆是平的——前副歌才是制造期待、让副歌兑现的东西。
06 · 游戏
一个能听两百遍的循环
提示词
Fantasy game menu loop, 80 BPM, D dorian. Solo cello melody over harp arpeggios, soft choir pad. Patient and unhurried, instrumental, seamless loop with no obvious start point.
返回了什么
一段缓慢、环形的音乐,听不出起点。大提琴陈述一个短句,竖琴在下面循环,合唱垫保持和声、几乎不移动。放在菜单界面跑二十分钟也不抢戏。
为什么这样写有效
“没有明显起点”是让它正确无缝循环的指令。一个有鲜明开场手势的段落每次都会宣告重启,重复五十遍后玩家只能听到那个。D dorian 也在默默起作用:这种调式听起来古旧、略未完结但不悲伤,所以大量奇幻配乐待在这里。
改一处试试
改成 D 小调 — 同样的编配立刻变得忧郁。Dorian 的升六度就是“惆怅”和“凄凉”的分水岭。
07 · 播客
用十五秒立好预期
提示词
Podcast intro, 105 BPM, 15 seconds. Warm Rhodes chord, upright bass walk, brushed snare, one vibraphone flourish at the end. Conversational and inviting, instrumental, ends on a resolved chord.
返回了什么
一段短小温暖的乐句,结尾清楚。Rhodes 弹出和弦,贝斯在下方行进,刷子打点节拍,一个颤音琴短句收尾。它是收在和弦上而不是淡出,这样主持人能干净地开口。
为什么这样写有效
“以稳定和弦收尾”才让它周周可用——淡出的片头会让主持人猜该什么时候进。“一段颤音琴花腔”刻意用单数:要一个花腔就给你一个,要多个花腔就会给你一堆忙乱的十五秒,和开场第一句话打架。
改一处试试
改成 8 秒 — 贝斯行进消失,颤音琴更早落点——更紧凑,更适合冷开场的节目。
08 · 嘻哈
卡在律动里的小节
提示词
Boom bap instrumental, 90 BPM, C minor. Hard sampled drums with slight swing, dusty jazz piano loop, upright bass. Midrange left open for a vocal. Instrumental.
返回了什么
四小节循环,后拍很重,短钢琴句反复。摇摆把踩镲推得略微靠后。混音中段刻意留空——不给人声该坐的位置添堵。
为什么这样写有效
“轻微摇摆”就是“会走路的鼓点”和“只会播放的鼓点”的区别;量化得完美的 boom bap 听起来像小样。“中频留空”是大多数人生成说唱伴奏时会忘的指令——否则钢琴会正好占满人声需要的频段。
改一处试试
抬到 140 BPM,并要三连音 hi-hat — 配器不变,风格彻底换了——成了 trap,律动口袋移到半速。
弱提示词,以及更该怎么写
左栏是大家真会打的内容。它们不算错——只是信息不够,模型就用训练集中最常见的东西把空白填满。
| 弱 | 更强 | 为什么 |
|---|---|---|
| 轻松氛围音乐 | lo-fi hip hop,78 BPM,温暖的 Rhodes,带灰的摇摆鼓,黑胶噼啪,纯伴奏 | 弱版本只报一个情绪,没任何声学内容。决定声音的每个参数——速度、乐器、质感——全被丢给运气。 |
| 史诗感电影配乐 | 电影管弦,90 BPM,D 小调。独奏钢琴与低音弦,20s 太鼓进,45s 全铜管,60s 硬停 | “史诗感”描述的是结果,不是原因。说清楚从哪儿开始堆、堆到哪儿,效果才会出来。 |
| 给我视频用的开心欢快歌 | 明亮的 indie-dance,124 BPM,A 大调。干净吉他riff,迪斯科 hi-hat,2 和 4 上打掌。纯伴奏,前两秒就给出钩子 | 两个形容词加一个用途,给不了模型可操作的信息。强版本把真正会改结果的四件事说清了。 |
| 一段说唱节拍 | boom bap,90 BPM,C 小调。硬朗的采样鼓带轻微摇摆,带灰的爵士钢琴,立式贝斯,中频为人声留空 | 说唱各子流派横跨 85 到 150 BPM,彼此几乎没共同点。速度和鼓的处理方式,就是风格本身。 |
| 背景音乐,别太吵 | 纪录片衬乐,72 BPM,A 小调。毡槌钢琴与持续大提琴,不做堆叠,中频为旁白留稀疏空间 | 响度是后期混音的决定,不是生成器能管的。你真正要的是平直的动态和清晰的中频。 |
| 像 [famous artist] 的歌 | 当代 R&B,72 BPM,Bb 小调,半速。丝滑女主唱叠和声,温暖的 Rhodes,深潜次低频,打响指 | 点名艺人既不可靠也有法律麻烦。描述他们听起来那样的成因,更有效,也发布得安心。 |
它们背后的套路
上面每个强力提示词都点名了同样五件事:流派、速度、配器、对人声的明确取舍,以及一个结构指令——比如起伏落在哪里、怎么收尾、该删掉什么。大多数人会跳过结构指令,但它最常决定结果能不能用,因为这是模型唯一无法从流派惯例里猜到的部分。
注意,关键指令常常是否定式——“不要铺陈”、“不要明显的起点”、“中频留空”、“干脆收尾,不要淡出”。告诉模型不要做什么,比再加一个形容词更能把它钳住,因为形容词它可以模糊满足,禁令不行。
内页
一句话会变成什么
这条提示词,以及它生成的音轨。
1 / 5
你能直接听到差别
功能清单只会说这个工具支持十二种风格;示例会告诉你它的 lo-fi 到底行不行。
提示词本身就是课程
看到产出背后的原话,比再多说明都更有用。
它们能诚实设定预期
选“有代表性”而不是“惊艳”的示例更有用,哪怕不那么抓耳。
它们是起点
每个示例都该被拷走再改,不是拿来膜拜的。
常见问题
这些示例在展示什么?
原封不动的提示词、产出了什么、哪个具体词决定了结果、去掉它会怎样。比起单条提示词,背后的规律更重要。
我可以直接复制这些提示词吗?
本来就是给你抄的。先复制,改一处,再对比——一次只改一个变量,最快看清每个词的作用。
为啥一个词能把结果改这么多?
因为大多数字眼都含糊,只有少数是承重件。速度、乐器名、制作年代是杠杆;“nice”“epic”这种形容词由模型来理解,不是你来定。
这些提示词在别的 AI 音乐生成器上也管用吗?
多数情况管用。流派、速度、编制在不同模型间迁移性好。结构标签和否定指令在不同平台的表现差别大。
最常见的提示错误是什么?
描述情绪而不是声音。“Emotional”会给你一个它见过的此类标签的平均值;“独奏大提琴,无打击乐,60 BPM”会给你一条具体的音轨。
我该做多少个示例就够了?
三四个就能看出规律。重点不是收集提示词,而是分清哪些词会改变结果,哪些只是装饰。

















