Suno 把音轨分离重做了,不是抠频率是从零重新生成一遍

小岛AI 2026 / 06 / 14

昨晚刷到 Suno 一条更新,就一句话,我盯着看了两遍。

它说,音轨分离升级了,现在不是隔离频率,而是把每条音轨从零重新生成一遍。原文是 regenerating stems from scratch instead of just isolating frequencies,配了段演示,1 万多浏览,底下一堆做音乐的在欢呼。

我第一反应不是欢呼,是愣了一下。

因为如果你知道过去十年这个领域是怎么干活的,你会发现这句话里藏着一个很大的范式调头。不是把活干得更好了,是换了一种世界观在干活。这事儿值得唠唠。

先说清楚音轨分离是个啥。你手里有一首做好的歌,人声、鼓、贝斯、吉他全混在一起,变成了左右两条立体声轨道。所谓 stem separation(音轨分离,也叫音源分离),就是想把这锅已经煮好的汤,重新拆回一碗清汤加几把单独的料,人声归人声,鼓归鼓。做卡拉 OK 要它,重新混音要它,采样、扒带、二次创作都要它。

需求一直在,难的是怎么拆。

过去主流的拆法,本质是在频谱图上做减法。把那条混音波形做个变换,铺成一张时间和频率的二维图,行话叫频谱图(spectrogram,横轴时间纵轴频率的一张热力图)。然后训练一个模型去猜,这张图上每一个点,是属于人声的能量,还是属于鼓的能量。猜完了,把判给人声的那些点抠出来反变换回去,你就得到一条人声轨。这套思路叫频谱遮罩(spectral masking),听着挺巧妙对吧。

Deezer 开源的 Spleeter 是这条路的代表,跑得飞快,当年 GitHub 上一片欢呼。后来 Meta 的 FAIR 实验室搞了 Demucs,做得更精细,后期版本干脆跳过频谱图直接在波形上动刀。商业产品里 LALAL.AIMoises 这些,底子也都是这套减法逻辑。它们确实好用,我自己扒过几次伴奏,能用。

但这套减法有个绕不过去的物理天花板。

你想想看,人声和吉他如果在同一个瞬间踩到了同一个频率,它俩的能量在频谱图上就是叠在一起的一坨,糊成一团。模型这时候不是在做切割,是在做分赃,它得猜这一坨里有几分该给人声几分该给吉他,猜错一点,抠出来的人声里就带着吉他的渣,吉他里就飘着人声的魂。

这种残留有个专门的名字,叫伪影(artifacts),听感上就是那种水下的、闷闷的、带点金属咕噜声的脏东西。混音越密集,乐器越多,撞车越狠,捞出来的分轨越糊。做这行的人都熟,你拿一首编曲简单的民谣去扒,干干净净;拿一首墙到墙全是声音的流行歌去扒,出来的人声跟隔着浴室门唱的一样。

这不是工程师不努力,是减法这条路本身就有上限。一锅汤煮到一起了,你想把葱花一根一根挑干净,总会带汤带渣,这是物理决定的,再好的筷子也没用。

然后 Suno 说,我不挑了。

它的新做法,是不再去原混音里抠,而是让生成模型理解这首歌的每一条声部本来应该长什么样,然后从零合成一条全新的、干净的分轨出来。注意这个动作的性质变了,前面那套是把脏数据里的信息往外捞,Suno 这套是知道答案之后重新画一遍。

葱花挑不干净,那我干脆别挑了,我知道这锅汤的配方,我重新单独给你做一份纯葱、一份纯姜、一份纯蒜,每一份都是新鲜现做的,干净到可以直接下锅。

听着挺玄对吧。凭什么它能知道每条声部本来长啥样?

关键在这是 Suno 自己生成的歌。它手里本来就攥着这首曲子的底稿,每条声部的来龙去脉它一清二楚,所以它不需要从成品里去逆向猜测,它直接调出那条声部重新生成一遍就行。这一下就绕开了减法的物理天花板,因为它压根没在做减法,它在做创作的回放。

我看到这儿是真愣了一下。这不是把扒带这件事做得更好了,这是把扒带这件事给取消了,换成了重新唱一遍。

而且你把镜头拉远一点会发现,这个调头在 AI 这几年里反复发生过。

老照片修复,早年是拿一堆滤镜去锐化去噪,跟挤牙膏一样从糊掉的像素里硬抠细节,修出来一股塑料感。后来扩散模型上场,思路直接变成,我见过几千万张清晰的人脸,我知道一张正常的脸该长啥样,我不修了,我照着你这张糊脸重新生成一张清晰的。语音降噪、图像超分、缺帧补全,剧情几乎一模一样,都是从判别式(judge,判断这是啥、该留还是该扔)转向生成式(generate,干脆重新造一个对的出来)。

这背后其实是一个挺朴素的道理。当模型见过了足够多的正确答案,与其费劲巴拉地从一份坏掉的数据里抠那点残存信息,不如让它直接照着脑子里的正确答案重画一份。补全缺失信息这件事上,生成式比判别式有结构性的优势,因为判别式被原始数据的质量锁死了,原图多糊它就多无能为力;生成式不被锁死,它的上限是它脑子里见过的世界,而不是你手里那份烂数据。

Suno 这次干的,就是把这套世界观搬到了音频分轨上。早该有人这么想了,但真做出来还是有点子牛逼。

说到这我得踩个刹车,泼点冷水,免得显得我在替它打广告。

它这套有个非常硬的前提,叫这首歌得是它自己生成的。它认识这段音频,它有底稿,所以才能重画。可一旦你扔给它一首外面的歌,一首它从没见过的、别人做的曲子呢?它手里没有底稿,它不知道这条人声本来真正长啥样,那它所谓的重新生成,就不再是回放,而是猜着编。

编出来好不好听是一回事,但它很可能会编出原作里压根不存在的细节。一个气声的换气、一个吉他的揉弦、一段贝斯的滑音,原唱没这么弹,模型觉得这儿应该有就给你脑补上了。对追求干净听感的人来说这是福音,对追求保真、追求一个音都不能差的人来说,这就有点恐怖了,你拿到的不是原作的分轨,是模型对原作的一份翻唱。

版权这块就更微妙了。当分离变成了重新生成,你手里那条人声轨,到底还算不算原作的一部分,这事儿在法律上现在没人能给你一个干净的答案。我也不知道这条线最后会划在哪,反正现在是糊的。

所以这功能目前最稳的用法,就是在 Suno 自己的生态里,拆它自己生成的歌(suno.com)。这个边界它官方没大声强调,但你得自己心里有数。演示视频里那条干净到反光的分轨,是在它认识这首歌的前提下跑出来的,别看完就觉得天下所有歌从此都能一键完美扒带了,不是的。官方演示永远是顺风顺水那一条,逆风局它不会拍给你看,这点我们做工程的最清楚,demo 和生产环境之间隔着一整个太平洋。

但即便把冷水泼完,我还是觉得这事值得记一笔。

因为它又一次提醒我,这几年 AI 真正在变的,不是某个指标涨了几个点,是解决问题的姿势在整个换掉。我们这代人是被减法教育大的,遇到脏数据的第一反应永远是清洗、过滤、修补、降噪,在烂摊子里抢救。而生成式给的是另一种答案,烂摊子别抢救了,我见过好的长啥样,我重做一个给你。

这两种姿势,背后是两种对世界的态度。一种是修补匠,对着破的东西缝缝补补,能用就行;一种是创作者,干脆按理想的样子重新造一个。我说不好哪种更对,很多场景里修补依然是更老实、更可控的选择,重做有重做的代价和风险,比如刚才说的那个会脑补、会失真的问题。但你不得不承认,创作者这条路的天花板,肉眼可见地比修补匠高。

万能青年旅店有句词我一直记着,是谁来自山川湖海,却囿于昼夜厨房与爱。我们做技术的,很多时候就是被囿在那份烂数据里,在既定的约束里螺蛳壳里做道场,抠那最后一点点信噪比。而生成式这套东西,某种程度上是在问一个更野的问题,我为什么非得待在这口锅里,我能不能跳出去,重新生一锅干净的。

Suno 这次的更新,技术上看就是一行小字,一个产品功能的迭代。但它背后那个从抠频率到重画一遍的转身,我觉得比功能本身有意思得多。

回到最开始那句让我愣神的话,regenerating from scratch。从零重新生成。这六个字现在贴在音轨分离上,明天可能就贴在别的什么你以为只能修不能换的东西上。

哪天你发现一个一直靠清洗和修补硬撑的老问题,突然有人说不修了,我重做一个,别急着说他疯,先愣一下,想想是不是那个调头又来了。

反正我昨晚是愣住了。挺好,又长见识了。