银河行业信息

那天深夜,我被一首银河系闪耀星的AI翻唱罗生门整破防了

大概是凌晨一点多,刷短视频刷得眼睛发酸,正准备放下手机睡觉,首页突然推了一条视频,封面是银河系闪耀星那张熟悉的脸,但标题写的是“AI翻唱《罗生门》”,我愣了一下,心想这又是什么整活,手指却已经点了进去。

然后我坐在黑暗中听完了整首歌,后背一阵阵发麻。

不是说唱得有多完美——恰恰相反,那种微妙的、介于真人和机器之间的质感,让《罗生门》这首歌突然有了另一层意味,我爬起来打开电脑,开始认认真真研究这个叫“银河系闪耀星”的声音和AI翻唱背后的东西。

那天深夜,我被一首银河系闪耀星的AI翻唱罗生门整破防了

这首歌为什么偏偏是《罗生门》

先说说《罗生门》这首歌本身,麦浚龙和谢安琪的对唱版本,讲的是多年后男女重逢,各自回忆同一段感情,却发现记忆版本完全对不上,男的记得是女方提的分手,女的记得是男方冷暴力逼她离开,谁在说谎?还是说两个人都真诚地相信自己编织的那个版本?

这首歌的厉害之处在于,它把“真相不可得”这件事唱得让人心头发紧,每句歌词都像一根针,扎在不同人的不同痛点上。

那么问题来了——用AI技术去翻唱一首探讨“真实与虚构边界”的歌,这件事本身就很有意思,当你听到“银河系闪耀星”的声音唱出“若要求证恋爱面目,可对着谁”,而这个声音既不是真人唱的,又确确实实存在,它逼着你去想一个问题:我们听到的感动,到底需不需要一个真实的源头?

银河系闪耀星的声音是怎么被AI“学会”的

这里得用费曼学习法的思路,把这件事拆开揉碎了讲清楚。

所谓AI翻唱,核心用的是一种叫歌声合成的技术,你大概听过早期的初音未来,那种电子感很强的合成音,但这两年技术已经迭代到另一个维度了,现在主流的是基于深度学习的声学模型

整个过程可以这样理解:

  • 第一步,数据采集。需要大量银河系闪耀星的原声素材——演唱会录音、直播片段、采访音频,音质越高越好,时长越长越好,这些声音会被切成无数个极短的片段,短到毫秒级别。
  • 第二步,特征提取。算法会分析这些声音片段里的核心特征:音色(决定这个人听起来像不像自己)、音高曲线(怎么从低音滑到高音)、共鸣位置(胸腔还是头腔多一些)、咬字习惯(平翘舌处理、元音发音方式),这些东西构成了一个人的“声纹指纹”。
  • 第三步,模型训练。用神经网络去“学”这些特征之间的映射关系,给模型一段干净的干声,再给它对应的高质量原声,让模型一遍遍调整参数,直到它生成的波形无限接近真人。
  • 第四步,推理生成。训练好之后,你输入《罗生门》的旋律和歌词,模型就能输出一段带着银河系闪耀星音色的演唱。

但这里面有一个很微妙的东西——模型永远无法百分之百还原真人演唱的细节,气息的微妙颤抖、情绪推到顶点时声带的微微撕裂感、即兴的转音处理,这些目前AI能做到七八成,但剩下那两三成,人味儿”最后的堡垒。

那天深夜,我被一首银河系闪耀星的AI翻唱罗生门整破防了

让我破防的到底是技术还是情绪

回到那个凌晨,我反复听了好几遍,确认了自己的感受:这首AI翻唱之所以击中我,恰恰是因为它在技术层面的那点“不完美”,和《罗生门》的内核形成了奇妙的共振。

这首歌的主题本就是记忆的不可靠,是每个人都在讲述自己版本的故事,当AI用一种近乎完美却又有微妙偏差的声音唱出“难道要等青春全枯萎,至得到你裁决”,那种感觉像是——连声音本身都在追问,到底什么才是真实的。

我翻到了一个做AI音乐的技术博主的分析文章,里面提到一个数据对比,我觉得特别能说明问题:

对比维度真人演唱早期合成音当前AI翻唱
音色还原度100%约40%约85%-95%
情感细腻度高,依赖歌手状态极低中等,依赖训练数据质量
气息自然感自然,有随机性机械,无变化接近自然,但模式化
咬字个性强,有个人习惯模糊可捕捉,但偶尔失真

你看那个“情感细腻度”一栏,写的是“中等,依赖训练数据质量”,这就是关键,如果训练数据里缺少银河系闪耀星在特定情绪下的演唱样本,AI在处理类似段落时就会显得“平”,如果数据覆盖得足够全面,那种以假乱真的程度确实会让人恍惚。

听这首歌时我在想什么

说起来有点矫情,但听到副歌部分的时候,我脑子里闪过的是之前看过的一句话,大概意思是:技术发展到某个阶段之后,人类要面对的最大问题不是“能不能做到”,而是“做到之后我们怎么办”。

AI翻唱技术现在已经可以让任何一个有足够声音素材的人“演唱”任何歌曲,银河系闪耀星翻唱《罗生门》只是一个例子,背后是声音版权、人格权、情感真实性这一连串让人头疼的问题,你的声音被别人拿去训练模型,唱了你本人永远不会唱的歌,表达了你自己未必认同的情绪——这算不算一种新型的“罗生门”?

每个人都听到了自己想听的那个版本,技术开发者看到的是模型精度,粉丝看到的是对偶像声音的另一种亲近方式,版权律师看到的是灰色地带,普通人如我,听到的是凌晨一点的情绪共振。

说真的,我到现在也没想明白自己站的哪一边,我只是记住了那个瞬间——黑暗中手机屏幕亮着,银河系闪耀星的AI声音唱到“明明在那边,回头便见面”,我鼻子一酸,然后意识到让我难过的这个声音本身,严格来说并不存在。

这大概就是2024年版本的罗生门吧。

关键词: