跳到主内容
快讯直播
AI智模界
模型

OpenAI 发布 Jukebox:能生成带人声的音乐

OpenAI 在其官网发布了名为 Jukebox 的新工作,官方将其归入"模型"方向。按照介绍,Jukebox 是一个能够生成音乐的神经网络,其特殊之处在于直接输出原始音频波形,而不只是乐谱或 MIDI 这类符号化的音乐表示;生成结果中还包括初步的人声演唱与歌词。

从技术路线看,Jukebox 延续了"先压缩、再建模"的思路:先把原始音频压缩为离散编码,再用自回归模型在编码层面逐段预测,最后解码回波形。相比符号音乐生成,这种做法保留了音色、混响与演唱细节,也更接近"端到端生成一首歌"的目标。模型支持通过艺术家风格、歌词等条件进行引导,用户可以给定大致方向,再让模型续写。

为何值得关注:音频是生成模型最难处理的模态之一,序列长、采样密度高,局部细节与全局结构必须同时兼顾。Jukebox 把文本与图像领域的自回归建模经验迁移到音乐音频上,让"用神经网络写歌、唱歌"从概念演示走向可复现的工程实现。官方同时提供了代码与模型,研究者可以在此基础上继续改进音质与可控性。

需要指出的是,这仍是早期成果:生成片段的长度、演唱自然度与结构连贯性都有明显局限,距离可直接用于商业音乐制作的工具还有距离。但作为音频生成方向的一次公开尝试,它为人声合成、音乐信息检索与创意辅助工具提供了新的参考基线。对关注生成式 AI 的从业者而言,Jukebox 提示了一条清晰的路径:当离散编码与自回归建模足够成熟时,音乐这类高维、长时序的模态同样可以被纳入统一框架,而不仅停留在图像与文本。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。