智通财经 APP 获悉，英伟达 (NVDA.US) 推出了一款用于生成音乐和音频的新型人工智能 (AI) 模型，旨在为制作音乐、电影和视频游戏的人们提供服务。 根据英伟达的说法，这款模型名为 Fugatto(Foundational Generative Audio Transformer Opus)，可以使用任何文本和音频文件来生成或修改音乐和声音。例如，该模型可以根据文本提示创建音乐片段，从现有歌曲中删除或添加乐器，改变声音中的口音或情绪，甚至发出从未听过的声音。英伟达应用音频研究经理、管弦乐队指挥兼作曲家 Rafael Valle 表示：“我们希望创建一个能像人类一样理解和产生声音的模型。”英伟达指出，广告代理商可以使用 Fugatto 快速定位多个地区的现有广告，并在配音中加入不同的口音和情感。此外，视频游戏开发者可以使用人工智能模型修改游戏中预先录制的资产，以适应用户在玩游戏时不断变化的动作。Fugatto 可以使小号发出狗吠声或萨克斯管发出喵喵声。该公司补充说，通过微调和少量的歌唱数据，研究人员发现它可以处理未经预先训练的任务，比如从文本中生成高质量的歌声。英伟达表示，Fugatto 的完整版本使用了 25 亿个参数，并在包含 32 个 Nvidia H100 Tensor Core GPU 的 Nvidia DGX 系统上进行了训练。该模型的整体工作耗时一年多。Fugatto 可能会与 Runway 等初创公司以及 Meta Platforms(META.US) 等大公司的类似技术展开竞争。10 月，Meta 发布了名为 Movie Gen 的人工智能模型，该模型可以根据用户提示创建逼真的视频和音频剪辑。今年 2 月，ChatGPT 制造商 OpenAI 推出了 Sora，它可以根据文本指令创建逼真且富有想象力的场景。这家由微软 (MSFT.US) 支持的公司尚未向公众发布文本转视频模型。

英伟达

英伟达推出新型 AI 模型 Fugatto，旨在生成和修改音乐及音频，服务于音乐、电影和视频游戏制作。该模型可根据文本和音频文件创建音乐片段，改变声音的口音和情感，甚至生成新声音。Fugatto 使用 25 亿个参数，在 Nvidia DGX 系统上训练，耗时一年多。该技术可能与 Meta 等公司的类似产品竞争。

- 英伟达推出新型 AI 模型 Fugatto，用于生成音乐和音频。  
- 模型可根据文本和音频文件生成或修改音乐，适用于广告和游戏开发。  
- Fugatto 使用 25 亿个参数，训练耗时一年多，可能与 Meta 和 OpenAI 的技术竞争。  

英伟达推出新 AI 模型 Fugatto，可修改并生成新声音