智通財經 APP 獲悉，英偉達 (NVDA.US) 推出了一款用於生成音樂和音頻的新型人工智能 (AI) 模型，旨在為製作音樂、電影和視頻遊戲的人們提供服務。 根據英偉達的説法，這款模型名為 Fugatto(Foundational Generative Audio Transformer Opus)，可以使用任何文本和音頻文件來生成或修改音樂和聲音。例如，該模型可以根據文本提示創建音樂片段，從現有歌曲中刪除或添加樂器，改變聲音中的口音或情緒，甚至發出從未聽過的聲音。英偉達應用音頻研究經理、管絃樂隊指揮兼作曲家 Rafael Valle 表示：“我們希望創建一個能像人類一樣理解和產生聲音的模型。”英偉達指出，廣告代理商可以使用 Fugatto 快速定位多個地區的現有廣告，並在配音中加入不同的口音和情感。此外，視頻遊戲開發者可以使用人工智能模型修改遊戲中預先錄製的資產，以適應用户在玩遊戲時不斷變化的動作。Fugatto 可以使小號發出狗吠聲或薩克斯管發出喵喵聲。該公司補充説，通過微調和少量的歌唱數據，研究人員發現它可以處理未經預先訓練的任務，比如從文本中生成高質量的歌聲。英偉達表示，Fugatto 的完整版本使用了 25 億個參數，並在包含 32 個 Nvidia H100 Tensor Core GPU 的 Nvidia DGX 系統上進行了訓練。該模型的整體工作耗時一年多。Fugatto 可能會與 Runway 等初創公司以及 Meta Platforms(META.US) 等大公司的類似技術展開競爭。10 月，Meta 發佈了名為 Movie Gen 的人工智能模型，該模型可以根據用户提示創建逼真的視頻和音頻剪輯。今年 2 月，ChatGPT 製造商 OpenAI 推出了 Sora，它可以根據文本指令創建逼真且富有想象力的場景。這家由微軟 (MSFT.US) 支持的公司尚未向公眾發佈文本轉視頻模型。

英偉達

英偉達推出新型 AI 模型 Fugatto，旨在生成和修改音樂及音頻，服務於音樂、電影和視頻遊戲製作。該模型可根據文本和音頻文件創建音樂片段，改變聲音的口音和情感，甚至生成新聲音。Fugatto 使用 25 億個參數，在 Nvidia DGX 系統上訓練，耗時一年多。該技術可能與 Meta 等公司的類似產品競爭。

- 英偉達推出新型 AI 模型 Fugatto，用於生成音樂和音頻。  
- 模型可根據文本和音頻文件生成或修改音樂，適用於廣告和遊戲開發。  
- Fugatto 使用 25 億個參數，訓練耗時一年多，可能與 Meta 和 OpenAI 的技術競爭。  

英偉達推出新 AI 模型 Fugatto，可修改並生成新聲音