Nvidia公布可生成混合音乐、人声音效的AI模型Fugatto
支付動態 · 2024-11-26

Fugatto接受文本与音频文件输入,强调能根据提示生成出高度客制化的独特音效

Nvidia本周发表一个能依文本或音乐文件提示,生成或修改一首混合音乐、人声和音效的AI模型,名为Fugatto。

现今已有多家厂商,包括GoogleMeta推出可生成短曲、音效、或修改现有音乐的AI模型,但Nvidia公布的Fugatto模型号称生成技巧超越前者。Fugatto可依据用户输入的文本,或上传的音频文件,生成或修改音乐、人声或声音的元素组合。例如它可以根据用户文本提示生成音乐片段、在现有歌曲加入一种乐器声音(或移除),或是改变人声腔调或是情感,甚至发展出全新的表现方式。

Fugatto全名为「Foundational Generative Audio Transformer Opus 1」,是一个基础生成式transformer模型,为Nvidia在之前语音模型、音频编码及音频理解等基础上的研发成果。模型本身包含25亿参数,是在32颗H100 GPU的DGX系统,在一年多期间,以数百万音频样本及文本数据训练而成。

Fugatto训练团队涵括印度、巴西、中国、南韩和约旦。Nvidia指出,研究团队使用多面向策略产生数据和指令,以确保模型能胜任多种不同任务,他们也审视现有数据集,找出数据间的新关联性,在不需额外新数据集情况下,使模型学习到新任务且获致高准确性。

例如Fugatto使用名为ComposableART的技术,把原本个别使用的指令组合起来,像是组合多个指令,例如用户可要求它用悲伤情绪以法语腔说一段文本,还允许插入不同指令的功能,方便用户微调,像是腔调浓重或是悲伤程度。

Nvidia贴出了一段视频,展现Fugatto可为电影创造出震撼的配音。

Fugatto还具备时序插入(temporal interpolation)能力,可生成随时间改变的声音,像是暴风雨中由近而远传递的雷声,也提供声音地景的微调功能。此外,有别于其他多数模型只能重建模型团队输入的训练数据,Fugatto还让用户新创造全新的声音地景,像是风雨过后随着鸟鸣来到的清晨。

各家业者目前皆积极开发生成音乐、人声及音效的AI技术。ElevenLabs、DeepMind都在开发帮视频配音的技术、Meta去年公布可同时接受文本和音频输入的AudioBox。OpenAI也在今年稍早公布了以15秒样本生成人声的模型。

热门文章
斯里兰卡博弈产业大转型,官方:剑指南亚拉斯维加斯
游戏风向
巴西颁布新法赋权央行封锁非法博彩账户及 Pix 交易
支付动态
亚洲游戏市场观察:15大市场热门游戏与用户趋势
线上游戏
越南在线博彩业政策收紧 催生市场新机遇
东南亚资讯
密西西比州众议院委员会推进提议增加赌场税的法案
游戏风向
越南博彩管控逐步放宽,惟本土需求仍显乏力
东南亚资讯
PropellerAds 分享了新的 iGaming 案例研究:在 3 个月实现 97,674 次安装和 12,701 笔存款
广告营销
新泽西州7月博彩收入创6.06亿美元新高,颁布禁令
游戏风向
JILI 宣布与全球板球传奇 AB de Villiers(ABD)达成重磅战略合作
体育游戏
亚洲顶尖游戏供应商多寶游戏 DB GAMING,开创亚洲市场的唯一首选
广告营销
Zenith携手HUIDU,冠名赞助2026年世界杯嘉年华官方巡回活动
线上游戏
张侨伟参议员排除全面禁止,敦促菲律宾规范网络赌博
东南亚资讯
巴西拟将博彩税率提高至24% 税收将用于社保和医疗领域
游戏风向
哈萨克斯坦计划对在线赌场促销活动进行处罚
游戏风向
2027 Global Game Connect(GGC)斯里兰卡招商全面开启!业务人脉尽在掌握!
灰度头条
首页
游戏
合作
发现
我的