半导体跨界潮,谁在跟风,谁在下棋?Nikola,一个千亿造车独角兽破产了消息称谷歌将因违反反垄断规则而遭欧盟指控,恐被处以高额罚款透明美学再进化,Nothing Phone(3a)系列手机宣传物料曝光2025 年春运今日迎来最后一天,全国铁路已累计发送旅客 4.99 亿人次国内通信运营商首次:中国联通通过数字货币桥实现跨境支付微软 Outlook“保存邮件到 OneNote”功能 3 月谢幕,“发送到 OneNote”接棒全国首个:浙江率先布局低空经济“下乡”,目标到年底建成 200 个乡村无人机起降枢纽拨打客服电话强制等待 15 分钟,惠普欧洲试点遭强烈反对后取消OPPO一键问屏 / 全能搜基于阶跃星辰Step系列多模态模型打造京东&创维联合定制JD100 Mini电视发布 下单享免费送装一体服务我国成功发射中星 10R 卫星中科闻歌发布“智川”企业智能体平台1.0、“优雅”音视频大模型平台1.5,领先技术加速AI普惠落地这个周末,在最懂开发者的城市邂逅最懂开发者的算力平台DDN推出 Infinia 2.0对象存储 加速AI数据处理速度全部免费!百度文心智能体平台已全面接入DeepSeek模型灯塔云系统:开启劳务派遣管理4.0时代超2671万名消费者申请手机等数码产品购新补贴 用国补买手机上京东皇家马德里对阵赫罗纳:不乏进球与高水平竞技的足球现场OpenAI宣布面向多个国家推出AI代理 Operator
  • 首页 > 云计算频道 > 大模型

    Mustango:结合扩散模型, 提高文本生成音乐质量

    2023年11月23日 15:29:32   来源:站长之家

      在文本到音乐合成领域,生成内容的质量一直在提高,但对音乐方面的可控性仍未得到探索。新加坡科技与设计大学和伦敦玛丽女王大学的研究人员提出了一个名为 Mustango 的解决方案,它扩展了 Tango 文本到音频模型,旨在通过丰富的说明来控制生成的音乐,这些说明包含与和弦、节拍、速度和键相关的具体指令。

      研究人员将 Mustango 介绍为一种基于扩散模型的音乐领域知识启发的文本到音乐系统。他们强调了从扩散模型直接生成音乐所面临的独特挑战,强调了在与条件文本对齐和音乐性之间取得平衡的需求。Mustango 使音乐家、制作人和音效设计师能够根据特定条件(如和弦进行、速度和键选择)创建音乐片段。

      作为 Mustango 的一部分,研究人员提出了 MuNet,即音乐领域知识启发的 UNet 子模块。MuNet 将音乐专用功能与从文本提示中预测的功能集成到扩散去噪过程中。为了克服现有带有音乐和文本说明的开放数据集的有限可用性,研究人员引入了一种新颖的数据增强方法。该方法涉及改变音乐音频的和谐、节奏和动态方面,并使用音乐信息检索方法提取音乐特征,然后将这些特征附加到现有的文本描述中,从而得到 MusicBench 数据集。

      MusicBench 数据集包含超过52,000个实例,通过将节拍、下拍位置、基本和弦进行、键和速度添加到原始文本描述中,丰富了数据集。研究人员进行了广泛的实验,证明了 Mustango 在音乐质量方面达到了最新的水平。他们强调了 Mustango 通过音乐专用文本提示的可控性,展示了在捕捉多个数据集中所需的和弦、节拍、键和速度方面的出色性能。他们评估了这些预测器在没有控制句子的情况下的适应能力,并观察到 Mustango 在这种情况下的表现优于 Tango,表明控制预测器不会影响性能。

      实验包括与 Tango 和 Mustango 的变体等基线的比较,证明了所提出的数据增强方法在提高性能方面的有效性。从头开始训练的 Mustango 被认为是表现最好的模型,在音频质量、节奏存在和谐等方面超过了 Tango 和其他变体。Mustango 拥有14亿个参数,比 Tango 多得多。

      研究人员将 Mustango 作为文本到音乐合成领域的重要进展。他们解决了现有系统中的可控性差距,并通过广泛的实验证明了他们提出的方法的有效性。Mustango 不仅实现了最新的音乐质量,还提供了增强的可控性,为该领域的发展做出了宝贵的贡献。研究人员发布了 MusicBench 数据集,为未来的文本到音乐合成研究提供了资源。

      文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

    即时

    新闻

    明火炊具市场:三季度健康属性贯穿全类目

    奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。

    企业IT

    重庆创新公积金应用,“区块链+政务服务”显成效

    “以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。

    3C消费

    华硕ProArt创艺27 Pro PA279CRV显示器,高能实力,创

    华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。

    研究

    中国信通院罗松:深度解读《工业互联网标识解析体系

    9月14日,2024全球工业互联网大会——工业互联网标识解析专题论坛在沈阳成功举办。