基于神经网络的立体声自动上混算法研究

《Artificial Life》:S2X-Net: Stereo-to-Multichannel Neural Upmixing Network

【字体: 时间:2026年09月15日 来源:Artificial Life 1.8

编辑推荐:

   摘要:虽然立体声格式是音频最常见的表示方式,但由于缺乏环绕声,它无法提供完整的沉浸式音频体验。因此,电影院或家庭录音室中使用5.1或7.1等多声道配置,提供改进的声音体验。然而,将单声道或立体声转换为多声道通常需要音响工程师手动操作,需要繁重的劳动和努力。本文提出了一种基于

  

摘要:

虽然立体声格式是音频最常见的表示方式,但由于缺乏环绕声,它无法提供完整的沉浸式音频体验。因此,电影院或家庭录音室中使用5.1或7.1等多声道配置,提供改进的声音体验。然而,将单声道或立体声转换为多声道通常需要音响工程师手动操作,需要繁重的劳动和努力。本文提出了一种基于神经网络的自动上混算法,可以将任何立体声音频,如电影、音乐或动画片,转换为5.1甚至7.1声音。结合新颖的声源分离和主要-环境提取模型,我们提出的方法可以达到接近人工上混的结果,通过MUSHRA启发的听音测试进行主观评估,共有50名受试者参与。此外,与其他工业方法不同,我们的策略基于数学公式,通过降混所得的多声道信号并将其与原始立体声进行比较,使用SDR、SI-SDR和MSE指标,确保接近无损的往返转换回立体声。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号