资源库
语音与音频 Papers
面向语音识别、合成与音频生成的研究论文。
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
Zhifeng Kong, Arushi Goel 等 · 2024
提出具备少样本与对话能力的音频语言模型 Audio Flamingo。
CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens
Zhihao Du, Qian Chen 等 · 2024
提出基于监督语义词元的可扩展多语言零样本文生语音系统。
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
Yushen Chen, Zhikang Niu 等 · 2024
用流匹配方法实现流畅且忠实的零样本语音合成。
Moshi: a speech-text foundation model for real-time dialogue
Alexandre Defossez, Laurent Mazare 等 · 2024
提出面向实时语音对话的语音文本基础模型 Moshi。
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
Zeqian Ju, Yuancheng Wang 等 · 2024
结合分解编解码与扩散模型提升零样本语音合成。
Qwen2-Audio Technical Report
Yunfei Chu, Jin Xu 等 · 2024
介绍 Qwen2-Audio 的音频理解与语音交互能力。
Spirit-LM: Interleaved Spoken and Written Language Model
Tu Anh Nguyen, Benjamin Muller 等 · 2024
提出交错语音与文本建模的 Spirit-LM。
MusicLM: Generating Music From Text
Andrea Agostinelli, Timo I. Denk 等 · 2023
提出从文本描述生成高保真音乐的 MusicLM。
Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers
Chengyi Wang, Sanyuan Chen 等 · 2023
提出 VALL-E,用神经编解码语言模型实现零样本文生语音。
SeamlessM4T: Massively Multilingual & Multimodal Machine Translation
Seamless Communication · 2023
提出大规模多语言多模态语音与文本翻译系统 SeamlessM4T。
Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale
Matthew Le, Apoorv Vyas 等 · 2023
提出可规模化的文本引导多语言通用语音生成模型 Voicebox。
Robust Speech Recognition via Large-Scale Weak Supervision
Alec Radford, Jong Wook Kim 等 · 2022
提出 Whisper,用大规模弱监督训练稳健的多语言语音识别模型。
HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units
Wei-Ning Hsu, Benjamin Bolte 等 · 2021 · TASLP
通过掩码预测隐单元学习稳健语音表示。
SoundStream: An End-to-End Neural Audio Codec
Neil Zeghidour, Alejandro Luebs 等 · 2021
提出端到端神经音频编解码器 SoundStream。
SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing
Junyi Ao, Rui Wang 等 · 2021 · ACL 2022
提出统一模态的语音语言处理预训练框架 SpeechT5。
wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations
Alexei Baevski, Henry Zhou 等 · 2020 · NeurIPS 2020
提出 wav2vec 2.0,用自监督学习学习通用语音表示。
MelGAN: Generative Adversarial Networks for Conditional Waveform Synthesis
Kundan Kumar, Rithesh Kumar 等 · 2019 · NeurIPS 2019
提出 MelGAN,用对抗网络从梅尔谱高效合成波形。
SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition
Daniel S. Park, William Chan 等 · 2019 · Interspeech 2019
提出面向语音识别的频谱遮挡数据增强方法 SpecAugment。
Tacotron 2: Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
Jonathan Shen, Ruoming Pang 等 · 2017
提出 Tacotron 2,用梅尔谱预测与 WaveNet 声码器实现自然 TTS。
WaveNet: A Generative Model for Raw Audio
Aaron van den Oord, Sander Dieleman 等 · 2016
提出直接建模原始波形的自回归生成模型 WaveNet。