TodayAI

资源库

语音与音频 Papers

面向语音识别、合成与音频生成的研究论文。

Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

Zhifeng Kong, Arushi Goel 等 · 2024

提出具备少样本与对话能力的音频语言模型 Audio Flamingo。

audio-flamingoaudiofew-shot
语音与音频arXiv

CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Zhihao Du, Qian Chen 等 · 2024

提出基于监督语义词元的可扩展多语言零样本文生语音系统。

cosyvoicettsmultilingual
语音与音频arXiv

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching

Yushen Chen, Zhikang Niu 等 · 2024

用流匹配方法实现流畅且忠实的零样本语音合成。

f5-ttsflow-matchingtts
语音与音频arXiv

Moshi: a speech-text foundation model for real-time dialogue

Alexandre Defossez, Laurent Mazare 等 · 2024

提出面向实时语音对话的语音文本基础模型 Moshi。

moshispeech-dialoguerealtime
语音与音频arXiv

NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Zeqian Ju, Yuancheng Wang 等 · 2024

结合分解编解码与扩散模型提升零样本语音合成。

naturalspeechzero-shottts
语音与音频arXiv

Qwen2-Audio Technical Report

Yunfei Chu, Jin Xu 等 · 2024

介绍 Qwen2-Audio 的音频理解与语音交互能力。

qwen2-audioaudiomultimodal
语音与音频arXiv

Spirit-LM: Interleaved Spoken and Written Language Model

Tu Anh Nguyen, Benjamin Muller 等 · 2024

提出交错语音与文本建模的 Spirit-LM。

spirit-lmspeechlanguage-model
语音与音频arXiv

MusicLM: Generating Music From Text

Andrea Agostinelli, Timo I. Denk 等 · 2023

提出从文本描述生成高保真音乐的 MusicLM。

musiclmmusicgeneration
语音与音频arXiv

Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Chengyi Wang, Sanyuan Chen 等 · 2023

提出 VALL-E,用神经编解码语言模型实现零样本文生语音。

vall-ettszero-shot
语音与音频arXiv

SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Seamless Communication · 2023

提出大规模多语言多模态语音与文本翻译系统 SeamlessM4T。

seamlessspeech-translationmultilingual
语音与音频arXiv

Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale

Matthew Le, Apoorv Vyas 等 · 2023

提出可规模化的文本引导多语言通用语音生成模型 Voicebox。

voiceboxttsmultilingual
语音与音频arXiv

Robust Speech Recognition via Large-Scale Weak Supervision

Alec Radford, Jong Wook Kim 等 · 2022

提出 Whisper,用大规模弱监督训练稳健的多语言语音识别模型。

whisperasrspeech
语音与音频arXiv

HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units

Wei-Ning Hsu, Benjamin Bolte 等 · 2021 · TASLP

通过掩码预测隐单元学习稳健语音表示。

hubertself-supervisedspeech
语音与音频arXiv

SoundStream: An End-to-End Neural Audio Codec

Neil Zeghidour, Alejandro Luebs 等 · 2021

提出端到端神经音频编解码器 SoundStream。

codecaudiocompression
语音与音频arXiv

SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing

Junyi Ao, Rui Wang 等 · 2021 · ACL 2022

提出统一模态的语音语言处理预训练框架 SpeechT5。

speecht5pretrainingspeech
语音与音频arXiv

wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

Alexei Baevski, Henry Zhou 等 · 2020 · NeurIPS 2020

提出 wav2vec 2.0,用自监督学习学习通用语音表示。

wav2vecself-supervisedspeech
语音与音频arXiv

MelGAN: Generative Adversarial Networks for Conditional Waveform Synthesis

Kundan Kumar, Rithesh Kumar 等 · 2019 · NeurIPS 2019

提出 MelGAN,用对抗网络从梅尔谱高效合成波形。

melganvocodergan
语音与音频arXiv

SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition

Daniel S. Park, William Chan 等 · 2019 · Interspeech 2019

提出面向语音识别的频谱遮挡数据增强方法 SpecAugment。

specaugmentasraugmentation
语音与音频arXiv

Tacotron 2: Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions

Jonathan Shen, Ruoming Pang 等 · 2017

提出 Tacotron 2,用梅尔谱预测与 WaveNet 声码器实现自然 TTS。

tacotronttswavenet
语音与音频arXiv

WaveNet: A Generative Model for Raw Audio

Aaron van den Oord, Sander Dieleman 等 · 2016

提出直接建模原始波形的自回归生成模型 WaveNet。

wavenetaudiogenerative
语音与音频arXiv