资源库
图像与视频生成 Papers
面向扩散模型、图像与视频生成的研究论文。
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
Zhuoyi Yang, Jiayan Teng 等 · 2024
提出带专家 Transformer 的文生视频扩散模型 CogVideoX。
HunyuanVideo: A Systematic Framework For Large Video Generative Models
Tencent Hunyuan Foundation Model Team · 2024
系统介绍面向大规模视频生成的 HunyuanVideo 框架。
Instruct-Imagen: Image Generation with Multi-modal Instruction
Hexiang Hu, Kelvin C.K. Chan 等 · 2024
研究用多模态指令控制图像生成模型。
Latte: Latent Diffusion Transformer for Video Generation
Xin Ma, Yaohui Wang 等 · 2024
提出潜空间扩散 Transformer 用于视频生成。
Lumiere: A Space-Time Diffusion Model for Video Generation
Omer Bar-Tal, Hila Chefer 等 · 2024
提出时空扩散模型 Lumiere,用于连贯视频生成。
Movie Gen: A Cast of Media Foundation Models
Movie Gen Team, Meta · 2024
介绍 Meta Movie Gen 媒体基础模型在视频与媒体生成上的能力。
Open-Sora: Democratizing Efficient Video Production for All
Zangwei Zheng, Xiangyu Peng 等 · 2024
提出开源高效视频生成系统 Open-Sora。
Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
Fan Bao, Chendong Xiang 等 · 2024
介绍面向高一致性与动态表现的文生视频扩散模型 Vidu。
Adding Conditional Control to Text-to-Image Diffusion Models
Lvmin Zhang, Anyi Rao, Maneesh Agrawala · 2023
提出 ControlNet,为文生图扩散模型增加空间条件控制。
Consistency Models
Yang Song, Prafulla Dhariwal 等 · 2023 · ICML 2023
提出一致性模型,支持少步甚至单步高质量生成。
SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
Dustin Podell, Zion English 等 · 2023
介绍 SDXL,改进潜空间扩散模型的高分辨率图像合成。
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
Andreas Blattmann, Tim Dockhorn 等 · 2023
将潜空间扩散扩展到大规模数据上的视频生成。
Classifier-Free Diffusion Guidance
Jonathan Ho, Tim Salimans · 2022 · NeurIPS 2022
提出无分类器引导,成为条件扩散生成的标准控制方法。
Scalable Diffusion Models with Transformers
William Peebles, Saining Xie · 2022 · ICCV 2023
提出 DiT,用 Transformer 主干替代 U-Net 做扩散生成。
High-Resolution Image Synthesis with Latent Diffusion Models
Robin Rombach, Andreas Blattmann 等 · 2021 · CVPR 2022
提出潜空间扩散模型,支撑高质量且计算更高效的图像合成。
Denoising Diffusion Probabilistic Models
Jonathan Ho, Ajay Jain, Pieter Abbeel · 2020 · NeurIPS 2020
提出去噪扩散概率模型 DDPM,确立扩散生成的主流训练框架。
Analyzing and Improving the Image Quality of StyleGAN
Tero Karras, Samuli Laine 等 · 2019 · CVPR 2020
提出 StyleGAN2,改进生成图像质量与训练伪影问题。
A Style-Based Generator Architecture for Generative Adversarial Networks
Tero Karras, Samuli Laine, Timo Aila · 2018 · CVPR 2019
提出 StyleGAN,通过风格控制显著提升人脸等图像生成质量。
Generative Adversarial Nets
Ian J. Goodfellow, Jean Pouget-Abadie 等 · 2014 · NeurIPS 2014
提出生成对抗网络,开创对抗训练生成建模范式。
Auto-Encoding Variational Bayes
Diederik P. Kingma, Max Welling · 2013
提出变分自编码器,建立可扩展的潜变量生成模型训练方法。