TodayAI

资源库

图像与视频生成 Papers

面向扩散模型、图像与视频生成的研究论文。

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang, Jiayan Teng 等 · 2024

提出带专家 Transformer 的文生视频扩散模型 CogVideoX。

cogvideoxtext-to-videodiffusion
图像与视频生成arXiv

HunyuanVideo: A Systematic Framework For Large Video Generative Models

Tencent Hunyuan Foundation Model Team · 2024

系统介绍面向大规模视频生成的 HunyuanVideo 框架。

hunyuanvideotext-to-videofoundation-model
图像与视频生成arXiv

Instruct-Imagen: Image Generation with Multi-modal Instruction

Hexiang Hu, Kelvin C.K. Chan 等 · 2024

研究用多模态指令控制图像生成模型。

instruct-imagentext-to-imageinstruction
图像与视频生成arXiv

Latte: Latent Diffusion Transformer for Video Generation

Xin Ma, Yaohui Wang 等 · 2024

提出潜空间扩散 Transformer 用于视频生成。

lattevideodit
图像与视频生成arXiv

Lumiere: A Space-Time Diffusion Model for Video Generation

Omer Bar-Tal, Hila Chefer 等 · 2024

提出时空扩散模型 Lumiere,用于连贯视频生成。

lumierevideodiffusion
图像与视频生成arXiv

Movie Gen: A Cast of Media Foundation Models

Movie Gen Team, Meta · 2024

介绍 Meta Movie Gen 媒体基础模型在视频与媒体生成上的能力。

movie-genvideofoundation-model
图像与视频生成arXiv

Open-Sora: Democratizing Efficient Video Production for All

Zangwei Zheng, Xiangyu Peng 等 · 2024

提出开源高效视频生成系统 Open-Sora。

open-soratext-to-videoopen-source
图像与视频生成arXiv

Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models

Fan Bao, Chendong Xiang 等 · 2024

介绍面向高一致性与动态表现的文生视频扩散模型 Vidu。

vidutext-to-videodiffusion
图像与视频生成arXiv

Adding Conditional Control to Text-to-Image Diffusion Models

Lvmin Zhang, Anyi Rao, Maneesh Agrawala · 2023

提出 ControlNet,为文生图扩散模型增加空间条件控制。

controlnetconditioningdiffusion
图像与视频生成arXiv

Consistency Models

Yang Song, Prafulla Dhariwal 等 · 2023 · ICML 2023

提出一致性模型,支持少步甚至单步高质量生成。

consistency-modelsfast-samplinggeneration
图像与视频生成arXiv

SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Dustin Podell, Zion English 等 · 2023

介绍 SDXL,改进潜空间扩散模型的高分辨率图像合成。

sdxllatent-diffusiontext-to-image
图像与视频生成arXiv

Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Andreas Blattmann, Tim Dockhorn 等 · 2023

将潜空间扩散扩展到大规模数据上的视频生成。

svdvideolatent-diffusion
图像与视频生成arXiv

Classifier-Free Diffusion Guidance

Jonathan Ho, Tim Salimans · 2022 · NeurIPS 2022

提出无分类器引导,成为条件扩散生成的标准控制方法。

cfgguidancediffusion
图像与视频生成arXiv

Scalable Diffusion Models with Transformers

William Peebles, Saining Xie · 2022 · ICCV 2023

提出 DiT,用 Transformer 主干替代 U-Net 做扩散生成。

dittransformerdiffusion
图像与视频生成arXiv

High-Resolution Image Synthesis with Latent Diffusion Models

Robin Rombach, Andreas Blattmann 等 · 2021 · CVPR 2022

提出潜空间扩散模型,支撑高质量且计算更高效的图像合成。

ldmstable-diffusionlatent
图像与视频生成arXiv

Denoising Diffusion Probabilistic Models

Jonathan Ho, Ajay Jain, Pieter Abbeel · 2020 · NeurIPS 2020

提出去噪扩散概率模型 DDPM,确立扩散生成的主流训练框架。

ddpmdiffusiongeneration
图像与视频生成arXiv

Analyzing and Improving the Image Quality of StyleGAN

Tero Karras, Samuli Laine 等 · 2019 · CVPR 2020

提出 StyleGAN2,改进生成图像质量与训练伪影问题。

stylegan2ganimage-generation
图像与视频生成arXiv

A Style-Based Generator Architecture for Generative Adversarial Networks

Tero Karras, Samuli Laine, Timo Aila · 2018 · CVPR 2019

提出 StyleGAN,通过风格控制显著提升人脸等图像生成质量。

styleganganimage-generation
图像与视频生成arXiv

Generative Adversarial Nets

Ian J. Goodfellow, Jean Pouget-Abadie 等 · 2014 · NeurIPS 2014

提出生成对抗网络,开创对抗训练生成建模范式。

gangenerativeadversarial
图像与视频生成arXiv

Auto-Encoding Variational Bayes

Diederik P. Kingma, Max Welling · 2013

提出变分自编码器,建立可扩展的潜变量生成模型训练方法。

vaelatent-variablegeneration
图像与视频生成arXiv