TodayAI

资源库

多模态与生成 Open Source

面向图像、视频、音频等多模态生成与创作的开源项目。

AnimateDiff

guoyww/AnimateDiff

为扩散模型增加动画能力的开源项目。

videoimage-generationdiffusion
多模态与生成PythonApache-2.0

AudioCraft

facebookresearch/audiocraft

Meta 开源音频生成与音乐生成研究代码。

audiogenerationmusic
多模态与生成PythonMIT

Bark

suno-ai/bark

可生成语音与非语言音频的开源文本转音频模型。

speechttsaudio
多模态与生成PythonMIT

ComfyUI

comfyanonymous/ComfyUI

基于节点工作流进行扩散模型图像生成的开源界面。

image-generationworkflowdiffusion
多模态与生成PythonGPL-3.0

Coqui TTS

coqui-ai/TTS

开源文本转语音工具包与模型集合。

speechttsaudio
多模态与生成PythonMPL-2.0

Diffusers

huggingface/diffusers

面向扩散模型训练与推理的开源库。

image-generationdiffusiontraining
多模态与生成PythonApache-2.0

faster-whisper

SYSTRAN/faster-whisper

基于 CTranslate2 的加速 Whisper 实现。

speechasrinference
多模态与生成PythonMIT

Fooocus

lllyasviel/Fooocus

简化操作的开源图像生成界面。

image-generationdiffusionui
多模态与生成PythonGPL-3.0

GFPGAN

TencentARC/GFPGAN

面向人脸修复的开源生成模型。

visionfacerestoration
多模态与生成PythonApache-2.0

GroundingDINO

IDEA-Research/GroundingDINO

开源开放词汇目标检测模型实现。

visiondetectionmultimodal
多模态与生成PythonApache-2.0

InvokeAI

invoke-ai/InvokeAI

面向专业图像创作流程的开源扩散工具。

image-generationdiffusionui
多模态与生成TypeScriptApache-2.0

Open-Sora

hpcaitech/Open-Sora

面向视频生成的开源复现与训练框架。

videogenerationdiffusion
多模态与生成PythonApache-2.0

Piper

rhasspy/piper

面向本地设备的快速文本转语音系统。

speechttslocal-ai
多模态与生成C++MIT

Real-ESRGAN

xinntao/Real-ESRGAN

面向真实场景图像超分的开源模型。

visionsuper-resolutionimage
多模态与生成PythonBSD-3-Clause

RemBG

danielgatis/rembg

开源图像背景移除工具。

visionimagetools
多模态与生成PythonMIT

RVC

RVC-Project/Retrieval-based-Voice-Conversion-WebUI

基于检索的开源歌声与语音转换工具。

speechvoice-conversionaudio
多模态与生成PythonMIT

Segment Anything

facebookresearch/segment-anything

Meta 开源通用图像分割模型与工具。

visionsegmentationimage
多模态与生成PythonApache-2.0

Stable Diffusion

CompVis/stable-diffusion

潜空间扩散模型的原始开源实现。

image-generationdiffusionresearch
多模态与生成PythonCreativeML Open RAIL-M

Stable Diffusion WebUI

AUTOMATIC1111/stable-diffusion-webui

广泛使用的 Stable Diffusion Web 界面。

image-generationuidiffusion
多模态与生成PythonAGPL-3.0

Ultralytics YOLO

ultralytics/ultralytics

YOLO 系列视觉模型的开源训练与推理库。

visiondetectiontraining
多模态与生成PythonAGPL-3.0

Whisper

openai/whisper

OpenAI 开源通用语音识别模型与代码。

speechasraudio
多模态与生成PythonMIT

WhisperX

m-bain/whisperX

增强时间戳与说话人分离的 Whisper 流水线。

speechasrdiarization
多模态与生成PythonBSD-4-Clause