资源库
多模态与生成 Open Source
面向图像、视频、音频等多模态生成与创作的开源项目。
AnimateDiff
guoyww/AnimateDiff
为扩散模型增加动画能力的开源项目。
AudioCraft
facebookresearch/audiocraft
Meta 开源音频生成与音乐生成研究代码。
Bark
suno-ai/bark
可生成语音与非语言音频的开源文本转音频模型。
ComfyUI
comfyanonymous/ComfyUI
基于节点工作流进行扩散模型图像生成的开源界面。
Coqui TTS
coqui-ai/TTS
开源文本转语音工具包与模型集合。
Diffusers
huggingface/diffusers
面向扩散模型训练与推理的开源库。
faster-whisper
SYSTRAN/faster-whisper
基于 CTranslate2 的加速 Whisper 实现。
Fooocus
lllyasviel/Fooocus
简化操作的开源图像生成界面。
GFPGAN
TencentARC/GFPGAN
面向人脸修复的开源生成模型。
GroundingDINO
IDEA-Research/GroundingDINO
开源开放词汇目标检测模型实现。
InvokeAI
invoke-ai/InvokeAI
面向专业图像创作流程的开源扩散工具。
Open-Sora
hpcaitech/Open-Sora
面向视频生成的开源复现与训练框架。
Piper
rhasspy/piper
面向本地设备的快速文本转语音系统。
Real-ESRGAN
xinntao/Real-ESRGAN
面向真实场景图像超分的开源模型。
RemBG
danielgatis/rembg
开源图像背景移除工具。
RVC
RVC-Project/Retrieval-based-Voice-Conversion-WebUI
基于检索的开源歌声与语音转换工具。
Segment Anything
facebookresearch/segment-anything
Meta 开源通用图像分割模型与工具。
Stable Diffusion
CompVis/stable-diffusion
潜空间扩散模型的原始开源实现。
Stable Diffusion WebUI
AUTOMATIC1111/stable-diffusion-webui
广泛使用的 Stable Diffusion Web 界面。
Ultralytics YOLO
ultralytics/ultralytics
YOLO 系列视觉模型的开源训练与推理库。
Whisper
openai/whisper
OpenAI 开源通用语音识别模型与代码。
WhisperX
m-bain/whisperX
增强时间戳与说话人分离的 Whisper 流水线。