资源库
多模态与视觉 Papers
面向视觉、视觉语言与多模态理解的研究论文。
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
Xiaokang Chen, Zhiyu Wu 等 · 2025
提出统一多模态理解与生成的 Janus-Pro,并研究数据与模型扩展。
Qwen2.5-VL Technical Report
Qwen Team · 2025
介绍 Qwen2.5-VL 在视觉理解与代理能力上的技术进展。
Aria: An Open Multimodal Native Mixture-of-Experts Model
Dongxu Li, Yudong Liu 等 · 2024
提出原生多模态混合专家开放模型 Aria。
Chameleon: Mixed-Modal Early-Fusion Foundation Models
Chameleon Team · 2024
提出早期融合的混合模态基础模型,统一处理图像与文本。
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
Zhiyu Wu, Xiaokang Chen 等 · 2024
提出基于 MoE 的 DeepSeek-VL2 多模态理解模型。
LLaVA-OneVision: Easy Visual Task Transfer
Bo Li, Yuanhan Zhang 等 · 2024
提出面向单图、多图与视频任务迁移的 LLaVA-OneVision。
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
Matt Deitke, Christopher Clark 等 · 2024
发布开放权重与开放数据的高性能视觉语言模型 Molmo。
NVLM: Open Frontier-Class Multimodal LLMs
Wenliang Dai, Nayeon Lee 等 · 2024
提出开放的前沿级多模态大语言模型 NVLM。
PaliGemma: A versatile 3B VLM for transfer
Lucas Beyer, Andreas Steiner 等 · 2024
提出面向迁移的紧凑多功能视觉语言模型 PaliGemma。
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
Peng Wang, Shu Bai 等 · 2024
提出支持动态分辨率感知的 Qwen2-VL 视觉语言模型。
SAM 2: Segment Anything in Images and Videos
Nikhila Ravi, Valentin Gabeur 等 · 2024
将可提示分割扩展到图像与视频的统一模型 SAM 2。
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
Junnan Li, Dongxu Li 等 · 2023 · ICML 2023
用可学习查询桥接冻结视觉编码器与大语言模型。
DINOv2: Learning Robust Visual Features without Supervision
Maxime Oquab, Timothee Darcet 等 · 2023
提出无需监督即可学习稳健视觉特征的 DINOv2。
Segment Anything
Alexander Kirillov, Eric Mintun 等 · 2023
提出可提示的通用图像分割模型 SAM 与大规模分割数据。
Sigmoid Loss for Language Image Pre-Training
Xiaohua Zhai, Basil Mustafa 等 · 2023 · ICCV 2023
提出 SigLIP,用 sigmoid 损失改进图文对比预训练。
Visual Instruction Tuning
Haotian Liu, Chunyuan Li 等 · 2023 · NeurIPS 2023
提出 LLaVA,用视觉指令微调连接视觉编码器与语言模型。
Flamingo: a Visual Language Model for Few-Shot Learning
Jean-Baptiste Alayrac, Jeff Donahue 等 · 2022 · NeurIPS 2022
提出可少样本适配的视觉语言模型 Flamingo。
Learning Transferable Visual Models From Natural Language Supervision
Alec Radford, Jong Wook Kim 等 · 2021
提出 CLIP,用图文对比学习获得可迁移的视觉表示。
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Alexey Dosovitskiy, Lucas Beyer 等 · 2020 · ICLR 2021
提出 Vision Transformer,将图像切分为序列并用 Transformer 做识别。
Deep Residual Learning for Image Recognition
Kaiming He, Xiangyu Zhang 等 · 2015 · CVPR 2016
提出残差学习,使极深卷积网络可有效训练。