TodayAI

资源库

多模态与视觉 Papers

面向视觉、视觉语言与多模态理解的研究论文。

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Xiaokang Chen, Zhiyu Wu 等 · 2025

提出统一多模态理解与生成的 Janus-Pro,并研究数据与模型扩展。

janusmultimodalgeneration
多模态与视觉arXiv

Qwen2.5-VL Technical Report

Qwen Team · 2025

介绍 Qwen2.5-VL 在视觉理解与代理能力上的技术进展。

qwen2-5-vlvision-languagemultimodal
多模态与视觉arXiv

Aria: An Open Multimodal Native Mixture-of-Experts Model

Dongxu Li, Yudong Liu 等 · 2024

提出原生多模态混合专家开放模型 Aria。

ariamoemultimodal
多模态与视觉arXiv

Chameleon: Mixed-Modal Early-Fusion Foundation Models

Chameleon Team · 2024

提出早期融合的混合模态基础模型,统一处理图像与文本。

chameleonearly-fusionmultimodal
多模态与视觉arXiv

DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Zhiyu Wu, Xiaokang Chen 等 · 2024

提出基于 MoE 的 DeepSeek-VL2 多模态理解模型。

deepseekmoevision-language
多模态与视觉arXiv

LLaVA-OneVision: Easy Visual Task Transfer

Bo Li, Yuanhan Zhang 等 · 2024

提出面向单图、多图与视频任务迁移的 LLaVA-OneVision。

llavavision-languagetransfer
多模态与视觉arXiv

Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Matt Deitke, Christopher Clark 等 · 2024

发布开放权重与开放数据的高性能视觉语言模型 Molmo。

molmoopen-datavision-language
多模态与视觉arXiv

NVLM: Open Frontier-Class Multimodal LLMs

Wenliang Dai, Nayeon Lee 等 · 2024

提出开放的前沿级多模态大语言模型 NVLM。

nvlmmultimodalopen-model
多模态与视觉arXiv

PaliGemma: A versatile 3B VLM for transfer

Lucas Beyer, Andreas Steiner 等 · 2024

提出面向迁移的紧凑多功能视觉语言模型 PaliGemma。

paligemmavlmtransfer
多模态与视觉arXiv

Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Peng Wang, Shu Bai 等 · 2024

提出支持动态分辨率感知的 Qwen2-VL 视觉语言模型。

qwen2-vlvision-languageresolution
多模态与视觉arXiv

SAM 2: Segment Anything in Images and Videos

Nikhila Ravi, Valentin Gabeur 等 · 2024

将可提示分割扩展到图像与视频的统一模型 SAM 2。

sam2segmentationvideo
多模态与视觉arXiv

BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

Junnan Li, Dongxu Li 等 · 2023 · ICML 2023

用可学习查询桥接冻结视觉编码器与大语言模型。

blip-2vision-languageefficient
多模态与视觉arXiv

DINOv2: Learning Robust Visual Features without Supervision

Maxime Oquab, Timothee Darcet 等 · 2023

提出无需监督即可学习稳健视觉特征的 DINOv2。

dinoself-supervisedvision
多模态与视觉arXiv

Segment Anything

Alexander Kirillov, Eric Mintun 等 · 2023

提出可提示的通用图像分割模型 SAM 与大规模分割数据。

samsegmentationfoundation-model
多模态与视觉arXiv

Sigmoid Loss for Language Image Pre-Training

Xiaohua Zhai, Basil Mustafa 等 · 2023 · ICCV 2023

提出 SigLIP,用 sigmoid 损失改进图文对比预训练。

siglipcontrastivevision-language
多模态与视觉arXiv

Visual Instruction Tuning

Haotian Liu, Chunyuan Li 等 · 2023 · NeurIPS 2023

提出 LLaVA,用视觉指令微调连接视觉编码器与语言模型。

llavainstruction-tuningvision-language
多模态与视觉arXiv

Flamingo: a Visual Language Model for Few-Shot Learning

Jean-Baptiste Alayrac, Jeff Donahue 等 · 2022 · NeurIPS 2022

提出可少样本适配的视觉语言模型 Flamingo。

flamingofew-shotvision-language
多模态与视觉arXiv

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford, Jong Wook Kim 等 · 2021

提出 CLIP,用图文对比学习获得可迁移的视觉表示。

clipcontrastivevision-language
多模态与视觉arXiv

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Alexey Dosovitskiy, Lucas Beyer 等 · 2020 · ICLR 2021

提出 Vision Transformer,将图像切分为序列并用 Transformer 做识别。

vitvisiontransformer
多模态与视觉arXiv

Deep Residual Learning for Image Recognition

Kaiming He, Xiangyu Zhang 等 · 2015 · CVPR 2016

提出残差学习,使极深卷积网络可有效训练。

resnetcnnvision
多模态与视觉arXiv