TodayAI

Alibaba · Qwen2.5 系列 · 视觉理解

Qwen2.5-VL

Qwen2.5 家族中的视觉语言模型,开放权重,适合图像理解、截图问答和需要看图的自托管任务。

查看 Model Card

访问方式:Open weights

它是什么

Qwen2.5-VL 由 Qwen 团队发布,官方模型卡在 Qwen 组织。它接受文本和图像,是视觉理解模型,而不是图像生成模型。

相对 Llama 3.2 Vision 和 GPT-4o,它提供一条可自托管的开源权重视觉路径。通用文本任务仍应优先考虑 Qwen3 等文本规格。

视觉结果对分辨率和裁切敏感,关键识别需要人工复核。

核心能力

图像理解

适合截图、文档页图像和界面说明类问答。

视觉问答

把图像和文本问题一起输入,输出文本回答。

开放权重

官方 Hugging Face 模型卡提供权重来源。

适合什么任务

  • 自托管视觉问答
  • 界面截图和图表说明
  • 与 Llama 3.2 Vision、Gemini Flash 对照
  • 需要看图但不走托管多模态 API 的任务

API 与技术信息

API
开放权重
输入
Text · Image
输出
Text
权重
开放权重

使用时要注意

  • 官方卡指向 Qwen2.5-VL-72B-Instruct 等具体仓库。
  • 它不生成图像,也不等于原生 PDF 版式解析。
  • 硬件需求高于纯文本 7B/14B 规格。
  • 许可以官方模型卡为准。

官方资料