TodayAI

Meta · Llama 3.2 系列 · 视觉理解

Llama 3.2 90B Vision Instruct

Meta Llama 3.2 的视觉指令模型,面向图像理解和视觉问答,适合需要看图的自托管任务。

查看 Model Card

访问方式:Open weights

它是什么

Llama 3.2 90B Vision Instruct 由 Meta 发布,官方模型卡在 meta-llama 组织。它是 Llama 3.2 中明确带视觉能力的指令模型,而不是纯文本的 3.3 70B。

相对 Llama 4 Maverick,它属于上一主世代的视觉规格,仍然是很多现有部署的基线。新项目应同时评估 Llama 4 是否已覆盖所需视觉路径。

视觉模型会受图像分辨率、裁切和提示方式影响。关键识别结果需要人工确认。

核心能力

图像理解

接受文本和图像输入,适合视觉问答和截图说明。

开放权重

官方 Hugging Face 模型卡提供权重和许可信息。

指令微调

Instruct 变体面向对话式视觉任务,而不是预训练基座本身。

适合什么任务

  • 自托管视觉问答
  • 截图、图表和界面说明
  • 与 Qwen2.5-VL、GPT-4o 对照视觉任务
  • 仍在 Llama 3.2 栈上的现有部署

API 与技术信息

API
开放权重
输入
Text · Image
输出
Text
权重
开放权重
License
Llama Community License

使用时要注意

  • 许可为 Llama Community License。
  • 90B 视觉规格对硬件要求高,部署前看官方模型卡。
  • 不要把任意 PDF 或视频当成原生模态。
  • Llama 4 发布后,应重新评估是否继续以 3.2 Vision 为默认。

官方资料