Meta · Llama 3.2 系列 · 视觉理解
Llama 3.2 90B Vision Instruct
Meta Llama 3.2 的视觉指令模型,面向图像理解和视觉问答,适合需要看图的自托管任务。
查看 Model Card
访问方式:Open weights
它是什么
Llama 3.2 90B Vision Instruct 由 Meta 发布,官方模型卡在 meta-llama 组织。它是 Llama 3.2 中明确带视觉能力的指令模型,而不是纯文本的 3.3 70B。
相对 Llama 4 Maverick,它属于上一主世代的视觉规格,仍然是很多现有部署的基线。新项目应同时评估 Llama 4 是否已覆盖所需视觉路径。
视觉模型会受图像分辨率、裁切和提示方式影响。关键识别结果需要人工确认。
核心能力
图像理解
接受文本和图像输入,适合视觉问答和截图说明。
开放权重
官方 Hugging Face 模型卡提供权重和许可信息。
指令微调
Instruct 变体面向对话式视觉任务,而不是预训练基座本身。
适合什么任务
- 自托管视觉问答
- 截图、图表和界面说明
- 与 Qwen2.5-VL、GPT-4o 对照视觉任务
- 仍在 Llama 3.2 栈上的现有部署
API 与技术信息
- API
- 开放权重
- 输入
- Text · Image
- 输出
- Text
- 权重
- 开放权重
- License
- Llama Community License
使用时要注意
- 许可为 Llama Community License。
- 90B 视觉规格对硬件要求高,部署前看官方模型卡。
- 不要把任意 PDF 或视频当成原生模态。
- Llama 4 发布后,应重新评估是否继续以 3.2 Vision 为默认。