AI 多模态模型
多模态模型除文本外,还可以处理图像、音频或视频等一种或多种输入形式,具体能力取决于模型本身。
它不是图像生成,也不是只做视觉问答的专用模型。先确认输入模态和延迟要求,再在旗舰与 Flash 规格之间选。
适合解决什么
- 读截图、表格和文档图片并转成文字材料
- 在对话里混合文本与图像提问
- 为代理工作流提供多模态观察
- 用开放权重多模态模型做本地演示
精选模型
相关指南
相关工具
相关 Agent 资源
全部模型
Amazon Nova Pro
Amazon
Amazon Nova Pro 多模态模型,覆盖文本与图像任务。
multimodaltool-use
多模态专有
Gemini 2.5 Flash
兼顾推理能力与延迟的 Gemini 2.5 Flash 模型。
multimodalreasoningtool-use
多模态专有1M
Gemini 3.5 Flash
Google 当前主力高速多模态模型,面向通用与代理式任务。
multimodalreasoningtool-uselong-context
多模态专有
Gemma 3
Google Gemma 3 开放权重模型,面向通用与多模态研究部署。
open-weightmultimodal
多模态开放权重
GPT-4o
OpenAI
兼顾速度与多模态能力的通用 GPT 模型。
multimodalvisiontool-use
多模态专有
Phi-4-multimodal-instruct
Microsoft
微软 Phi-4 多模态指令模型,支持图像与音频理解。
multimodalopen-weightvision
多模态开放权重