资源库
多模态 AI Models
可同时处理文本、图像等输入模态的通用多模态模型。
Amazon Nova Pro
Amazon
Amazon Nova Pro 多模态模型,覆盖文本与图像任务。
multimodaltool-use
多模态专有
Gemini 2.5 Flash
兼顾推理能力与延迟的 Gemini 2.5 Flash 模型。
multimodalreasoningtool-use
多模态专有1M
Gemini 3.5 Flash
Google 当前主力高速多模态模型,面向通用与代理式任务。
multimodalreasoningtool-uselong-context
多模态专有
Gemma 3
Google Gemma 3 开放权重模型,面向通用与多模态研究部署。
open-weightmultimodal
多模态开放权重
GPT-4o
OpenAI
兼顾速度与多模态能力的通用 GPT 模型。
multimodalvisiontool-use
多模态专有
Phi-4-multimodal-instruct
Microsoft
微软 Phi-4 多模态指令模型,支持图像与音频理解。
multimodalopen-weightvision
多模态开放权重