TodayAI

AI 多模态模型

多模态模型除文本外,还可以处理图像、音频或视频等一种或多种输入形式,具体能力取决于模型本身。

它不是图像生成,也不是只做视觉问答的专用模型。先确认输入模态和延迟要求,再在旗舰与 Flash 规格之间选。

适合解决什么

  • 读截图、表格和文档图片并转成文字材料
  • 在对话里混合文本与图像提问
  • 为代理工作流提供多模态观察
  • 用开放权重多模态模型做本地演示

精选模型

全部模型