TodayAI

OpenAI · GPT-4o 系列

GPT-4o

OpenAI 的多模态通用模型,可同时处理文本、图像,并在部分接口中覆盖音频,适合作为常见生产负载的基线模型。

查看 API 文档

访问方式:Hosted API

它是什么

GPT-4o 由 OpenAI 发布,是 GPT-4 代中强调“omni”输入的通用模型。它覆盖文本和图像,并在官方模型页中列出音频相关能力,适合对话、内容整理和需要看图说明的任务。

相对更新的 GPT-5.6 旗舰和 o 系列推理模型,GPT-4o 更常被当作已经广泛接入产品的多模态基线,而不是最新推理上限。

具体音频输入/输出是否在当前 API 路径可用,必须以官方模型文档为准,不能把 ChatGPT 产品包装能力直接写成模型原生能力。

核心能力

多模态理解

可以同时处理文本和图像,适合截图说明、界面问答和图表解读。

通用对话与写作

适合日常问答、草稿和结构化整理,作为许多应用的默认文本模型。

工具调用

可接入函数调用工作流,把模型输出接到外部 API 或检索。

适合什么任务

  • 图文混合的问答和说明
  • 通用对话、改写与摘要
  • 需要稳定接入现有 OpenAI API 的应用
  • 作为更新旗舰模型的对照基线

API 与技术信息

API
Hosted API
Model ID
gpt-4o
输入
Text · Image · Audio
输出
Text

使用时要注意

  • 产品界面能上传的文件,不等于模型原生支持该文件格式。
  • 音频能力以当前官方 API 路径为准,不要默认所有端点都相同。
  • 推理强度通常低于 o 系列和更新的 GPT-5.6 旗舰规格。
  • 输出仍需核验,尤其是数字、引用和代码。

官方资料