OpenAI · GPT-4o 系列
GPT-4o
OpenAI 的多模态通用模型,可同时处理文本、图像,并在部分接口中覆盖音频,适合作为常见生产负载的基线模型。
查看 API 文档
访问方式:Hosted API
它是什么
GPT-4o 由 OpenAI 发布,是 GPT-4 代中强调“omni”输入的通用模型。它覆盖文本和图像,并在官方模型页中列出音频相关能力,适合对话、内容整理和需要看图说明的任务。
相对更新的 GPT-5.6 旗舰和 o 系列推理模型,GPT-4o 更常被当作已经广泛接入产品的多模态基线,而不是最新推理上限。
具体音频输入/输出是否在当前 API 路径可用,必须以官方模型文档为准,不能把 ChatGPT 产品包装能力直接写成模型原生能力。
核心能力
多模态理解
可以同时处理文本和图像,适合截图说明、界面问答和图表解读。
通用对话与写作
适合日常问答、草稿和结构化整理,作为许多应用的默认文本模型。
工具调用
可接入函数调用工作流,把模型输出接到外部 API 或检索。
适合什么任务
- 图文混合的问答和说明
- 通用对话、改写与摘要
- 需要稳定接入现有 OpenAI API 的应用
- 作为更新旗舰模型的对照基线
API 与技术信息
- API
- Hosted API
- Model ID
- gpt-4o
- 输入
- Text · Image · Audio
- 输出
- Text
使用时要注意
- 产品界面能上传的文件,不等于模型原生支持该文件格式。
- 音频能力以当前官方 API 路径为准,不要默认所有端点都相同。
- 推理强度通常低于 o 系列和更新的 GPT-5.6 旗舰规格。
- 输出仍需核验,尤其是数字、引用和代码。