用 Gemini 生成第一张图像
按 Gemini Image generation 文档,从文本提示生成图像并保存。
基于 Gemini API 整理 · Image Generation · 官方资料
Gemini 图像生成走官方支持的图像模型与响应模态。
这篇完成:提交提示词,从响应中取出图像字节并写入文件。
提交提示并保存图片
Gemini image generation
python
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-2.5-flash-image",
contents="一张安静的书房,桌上有一杯咖啡和打开的笔记本",
config=types.GenerateContentConfig(response_modalities=["TEXT", "IMAGE"]),
)
for part in response.candidates[0].content.parts:
if getattr(part, "inline_data", None):
with open("study.png", "wb") as f:
f.write(part.inline_data.data)
print("saved study.png")具体模型 ID 与 response_modalities 以当前官方文档为准;上线前对照页面更新。
最容易踩的坑
响应只有文字没有图
确认使用支持图像输出的模型,并正确设置 response_modalities。
官方资料
Gemini APIImage generation相关 AI 模型
相关 TodayAI 指南
- 用 Structured Outputs 拿到可解析的模型结果用 json_schema + strict 约束 Chat Completions 输出,让结果可以直接解析进入应用逻辑。
- 用 Gemini Embeddings 做文本向量化按 Gemini API Embeddings 文档:用 embedContent 生成向量,配置 task 前缀或 task_type,并用 output_dimensionality 控制维度。
- 用 Gemini Structured Outputs 约束 JSON 结果按官方 Structured outputs:用 JSON Schema / Pydantic 约束 Gemini 的最终回答格式,提取菜谱等结构化数据并可直接校验。