Examples and guides for using the Gemini API
欢迎使用 Gemini API 开发指南
本指南为使用 Gemini API 提供了结构化的学习路径,重点关注实践教程和实用示例。
如需全面的 API 文档,请访问 ai.google.dev。
如需 Gemma 快速入门和示例,请查看 Gemma 开发指南。
Gemini 3.7 Flash:在复杂的智能体和多模态任务上表现更出色,同时减少 token 用量。通过 快速入门
和 思考过程
指南开始使用。
Omni Flash:视频编辑领域的“迷你香蕉”来了!了解如何使用交互 API 调用模型、用自然语言编辑视频等更多功能,请点击这里
!
🍌 Nano-Banana 2:快来体验我们最新的图像生成模型 Nano-Banana 2!通过这里
开始使用,支持 512px 分辨率、思考过程、搜索和图像定位,还有大量示例!
🎶 Lyria 3:借助 Lyria 3 释放您内心的作曲家潜能。通过这里
开始使用,支持 30 秒片段和完整歌曲生成、图像转音乐,以及大量示例!
Agents API:使用全新的 Antigravity 智能体
创建和运行您的自定义智能体!
浏览 Cookbook
本 Cookbook 分为两大主要类别:
我们还在单独的代码库中展示 演示,说明 Gemini API 的端到端应用。
新增内容?
以下是 Gemini API 和 Cookbook 的最新新增内容和更新:
- Gemini 3.7 Flash:在复杂的智能体和多模态任务上性能更强,同时减少了 token 用量,价格低于 3.5 Flash。在入门 Cookbook
中了解如何使用该模型构建应用。 - Gemini 3.5 Flash-Lite:3.5 系列中速度最快、成本最低的模型。在高吞吐量执行方面优于之前的 Flash-Lite 版本。在入门 Cookbook
中了解更多信息。 - Omni Flash:通过 Omni Flash 指南,开始使用 Gemini Omni Flash 和 Interactions API 进行对话式视频生成和编辑!

- Agents API:在受控环境中使用 Antigravity 智能体
创建和运行智能体。 - Webhooks:通过 Webhooks 快速入门
,获取批量作业和视频生成等异步操作的实时通知。 - 推理层级:在 推理层级指南
中了解如何使用 Priority 和 Flex 层级,帮助您平衡速度、成本和可靠性。 - 🎶 Lyria 3:将您的想法转化为歌曲
,并完全控制音乐结构等! - 🍌 Nano-Banana 2 & Pro:使用 Gemini 的原生图像生成
功能编辑具有高一致性的图像或生成视觉故事。体验 Nano-Banana 2 的高速或 Nano-Banana Pro 的 4K 质量——两者现在都支持思考和搜索 grounding! - 文件搜索:通过 文件搜索快速入门
,了解如何在托管的 RAG 系统中基于您自己的数据进行生成。 - Google 地图 Grounding:开始在您的应用中使用来自 📍 Google 地图的事实地理数据!请参阅 Grounding 指南
的 Google 地图部分。 - Gemini Robotics-ER 1.5:了解这款专为机器人应用的空间理解和推理而设计的新型 Gemini 模型。

- Lyria 和 TTS:通过 TTS
和 Lyria RealTime
模型开始播客和音乐生成。 - 实时 API 和实时翻译:通过 多模态实时 API
开始低延迟语音/视频流,或通过 实时翻译 API
实时翻译音频流。 - 最近新增的指南:
- Grounding
:探索使用不同工具(从 Google 搜索到 Youtube、URL 以及新的 地图 grounding 工具)来锚定 Gemini 答案的不同方法。 - 批量 API
:使用批量 API 向模型发送大量非时间敏感请求,可享受高达 90% 的折扣。
- Grounding
1. 快速入门
快速入门部分包含循序渐进的教程,帮助您开始使用 Gemini 并了解其特定功能。
开始前,您需要:
- 一个 Google 账号。
- 一个 API 密钥(在 Google AI Studio 中创建)。
我们建议从以下内容开始:
然后,探索其他快速入门教程以了解各个功能:
- Live API 入门
:通过对其功能的全面概述开始使用实时 API - 实时翻译入门
:使用实时翻译 API 实时翻译音频流 - Omni Flash 入门
:开始使用 Interactions API 进行对话式视频生成和编辑 - Veo 入门
:开始使用我们的视频生成功能 - Imagen 入门
和 原生图像生成
:开始使用我们的图像生成功能 - grounding
:使用 Google 搜索获取基于事实的响应 - 代码执行
:生成并运行 Python 代码以解决复杂任务,甚至输出图表 - 以及更多内容
2. 示例(实际用例)
这些示例展示了如何结合 Gemini API 的多项功能或第三方工具来构建更复杂的应用。
- 将浏览器作为工具
:使用 Web 浏览器进行实时和内部(内联网)网络交互 - 书籍插图绘制
:使用 Gemini 为开源书籍创作插图 - 动画故事生成
:结合 Gemini 的故事生成、Imagen 和音频合成功能创建动画视频 - 实时绘图与地图绘制
:混合使用 实时 API 和 代码执行 功能来实时解决复杂任务 - 3D 空间理解
:利用 Gemini 的 3D 空间 能力来理解 3D 场景 - 成本估算与健康监控
:为 Gemini API 应用构建可观测性层,以估算美元成本并监控健康状况 - Gradio 与实时 API:使用 Gradio 部署您自己的 实时 API 实例
- 以及 更多示例
3. 演示(端到端应用程序)
这些功能齐全的端到端应用程序展示了 Gemini 在实际场景中的强大能力。
- Gemini CLI:开源 AI 代理,可将 Gemini 的强大功能直接引入您的终端
- Gemini API 快速入门:使用 Google AI Gemini API 运行的 Python Flask 应用程序,旨在帮助您开始构建具有 Gemini 多模态功能的应用
- 多模态实时 API Web 控制台:基于 React 的入门应用程序,用于通过 websocket 使用多模态实时 API
- 全栈 Langgraph 快速入门:一个全栈应用程序,使用 React 前端和由 LangGraph 驱动的后端代理
- Google AI Studio 入门小应用:一系列小型应用程序,展示如何使用 Gemini 创建交互式体验
官方 SDK
Gemini API 是一个 REST API。您可以使用 curl 等工具直接调用它(参见 REST 示例 或出色的 Postman 工作区),或者使用我们的官方 SDK 之一:
获取帮助
在 Google AI 开发者论坛 上提问。
Google Cloud Vertex AI 上的 Gemini API
对于企业开发者,Gemini API 也可在 Google Cloud Vertex AI 上使用。有关示例,请参见 此仓库。
贡献
欢迎贡献!详情请参见 CONTRIBUTING.md。
感谢您使用 Gemini API 进行开发!我们很期待看到您的创造。