Gemini 3.5 Flash:完整规格、定价、API访问与应用场景(2026)
什么是 Gemini 3.5 Flash?
Gemini 3.5 Flash 是 Google 于2026年5月19日发布的多模态、具备代理能力的大型语言模型,支持1048576个输入令牌窗口,并可接受文本、图片、视频、音频及PDF输入,输出为文本。标准 Gemini API 的定价为每100万输入令牌1.50美元、每100万输出令牌9.00美元(截至2026年7月)。Google 官方宣布 Gemini 3.5 Flash 是 Gemini 3.5系列的首发版本,专为复杂的代理工作流、编程及长期任务设计。
Google 将 Gemini 3.5 Flash 定位为适用于生产环境的 Flash级模型,适合需要能力、延迟与成本平衡的团队。该模型可通过 Google AI Studio、Gemini API、Android Studio、Google Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise、Gemini 应用及搜索中的 AI 模式访问。
开发者通常会评估 Gemini 3.5 Flash 在编程代理、重构助手、多模态文档处理、支持自动化及长上下文推理工作流中的表现。迁移自早期 Flash 模型的团队,可能会在采用新版本前,参考历史的 Gemini 1.5 Flash 规格 和 Gemini 2.0 Flash 多模态工作流。
Gemini 3.5 Flash 的主要规格与定价是什么?
| 字段 | 已验证数值 |
|---|---|
| 提供商 | Google / Google DeepMind(截至2026年7月) |
| 模型系列 | Gemini 3.5(截至2026年7月) |
| 模型类型 | 多模态大型语言模型,适用于代理工作流、编程、长上下文分析及实时聊天(截至2026年7月) |
| 发布日期 | 2026年5月19日(截至2026年7月) |
| 上下文窗口 | 1048576个输入令牌(截至2026年7月) |
| 最大输出令牌 | Google AI for Developers 文档中为65536个输出令牌;Google Cloud Agent Platform 默认最大输出令牌为65535(截至2026年7月) |
| 输入定价 | 标准 Gemini API:每100万输入令牌1.50美元;批量/Flex:0.75美元;优先:2.70美元(截至2026年7月) |
| 输出定价 | 标准 Gemini API:每100万输出令牌9.00美元(包含思考令牌);批量/Flex:4.50美元;优先:16.20美元(截至2026年7月) |
| 上下文缓存定价 | Google 标准上下文缓存:每100万令牌0.15美元,另加每小时每100万令牌1.00美元存储费;批量/Flex缓存:每100万令牌0.08美元(截至2026年7月) |
| Gate.AI 定价 | 输入1.50美元/100万,输出9.00美元/100万,缓存读取0.15美元/100万,缓存写入0.08美元/100万;Gate.AI 定价页面说明模型价格与提供商单位价格同步(截至2026年7月) |
| 定价单位 | 除非另有说明,均为每100万令牌美元(截至2026年7月) |
| 模态支持 | 支持文本、图片、视频、音频及PDF输入;输出为文本(截至2026年7月) |
| API 访问 | Google AI Studio / Gemini API;Google Cloud Gemini Enterprise Agent Platform;Gate.AI 使用模型ID google/gemini-3.5-flash 时采用 OpenAI 兼容API格式(截至2026年7月) |
| 提供商模型ID | gemini-3.5-flash(截至2026年7月) |
| Gate.AI模型ID | google/gemini-3.5-flash,由用户提供;Gate.AI文档验证了 provider/model-name 的模型ID模式(截至2026年7月) |
| 可用性 | Google 官方公告列明可通过 Gemini API、Google AI Studio、Android Studio、Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise、Gemini 应用及搜索中的 AI 模式访问(截至2026年7月) |
| 知识截止日期 | Google AI for Developers 文档中为2025年1月(截至2026年7月) |
| 速率限制 | 截至2026年7月,官方资料未确认单一固定的模型专属公开速率限制表 |
| 微调支持 | Google Cloud 发布说明列明 Gemini 3.5 Flash 在公测阶段支持有监督微调及强化学习微调,存在地区限制(截至2026年7月) |
| 流式支持 | Gemini API 支持流式生成;Gate.AI 定价FAQ说明流式与非流式均采用令牌计费(截至2026年7月) |
| 批量API支持 | 支持(截至2026年7月) |
| Flex / 优先推理 | 支持(截至2026年7月) |
| 工具/函数调用 | 支持函数调用、代码执行、文件搜索、Google Maps 定位、搜索定位、URL上下文、结构化输出、思考及缓存;仅在预览阶段支持 Computer Use(截至2026年7月) |
| 原生音频生成 | 不支持(截至2026年7月) |
| 原生图片生成 | 不支持(截至2026年7月) |
| 实时API | 不支持(截至2026年7月) |
| 许可/使用限制 | Google 专有模型,受相关 Google API、Google Cloud 及平台条款约束;官方资料未说明独立开放权重许可(截至2026年7月) |
Gemini 3.5 Flash 在生产环境有哪些实用功能?
代理工作流执行。 Gemini 3.5 Flash 专为子代理部署、多步骤工作流及长期任务设计,适用于任务自动化、内部助手、开发者代理及运营工作流,模型可在多步骤中规划、调用工具并修订输出。生产系统仍需采用沙箱、权限控制、可观测性及回退处理。
编程与重构支持。 Google 将 Gemini 3.5 Flash 描述为适用于复杂编程循环与迭代的模型,官方页面列明支持代码执行与函数调用。适用于代码审查、测试生成、重构、调试及开发助手工作流。生成代码仍需测试、安全审查及人工工程监管。
长上下文多模态分析。 1048576令牌输入上限及对文本、图片、视频、音频、PDF的支持,使 Gemini 3.5 Flash 能处理大型文档、转录、截图、产品手册、研究包及混合格式知识库。长上下文提升请求可包含的信息量,但不保证完美回溯或完美提取。
结构化提取与工具型助手。 Gemini 3.5 Flash 支持结构化输出、文件搜索、函数调用、URL上下文、搜索定位、Google Maps 定位及缓存。这些能力适用于工作流自动化、客户支持分流、文档提取、内部搜索助手及数据增强管道。对比轻量模型时,团队也可参考 GPT-4o mini 定价与用例 或 OpenAI o4-mini 用于推理型生产任务。
预览阶段的 Computer Use 工作流。 Google 当前模型页面显示 Computer Use 为“支持(预览)”,官方公告称 Computer Use 已集成至 Gemini 3.5 Flash 内置工具。由于仍处于预览阶段,团队应将其视为评估功能,除非部署路径及条款支持该用法,否则不应作为稳定生产依赖。
Gemini 3.5 Flash 支持哪些模态?
| 模态 | 是否支持 | 说明 |
|---|---|---|
| 文本输入 | 是 | 标准提示、聊天、代码文本输入 |
| 图片输入 | 是 | 支持图片理解输入 |
| 视频输入 | 是 | 支持视频输入 |
| 音频输入 | 是 | 支持音频输入 |
| PDF输入 | 是 | 官方列明支持PDF输入 |
| 文本输出 | 是 | 主要输出类型 |
| 原生图片输出 | 否 | 该模型不支持图片生成 |
| 原生音频输出 | 否 | 该模型不支持音频生成 |
| 原生视频输出 | 未确认 | 官方未说明为原生视频生成模型 |
| 实时API | 否 | Google 模型文档列明不支持实时API |
Gemini 3.5 Flash 有哪些不足?
Gemini 3.5 Flash 并非原生图片、音频或视频生成模型。可处理多模态输入,但输出类型为文本,需要生成媒体内容的团队应选用专门的图片、语音或视频模型。
模型知识截止于2025年1月,意味着若请求未包含更新上下文或未使用定位与检索功能,模型可能无法了解后续事件。这对于法律、医疗、金融、安全、合规及政策相关任务尤为重要,输出需由专业人士审核。
Computer Use 不应被视为完全稳定的默认功能。Google 文档将其列为“支持(预览)”,生产使用需结合预览条款、可靠性要求、监控需求及安全浏览器或桌面自动化控制进行评估。
这是通用AI的局限,除非 Google 明确说明,否则并非模型特有:Gemini 3.5 Flash 可能出现幻觉、在长提示中遗漏细节、生成看似合理但错误的代码、工具结果处理失误或对不明确指令过拟合。大上下文窗口减少输入约束,但仍需评估输出质量。
长周期工作流成本也可能上升。输出定价包含思考令牌,多模态提示、重复工具调用及代理循环会增加总用量。团队应测试请求大小,合理使用缓存,并监控每个工作流的成本,而非单次提示成本。
Gemini 3.5 Flash 最适合哪些场景?
| 用例 | 适用理由 | 重要限制 |
|---|---|---|
| 代码重构代理 | 支持编程工作流、代码执行、函数调用及大上下文输入 | 生成代码需测试、安全审查及人工批准 |
| 日常开发者助手 | 适用于调试、解释、仓库分析及测试生成 | 不能替代工程师判断 |
| 多模态文档分析 | 接受文本、图片、视频、音频及PDF,输入窗口达100万令牌 | 输出仅为文本,提取准确性需验证 |
| 代理任务自动化 | 专为多步骤工作流及子代理部署设计 | 需工具权限、沙箱、审计日志及回退处理 |
| 生产聊天与支持工作流 | 支持结构化输出、定位、URL上下文及文件搜索 | 知识质量依赖检索源及提示设计 |
| 成本敏感的长上下文工作负载 | Flash级定价适合高频工作流,优于Pro级模型 | 长提示及代理循环仍可能成本高 |
Gemini 3.5 Flash 与 Gemini 3.1 Pro Preview、Gemini 3.1 Flash-Lite 有何对比?
| 对比项 | Gemini 3.5 Flash | Gemini 3.1 Pro Preview | Gemini 3.1 Flash-Lite | 场景适配 |
|---|---|---|---|---|
| 提供商 | 同一生态体系 | |||
| 定位 | Flash级多模态模型,适用于代理、编程及长上下文工作流 | Pro级预览模型,适合复杂问题解决及高能力任务 | 低延迟、成本高效,适合高频轻量任务 | 根据任务复杂度选择模型等级 |
| 输入上下文 | 1048576令牌 | 官方定价/模型参考均为1048576令牌 | 官方模型参考均为1048576令牌 | 输入容量相近,成本与能力配置不同 |
| 输出类型 | 文本 | 文本 | 文本 | 核心输出类型一致 |
| 标准输入定价 | 每100万输入令牌1.50美元 | 200K令牌内每100万2.00美元;超200K每100万4.00美元 | 文本/图片/视频每100万输入令牌0.25美元;音频每100万0.50美元 | Flash成本介于Pro Preview与Flash-Lite之间 |
| 标准输出定价 | 每100万输出令牌9.00美元 | 200K内每100万12.00美元;超200K每100万18.00美元 | 每100万输出令牌1.50美元 | Flash-Lite适合高频简单任务,Pro Preview适合复杂工作流 |
| 工具与能力 | 支持函数调用、代码执行、文件搜索、搜索定位、地图定位、URL上下文、结构化输出、思考、缓存及预览阶段 Computer Use | Google 生态工具类似,具体依模型及端点而定 | 轻量模型工具类似,具体依端点而定 | 根据工具需求、可靠性及成本选择 |
此对比并非选出优劣。Gemini 3.5 Flash 更适用于需要代理能力、编程支持、多模态输入、长上下文及 Flash级定价的团队。跨厂商对比时,团队也可参考 Claude Sonnet 5 规格(Anthropic 工作流)或 OpenAI o3(推理型任务)。
如何通过 Gate.AI 访问 Gemini 3.5 Flash?
Gate.AI 对 Gemini 3.5 Flash 的访问基于模型ID google/gemini-3.5-flash。Gate.AI 静态模型页在验证时未直接爬取到 Gemini 3.5 Flash 条目,因此本文将模型专属 Gate.AI ID 和专属定价视为目录数据。另,Gate.AI 文档验证了 OpenAI 兼容基础URL https://api.gate.ai/openai/v1、API密钥认证及 provider/model-name 的模型ID模式。
Gate.AI 定价页面说明支持按需计费、API密钥管理、智能路由、提示缓存、用量洞察、组织权限及与模型提供商单位价格同步的令牌定价。流式与非流式均采用令牌计费。
Python 示例
from openai import OpenAIimport osclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)response = client.chat.completions.create(model="google/gemini-3.5-flash",messages=[{"role": "user","content": "Summarize Gemini 3.5 Flash's production trade-offs in one paragraph."}],)print(response.choices[0].message.content)
curl 示例
curl https://api.gate.ai/openai/v1/chat/completions \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "google/gemini-3.5-flash","messages": [{"role": "user","content": "Summarize Gemini 3.5 Flash'\''s production trade-offs in one paragraph."}]}'
开发者也可通过 Google AI Studio 和 Gemini API,使用 Google 提供商模型ID gemini-3.5-flash 访问该模型。Google 模型页面还指出 Interactions API 已全面开放,推荐用于访问最新 Gemini 功能及模型。
常见问题
Gemini 3.5 Flash 的上下文窗口是多少?
Gemini 3.5 Flash 支持1048576令牌输入上限,输出上限为65536令牌(Google AI for Developers 文档,截至2026年7月)。
Gemini 3.5 Flash 的费用是多少?
标准 Gemini API 定价为每100万输入令牌1.50美元、每100万输出令牌9.00美元。批量/Flex定价更低,优先定价更高(截至2026年7月)。
可以通过 Gate.AI 访问 Gemini 3.5 Flash 吗?
可以,使用 Gate.AI 模型ID google/gemini-3.5-flash。Gate.AI 的API格式和基础URL已验证,但模型专属目录条目在验证时未直接爬取到。
Gemini 3.5 Flash 支持 Computer Use 吗?
支持,但仅为 Google 当前模型文档中的预览功能。除非部署路径支持预览特性用于生产,否则建议将 Computer Use 视为评估功能。


