Gate.AI博客Gemini 3.5 Flash:完整规格、定价、API访问与应用场景(2026)

    Gemini 3.5 Flash:完整规格、定价、API访问与应用场景(2026)

    模型

    什么是 Gemini 3.5 Flash?

    Gemini 3.5 Flash 是 Google 于2026年5月19日发布的多模态、具备代理能力的大型语言模型,支持1048576个输入令牌窗口,并可接受文本、图片、视频、音频及PDF输入,输出为文本。标准 Gemini API 的定价为每100万输入令牌1.50美元、每100万输出令牌9.00美元(截至2026年7月)。Google 官方宣布 Gemini 3.5 Flash 是 Gemini 3.5系列的首发版本,专为复杂的代理工作流、编程及长期任务设计。

    Google 将 Gemini 3.5 Flash 定位为适用于生产环境的 Flash级模型,适合需要能力、延迟与成本平衡的团队。该模型可通过 Google AI Studio、Gemini API、Android Studio、Google Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise、Gemini 应用及搜索中的 AI 模式访问。

    开发者通常会评估 Gemini 3.5 Flash 在编程代理、重构助手、多模态文档处理、支持自动化及长上下文推理工作流中的表现。迁移自早期 Flash 模型的团队,可能会在采用新版本前,参考历史的 Gemini 1.5 Flash 规格Gemini 2.0 Flash 多模态工作流

    Gemini 3.5 Flash 的主要规格与定价是什么?

    字段 已验证数值
    提供商 Google / Google DeepMind(截至2026年7月)
    模型系列 Gemini 3.5(截至2026年7月)
    模型类型 多模态大型语言模型,适用于代理工作流、编程、长上下文分析及实时聊天(截至2026年7月)
    发布日期 2026年5月19日(截至2026年7月)
    上下文窗口 1048576个输入令牌(截至2026年7月)
    最大输出令牌 Google AI for Developers 文档中为65536个输出令牌;Google Cloud Agent Platform 默认最大输出令牌为65535(截至2026年7月)
    输入定价 标准 Gemini API:每100万输入令牌1.50美元;批量/Flex:0.75美元;优先:2.70美元(截至2026年7月)
    输出定价 标准 Gemini API:每100万输出令牌9.00美元(包含思考令牌);批量/Flex:4.50美元;优先:16.20美元(截至2026年7月)
    上下文缓存定价 Google 标准上下文缓存:每100万令牌0.15美元,另加每小时每100万令牌1.00美元存储费;批量/Flex缓存:每100万令牌0.08美元(截至2026年7月)
    Gate.AI 定价 输入1.50美元/100万,输出9.00美元/100万,缓存读取0.15美元/100万,缓存写入0.08美元/100万;Gate.AI 定价页面说明模型价格与提供商单位价格同步(截至2026年7月)
    定价单位 除非另有说明,均为每100万令牌美元(截至2026年7月)
    模态支持 支持文本、图片、视频、音频及PDF输入;输出为文本(截至2026年7月)
    API 访问 Google AI Studio / Gemini API;Google Cloud Gemini Enterprise Agent Platform;Gate.AI 使用模型ID google/gemini-3.5-flash 时采用 OpenAI 兼容API格式(截至2026年7月)
    提供商模型ID gemini-3.5-flash(截至2026年7月)
    Gate.AI模型ID google/gemini-3.5-flash,由用户提供;Gate.AI文档验证了 provider/model-name 的模型ID模式(截至2026年7月)
    可用性 Google 官方公告列明可通过 Gemini API、Google AI Studio、Android Studio、Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise、Gemini 应用及搜索中的 AI 模式访问(截至2026年7月)
    知识截止日期 Google AI for Developers 文档中为2025年1月(截至2026年7月)
    速率限制 截至2026年7月,官方资料未确认单一固定的模型专属公开速率限制表
    微调支持 Google Cloud 发布说明列明 Gemini 3.5 Flash 在公测阶段支持有监督微调及强化学习微调,存在地区限制(截至2026年7月)
    流式支持 Gemini API 支持流式生成;Gate.AI 定价FAQ说明流式与非流式均采用令牌计费(截至2026年7月)
    批量API支持 支持(截至2026年7月)
    Flex / 优先推理 支持(截至2026年7月)
    工具/函数调用 支持函数调用、代码执行、文件搜索、Google Maps 定位、搜索定位、URL上下文、结构化输出、思考及缓存;仅在预览阶段支持 Computer Use(截至2026年7月)
    原生音频生成 不支持(截至2026年7月)
    原生图片生成 不支持(截至2026年7月)
    实时API 不支持(截至2026年7月)
    许可/使用限制 Google 专有模型,受相关 Google API、Google Cloud 及平台条款约束;官方资料未说明独立开放权重许可(截至2026年7月)

    Gemini 3.5 Flash 在生产环境有哪些实用功能?

    代理工作流执行。 Gemini 3.5 Flash 专为子代理部署、多步骤工作流及长期任务设计,适用于任务自动化、内部助手、开发者代理及运营工作流,模型可在多步骤中规划、调用工具并修订输出。生产系统仍需采用沙箱、权限控制、可观测性及回退处理。

    编程与重构支持。 Google 将 Gemini 3.5 Flash 描述为适用于复杂编程循环与迭代的模型,官方页面列明支持代码执行与函数调用。适用于代码审查、测试生成、重构、调试及开发助手工作流。生成代码仍需测试、安全审查及人工工程监管。

    长上下文多模态分析。 1048576令牌输入上限及对文本、图片、视频、音频、PDF的支持,使 Gemini 3.5 Flash 能处理大型文档、转录、截图、产品手册、研究包及混合格式知识库。长上下文提升请求可包含的信息量,但不保证完美回溯或完美提取。

    结构化提取与工具型助手。 Gemini 3.5 Flash 支持结构化输出、文件搜索、函数调用、URL上下文、搜索定位、Google Maps 定位及缓存。这些能力适用于工作流自动化、客户支持分流、文档提取、内部搜索助手及数据增强管道。对比轻量模型时,团队也可参考 GPT-4o mini 定价与用例OpenAI o4-mini 用于推理型生产任务。

    预览阶段的 Computer Use 工作流。 Google 当前模型页面显示 Computer Use 为“支持(预览)”,官方公告称 Computer Use 已集成至 Gemini 3.5 Flash 内置工具。由于仍处于预览阶段,团队应将其视为评估功能,除非部署路径及条款支持该用法,否则不应作为稳定生产依赖。

    Gemini 3.5 Flash 支持哪些模态?

    模态 是否支持 说明
    文本输入 标准提示、聊天、代码文本输入
    图片输入 支持图片理解输入
    视频输入 支持视频输入
    音频输入 支持音频输入
    PDF输入 官方列明支持PDF输入
    文本输出 主要输出类型
    原生图片输出 该模型不支持图片生成
    原生音频输出 该模型不支持音频生成
    原生视频输出 未确认 官方未说明为原生视频生成模型
    实时API Google 模型文档列明不支持实时API

    Gemini 3.5 Flash 有哪些不足?

    Gemini 3.5 Flash 并非原生图片、音频或视频生成模型。可处理多模态输入,但输出类型为文本,需要生成媒体内容的团队应选用专门的图片、语音或视频模型。

    模型知识截止于2025年1月,意味着若请求未包含更新上下文或未使用定位与检索功能,模型可能无法了解后续事件。这对于法律、医疗、金融、安全、合规及政策相关任务尤为重要,输出需由专业人士审核。

    Computer Use 不应被视为完全稳定的默认功能。Google 文档将其列为“支持(预览)”,生产使用需结合预览条款、可靠性要求、监控需求及安全浏览器或桌面自动化控制进行评估。

    这是通用AI的局限,除非 Google 明确说明,否则并非模型特有:Gemini 3.5 Flash 可能出现幻觉、在长提示中遗漏细节、生成看似合理但错误的代码、工具结果处理失误或对不明确指令过拟合。大上下文窗口减少输入约束,但仍需评估输出质量。

    长周期工作流成本也可能上升。输出定价包含思考令牌,多模态提示、重复工具调用及代理循环会增加总用量。团队应测试请求大小,合理使用缓存,并监控每个工作流的成本,而非单次提示成本。

    Gemini 3.5 Flash 最适合哪些场景?

    用例 适用理由 重要限制
    代码重构代理 支持编程工作流、代码执行、函数调用及大上下文输入 生成代码需测试、安全审查及人工批准
    日常开发者助手 适用于调试、解释、仓库分析及测试生成 不能替代工程师判断
    多模态文档分析 接受文本、图片、视频、音频及PDF,输入窗口达100万令牌 输出仅为文本,提取准确性需验证
    代理任务自动化 专为多步骤工作流及子代理部署设计 需工具权限、沙箱、审计日志及回退处理
    生产聊天与支持工作流 支持结构化输出、定位、URL上下文及文件搜索 知识质量依赖检索源及提示设计
    成本敏感的长上下文工作负载 Flash级定价适合高频工作流,优于Pro级模型 长提示及代理循环仍可能成本高

    Gemini 3.5 Flash 与 Gemini 3.1 Pro Preview、Gemini 3.1 Flash-Lite 有何对比?

    对比项 Gemini 3.5 Flash Gemini 3.1 Pro Preview Gemini 3.1 Flash-Lite 场景适配
    提供商 Google Google Google 同一生态体系
    定位 Flash级多模态模型,适用于代理、编程及长上下文工作流 Pro级预览模型,适合复杂问题解决及高能力任务 低延迟、成本高效,适合高频轻量任务 根据任务复杂度选择模型等级
    输入上下文 1048576令牌 官方定价/模型参考均为1048576令牌 官方模型参考均为1048576令牌 输入容量相近,成本与能力配置不同
    输出类型 文本 文本 文本 核心输出类型一致
    标准输入定价 每100万输入令牌1.50美元 200K令牌内每100万2.00美元;超200K每100万4.00美元 文本/图片/视频每100万输入令牌0.25美元;音频每100万0.50美元 Flash成本介于Pro Preview与Flash-Lite之间
    标准输出定价 每100万输出令牌9.00美元 200K内每100万12.00美元;超200K每100万18.00美元 每100万输出令牌1.50美元 Flash-Lite适合高频简单任务,Pro Preview适合复杂工作流
    工具与能力 支持函数调用、代码执行、文件搜索、搜索定位、地图定位、URL上下文、结构化输出、思考、缓存及预览阶段 Computer Use Google 生态工具类似,具体依模型及端点而定 轻量模型工具类似,具体依端点而定 根据工具需求、可靠性及成本选择

    此对比并非选出优劣。Gemini 3.5 Flash 更适用于需要代理能力、编程支持、多模态输入、长上下文及 Flash级定价的团队。跨厂商对比时,团队也可参考 Claude Sonnet 5 规格(Anthropic 工作流)或 OpenAI o3(推理型任务)。

    如何通过 Gate.AI 访问 Gemini 3.5 Flash?

    Gate.AI 对 Gemini 3.5 Flash 的访问基于模型ID google/gemini-3.5-flash。Gate.AI 静态模型页在验证时未直接爬取到 Gemini 3.5 Flash 条目,因此本文将模型专属 Gate.AI ID 和专属定价视为目录数据。另,Gate.AI 文档验证了 OpenAI 兼容基础URL https://api.gate.ai/openai/v1、API密钥认证及 provider/model-name 的模型ID模式。

    Gate.AI 定价页面说明支持按需计费、API密钥管理、智能路由、提示缓存、用量洞察、组织权限及与模型提供商单位价格同步的令牌定价。流式与非流式均采用令牌计费。

    Python 示例

    1. from openai import OpenAI
    2. import os
    3. client = OpenAI(
    4. api_key=os.environ["GATEAI_API_KEY"],
    5. base_url="https://api.gate.ai/openai/v1",
    6. )
    7. response = client.chat.completions.create(
    8. model="google/gemini-3.5-flash",
    9. messages=[
    10. {
    11. "role": "user",
    12. "content": "Summarize Gemini 3.5 Flash's production trade-offs in one paragraph."
    13. }
    14. ],
    15. )
    16. print(response.choices[0].message.content)

    curl 示例

    1. curl https://api.gate.ai/openai/v1/chat/completions \
    2. -H "Authorization: Bearer $GATEAI_API_KEY" \
    3. -H "Content-Type: application/json" \
    4. -d '{
    5. "model": "google/gemini-3.5-flash",
    6. "messages": [
    7. {
    8. "role": "user",
    9. "content": "Summarize Gemini 3.5 Flash'\''s production trade-offs in one paragraph."
    10. }
    11. ]
    12. }'

    开发者也可通过 Google AI Studio 和 Gemini API,使用 Google 提供商模型ID gemini-3.5-flash 访问该模型。Google 模型页面还指出 Interactions API 已全面开放,推荐用于访问最新 Gemini 功能及模型。

    常见问题

    Gemini 3.5 Flash 的上下文窗口是多少?
    Gemini 3.5 Flash 支持1048576令牌输入上限,输出上限为65536令牌(Google AI for Developers 文档,截至2026年7月)。

    Gemini 3.5 Flash 的费用是多少?
    标准 Gemini API 定价为每100万输入令牌1.50美元、每100万输出令牌9.00美元。批量/Flex定价更低,优先定价更高(截至2026年7月)。

    可以通过 Gate.AI 访问 Gemini 3.5 Flash 吗?
    可以,使用 Gate.AI 模型ID google/gemini-3.5-flash。Gate.AI 的API格式和基础URL已验证,但模型专属目录条目在验证时未直接爬取到。

    Gemini 3.5 Flash 支持 Computer Use 吗?
    支持,但仅为 Google 当前模型文档中的预览功能。除非部署路径支持预览特性用于生产,否则建议将 Computer Use 视为评估功能。

    本内容不构成任何要约、招揽、或建议。您在做出任何投资决定之前应始终寻求独立的专业建议。请注意,Gate 可能会限制或禁止来自受限制地区的所有或部分服务。请阅读 用户协议了解更多信息。

    相关文章