Gemini 3.1 Flash-Lite:完整规格、定价、API 访问与使用案例(2026)
Gemini 3.1 Flash-Lite 是 Google 面向效率的多模态模型,主要适用于对吞吐量、延迟和 API 成本要求更高、而非对最大“前沿模型”能力有强依赖的工作负载。该模型于 2026年5月7日以普遍可用(GA)形式发布。它将 1,048,576-token 的输入上限与文本、图像、视频、音频和 PDF 的理解能力结合在一起。本指南聚焦:截至 2026年9月,开发者在评估该模型用于生产时,这些规格意味着什么。
Gemini 3.1 Flash-Lite 是什么?
Gemini 3.1 Flash-Lite 属于 Google 的 Gemini 3 系列定位。它被定位为低延迟、成本高效的模型,用于高频率且相对轻量的工作负载。Google 特别强调了翻译、转写、结构化数据抽取、文档摘要、模型路由以及其他可能需要在大规模场景中运行的任务。
稳定模型 ID 为 gemini-3.1-flash-lite。它替代了此前的 gemini-3.1-flash-lite-preview,后者在 2026年5月25日被 Google 关闭。这个差异对集成很关键:新应用应使用稳定标识符,而不是已退役的预览端点。
Flash-Lite 也不应与 Gemini 3.1 Flash Lite Image 混淆——后者是独立的图像生成模型。标准的 Flash-Lite 模型可以理解多种媒体格式,但生成的是文本,而不是原生图像。
Gemini 3.1 Flash-Lite 的关键规格和定价是什么?
| 规格 | Gemini 3.1 Flash-Lite |
|---|---|
| 提供方 | Google / Google DeepMind |
| 发布时间 | 2026年5月7日 |
| 提供方模型 ID | gemini-3.1-flash-lite |
| Gate.AI 模型 ID | google/gemini-3.1-flash-lite |
| 输入上限 | 1,048,576 tokens |
| 最大输出 | 65,536 tokens |
| Gate.AI 输入价格 | $0.25 / 1M tokens |
| Gate.AI 输出价格 | $1.50 / 1M tokens |
| Gate.AI 缓存读取 | $0.025 / 1M tokens |
| Gate.AI 缓存写入 | $0.08333 / 1M tokens |
| 输出 | 文本 |
| 状态 | Stable / GA |
Google 的标准 Gemini API 计价会独立列出:每百万(1M)文本、图像或视频输入 tokens 为 $0.25;每百万输出 tokens 为 $1.50;音频输入则为每百万 tokens $0.50。标准上下文缓存(context-cache)输入为:每百万文本/图像/视频 tokens $0.025。
根据 Gate.AI 针对 google/gemini-3.1-flash-lite 的 model-card 细节,列出的费率为:$0.25/M 输入、$1.50/M 输出、$0.025/M 缓存读取、$0.08333/M 缓存写入。
用一个简单工作负载来说明成本。按 Gate.AI 公布的费率,处理 800,000 个输入 tokens、生成 100,000 个输出 tokens 的成本约为:
(0.8 × $0.25) + (0.1 × $1.50) = $0.35
这是一个计算示例,不包含缓存与其他特定平台收费。
Gemini 3.1 Flash-Lite 能做什么,从而让它适用于生产?
最大的优势在于:对可重复执行的工作负载,成本更低、执行更经济。Google 明确建议用 Flash-Lite 处理高频翻译任务,因此它适合在大规模场景下处理产品评论、支持消息、本地化队列或类似的短文本应用。
结构化输出使它比基础文本生成器更适用于抽取式流水线。团队可以将客户反馈转化为预定义字段,例如类别、情感、摘要和升级状态,然后把 JSON 交给下游系统。
其较大的上下文窗口也支持文档分诊(triage)。可以将 PDF、长文本、图像、音频和视频作为上下文输入,使得同一个模型能够在多种媒体格式之间完成抽取或摘要。
另一个有用的模式是 模型路由(model routing)。Google 特别说明 Flash-Lite 被用作一种低成本分类器,用来判断某项任务应当继续留在轻量模型上,还是需要升级到更强的 Flash 或 Pro 模型。在高频系统中,这可以让“模型成本”成为架构层面的变量,而不仅仅是按请求计费的支出。
Gemini 3.1 Flash-Lite 支持哪些模态?
| 模态 | 输入 | 输出 | 备注 |
|---|---|---|---|
| 文本 | 是 | 是 | 提示、代码、结构化文本 |
| 图像 | 是 | 否 | 图像理解 |
| 视频 | 是 | 否 | 视频理解 |
| 音频 | 是 | 否 | 包括转写工作流 |
| 是 | 否 | 文档分析与摘要 | |
| 原生图像生成 | — | 否 | 使用专用的 Gemini 图像模型 |
| 原生音频生成 | — | 否 | 不支持 |
| 在线 API | — | 否 | 不支持 |
Google 将文本、图像、视频、音频和 PDF 作为被接受的输入类型,并将文本作为输出。该模型还支持缓存、代码执行、文件搜索、函数调用、Search and Maps grounding、结构化输出、思考(thinking)以及 URL 上下文。
Gemini 3.1 Flash-Lite 的不足在哪里?
Flash-Lite 被优化用于在规模化场景下执行直截了当的任务,而不是被定位为 Google 的最高能力模型。涉及困难编码、较长规划、模糊推理或复杂自主行为的工作流,可能需要选择更有能力的 Flash 或 Pro 级模型。
它的多模态能力也主要是 以输入为中心。它无法原生生成图像或音频,Google 将 Computer Use 和 Live API 支持列为不可用。
把 1M-token 的限制理解为“对一个百万 tokens 的提示具备保证级完美记忆/回忆(recall)”并不合适。抽取准确性、grounding(基于证据的对齐)、结构化输出的有效性,以及重要的业务决策,仍需要评估与验证。
生命周期规划也很重要。Google 目前将稳定版 Gemini API 模型的最早停服日期列为 2027年5月7日,并建议使用 Gemini 3.5 Flash-Lite 作为其后继者。
Gemini 3.1 Flash-Lite 最适合用来做什么?
最匹配的是可重复、边界清晰的工作:大批量翻译、分类、实体抽取、支持工单分诊、转写、文档摘要、多模态预处理,以及在不同模型之间进行低成本路由。
当 成本和请求量是主要约束,并且任务可以被清晰地指定 时,可以选择 Gemini 3.1 Flash-Lite。当工作流依赖更深的编码能力、更难的多步骤推理或更高要求的 agentic 执行时,可以考虑更高一档的 Gemini 模型。
这种分工也有助于避免不必要的模型开支:生产流水线不需要把每一个简单分类请求都发送给最昂贵的推理模型。
Gemini 3.1 Flash-Lite 与 Gemini 3.5 Flash、Gemini 3.5 Flash-Lite 有何区别?
| 领域 | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|---|
| 主要定位 | 高频轻量工作 | 更复杂的 agentic/编码工作 | 更新的效率导向 Flash-Lite |
| 上下文 | 1,048,576 | 1,048,576 | 当前 Flash-Lite 生成 |
| 标准输入 | $0.25/M* | $1.50/M* | 查看当前定价 |
| 标准输出 | $1.50/M* | $9.00/M* | 查看当前定价 |
| 最佳适配 | 规模与成本 | 能力-成本平衡 | 更新的轻量部署 |
*基于截至 2026年9月对 Google Gemini API 标准文本定价的核查。
实际差异在于工作负载复杂度。以所核查的标准费率来看,Gemini 3.1 Flash-Lite 依然明显比 Gemini 3.5 Flash 更便宜;同时,Google 现在将 Gemini 3.5 Flash-Lite 标识为 3.1 Flash-Lite 的计划后继者。因此,新的长期部署应同时考虑即时成本与迁移时间跨度。
如何通过 Gate.AI 访问 Gemini 3.1 Flash-Lite?
根据 Gate.AI 的列表信息,模型 ID 为:
google/gemini-3.1-flash-lite
Gate.AI 在 https://api.gate.ai/openai/v1 文档中提供了一个 OpenAI 兼容的 base URL,聊天补全通过 /chat/completions 发送。Gate.AI 还分别支持在 /gemini/v1beta/models/{model}:generateContent 发起 Gemini 原生请求。
Python 示例
import osfrom openai import OpenAIclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)response = client.chat.completions.create(model="google/gemini-3.1-flash-lite",messages=[{"role": "user","content": "Classify this support request and return a concise answer."}],)print(response.choices[0].message.content)
cURL 示例
curl https://api.gate.ai/openai/v1/chat/completions \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "google/gemini-3.1-flash-lite","messages": [{"role": "user","content": "Summarize this customer feedback in one sentence."}]}'
这些示例遵循 Gate.AI 文档中注明的 OpenAI 兼容请求模式;它们是基于文档的示例,并非经过执行验证的样例。
常见问题(FAQs)
Gemini 3.1 Flash-Lite 是多模态模型吗?
是。Google 将文本、图像、视频、音频和 PDF 作为支持的输入,而输出为文本。
它的上下文窗口是多少?
模型支持最多 1,048,576 个输入 tokens,以及 65,536 个输出 tokens。
Gemini 3.1 Flash-Lite 在 Gate.AI 上多少钱?
根据 Gate.AI model-card 细节,定价为:$0.25/M 输入 tokens、$1.50/M 输出 tokens、$0.025/M 缓存读取,以及 $0.08333/M 缓存写入。
Gemini 3.1 Flash-Lite 会生成图像吗?
不会。它可以理解图像输入,但不支持原生图像生成。Google 维护了独立的 Gemini 图像生成模型。
Gemini 3.1 Flash-Lite 适用于生产吗?
它是为高频任务设计的稳定 GA 模型。团队仍应在部署前,基于自身工作负载对准确性、延迟、成本、结构化输出以及生命周期需求进行验证。


