Gemini 3.1 Flash-Lite:完整規格、定價、API 存取與使用範例(2026)
Gemini 3.1 Flash-Lite 是 Google 面向效率的多模態模型,主要適用於對吞吐量、延遲和 API 成本要求更高,而非對最大「前沿模型」能力有強依賴的工作負載。該模型於 2026年5月7日以普遍可用(GA)形式發布。它將 1,048,576-token 的輸入上限與文本、圖像、影片、音頻和 PDF 的理解能力結合在一起。本指南聚焦:截至 2026年9月,開發者在評估該模型用於生產時,這些規格代表什麼。
Gemini 3.1 Flash-Lite 是什麼?
Gemini 3.1 Flash-Lite 屬於 Google 的 Gemini 3 系列定位。它被定位為低延遲、成本高效的模型,用於高頻率且相對輕量的工作負載。Google 特別強調了翻譯、轉寫、結構化資料擷取、文件摘要、模型路由以及其他可能需要在大規模情境中運行的任務。
穩定模型 ID 為 gemini-3.1-flash-lite。它取代了先前的 gemini-3.1-flash-lite-preview,後者在 2026年5月25日由 Google 關閉。這個差異對整合至關重要:新應用應使用穩定識別碼,而不是已退役的預覽端點。
Flash-Lite 也不應與 Gemini 3.1 Flash Lite Image 混淆——後者是獨立的圖像生成模型。標準的 Flash-Lite 模型可以理解多種媒體格式,但生成的是文字,而不是原生圖像。
Gemini 3.1 Flash-Lite 的關鍵規格與定價是什麼?
| 規格 | Gemini 3.1 Flash-Lite |
|---|---|
| 供應商 | Google / Google DeepMind |
| 發布時間 | 2026年5月7日 |
| 供應商模型 ID | gemini-3.1-flash-lite |
| Gate.AI 模型 ID | google/gemini-3.1-flash-lite |
| 輸入上限 | 1,048,576 tokens |
| 最大輸出 | 65,536 tokens |
| Gate.AI 輸入價格 | $0.25 / 1M tokens |
| Gate.AI 輸出價格 | $1.50 / 1M tokens |
| Gate.AI 快取讀取 | $0.025 / 1M tokens |
| Gate.AI 快取寫入 | $0.08333 / 1M tokens |
| 輸出 | 文字 |
| 狀態 | Stable / GA |
Google 的標準 Gemini API 計價會獨立列出:每百萬(1M)文字、圖像或影片輸入 tokens 為 $0.25;每百萬輸出 tokens 為 $1.50;音頻輸入則是每百萬 tokens $0.50。標準上下文快取(context-cache)輸入為:每百萬文字/圖像/影片 tokens $0.025。
依 Gate.AI 針對 google/gemini-3.1-flash-lite 的 model-card 詳細資訊,列出的費率為:$0.25/M 輸入、$1.50/M 輸出、$0.025/M 快取讀取、$0.08333/M 快取寫入。
用一個簡單工作負載來說明成本。依 Gate.AI 公布的費率,處理 800,000 個輸入 tokens、生成 100,000 個輸出 tokens 的成本約為:
(0.8 × $0.25) + (0.1 × $1.50) = $0.35
這是計算示例,不包含快取與其他特定平台的費用。
Gemini 3.1 Flash-Lite 能做什麼,因而適用於生產?
最大的優勢在於:針對可重複執行的工作負載,成本更低、執行更經濟。Google 明確建議使用 Flash-Lite 處理高頻翻譯任務,因此它適合在大規模情境中處理產品評論、客服訊息、本地化佇列或類似的短文字應用。
結構化輸出使它比基礎文字生成器更適合用於擷取式流程。團隊可以將客戶回饋轉換為預先定義的欄位,例如類別、情感、摘要與升級狀態,接著將 JSON 交給下游系統。
它較大的上下文視窗也支援文件分診(triage)。可以將 PDF、長文字、圖像、音頻與影片作為上下文輸入,使得同一個模型能在多種媒體格式之間完成擷取或摘要。
另一個有用的模式是 模型路由(model routing)。Google 特別說明 Flash-Lite 被用作一種低成本分類器,用來判斷某項任務應該繼續留在輕量模型上,還是需要升級到更強的 Flash 或 Pro 模型。在高頻系統中,這可以讓「模型成本」成為架構層級的變數,而不只是依請求計費的支出。
Gemini 3.1 Flash-Lite 支援哪些模態?
| 模態 | 輸入 | 輸出 | 備註 |
|---|---|---|---|
| 文字 | 是 | 是 | 提示、程式碼、結構化文字 |
| 圖像 | 是 | 否 | 圖像理解 |
| 影片 | 是 | 否 | 影片理解 |
| 音頻 | 是 | 否 | 包括轉寫流程 |
| 是 | 否 | 文件分析與摘要 | |
| 原生圖像生成 | — | 否 | 使用專用的 Gemini 圖像模型 |
| 原生音頻生成 | — | 否 | 不支援 |
| 線上 API | — | 否 | 不支援 |
Google 將文字、圖像、影片、音頻與 PDF 視為支援的輸入類型,並將文字作為輸出。該模型也支援快取、程式碼執行、檔案搜尋、函式呼叫、Search and Maps grounding、結構化輸出、思考(thinking)以及 URL 上下文。
Gemini 3.1 Flash-Lite 的不足之處在哪裡?
Flash-Lite 已針對在規模化情境中執行直截了當的任務進行最佳化,而不是定位為 Google 的最高能力模型。涉及困難的程式編碼、較長規劃、模糊推理或複雜自主行為的工作流程,可能需要選擇更有能力的 Flash 或 Pro 等級模型。
它的多模態能力也主要是 以輸入為中心。它無法原生生成圖像或音頻,Google 將 Computer Use 和 Live API 支援列為不可用。
將 1M-token 的限制理解為「對一百萬 tokens 的提示具備保證等級的完美記憶/回想(recall)」並不恰當。擷取的準確性、grounding(基於證據的對齊)、結構化輸出的有效性,以及重要的商業決策,仍需要評估與驗證。
生命週期規劃也很重要。Google 目前將穩定版 Gemini API 模型的最早停止服務日期列為 2027年5月7日,並建議使用 Gemini 3.5 Flash-Lite 作為其後繼者。
Gemini 3.1 Flash-Lite 最適合用來做什麼?
最適配的是可重複、邊界清晰的工作:大量翻譯、分類、實體擷取、支援工單分診、轉寫、文件摘要、多模態前處理,以及在不同模型之間進行低成本路由。
當 成本與請求量是主要限制,且任務可以被清晰地指定 時,就可以選擇 Gemini 3.1 Flash-Lite。若工作流程仰賴更深的編碼能力、更難的多步推理,或對 agentic 執行有更高要求,則可考慮更上一階的 Gemini 模型。
這種分工也有助於避免不必要的模型開支:生產流程不需要把每一個簡單分類請求都送到最昂貴的推理模型。
Gemini 3.1 Flash-Lite 與 Gemini 3.5 Flash、Gemini 3.5 Flash-Lite 有何差異?
| 領域 | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|---|
| 主要定位 | 高頻輕量工作 | 更複雜的 agentic/編碼工作 | 更新的效率導向 Flash-Lite |
| 上下文 | 1,048,576 | 1,048,576 | 目前 Flash-Lite 生成 |
| 標準輸入 | $0.25/M* | $1.50/M* | 查看目前定價 |
| 標準輸出 | $1.50/M* | $9.00/M* | 查看目前定價 |
| 最佳適配 | 規模與成本 | 能力-成本平衡 | 更新的輕量部署 |
*依據截至 2026年9月對 Google Gemini API 標準文字定價的核查。
實際差異在於工作負載複雜度。以所核查的標準費率來看,Gemini 3.1 Flash-Lite 依然明顯比 Gemini 3.5 Flash 更便宜;同時,Google 目前將 Gemini 3.5 Flash-Lite 標示為 3.1 Flash-Lite 的計畫後繼者。因此,新的長期部署應同時考量即時成本與遷移所需的時間跨度。
如何透過 Gate.AI 存取 Gemini 3.1 Flash-Lite?
依據 Gate.AI 的列表資訊,模型 ID 為:
google/gemini-3.1-flash-lite
Gate.AI 在 https://api.gate.ai/openai/v1 文件中提供了一個 OpenAI 相容的 base URL,聊天補全透過 /chat/completions 送出。Gate.AI 也分別支援在 /gemini/v1beta/models/{model}:generateContent 發起 Gemini 原生請求。
Python 範例
import osfrom openai import OpenAIclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)response = client.chat.completions.create(model="google/gemini-3.1-flash-lite",messages=[{"role": "user","content": "Classify this support request and return a concise answer."}],)print(response.choices[0].message.content)
cURL 範例
curl https://api.gate.ai/openai/v1/chat/completions \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "google/gemini-3.1-flash-lite","messages": [{"role": "user","content": "Summarize this customer feedback in one sentence."}]}'
這些範例遵循 Gate.AI 文件中註明的 OpenAI 相容請求模式;它們是基於文件的示例,並非經過執行驗證的範例。
常見問題(FAQs)
Gemini 3.1 Flash-Lite 是多模態模型嗎?
是。Google 支援將文字、圖像、影片、音頻與 PDF 作為輸入,而輸出為文字。
它的上下文視窗是多少?
模型支援最多 1,048,576 個輸入 tokens,以及 65,536 個輸出 tokens。
Gemini 3.1 Flash-Lite 在 Gate.AI 上多少錢?
依據 Gate.AI model-card 詳細資訊,定價為:$0.25/M 輸入 tokens、$1.50/M 輸出 tokens、$0.025/M 快取讀取,以及 $0.08333/M 快取寫入。
Gemini 3.1 Flash-Lite 會生成圖像嗎?
不會。它能理解圖像輸入,但不支援原生圖像生成。Google 維護了獨立的 Gemini 圖像生成模型。
Gemini 3.1 Flash-Lite 適用於生產嗎?
它是一個為高頻任務設計的穩定 GA 模型。團隊在部署前仍應依據自身工作負載,針對準確性、延遲、成本、結構化輸出以及生命週期需求進行驗證。


