Gate.AI博客Gemini 3.1 Flash-Lite:完整規格、定價、API 存取與使用範例(2026)

    Gemini 3.1 Flash-Lite:完整規格、定價、API 存取與使用範例(2026)

    模型

    Gemini 3.1 Flash-Lite 是 Google 面向效率的多模態模型,主要適用於對吞吐量、延遲和 API 成本要求更高,而非對最大「前沿模型」能力有強依賴的工作負載。該模型於 2026年5月7日以普遍可用(GA)形式發布。它將 1,048,576-token 的輸入上限與文本、圖像、影片、音頻和 PDF 的理解能力結合在一起。本指南聚焦:截至 2026年9月,開發者在評估該模型用於生產時,這些規格代表什麼。

    Gemini 3.1 Flash-Lite 是什麼?

    Gemini 3.1 Flash-Lite 屬於 Google 的 Gemini 3 系列定位。它被定位為低延遲、成本高效的模型,用於高頻率且相對輕量的工作負載。Google 特別強調了翻譯、轉寫、結構化資料擷取、文件摘要、模型路由以及其他可能需要在大規模情境中運行的任務。

    穩定模型 ID 為 gemini-3.1-flash-lite。它取代了先前的 gemini-3.1-flash-lite-preview,後者在 2026年5月25日由 Google 關閉。這個差異對整合至關重要:新應用應使用穩定識別碼,而不是已退役的預覽端點。

    Flash-Lite 也不應與 Gemini 3.1 Flash Lite Image 混淆——後者是獨立的圖像生成模型。標準的 Flash-Lite 模型可以理解多種媒體格式,但生成的是文字,而不是原生圖像。

    Gemini 3.1 Flash-Lite 的關鍵規格與定價是什麼?

    規格 Gemini 3.1 Flash-Lite
    供應商 Google / Google DeepMind
    發布時間 2026年5月7日
    供應商模型 ID gemini-3.1-flash-lite
    Gate.AI 模型 ID google/gemini-3.1-flash-lite
    輸入上限 1,048,576 tokens
    最大輸出 65,536 tokens
    Gate.AI 輸入價格 $0.25 / 1M tokens
    Gate.AI 輸出價格 $1.50 / 1M tokens
    Gate.AI 快取讀取 $0.025 / 1M tokens
    Gate.AI 快取寫入 $0.08333 / 1M tokens
    輸出 文字
    狀態 Stable / GA

    Google 的標準 Gemini API 計價會獨立列出:每百萬(1M)文字、圖像或影片輸入 tokens 為 $0.25;每百萬輸出 tokens 為 $1.50;音頻輸入則是每百萬 tokens $0.50。標準上下文快取(context-cache)輸入為:每百萬文字/圖像/影片 tokens $0.025。

    依 Gate.AI 針對 google/gemini-3.1-flash-lite 的 model-card 詳細資訊,列出的費率為:$0.25/M 輸入、$1.50/M 輸出、$0.025/M 快取讀取、$0.08333/M 快取寫入。

    用一個簡單工作負載來說明成本。依 Gate.AI 公布的費率,處理 800,000 個輸入 tokens、生成 100,000 個輸出 tokens 的成本約為:

    (0.8 × $0.25) + (0.1 × $1.50) = $0.35

    這是計算示例,不包含快取與其他特定平台的費用。

    Gemini 3.1 Flash-Lite 能做什麼,因而適用於生產?

    最大的優勢在於:針對可重複執行的工作負載,成本更低、執行更經濟。Google 明確建議使用 Flash-Lite 處理高頻翻譯任務,因此它適合在大規模情境中處理產品評論、客服訊息、本地化佇列或類似的短文字應用。

    結構化輸出使它比基礎文字生成器更適合用於擷取式流程。團隊可以將客戶回饋轉換為預先定義的欄位,例如類別、情感、摘要與升級狀態,接著將 JSON 交給下游系統。

    它較大的上下文視窗也支援文件分診(triage)。可以將 PDF、長文字、圖像、音頻與影片作為上下文輸入,使得同一個模型能在多種媒體格式之間完成擷取或摘要。

    另一個有用的模式是 模型路由(model routing)。Google 特別說明 Flash-Lite 被用作一種低成本分類器,用來判斷某項任務應該繼續留在輕量模型上,還是需要升級到更強的 Flash 或 Pro 模型。在高頻系統中,這可以讓「模型成本」成為架構層級的變數,而不只是依請求計費的支出。

    Gemini 3.1 Flash-Lite 支援哪些模態?

    模態 輸入 輸出 備註
    文字 提示、程式碼、結構化文字
    圖像 圖像理解
    影片 影片理解
    音頻 包括轉寫流程
    PDF 文件分析與摘要
    原生圖像生成 使用專用的 Gemini 圖像模型
    原生音頻生成 不支援
    線上 API 不支援

    Google 將文字、圖像、影片、音頻與 PDF 視為支援的輸入類型,並將文字作為輸出。該模型也支援快取、程式碼執行、檔案搜尋、函式呼叫、Search and Maps grounding、結構化輸出、思考(thinking)以及 URL 上下文。

    Gemini 3.1 Flash-Lite 的不足之處在哪裡?

    Flash-Lite 已針對在規模化情境中執行直截了當的任務進行最佳化,而不是定位為 Google 的最高能力模型。涉及困難的程式編碼、較長規劃、模糊推理或複雜自主行為的工作流程,可能需要選擇更有能力的 Flash 或 Pro 等級模型。

    它的多模態能力也主要是 以輸入為中心。它無法原生生成圖像或音頻,Google 將 Computer Use 和 Live API 支援列為不可用。

    將 1M-token 的限制理解為「對一百萬 tokens 的提示具備保證等級的完美記憶/回想(recall)」並不恰當。擷取的準確性、grounding(基於證據的對齊)、結構化輸出的有效性,以及重要的商業決策,仍需要評估與驗證。

    生命週期規劃也很重要。Google 目前將穩定版 Gemini API 模型的最早停止服務日期列為 2027年5月7日,並建議使用 Gemini 3.5 Flash-Lite 作為其後繼者。

    Gemini 3.1 Flash-Lite 最適合用來做什麼?

    最適配的是可重複、邊界清晰的工作:大量翻譯、分類、實體擷取、支援工單分診、轉寫、文件摘要、多模態前處理,以及在不同模型之間進行低成本路由。

    成本與請求量是主要限制,且任務可以被清晰地指定 時,就可以選擇 Gemini 3.1 Flash-Lite。若工作流程仰賴更深的編碼能力、更難的多步推理,或對 agentic 執行有更高要求,則可考慮更上一階的 Gemini 模型。

    這種分工也有助於避免不必要的模型開支:生產流程不需要把每一個簡單分類請求都送到最昂貴的推理模型。

    Gemini 3.1 Flash-Lite 與 Gemini 3.5 Flash、Gemini 3.5 Flash-Lite 有何差異?

    領域 Gemini 3.1 Flash-Lite Gemini 3.5 Flash Gemini 3.5 Flash-Lite
    主要定位 高頻輕量工作 更複雜的 agentic/編碼工作 更新的效率導向 Flash-Lite
    上下文 1,048,576 1,048,576 目前 Flash-Lite 生成
    標準輸入 $0.25/M* $1.50/M* 查看目前定價
    標準輸出 $1.50/M* $9.00/M* 查看目前定價
    最佳適配 規模與成本 能力-成本平衡 更新的輕量部署

    *依據截至 2026年9月對 Google Gemini API 標準文字定價的核查。

    實際差異在於工作負載複雜度。以所核查的標準費率來看,Gemini 3.1 Flash-Lite 依然明顯比 Gemini 3.5 Flash 更便宜;同時,Google 目前將 Gemini 3.5 Flash-Lite 標示為 3.1 Flash-Lite 的計畫後繼者。因此,新的長期部署應同時考量即時成本與遷移所需的時間跨度。

    如何透過 Gate.AI 存取 Gemini 3.1 Flash-Lite?

    依據 Gate.AI 的列表資訊,模型 ID 為:

    google/gemini-3.1-flash-lite

    Gate.AI 在 https://api.gate.ai/openai/v1 文件中提供了一個 OpenAI 相容的 base URL,聊天補全透過 /chat/completions 送出。Gate.AI 也分別支援在 /gemini/v1beta/models/{model}:generateContent 發起 Gemini 原生請求。

    Python 範例

    1. import os
    2. from openai import OpenAI
    3. client = OpenAI(
    4. api_key=os.environ["GATEAI_API_KEY"],
    5. base_url="https://api.gate.ai/openai/v1",
    6. )
    7. response = client.chat.completions.create(
    8. model="google/gemini-3.1-flash-lite",
    9. messages=[
    10. {
    11. "role": "user",
    12. "content": "Classify this support request and return a concise answer."
    13. }
    14. ],
    15. )
    16. print(response.choices[0].message.content)

    cURL 範例

    1. curl https://api.gate.ai/openai/v1/chat/completions \
    2. -H "Authorization: Bearer $GATEAI_API_KEY" \
    3. -H "Content-Type: application/json" \
    4. -d '{
    5. "model": "google/gemini-3.1-flash-lite",
    6. "messages": [
    7. {
    8. "role": "user",
    9. "content": "Summarize this customer feedback in one sentence."
    10. }
    11. ]
    12. }'

    這些範例遵循 Gate.AI 文件中註明的 OpenAI 相容請求模式;它們是基於文件的示例,並非經過執行驗證的範例。

    常見問題(FAQs)

    Gemini 3.1 Flash-Lite 是多模態模型嗎?

    是。Google 支援將文字、圖像、影片、音頻與 PDF 作為輸入,而輸出為文字。

    它的上下文視窗是多少?

    模型支援最多 1,048,576 個輸入 tokens,以及 65,536 個輸出 tokens。

    Gemini 3.1 Flash-Lite 在 Gate.AI 上多少錢?

    依據 Gate.AI model-card 詳細資訊,定價為:$0.25/M 輸入 tokens、$1.50/M 輸出 tokens、$0.025/M 快取讀取,以及 $0.08333/M 快取寫入。

    Gemini 3.1 Flash-Lite 會生成圖像嗎?

    不會。它能理解圖像輸入,但不支援原生圖像生成。Google 維護了獨立的 Gemini 圖像生成模型。

    Gemini 3.1 Flash-Lite 適用於生產嗎?

    它是一個為高頻任務設計的穩定 GA 模型。團隊在部署前仍應依據自身工作負載,針對準確性、延遲、成本、結構化輸出以及生命週期需求進行驗證。

    相關文章