Gate.AI博客Nemotron 3 Nano 30B A3B:完整規格、價格、API 存取與應用場景(2026)

    Nemotron 3 Nano 30B A3B:完整規格、價格、API 存取與應用場景(2026)

    模型

    Nemotron 3 Nano 30B A3B是什麼?

    Nemotron 3 Nano 30B A3B 是 NVIDIA 推出的專為文本設計的混合 Mamba-Transformer 專家混合大型語言模型,於 2025年12月15日發佈。此模型具備可調整的推理能力,支援 128K-token 的託管 API 輸入輸出上限,自行託管環境下最高可達 1M-token 上下文視窗。

    根據用戶提供的 Gate.AI 模型卡,免費模型的定價顯示每 100 萬輸入 token 及每 100 萬輸出 token 均為 0 美元(截至 2026年6月)。NVIDIA 將模型開發者標註為 NVIDIA Corporation,預訓練資料更新至 2025年6月25日,後訓練資料更新至 2025年11月28日,並將該模型描述為統一推理與非推理的大型語言模型。

    NVIDIA 將 Nemotron 定義為開放權重、開放訓練資料及建構專業 AI 代理的開放模型家族。Nemotron 3 Nano 30B A3B 是該家族中適合開發者評估推理、程式碼、RAG、聊天與智慧代理等場景的小型成員,尤其適用於需要自託管或閘道 API 存取的情境。

    研究此模型的團隊通常會將其與其他推理或開放權重系統進行比較,例如 DeepSeek-R1DeepSeek-V3Qwen2.5 72B Instruct,特別是在成本、部署控制、上下文長度與工具調用行為等方面進行權衡。

    Nemotron 3 Nano 30B A3B 的主要規格與定價如何?

    資料參考日期:2026年6月。

    欄位 核實數值
    服務商 NVIDIA Corporation,截止 2026年6月
    模型家族 NVIDIA Nemotron / Nemotron 3,截止 2026年6月
    模型類型 專為文本設計的混合 Mamba2-Transformer 專家混合大型語言模型,適用於推理與聊天,截止 2026年6月
    發佈日期 2025年12月15日,於 Hugging Face 與 Build.NVIDIA.com 上線,截止 2026年6月
    上下文視窗 NVIDIA Build 模型卡顯示託管模型最大輸入 128K、最大輸出 128K。官方亦說明自託管環境下支援最高 1M 上下文視窗,Hugging Face 預設配置為 256K,受顯示記憶體需求影響,截止 2026年6月
    輸入定價 Gate.AI 用戶提供的模型卡顯示 nvidia/nemotron-3-nano-30b-a3b:free 每 100 萬輸入 token 為 0 美元,截止 2026年6月。NVIDIA 官方未確認具體 token 定價
    快取輸入定價 Gate.AI 用戶提供的模型卡顯示該模型的快取讀寫欄位為「—」,截止 2026年6月
    輸出定價 Gate.AI 用戶提供的模型卡顯示 nvidia/nemotron-3-nano-30b-a3b:free 每 100 萬輸出 token 為 0 美元,截止 2026年6月
    定價單位 Gate.AI 模型卡以每 100 萬 token 計價;NVIDIA 官方未確認定價單位,截止 2026年6月
    模態支援 NVIDIA 模型卡僅支援文本輸入與文本輸出,截止 2026年6月
    支援輸入類型 文字字串及一維 token 序列,截止 2026年6月
    支援輸出類型 文字字串及一維 token 序列,截止 2026年6月
    API 存取 Gate.AI 支援 OpenAI 相容聊天 API;NVIDIA Build / NIM、自託管 Hugging Face、vLLM、TRT-LLM、SGLang 等路徑均有文件說明,截止 2026年6月
    模型 ID Gate.AI:nvidia/nemotron-3-nano-30b-a3b:free;NVIDIA Build API:nvidia/nemotron-3-nano-30b-a3b;Hugging Face 權重:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16,截止 2026年6月
    可用性 NVIDIA 官方列出全球部署;Gate.AI 模型具體可用性以用戶提供的 Gate.AI 模型卡為準,截止 2026年6月
    知識截止 預訓練截止:2025年6月25日;後訓練截止:2025年11月28日,截止 2026年6月
    速率限制 截至 2026年6月,官方未確認具體數值速率限制
    微調支援 開放權重及模型使用路徑均有文件說明;該模型的託管 API 微調支援未見官方確認,截止 2026年6月
    串流支援 Gate.AI 文件說明 POST /chat/completions 支援串流,截止 2026年6月
    批次 API 支援 截至 2026年6月,官方未確認相關資訊
    工具/函式調用 NVIDIA 文件涵蓋工具調用、多步工具使用、結構化輸出環境;Gate.AI 模型具體工具調用行為未單獨確認,截止 2026年6月
    結構化輸出/JSON 模式 NVIDIA 文件涵蓋結構化輸出訓練環境;Gate.AI 模型具體 JSON 模式保障未單獨確認,截止 2026年6月
    授權/使用限制 NVIDIA Nemotron 開放模型授權;NVIDIA 稱該模型已可商用,截止 2026年6月

    Nemotron 3 Nano 30B A3B 在生產環境有哪些實用價值?

    Nemotron 3 Nano 30B A3B 適用於 AI 代理原型開發,因為 NVIDIA 將其定位為面向開發者建構 AI 代理系統、聊天機器人、RAG 系統及指令遵循應用的通用推理與聊天模型。這使其適合在工作流程自動化、工具輔助助手及內部開發工具等場景進行評估,前提是團隊需針對自身任務測試工具可靠性與安全行為。

    當團隊可控部署時,該模型對於長上下文實驗尤其有用。NVIDIA 託管模型卡欄位顯示最大輸入 128K、最大輸出 128K,同時官方說明自託管環境下最高可達 1M 上下文視窗(需更高顯示記憶體)。這一差異對於文件審查、程式碼庫分析及 RAG 流程尤其重要。

    在程式碼與技術問答方面,NVIDIA 將程式語言與開發應用列為主要用途之一。模型後訓練資料涵蓋合成程式碼、數學、科學、工具調用、指令遵循、結構化輸出及一般知識,但生產團隊仍需結合自身程式碼庫、延遲預算與容錯需求進行基準測試。

    對於閘道測試,Gate.AI 文件確認支援 OpenAI 相容基礎 URL、Bearer-token 認證、按需計費、/chat/completions/models 介面。Gate.AI 首頁也將 Nemotron 列入其 200+ 模型覆蓋範圍,具體免費模型 ID 與 0 美元定價來自用戶提供的 Gate.AI 模型卡截圖。

    Nemotron 3 Nano 30B A3B 支援哪些模態?

    模態 是否支援 說明
    文字輸入 NVIDIA 支援文字輸入、字串格式及一維序列
    文字輸出 NVIDIA 支援文字輸出、字串格式及一維序列
    圖像輸入 未驗證 此模型卡僅支援文字輸入。NVIDIA 另有 Nemotron Omni 模型支援多模態工作流程
    音訊輸入 未驗證 此模型卡僅支援文字輸入
    影片輸入 未驗證 此模型卡僅支援文字輸入

    Nemotron 3 Nano 30B A3B 有哪些不足?

    主要的規格注意點在於上下文視窗依賴部署方式。NVIDIA 模型卡顯示最大輸入 128K、最大輸出 128K,但官方亦說明自託管環境最高可達 1M。團隊不應假定所有 API 路徑均支援 1M token。

    此模型於 NVIDIA 模型卡中僅支援文字,不應作為多模態模型使用,圖像、音訊或影片場景需選擇專門支援相關模態的模型。

    官方支援語言包括英語、西班牙語、法語、德語、日語及義大利語。NVIDIA 亦描述更廣泛的訓練資料,但非官方支援語言的生產品質需單獨評估。

    這是通用 AI 侷限,非模型特有:模型可能出現幻覺、誤讀指令、產生不安全輸出、工具調用異常或於高風險法律、醫療、金融、網路安全、合規任務中失效。高風險應用需專家審核與應用層安全防護。

    Nemotron 3 Nano 30B A3B 最適合哪些場景?

    應用場景 適用理由 重要限制
    AI 代理 NVIDIA 定位該模型用於代理系統、聊天機器人、RAG 系統及指令遵循應用 工具調用行為需在實際代理框架中驗證
    程式輔助 NVIDIA 描述主要用途包括英語及程式語言 針對程式碼庫的測試比通用基準更可靠
    RAG 與文件問答 長上下文自託管配置可支援大文件輸入 託管 API 與閘道限制可能與自託管不同
    成本敏感測試 用戶提供的 Gate.AI 模型卡顯示免費版本每 100 萬輸入和輸出 token 為 0 美元 免費路徑可能有配額、可用性或速率限制
    開放權重部署 NVIDIA 於 Hugging Face 發布模型,並支援 vLLM、SGLang 等本地部署工具 自託管需 GPU 顯示記憶體、部署經驗及監控

    對比開放或閘道可存取模型時,團隊亦可評估 Mistral Small 4 用於輕量生產路由,或 Llama 3.1 70B 作為成熟的開放模型基線。

    Nemotron 3 Nano 30B A3B 與 Qwen3-30B-A3B-Thinking-2507 及 GPT-OSS-20B 對比如何?

    對比維度 Nemotron 3 Nano 30B A3B Qwen3-30B-A3B-Thinking-2507 GPT-OSS-20B 場景適配
    模型類型 混合 Mamba2-Transformer 專家混合推理/聊天 LLM,共 30B 參數 因果語言模型,30.5B 總參數,3.3B 啟用參數 OpenAI 開放權重專家混合語言模型,21B 總參數,每 token 啟用參數 3.6B 根據任務類型、模型存取方式與部署棧選擇
    上下文視窗 託管輸入/輸出 128K;自託管最高 1M 原生上下文 262,144 token,另有 1M 上下文配置指導 上下文長度 128K 長上下文用戶需驗證具體部署配置
    模態支援 文字輸入與文字輸出 文字生成模型 主要英語,文本專用模型家族 三者均為文字模型選擇,非多模態替代
    部署方式 Gate.AI API、NVIDIA Build / NIM、Hugging Face、vLLM、TRT-LLM、SGLang 路徑 Hugging Face、Transformers、vLLM、SGLang 及本地應用生態 開放權重本地或託管部署,視服務商而定 部署偏好可能比基準差異更重要
    實用適配 適合 NVIDIA 生態的開放權重推理、RAG、代理工作流程 適合 Qwen 生態推理及長上下文思考模式工作流程 適合本地或邊緣開放權重實驗 無絕對優勝,需結合任務、語言、延遲、預算與基礎設施匹配

    如何透過 Gate.AI 存取 Nemotron 3 Nano 30B A3B?

    Gate.AI 存取 Nemotron 3 Nano 30B A3B 已由用戶提供的 Gate.AI 模型卡截圖驗證,模型 ID 為 nvidia/nemotron-3-nano-30b-a3b:free

    Gate.AI 文件確認支援 OpenAI 相容基礎 URL https://api.gate.ai/openai/v1、Bearer-token 認證、POST /chat/completionsGET /models、按需計費模式及聊天串流支援。

    Python 範例

    1. from openai import OpenAI
    2. import os
    3. client = OpenAI(
    4. api_key=os.environ["GATEAI_API_KEY"],
    5. base_url="https://api.gate.ai/openai/v1",
    6. )
    7. response = client.chat.completions.create(
    8. model="nvidia/nemotron-3-nano-30b-a3b:free",
    9. messages=[
    10. {
    11. "role": "user",
    12. "content": "Summarize Nemotron 3 Nano 30B A3B in three bullet points."
    13. }
    14. ],
    15. )
    16. print(response.choices[0].message.content)

    curl 範例

    1. curl https://api.gate.ai/openai/v1/chat/completions \
    2. -H "Authorization: Bearer $GATEAI_API_KEY" \
    3. -H "Content-Type: application/json" \
    4. -d '{
    5. "model": "nvidia/nemotron-3-nano-30b-a3b:free",
    6. "messages": [
    7. {
    8. "role": "user",
    9. "content": "Explain what Nemotron 3 Nano 30B A3B is used for."
    10. }
    11. ]
    12. }'

    Gate.AI 定價文件說明免費模型有免費層,200+ 模型按需計費,支援 API 金鑰管理、智慧路由、支援快取提示(部分模型)、用量洞察及組織權限。生產團隊仍需於儀表板檢查模型配額、路徑可用性及免費模型每日限額。

    常見問題

    Nemotron 3 Nano 30B A3B 的上下文視窗是多少?

    NVIDIA 託管模型卡欄位顯示最大輸入 128K、最大輸出 128K,同時官方說明自託管環境下最高可達 1M token。

    Nemotron 3 Nano 30B A3B 在 Gate.AI 上的費用是多少?

    用戶提供的 Gate.AI 模型卡顯示 nvidia/nemotron-3-nano-30b-a3b:free 每 100 萬輸入 token 和每 100 萬輸出 token 均為 0 美元(截至 2026年6月)。

    開發者如何存取 Nemotron 3 Nano 30B A3B?

    開發者可透過 Gate.AI OpenAI 相容聊天 API,使用已驗證的 Gate.AI 模型 ID 存取。NVIDIA 亦支援 Build / NIM 及 Hugging Face、vLLM、TRT-LLM、SGLang 等自託管選項。

    Nemotron 3 Nano 30B A3B 適合哪些用途?

    適用於 AI 代理、程式輔助、RAG、文件分析、指令遵循及開放權重實驗。生產前團隊需測試延遲、幻覺行為、安全性及工具調用可靠性。

    相關文章