Nemotron 3 Nano 30B A3B:完整規格、價格、API 存取與應用場景(2026)
Nemotron 3 Nano 30B A3B是什麼?
Nemotron 3 Nano 30B A3B 是 NVIDIA 推出的專為文本設計的混合 Mamba-Transformer 專家混合大型語言模型,於 2025年12月15日發佈。此模型具備可調整的推理能力,支援 128K-token 的託管 API 輸入輸出上限,自行託管環境下最高可達 1M-token 上下文視窗。
根據用戶提供的 Gate.AI 模型卡,免費模型的定價顯示每 100 萬輸入 token 及每 100 萬輸出 token 均為 0 美元(截至 2026年6月)。NVIDIA 將模型開發者標註為 NVIDIA Corporation,預訓練資料更新至 2025年6月25日,後訓練資料更新至 2025年11月28日,並將該模型描述為統一推理與非推理的大型語言模型。
NVIDIA 將 Nemotron 定義為開放權重、開放訓練資料及建構專業 AI 代理的開放模型家族。Nemotron 3 Nano 30B A3B 是該家族中適合開發者評估推理、程式碼、RAG、聊天與智慧代理等場景的小型成員,尤其適用於需要自託管或閘道 API 存取的情境。
研究此模型的團隊通常會將其與其他推理或開放權重系統進行比較,例如 DeepSeek-R1、DeepSeek-V3 及 Qwen2.5 72B Instruct,特別是在成本、部署控制、上下文長度與工具調用行為等方面進行權衡。
Nemotron 3 Nano 30B A3B 的主要規格與定價如何?
資料參考日期:2026年6月。
| 欄位 | 核實數值 |
|---|---|
| 服務商 | NVIDIA Corporation,截止 2026年6月 |
| 模型家族 | NVIDIA Nemotron / Nemotron 3,截止 2026年6月 |
| 模型類型 | 專為文本設計的混合 Mamba2-Transformer 專家混合大型語言模型,適用於推理與聊天,截止 2026年6月 |
| 發佈日期 | 2025年12月15日,於 Hugging Face 與 Build.NVIDIA.com 上線,截止 2026年6月 |
| 上下文視窗 | NVIDIA Build 模型卡顯示託管模型最大輸入 128K、最大輸出 128K。官方亦說明自託管環境下支援最高 1M 上下文視窗,Hugging Face 預設配置為 256K,受顯示記憶體需求影響,截止 2026年6月 |
| 輸入定價 | Gate.AI 用戶提供的模型卡顯示 nvidia/nemotron-3-nano-30b-a3b:free 每 100 萬輸入 token 為 0 美元,截止 2026年6月。NVIDIA 官方未確認具體 token 定價 |
| 快取輸入定價 | Gate.AI 用戶提供的模型卡顯示該模型的快取讀寫欄位為「—」,截止 2026年6月 |
| 輸出定價 | Gate.AI 用戶提供的模型卡顯示 nvidia/nemotron-3-nano-30b-a3b:free 每 100 萬輸出 token 為 0 美元,截止 2026年6月 |
| 定價單位 | Gate.AI 模型卡以每 100 萬 token 計價;NVIDIA 官方未確認定價單位,截止 2026年6月 |
| 模態支援 | NVIDIA 模型卡僅支援文本輸入與文本輸出,截止 2026年6月 |
| 支援輸入類型 | 文字字串及一維 token 序列,截止 2026年6月 |
| 支援輸出類型 | 文字字串及一維 token 序列,截止 2026年6月 |
| API 存取 | Gate.AI 支援 OpenAI 相容聊天 API;NVIDIA Build / NIM、自託管 Hugging Face、vLLM、TRT-LLM、SGLang 等路徑均有文件說明,截止 2026年6月 |
| 模型 ID | Gate.AI:nvidia/nemotron-3-nano-30b-a3b:free;NVIDIA Build API:nvidia/nemotron-3-nano-30b-a3b;Hugging Face 權重:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16,截止 2026年6月 |
| 可用性 | NVIDIA 官方列出全球部署;Gate.AI 模型具體可用性以用戶提供的 Gate.AI 模型卡為準,截止 2026年6月 |
| 知識截止 | 預訓練截止:2025年6月25日;後訓練截止:2025年11月28日,截止 2026年6月 |
| 速率限制 | 截至 2026年6月,官方未確認具體數值速率限制 |
| 微調支援 | 開放權重及模型使用路徑均有文件說明;該模型的託管 API 微調支援未見官方確認,截止 2026年6月 |
| 串流支援 | Gate.AI 文件說明 POST /chat/completions 支援串流,截止 2026年6月 |
| 批次 API 支援 | 截至 2026年6月,官方未確認相關資訊 |
| 工具/函式調用 | NVIDIA 文件涵蓋工具調用、多步工具使用、結構化輸出環境;Gate.AI 模型具體工具調用行為未單獨確認,截止 2026年6月 |
| 結構化輸出/JSON 模式 | NVIDIA 文件涵蓋結構化輸出訓練環境;Gate.AI 模型具體 JSON 模式保障未單獨確認,截止 2026年6月 |
| 授權/使用限制 | NVIDIA Nemotron 開放模型授權;NVIDIA 稱該模型已可商用,截止 2026年6月 |
Nemotron 3 Nano 30B A3B 在生產環境有哪些實用價值?
Nemotron 3 Nano 30B A3B 適用於 AI 代理原型開發,因為 NVIDIA 將其定位為面向開發者建構 AI 代理系統、聊天機器人、RAG 系統及指令遵循應用的通用推理與聊天模型。這使其適合在工作流程自動化、工具輔助助手及內部開發工具等場景進行評估,前提是團隊需針對自身任務測試工具可靠性與安全行為。
當團隊可控部署時,該模型對於長上下文實驗尤其有用。NVIDIA 託管模型卡欄位顯示最大輸入 128K、最大輸出 128K,同時官方說明自託管環境下最高可達 1M 上下文視窗(需更高顯示記憶體)。這一差異對於文件審查、程式碼庫分析及 RAG 流程尤其重要。
在程式碼與技術問答方面,NVIDIA 將程式語言與開發應用列為主要用途之一。模型後訓練資料涵蓋合成程式碼、數學、科學、工具調用、指令遵循、結構化輸出及一般知識,但生產團隊仍需結合自身程式碼庫、延遲預算與容錯需求進行基準測試。
對於閘道測試,Gate.AI 文件確認支援 OpenAI 相容基礎 URL、Bearer-token 認證、按需計費、/chat/completions 及 /models 介面。Gate.AI 首頁也將 Nemotron 列入其 200+ 模型覆蓋範圍,具體免費模型 ID 與 0 美元定價來自用戶提供的 Gate.AI 模型卡截圖。
Nemotron 3 Nano 30B A3B 支援哪些模態?
| 模態 | 是否支援 | 說明 |
|---|---|---|
| 文字輸入 | 是 | NVIDIA 支援文字輸入、字串格式及一維序列 |
| 文字輸出 | 是 | NVIDIA 支援文字輸出、字串格式及一維序列 |
| 圖像輸入 | 未驗證 | 此模型卡僅支援文字輸入。NVIDIA 另有 Nemotron Omni 模型支援多模態工作流程 |
| 音訊輸入 | 未驗證 | 此模型卡僅支援文字輸入 |
| 影片輸入 | 未驗證 | 此模型卡僅支援文字輸入 |
Nemotron 3 Nano 30B A3B 有哪些不足?
主要的規格注意點在於上下文視窗依賴部署方式。NVIDIA 模型卡顯示最大輸入 128K、最大輸出 128K,但官方亦說明自託管環境最高可達 1M。團隊不應假定所有 API 路徑均支援 1M token。
此模型於 NVIDIA 模型卡中僅支援文字,不應作為多模態模型使用,圖像、音訊或影片場景需選擇專門支援相關模態的模型。
官方支援語言包括英語、西班牙語、法語、德語、日語及義大利語。NVIDIA 亦描述更廣泛的訓練資料,但非官方支援語言的生產品質需單獨評估。
這是通用 AI 侷限,非模型特有:模型可能出現幻覺、誤讀指令、產生不安全輸出、工具調用異常或於高風險法律、醫療、金融、網路安全、合規任務中失效。高風險應用需專家審核與應用層安全防護。
Nemotron 3 Nano 30B A3B 最適合哪些場景?
| 應用場景 | 適用理由 | 重要限制 |
|---|---|---|
| AI 代理 | NVIDIA 定位該模型用於代理系統、聊天機器人、RAG 系統及指令遵循應用 | 工具調用行為需在實際代理框架中驗證 |
| 程式輔助 | NVIDIA 描述主要用途包括英語及程式語言 | 針對程式碼庫的測試比通用基準更可靠 |
| RAG 與文件問答 | 長上下文自託管配置可支援大文件輸入 | 託管 API 與閘道限制可能與自託管不同 |
| 成本敏感測試 | 用戶提供的 Gate.AI 模型卡顯示免費版本每 100 萬輸入和輸出 token 為 0 美元 | 免費路徑可能有配額、可用性或速率限制 |
| 開放權重部署 | NVIDIA 於 Hugging Face 發布模型,並支援 vLLM、SGLang 等本地部署工具 | 自託管需 GPU 顯示記憶體、部署經驗及監控 |
對比開放或閘道可存取模型時,團隊亦可評估 Mistral Small 4 用於輕量生產路由,或 Llama 3.1 70B 作為成熟的開放模型基線。
Nemotron 3 Nano 30B A3B 與 Qwen3-30B-A3B-Thinking-2507 及 GPT-OSS-20B 對比如何?
| 對比維度 | Nemotron 3 Nano 30B A3B | Qwen3-30B-A3B-Thinking-2507 | GPT-OSS-20B | 場景適配 |
|---|---|---|---|---|
| 模型類型 | 混合 Mamba2-Transformer 專家混合推理/聊天 LLM,共 30B 參數 | 因果語言模型,30.5B 總參數,3.3B 啟用參數 | OpenAI 開放權重專家混合語言模型,21B 總參數,每 token 啟用參數 3.6B | 根據任務類型、模型存取方式與部署棧選擇 |
| 上下文視窗 | 託管輸入/輸出 128K;自託管最高 1M | 原生上下文 262,144 token,另有 1M 上下文配置指導 | 上下文長度 128K | 長上下文用戶需驗證具體部署配置 |
| 模態支援 | 文字輸入與文字輸出 | 文字生成模型 | 主要英語,文本專用模型家族 | 三者均為文字模型選擇,非多模態替代 |
| 部署方式 | Gate.AI API、NVIDIA Build / NIM、Hugging Face、vLLM、TRT-LLM、SGLang 路徑 | Hugging Face、Transformers、vLLM、SGLang 及本地應用生態 | 開放權重本地或託管部署,視服務商而定 | 部署偏好可能比基準差異更重要 |
| 實用適配 | 適合 NVIDIA 生態的開放權重推理、RAG、代理工作流程 | 適合 Qwen 生態推理及長上下文思考模式工作流程 | 適合本地或邊緣開放權重實驗 | 無絕對優勝,需結合任務、語言、延遲、預算與基礎設施匹配 |
如何透過 Gate.AI 存取 Nemotron 3 Nano 30B A3B?
Gate.AI 存取 Nemotron 3 Nano 30B A3B 已由用戶提供的 Gate.AI 模型卡截圖驗證,模型 ID 為 nvidia/nemotron-3-nano-30b-a3b:free。
Gate.AI 文件確認支援 OpenAI 相容基礎 URL https://api.gate.ai/openai/v1、Bearer-token 認證、POST /chat/completions、GET /models、按需計費模式及聊天串流支援。
Python 範例
from openai import OpenAIimport osclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)response = client.chat.completions.create(model="nvidia/nemotron-3-nano-30b-a3b:free",messages=[{"role": "user","content": "Summarize Nemotron 3 Nano 30B A3B in three bullet points."}],)print(response.choices[0].message.content)
curl 範例
curl https://api.gate.ai/openai/v1/chat/completions \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "nvidia/nemotron-3-nano-30b-a3b:free","messages": [{"role": "user","content": "Explain what Nemotron 3 Nano 30B A3B is used for."}]}'
Gate.AI 定價文件說明免費模型有免費層,200+ 模型按需計費,支援 API 金鑰管理、智慧路由、支援快取提示(部分模型)、用量洞察及組織權限。生產團隊仍需於儀表板檢查模型配額、路徑可用性及免費模型每日限額。
常見問題
Nemotron 3 Nano 30B A3B 的上下文視窗是多少?
NVIDIA 託管模型卡欄位顯示最大輸入 128K、最大輸出 128K,同時官方說明自託管環境下最高可達 1M token。
Nemotron 3 Nano 30B A3B 在 Gate.AI 上的費用是多少?
用戶提供的 Gate.AI 模型卡顯示 nvidia/nemotron-3-nano-30b-a3b:free 每 100 萬輸入 token 和每 100 萬輸出 token 均為 0 美元(截至 2026年6月)。
開發者如何存取 Nemotron 3 Nano 30B A3B?
開發者可透過 Gate.AI OpenAI 相容聊天 API,使用已驗證的 Gate.AI 模型 ID 存取。NVIDIA 亦支援 Build / NIM 及 Hugging Face、vLLM、TRT-LLM、SGLang 等自託管選項。
Nemotron 3 Nano 30B A3B 適合哪些用途?
適用於 AI 代理、程式輔助、RAG、文件分析、指令遵循及開放權重實驗。生產前團隊需測試延遲、幻覺行為、安全性及工具調用可靠性。


