Nemotron 3 Nano 30B A3B:完整规格、价格、API访问与应用场景(2026)
Nemotron 3 Nano 30B A3B是什么?
Nemotron 3 Nano 30B A3B是NVIDIA推出的文本专用混合Mamba-Transformer专家混合大语言模型,于2025年12月15日发布。该模型具备可配置的推理能力,支持128K-token的托管API输入输出上限,并在自托管环境下最高可达1M-token上下文窗口。
在用户提供的Gate.AI模型卡中,免费模型的定价显示为每100万输入token和每100万输出token均为0美元(截至2026年6月)。NVIDIA将模型开发者标注为NVIDIA Corporation,预训练数据更新至2025年6月25日,后训练数据更新至2025年11月28日,并将该模型描述为统一推理与非推理的大语言模型。
NVIDIA将Nemotron定义为开放权重、开放训练数据和构建专业AI代理的开放模型家族。Nemotron 3 Nano 30B A3B是该家族中适合开发者评估推理、代码、RAG、聊天和智能代理等场景的小型成员,尤其适用于需要自托管或网关API访问的场景。
研究该模型的团队通常会将其与其他推理或开放权重系统进行对比,例如DeepSeek-R1、DeepSeek-V3和Qwen2.5 72B Instruct,尤其是在成本、部署控制、上下文长度和工具调用行为方面进行权衡。
Nemotron 3 Nano 30B A3B的主要规格与定价如何?
数据参考日期:2026年6月。
| 字段 | 核实数值 |
|---|---|
| 服务商 | NVIDIA Corporation,截止2026年6月 |
| 模型家族 | NVIDIA Nemotron / Nemotron 3,截止2026年6月 |
| 模型类型 | 文本专用混合Mamba2-Transformer专家混合大语言模型,适用于推理与聊天,截止2026年6月 |
| 发布日期 | 2025年12月15日,在Hugging Face和Build.NVIDIA.com上线,截止2026年6月 |
| 上下文窗口 | NVIDIA Build模型卡显示托管模型最大输入128K、最大输出128K。官方还说明自托管环境下支持最高1M上下文窗口,Hugging Face默认配置为256K,受显存要求影响,截止2026年6月 |
| 输入定价 | Gate.AI用户提供的模型卡显示nvidia/nemotron-3-nano-30b-a3b:free每100万输入token为0美元,截止2026年6月。NVIDIA官方未确认具体token定价 |
| 缓存输入定价 | Gate.AI用户提供的模型卡显示该模型的缓存读写字段为“—”,截止2026年6月 |
| 输出定价 | Gate.AI用户提供的模型卡显示nvidia/nemotron-3-nano-30b-a3b:free每100万输出token为0美元,截止2026年6月 |
| 定价单位 | Gate.AI模型卡以每100万token计价;NVIDIA官方未确认定价单位,截止2026年6月 |
| 模态支持 | NVIDIA模型卡仅支持文本输入与文本输出,截止2026年6月 |
| 支持输入类型 | 文本字符串及一维token序列,截止2026年6月 |
| 支持输出类型 | 文本字符串及一维token序列,截止2026年6月 |
| API访问 | Gate.AI支持OpenAI兼容聊天API;NVIDIA Build / NIM、自托管Hugging Face、vLLM、TRT-LLM、SGLang等路径均有文档说明,截止2026年6月 |
| 模型ID | Gate.AI:nvidia/nemotron-3-nano-30b-a3b:free;NVIDIA Build API:nvidia/nemotron-3-nano-30b-a3b;Hugging Face权重:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16,截止2026年6月 |
| 可用性 | NVIDIA官方列出全球部署;Gate.AI模型具体可用性以用户提供的Gate.AI模型卡为准,截止2026年6月 |
| 知识截止 | 预训练截止:2025年6月25日;后训练截止:2025年11月28日,截止2026年6月 |
| 速率限制 | 截至2026年6月,官方未确认具体数值速率限制 |
| 微调支持 | 开放权重及模型使用路径均有文档说明;该模型的托管API微调支持未见官方确认,截止2026年6月 |
| 流式支持 | Gate.AI文档说明POST /chat/completions支持流式,截止2026年6月 |
| 批量API支持 | 截至2026年6月,官方未确认相关信息 |
| 工具/函数调用 | NVIDIA文档涵盖工具调用、多步工具使用、结构化输出环境;Gate.AI模型具体工具调用行为未单独确认,截止2026年6月 |
| 结构化输出/JSON模式 | NVIDIA文档涵盖结构化输出训练环境;Gate.AI模型具体JSON模式保障未单独确认,截止2026年6月 |
| 许可/使用限制 | NVIDIA Nemotron开放模型许可;NVIDIA称该模型已可商用,截止2026年6月 |
Nemotron 3 Nano 30B A3B在生产环境有哪些实用价值?
Nemotron 3 Nano 30B A3B适用于AI代理原型开发,因为NVIDIA将其定位为面向开发者构建AI代理系统、聊天机器人、RAG系统和指令遵循应用的通用推理与聊天模型。这使其适合在工作流自动化、工具辅助助手和内部开发工具等场景进行评估,前提是团队需针对自身任务测试工具可靠性与安全行为。
当团队可控部署时,该模型对于长上下文实验尤为有用。NVIDIA托管模型卡字段显示最大输入128K、最大输出128K,同时官方说明自托管环境下最高可达1M上下文窗口(需更高显存)。这一差异对于文档审查、代码库分析和RAG流程尤为重要。
在代码与技术问答方面,NVIDIA将编程语言和开发应用列为主要用途之一。模型后训练数据涵盖合成代码、数学、科学、工具调用、指令遵循、结构化输出及一般知识,但生产团队仍需结合自身代码库、延迟预算和容错需求进行基准测试。
对于网关测试,Gate.AI文档确认支持OpenAI兼容基础URL、Bearer-token认证、按需计费、/chat/completions和/models接口。Gate.AI主页也将Nemotron列入其200+模型覆盖范围,具体免费模型ID和0美元定价来自用户提供的Gate.AI模型卡截图。
Nemotron 3 Nano 30B A3B支持哪些模态?
| 模态 | 是否支持 | 说明 |
|---|---|---|
| 文本输入 | 是 | NVIDIA支持文本输入、字符串格式及一维序列 |
| 文本输出 | 是 | NVIDIA支持文本输出、字符串格式及一维序列 |
| 图像输入 | 未验证 | 此模型卡仅支持文本输入。NVIDIA另有Nemotron Omni模型支持多模态工作流 |
| 音频输入 | 未验证 | 此模型卡仅支持文本输入 |
| 视频输入 | 未验证 | 此模型卡仅支持文本输入 |
Nemotron 3 Nano 30B A3B有哪些不足?
主要的规格注意点在于上下文窗口依赖部署方式。NVIDIA模型卡显示最大输入128K、最大输出128K,但官方也说明自托管环境最高可达1M。团队不应假定所有API路径均支持1M token。
该模型在NVIDIA模型卡中仅支持文本,不应作为多模态模型使用,图像、音频或视频场景需选择专门支持相关模态的模型。
官方支持语言包括英语、西班牙语、法语、德语、日语和意大利语。NVIDIA也描述更广泛的训练数据,但非官方支持语言的生产质量需单独评估。
这是通用AI局限,非模型特有:模型可能出现幻觉、误读指令、生成不安全输出、工具调用异常或在高风险法律、医疗、金融、网络安全、合规任务中失败。高风险应用需专家审核与应用级安全防护。
Nemotron 3 Nano 30B A3B最适合哪些场景?
| 应用场景 | 适用理由 | 重要限制 |
|---|---|---|
| AI代理 | NVIDIA定位该模型用于代理系统、聊天机器人、RAG系统及指令遵循应用 | 工具调用行为需在实际代理框架中验证 |
| 编码辅助 | NVIDIA描述主要用途包括英语及编程语言 | 针对代码库的测试比通用基准更可靠 |
| RAG与文档问答 | 长上下文自托管配置可支持大文档输入 | 托管API与网关限制可能与自托管不同 |
| 成本敏感测试 | 用户提供的Gate.AI模型卡显示免费版本每100万输入和输出token为0美元 | 免费路径可能有配额、可用性或速率限制 |
| 开放权重部署 | NVIDIA在Hugging Face发布模型,并支持vLLM、SGLang等本地部署工具 | 自托管需GPU显存、部署经验及监控 |
对比开放或网关可访问模型时,团队也可评估Mistral Small 4用于轻量生产路由,或Llama 3.1 70B作为成熟的开放模型基线。
Nemotron 3 Nano 30B A3B与Qwen3-30B-A3B-Thinking-2507及GPT-OSS-20B对比如何?
| 对比维度 | Nemotron 3 Nano 30B A3B | Qwen3-30B-A3B-Thinking-2507 | GPT-OSS-20B | 场景适配 |
|---|---|---|---|---|
| 模型类型 | 混合Mamba2-Transformer专家混合推理/聊天LLM,共30B参数 | 因果语言模型,30.5B总参数,3.3B激活参数 | OpenAI开放权重专家混合语言模型,21B总参数,每token激活参数3.6B | 根据任务类型、模型访问方式和部署栈选择 |
| 上下文窗口 | 托管输入/输出128K;自托管最高1M | 原生上下文262,144 token,另有1M上下文配置指导 | 上下文长度128K | 长上下文用户需验证具体部署配置 |
| 模态支持 | 文本输入与文本输出 | 文本生成模型 | 主要英语,文本专用模型家族 | 三者均为文本模型选择,非多模态替代 |
| 部署方式 | Gate.AI API、NVIDIA Build / NIM、Hugging Face、vLLM、TRT-LLM、SGLang路径 | Hugging Face、Transformers、vLLM、SGLang及本地应用生态 | 开放权重本地或托管部署,视服务商而定 | 部署偏好可能比基准差异更重要 |
| 实用适配 | 适合NVIDIA生态的开放权重推理、RAG、代理工作流 | 适合Qwen生态推理及长上下文思考模式工作流 | 适合本地或边缘开放权重实验 | 无绝对优胜,需结合任务、语言、延迟、预算与基础设施匹配 |
如何通过Gate.AI访问Nemotron 3 Nano 30B A3B?
Gate.AI访问Nemotron 3 Nano 30B A3B已由用户提供的Gate.AI模型卡截图验证,模型ID为nvidia/nemotron-3-nano-30b-a3b:free。
Gate.AI文档确认支持OpenAI兼容基础URL https://api.gate.ai/openai/v1、Bearer-token认证、POST /chat/completions、GET /models、按需计费模式及聊天流式支持。
Python示例
from openai import OpenAIimport osclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)response = client.chat.completions.create(model="nvidia/nemotron-3-nano-30b-a3b:free",messages=[{"role": "user","content": "Summarize Nemotron 3 Nano 30B A3B in three bullet points."}],)print(response.choices[0].message.content)
curl示例
curl https://api.gate.ai/openai/v1/chat/completions \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "nvidia/nemotron-3-nano-30b-a3b:free","messages": [{"role": "user","content": "Explain what Nemotron 3 Nano 30B A3B is used for."}]}'
Gate.AI定价文档说明免费模型有免费层,200+模型按需计费,支持API密钥管理、智能路由、支持缓存提示(部分模型)、用量洞察及组织权限。生产团队仍需在仪表盘检查模型配额、路径可用性及免费模型每日限额。
常见问题
Nemotron 3 Nano 30B A3B的上下文窗口是多少?
NVIDIA托管模型卡字段显示最大输入128K、最大输出128K,同时官方说明自托管环境下最高可达1M token。
Nemotron 3 Nano 30B A3B在Gate.AI上的费用是多少?
用户提供的Gate.AI模型卡显示nvidia/nemotron-3-nano-30b-a3b:free每100万输入token和每100万输出token均为0美元(截至2026年6月)。
开发者如何访问Nemotron 3 Nano 30B A3B?
开发者可通过Gate.AI OpenAI兼容聊天API,使用已验证的Gate.AI模型ID访问。NVIDIA也支持Build / NIM及Hugging Face、vLLM、TRT-LLM、SGLang等自托管选项。
Nemotron 3 Nano 30B A3B适合哪些用途?
适用于AI代理、编码辅助、RAG、文档分析、指令遵循及开放权重实验。生产前团队需测试延迟、幻觉行为、安全性及工具调用可靠性。


