Gate.AI博客Nemotron 3 Nano 30B A3B:完整规格、价格、API访问与应用场景(2026)

    Nemotron 3 Nano 30B A3B:完整规格、价格、API访问与应用场景(2026)

    模型

    Nemotron 3 Nano 30B A3B是什么?

    Nemotron 3 Nano 30B A3B是NVIDIA推出的文本专用混合Mamba-Transformer专家混合大语言模型,于2025年12月15日发布。该模型具备可配置的推理能力,支持128K-token的托管API输入输出上限,并在自托管环境下最高可达1M-token上下文窗口。

    在用户提供的Gate.AI模型卡中,免费模型的定价显示为每100万输入token和每100万输出token均为0美元(截至2026年6月)。NVIDIA将模型开发者标注为NVIDIA Corporation,预训练数据更新至2025年6月25日,后训练数据更新至2025年11月28日,并将该模型描述为统一推理与非推理的大语言模型。

    NVIDIA将Nemotron定义为开放权重、开放训练数据和构建专业AI代理的开放模型家族。Nemotron 3 Nano 30B A3B是该家族中适合开发者评估推理、代码、RAG、聊天和智能代理等场景的小型成员,尤其适用于需要自托管或网关API访问的场景。

    研究该模型的团队通常会将其与其他推理或开放权重系统进行对比,例如DeepSeek-R1DeepSeek-V3Qwen2.5 72B Instruct,尤其是在成本、部署控制、上下文长度和工具调用行为方面进行权衡。

    Nemotron 3 Nano 30B A3B的主要规格与定价如何?

    数据参考日期:2026年6月。

    字段 核实数值
    服务商 NVIDIA Corporation,截止2026年6月
    模型家族 NVIDIA Nemotron / Nemotron 3,截止2026年6月
    模型类型 文本专用混合Mamba2-Transformer专家混合大语言模型,适用于推理与聊天,截止2026年6月
    发布日期 2025年12月15日,在Hugging Face和Build.NVIDIA.com上线,截止2026年6月
    上下文窗口 NVIDIA Build模型卡显示托管模型最大输入128K、最大输出128K。官方还说明自托管环境下支持最高1M上下文窗口,Hugging Face默认配置为256K,受显存要求影响,截止2026年6月
    输入定价 Gate.AI用户提供的模型卡显示nvidia/nemotron-3-nano-30b-a3b:free每100万输入token为0美元,截止2026年6月。NVIDIA官方未确认具体token定价
    缓存输入定价 Gate.AI用户提供的模型卡显示该模型的缓存读写字段为“—”,截止2026年6月
    输出定价 Gate.AI用户提供的模型卡显示nvidia/nemotron-3-nano-30b-a3b:free每100万输出token为0美元,截止2026年6月
    定价单位 Gate.AI模型卡以每100万token计价;NVIDIA官方未确认定价单位,截止2026年6月
    模态支持 NVIDIA模型卡仅支持文本输入与文本输出,截止2026年6月
    支持输入类型 文本字符串及一维token序列,截止2026年6月
    支持输出类型 文本字符串及一维token序列,截止2026年6月
    API访问 Gate.AI支持OpenAI兼容聊天API;NVIDIA Build / NIM、自托管Hugging Face、vLLM、TRT-LLM、SGLang等路径均有文档说明,截止2026年6月
    模型ID Gate.AI:nvidia/nemotron-3-nano-30b-a3b:free;NVIDIA Build API:nvidia/nemotron-3-nano-30b-a3b;Hugging Face权重:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16,截止2026年6月
    可用性 NVIDIA官方列出全球部署;Gate.AI模型具体可用性以用户提供的Gate.AI模型卡为准,截止2026年6月
    知识截止 预训练截止:2025年6月25日;后训练截止:2025年11月28日,截止2026年6月
    速率限制 截至2026年6月,官方未确认具体数值速率限制
    微调支持 开放权重及模型使用路径均有文档说明;该模型的托管API微调支持未见官方确认,截止2026年6月
    流式支持 Gate.AI文档说明POST /chat/completions支持流式,截止2026年6月
    批量API支持 截至2026年6月,官方未确认相关信息
    工具/函数调用 NVIDIA文档涵盖工具调用、多步工具使用、结构化输出环境;Gate.AI模型具体工具调用行为未单独确认,截止2026年6月
    结构化输出/JSON模式 NVIDIA文档涵盖结构化输出训练环境;Gate.AI模型具体JSON模式保障未单独确认,截止2026年6月
    许可/使用限制 NVIDIA Nemotron开放模型许可;NVIDIA称该模型已可商用,截止2026年6月

    Nemotron 3 Nano 30B A3B在生产环境有哪些实用价值?

    Nemotron 3 Nano 30B A3B适用于AI代理原型开发,因为NVIDIA将其定位为面向开发者构建AI代理系统、聊天机器人、RAG系统和指令遵循应用的通用推理与聊天模型。这使其适合在工作流自动化、工具辅助助手和内部开发工具等场景进行评估,前提是团队需针对自身任务测试工具可靠性与安全行为。

    当团队可控部署时,该模型对于长上下文实验尤为有用。NVIDIA托管模型卡字段显示最大输入128K、最大输出128K,同时官方说明自托管环境下最高可达1M上下文窗口(需更高显存)。这一差异对于文档审查、代码库分析和RAG流程尤为重要。

    在代码与技术问答方面,NVIDIA将编程语言和开发应用列为主要用途之一。模型后训练数据涵盖合成代码、数学、科学、工具调用、指令遵循、结构化输出及一般知识,但生产团队仍需结合自身代码库、延迟预算和容错需求进行基准测试。

    对于网关测试,Gate.AI文档确认支持OpenAI兼容基础URL、Bearer-token认证、按需计费、/chat/completions/models接口。Gate.AI主页也将Nemotron列入其200+模型覆盖范围,具体免费模型ID和0美元定价来自用户提供的Gate.AI模型卡截图。

    Nemotron 3 Nano 30B A3B支持哪些模态?

    模态 是否支持 说明
    文本输入 NVIDIA支持文本输入、字符串格式及一维序列
    文本输出 NVIDIA支持文本输出、字符串格式及一维序列
    图像输入 未验证 此模型卡仅支持文本输入。NVIDIA另有Nemotron Omni模型支持多模态工作流
    音频输入 未验证 此模型卡仅支持文本输入
    视频输入 未验证 此模型卡仅支持文本输入

    Nemotron 3 Nano 30B A3B有哪些不足?

    主要的规格注意点在于上下文窗口依赖部署方式。NVIDIA模型卡显示最大输入128K、最大输出128K,但官方也说明自托管环境最高可达1M。团队不应假定所有API路径均支持1M token。

    该模型在NVIDIA模型卡中仅支持文本,不应作为多模态模型使用,图像、音频或视频场景需选择专门支持相关模态的模型。

    官方支持语言包括英语、西班牙语、法语、德语、日语和意大利语。NVIDIA也描述更广泛的训练数据,但非官方支持语言的生产质量需单独评估。

    这是通用AI局限,非模型特有:模型可能出现幻觉、误读指令、生成不安全输出、工具调用异常或在高风险法律、医疗、金融、网络安全、合规任务中失败。高风险应用需专家审核与应用级安全防护。

    Nemotron 3 Nano 30B A3B最适合哪些场景?

    应用场景 适用理由 重要限制
    AI代理 NVIDIA定位该模型用于代理系统、聊天机器人、RAG系统及指令遵循应用 工具调用行为需在实际代理框架中验证
    编码辅助 NVIDIA描述主要用途包括英语及编程语言 针对代码库的测试比通用基准更可靠
    RAG与文档问答 长上下文自托管配置可支持大文档输入 托管API与网关限制可能与自托管不同
    成本敏感测试 用户提供的Gate.AI模型卡显示免费版本每100万输入和输出token为0美元 免费路径可能有配额、可用性或速率限制
    开放权重部署 NVIDIA在Hugging Face发布模型,并支持vLLM、SGLang等本地部署工具 自托管需GPU显存、部署经验及监控

    对比开放或网关可访问模型时,团队也可评估Mistral Small 4用于轻量生产路由,或Llama 3.1 70B作为成熟的开放模型基线。

    Nemotron 3 Nano 30B A3B与Qwen3-30B-A3B-Thinking-2507及GPT-OSS-20B对比如何?

    对比维度 Nemotron 3 Nano 30B A3B Qwen3-30B-A3B-Thinking-2507 GPT-OSS-20B 场景适配
    模型类型 混合Mamba2-Transformer专家混合推理/聊天LLM,共30B参数 因果语言模型,30.5B总参数,3.3B激活参数 OpenAI开放权重专家混合语言模型,21B总参数,每token激活参数3.6B 根据任务类型、模型访问方式和部署栈选择
    上下文窗口 托管输入/输出128K;自托管最高1M 原生上下文262,144 token,另有1M上下文配置指导 上下文长度128K 长上下文用户需验证具体部署配置
    模态支持 文本输入与文本输出 文本生成模型 主要英语,文本专用模型家族 三者均为文本模型选择,非多模态替代
    部署方式 Gate.AI API、NVIDIA Build / NIM、Hugging Face、vLLM、TRT-LLM、SGLang路径 Hugging Face、Transformers、vLLM、SGLang及本地应用生态 开放权重本地或托管部署,视服务商而定 部署偏好可能比基准差异更重要
    实用适配 适合NVIDIA生态的开放权重推理、RAG、代理工作流 适合Qwen生态推理及长上下文思考模式工作流 适合本地或边缘开放权重实验 无绝对优胜,需结合任务、语言、延迟、预算与基础设施匹配

    如何通过Gate.AI访问Nemotron 3 Nano 30B A3B?

    Gate.AI访问Nemotron 3 Nano 30B A3B已由用户提供的Gate.AI模型卡截图验证,模型ID为nvidia/nemotron-3-nano-30b-a3b:free

    Gate.AI文档确认支持OpenAI兼容基础URL https://api.gate.ai/openai/v1、Bearer-token认证、POST /chat/completionsGET /models、按需计费模式及聊天流式支持。

    Python示例

    1. from openai import OpenAI
    2. import os
    3. client = OpenAI(
    4. api_key=os.environ["GATEAI_API_KEY"],
    5. base_url="https://api.gate.ai/openai/v1",
    6. )
    7. response = client.chat.completions.create(
    8. model="nvidia/nemotron-3-nano-30b-a3b:free",
    9. messages=[
    10. {
    11. "role": "user",
    12. "content": "Summarize Nemotron 3 Nano 30B A3B in three bullet points."
    13. }
    14. ],
    15. )
    16. print(response.choices[0].message.content)

    curl示例

    1. curl https://api.gate.ai/openai/v1/chat/completions \
    2. -H "Authorization: Bearer $GATEAI_API_KEY" \
    3. -H "Content-Type: application/json" \
    4. -d '{
    5. "model": "nvidia/nemotron-3-nano-30b-a3b:free",
    6. "messages": [
    7. {
    8. "role": "user",
    9. "content": "Explain what Nemotron 3 Nano 30B A3B is used for."
    10. }
    11. ]
    12. }'

    Gate.AI定价文档说明免费模型有免费层,200+模型按需计费,支持API密钥管理、智能路由、支持缓存提示(部分模型)、用量洞察及组织权限。生产团队仍需在仪表盘检查模型配额、路径可用性及免费模型每日限额。

    常见问题

    Nemotron 3 Nano 30B A3B的上下文窗口是多少?

    NVIDIA托管模型卡字段显示最大输入128K、最大输出128K,同时官方说明自托管环境下最高可达1M token。

    Nemotron 3 Nano 30B A3B在Gate.AI上的费用是多少?

    用户提供的Gate.AI模型卡显示nvidia/nemotron-3-nano-30b-a3b:free每100万输入token和每100万输出token均为0美元(截至2026年6月)。

    开发者如何访问Nemotron 3 Nano 30B A3B?

    开发者可通过Gate.AI OpenAI兼容聊天API,使用已验证的Gate.AI模型ID访问。NVIDIA也支持Build / NIM及Hugging Face、vLLM、TRT-LLM、SGLang等自托管选项。

    Nemotron 3 Nano 30B A3B适合哪些用途?

    适用于AI代理、编码辅助、RAG、文档分析、指令遵循及开放权重实验。生产前团队需测试延迟、幻觉行为、安全性及工具调用可靠性。

    本内容不构成任何要约、招揽、或建议。您在做出任何投资决定之前应始终寻求独立的专业建议。请注意,Gate 可能会限制或禁止来自受限制地区的所有或部分服务。请阅读 用户协议了解更多信息。

    相关文章