Gate.AI博客Qwen3.5 122B A10B:完整规格、价格、API 接入与应用场景(2026)

    Qwen3.5 122B A10B:完整规格、价格、API 接入与应用场景(2026)

    模型

    Qwen3.5 122B A10B 是阿里巴巴 Qwen 团队推出的一款大型开源专家混合(Mixture-of-Experts,MoE)模型,专为推理、编程、工具调用、多模态理解以及以智能体为核心的工作流程而设计。该模型于 2026年2月发布,定位介于更小型的 Qwen3.5 部署版本与更大规模的 397B-A17B 版本之间。其 1220 亿总参数、100 亿激活参数以及原生 26.2 万 token 上下文窗口,使其尤为适合希望自部署且兼具强大能力的团队进行评估和落地。

    Qwen3.5 122B A10B 是什么?

    Qwen3.5 122B A10B 是经过后训练的因果语言模型,配备视觉编码器。官方模型卡文档显示其总参数量为 1220 亿,其中约有 100 亿参数被激活,采用稀疏专家混合结构,包含 256 个专家、8 个路由专家和 1 个共享专家。Qwen 将该 MoE 架构与门控 Delta 网络和门控注意力机制相结合。

    该模型于 2026年2月24日与 Qwen3.5-35B-A3B 和 Qwen3.5-27B 同步发布,而 Qwen3.5 系列最早在 2 月初便已推出更大规模的 397B-A17B 模型。

    与传统仅支持文本的 LLM 不同,本模型属于 Qwen3.5 的统一视觉-语言架构,适用于包含截图、文档、图表、图片或视频帧等多模态输入的部署场景。这对于需要将文本和视觉内容同时纳入的应用尤为重要。该模型以 Apache 2.0 许可协议开源发布,允许团队按照该协议要求进行自主部署。

    Qwen3.5 122B A10B 的主要规格与定价如何?

    规格 Qwen3.5 122B A10B
    提供方 Qwen / 阿里巴巴
    发布时间 2026年2月24日
    架构 带视觉编码器的稀疏 MoE
    参数量 1220 亿总参数 / 100 亿激活参数
    原生上下文窗口 262,144 tokens
    扩展上下文 文档记录自部署可达 1,010,000 tokens
    Gate.AI 模型 ID alibaba/qwen3.5-122b-a10b
    Gate.AI 公布输入价格 $0.115 / 每百万 tokens
    Gate.AI 公布输出价格 $0.917 / 每百万 tokens
    缓存读写 未公示
    许可协议 Apache 2.0

    官方 Qwen 模型卡记录原生支持 262,144 token,并支持扩展到最多 1,010,000 token。阿里云则针对 API 调用实行分层价格:128K 以内输入按每百万 token $0.115、输出 $0.917 计费,128K-256K区间则为输入 $0.287/M,输出 $2.294/M。以上为直接由提供方发布的价格信息,不应直接视为 Gate.AI 的计费标准。

    若简单按照 Gate.AI 公布价格计算,处理 100 万输入 tokens、产生 25 万输出 tokens 的工作量成本约为:

    $0.115 + (0.25 × $0.917) = $0.34425

    实际价格可能因账号、套餐或其它费用项有所变化。

    Qwen3.5 122B A10B 在生产应用中有哪些突出价值?

    该模型在智能体及多轮/多步工作流场景中尤为亮眼。Qwen 官方评测涵盖了工具调用、搜索智能体、规划、编程及通用智能体基准测试,该架构每次前向推理只激活部分参数池,实现高效资源利用。

    实际部署示例中,模型可接收长篇技术文档、应用程序截图以及一组可调用工具,并可基于综合上下文进行推理,自动判断何时调用何种工具并产出结构化文本输出。生产系统建议对工具参数及生成输出的执行行为设置必要校验,不建议无约束地直接执行生成内容。

    本地自部署是一大亮点。Qwen 公布了模型权重,并提供 Transformers、vLLM 与 SGLang 的部署文档,优于仅 API 形式提供的闭源大模型,让有能力的团队可以获得更细致的部署控制权。

    如果你还在对比更大规模的开源模型选择,Qwen3 235B A22B 规格参考指南也可作为重要对照。

    Qwen3.5 122B A10B 支持哪些模态类型?

    模态 输入 输出 状态
    文本 已验证
    图片 不支持生成图片 已验证
    视频 不支持生成视频 已通过 Qwen 评测/工作流验证
    音频 未公开原生支持 未确认

    Qwen 方面将 Qwen3.5 122B A10B 定义为图文到文本模型,并在模型卡中直接给出了图片加文本的用例,官方评测套件同样涵盖了视频理解基准。

    需明确指出:多模态理解不等于多模态生成。官方已验证输出类型为文本,模型并不具备图片、视频或音频生成能力。

    Qwen3.5 122B A10B 的不足之处有哪些?

    最主要的运维限制来自于模型规模。虽然单次推理仅激活 100 亿参数,但完整模型总参数高达 1220 亿,自部署依然需要极高的内存与加速硬件资源。

    其超长原生上下文窗口,并不意味着所有应用都应该填满 262K token。更大的 prompt 会增加计算开销,而阿里云托管价格机制也表明,长上下文请求可能进入更高的计费档位。

    此外,不同平台的参数设置和功能可能有差异。Qwen 公布的开源模型能力,并不自动等价于 Gate.AI 各端点完全支持同样的模态、参数或上下文扩展。

    Qwen3.5 122B A10B 最适合哪些场景?

    如果你的工作流需要长上下文推理、多模态文档理解、编程、函数调用、或复杂多步智能体规划,并希望保留开源自部署的灵活性,Qwen3.5 122B A10B 是非常契合的选择。

    当 1220 亿量级的模型权重在基础设施层面可控且对能力提升有需求时,可优先考虑。若更看重部署效率,可选择更小的 Qwen3.5 27B,如无需自管推理基础设施,则选择托管模型更为便捷。

    Qwen3.5 122B A10B 与 Qwen3.5 35B A3B、Qwen3.5 27B 有何区别?

    模型 总参数 / 激活参数 原生上下文窗口 架构 最佳适配场景
    Qwen3.5 122B A10B 1220亿/100亿 262K MoE 高能力自部署智能体
    Qwen3.5 35B A3B 350亿/30亿 262K MoE 资源要求较低的 MoE 应用
    Qwen3.5 27B ~270亿稠密 262K 稠密结构 更便捷的本地部署

    三款模型均属 Qwen3.5 代际,均支持视觉-语言工作流,但在硬件资源和运维要求上有明显差异。Qwen 官方公开基准显示,没有单一版本能在所有场景内完全占优,因此模型选择需结合自身业务负载、硬件基础、延迟目标和成本权衡。

    对于更专注托管体验的团队,Qwen3.5 Plus 指南也值得参考。

    如何通过 Gate.AI 获取 Qwen3.5 122B A10B?

    根据 Gate.AI 模型卡信息,模型唯一标识为:

    alibaba/qwen3.5-122b-a10b

    Gate.AI 支持用 OpenAI 兼容的基础 URL https://api.gate.ai/openai/v1,采用 Bearer-token 认证,标准 Chat Completions 流程。开发者应到模型目录、控制台或 /models 接口获取确切模型 ID 使用。

    以下是结合 Gate.AI 官方文档提供的普遍聊天工作流与模型 ID 的教程示例,仅作文档说明,未实际执行验证

    Python

    1. import os
    2. from openai import OpenAI
    3. client = OpenAI(
    4. api_key=os.environ["GATEAI_API_KEY"],
    5. base_url="https://api.gate.ai/openai/v1",
    6. )
    7. try:
    8. response = client.chat.completions.create(
    9. model="alibaba/qwen3.5-122b-a10b",
    10. messages=[
    11. {
    12. "role": "user",
    13. "content": "Create a concise deployment plan for a tool-using AI agent."
    14. }
    15. ],
    16. )
    17. print(response.choices[0].message.content)
    18. except Exception as error:
    19. print(f"Gate.AI request failed: {error}")

    cURL

    1. curl https://api.gate.ai/openai/v1/chat/completions \
    2. -H "Authorization: Bearer $GATEAI_API_KEY" \
    3. -H "Content-Type: application/json" \
    4. -d '{
    5. "model": "alibaba/qwen3.5-122b-a10b",
    6. "messages": [
    7. {
    8. "role": "user",
    9. "content": "Explain when a mixture-of-experts model is useful."
    10. }
    11. ]
    12. }'

    在生产部署前,务必确认模型对账号依然可用,并查阅 Gate.AI 实时文档或控制台确认当前额度限制、多模态请求格式及定价信息。

    如需横向对比相同接口下不同模型系列,推荐查阅 DeepSeek R1 API 指南Llama 3.1 70B 指南

    常见问题

    Qwen3.5 122B A10B 是开源权重吗?

    是的。Qwen 以 Apache 2.0 许可证开源发布了模型权重,并公开了通过 Transformers、vLLM 和 SGLang 等主流框架部署的文档。

    Qwen3.5 122B A10B 实际激活参数有多少?

    官方模型卡显示总参数量 1220 亿,激活参数量约为 100 亿,体现为稀疏 MoE 架构。

    Qwen3.5 122B A10B 支持图片输入吗?

    支持。模型可接受图片与文本输入,输出为文本。Qwen 官方明确支持多模态 Transformer 及服务端示例。

    上下文窗口多大?

    原生上下文长度为 262,144 tokens,官方文档还支持针对自部署场景扩展至 1,010,000 tokens。

    Qwen3.5 122B A10B 在 Gate.AI 上如何计费?

    Gate.AI 官方价格为每百万输入 tokens $0.115每百万输出 tokens $0.917,未公布缓存读写相关费用。平台价格可能变动,生产使用前请务必核查最新费率。

    本内容不构成任何要约、招揽、或建议。您在做出任何投资决定之前应始终寻求独立的专业建议。请注意,Gate 可能会限制或禁止来自受限制地区的所有或部分服务。请阅读 用户协议了解更多信息。

    相关文章