Qwen3.5 122B A10B:完整规格、价格、API 接入与应用场景(2026)
Qwen3.5 122B A10B 是阿里巴巴 Qwen 团队推出的一款大型开源专家混合(Mixture-of-Experts,MoE)模型,专为推理、编程、工具调用、多模态理解以及以智能体为核心的工作流程而设计。该模型于 2026年2月发布,定位介于更小型的 Qwen3.5 部署版本与更大规模的 397B-A17B 版本之间。其 1220 亿总参数、100 亿激活参数以及原生 26.2 万 token 上下文窗口,使其尤为适合希望自部署且兼具强大能力的团队进行评估和落地。
Qwen3.5 122B A10B 是什么?
Qwen3.5 122B A10B 是经过后训练的因果语言模型,配备视觉编码器。官方模型卡文档显示其总参数量为 1220 亿,其中约有 100 亿参数被激活,采用稀疏专家混合结构,包含 256 个专家、8 个路由专家和 1 个共享专家。Qwen 将该 MoE 架构与门控 Delta 网络和门控注意力机制相结合。
该模型于 2026年2月24日与 Qwen3.5-35B-A3B 和 Qwen3.5-27B 同步发布,而 Qwen3.5 系列最早在 2 月初便已推出更大规模的 397B-A17B 模型。
与传统仅支持文本的 LLM 不同,本模型属于 Qwen3.5 的统一视觉-语言架构,适用于包含截图、文档、图表、图片或视频帧等多模态输入的部署场景。这对于需要将文本和视觉内容同时纳入的应用尤为重要。该模型以 Apache 2.0 许可协议开源发布,允许团队按照该协议要求进行自主部署。
Qwen3.5 122B A10B 的主要规格与定价如何?
| 规格 | Qwen3.5 122B A10B |
|---|---|
| 提供方 | Qwen / 阿里巴巴 |
| 发布时间 | 2026年2月24日 |
| 架构 | 带视觉编码器的稀疏 MoE |
| 参数量 | 1220 亿总参数 / 100 亿激活参数 |
| 原生上下文窗口 | 262,144 tokens |
| 扩展上下文 | 文档记录自部署可达 1,010,000 tokens |
| Gate.AI 模型 ID | alibaba/qwen3.5-122b-a10b |
| Gate.AI 公布输入价格 | $0.115 / 每百万 tokens |
| Gate.AI 公布输出价格 | $0.917 / 每百万 tokens |
| 缓存读写 | 未公示 |
| 许可协议 | Apache 2.0 |
官方 Qwen 模型卡记录原生支持 262,144 token,并支持扩展到最多 1,010,000 token。阿里云则针对 API 调用实行分层价格:128K 以内输入按每百万 token $0.115、输出 $0.917 计费,128K-256K区间则为输入 $0.287/M,输出 $2.294/M。以上为直接由提供方发布的价格信息,不应直接视为 Gate.AI 的计费标准。
若简单按照 Gate.AI 公布价格计算,处理 100 万输入 tokens、产生 25 万输出 tokens 的工作量成本约为:
$0.115 + (0.25 × $0.917) = $0.34425
实际价格可能因账号、套餐或其它费用项有所变化。
Qwen3.5 122B A10B 在生产应用中有哪些突出价值?
该模型在智能体及多轮/多步工作流场景中尤为亮眼。Qwen 官方评测涵盖了工具调用、搜索智能体、规划、编程及通用智能体基准测试,该架构每次前向推理只激活部分参数池,实现高效资源利用。
实际部署示例中,模型可接收长篇技术文档、应用程序截图以及一组可调用工具,并可基于综合上下文进行推理,自动判断何时调用何种工具并产出结构化文本输出。生产系统建议对工具参数及生成输出的执行行为设置必要校验,不建议无约束地直接执行生成内容。
本地自部署是一大亮点。Qwen 公布了模型权重,并提供 Transformers、vLLM 与 SGLang 的部署文档,优于仅 API 形式提供的闭源大模型,让有能力的团队可以获得更细致的部署控制权。
如果你还在对比更大规模的开源模型选择,Qwen3 235B A22B 规格参考指南也可作为重要对照。
Qwen3.5 122B A10B 支持哪些模态类型?
| 模态 | 输入 | 输出 | 状态 |
|---|---|---|---|
| 文本 | 是 | 是 | 已验证 |
| 图片 | 是 | 不支持生成图片 | 已验证 |
| 视频 | 是 | 不支持生成视频 | 已通过 Qwen 评测/工作流验证 |
| 音频 | 未公开原生支持 | 否 | 未确认 |
Qwen 方面将 Qwen3.5 122B A10B 定义为图文到文本模型,并在模型卡中直接给出了图片加文本的用例,官方评测套件同样涵盖了视频理解基准。
需明确指出:多模态理解不等于多模态生成。官方已验证输出类型为文本,模型并不具备图片、视频或音频生成能力。
Qwen3.5 122B A10B 的不足之处有哪些?
最主要的运维限制来自于模型规模。虽然单次推理仅激活 100 亿参数,但完整模型总参数高达 1220 亿,自部署依然需要极高的内存与加速硬件资源。
其超长原生上下文窗口,并不意味着所有应用都应该填满 262K token。更大的 prompt 会增加计算开销,而阿里云托管价格机制也表明,长上下文请求可能进入更高的计费档位。
此外,不同平台的参数设置和功能可能有差异。Qwen 公布的开源模型能力,并不自动等价于 Gate.AI 各端点完全支持同样的模态、参数或上下文扩展。
Qwen3.5 122B A10B 最适合哪些场景?
如果你的工作流需要长上下文推理、多模态文档理解、编程、函数调用、或复杂多步智能体规划,并希望保留开源自部署的灵活性,Qwen3.5 122B A10B 是非常契合的选择。
当 1220 亿量级的模型权重在基础设施层面可控且对能力提升有需求时,可优先考虑。若更看重部署效率,可选择更小的 Qwen3.5 27B,如无需自管推理基础设施,则选择托管模型更为便捷。
Qwen3.5 122B A10B 与 Qwen3.5 35B A3B、Qwen3.5 27B 有何区别?
| 模型 | 总参数 / 激活参数 | 原生上下文窗口 | 架构 | 最佳适配场景 |
|---|---|---|---|---|
| Qwen3.5 122B A10B | 1220亿/100亿 | 262K | MoE | 高能力自部署智能体 |
| Qwen3.5 35B A3B | 350亿/30亿 | 262K | MoE | 资源要求较低的 MoE 应用 |
| Qwen3.5 27B | ~270亿稠密 | 262K | 稠密结构 | 更便捷的本地部署 |
三款模型均属 Qwen3.5 代际,均支持视觉-语言工作流,但在硬件资源和运维要求上有明显差异。Qwen 官方公开基准显示,没有单一版本能在所有场景内完全占优,因此模型选择需结合自身业务负载、硬件基础、延迟目标和成本权衡。
对于更专注托管体验的团队,Qwen3.5 Plus 指南也值得参考。
如何通过 Gate.AI 获取 Qwen3.5 122B A10B?
根据 Gate.AI 模型卡信息,模型唯一标识为:
alibaba/qwen3.5-122b-a10b
Gate.AI 支持用 OpenAI 兼容的基础 URL https://api.gate.ai/openai/v1,采用 Bearer-token 认证,标准 Chat Completions 流程。开发者应到模型目录、控制台或 /models 接口获取确切模型 ID 使用。
以下是结合 Gate.AI 官方文档提供的普遍聊天工作流与模型 ID 的教程示例,仅作文档说明,未实际执行验证。
Python
import osfrom openai import OpenAIclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)try:response = client.chat.completions.create(model="alibaba/qwen3.5-122b-a10b",messages=[{"role": "user","content": "Create a concise deployment plan for a tool-using AI agent."}],)print(response.choices[0].message.content)except Exception as error:print(f"Gate.AI request failed: {error}")
cURL
curl https://api.gate.ai/openai/v1/chat/completions \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "alibaba/qwen3.5-122b-a10b","messages": [{"role": "user","content": "Explain when a mixture-of-experts model is useful."}]}'
在生产部署前,务必确认模型对账号依然可用,并查阅 Gate.AI 实时文档或控制台确认当前额度限制、多模态请求格式及定价信息。
如需横向对比相同接口下不同模型系列,推荐查阅 DeepSeek R1 API 指南 与 Llama 3.1 70B 指南。
常见问题
Qwen3.5 122B A10B 是开源权重吗?
是的。Qwen 以 Apache 2.0 许可证开源发布了模型权重,并公开了通过 Transformers、vLLM 和 SGLang 等主流框架部署的文档。
Qwen3.5 122B A10B 实际激活参数有多少?
官方模型卡显示总参数量 1220 亿,激活参数量约为 100 亿,体现为稀疏 MoE 架构。
Qwen3.5 122B A10B 支持图片输入吗?
支持。模型可接受图片与文本输入,输出为文本。Qwen 官方明确支持多模态 Transformer 及服务端示例。
上下文窗口多大?
原生上下文长度为 262,144 tokens,官方文档还支持针对自部署场景扩展至 1,010,000 tokens。
Qwen3.5 122B A10B 在 Gate.AI 上如何计费?
Gate.AI 官方价格为每百万输入 tokens $0.115,每百万输出 tokens $0.917,未公布缓存读写相关费用。平台价格可能变动,生产使用前请务必核查最新费率。


