GLM-4:完整规格、定价、API访问与应用场景(2026)
什么是 GLM-4?
GLM-4 是智谱 AI 推出的 GLM 系列大语言模型,于 2024年1月16日通过 GLM-4 API 正式开放。其主要特性包括在核心 GLM-4 版本中支持 128K Token 上下文窗口,以及专注于文本处理的能力,如指令跟随、推理、长上下文处理、流式输出、函数调用和结构化输出。官方定价以每百万 Token 的人民币计价,数据截至 2026年6月。
在 BigModel 当前文档中,GLM-4 指的是一个模型家族,而非单一 API 模型 ID。GLM-4 页面列出了五个版本:
- GLM-4-Plus
- GLM-4-Air-250414
- GLM-4-AirX
- GLM-4-FlashX-250414
- GLM-4-Flash-250414
用户通常搜索 GLM-4,以便比较上下文长度、价格、API 接入、长文档处理能力、中英文表现,以及与 DeepSeek-V3 和 Qwen2.5-72B Instruct 等替代方案的差异。
GLM-4 并非智谱 AI 最新一代模型。BigModel 当前模型总览显示,GLM-5、GLM-5.1、GLM-5.2、GLM-4.7、GLM-4.6、GLM-4.5 等新版本均高于 GLM-4 系列。因此,本页面聚焦于 GLM-4 作为已发布生产模型家族,而非最新旗舰产品。
GLM-4 的主要参数与价格
| 字段 | 核实数值 |
|---|---|
| 服务商 | 智谱 AI / BigModel,数据截至 2026年6月 |
| 模型家族 | GLM-4 系列 |
| 模型类型 | 专注文本的大语言模型家族 |
| 发布时间 | GLM-4 API 于 2024年1月16日开放,数据截至 2026年6月 |
| 当前 GLM-4 版本 | GLM-4-Plus、GLM-4-Air-250414、GLM-4-AirX、GLM-4-FlashX-250414、GLM-4-Flash-250414 |
| 上下文窗口 | GLM-4-Plus、GLM-4-Air-250414、GLM-4-FlashX-250414、GLM-4-Flash-250414 支持 128K;GLM-4-AirX 支持 8K,数据截至 2026年6月 |
| 最大输出 | GLM-4-Plus 和 GLM-4-AirX 支持 4K;其他版本输出上限需参考 BigModel 当前页面 |
| 输入价格 | GLM-4 页面未单独列出输入价格;各版本 Token 价格已公布,数据截至 2026年6月 |
| 输出价格 | GLM-4 页面未单独列出输出价格;各版本 Token 价格已公布,数据截至 2026年6月 |
| 各版本价格 | GLM-4-Plus:¥5 /百万 Token;GLM-4-Air-250414:¥0.5 /百万 Token;GLM-4-AirX:¥10 /百万 Token;GLM-4-FlashX-250414:¥0.1 /百万 Token;GLM-4-Flash-250414:页面显示为“/”,数据截至 2026年6月 |
| 缓存输入价格 | 官方渠道未确认,数据截至 2026年6月 |
| 计价单位 | GLM-4 页面以每百万 Token 的人民币计价,数据截至 2026年6月 |
| 模态支持 | GLM-4 语言模型支持文本输入与文本输出,数据截至 2026年6月 |
| API 接入 | BigModel 聊天补全 API 与智谱 / Z.ai SDK 示例均有文档,数据截至 2026年6月 |
| API 端点 | /api/paas/v4/chat/completions |
| 示例模型 ID | glm-4-plus |
| 鉴权方式 | Bearer-token 授权 |
| 并发限制 | 按用户等级与模型版本设定并发请求上限;具体生产环境限制取决于账号等级,数据截至 2026年6月 |
| 微调支持 | GLM-4 页面未确认这些托管版本是否支持微调,数据截至 2026年6月 |
| 流式输出支持 | 支持,数据截至 2026年6月 |
| 工具 / 函数调用 | 支持,数据截至 2026年6月 |
| 结构化输出 / JSON 模式 | 支持结构化 JSON 输出,数据截至 2026年6月 |
| 许可 / 使用限制 | GLM-4 页面未明确列出,数据截至 2026年6月 |
GLM-4 在生产场景中的核心价值
GLM-4 在团队选择 128K 版本时,非常适合 长上下文文本工作流。可用于文档摘要、合同审查准备、政策抽取、知识库问答、检索增强生成等场景。但长上下文并不意味着可以省略源数据校验、分块策略与输出验证。
GLM-4 支持 结构化应用工作流,官方文档列出流式输出、函数调用、上下文缓存、结构化输出及 MCP 风格的外部工具或数据源接入。这些功能适用于客服路由、字段抽取、工作流代理、需要 JSON 类输出的应用后端。生产团队仍需验证输出格式并设计容错处理。
GLM-4 在 中英文及多语种文本处理 方面表现突出。BigModel GLM-4 页面推荐翻译与多语混合文本处理场景,并指出 GLM-4-Flash-250414 支持多达 26 种语言。
评估双语助手时,团队可将 GLM-4 与 DeepSeek-R1(适合推理型场景)及 Claude 3.5 Sonnet(适合指令跟随型场景)进行对比。
GLM-4 支持哪些模态?
| 模态 | 是否支持 | 备注 |
|---|---|---|
| 文本输入 | 支持 | GLM-4 语言模型版本均已列出 |
| 文本输出 | 支持 | GLM-4 语言模型版本均已列出 |
| 图像输入 | 未确认 | BigModel 有单独视觉模型类别 |
| 音频输入 | 未确认 | GLM-4 文档未确认音频输入支持 |
| 视频输入 | 未确认 | BigModel 有单独视频模型类别 |
| 流式输出 | 支持 | BigModel 聊天补全场景已文档化 |
| 函数调用 | 支持 | 官方文档已说明 |
| 结构化文本输出 | 支持 | 支持 JSON 风格结构化输出 |
| 上下文缓存 | 支持 | 官方文档已说明 |
| MCP / 外部工具接入 | 支持 | 文档提及外部工具或数据源接入 |
GLM-4 的局限性
GLM-4 的主要文档问题是命名不够清晰。“GLM-4”指的是一个家族,实际生产需指定具体版本与模型 ID,如 glm-4-plus。
价格对比也需谨慎。GLM-4 页面只列出了各版本 Token 价格,并未明确区分输入与输出价格。因此,与 GPT-4o mini 或 Mistral Large 等模型直接比较成本时,需统一计费假设。
GLM-4 语言模型版本以文本为主。若需原生图像、音频、视频理解,建议评估专用多模态模型,不应假设 GLM-4 本身支持这些模态。
此外,AI 的通用局限并非模型特有:GLM-4 可能出现幻觉、误解模糊指令、生成看似合理但实际错误的输出。法律、医疗、金融、安全等关键场景必须由专家审核并独立验证。
GLM-4 最适合哪些场景?
| 应用场景 | GLM-4 适用理由 | 重要限制 |
|---|---|---|
| 长文档分析 | 128K 版本支持更大输入与文档上下文 | 长上下文仍需检索设计与结果验证 |
| 中英双语助手 | GLM-4 为中国团队开发,官方推荐翻译与多语场景 | 行业术语需实际测试 |
| 结构化抽取 | 已文档化 JSON 输出与函数调用 | 输出需校验格式 |
| 低延迟或高并发文本应用 | FlashX 与 AirX 版本定位速度或并发 | 实际延迟取决于负载、账号等级与部署条件 |
| 工作流自动化 | 流式输出、工具与结构化输出可支持应用后端 | 代理工作流需监控、保护措施与重试逻辑 |
GLM-4 与 DeepSeek-V3、Qwen2.5-72B Instruct 对比
| 对比维度 | GLM-4 | DeepSeek-V3 | Qwen2.5-72B Instruct | 场景适配 |
|---|---|---|---|---|
| 服务商 | 智谱 AI / BigModel | DeepSeek | Qwen / 阿里生态 | 服务商选择取决于 API 接入、托管、合规与生态 |
| 接入方式 | BigModel 托管 API | DeepSeek API 或第三方网关,视部署而定 | 开源权重与托管选项,取决于服务商 | GLM-4 适合 BigModel API 工作流;Qwen 适合开源权重部署 |
| 上下文 | 关键版本支持 128K;GLM-4-AirX 支持 8K | 需查阅当前 DeepSeek 版本 | 常作为长上下文开源指令模型评估,具体部署取决于服务栈 | 长文档任务需比较可用上下文、输出上限与检索设计 |
| 模态 | GLM-4 语言模型支持文本输入与输出 | 核心聊天模型主要支持文本,除非另有说明 | 专注文本的指令模型 | 图像、音频、视频需求建议使用专用多模态模型 |
| 成本对比 | GLM-4 页面以每百万 Token 的人民币计价,未明确区分输入输出 | 需查阅当前 DeepSeek 定价 | 成本取决于托管服务商或自建基础设施 | 成本敏感团队需统一输入、输出、缓存、批量与托管成本 |
| 最佳适配 | 中英文本工作流、BigModel API 用户、结构化应用场景 | DeepSeek 生态用户及高能力文本模型对比 | 偏好开源权重部署与基础设施控制的团队 | 可按接入方式、治理需求、延迟与成本模型选择 |
如何接入 GLM-4?
开发者可通过智谱 AI 的 BigModel API 接入 GLM-4 各版本。官方 GLM-4 文档提供了聊天补全示例,使用端点 /api/paas/v4/chat/completions、Bearer-token 授权,以及示例模型 ID glm-4-plus。
Python 示例
import osfrom zai import ZhipuAiClientclient = ZhipuAiClient(api_key=os.environ["ZHIPUAI_API_KEY"])response = client.chat.completions.create(model="glm-4-plus",messages=[{"role": "system", "content": "You are a concise technical assistant."},{"role": "user", "content": "Summarize GLM-4 in three bullet points."}],max_tokens=1024,temperature=0.7)print(response.choices[0].message.content)
curl 示例
curl -X POST "https://open.bigmodel.cn/api/paas/v4/chat/completions" \-H "Authorization: Bearer $ZHIPUAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "glm-4-plus","messages": [{"role": "system", "content": "You are a concise technical assistant."},{"role": "user", "content": "Summarize GLM-4 in three bullet points."}],"max_tokens": 1024,"temperature": 0.7}'
实际应用需根据工作负载选择对应 GLM-4 版本。GLM-4-Plus、Air、AirX、FlashX、Flash 等版本在上下文长度、最大输出、速度定位、并发能力和价格上均有差异。
常见问题
GLM-4 的上下文窗口是多少?
截至 2026年6月,BigModel 列出 GLM-4-Plus、GLM-4-Air-250414、GLM-4-FlashX-250414、GLM-4-Flash-250414 支持 128K 上下文窗口。GLM-4-AirX 支持 8K。
GLM-4 的价格是多少?
GLM-4 页面公布各版本价格,按每百万 Token 计价:GLM-4-Plus ¥5,GLM-4-Air-250414 ¥0.5,GLM-4-AirX ¥10,GLM-4-FlashX-250414 ¥0.1。
开发者如何接入 GLM-4?
开发者可通过智谱 AI 的 BigModel API 接入 GLM-4。官方示例采用 Bearer-token 授权、聊天补全端点,以及如 glm-4-plus 等模型 ID。
GLM-4 是否优于 DeepSeek-V3 或 Qwen2.5-72B?
没有绝对优胜者。GLM-4 适合 BigModel API 与中英文本工作流,DeepSeek-V3 适合 DeepSeek API 用户,Qwen2.5-72B 适合偏好开源权重部署的团队。


