GLM-4:完整規格、定價、API 存取與應用場景(2026)
什麼是 GLM-4?
GLM-4 是智譜 AI 推出的 GLM 系列大型語言模型,於 2024年1月16日透過 GLM-4 API 正式開放。其主要特色包含核心 GLM-4 版本支援 128K Token 上下文視窗,以及專注於文字處理的能力,如指令跟隨、推理、長上下文處理、串流輸出、函數呼叫與結構化輸出。官方定價以每百萬 Token 的人民幣計價,數據截至 2026年6月。
在 BigModel 當前文件中,GLM-4 指的是一個模型家族,而非單一 API 模型 ID。GLM-4 頁面列出了五個版本:
- GLM-4-Plus
- GLM-4-Air-250414
- GLM-4-AirX
- GLM-4-FlashX-250414
- GLM-4-Flash-250414
用戶通常搜尋 GLM-4,以便比較上下文長度、價格、API 接入、長文檔處理能力、中英文表現,以及與 DeepSeek-V3 和 Qwen2.5-72B Instruct 等替代方案的差異。
GLM-4 並非智譜 AI 最新一代模型。BigModel 當前模型總覽顯示,GLM-5、GLM-5.1、GLM-5.2、GLM-4.7、GLM-4.6、GLM-4.5 等新版本皆高於 GLM-4 系列。因此,本頁面聚焦於 GLM-4 作為已發佈的生產模型家族,而非最新旗艦產品。
GLM-4 的主要參數與價格
| 欄位 | 核實數值 |
|---|---|
| 服務商 | 智譜 AI / BigModel,數據截至 2026年6月 |
| 模型家族 | GLM-4 系列 |
| 模型類型 | 專注文本的大型語言模型家族 |
| 發佈時間 | GLM-4 API 於 2024年1月16日開放,數據截至 2026年6月 |
| 當前 GLM-4 版本 | GLM-4-Plus、GLM-4-Air-250414、GLM-4-AirX、GLM-4-FlashX-250414、GLM-4-Flash-250414 |
| 上下文視窗 | GLM-4-Plus、GLM-4-Air-250414、GLM-4-FlashX-250414、GLM-4-Flash-250414 支援 128K;GLM-4-AirX 支援 8K,數據截至 2026年6月 |
| 最大輸出 | GLM-4-Plus 和 GLM-4-AirX 支援 4K;其他版本輸出上限需參考 BigModel 當前頁面 |
| 輸入價格 | GLM-4 頁面未單獨列出輸入價格;各版本 Token 價格已公佈,數據截至 2026年6月 |
| 輸出價格 | GLM-4 頁面未單獨列出輸出價格;各版本 Token 價格已公佈,數據截至 2026年6月 |
| 各版本價格 | GLM-4-Plus:¥5 /百萬 Token;GLM-4-Air-250414:¥0.5 /百萬 Token;GLM-4-AirX:¥10 /百萬 Token;GLM-4-FlashX-250414:¥0.1 /百萬 Token;GLM-4-Flash-250414:頁面顯示為「/」,數據截至 2026年6月 |
| 快取輸入價格 | 官方管道未確認,數據截至 2026年6月 |
| 計價單位 | GLM-4 頁面以每百萬 Token 的人民幣計價,數據截至 2026年6月 |
| 模態支援 | GLM-4 語言模型支援文本輸入與文本輸出,數據截至 2026年6月 |
| API 接入 | BigModel 聊天補全 API 與智譜 / Z.ai SDK 範例均有文件,數據截至 2026年6月 |
| API 端點 | /api/paas/v4/chat/completions |
| 範例模型 ID | glm-4-plus |
| 驗證方式 | Bearer-token 授權 |
| 併發限制 | 依用戶等級與模型版本設定併發請求上限;具體生產環境限制取決於帳號等級,數據截至 2026年6月 |
| 微調支援 | GLM-4 頁面未確認這些託管版本是否支援微調,數據截至 2026年6月 |
| 串流輸出支援 | 支援,數據截至 2026年6月 |
| 工具 / 函數呼叫 | 支援,數據截至 2026年6月 |
| 結構化輸出 / JSON 模式 | 支援結構化 JSON 輸出,數據截至 2026年6月 |
| 授權 / 使用限制 | GLM-4 頁面未明確列出,數據截至 2026年6月 |
GLM-4 在生產場景中的核心價值
GLM-4 在團隊選擇 128K 版本時,非常適合 長上下文文本工作流程。可用於文件摘要、合約審查準備、政策抽取、知識庫問答、檢索增強生成等場景。但長上下文並不代表可以省略原始資料驗證、分段策略與輸出檢核。
GLM-4 支援 結構化應用工作流程,官方文件列出串流輸出、函數呼叫、上下文快取、結構化輸出及 MCP 風格的外部工具或資料來源接入。這些功能適用於客服路由、欄位抽取、工作流程代理、需要 JSON 類輸出的應用後端。生產團隊仍需驗證輸出格式並設計容錯處理。
GLM-4 在 中英文及多語言文本處理 方面表現優異。BigModel GLM-4 頁面推薦翻譯與多語混合文本處理場景,並指出 GLM-4-Flash-250414 支援多達 26 種語言。
評估雙語助手時,團隊可將 GLM-4 與 DeepSeek-R1(適合推理型場景)及 Claude 3.5 Sonnet(適合指令跟隨型場景)進行比較。
GLM-4 支援哪些模態?
| 模態 | 是否支援 | 備註 |
|---|---|---|
| 文字輸入 | 支援 | GLM-4 語言模型版本均已列出 |
| 文字輸出 | 支援 | GLM-4 語言模型版本均已列出 |
| 影像輸入 | 未確認 | BigModel 有單獨視覺模型類別 |
| 音訊輸入 | 未確認 | GLM-4 文件未確認音訊輸入支援 |
| 影片輸入 | 未確認 | BigModel 有單獨影片模型類別 |
| 串流輸出 | 支援 | BigModel 聊天補全場景已文件化 |
| 函數呼叫 | 支援 | 官方文件已說明 |
| 結構化文字輸出 | 支援 | 支援 JSON 風格結構化輸出 |
| 上下文快取 | 支援 | 官方文件已說明 |
| MCP / 外部工具接入 | 支援 | 文件提及外部工具或資料來源接入 |
GLM-4 的侷限性
GLM-4 的主要文件問題是命名不夠清晰。「GLM-4」指的是一個家族,實際生產需指定具體版本與模型 ID,如 glm-4-plus。
價格對比也需謹慎。GLM-4 頁面僅列出各版本 Token 價格,並未明確區分輸入與輸出價格。因此,與 GPT-4o mini 或 Mistral Large 等模型直接比較成本時,需統一計費假設。
GLM-4 語言模型版本以文本為主。若需原生影像、音訊、影片理解,建議評估專用多模態模型,不應假設 GLM-4 本身支援這些模態。
此外,AI 的通用侷限並非模型特有:GLM-4 可能出現幻覺、誤解模糊指令、生成看似合理但實際錯誤的輸出。法律、醫療、金融、安全等關鍵場景必須由專家審查並獨立驗證。
GLM-4 最適合哪些場景?
| 應用場景 | GLM-4 適用理由 | 重要限制 |
|---|---|---|
| 長文檔分析 | 128K 版本支援更大輸入與文件上下文 | 長上下文仍需檢索設計與結果驗證 |
| 中英雙語助手 | GLM-4 為中國團隊開發,官方推薦翻譯與多語場景 | 產業術語需實際測試 |
| 結構化抽取 | 已文件化 JSON 輸出與函數呼叫 | 輸出需檢核格式 |
| 低延遲或高併發文本應用 | FlashX 與 AirX 版本定位速度或併發 | 實際延遲取決於負載、帳號等級與部署條件 |
| 工作流程自動化 | 串流輸出、工具與結構化輸出可支援應用後端 | 代理工作流程需監控、保護措施與重試邏輯 |
GLM-4 與 DeepSeek-V3、Qwen2.5-72B Instruct 對比
| 對比維度 | GLM-4 | DeepSeek-V3 | Qwen2.5-72B Instruct | 場景適配 |
|---|---|---|---|---|
| 服務商 | 智譜 AI / BigModel | DeepSeek | Qwen / 阿里生態 | 服務商選擇取決於 API 接入、託管、合規與生態 |
| 接入方式 | BigModel 託管 API | DeepSeek API 或第三方閘道,視部署而定 | 開源權重與託管選項,取決於服務商 | GLM-4 適合 BigModel API 工作流程;Qwen 適合開源權重部署 |
| 上下文 | 關鍵版本支援 128K;GLM-4-AirX 支援 8K | 需查閱當前 DeepSeek 版本 | 常作為長上下文開源指令模型評估,具體部署取決於服務堆疊 | 長文檔任務需比較可用上下文、輸出上限與檢索設計 |
| 模態 | GLM-4 語言模型支援文本輸入與輸出 | 核心聊天模型主要支援文本,除非另有說明 | 專注文本的指令模型 | 影像、音訊、影片需求建議使用專用多模態模型 |
| 成本對比 | GLM-4 頁面以每百萬 Token 的人民幣計價,未明確區分輸入輸出 | 需查閱當前 DeepSeek 定價 | 成本取決於託管服務商或自建基礎設施 | 成本敏感團隊需統一輸入、輸出、快取、批量與託管成本 |
| 最佳適配 | 中英文文本工作流程、BigModel API 用戶、結構化應用場景 | DeepSeek 生態用戶及高能力文本模型對比 | 偏好開源權重部署與基礎設施控制的團隊 | 可按接入方式、治理需求、延遲與成本模型選擇 |
如何接入 GLM-4?
開發者可透過智譜 AI 的 BigModel API 接入 GLM-4 各版本。官方 GLM-4 文件提供了聊天補全範例,使用端點 /api/paas/v4/chat/completions、Bearer-token 授權,以及範例模型 ID glm-4-plus。
Python 範例
import osfrom zai import ZhipuAiClientclient = ZhipuAiClient(api_key=os.environ["ZHIPUAI_API_KEY"])response = client.chat.completions.create(model="glm-4-plus",messages=[{"role": "system", "content": "You are a concise technical assistant."},{"role": "user", "content": "Summarize GLM-4 in three bullet points."}],max_tokens=1024,temperature=0.7)print(response.choices[0].message.content)
curl 範例
curl -X POST "https://open.bigmodel.cn/api/paas/v4/chat/completions" \-H "Authorization: Bearer $ZHIPUAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "glm-4-plus","messages": [{"role": "system", "content": "You are a concise technical assistant."},{"role": "user", "content": "Summarize GLM-4 in three bullet points."}],"max_tokens": 1024,"temperature": 0.7}'
實際應用需根據工作負載選擇對應 GLM-4 版本。GLM-4-Plus、Air、AirX、FlashX、Flash 等版本在上下文長度、最大輸出、速度定位、併發能力與價格上皆有差異。
常見問題
GLM-4 的上下文視窗是多少?
截至 2026年6月,BigModel 列出 GLM-4-Plus、GLM-4-Air-250414、GLM-4-FlashX-250414、GLM-4-Flash-250414 支援 128K 上下文視窗。GLM-4-AirX 支援 8K。
GLM-4 的價格是多少?
GLM-4 頁面公佈各版本價格,按每百萬 Token 計價:GLM-4-Plus ¥5,GLM-4-Air-250414 ¥0.5,GLM-4-AirX ¥10,GLM-4-FlashX-250414 ¥0.1。
開發者如何接入 GLM-4?
開發者可透過智譜 AI 的 BigModel API 接入 GLM-4。官方範例採用 Bearer-token 授權、聊天補全端點,以及如 glm-4-plus 等模型 ID。
GLM-4 是否優於 DeepSeek-V3 或 Qwen2.5-72B?
沒有絕對優勝者。GLM-4 適合 BigModel API 與中英文文本工作流程,DeepSeek-V3 適合 DeepSeek API 用戶,Qwen2.5-72B 適合偏好開源權重部署的團隊。


