GPT Image 2:完整規格、定價、API 接入與應用場景(2026)
什麼是 GPT Image 2?
GPT Image 2 是 OpenAI 推出的圖像生成與編輯模型,於 2026年4月隨 ChatGPT Images 2.0 發布,並自 2026年7月起採用彈性的圖像尺寸、高保真圖像輸入及基於 Token 的圖像生成計價方式。根據 OpenAI 的模型文件,GPT Image 2 旨在實現快速、高品質的圖像生成與編輯,支援文字輸入、圖像輸入與圖像輸出。
此模型專為文字生成圖像、參考圖像工作流程、視覺編輯、多語言文字渲染(嵌入於圖像內)及複雜視覺版面設計而打造。OpenAI 在 ChatGPT Images 2.0 的發布資料中特別強調圖像生成的準確性提升、更強的多語言文字處理能力,以及對編輯排版、資訊圖、海報、漫畫等結構化視覺輸出的支援。
GPT Image 2 主要適用於評估 AI 生成靜態圖像的團隊,而非通用聊天、語音或影片生成。使用者在選擇用於活動素材、產品視覺、社群圖形、分鏡與設計原型等場景的工具時,常將其與 GPT Image 1、Sora 2 及其他新一代創意生成模型進行比較。
對於已在評估 OpenAI 模型家族的團隊,GPT Image 2 應被視為專門的視覺生成模型,而非通用推理模型,如 GPT-5.5、o3 或 o4-mini。
GPT Image 2 的主要規格與定價如何?
下表整理了截至 2026年7月的 GPT Image 2 主要規格與定價。OpenAI 官方確認了模型名稱、模態支援及圖像生成定位,定價資料則列出了 GPT Image 2 的標準及批量 Token 價格。
| 欄位 | 官方確認值 |
|---|---|
| 服務商 | OpenAI(截至 2026年7月) |
| 模型家族 | GPT Image / OpenAI 圖像生成模型(截至 2026年7月) |
| 模型類型 | 圖像生成與編輯模型(截至 2026年7月) |
| 發布時間 | 2026年4月,依據 OpenAI ChatGPT Images 2.0 發布資料(截至 2026年7月) |
| 上下文視窗 | 截至 2026年7月,暫無官方確認 |
| 輸入定價 | 標準價格:圖像輸入 \$8.00 / 100萬 Token;文字輸入 \$5.00 / 100萬 Token(截至 2026年7月) |
| 快取輸入定價 | 標準價格:快取圖像輸入 \$2.00 / 100萬 Token;快取文字輸入 \$1.25 / 100萬 Token(截至 2026年7月) |
| 輸出定價 | 標準價格:圖像輸出 \$30.00 / 100萬 Token;GPT Image 2 未列出文字輸出價格,因圖像為主要輸出模態(截至 2026年7月) |
| 批量定價 | 批量價格:圖像輸入 \$4.00 / 100萬 Token,快取圖像輸入 \$1.00 / 100萬 Token,圖像輸出 \$15.00 / 100萬 Token,文字輸入 \$2.50 / 100萬 Token,快取文字輸入 \$0.625 / 100萬 Token(截至 2026年7月) |
| 計價單位 | 每 100萬 Token;最終圖像成本可能因尺寸、品質、提示長度及參考圖像使用而異(截至 2026年7月) |
| 支援模態 | 文字輸入、圖像輸入、圖像輸出;不支援音訊與影片(截至 2026年7月) |
| 支援輸入類型 | 文字與圖像(截至 2026年7月) |
| 支援輸出類型 | 圖像(截至 2026年7月) |
| API 存取 | OpenAI API;Gate.AI 提供 OpenAI 相容圖像端點,詳見 Gate.AI 文件及 Gate.AI model-card ID(截至 2026年7月) |
| OpenAI 模型 ID | gpt-image-2(截至 2026年7月) |
| Gate.AI Model-Card ID | openai/gpt-image-2(截至 2026年7月) |
| 可用性 | OpenAI API 模型文件及 Gate.AI model-card 列表(截至 2026年7月) |
| 知識截止 | 截至 2026年7月暫無官方確認 |
| 速率限制 | 截至 2026年7月暫無官方確認 |
| 微調支援 | 截至 2026年7月暫無官方確認 |
| 流式支援 | Gate.AI 文件說明圖像路徑為同步,目前圖像路徑不經由 stream 欄位(截至 2026年7月) |
| 批量 API 支援 | OpenAI 公布 GPT Image 2 批量定價;生產環境前應確認帳戶級批量可用性(截至 2026年7月) |
| 工具/函數調用 | 截至 2026年7月,未確認為 GPT Image 2 原生特性 |
| 結構化輸出/JSON 模式 | 截至 2026年7月暫無官方確認 |
| 授權/使用限制 | 受 OpenAI 及平台適用政策約束;截至 2026年7月,未單獨確認模型專屬授權條款 |
OpenAI 的定價資料將 GPT Image 2 列為圖像生成模型,分別針對圖像輸入 Token、快取圖像輸入 Token、圖像輸出 Token、文字輸入 Token 及快取文字輸入 Token 定價。Gate.AI 的 openai/gpt-image-2 model-card 概述顯示,輸入價格自 \$5.00 / 100萬 Token 起,輸出價格為 \$30.00 / 100萬 Token,快取讀取自 \$1.25 / 100萬 Token 起。這些數據與 OpenAI 的文字輸入、圖像輸出及快取文字輸入定價一致,但實際生產成本仍需在 Gate.AI 計費視圖中核查。
在比較 GPT Image 2 與圖像、影片及多模態系統時,建議將靜態圖像生成成本與影片生成成本區分。例如,涉及 海螺 2.3、海螺 02、萬 2.5 T2V 預覽 或 萬 2.6 T2V 的工作流程,應分別評估時長、畫質、動作一致性與影片定價,與 GPT Image 2 的圖像 Token 計價模式明確區隔。
GPT Image 2 在生產中有哪些實用價值?
GPT Image 2 適用於需要根據自然語言指令生成或編輯圖像的生產級工作流程。其最適合的場景為靜態圖像生成、參考圖像編輯及結構化視覺創作,而非通用對話、語音或影片合成。
首先,GPT Image 2 可透過文字提示生成視覺概念。這對於需要在設計投入前獲得多種視覺方向的行銷、產品、出版及代理團隊尤其有用。主要限制在於,生成的圖像在發布前仍需經過品牌、事實、法律及權利審查。
其次,GPT Image 2 支援參考圖像及編輯工作流程。高保真圖像輸入對於需要保留來源圖像重要細節(如產品形態、場景構圖、視覺風格、包裝方向或角色一致性)的團隊極具價值。
第三,GPT Image 2 在多語言視覺資產領域表現突出。OpenAI ChatGPT Images 2.0 範例涵蓋多語言字型、全球文字、海報、漫畫、編輯排版及資訊圖輸出,適合在地化草稿及國際創意概念。對比 Hy3 Preview、Seedance 2.0 等創意系統時,應區分靜態圖像版面品質與影片/3D 工作流程。
第四,GPT Image 2 支援複雜視覺版面。適用於社群圖形、產品單頁、活動看板、UI 原型、插畫解說、教育圖表及結構化內容草稿等結構性要求較高的場景。但當圖像包含文字、數字、產品聲明、說明或受規範資訊時,使用者仍須逐一核查每個視覺細節。
第五,GPT Image 2 可協助團隊快速原型創意變體。對於已在使用 Gemini 2.5 Flash、Claude Haiku 4.5 或 MiniMax M3 等文字與推理模型的生產團隊,GPT Image 2 可作為補充,將提示、簡報及視覺參考快速轉化為靜態圖像。
GPT Image 2 支援哪些模態?
OpenAI 明確 GPT Image 2 支援文字輸入、圖像輸入及圖像輸出。根據模型文件,不支援音訊及影片。
| 模態 | 是否支援 | 說明 | 來源狀態 |
|---|---|---|---|
| 文字輸入 | 是 | 用於提示、生成指令及編輯指令(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 圖像輸入 | 是 | 用於參考圖像及編輯工作流程(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 圖像輸出 | 是 | 生成或編輯圖像的主要輸出類型(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 文字輸出 | 非主要輸出 | OpenAI 將圖像列為 GPT Image 2 的輸出模態(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 音訊輸入 | 否 | 不支援音訊(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 音訊輸出 | 否 | 不支援音訊(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 影片輸入 | 否 | 不支援影片(截至 2026年7月) | OpenAI 模型文件已驗證 |
| 影片輸出 | 否 | 不支援影片(截至 2026年7月) | OpenAI 模型文件已驗證 |
由於 GPT Image 2 著重於圖像生成與編輯,不應將其與通用多模態語言模型(如 GPT-4o mini、Gemini 2.0 Flash 或 Claude 3.5 Sonnet)等同對待。後者多用於推理、對話、工具調用或多模態理解,而 GPT Image 2 則專注於圖像輸出。
GPT Image 2 的主要局限有哪些?
GPT Image 2 在實際生產中存在若干重要限制:
官方上下文視窗截至 2026年7月尚未確認。對於圖像生成模型而言,提示長度、輸入圖像處理、輸出解析度、品質設定和 Token 成本通常比類 LLM 的上下文長度更為關鍵。
成本因請求類型而異。簡單的文字生成圖像請求與參考圖像編輯在計價上可能不同,因圖像輸入會增加圖像輸入 Token。OpenAI 將文字輸入、快取文字輸入、圖像輸入、快取圖像輸入及圖像輸出分別計價,團隊應估算整個工作流程成本,而非僅參考單一價格。
GPT Image 2 並非音訊或影片模型。OpenAI 明確不支援音訊與影片,需動畫、時長、鏡頭運動或影片輸出的團隊應單獨評估影片生成模型。影片方向的替代方案可參考 Sora 2、海螺 2.3、萬 2.6 T2V 或 Seedance 2.0,具體選擇可依據地區、接入方式、定價及生產需求。
圖像內文字仍需人工校對。OpenAI 雖強調多語言及結構化視覺渲染能力提升,但包含姓名、價格、聲明、日期、地址、安全說明或受規範資訊的生產資產,仍需人工審核。
生成視覺內容可能帶來品牌、智慧財產權、肖像及真實性風險。這是 AI 普遍局限,除非服務商另有說明。團隊應建立著作權、商標、肖像權、同意、合成媒體揭露及平台合規等審查流程。
高風險視覺內容需專家複核。GPT Image 2 適合草稿、原型或解說視覺,涉及法律、醫療、金融、科研、教育、公共安全或合規敏感場景的圖像,務必由專業人員審查。
GPT Image 2 最適合哪些場景?
「最適合」應理解為特定場景下的適用性。只要團隊需要靜態圖像生成或編輯,並能在發布前審查輸出,GPT Image 2 可滿足以下工作流程需求:
| 應用場景 | 適用原因 | 重要限制 |
|---|---|---|
| 行銷創意草稿 | 支援文字生成圖像、重排版資產及活動概念設計 | 仍需品牌、聲明及權利審查 |
| 產品概念視覺化 | 可根據提示或參考圖生成產品風格原型與視覺變體 | 生成的產品細節可能不準確 |
| 多語言視覺資產 | OpenAI 強調多語言視覺渲染及全球文字範例 | 發布前需人工校對 |
| 編輯插圖 | 適用於文章視覺、雜誌排版、海報及社群圖形 | 事實視覺及說明需核查 |
| 資訊圖與解說圖 | 可輔助結構化視覺版面及教育類圖像草稿 | 數字、圖表與標籤必須核查 |
| 參考圖像編輯 | 高保真輸入適用於基於來源圖的視覺編輯 | 圖像輸入 Token 可能增加總成本 |
| 創意原型 | 快速測試多種視覺方向,提升團隊效率 | 不能取代美術指導、授權審查或生產設計 |
| UI 與介面版面原型 | 有助於探索視覺構圖和介面概念 | 生成的 UI 文字及功能細節可能不可靠 |
GPT Image 2 在與其他規劃、寫作、編碼或推理模型配合時尤其高效。例如,團隊可先用 Qwen3.7 Plus、GLM-5.1、Kimi K2.6 或 Claude Sonnet 4.6 起草創意簡報,再用 GPT Image 2 生成和編輯靜態圖像。
GPT Image 2 與 GPT Image 1.5、Gemini 2.5 Flash 有何不同?
GPT Image 2、GPT Image 1.5 與 Gemini 2.5 Flash 各自適用於不同評估需求。GPT Image 2 與 GPT Image 1.5 均為 OpenAI 的圖像生成模型,而 Gemini 2.5 Flash 更多被視為面向更廣泛文字與視覺任務的快速多模態模型,而非直接取代靜態圖像生成。
| 對比維度 | GPT Image 2 | GPT Image 1.5 | Gemini 2.5 Flash | 場景適配 |
|---|---|---|---|---|
| 主要定位 | 圖像生成與編輯 | 圖像生成與編輯 | 通用多模態模型 | GPT Image 2 更適合生成型圖像輸出 |
| 服務商 | OpenAI | OpenAI | 可依生態、API 需求及工作流程類型選擇 | |
| 輸入模態 | 文字與圖像 | 文字與圖像(基於 OpenAI 圖像模型定價分類) | 多模態輸入,依 API 配置而定 | 圖像生成或編輯為核心時建議選用 GPT Image 2 |
| 輸出模態 | 圖像 | 圖像 | 常用於文字輸出及多模態推理 | 靜態圖像輸出場景 GPT Image 2 更相關 |
| 定價基礎 | 文字/圖像 Token 價格加圖像輸出 Token 價格 | 文字/圖像 Token 價格加圖像輸出 Token 價格 | 供應商特定 Token 定價 | 應比較整個工作流程成本,而非單一 Token 價格 |
| 參考圖像工作流程 | 支援圖像輸入 | OpenAI 圖像工作流程支援參考圖像 | 取決於端點及模型配置 | 編輯型視覺工作流程 GPT Image 2 更適合 |
| 圖像文字/版面 | OpenAI 在 ChatGPT Images 2.0 強調多語言及結構化視覺輸出 | OpenAI 早期圖像生成版本 | 非靜態圖像生成主打 | 海報、資訊圖及視覺版面 GPT Image 2 更具優勢 |
| 主要局限 | 不支援音訊/影片;上下文視窗未確認 | 早期模型版本,定價策略不同 | 非直接圖像輸出替代 | 選擇依是否需要圖像輸出、多模態推理或兩者兼具 |
沒有任何模型適用於所有場景。GPT Image 2 適合專注於靜態圖像生成與編輯的團隊,GPT Image 1.5 適用於對舊版相容性或定價更敏感的場景,Gemini 2.5 Flash 適合需要快速多模態推理而非專門圖像輸出的團隊。
更廣泛的模型選擇時,團隊還可將 GPT Image 2 與通用大型模型(如 DeepSeek V4 Pro、DeepSeek V4 Flash、Qwen3.7 Max 或 Mistral Small 4)對比,特別是在涉及調研、提示編寫、內容策劃或自動化文字處理後再進行圖像生成的工作流程中。
如何透過 Gate.AI 存取 GPT Image 2?
Gate.AI 可透過 model-card ID openai/gpt-image-2 存取。Gate.AI 文件提供 OpenAI 相容的圖像生成基礎 URL、Bearer 認證及同步文字生成圖像端點,回傳圖像 URL 及計費細節。
Gate.AI 文字生成圖像端點使用如下參數:
| 存取欄位 | 官方說明 |
|---|---|
| 基礎 URL | https://api.gate.ai/openai/v1 |
| 認證 | Authorization: Bearer |
| 文字生成圖像端點 | POST /images/generations |
| 請求格式 | JSON 請求體 |
| 必填欄位 | model, prompt |
| 選填欄位 | n, size, response_format, stream |
| 回應結構 | OpenAI 相容的圖像結果結構,含 data[].url |
| 計費細節 | 同步回應可包含用量與計費資訊 |
Gate.AI 亦提供參考圖像端點,適用於圖像到圖像或編輯工作流程。該端點採用 multipart 表單資料,接收參考圖像,並同步回傳圖像 URL 及計費細節;參考圖像會計入圖像 Token 用量。
Python 範例
import osimport requestsapi_key = os.environ["GATEAI_API_KEY"]payload = {"model": "openai/gpt-image-2","prompt": "A clean editorial product photo of a ceramic coffee cup on a wooden desk","n": 1,"size": "1024x1024"}response = requests.post("https://api.gate.ai/openai/v1/images/generations",headers={"Authorization": f"Bearer {api_key}","Content-Type": "application/json",},json=payload,timeout=60,)response.raise_for_status()result = response.json()print(result["data"][0]["url"])
curl 範例
curl https://api.gate.ai/openai/v1/images/generations \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "openai/gpt-image-2","prompt": "A clean editorial product photo of a ceramic coffee cup on a wooden desk","n": 1,"size": "1024x1024"}'
正式上線前,團隊應於 Gate.AI 控制台確認帳戶級模型可用性、速率限制、支援的圖像尺寸、最終計費方式及任何組織級存取控制。
常見問題
GPT Image 2 的主要規格是什麼?
GPT Image 2 是 OpenAI 的圖像生成與編輯模型。截至 2026年7月,OpenAI 支援文字輸入、圖像輸入與圖像輸出。不支援音訊和影片,上下文視窗暫無官方確認。
GPT Image 2 多少錢?
截至 2026年7月,OpenAI 公布的 GPT Image 2 標準價格為:文字輸入 \$5.00 / 100萬 Token,圖像輸入 \$8.00 / 100萬 Token,快取文字輸入 \$1.25 / 100萬 Token,快取圖像輸入 \$2.00 / 100萬 Token,圖像輸出 \$30.00 / 100萬 Token。
可以透過 Gate.AI 使用 GPT Image 2 嗎?
可以。Gate.AI model-card ID 為 openai/gpt-image-2。Gate.AI 文件提供 OpenAI 相容圖像生成基礎 URL、Bearer 認證及同步 POST /images/generations 端點,支援文字生成圖像工作流程。
GPT Image 2 適合做什麼?
GPT Image 2 適用於文字生成圖像、圖像編輯、行銷草圖、產品概念視覺、多語言排版草稿、資訊圖、編輯插圖及參考圖像工作流程。對於事實、法律、品牌及安全敏感內容,仍需人工審查。