GPT-4o mini TTS:完整規格、定價、API 接入與應用場景(2026)
什麼是 GPT-4o mini TTS?
GPT-4o mini TTS 是 OpenAI 推出的可控文本轉語音模型,於 2025年3月20日發佈,最大輸入長度為 2,000 個令牌。截至 2026年7月,API 按令牌計價,文字輸入每百萬令牌收費 $0.60,音訊輸出每百萬令牌收費 $12。
此模型將書面文字轉換為生成語音,而非傳統文字回應。它基於 GPT-4o mini 架構,專為需要自然語音播報、串流語音、多語言音訊或語音風格控制的應用場景設計。
與通用 GPT-4o mini 模型家族 不同,GPT-4o mini TTS 有專門的模態配置:輸入為文字,輸出為音訊。它不是通用聊天模型、轉錄模型、圖像模型或語音到語音推理模型。
GPT-4o mini TTS 的主要規格與定價如何?
| 規格 | 經驗證數值 |
|---|---|
| 服務商 | OpenAI(截至 2026年7月) |
| 模型家族 | GPT-4o mini(截至 2026年7月) |
| 模型類型 | 文字轉語音與語音合成模型(截至 2026年7月) |
| 發佈時間 | 2025年3月20日(截至 2026年7月) |
| 最大輸入長度 | 2,000 個輸入令牌(截至 2026年7月) |
| 輸入計價 | 每 100 萬文字輸入令牌 $0.60(截至 2026年7月) |
| 快取輸入計價 | 官方文件未明確說明(截至 2026年7月) |
| 輸出計價 | 每 100 萬音訊輸出令牌 $12.00(截至 2026年7月) |
| 計價單位 | 文字輸入令牌與音訊輸出令牌(截至 2026年7月) |
| 支援輸入 | 文字(截至 2026年7月) |
| 支援輸出 | 音訊(截至 2026年7月) |
| OpenAI 模型 ID | gpt-4o-mini-tts(截至 2026年7月) |
| OpenAI 介面 | POST /v1/audio/speech(截至 2026年7月) |
| Gate.AI模型卡 ID | openai/gpt-4o-mini-tts(截至 2026年7月) |
| Gate.AITTS 請求模型 | gpt-4o-mini-tts(截至 2026年7月) |
| Gate.AI介面 | POST /openai/v1/audio/speech(截至 2026年7月) |
| 內建語音 | 13 種官方語音選項(截至 2026年7月) |
| 串流傳輸 | OpenAI 與Gate.AI均支援(截至 2026年7月) |
| 微調 | 官方暫未確認支援(截至 2026年7月) |
| 批次 API | 官方未列為支援端點(截至 2026年7月) |
| 工具或函數呼叫 | 不適用於已記錄 TTS 介面(截至 2026年7月) |
| 結構化輸出或 JSON 模式 | 不適用於已記錄音訊回應(截至 2026年7月) |
| 知識截止 | 此語音生成模型未指定(截至 2026年7月) |
| AI 語音揭露 | OpenAI 使用指南要求揭露(截至 2026年7月) |
OpenAI 模型文件確認最大輸入 2,000 令牌、僅文字輸入、僅音訊輸出以及已公布的令牌費率。官方語音生成端點為 /v1/audio/speech。
根據 Gate.AI 模型卡,目錄條目為 openai/gpt-4o-mini-tts。專用 Gate.AI 文字轉語音端點請求體需使用 gpt-4o-mini-tts 作為模型值。此區分重要,因為目錄識別碼與端點請求值不總是可互換。Gate.AI 文件顯示 OpenAI 相容基地址為 https://api.gate.ai/openai/v1。
GPT-4o mini TTS 在生產環境中有哪些實用功能?
控制語音表現方式
開發者可透過自然語言指令調整口音、情感範圍、語調、語速、音色、模仿及耳語效果。這使模型適用於客服提示、教育播報、角色對話及品牌音訊體驗。若對發音或情感表達有嚴格要求,輸出仍需人工審核。
音訊串流生成,未完成即可播放
OpenAI 支援串流語音生成,允許在完整音訊檔案生成前即開始播放。Gate.AI 也支援伺服器推送事件串流(stream_format: "sse"),音訊以編碼區塊形式返回,後續附帶用量與計費元資料。
支援多種標準音訊格式
OpenAI 官方文件支援 MP3、Opus、AAC、FLAC、WAV、PCM 輸出。MP3 適合通用發佈,Opus 用於網路通訊,FLAC 用於無損儲存,WAV 或 PCM 適合低解碼負擔場景。
多語言語音生成
文字轉語音指南列出多語言支援,包括英語、中文、日語、韓語、法語、德語、西班牙語、阿拉伯語、印地語、葡萄牙語和越南語。OpenAI 指出內建語音主要針對英語優化,多語言發音及自然度需用代表性腳本測試。
內建語音選擇
OpenAI 官方文件列出 13 種內建語音:alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse、marin、cedar。語音可用性因模型而異,OpenAI 建議 marin 或 cedar 用於重視音質的場景。
GPT-4o mini TTS 支援哪些模態?
| 模態 | 是否支援 | 備註 |
|---|---|---|
| 文字輸入 | 是 | 最大 2,000 輸入令牌 |
| 圖像輸入 | 否 | 不支援 |
| 音訊輸入 | 否 | 音訊輸入需用轉錄或即時模型 |
| 影片輸入 | 否 | 不支援 |
| 文字輸出 | 否 | 官方回應為生成音訊 |
| 音訊輸出 | 是 | 官方文件支援 MP3、Opus、AAC、FLAC、WAV、PCM |
| 串流音訊 | 是 | 支援分段串流;Gate.AI也支援 SSE 模式 |
GPT-4o mini TTS 不應與更廣泛的 GPT-4o 多模態模型 混淆。GPT-4o mini TTS 專為文字到音訊生成而設計,並不具備多模態模型的廣泛輸入與推理能力。
GPT-4o mini TTS 的局限性有哪些?
2,000 令牌輸入上限使模型不適用於長文件、有聲書或長時訓練材料。較長腳本需分段處理,團隊還需管理節奏、發音、停頓及語音一致性。
儘管支援多語言語音,內建語音主要針對英語優化。不同語言、口音、專有名詞、縮寫或技術術語的表現品質不一,發佈前需用代表性腳本測試。
標準文字轉語音指南未記錄所有發音場景的細緻音素控制。團隊可能需調整拼寫、標點、措辭或分段以提升專有名詞及專業術語的表現。
自訂語音僅限符合資格的 OpenAI 客戶。建立需錄製授權與樣本,標準 API 介面並非自動支援語音複製或組織專屬語音。
生成語音可能出現發音錯誤、強調不當或情感表達不適。這是通用生成式 AI 的局限,而非模型特定安全保障。醫療、法律、金融、緊急等高影響音訊需專業人員審核後發佈或使用。
OpenAI 要求應用明確揭露,聽眾聽到的是 AI 生成語音而非真人發聲。
GPT-4o mini TTS 最適合哪些場景?
| 應用場景 | 為什麼適用 GPT-4o mini TTS | 重要限制 |
|---|---|---|
| 文章播報 | 將書面內容轉為富有表現力的語音 | 長篇文章需分段處理 |
| 客服提示 | 支援語調與表現方式控制 | 並不能取代完整對話語音代理 |
| 無障礙功能 | 為介面或編輯文字生成語音版本 | 發音需測試 |
| 教育內容 | 支援節奏、多語言語音及多種語調 | 語音主要針對英語優化 |
| 遊戲或應用對話 | 可變換表現方式與角色風格 | 多次請求需測試一致性 |
| 自動播報 | 生成常用格式的可重複音訊 | 高影響資訊需人工審核 |
| 媒體原型製作 | 無需錄音即可生成播報 | 必須揭露 AI 生成語音 |
GPT-4o mini TTS 與 TTS-1、TTS-1-HD 有何對比?
| 對比維度 | GPT-4o mini TTS | TTS-1 | TTS-1-HD | 場景適配 |
|---|---|---|---|---|
| 主要定位 | 可控文字轉語音 | 低延遲文字轉語音 | 注重音質的傳統文字轉語音 | 按可控性、延遲與既有流程需求選擇 |
| 表現指令 | 支援自然語言語音指令 | 官方未記錄等效指令控制 | 官方未記錄等效指令控制 | GPT-4o mini TTS 適合表現力或定向播報 |
| 延遲定位 | 快速且支援串流 | 主打低延遲 | 音質高於 TTS-1,但延遲更大 | TTS-1 適用於延遲敏感的傳統部署 |
| 內建語音 | 13 種官方選項 | 語音選項更少 | 語音選項更少 | 需測試語音適配性,勿僅按模型名選擇 |
| 介面 | /v1/audio/speech | /v1/audio/speech | /v1/audio/speech | 既有 Speech API 整合可更換模型值 |
| 輸入上限 | 2,000 令牌 | 官方未確認直接可比上限 | 官方未確認直接可比上限 | 長篇工作需測試與分段 |
OpenAI 描述 GPT-4o mini TTS 為最新且最可靠的文字轉語音模型。TTS-1 主打低延遲,TTS-1-HD 是舊模型中音質最高者。無單一模型適用於所有場景,實際選擇需根據語音品質、指令控制、語言表現、延遲與整合需求綜合考量。
如何透過 Gate.AI 存取 GPT-4o mini TTS?
Gate.AI 官方文件提供 OpenAI 相容文字轉語音 API,基地址為 https://api.gate.ai/openai/v1,端點為 POST /audio/speech。請求需在 Bearer 授權標頭中攜帶 Gate.AI API 金鑰,並以 JSON 體提交模型、輸入文字與語音選項。
根據 Gate.AI 模型卡,目錄識別碼為 openai/gpt-4o-mini-tts。專用 TTS 請求規範中,Gate.AI 記錄 gpt-4o-mini-tts 為模型值。
預設情況下,Gate.AI 同步回傳二進位音訊。設定 stream_format 為 sse 時,將回傳 speech.audio.delta 事件(編碼音訊區塊),以及最終的 speech.audio.done 事件(用量與計費詳情)。
Python 範例
Python import os
from pathlib import Path
import requests
api_key = os.environ[“GATEAI_API_KEY”]
output_file = Path(“speech.mp3”)
response = requests.post(
“https://api.gate.ai/openai/v1/audio/speech“,
headers={
“Authorization”: f”Bearer {api_key}”,
“Content-Type”: “application/json”,
},
json={
“model”: “gpt-4o-mini-tts”,
“input”: “Welcome to this GPT-4o mini TTS demonstration.”,
“voice”: “alloy”,
“response_format”: “mp3”,
},
timeout=120,
)
response.raise_for_status()
output_file.write_bytes(response.content)
print(f”Audio saved to {output_file}”) ```
curl 範例
``` Bash curl https://api.gate.ai/openai/v1/audio/speech \
-H “Authorization: Bearer $GATEAI_API_KEY” \
-H “Content-Type: application/json” \
-d ‘{
“model”: “gpt-4o-mini-tts”,
“input”: “Welcome to this GPT-4o mini TTS demonstration.”,
“voice”: “alloy”,
“response_format”: “mp3
}’ \
—output speech.mp3
以上程式碼遵循 Gate.AI 官方基地址、Bearer 認證方式、端點路徑、請求欄位、模型值及二進位回應行為。
常見問題解答
GPT-4o mini TTS 最大輸入長度是多少?
GPT-4o mini TTS 每次請求最多接受 2,000 個輸入令牌(截至 2026年7月)。較長腳本需分段生成語音。
GPT-4o mini TTS 的費用是多少?
OpenAI 官方定價為每百萬文字輸入令牌 $0.60,每百萬音訊輸出令牌 $12(截至 2026年7月)。總費用取決於提交文字量與生成音訊令牌數。
開發者如何透過 Gate.AI 存取 GPT-4o mini TTS?
開發者可向 Gate.AI 的 /openai/v1/audio/speech 端點發送認證請求。JSON 請求體包含 gpt-4o-mini-tts、輸入文字、語音選項及可選回應格式。
在什麼情況下 GPT-4o mini TTS 優於 TTS-1 或 TTS-1-HD?
GPT-4o mini TTS 適合需要自然語言控制語調、口音、節奏、情感表達或語音表現的應用。TTS-1 主打低延遲,TTS-1-HD 是 OpenAI 舊款 TTS 模型中音質較高者。


