Gate.AI博客GPT-4o mini TTS:完整規格、定價、API 接入與應用場景(2026)

    GPT-4o mini TTS:完整規格、定價、API 接入與應用場景(2026)

    模型

    什麼是 GPT-4o mini TTS?

    GPT-4o mini TTS 是 OpenAI 推出的可控文本轉語音模型,於 2025年3月20日發佈,最大輸入長度為 2,000 個令牌。截至 2026年7月,API 按令牌計價,文字輸入每百萬令牌收費 $0.60,音訊輸出每百萬令牌收費 $12。

    此模型將書面文字轉換為生成語音,而非傳統文字回應。它基於 GPT-4o mini 架構,專為需要自然語音播報、串流語音、多語言音訊或語音風格控制的應用場景設計。

    與通用 GPT-4o mini 模型家族 不同,GPT-4o mini TTS 有專門的模態配置:輸入為文字,輸出為音訊。它不是通用聊天模型、轉錄模型、圖像模型或語音到語音推理模型。

    GPT-4o mini TTS 的主要規格與定價如何?

    規格 經驗證數值
    服務商 OpenAI(截至 2026年7月)
    模型家族 GPT-4o mini(截至 2026年7月)
    模型類型 文字轉語音與語音合成模型(截至 2026年7月)
    發佈時間 2025年3月20日(截至 2026年7月)
    最大輸入長度 2,000 個輸入令牌(截至 2026年7月)
    輸入計價 每 100 萬文字輸入令牌 $0.60(截至 2026年7月)
    快取輸入計價 官方文件未明確說明(截至 2026年7月)
    輸出計價 每 100 萬音訊輸出令牌 $12.00(截至 2026年7月)
    計價單位 文字輸入令牌與音訊輸出令牌(截至 2026年7月)
    支援輸入 文字(截至 2026年7月)
    支援輸出 音訊(截至 2026年7月)
    OpenAI 模型 ID gpt-4o-mini-tts(截至 2026年7月)
    OpenAI 介面 POST /v1/audio/speech(截至 2026年7月)
    Gate.AI模型卡 ID openai/gpt-4o-mini-tts(截至 2026年7月)
    Gate.AITTS 請求模型 gpt-4o-mini-tts(截至 2026年7月)
    Gate.AI介面 POST /openai/v1/audio/speech(截至 2026年7月)
    內建語音 13 種官方語音選項(截至 2026年7月)
    串流傳輸 OpenAI 與Gate.AI均支援(截至 2026年7月)
    微調 官方暫未確認支援(截至 2026年7月)
    批次 API 官方未列為支援端點(截至 2026年7月)
    工具或函數呼叫 不適用於已記錄 TTS 介面(截至 2026年7月)
    結構化輸出或 JSON 模式 不適用於已記錄音訊回應(截至 2026年7月)
    知識截止 此語音生成模型未指定(截至 2026年7月)
    AI 語音揭露 OpenAI 使用指南要求揭露(截至 2026年7月)

    OpenAI 模型文件確認最大輸入 2,000 令牌、僅文字輸入、僅音訊輸出以及已公布的令牌費率。官方語音生成端點為 /v1/audio/speech

    根據 Gate.AI 模型卡,目錄條目為 openai/gpt-4o-mini-tts。專用 Gate.AI 文字轉語音端點請求體需使用 gpt-4o-mini-tts 作為模型值。此區分重要,因為目錄識別碼與端點請求值不總是可互換。Gate.AI 文件顯示 OpenAI 相容基地址為 https://api.gate.ai/openai/v1

    GPT-4o mini TTS 在生產環境中有哪些實用功能?

    控制語音表現方式

    開發者可透過自然語言指令調整口音、情感範圍、語調、語速、音色、模仿及耳語效果。這使模型適用於客服提示、教育播報、角色對話及品牌音訊體驗。若對發音或情感表達有嚴格要求,輸出仍需人工審核。

    音訊串流生成,未完成即可播放

    OpenAI 支援串流語音生成,允許在完整音訊檔案生成前即開始播放。Gate.AI 也支援伺服器推送事件串流(stream_format: "sse"),音訊以編碼區塊形式返回,後續附帶用量與計費元資料。

    支援多種標準音訊格式

    OpenAI 官方文件支援 MP3、Opus、AAC、FLAC、WAV、PCM 輸出。MP3 適合通用發佈,Opus 用於網路通訊,FLAC 用於無損儲存,WAV 或 PCM 適合低解碼負擔場景。

    多語言語音生成

    文字轉語音指南列出多語言支援,包括英語、中文、日語、韓語、法語、德語、西班牙語、阿拉伯語、印地語、葡萄牙語和越南語。OpenAI 指出內建語音主要針對英語優化,多語言發音及自然度需用代表性腳本測試。

    內建語音選擇

    OpenAI 官方文件列出 13 種內建語音:alloyashballadcoralechofablenovaonyxsageshimmerversemarincedar。語音可用性因模型而異,OpenAI 建議 marincedar 用於重視音質的場景。

    GPT-4o mini TTS 支援哪些模態?

    模態 是否支援 備註
    文字輸入 最大 2,000 輸入令牌
    圖像輸入 不支援
    音訊輸入 音訊輸入需用轉錄或即時模型
    影片輸入 不支援
    文字輸出 官方回應為生成音訊
    音訊輸出 官方文件支援 MP3、Opus、AAC、FLAC、WAV、PCM
    串流音訊 支援分段串流;Gate.AI也支援 SSE 模式

    GPT-4o mini TTS 不應與更廣泛的 GPT-4o 多模態模型 混淆。GPT-4o mini TTS 專為文字到音訊生成而設計,並不具備多模態模型的廣泛輸入與推理能力。

    GPT-4o mini TTS 的局限性有哪些?

    2,000 令牌輸入上限使模型不適用於長文件、有聲書或長時訓練材料。較長腳本需分段處理,團隊還需管理節奏、發音、停頓及語音一致性。

    儘管支援多語言語音,內建語音主要針對英語優化。不同語言、口音、專有名詞、縮寫或技術術語的表現品質不一,發佈前需用代表性腳本測試。

    標準文字轉語音指南未記錄所有發音場景的細緻音素控制。團隊可能需調整拼寫、標點、措辭或分段以提升專有名詞及專業術語的表現。

    自訂語音僅限符合資格的 OpenAI 客戶。建立需錄製授權與樣本,標準 API 介面並非自動支援語音複製或組織專屬語音。

    生成語音可能出現發音錯誤、強調不當或情感表達不適。這是通用生成式 AI 的局限,而非模型特定安全保障。醫療、法律、金融、緊急等高影響音訊需專業人員審核後發佈或使用。

    OpenAI 要求應用明確揭露,聽眾聽到的是 AI 生成語音而非真人發聲。

    GPT-4o mini TTS 最適合哪些場景?

    應用場景 為什麼適用 GPT-4o mini TTS 重要限制
    文章播報 將書面內容轉為富有表現力的語音 長篇文章需分段處理
    客服提示 支援語調與表現方式控制 並不能取代完整對話語音代理
    無障礙功能 為介面或編輯文字生成語音版本 發音需測試
    教育內容 支援節奏、多語言語音及多種語調 語音主要針對英語優化
    遊戲或應用對話 可變換表現方式與角色風格 多次請求需測試一致性
    自動播報 生成常用格式的可重複音訊 高影響資訊需人工審核
    媒體原型製作 無需錄音即可生成播報 必須揭露 AI 生成語音

    GPT-4o mini TTS 與 TTS-1、TTS-1-HD 有何對比?

    對比維度 GPT-4o mini TTS TTS-1 TTS-1-HD 場景適配
    主要定位 可控文字轉語音 低延遲文字轉語音 注重音質的傳統文字轉語音 按可控性、延遲與既有流程需求選擇
    表現指令 支援自然語言語音指令 官方未記錄等效指令控制 官方未記錄等效指令控制 GPT-4o mini TTS 適合表現力或定向播報
    延遲定位 快速且支援串流 主打低延遲 音質高於 TTS-1,但延遲更大 TTS-1 適用於延遲敏感的傳統部署
    內建語音 13 種官方選項 語音選項更少 語音選項更少 需測試語音適配性,勿僅按模型名選擇
    介面 /v1/audio/speech /v1/audio/speech /v1/audio/speech 既有 Speech API 整合可更換模型值
    輸入上限 2,000 令牌 官方未確認直接可比上限 官方未確認直接可比上限 長篇工作需測試與分段

    OpenAI 描述 GPT-4o mini TTS 為最新且最可靠的文字轉語音模型。TTS-1 主打低延遲,TTS-1-HD 是舊模型中音質最高者。無單一模型適用於所有場景,實際選擇需根據語音品質、指令控制、語言表現、延遲與整合需求綜合考量。

    如何透過 Gate.AI 存取 GPT-4o mini TTS?

    Gate.AI 官方文件提供 OpenAI 相容文字轉語音 API,基地址為 https://api.gate.ai/openai/v1,端點為 POST /audio/speech。請求需在 Bearer 授權標頭中攜帶 Gate.AI API 金鑰,並以 JSON 體提交模型、輸入文字與語音選項。

    根據 Gate.AI 模型卡,目錄識別碼為 openai/gpt-4o-mini-tts。專用 TTS 請求規範中,Gate.AI 記錄 gpt-4o-mini-tts 為模型值。

    預設情況下,Gate.AI 同步回傳二進位音訊。設定 stream_formatsse 時,將回傳 speech.audio.delta 事件(編碼音訊區塊),以及最終的 speech.audio.done 事件(用量與計費詳情)。

    Python 範例

    Python import os

    from pathlib import Path

    import requests

    api_key = os.environ[“GATEAI_API_KEY”]
    output_file = Path(“speech.mp3”)

    response = requests.post(
    https://api.gate.ai/openai/v1/audio/speech“,
    headers={
    “Authorization”: f”Bearer {api_key}”,
    “Content-Type”: “application/json”,
    },
    json={
    “model”: “gpt-4o-mini-tts”,
    “input”: “Welcome to this GPT-4o mini TTS demonstration.”,
    “voice”: “alloy”,
    “response_format”: “mp3”,
    },
    timeout=120,
    )

    response.raise_for_status()
    output_file.write_bytes(response.content)

    print(f”Audio saved to {output_file}”) ```

    curl 範例

    ``` Bash curl https://api.gate.ai/openai/v1/audio/speech \

    -H “Authorization: Bearer $GATEAI_API_KEY” \
    -H “Content-Type: application/json” \
    -d ‘{
    “model”: “gpt-4o-mini-tts”,
    “input”: “Welcome to this GPT-4o mini TTS demonstration.”,
    “voice”: “alloy”,
    “response_format”: “mp3
    }’ \
    —output speech.mp3

    以上程式碼遵循 Gate.AI 官方基地址、Bearer 認證方式、端點路徑、請求欄位、模型值及二進位回應行為。

    常見問題解答

    GPT-4o mini TTS 最大輸入長度是多少?

    GPT-4o mini TTS 每次請求最多接受 2,000 個輸入令牌(截至 2026年7月)。較長腳本需分段生成語音。

    GPT-4o mini TTS 的費用是多少?

    OpenAI 官方定價為每百萬文字輸入令牌 $0.60,每百萬音訊輸出令牌 $12(截至 2026年7月)。總費用取決於提交文字量與生成音訊令牌數。

    開發者如何透過 Gate.AI 存取 GPT-4o mini TTS?

    開發者可向 Gate.AI 的 /openai/v1/audio/speech 端點發送認證請求。JSON 請求體包含 gpt-4o-mini-tts、輸入文字、語音選項及可選回應格式。

    在什麼情況下 GPT-4o mini TTS 優於 TTS-1 或 TTS-1-HD?

    GPT-4o mini TTS 適合需要自然語言控制語調、口音、節奏、情感表達或語音表現的應用。TTS-1 主打低延遲,TTS-1-HD 是 OpenAI 舊款 TTS 模型中音質較高者。

    相關文章