文字轉語音 API 參考

    透過 Gate.AI 文字轉語音接口提交文字並同步生成音訊。預設回傳二進位音訊;設定 stream_format=sse 時會逐幀回傳 speech.audio.delta,並在 speech.audio.done 末幀攜帶 usage 與 model_extend。

    欄位
    Base URLhttps://api.gate.ai/openai/v1
    認證Authorization: Bearer <API_KEY>
    格式OpenAI 相容;使用 JSON 請求主體,預設回傳二進位音訊,可透過 SSE 串流回傳音訊分片

    語音接口路徑位於 /openai/v1 下;語音轉文字與文字轉語音為同步能力,不回傳 job_id,也不需要輪詢。TTS 預設二進位回應中的計費資訊會記錄在控制台 Generations。

    文字轉語音

    POST/audio/speech

    提交待合成文字並同步回傳音訊。預設響應體為二進位音訊流,Content-Type 隨 response_format 變化;SSE 模式會回傳 base64 音訊分片與末幀計費資訊。

    請求參數

    名稱位置類型必填說明
    AuthorizationheaderstringGate.AI API Key。格式:Bearer <API_KEY>
    Content-Typeheaderstring請求主體格式:application/json

    請求主體

    名稱類型必填說明
    modelstring文字轉語音模型 ID,目前僅支援 gpt-4o-mini-tts
    inputstring待合成文字
    voicestring發音人,如 alloy
    response_formatstring輸出音訊格式,如 wav、mp3;預設 wav
    stream_formatstring設為 sse 時回傳 text/event-stream;speech.audio.delta 幀包含 base64 音訊分片,speech.audio.done 幀包含 usage 與 model_extend

    示例

    text
    1{2  "model": "gpt-4o-mini-tts",3  "input": "今天天气很好,我们一起去海边散步吧。",4  "voice": "alloy",5  "response_format": "mp3"6}

    返回欄位說明

    名稱類型說明
    audio bytesbinary預設回傳的音訊二進位資料
    speech.audio.deltaSSE eventSSE 音訊分片事件,攜帶 base64 編碼的音訊片段
    speech.audio.doneSSE eventSSE 結束事件,攜帶 usage 與 model_extend
    usageobject文字轉語音用量;二進位回應場景下由網關寫入後台記錄,SSE 末幀回傳
    model_extend.coststring實際計費金額(USD),扣款以 model_extend.cost 為準

    回傳範例

    json
    1HTTP/1.1 200 OK2Content-Type: audio/mpeg34(binary audio bytes)

    回傳結果

    狀態碼狀態碼含義說明資料模型
    200OK成功,同步回傳轉寫結果、音訊資料或 SSE 事件。AudioResponse
    400Bad Request請求參數錯誤、請求主體格式錯誤,或缺少 model / file / input 等必填欄位。OpenAIErrorResponse
    401UnauthorizedAPI Key 無效或缺失。OpenAIErrorResponse
    402Payment Required餘額不足。InsufficientBalanceResponse
    404Not Found模型不存在,或語音端點未啟用。OpenAIErrorResponse
    413Payload Too Large上傳檔案或請求主體過大。OpenAIErrorResponse
    429Too Many Requests請求過於頻繁,請降低呼叫頻率。OpenAIErrorResponse
    500Internal Server Error服務內部錯誤。OpenAIErrorResponse
    502Bad Gateway上游語音服務失敗。OpenAIErrorResponse