文本转语音 API 参考

    通过 Gate.AI 文本转语音接口提交文本并同步生成音频。默认返回二进制音频;设置 stream_format=sse 时会逐帧返回 speech.audio.delta,并在 speech.audio.done 末帧携带 usage 与 model_extend。

    字段
    Base URLhttps://api.gate.ai/openai/v1
    认证Authorization: Bearer <API_KEY>
    格式OpenAI 兼容;使用 JSON 请求体,默认返回二进制音频,可通过 SSE 流式返回音频分片

    语音接口路径位于 /openai/v1 下;语音转文本与文本转语音为同步能力,不返回 job_id,也不需要轮询。TTS 默认二进制响应中的计费信息记录在控制台 Generations。

    文本转语音

    POST/audio/speech

    提交待合成文本并同步返回音频。默认响应体为二进制音频流,Content-Type 随 response_format 变化;SSE 模式会返回 base64 音频分片与末帧计费信息。

    请求参数

    名称位置类型必选说明
    AuthorizationheaderstringGate.AI API Key。格式:Bearer <API_KEY>
    Content-Typeheaderstring请求体格式:application/json

    请求体

    名称类型必选说明
    modelstring文本转语音模型 ID,当前仅支持 gpt-4o-mini-tts
    inputstring待合成文本
    voicestring发音人,如 alloy
    response_formatstring输出音频格式,如 wav、mp3;默认 wav
    stream_formatstring设为 sse 时返回 text/event-stream;speech.audio.delta 帧包含 base64 音频分片,speech.audio.done 帧包含 usage 与 model_extend

    示例

    json
    1{2  "model": "gpt-4o-mini-tts",3  "input": "今天天气很好,我们一起去海边散步吧。",4  "voice": "alloy",5  "response_format": "mp3"6}

    返回字段说明

    名称类型说明
    audio bytesbinary默认返回的音频二进制数据
    speech.audio.deltaSSE eventSSE 音频分片事件,携带 base64 编码的音频片段
    speech.audio.doneSSE eventSSE 结束事件,携带 usage 与 model_extend
    usageobject文本转语音用量;二进制响应场景下由网关写入后台记录,SSE 末帧返回
    model_extend.coststring实际计费金额(USD),扣款以 model_extend.cost 为准

    返回示例

    text
    1HTTP/1.1 200 OK2Content-Type: audio/mpeg34(binary audio bytes)

    返回结果

    状态码状态码含义说明数据模型
    200OK成功,同步返回转写结果、音频数据或 SSE 事件。AudioResponse
    400Bad Request请求参数错误、请求体格式错误,或缺少 model / file / input 等必填字段。OpenAIErrorResponse
    401UnauthorizedAPI Key 无效或缺失。OpenAIErrorResponse
    402Payment Required余额不足。InsufficientBalanceResponse
    404Not Found模型不存在,或语音端点未启用。OpenAIErrorResponse
    413Payload Too Large上传文件或请求体过大。OpenAIErrorResponse
    429Too Many Requests请求过于频繁,请降低调用频率。OpenAIErrorResponse
    500Internal Server Error服务内部错误。OpenAIErrorResponse
    502Bad Gateway上游语音服务失败。OpenAIErrorResponse