GPT-4o Mini 逐字稿:完整規格、定價、API 接入與應用場景(2026)
什麼是 GPT-4o Mini Transcribe?
GPT-4o Mini Transcribe 是 OpenAI 推出的輕量級語音轉文字模型,於 2025年3月20日發佈,具備 16,000 個 token 的上下文視窗,支援音訊轉錄,同時 OpenAI API 定價為每 100 萬輸入音訊 token 1.25 美元、每 100 萬輸出 token 5 美元(截至 2026年7月)。
此模型採用 GPT-4o Mini 架構,可將錄製或串流語音內容轉換為文字。OpenAI 將其與 GPT-4o Transcribe 同步推出,屬於新一代音訊模型,相較於原有的 Whisper 模型,在詞錯誤率、語言辨識及轉錄準確率等方面皆有提升。
GPT-4o Mini Transcribe 是 OpenAI GPT-4o 轉錄系列中體積更小、價格更低的模型,專為語音辨識設計,並不適用於通用對話、影像理解、推理或文字轉語音生成等場景。
開發者常用於會議紀錄、通話轉錄、訪談處理、字幕製作、語音助理輸入、多語種音訊工作流程及可檢索的媒體檔案等情境。該模型也已收錄於 Gate.AI 模型目錄及 Gate.AI 語音轉文字文件中。
GPT-4o Mini Transcribe 主要參數與定價
根據 OpenAI 官方模型文件,其上下文視窗為 16,000 token,最大輸出 2,000 token,支援音訊與文字輸入,輸出為文字。文件亦註明知識截止日期為 2024年6月1日,並採用分級限流策略。
| 規格說明 | 經查證的參數 |
|---|---|
| 提供方 | OpenAI(截至 2026年7月) |
| 模型系列 | GPT-4o Mini 音訊模型(截至 2026年7月) |
| 模型類型 | 語音轉文字轉錄模型(截至 2026年7月) |
| 發佈時間 | 2025年3月20日(截至 2026年7月) |
| 上下文視窗 | 16,000 token(截至 2026年7月) |
| 最大輸出 | 2,000 token(截至 2026年7月) |
| 輸入定價 | 透過 OpenAI,每 100 萬輸入音訊 token 1.25 美元(截至 2026年7月) |
| 快取輸入定價 | 截至 2026年7月,官方文件未說明 |
| 輸出定價 | 透過 OpenAI,每 100 萬輸出 token 5.00 美元(截至 2026年7月) |
| 計費單位 | 每 100 萬 token(截至 2026年7月) |
| 支援的模態 | 音訊與文字輸入,文字輸出(截至 2026年7月) |
| 透過Gate.AI支援的音訊格式 | 官方文件範例為 MP3、WAV、M4A(截至 2026年7月) |
| 提供方 API 接入 | OpenAI Audio Transcriptions API 及支援的即時轉錄介面(截至 2026年7月) |
| OpenAI 模型 ID | gpt-4o-mini-transcribe(截至 2026年7月) |
| Gate.AI模型卡 ID | openai/gpt-4o-mini-transcribe(截至 2026年7月) |
| Gate.AI轉錄請求 ID | gpt-4o-mini-transcribe(截至 2026年7月) |
| 可用性 | OpenAI API 及Gate.AI語音轉文字端點,受平台目錄約束(截至 2026年7月) |
| 知識截止日期 | 2024年6月1日(截至 2026年7月) |
| 串流轉錄支援 | 支援文件中的即時或 Server-Sent-Event 轉錄路徑(截至 2026年7月) |
| 微調支援 | 官方尚未確認(截至 2026年7月) |
| 批次 API 支援 | 轉錄請求尚未確認(截至 2026年7月) |
| 工具或函式呼叫 | 不適用於模型的主要轉錄功能(截至 2026年7月) |
| 結構化輸出或 JSON 模式 | 官方未記錄為通用能力(截至 2026年7月) |
| 許可與使用限制 | 受 OpenAI 或Gate.AI平台條款約束(截至 2026年7月) |
OpenAI 定價適用於直接透過 OpenAI 取得服務。Gate.AI 計費需另行核算。Gate.AI 語音轉文字文件說明,轉錄回應可於 model_extend.cost 欄位返回實際計費金額,並包含服務商及明細資訊。
OpenAI 限流策略
OpenAI 依使用等級(Tier)分級限流,非統一限額。截至 2026年7月,官方頁面列出如下限額:
| OpenAI 使用等級 | 每分鐘請求數 | 每分鐘 token 數 |
|---|---|---|
| 免費 | 不支援 | 不支援 |
| 等級 1 | 500 | 50,000 |
| 等級 2 | 2,000 | 150,000 |
| 等級 3 | 5,000 | 600,000 |
| 等級 4 | 10,000 | 2,000,000 |
| 等級 5 | 10,000 | 8,000,000 |
限流策略可能變動,並受帳戶狀態、地區可用性或服務商政策影響。生產環境應於部署前讀取當前帳戶級限額。
GPT-4o Mini Transcribe 在生產環境中的應用價值
語音轉為可檢索文字
此模型可將錄音內容轉為書面文字,便於應用儲存、檢索、摘要、分類或覆查,支援會議、訪談、播客、講座、客服通話及語音訊息等場景。
如涉及人名、數字、專業術語或高風險內容,建議對轉錄文字進行人工校驗。
支援多語種及口音語音
OpenAI 報告指出,新一代 GPT-4o 轉錄模型在語言辨識及詞錯誤率方面優於原 Whisper 模型,同時對口音、噪音環境與語速變化有更強適應力。
實際表現受語言、方言、音訊品質、說話人重疊及主題影響,建議團隊以典型錄音進行測試,勿僅依賴基準數據。
支援語言與上下文提示
Gate.AI 語音轉文字介面支援可選語言提示(如 zh),有助於系統判斷預期語言。
上下文提示可降低歧義,但無法保證產品名、技術術語、縮寫或罕見專有名詞的準確轉錄。
支援同步及串流轉錄
Gate.AI 支援同步音訊檔案轉錄,無需輪詢任務,也支援 stream=true 回傳伺服器推送的轉錄事件,最終片段包含用量與計費細節。
同步轉錄適合上傳錄音及通話後分析,串流或即時轉錄則更適合直播字幕、互動式語音應用或智慧代理流程。
降低大規模轉錄成本
GPT-4o Mini Transcribe 的 OpenAI 輸入 token 單價低於 GPT-4o Transcribe。截至 2026年7月,GPT-4o Mini Transcribe 為每 100 萬輸入音訊 token 1.25 美元,GPT-4o Transcribe 為 2.50 美元。
因此,該小型模型適合重視成本效益的大批量轉錄場景。但團隊仍需以實際音訊比較模型表現,因單價低不代表總成本最低,若需額外覆查或返工,整體成本可能上升。
GPT-4o Mini Transcribe 支援哪些輸入輸出模態?
| 模態 | 是否支援 | 說明 |
|---|---|---|
| 文字輸入 | 支援 | 若端點支援,可輸入指令或上下文文字 |
| 音訊輸入 | 支援 | 語音辨識的主要輸入 |
| 影像輸入 | 不支援 | 專業轉錄模型不支援影像輸入 |
| 影片輸入 | 不支援 | 影片需先擷取音訊後轉錄 |
| 文字輸出 | 支援 | 輸出為辨識後的文字 |
| 音訊輸出 | 不支援 | 不產生語音 |
| 串流轉錄事件 | 支援 | 支援文件中的即時或 SSE 轉錄路徑 |
| 原生說話人分離 | 未確認 | 官方文件未列出內建說話人標籤功能 |
OpenAI 官方頁面說明,文字為輸入輸出模態,音訊僅支援輸入,不支援影像或影片輸入。
如需視覺生成,須呼叫專用影像模型(如 GPT Image 1 Mini);語音合成則需單獨的文字轉語音模型。
GPT-4o Mini Transcribe 的局限性
GPT-4o Mini Transcribe 專注於語音辨識,無法取代通用大型模型的推理、文件分析、程式設計、影像理解、工具呼叫或內容生成等能力。
以下情況可能影響轉錄準確率:
- 背景雜音較大
- 多人同時說話
- 麥克風距離遠或失真
- 頻繁切換語言
- 罕見人名或縮寫
- 醫療、法律、科學、金融等專業詞彙
- 音樂或非語音內容混雜
OpenAI 報告稱其辨識能力優於原 Whisper,但無法保證零錯誤。
16,000 token 的上下文視窗及 2,000 token 的最大輸出,可能限制長音訊或內容密集錄音的轉錄。長音訊需分段處理,並由應用層維護順序、時間戳與上下文。
原生說話人分離功能尚未確認。如需區分說話人,可能需呼叫獨立分離服務、錄音平台中繼資料,或具備明確說話人標籤支援的轉錄模型。
轉錄模型可能輸出「看似合理但實際錯誤」的詞彙,這是 AI 的通用限制,並非 GPT-4o Mini Transcribe 獨有。法律證據、醫療紀錄、金融指令、監管材料、安全事件等重要轉錄內容,需由專業人士對照原音訊覆核。
GPT-4o Mini Transcribe 適合哪些場景?
| 應用場景 | 適用原因 | 重要限制說明 |
|---|---|---|
| 會議轉錄 | 將討論內容轉為可檢索筆記與摘要 | 說話人辨識需額外工具支援 |
| 客服通話分析 | 低價模型支援大量語音處理 | 須合規處理同意、隱私與資料保存 |
| 播客及訪談轉錄 | 產生可編輯文字,便於發佈、索引與無障礙存取 | 專有名詞及專業術語需覆查 |
| 字幕製作 | 提供初步轉錄結果,便於後續字幕流程處理 | 時序、分段與字幕格式需後續加工 |
| 語音助理輸入 | 將語音轉為文字供下游模型或業務邏輯處理 | 並非完整的語音到語音代理 |
| 多語種轉錄 | OpenAI 報告稱語言辨識優於原 Whisper | 不同語言、口音與錄音條件下準確率有差異 |
| 可檢索音訊檔案 | 支援媒體資料的索引與檢索 | 長錄音需分段及中繼資料管理 |
| 研究訪談 | 降低定性分析的人工作業量 | 研究人員需核查引言與參與者術語 |
轉錄後,團隊可將文字交由通用大型模型進行摘要、資訊擷取、分類或自動化流程處理。例如 Gemini 2.5 Flash 可作為下游分析環節,而非語音辨識的直接替代。
GPT-4o Mini Transcribe 與 GPT-4o Transcribe 及 Whisper 的比較
| 比較維度 | GPT-4o Mini Transcribe | GPT-4o Transcribe | Whisper |
|---|---|---|---|
| 主要功能 | 語音轉文字 | 語音轉文字 | 語音轉文字 |
| 市場定位 | GPT-4o 轉錄系列中體積更小、價格更低 | GPT-4o 轉錄系列中價格更高 | OpenAI 早期語音辨識系列 |
| OpenAI 輸入價格 | 每 100 萬輸入音訊 token 1.25 美元 | 每 100 萬輸入音訊 token 2.50 美元 | API 可能採用時長計價 |
| 上下文視窗 | 16,000 token | 部署前需查閱官方最新頁面 | 未以相同格式公開 |
| 最大輸出 | 2,000 token | 部署前需查閱官方最新頁面 | 端點行為不同 |
| 語言辨識 | OpenAI 報告優於原 Whisper | OpenAI 報告優於原 Whisper | 作為早期對比基線 |
| 本地部署 | 無開源權重發佈 | 無開源權重發佈 | Whisper 為開源權重 |
| Gate.AI接入 | 已記錄語音轉文字模型 ID,受平台目錄約束 | 已記錄語音轉文字模型 ID,受平台目錄約束 | 記錄為 whisper-1 |
| 適用場景 | 注重 API 成本與吞吐量的大規模轉錄 | 需測試大型模型轉錄品質的工作負載 | 需本地部署、離線或自控基礎設施場景 |
OpenAI 表示,兩款 GPT-4o Transcribe 模型在辨識率與詞錯誤率上均優於原 Whisper。
沒有絕對最佳選擇,GPT-4o Mini Transcribe 適合優先考量 API 成本與吞吐量的團隊;GPT-4o Transcribe 適合對轉錄品質有更高要求的場景;Whisper 仍適用於需本地部署、離線或基礎設施自控的需求。
如何透過 Gate.AI 存取 GPT-4o Mini Transcribe?
如 Gate.AI 模型目錄及語音轉文字文件所述,開發者可透過 Gate.AI 的 OpenAI 相容音訊端點呼叫 GPT-4o Mini Transcribe。
標準設定如下:
| 接入欄位 | Gate.AI 參數值 |
|---|---|
| Base URL | https://api.gate.ai/openai/v1 |
| Endpoint | POST /audio/transcriptions |
| 完整端點 | https://api.gate.ai/openai/v1/audio/transcriptions |
| 認證方式 | Authorization: Bearer |
| 請求格式 | multipart/form-data |
| 轉錄模型 ID | gpt-4o-mini-transcribe |
| 必填欄位 | model 和 file |
| 可選欄位 | language 和 stream |
| 同步回應 | 回傳轉錄文字、用量與計費中繼資料 |
| 串流回應 | SSE 推送轉錄事件,含最終用量與 model_extend 資訊 |
Gate.AI 說明模型可用性依賴於平台目錄,並支援 MP3、WAV、M4A 等音訊格式。
Python 範例
import osfrom pathlib import Pathfrom openai import OpenAIaudio_path = Path("meeting.mp3")if not audio_path.is_file():raise FileNotFoundError(f"Audio file not found: {audio_path}")api_key = os.environ.get("GATEAI_API_KEY")if not api_key:raise RuntimeError("Set the GATEAI_API_KEY environment variable.")client = OpenAI(api_key=api_key,base_url="https://api.gate.ai/openai/v1",)with audio_path.open("rb") as audio_file:transcript = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe",file=audio_file,)print(transcript.text)
curl 範例
curl https://api.gate.ai/openai/v1/audio/transcriptions \-H "Authorization: Bearer $GATEAI_API_KEY" \-F "model=gpt-4o-mini-transcribe" \-F "file=@meeting.mp3"
curl 範例(帶語言提示)
curl https://api.gate.ai/openai/v1/audio/transcriptions \-H "Authorization: Bearer $GATEAI_API_KEY" \-F "model=gpt-4o-mini-transcribe" \-F "language=en" \-F "file=@interview.wav"
Gate.AI 於 text 欄位回傳轉錄文字。根據模型與請求,回應還可能包含 token 用量、音訊 token 詳細資訊、上游服務商、實際計費金額及明細。Gate.AI 計費以 model_extend.cost 欄位為準。
開發者應將 API key 儲存於環境變數,生產部署前核查模型卡狀態,檢查回傳的計費欄位,並為無效請求、餘額不足、模型不可用、上傳超限與限流等情況實作錯誤處理。
常見問題解答
GPT-4o Mini Transcribe 的上下文視窗是多少?
根據 OpenAI 官方模型文件(截至 2026年7月),GPT-4o Mini Transcribe 支援 16,000 token 上下文視窗,最大輸出 2,000 token。
GPT-4o Mini Transcribe 的價格是多少?
OpenAI 定價為每 100 萬輸入音訊 token 1.25 美元、每 100 萬輸出 token 5 美元(截至 2026年7月)。Gate.AI 計費將於請求回應中單獨回傳,實際金額位於 model_extend.cost 欄位。
開發者如何存取 GPT-4o Mini Transcribe?
開發者可透過 OpenAI 轉錄介面或 Gate.AI 的 OpenAI 相容 POST /audio/transcriptions 端點呼叫。Gate.AI 採用 Bearer 認證、multipart 檔案上傳,請求模型 ID 為 gpt-4o-mini-transcribe。
GPT-4o Mini Transcribe 適用哪些場景?
適合會議紀錄、客服通話處理、播客轉錄、字幕製作、多語種語音辨識、語音助理輸入及可檢索音訊檔案等情境。重要轉錄內容建議與原音訊核對。


