GPT-4o 逐字轉錄與分角色記錄:完整規格、定價、API 接入與應用場景(2026)
什麼是 GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize 是 OpenAI 推出的自動語音辨識模型,具備內建說話人分離功能。該模型的正式發佈時間尚未公開,擁有 16,000 個 token 的上下文視窗,2026年7月的 token 定價為每百萬音訊輸入 token 2.50 美元、每百萬輸出 token 10 美元。
此模型能將錄音語音轉換為文字,並將轉錄片段與不同說話人對應。說話人分離可回答「誰在什麼時候說話」,讓轉錄內容能夠區分會議、訪談、Podcast、研究對話及客服通話中的參與者。
OpenAI 將此 API 模型標示為 gpt-4o-transcribe-diarize。其模型頁面描述本模型為具備說話人辨識的轉錄模型,並指出可透過 Transcription API 存取。該模型專為音訊處理設計,不適用於一般聊天、推理、影像生成或文字轉語音等任務。
目前官方模型頁面尚未明確公告具體上線時程。為避免將推測日期誤認為官方資訊,本文截至2026年7月,記錄該模型發佈時間以 OpenAI 正式產品文件為準。
GPT-4o Transcribe Diarize 的主要參數與定價
以下參數主要根據 OpenAI 官方模型頁面、語音轉文字文件及轉錄 API 參考,所有內容皆為2026年7月的官方狀態。
| 參數 | 官方數值 |
|---|---|
| 服務商 | OpenAI(截至2026年7月) |
| 模型系列 | GPT-4o Transcribe(截至2026年7月) |
| 模型類型 | 自動語音辨識模型,具備說話人分離功能(截至2026年7月) |
| 發佈時間 | 官方管道未確認(截至2026年7月) |
| 上下文視窗 | 16,000 個 token(截至2026年7月) |
| 最大輸出 | 2,000 個 token(截至2026年7月) |
| 輸入定價 | 每百萬音訊輸入 token 2.50 美元(截至2026年7月) |
| 快取輸入定價 | 官方文件未說明(截至2026年7月) |
| 輸出定價 | 每百萬輸出 token 10.00 美元(截至2026年7月) |
| 定價單位 | 輸入與輸出皆以每百萬音訊 token 計價(截至2026年7月) |
| 支援輸入模態 | 文字相關請求欄位及音訊輸入(截至2026年7月) |
| 支援輸出模態 | 文字輸出,可選說話人片段中繼資料(截至2026年7月) |
| 支援回應格式 | json、text、diarized_json(截至2026年7月) |
| 說話人標註輸出 | 需使用 diarized_json(截至2026年7月) |
| 服務商 API 接入 | OpenAI Audio Transcriptions API(截至2026年7月) |
| 服務商模型 ID | gpt-4o-transcribe-diarize(截至2026年7月) |
| Gate.AI 模型 ID | openai/gpt-4o-transcribe-diarize,Gate.AI 模型卡所述(截至2026年7月) |
| Gate.AI 定價 | Gate.AI 模型卡顯示暫不可用(截至2026年7月) |
| 可用性 | OpenAI API 與 Gate.AI 模型目錄均有列出(截至2026年7月) |
| 知識截止日期 | 2024年6月1日(截至2026年7月) |
| 微調支援 | 官方模型頁面未列為支援(截至2026年7月) |
| 批次 API 支援 | 官方管道未確認(截至2026年7月) |
| 工具/函數呼叫 | 不適用於已記錄的轉錄工作流程(截至2026年7月) |
| 結構化輸出 | diarized_json 提供結構化說話人片段;未見通用 JSON Schema 強制(截至2026年7月) |
| 提示詞支援 | 轉錄請求 schema 不支援該模型(截至2026年7月) |
| Token 機率日誌 | 轉錄請求 schema 不支援該模型(截至2026年7月) |
| 速率限制 | 取決於 OpenAI 帳戶使用等級,具體需於帳戶後台查閱(截至2026年7月) |
| 授權/使用限制 | 受 OpenAI API 條款及相關使用政策約束(截至2026年7月) |
OpenAI 官方模型頁面列出 16,000 token 上下文視窗、2,000 token 最大輸出、音訊輸入、文字輸出,以及每百萬音訊 token 輸入 2.50 美元、輸出 10 美元。
此定價以 token 計價,並非保證每分鐘費用。實際轉錄請求成本會因錄音長度、語速、token 化及生成輸出而異。
GPT-4o Transcribe Diarize 在生產環境中的主要優勢
產生帶說話人標註的轉錄文字
本模型可將轉錄片段歸屬於不同說話人,無需額外的轉錄與分離服務,適用於會議、訪談、Podcast、研究會談及客服通話。
當說話人聲音相近、語音重疊或互相打斷時,建議人工複核說話人標籤。
回傳結構化說話人資料
模型支援 diarized_json 回應格式,適用於需要說話人標註的應用,而非僅有單一轉錄文字。
結構化輸出可支援可檢索歸檔、說話人摘要、通話複核面板、字幕流程及對話分析。說話人標籤僅代表模型分離結果,並非法律身分認證。
支援已知說話人參考
可選的說話人姓名與參考片段有助於將常見參與者與如主持人、採訪者、客服或客戶等標籤對應。
這些參考可提升體驗,但無法保證準確分配,特別是在發言短、音質差、背景雜訊、語音重疊或聲音相似時。
支援長錄音分段處理
針對超過 30 秒的音訊,API 要求採用分段策略。官方自動選項可將長錄音切割處理。
分段可簡化長文本轉錄,但片段邊界可能影響連貫性、時間戳及說話人歸屬。
支援下游自動化流程
結構化轉錄文字可用於檢索、摘要、品質複核、合規支援及分析系統。例如,應用可將客服與客戶發言分離後生成摘要。
任何下游流程都可能繼承轉錄與分離錯誤。涉及就業、醫療、法律、信貸、保險、合規或公共安全的高風險決策需人工複核。
GPT-4o Transcribe Diarize 支援哪些模態?
| 模態或輸出類型 | 是否支援 | 說明 |
|---|---|---|
| 音訊輸入 | 是 | 轉錄的主要輸入模態 |
| 文字請求欄位 | 是 | 用於參數及已知說話人標籤(如支援) |
| 影像輸入 | 否 | 未列為支援 |
| 影片畫面理解 | 否 | 僅轉錄音訊,不分析影片畫面 |
| 文字輸出 | 是 | 回傳轉錄文字 |
| JSON 輸出 | 是 | 標準 JSON 回應格式支援 |
| 分離 JSON 輸出 | 是 | 取得說話人標註必須使用 |
| 純文字輸出 | 是 | 支援無結構化說話人中繼資料 |
| 說話人標籤 | 是 | 分離輸出中可用 |
| 片段時間標註 | 是 | 分離回應含說話人片段與時間資料 |
| 音訊輸出 | 否 | 不產生語音 |
| SRT 輸出 | 否 | 未列為支援回應格式 |
| VTT 輸出 | 否 | 未列為支援回應格式 |
| 單字級時間戳粒度 | 未確認 | 不可假定支援其他轉錄模型的相關功能 |
OpenAI API 參考文件指出 GPT-4o Transcribe Diarize 支援 json、text、diarized_json,其中 diarized_json 用於說話人標註。
GPT-4o Transcribe Diarize 的限制
GPT-4o Transcribe Diarize 是專用轉錄模型,並非通用對話模型、推理模型、影像模型、翻譯複核流程或文字轉語音服務的替代品。
說話人標籤可能錯誤
當說話人重疊、互相打斷、低聲、遠距、麥克風品質不佳或聲音相似時,分離效果會下降。標籤如 speaker_1 僅代表模型分配片段,並不能獨立證明身分。
仍可能存在轉錄錯誤
模型可能誤聽姓名、數字、專有名詞、口音、低音量或被背景雜訊遮蔽的詞彙。標點與句子邊界也可能需人工編輯。
這是自動語音辨識的普遍限制,並非 GPT-4o Transcribe Diarize 獨有。
部分轉錄控制不可用
OpenAI 轉錄請求文件指出,GPT-4o Transcribe Diarize 不支援提示詞引導及 token 機率日誌。
當應用需透過轉錄提示詞提供術語表或檢查 token 級信心資訊時,GPT-4o Transcribe 或 GPT-4o Mini Transcribe 更適用,具體以當前 API 文件為準。
長錄音需分段處理
超過 30 秒的輸入需於轉錄請求中採用分段策略。分段會增加實作複雜度,並可能影響說話人連續性。
高風險轉錄需人工複核
自動轉錄文字不應作為最終證據,需核查原始錄音。法律、醫療、金融、就業、合規及安全相關轉錄需專業人員複核。
隱私與同意由開發者負責
錄音可能包含個人、機密、生物辨識或受監管資訊。開發者需評估本地法規下的同意、通知、儲存、存取控制、跨境處理及刪除要求。
文件存取範圍不明
OpenAI 模型頁面稱僅可透過 Transcription API 存取,但即時 API 參考頁亦將其列為分離對話選項。
由於官方頁面描述不同,生產團隊應於上線前確認當前即時行為是否支援分離架構。
GPT-4o Transcribe Diarize 最適合哪些場景?
本模型適用於需語音辨識與說話人分離的流程。「最適用」取決於具體場景,並不代表它是所有 ASR 模型中最強。
| 應用場景 | 適用原因 | 主要限制 |
|---|---|---|
| 商務會議 | 區分參與者片段,便於會議紀錄與摘要 | 重疊語音與遠距麥克風會影響準確性 |
| 訪談 | 區分採訪者與受訪者發言 | 姓名、引用及敏感內容需人工複核 |
| Podcast | 產生結構化說話人轉錄,便於編輯與檢索 | 對談與音樂會影響片段分離 |
| 客服通話 | 區分客服與客戶語音,便於品質複核 | 自動合規結論需人工審查 |
| 質性研究 | 產生可檢索的參與者轉錄文字 | 需處理同意、匿名化與儲存規範 |
| 對話分析 | 支援說話人級主題或情緒處理 | 分析結果受轉錄與分離錯誤影響 |
| 字幕製作 | 提供帶時間戳片段,支援字幕流程 | SRT 與 VTT 格式未直接列為支援輸出 |
| 內部知識歸檔 | 轉換錄音為結構化可檢索文字 | 機密錄音需權限管控與治理 |
若錄音僅有一位說話人,內建分離功能價值有限。無分離轉錄模型可能更簡單或更經濟,具體取決於當前定價與流程需求。
GPT-4o Transcribe Diarize 與 GPT-4o Transcribe、GPT-4o Mini Transcribe 比較
| 比較面向 | GPT-4o Transcribe Diarize | GPT-4o Transcribe | GPT-4o Mini Transcribe | 適用場景 |
|---|---|---|---|---|
| 主要用途 | 語音轉文字並分離說話人 | 通用語音轉文字 | 低價語音轉文字 | 依說話人標籤與成本需求選擇 |
| 內建說話人標籤 | 支援(diarized_json) | 未列為內建輸出 | 未列為內建輸出 | Diarize 適合多說話人錄音 |
| 上下文視窗 | 16,000 token | 16,000 token | 16,000 token | 無明顯差異 |
| 最大輸出 | 2,000 token | 2,000 token | 2,000 token | 輸出上限相同 |
| 輸入價格 | 每百萬音訊 token 2.50 美元 | 每百萬音訊 token 2.50 美元 | 每百萬音訊 token 1.25 美元 | Mini 適合成本敏感場景 |
| 輸出價格 | 每百萬 token 10 美元 | 每百萬 token 10 美元 | 每百萬 token 5 美元 | Mini 輸出價格更低 |
| 提示詞引導 | 不支援轉錄 schema | 支援轉錄流程 | 支援轉錄流程 | 非分離模型適合術語表引導轉錄 |
| 機率日誌 | 不支援 | 支援 | 支援 | 需信心度分析時相關 |
| 分離 JSON | 支援 | 未列為支援 | 未列為支援 | Diarize 適合結構化說話人輸出 |
| 典型場景 | 會議、訪談、通話、多說話人歸檔 | 高品質通用轉錄 | 高量或成本敏感轉錄 | 需用代表性音訊測試選型 |
OpenAI 官方頁面顯示 GPT-4o Mini Transcribe 輸入價格每百萬音訊 token 1.25 美元,輸出價格每百萬 token 5 美元,而 GPT-4o Transcribe Diarize 分別為 2.50 美元與 10 美元。三者皆為 16,000 token 上下文視窗、2,000 token 最大輸出。
沒有絕對優選。GPT-4o Transcribe Diarize 適合多說話人錄音;GPT-4o Transcribe 適合需提示詞引導轉錄;GPT-4o Mini Transcribe 適合優先考慮低價的應用。
如何透過 Gate.AI 接入 GPT-4o Transcribe Diarize?
Gate.AI 模型卡將 GPT-4o Transcribe Diarize 列為模型 ID:
openai/gpt-4o-transcribe-diarize
Gate.AI 文件說明其通用 API 閘道相容 OpenAI,並指定 OpenAI 相容基址 https://api.gate.ai/openai/v1,開發者需採用 provider/model-name 格式的模型 ID。
但目前 Gate.AI 文件未明確說明 GPT-4o Transcribe Diarize 的音訊轉錄端點、multipart 請求 schema、回應欄位或模型定價。為避免將通用聊天範例誤作轉錄請求,本文不提供該模型的 Gate.AI 可執行程式碼。
實作前建議查閱 Gate.AI 模型卡,確認:
- 當前模型可用性
- 支援的轉錄端點
- 請求與上傳要求
- 分離回應支援
- token 或音訊定價
- 帳戶存取限制
OpenAI API 接入
OpenAI 官方文件描述此模型透過 Audio Transcriptions API 使用:
- 端點:
POST https://api.openai.com/v1/audio/transcriptions - 認證: Bearer 認證,需 OpenAI API key
- 模型 ID:
gpt-4o-transcribe-diarize - 請求格式:
multipart/form-data - 說話人標註回應:
diarized_json
Python 範例
import osfrom openai import OpenAIclient = OpenAI(api_key=os.environ["OPENAI_API_KEY"])with open("meeting.wav", "rb") as audio_file:transcription = client.audio.transcriptions.create(model="gpt-4o-transcribe-diarize",file=audio_file,response_format="diarized_json",chunking_strategy="auto",)for segment in transcription.segments:print(f"{segment.speaker}: {segment.text} "f"({segment.start:.2f}s–{segment.end:.2f}s)")
curl 範例
curl https://api.openai.com/v1/audio/transcriptions \-H "Authorization: Bearer $OPENAI_API_KEY" \-F "file=@meeting.wav" \-F "model=gpt-4o-transcribe-diarize" \-F "response_format=diarized_json" \-F "chunking_strategy=auto"
如需說話人標註,必須使用 diarized_json 格式。對於超過 30 秒的輸入,OpenAI 要求採用分段策略。
生產應用需驗證檔案類型、錄音長度、錯誤回應、重試機制、隱私控管及速率限制,確保處理敏感或大量錄音安全可靠。
常見問題解答
GPT-4o Transcribe Diarize 的上下文視窗是多少?
OpenAI 官方列出 GPT-4o Transcribe Diarize 的上下文視窗為 16,000 token,最大輸出為 2,000 token(截至2026年7月)。
GPT-4o Transcribe Diarize 的費用是多少?
OpenAI 官方定價為每百萬音訊輸入 token 2.50 美元、每百萬輸出 token 10 美元(截至2026年7月)。Gate.AI 定價於參考模型卡中顯示暫不可用。
如何透過 API 取得說話人標籤?
將音訊傳送至 OpenAI Audio Transcriptions API,模型 ID 設為 gpt-4o-transcribe-diarize,response_format 設為 diarized_json。此格式為取得說話人標註所必須。
何時選用 GPT-4o Transcribe Diarize 而非 GPT-4o Mini Transcribe?
當錄音需內建說話人分離時,GPT-4o Transcribe Diarize 更適用;若僅需低價轉錄且無需說話人標籤,則 GPT-4o Mini Transcribe 更合適。建議依代表性音訊測試、延遲、準確度及當前價格綜合選擇。


