Gate.AI博客GPT-4o 逐字轉錄與分角色記錄:完整規格、定價、API 接入與應用場景(2026)

    GPT-4o 逐字轉錄與分角色記錄:完整規格、定價、API 接入與應用場景(2026)

    模型

    什麼是 GPT-4o Transcribe Diarize?

    GPT-4o Transcribe Diarize 是 OpenAI 推出的自動語音辨識模型,具備內建說話人分離功能。該模型的正式發佈時間尚未公開,擁有 16,000 個 token 的上下文視窗,2026年7月的 token 定價為每百萬音訊輸入 token 2.50 美元、每百萬輸出 token 10 美元。

    此模型能將錄音語音轉換為文字,並將轉錄片段與不同說話人對應。說話人分離可回答「誰在什麼時候說話」,讓轉錄內容能夠區分會議、訪談、Podcast、研究對話及客服通話中的參與者。

    OpenAI 將此 API 模型標示為 gpt-4o-transcribe-diarize。其模型頁面描述本模型為具備說話人辨識的轉錄模型,並指出可透過 Transcription API 存取。該模型專為音訊處理設計,不適用於一般聊天、推理、影像生成或文字轉語音等任務。

    目前官方模型頁面尚未明確公告具體上線時程。為避免將推測日期誤認為官方資訊,本文截至2026年7月,記錄該模型發佈時間以 OpenAI 正式產品文件為準。

    GPT-4o Transcribe Diarize 的主要參數與定價

    以下參數主要根據 OpenAI 官方模型頁面、語音轉文字文件及轉錄 API 參考,所有內容皆為2026年7月的官方狀態。

    參數 官方數值
    服務商 OpenAI(截至2026年7月)
    模型系列 GPT-4o Transcribe(截至2026年7月)
    模型類型 自動語音辨識模型,具備說話人分離功能(截至2026年7月)
    發佈時間 官方管道未確認(截至2026年7月)
    上下文視窗 16,000 個 token(截至2026年7月)
    最大輸出 2,000 個 token(截至2026年7月)
    輸入定價 每百萬音訊輸入 token 2.50 美元(截至2026年7月)
    快取輸入定價 官方文件未說明(截至2026年7月)
    輸出定價 每百萬輸出 token 10.00 美元(截至2026年7月)
    定價單位 輸入與輸出皆以每百萬音訊 token 計價(截至2026年7月)
    支援輸入模態 文字相關請求欄位及音訊輸入(截至2026年7月)
    支援輸出模態 文字輸出,可選說話人片段中繼資料(截至2026年7月)
    支援回應格式 json、text、diarized_json(截至2026年7月)
    說話人標註輸出 需使用 diarized_json(截至2026年7月)
    服務商 API 接入 OpenAI Audio Transcriptions API(截至2026年7月)
    服務商模型 ID gpt-4o-transcribe-diarize(截至2026年7月)
    Gate.AI 模型 ID openai/gpt-4o-transcribe-diarize,Gate.AI 模型卡所述(截至2026年7月)
    Gate.AI 定價 Gate.AI 模型卡顯示暫不可用(截至2026年7月)
    可用性 OpenAI API 與 Gate.AI 模型目錄均有列出(截至2026年7月)
    知識截止日期 2024年6月1日(截至2026年7月)
    微調支援 官方模型頁面未列為支援(截至2026年7月)
    批次 API 支援 官方管道未確認(截至2026年7月)
    工具/函數呼叫 不適用於已記錄的轉錄工作流程(截至2026年7月)
    結構化輸出 diarized_json 提供結構化說話人片段;未見通用 JSON Schema 強制(截至2026年7月)
    提示詞支援 轉錄請求 schema 不支援該模型(截至2026年7月)
    Token 機率日誌 轉錄請求 schema 不支援該模型(截至2026年7月)
    速率限制 取決於 OpenAI 帳戶使用等級,具體需於帳戶後台查閱(截至2026年7月)
    授權/使用限制 受 OpenAI API 條款及相關使用政策約束(截至2026年7月)

    OpenAI 官方模型頁面列出 16,000 token 上下文視窗、2,000 token 最大輸出、音訊輸入、文字輸出,以及每百萬音訊 token 輸入 2.50 美元、輸出 10 美元。

    此定價以 token 計價,並非保證每分鐘費用。實際轉錄請求成本會因錄音長度、語速、token 化及生成輸出而異。

    GPT-4o Transcribe Diarize 在生產環境中的主要優勢

    產生帶說話人標註的轉錄文字

    本模型可將轉錄片段歸屬於不同說話人,無需額外的轉錄與分離服務,適用於會議、訪談、Podcast、研究會談及客服通話。

    當說話人聲音相近、語音重疊或互相打斷時,建議人工複核說話人標籤。

    回傳結構化說話人資料

    模型支援 diarized_json 回應格式,適用於需要說話人標註的應用,而非僅有單一轉錄文字。

    結構化輸出可支援可檢索歸檔、說話人摘要、通話複核面板、字幕流程及對話分析。說話人標籤僅代表模型分離結果,並非法律身分認證。

    支援已知說話人參考

    可選的說話人姓名與參考片段有助於將常見參與者與如主持人、採訪者、客服或客戶等標籤對應。

    這些參考可提升體驗,但無法保證準確分配,特別是在發言短、音質差、背景雜訊、語音重疊或聲音相似時。

    支援長錄音分段處理

    針對超過 30 秒的音訊,API 要求採用分段策略。官方自動選項可將長錄音切割處理。

    分段可簡化長文本轉錄,但片段邊界可能影響連貫性、時間戳及說話人歸屬。

    支援下游自動化流程

    結構化轉錄文字可用於檢索、摘要、品質複核、合規支援及分析系統。例如,應用可將客服與客戶發言分離後生成摘要。

    任何下游流程都可能繼承轉錄與分離錯誤。涉及就業、醫療、法律、信貸、保險、合規或公共安全的高風險決策需人工複核。

    GPT-4o Transcribe Diarize 支援哪些模態?

    模態或輸出類型 是否支援 說明
    音訊輸入 轉錄的主要輸入模態
    文字請求欄位 用於參數及已知說話人標籤(如支援)
    影像輸入 未列為支援
    影片畫面理解 僅轉錄音訊,不分析影片畫面
    文字輸出 回傳轉錄文字
    JSON 輸出 標準 JSON 回應格式支援
    分離 JSON 輸出 取得說話人標註必須使用
    純文字輸出 支援無結構化說話人中繼資料
    說話人標籤 分離輸出中可用
    片段時間標註 分離回應含說話人片段與時間資料
    音訊輸出 不產生語音
    SRT 輸出 未列為支援回應格式
    VTT 輸出 未列為支援回應格式
    單字級時間戳粒度 未確認 不可假定支援其他轉錄模型的相關功能

    OpenAI API 參考文件指出 GPT-4o Transcribe Diarize 支援 jsontextdiarized_json,其中 diarized_json 用於說話人標註。

    GPT-4o Transcribe Diarize 的限制

    GPT-4o Transcribe Diarize 是專用轉錄模型,並非通用對話模型、推理模型、影像模型、翻譯複核流程或文字轉語音服務的替代品。

    說話人標籤可能錯誤

    當說話人重疊、互相打斷、低聲、遠距、麥克風品質不佳或聲音相似時,分離效果會下降。標籤如 speaker_1 僅代表模型分配片段,並不能獨立證明身分。

    仍可能存在轉錄錯誤

    模型可能誤聽姓名、數字、專有名詞、口音、低音量或被背景雜訊遮蔽的詞彙。標點與句子邊界也可能需人工編輯。

    這是自動語音辨識的普遍限制,並非 GPT-4o Transcribe Diarize 獨有。

    部分轉錄控制不可用

    OpenAI 轉錄請求文件指出,GPT-4o Transcribe Diarize 不支援提示詞引導及 token 機率日誌。

    當應用需透過轉錄提示詞提供術語表或檢查 token 級信心資訊時,GPT-4o Transcribe 或 GPT-4o Mini Transcribe 更適用,具體以當前 API 文件為準。

    長錄音需分段處理

    超過 30 秒的輸入需於轉錄請求中採用分段策略。分段會增加實作複雜度,並可能影響說話人連續性。

    高風險轉錄需人工複核

    自動轉錄文字不應作為最終證據,需核查原始錄音。法律、醫療、金融、就業、合規及安全相關轉錄需專業人員複核。

    隱私與同意由開發者負責

    錄音可能包含個人、機密、生物辨識或受監管資訊。開發者需評估本地法規下的同意、通知、儲存、存取控制、跨境處理及刪除要求。

    文件存取範圍不明

    OpenAI 模型頁面稱僅可透過 Transcription API 存取,但即時 API 參考頁亦將其列為分離對話選項。

    由於官方頁面描述不同,生產團隊應於上線前確認當前即時行為是否支援分離架構。

    GPT-4o Transcribe Diarize 最適合哪些場景?

    本模型適用於需語音辨識與說話人分離的流程。「最適用」取決於具體場景,並不代表它是所有 ASR 模型中最強。

    應用場景 適用原因 主要限制
    商務會議 區分參與者片段,便於會議紀錄與摘要 重疊語音與遠距麥克風會影響準確性
    訪談 區分採訪者與受訪者發言 姓名、引用及敏感內容需人工複核
    Podcast 產生結構化說話人轉錄,便於編輯與檢索 對談與音樂會影響片段分離
    客服通話 區分客服與客戶語音,便於品質複核 自動合規結論需人工審查
    質性研究 產生可檢索的參與者轉錄文字 需處理同意、匿名化與儲存規範
    對話分析 支援說話人級主題或情緒處理 分析結果受轉錄與分離錯誤影響
    字幕製作 提供帶時間戳片段,支援字幕流程 SRT 與 VTT 格式未直接列為支援輸出
    內部知識歸檔 轉換錄音為結構化可檢索文字 機密錄音需權限管控與治理

    若錄音僅有一位說話人,內建分離功能價值有限。無分離轉錄模型可能更簡單或更經濟,具體取決於當前定價與流程需求。

    GPT-4o Transcribe Diarize 與 GPT-4o Transcribe、GPT-4o Mini Transcribe 比較

    比較面向 GPT-4o Transcribe Diarize GPT-4o Transcribe GPT-4o Mini Transcribe 適用場景
    主要用途 語音轉文字並分離說話人 通用語音轉文字 低價語音轉文字 依說話人標籤與成本需求選擇
    內建說話人標籤 支援(diarized_json) 未列為內建輸出 未列為內建輸出 Diarize 適合多說話人錄音
    上下文視窗 16,000 token 16,000 token 16,000 token 無明顯差異
    最大輸出 2,000 token 2,000 token 2,000 token 輸出上限相同
    輸入價格 每百萬音訊 token 2.50 美元 每百萬音訊 token 2.50 美元 每百萬音訊 token 1.25 美元 Mini 適合成本敏感場景
    輸出價格 每百萬 token 10 美元 每百萬 token 10 美元 每百萬 token 5 美元 Mini 輸出價格更低
    提示詞引導 不支援轉錄 schema 支援轉錄流程 支援轉錄流程 非分離模型適合術語表引導轉錄
    機率日誌 不支援 支援 支援 需信心度分析時相關
    分離 JSON 支援 未列為支援 未列為支援 Diarize 適合結構化說話人輸出
    典型場景 會議、訪談、通話、多說話人歸檔 高品質通用轉錄 高量或成本敏感轉錄 需用代表性音訊測試選型

    OpenAI 官方頁面顯示 GPT-4o Mini Transcribe 輸入價格每百萬音訊 token 1.25 美元,輸出價格每百萬 token 5 美元,而 GPT-4o Transcribe Diarize 分別為 2.50 美元與 10 美元。三者皆為 16,000 token 上下文視窗、2,000 token 最大輸出。

    沒有絕對優選。GPT-4o Transcribe Diarize 適合多說話人錄音;GPT-4o Transcribe 適合需提示詞引導轉錄;GPT-4o Mini Transcribe 適合優先考慮低價的應用。

    如何透過 Gate.AI 接入 GPT-4o Transcribe Diarize?

    Gate.AI 模型卡將 GPT-4o Transcribe Diarize 列為模型 ID:

    openai/gpt-4o-transcribe-diarize

    Gate.AI 文件說明其通用 API 閘道相容 OpenAI,並指定 OpenAI 相容基址 https://api.gate.ai/openai/v1,開發者需採用 provider/model-name 格式的模型 ID。

    但目前 Gate.AI 文件未明確說明 GPT-4o Transcribe Diarize 的音訊轉錄端點、multipart 請求 schema、回應欄位或模型定價。為避免將通用聊天範例誤作轉錄請求,本文不提供該模型的 Gate.AI 可執行程式碼。

    實作前建議查閱 Gate.AI 模型卡,確認:

    • 當前模型可用性
    • 支援的轉錄端點
    • 請求與上傳要求
    • 分離回應支援
    • token 或音訊定價
    • 帳戶存取限制

    OpenAI API 接入

    OpenAI 官方文件描述此模型透過 Audio Transcriptions API 使用:

    • 端點: POST https://api.openai.com/v1/audio/transcriptions
    • 認證: Bearer 認證,需 OpenAI API key
    • 模型 ID: gpt-4o-transcribe-diarize
    • 請求格式: multipart/form-data
    • 說話人標註回應: diarized_json

    Python 範例

    1. import os
    2. from openai import OpenAI
    3. client = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
    4. with open("meeting.wav", "rb") as audio_file:
    5. transcription = client.audio.transcriptions.create(
    6. model="gpt-4o-transcribe-diarize",
    7. file=audio_file,
    8. response_format="diarized_json",
    9. chunking_strategy="auto",
    10. )
    11. for segment in transcription.segments:
    12. print(
    13. f"{segment.speaker}: {segment.text} "
    14. f"({segment.start:.2f}s–{segment.end:.2f}s)"
    15. )

    curl 範例

    1. curl https://api.openai.com/v1/audio/transcriptions \
    2. -H "Authorization: Bearer $OPENAI_API_KEY" \
    3. -F "file=@meeting.wav" \
    4. -F "model=gpt-4o-transcribe-diarize" \
    5. -F "response_format=diarized_json" \
    6. -F "chunking_strategy=auto"

    如需說話人標註,必須使用 diarized_json 格式。對於超過 30 秒的輸入,OpenAI 要求採用分段策略。

    生產應用需驗證檔案類型、錄音長度、錯誤回應、重試機制、隱私控管及速率限制,確保處理敏感或大量錄音安全可靠。

    常見問題解答

    GPT-4o Transcribe Diarize 的上下文視窗是多少?

    OpenAI 官方列出 GPT-4o Transcribe Diarize 的上下文視窗為 16,000 token,最大輸出為 2,000 token(截至2026年7月)。

    GPT-4o Transcribe Diarize 的費用是多少?

    OpenAI 官方定價為每百萬音訊輸入 token 2.50 美元、每百萬輸出 token 10 美元(截至2026年7月)。Gate.AI 定價於參考模型卡中顯示暫不可用。

    如何透過 API 取得說話人標籤?

    將音訊傳送至 OpenAI Audio Transcriptions API,模型 ID 設為 gpt-4o-transcribe-diarizeresponse_format 設為 diarized_json。此格式為取得說話人標註所必須。

    何時選用 GPT-4o Transcribe Diarize 而非 GPT-4o Mini Transcribe?

    當錄音需內建說話人分離時,GPT-4o Transcribe Diarize 更適用;若僅需低價轉錄且無需說話人標籤,則 GPT-4o Mini Transcribe 更合適。建議依代表性音訊測試、延遲、準確度及當前價格綜合選擇。

    相關文章