Gate.AI博客Whisper 1:完整規格、定價、API 接入與應用場景(2026)

    Whisper 1:完整規格、定價、API 接入與應用場景(2026)

    模型

    什麼是 Whisper 1?

    Whisper 1 是 OpenAI 推出的通用自動語音辨識(ASR)模型,源自 2022年9月21日發佈的 Whisper 系統,具備多語言轉錄、語言辨識、語音轉英文翻譯等功能。截止 2026年7月,Whisper 1 的託管 API 價格為每分鐘音訊 0.006 美元。

    OpenAI 將 Whisper 描述為基於 Transformer 架構的語音辨識系統,使用從網路收集的 68 萬小時多語言、多任務有監督音訊進行訓練。其訓練設計支援多語言語音辨識、語言辨識、時間戳預測,以及語音到英文的翻譯。

    託管於 OpenAI 的 API 模型使用模型 ID whisper-1。該模型接受音訊輸入,輸出文字結果;它並非對話型大型語言模型、推理模型、圖像模型或文字轉語音系統。OpenAI 將其歸類為通用語音辨識模型,輸入為音訊,輸出為文字。

    Whisper 1 常用於訪談轉錄、會議紀錄、講座筆記、字幕製作、媒體索引、可檢索音訊檔案及將錄音語音翻譯為英文的各類工作流程。

    Whisper 1 的主要規格與定價如何?

    規格 經驗證的數值
    服務商 OpenAI(截至 2026年7月)
    模型家族 Whisper(截至 2026年7月)
    模型類型 通用自動語音辨識模型(截至 2026年7月)
    首次發佈日期 2022年9月21日(截至 2026年7月)
    託管 API 模型 ID whisper-1(截至 2026年7月)
    Gate.AI 模型 ID openai/stt-whisper-1,詳見 Gate.AI 模型卡與 https://gate.ai/models(截至 2026年7月)
    上下文視窗 官方文件未以傳統 token 上下文視窗形式說明(截至 2026年7月)
    OpenAI 輸入定價 $0.006/分鐘音訊(截至 2026年7月)
    快取輸入定價 不適用或未說明(截至 2026年7月)
    輸出定價 未單獨說明文字輸出價格;按音訊時長計費(截至 2026年7月)
    計費單位 音訊分鐘(截至 2026年7月)
    輸入模態 音訊(截至 2026年7月)
    輸出模態 文字(截至 2026年7月)
    支援檔案類型 mp3、mp4、mpeg、mpga、m4a、wav、webm(截至 2026年7月)
    檔案上傳限制 OpenAI 轉錄 API 單檔案 25 MB(截至 2026年7月)
    API 存取 OpenAI 音訊 API 及 Gate.AI 語音轉文字 API(截至 2026年7月)
    翻譯方向 支援語言語音轉英文(截至 2026年7月)
    單字級時間戳 透過 whisper-1 的 timestamp_granularities 支援(截至 2026年7月)
    知識截止時間 不適用於傳統 LLM 概念;OpenAI 未說明(截至 2026年7月)
    速率限制 依帳號及使用等級而定;未在此說明統一固定速率(截至 2026年7月)
    微調支援 託管 whisper-1 API 未確認支援(截至 2026年7月)
    原生即時支援 whisper-1 未說明;OpenAI 單獨文件有即時轉錄模型與 API(截至 2026年7月)
    批次 API 支援 文件未確認 whisper-1 支援批次處理(截至 2026年7月)
    說話人分離 未確認 whisper-1 原生支援(截至 2026年7月)
    工具或函式呼叫 不適用於此語音辨識模型(截至 2026年7月)
    通用 JSON 模式 不適用;提供轉錄專用回應格式(截至 2026年7月)
    開源可用性 Whisper 程式碼與模型權重可與託管 API 分開取得(截至 2026年7月)
    授權與使用限制 託管 API 遵循 OpenAI 服務條款;開源倉庫有獨立授權協議(截至 2026年7月)

    OpenAI 模型文件將 Whisper 1 定價為每分鐘 0.006 美元,輸入為音訊,輸出為文字。該模型未公佈單獨的輸入 token、快取 token 或輸出 token 價格。

    根據 Gate.AI 在 https://gate.ai/models 的資訊,openai/stt-whisper-1 未顯示傳統輸入/輸出 token 價格。Gate.AI API 文件指出,whisper-1 通常按音訊時長計費,與按 token 計費的轉錄模型有所區別。

    Whisper 1 在生產環境中的主要應用價值是什麼?

    多語言音訊轉錄

    Whisper 1 能將錄音中的語音轉為對應語言的文字,適用於訪談、講座、用戶調查、內部會議、Podcast 及媒體檔案等場景。準確率受語言、口音、麥克風品質、背景噪音、說話人重疊及專業術語等因素影響。

    語音轉英文翻譯

    OpenAI 官方文件說明了兩種主要語音轉文字流程:一是原語言音訊轉錄,二是支援語言的語音直接翻譯為英文。這有助於多語言內容審查流程減少處理環節,但 Whisper 1 並不支援任意語音直接翻譯為所有目標語言。

    單字與片段級時間戳

    透過 timestamp_granularities 參數可回傳片段級、單字級或兩者兼有的時間戳。OpenAI 明確指出該參數適用於 whisper-1。時間戳資料有助於字幕對齊、轉錄導覽、媒體編輯、引用核查及可檢索播放介面。

    主流音訊與媒體格式支援

    Transcriptions API 支援 MP3、MP4、MPEG、MPGA、M4A、WAV、WebM 等主流格式,降低了媒體處理流程中的格式轉換需求,但開發者仍需對大檔案進行壓縮或分段。

    提示詞引導轉錄

    API 可接受上下文提示資訊,協助指定預期術語、姓名、縮寫或寫作風格。提示詞有助於提升一致性,但無法保證對生僻姓名或專業詞彙的準確辨識。

    Whisper 1 支援哪些輸入輸出模態?

    模態 是否支援 說明
    音訊輸入 支援主流音訊及媒體檔案格式
    文字輸入 有限 可選指令及轉錄參數;不支援通用文字生成
    圖像輸入 Whisper 1 不處理圖像
    影片理解 可處理 MP4 檔案的音訊內容,但不分析影片畫面
    文字輸出 輸出轉錄文字或英文翻譯文字
    音訊輸出 Whisper 1 不產生語音
    片段時間戳 支援帶時間戳的回應格式
    單字時間戳 whisper-1 支援 timestamp_granularities
    原生說話人標籤 未確認 可能需單獨說話人分離處理
    原生即時對話 未確認 即時串流場景建議用專門即時轉錄模型

    OpenAI 目前將 Transcriptions API 單次上傳限制為 25 MB,支援 mp3mp4mpegmpgam4awavwebm。超出限制的檔案需壓縮或分段上傳。OpenAI 建議避免在句中切分,因為片段邊界可能遺失有用上下文。

    Whisper 1 有哪些局限?

    Whisper 1 是專用語音辨識模型,無法獨立對轉錄文字進行摘要、回答錄音相關問題、主題分類、圖像生成、語音合成或通用推理。這些任務需借助其他模型或應用層實現。

    OpenAI 25 MB 上傳限制會增加長時間訪談、講座、會議、Podcast 及影片檔案的前處理工作。分段處理還可能導致上下文遺失、標點不一致、文字重複或句子斷裂等問題。

    其翻譯流程僅輸出英文文字。如需將語音直接翻譯為非英文目標語言,通常需另行設定翻譯流程。

    Whisper 1 不保證說話人歸屬準確。若對說話人標籤有要求,應採用經過驗證的說話人分離功能或獨立分段系統,並在代表性錄音上進行測試。

    當存在說話人重疊、麥克風距離遠、背景音樂或噪音大、頻繁切換語言、生僻姓名、專業術語或低資源語言時,轉錄品質可能下降。上下文提示可輔助詞彙辨識,但不能作為準確性的保證。

    此外,這也是通用 AI 的局限,並非 Whisper 1 獨有:生成的轉錄文字可能存在合理但錯誤的詞語、遺漏或標點問題。法律、醫療、金融、調查、無障礙及安全關鍵場景的轉錄內容,需由具備資格的人員對照原始錄音複核。

    Whisper 1 最適合哪些應用場景?

    應用場景 適用原因 重要限制
    訪談轉錄 將錄音語音轉為可編輯、可檢索文字 姓名、引用及說話人變化需人工複核
    會議紀錄 產生文字紀錄,便於檢索和後續摘要 原生說話人分離未確認支援
    講座及網路研討會轉錄 支援長時語音內容,前提是檔案準備得當 大型錄音需壓縮或分段
    字幕製作 輸出帶時間戳文字,便於對齊和編輯 時序與措辭需人工校驗
    Podcast 及媒體索引 使語音內容可檢索、便於歸檔 音樂及說話人重疊會影響準確率
    多語言研究 支援原語言轉錄 準確率受語言和錄音品質影響
    語音轉英文翻譯 將非英文音訊轉為英文文字 僅支援英文為目標語言
    檔案數位化 將錄音資料轉為可檢索文字 原音訊品質差會影響可靠性
    內容審查輔助 產生文字便於下游系統審查 轉錄可能遺失音訊含義和上下文
    無障礙流程 提供草稿轉錄或字幕來源 發佈前需人工校正

    「最佳用途」需結合具體場景判斷。Whisper 1 適用於需穩定、基於檔案的轉錄 API、英文翻譯或單字級時間戳的場合。建議在目標語言、口音、聲學環境和詞彙與實際需求一致的錄音上進行評估。

    Whisper 1 與 GPT-4o Transcribe 及 GPT-4o Mini Transcribe 有何比較?

    比較維度 Whisper 1 GPT-4o Transcribe GPT-4o Mini Transcribe 適用場景
    主要用途 通用多語言語音辨識 OpenAI 新一代轉錄模型 OpenAI 新一代小型轉錄模型 三者均適用於語音轉文字工作流程
    音訊輸入 支援 支援 支援 適用於錄音轉錄場景
    文字輸出 支援 支援 支援 均輸出文字轉錄結果
    OpenAI 定價 $0.006/分鐘音訊 部署前請查閱最新 OpenAI 定價 部署前請查閱最新 OpenAI 定價 建議按即時定價比較整體成本
    英文翻譯 Whisper 1 明確支援 請確認目前端點支援情況 請確認目前端點支援情況 Whisper 1 適用於既有語音轉英文流程
    單字級時間戳 Whisper 1 明確支援 請確認目前功能支援情況 請確認目前功能支援情況 Whisper 1 適合已基於時間戳輸出的應用
    API 成熟度 託管模型,整合歷史悠久 新一代模型 新一代高效模型 現有系統可優先考慮相容性,新增應用建議比較測試
    原生說話人分離 未確認 請查閱最新模型文件 請查閱最新模型文件 需說話人標籤的流程需驗證功能
    即時應用 未說明原生即時支援 請查閱最新即時支援情況 請查閱最新即時支援情況 即時場景應選用專門即時轉錄模型

    沒有哪款轉錄模型適用於所有場景。Whisper 1 適合依賴其模型 ID、翻譯行為或時間戳格式的既有整合。新應用建議在代表性音訊上測試 Whisper 1 及新一代轉錄模型,並比較準確率、延遲、回應特性及整體成本。

    如何透過 Gate.AI 存取 Whisper 1?

    根據 Gate.AI 模型卡(https://gate.ai/models),Gate.AI 的模型 ID 為:

    openai/stt-whisper-1

    Gate.AI 提供相容 OpenAI 的 API 基礎 URL:

    https://api.gate.ai/openai/v1​​

    其語音轉文字介面說明包括:POST /audio/transcriptions,Bearer-token 認證,multipart/form-data 請求體,同步文字輸出,使用資訊及按時長計費。

    Python 範例

    Python import os

    from pathlib import Path

    import OpenAI from openai

    audio_path = Path(“audio.mp3”)

    if audio_path.is_file():
    raise FileNotFoundError(f”Audio file not found: {audio_path}”)

    client = OpenAI(
    api_key=os.environ[“GATEAI_API_KEY”],
    base_url=”https://api.gate.ai/openai/v1“,
    )

    with audio_path.open(“rb”) as audio_file:
    transcription = client.audio.transcriptions.create(
    model=”openai/stt-whisper-1”,
    file=audio_file,
    )

    print(transcription.text )

    curl 範例

    ``` Bash curl —request POST \

    —url “https://api.gate.ai/openai/v1/audio/transcriptions“ \
    —header “Authorization: Bearer ${GATEAI_API_KEY}” \
    —form “file=@audio.mp3” \
    —form “model=openai/stt-whisper-1” ```

    上述範例將 API 密鑰保存在環境變數 GATEAI_API_KEY 中,避免直接寫入原始碼。應用部署前還應校驗檔案類型、檔案大小、錯誤回應、重試機制及帳號限額等。

    Gate.AI 將語音轉文字介面描述為同步介面。因此,對於長時或高併發任務,建議設計合理的請求逾時、排隊、檔案校驗及重試策略。

    開發者亦可直接透過 OpenAI 的 /v1/audio/transcriptions/v1/audio/translations API,使用 OpenAI 模型 ID whisper-1 存取該模型。

    常見問題解答

    Whisper 1 的上下文視窗是多少?

    OpenAI 未以傳統 token 上下文視窗定義 Whisper 1,因其為音訊轉錄模型而非聊天型 LLM。更相關的 API 限制是 OpenAI 轉錄 API 的 25 MB 檔案上傳上限。

    Whisper 1 的定價是多少?

    OpenAI 將 Whisper 1 定價為每分鐘音訊 0.006 美元(截至 2026年7月)。未公佈單獨的輸入 token、快取 token 或輸出 token 價格。Gate.AI 記錄 whisper-1 按時長計費;部署前應查閱帳號目前定價。

    開發者如何存取 Whisper 1?

    開發者可直接透過 OpenAI 音訊 API,使用模型 ID whisper-1 存取。根據 Gate.AI 模型卡,也可透過 Gate.AI 相容 OpenAI 的 /audio/transcriptions 端點,以 openai/stt-whisper-1 呼叫。

    Whisper 1 適用於哪些場景?

    Whisper 1 適用於錄音訪談、會議、講座、字幕、Podcast、多語言轉錄、可檢索音訊檔案及語音轉英文翻譯。準確率受語言、口音、錄音品質、說話人重疊、背景噪音及專業詞彙影響,重要轉錄內容需人工複核。

    相關文章