Whisper 1:完整規格、定價、API 接入與應用場景(2026)
什麼是 Whisper 1?
Whisper 1 是 OpenAI 推出的通用自動語音辨識(ASR)模型,源自 2022年9月21日發佈的 Whisper 系統,具備多語言轉錄、語言辨識、語音轉英文翻譯等功能。截止 2026年7月,Whisper 1 的託管 API 價格為每分鐘音訊 0.006 美元。
OpenAI 將 Whisper 描述為基於 Transformer 架構的語音辨識系統,使用從網路收集的 68 萬小時多語言、多任務有監督音訊進行訓練。其訓練設計支援多語言語音辨識、語言辨識、時間戳預測,以及語音到英文的翻譯。
託管於 OpenAI 的 API 模型使用模型 ID whisper-1。該模型接受音訊輸入,輸出文字結果;它並非對話型大型語言模型、推理模型、圖像模型或文字轉語音系統。OpenAI 將其歸類為通用語音辨識模型,輸入為音訊,輸出為文字。
Whisper 1 常用於訪談轉錄、會議紀錄、講座筆記、字幕製作、媒體索引、可檢索音訊檔案及將錄音語音翻譯為英文的各類工作流程。
Whisper 1 的主要規格與定價如何?
| 規格 | 經驗證的數值 |
|---|---|
| 服務商 | OpenAI(截至 2026年7月) |
| 模型家族 | Whisper(截至 2026年7月) |
| 模型類型 | 通用自動語音辨識模型(截至 2026年7月) |
| 首次發佈日期 | 2022年9月21日(截至 2026年7月) |
| 託管 API 模型 ID | whisper-1(截至 2026年7月) |
| Gate.AI 模型 ID | openai/stt-whisper-1,詳見 Gate.AI 模型卡與 https://gate.ai/models(截至 2026年7月) |
| 上下文視窗 | 官方文件未以傳統 token 上下文視窗形式說明(截至 2026年7月) |
| OpenAI 輸入定價 | $0.006/分鐘音訊(截至 2026年7月) |
| 快取輸入定價 | 不適用或未說明(截至 2026年7月) |
| 輸出定價 | 未單獨說明文字輸出價格;按音訊時長計費(截至 2026年7月) |
| 計費單位 | 音訊分鐘(截至 2026年7月) |
| 輸入模態 | 音訊(截至 2026年7月) |
| 輸出模態 | 文字(截至 2026年7月) |
| 支援檔案類型 | mp3、mp4、mpeg、mpga、m4a、wav、webm(截至 2026年7月) |
| 檔案上傳限制 | OpenAI 轉錄 API 單檔案 25 MB(截至 2026年7月) |
| API 存取 | OpenAI 音訊 API 及 Gate.AI 語音轉文字 API(截至 2026年7月) |
| 翻譯方向 | 支援語言語音轉英文(截至 2026年7月) |
| 單字級時間戳 | 透過 whisper-1 的 timestamp_granularities 支援(截至 2026年7月) |
| 知識截止時間 | 不適用於傳統 LLM 概念;OpenAI 未說明(截至 2026年7月) |
| 速率限制 | 依帳號及使用等級而定;未在此說明統一固定速率(截至 2026年7月) |
| 微調支援 | 託管 whisper-1 API 未確認支援(截至 2026年7月) |
| 原生即時支援 | whisper-1 未說明;OpenAI 單獨文件有即時轉錄模型與 API(截至 2026年7月) |
| 批次 API 支援 | 文件未確認 whisper-1 支援批次處理(截至 2026年7月) |
| 說話人分離 | 未確認 whisper-1 原生支援(截至 2026年7月) |
| 工具或函式呼叫 | 不適用於此語音辨識模型(截至 2026年7月) |
| 通用 JSON 模式 | 不適用;提供轉錄專用回應格式(截至 2026年7月) |
| 開源可用性 | Whisper 程式碼與模型權重可與託管 API 分開取得(截至 2026年7月) |
| 授權與使用限制 | 託管 API 遵循 OpenAI 服務條款;開源倉庫有獨立授權協議(截至 2026年7月) |
OpenAI 模型文件將 Whisper 1 定價為每分鐘 0.006 美元,輸入為音訊,輸出為文字。該模型未公佈單獨的輸入 token、快取 token 或輸出 token 價格。
根據 Gate.AI 在 https://gate.ai/models 的資訊,openai/stt-whisper-1 未顯示傳統輸入/輸出 token 價格。Gate.AI API 文件指出,whisper-1 通常按音訊時長計費,與按 token 計費的轉錄模型有所區別。
Whisper 1 在生產環境中的主要應用價值是什麼?
多語言音訊轉錄
Whisper 1 能將錄音中的語音轉為對應語言的文字,適用於訪談、講座、用戶調查、內部會議、Podcast 及媒體檔案等場景。準確率受語言、口音、麥克風品質、背景噪音、說話人重疊及專業術語等因素影響。
語音轉英文翻譯
OpenAI 官方文件說明了兩種主要語音轉文字流程:一是原語言音訊轉錄,二是支援語言的語音直接翻譯為英文。這有助於多語言內容審查流程減少處理環節,但 Whisper 1 並不支援任意語音直接翻譯為所有目標語言。
單字與片段級時間戳
透過 timestamp_granularities 參數可回傳片段級、單字級或兩者兼有的時間戳。OpenAI 明確指出該參數適用於 whisper-1。時間戳資料有助於字幕對齊、轉錄導覽、媒體編輯、引用核查及可檢索播放介面。
主流音訊與媒體格式支援
Transcriptions API 支援 MP3、MP4、MPEG、MPGA、M4A、WAV、WebM 等主流格式,降低了媒體處理流程中的格式轉換需求,但開發者仍需對大檔案進行壓縮或分段。
提示詞引導轉錄
API 可接受上下文提示資訊,協助指定預期術語、姓名、縮寫或寫作風格。提示詞有助於提升一致性,但無法保證對生僻姓名或專業詞彙的準確辨識。
Whisper 1 支援哪些輸入輸出模態?
| 模態 | 是否支援 | 說明 |
|---|---|---|
| 音訊輸入 | 是 | 支援主流音訊及媒體檔案格式 |
| 文字輸入 | 有限 | 可選指令及轉錄參數;不支援通用文字生成 |
| 圖像輸入 | 否 | Whisper 1 不處理圖像 |
| 影片理解 | 否 | 可處理 MP4 檔案的音訊內容,但不分析影片畫面 |
| 文字輸出 | 是 | 輸出轉錄文字或英文翻譯文字 |
| 音訊輸出 | 否 | Whisper 1 不產生語音 |
| 片段時間戳 | 是 | 支援帶時間戳的回應格式 |
| 單字時間戳 | 是 | whisper-1 支援 timestamp_granularities |
| 原生說話人標籤 | 未確認 | 可能需單獨說話人分離處理 |
| 原生即時對話 | 未確認 | 即時串流場景建議用專門即時轉錄模型 |
OpenAI 目前將 Transcriptions API 單次上傳限制為 25 MB,支援 mp3、mp4、mpeg、mpga、m4a、wav、webm。超出限制的檔案需壓縮或分段上傳。OpenAI 建議避免在句中切分,因為片段邊界可能遺失有用上下文。
Whisper 1 有哪些局限?
Whisper 1 是專用語音辨識模型,無法獨立對轉錄文字進行摘要、回答錄音相關問題、主題分類、圖像生成、語音合成或通用推理。這些任務需借助其他模型或應用層實現。
OpenAI 25 MB 上傳限制會增加長時間訪談、講座、會議、Podcast 及影片檔案的前處理工作。分段處理還可能導致上下文遺失、標點不一致、文字重複或句子斷裂等問題。
其翻譯流程僅輸出英文文字。如需將語音直接翻譯為非英文目標語言,通常需另行設定翻譯流程。
Whisper 1 不保證說話人歸屬準確。若對說話人標籤有要求,應採用經過驗證的說話人分離功能或獨立分段系統,並在代表性錄音上進行測試。
當存在說話人重疊、麥克風距離遠、背景音樂或噪音大、頻繁切換語言、生僻姓名、專業術語或低資源語言時,轉錄品質可能下降。上下文提示可輔助詞彙辨識,但不能作為準確性的保證。
此外,這也是通用 AI 的局限,並非 Whisper 1 獨有:生成的轉錄文字可能存在合理但錯誤的詞語、遺漏或標點問題。法律、醫療、金融、調查、無障礙及安全關鍵場景的轉錄內容,需由具備資格的人員對照原始錄音複核。
Whisper 1 最適合哪些應用場景?
| 應用場景 | 適用原因 | 重要限制 |
|---|---|---|
| 訪談轉錄 | 將錄音語音轉為可編輯、可檢索文字 | 姓名、引用及說話人變化需人工複核 |
| 會議紀錄 | 產生文字紀錄,便於檢索和後續摘要 | 原生說話人分離未確認支援 |
| 講座及網路研討會轉錄 | 支援長時語音內容,前提是檔案準備得當 | 大型錄音需壓縮或分段 |
| 字幕製作 | 輸出帶時間戳文字,便於對齊和編輯 | 時序與措辭需人工校驗 |
| Podcast 及媒體索引 | 使語音內容可檢索、便於歸檔 | 音樂及說話人重疊會影響準確率 |
| 多語言研究 | 支援原語言轉錄 | 準確率受語言和錄音品質影響 |
| 語音轉英文翻譯 | 將非英文音訊轉為英文文字 | 僅支援英文為目標語言 |
| 檔案數位化 | 將錄音資料轉為可檢索文字 | 原音訊品質差會影響可靠性 |
| 內容審查輔助 | 產生文字便於下游系統審查 | 轉錄可能遺失音訊含義和上下文 |
| 無障礙流程 | 提供草稿轉錄或字幕來源 | 發佈前需人工校正 |
「最佳用途」需結合具體場景判斷。Whisper 1 適用於需穩定、基於檔案的轉錄 API、英文翻譯或單字級時間戳的場合。建議在目標語言、口音、聲學環境和詞彙與實際需求一致的錄音上進行評估。
Whisper 1 與 GPT-4o Transcribe 及 GPT-4o Mini Transcribe 有何比較?
| 比較維度 | Whisper 1 | GPT-4o Transcribe | GPT-4o Mini Transcribe | 適用場景 |
|---|---|---|---|---|
| 主要用途 | 通用多語言語音辨識 | OpenAI 新一代轉錄模型 | OpenAI 新一代小型轉錄模型 | 三者均適用於語音轉文字工作流程 |
| 音訊輸入 | 支援 | 支援 | 支援 | 適用於錄音轉錄場景 |
| 文字輸出 | 支援 | 支援 | 支援 | 均輸出文字轉錄結果 |
| OpenAI 定價 | $0.006/分鐘音訊 | 部署前請查閱最新 OpenAI 定價 | 部署前請查閱最新 OpenAI 定價 | 建議按即時定價比較整體成本 |
| 英文翻譯 | Whisper 1 明確支援 | 請確認目前端點支援情況 | 請確認目前端點支援情況 | Whisper 1 適用於既有語音轉英文流程 |
| 單字級時間戳 | Whisper 1 明確支援 | 請確認目前功能支援情況 | 請確認目前功能支援情況 | Whisper 1 適合已基於時間戳輸出的應用 |
| API 成熟度 | 託管模型,整合歷史悠久 | 新一代模型 | 新一代高效模型 | 現有系統可優先考慮相容性,新增應用建議比較測試 |
| 原生說話人分離 | 未確認 | 請查閱最新模型文件 | 請查閱最新模型文件 | 需說話人標籤的流程需驗證功能 |
| 即時應用 | 未說明原生即時支援 | 請查閱最新即時支援情況 | 請查閱最新即時支援情況 | 即時場景應選用專門即時轉錄模型 |
沒有哪款轉錄模型適用於所有場景。Whisper 1 適合依賴其模型 ID、翻譯行為或時間戳格式的既有整合。新應用建議在代表性音訊上測試 Whisper 1 及新一代轉錄模型,並比較準確率、延遲、回應特性及整體成本。
如何透過 Gate.AI 存取 Whisper 1?
根據 Gate.AI 模型卡(https://gate.ai/models),Gate.AI 的模型 ID 為:
openai/stt-whisper-1
Gate.AI 提供相容 OpenAI 的 API 基礎 URL:
https://api.gate.ai/openai/v1
其語音轉文字介面說明包括:POST /audio/transcriptions,Bearer-token 認證,multipart/form-data 請求體,同步文字輸出,使用資訊及按時長計費。
Python 範例
Python import os
from pathlib import Path
import OpenAI from openai
audio_path = Path(“audio.mp3”)
if audio_path.is_file():
raise FileNotFoundError(f”Audio file not found: {audio_path}”)
client = OpenAI(
api_key=os.environ[“GATEAI_API_KEY”],
base_url=”https://api.gate.ai/openai/v1“,
)
with audio_path.open(“rb”) as audio_file:
transcription = client.audio.transcriptions.create(
model=”openai/stt-whisper-1”,
file=audio_file,
)
print(transcription.text )
curl 範例
``` Bash curl —request POST \
—url “https://api.gate.ai/openai/v1/audio/transcriptions“ \
—header “Authorization: Bearer ${GATEAI_API_KEY}” \
—form “file=@audio.mp3” \
—form “model=openai/stt-whisper-1” ```
上述範例將 API 密鑰保存在環境變數 GATEAI_API_KEY 中,避免直接寫入原始碼。應用部署前還應校驗檔案類型、檔案大小、錯誤回應、重試機制及帳號限額等。
Gate.AI 將語音轉文字介面描述為同步介面。因此,對於長時或高併發任務,建議設計合理的請求逾時、排隊、檔案校驗及重試策略。
開發者亦可直接透過 OpenAI 的 /v1/audio/transcriptions 和 /v1/audio/translations API,使用 OpenAI 模型 ID whisper-1 存取該模型。
常見問題解答
Whisper 1 的上下文視窗是多少?
OpenAI 未以傳統 token 上下文視窗定義 Whisper 1,因其為音訊轉錄模型而非聊天型 LLM。更相關的 API 限制是 OpenAI 轉錄 API 的 25 MB 檔案上傳上限。
Whisper 1 的定價是多少?
OpenAI 將 Whisper 1 定價為每分鐘音訊 0.006 美元(截至 2026年7月)。未公佈單獨的輸入 token、快取 token 或輸出 token 價格。Gate.AI 記錄 whisper-1 按時長計費;部署前應查閱帳號目前定價。
開發者如何存取 Whisper 1?
開發者可直接透過 OpenAI 音訊 API,使用模型 ID whisper-1 存取。根據 Gate.AI 模型卡,也可透過 Gate.AI 相容 OpenAI 的 /audio/transcriptions 端點,以 openai/stt-whisper-1 呼叫。
Whisper 1 適用於哪些場景?
Whisper 1 適用於錄音訪談、會議、講座、字幕、Podcast、多語言轉錄、可檢索音訊檔案及語音轉英文翻譯。準確率受語言、口音、錄音品質、說話人重疊、背景噪音及專業詞彙影響,重要轉錄內容需人工複核。


