Whisper 1:完整规格、定价、API 接入与应用场景(2026)
什么是 Whisper 1?
Whisper 1 是 OpenAI 推出的通用自动语音识别(ASR)模型,源自 2022年9月21日发布的 Whisper 系统,具备多语言转录、语言识别、语音转英文翻译等功能。截至 2026年7月,Whisper 1 的托管 API 定价为每分钟音频 0.006 美元。
OpenAI 将 Whisper 描述为基于 Transformer 架构的语音识别系统,使用从互联网收集的 68 万小时多语言、多任务有监督音频进行训练。其训练设计支持多语言语音识别、语言识别、时间戳预测以及支持语言到英文的翻译。
托管于 OpenAI 的 API 模型使用模型 ID whisper-1 。该模型接受音频输入,输出文本结果;它不是对话型大语言模型、推理模型、图像模型或文本转语音系统。OpenAI 将其归类为通用语音识别模型,输入为音频,输出为文本。
Whisper 1 常用于访谈转录、会议记录、讲座笔记、字幕制作、媒体索引、可检索音频档案及将录音语音翻译为英文的各类工作流。
Whisper 1 的主要规格和定价如何?
| 规格 | 经验证的数值 |
|---|---|
| 服务商 | OpenAI(截至 2026年7月) |
| 模型家族 | Whisper(截至 2026年7月) |
| 模型类型 | 通用自动语音识别模型(截至 2026年7月) |
| 首次发布日期 | 2022年9月21日(截至 2026年7月) |
| 托管 API 模型 ID | whisper-1(截至 2026年7月) |
| Gate.AI 模型 ID | openai/stt-whisper-1,详见 Gate.AI 模型卡与 https://gate.ai/models(截至 2026年7月) |
| 上下文窗口 | 官方文档未以传统 token 上下文窗口形式说明(截至 2026年7月) |
| OpenAI 输入定价 | $0.006/分钟音频(截至 2026年7月) |
| 缓存输入定价 | 不适用或未说明(截至 2026年7月) |
| 输出定价 | 未单独说明文本输出价格;按音频时长计费(截至 2026年7月) |
| 计费单位 | 音频分钟(截至 2026年7月) |
| 输入模态 | 音频(截至 2026年7月) |
| 输出模态 | 文本(截至 2026年7月) |
| 支持文件类型 | mp3、mp4、mpeg、mpga、m4a、wav、webm(截至 2026年7月) |
| 文件上传限制 | OpenAI 转录 API 单文件 25 MB(截至 2026年7月) |
| API 访问 | OpenAI 音频 API 及 Gate.AI 语音转文本 API(截至 2026年7月) |
| 翻译方向 | 支持语言语音转英文(截至 2026年7月) |
| 单词级时间戳 | 通过 whisper-1 的 timestamp_granularities 支持(截至 2026年7月) |
| 知识截止时间 | 不适用于传统 LLM 概念;OpenAI 未说明(截至 2026年7月) |
| 速率限制 | 依账号及使用等级而定;未在此说明统一固定速率(截至 2026年7月) |
| 微调支持 | 托管 whisper-1 API 未确认支持(截至 2026年7月) |
| 原生实时支持 | whisper-1 未说明;OpenAI 单独文档有实时转录模型与 API(截至 2026年7月) |
| 批量 API 支持 | 文档未确认 whisper-1 支持批量处理(截至 2026年7月) |
| 说话人分离 | 未确认 whisper-1 原生支持(截至 2026年7月) |
| 工具或函数调用 | 不适用于此语音识别模型(截至 2026年7月) |
| 通用 JSON 模式 | 不适用;提供转录专用响应格式(截至 2026年7月) |
| 开源可用性 | Whisper 代码与模型权重可与托管 API 分开获取(截至 2026年7月) |
| 许可与使用限制 | 托管 API 遵循 OpenAI 服务条款;开源仓库有独立许可协议(截至 2026年7月) |
OpenAI 模型文档将 Whisper 1 定价为每分钟 0.006 美元,输入为音频,输出为文本。该模型未公布单独的输入 token、缓存 token 或输出 token 价格。
根据 Gate.AI 在 https://gate.ai/models 的信息,openai/stt-whisper-1 未显示传统输入/输出 token 价格。Gate.AI API 文档指出,whisper-1 通常按音频时长计费,与按 token 计费的转录模型有所区别。
Whisper 1 在生产环境中的主要应用价值是什么?
多语言音频转录
Whisper 1 能将录音中的语音转为对应语言的文本,适用于访谈、讲座、用户调研、内部会议、播客及媒体档案等场景。准确率受语言、口音、麦克风质量、背景噪音、说话人重叠及专业术语等因素影响。
语音转英文翻译
OpenAI 官方文档说明了两种主要语音转文本流程:一是原语言音频转录,二是支持语言的语音直接翻译为英文。这有助于多语言内容审核流程减少处理环节,但 Whisper 1 并不支持任意语音直接翻译为所有目标语言。
单词与片段级时间戳
通过 timestamp_granularities 参数可返回片段级、单词级或两者兼有的时间戳。OpenAI 明确指出该参数适用于 whisper-1 。时间戳数据有助于字幕对齐、转录导航、媒体编辑、引文核查及可检索播放界面。
主流音频与媒体格式支持
Transcriptions API 支持 MP3、MP4、MPEG、MPGA、M4A、WAV、WebM 等主流格式,降低了媒体处理流程中的格式转换需求,但开发者仍需对大文件进行压缩或分段。
提示词引导转录
API 可接受上下文提示信息,帮助指定预期术语、姓名、缩写或写作风格。提示词有助于提升一致性,但不能保证对生僻姓名或专业词汇的准确识别。
Whisper 1 支持哪些输入输出模态?
| 模态 | 是否支持 | 说明 |
|---|---|---|
| 音频输入 | 是 | 支持主流音频及媒体文件格式 |
| 文本输入 | 有限 | 可选指令及转录参数;不支持通用文本生成 |
| 图像输入 | 否 | Whisper 1 不处理图像 |
| 视频理解 | 否 | 可处理 MP4 文件的音频内容,但不分析视频画面 |
| 文本输出 | 是 | 输出转录文本或英文翻译文本 |
| 音频输出 | 否 | Whisper 1 不生成语音 |
| 片段时间戳 | 是 | 支持带时间戳的响应格式 |
| 单词时间戳 | 是 | whisper-1 支持 timestamp_granularities |
| 原生说话人标签 | 未确认 | 可能需单独说话人分离处理 |
| 原生实时对话 | 未确认 | 实时流场景建议用专门实时转录模型 |
OpenAI 当前将 Transcriptions API 单次上传限制为 25 MB,支持 mp3、mp4、mpeg、mpga、m4a、wav、webm。超出限制的文件需压缩或分段上传。OpenAI 建议避免在句中切分,因为片段边界可能丢失有用上下文。
Whisper 1 有哪些局限?
Whisper 1 是专用语音识别模型,无法独立对转录文本进行摘要、回答录音相关问题、主题分类、图像生成、语音合成或通用推理。这些任务需借助其他模型或应用层实现。
OpenAI 25 MB 上传限制会增加长时间访谈、讲座、会议、播客及视频文件的预处理工作。分段处理还可能导致上下文丢失、标点不一致、文本重复或句子断裂等问题。
其翻译流程仅输出英文文本。如需将语音直接翻译为非英文目标语言,通常需另行设置翻译流程。
Whisper 1 不保证说话人归属准确。若对说话人标签有要求,应采用经过验证的说话人分离功能或独立分段系统,并在代表性录音上进行测试。
当存在说话人重叠、麦克风距离远、背景音乐或噪音大、频繁切换语言、生僻姓名、专业术语或低资源语言时,转录质量可能下降。上下文提示可辅助词汇识别,但不能作为准确性的保证。
此外,这也是通用 AI 的局限,并非 Whisper 1 独有:生成的转录文本可能存在合理但错误的词语、遗漏或标点问题。法律、医疗、金融、调查、无障碍及安全关键场景的转录内容,需由具备资质的人员对照原始录音复核。
Whisper 1 最适合哪些应用场景?
| 应用场景 | 适用原因 | 重要限制 |
|---|---|---|
| 访谈转录 | 将录音语音转为可编辑、可检索文本 | 姓名、引述及说话人变化需人工复核 |
| 会议记录 | 生成文本记录,便于检索和后续摘要 | 原生说话人分离未确认支持 |
| 讲座及网络研讨会转录 | 支持长时语音内容,前提是文件准备得当 | 大型录音需压缩或分段 |
| 字幕制作 | 输出带时间戳文本,便于对齐和编辑 | 时序与措辞需人工校验 |
| 播客及媒体索引 | 使语音内容可检索、便于归档 | 音乐及说话人重叠会影响准确率 |
| 多语言研究 | 支持原语言转录 | 准确率受语言和录音质量影响 |
| 语音转英文翻译 | 将非英文音频转为英文文本 | 仅支持英文为目标语言 |
| 档案数字化 | 将录音资料转为可检索文本 | 源音频质量差会影响可靠性 |
| 内容审核辅助 | 生成文本便于下游系统审核 | 转录可能丢失音频含义和上下文 |
| 无障碍流程 | 提供草稿转录或字幕来源 | 发布前需人工校正 |
“最佳用途”需结合具体场景判断。Whisper 1 适用于需稳定、基于文件的转录 API、英文翻译或单词级时间戳的场合。建议在目标语言、口音、声学环境和词汇与实际需求一致的录音上进行评估。
Whisper 1 与 GPT-4o Transcribe 及 GPT-4o Mini Transcribe 有何对比?
| 对比维度 | Whisper 1 | GPT-4o Transcribe | GPT-4o Mini Transcribe | 适用场景 |
|---|---|---|---|---|
| 主要用途 | 通用多语言语音识别 | OpenAI 新一代转录模型 | OpenAI 新一代小型转录模型 | 三者均适用于语音转文本工作流 |
| 音频输入 | 支持 | 支持 | 支持 | 适用于录音转录场景 |
| 文本输出 | 支持 | 支持 | 支持 | 均输出文本转录结果 |
| OpenAI 定价 | $0.006/分钟音频 | 部署前请查阅最新 OpenAI 定价 | 部署前请查阅最新 OpenAI 定价 | 建议按实时定价比较总体成本 |
| 英文翻译 | Whisper 1 明确支持 | 请确认当前端点支持情况 | 请确认当前端点支持情况 | Whisper 1 适用于既有语音转英文流程 |
| 单词级时间戳 | Whisper 1 明确支持 | 请确认当前功能支持情况 | 请确认当前功能支持情况 | Whisper 1 适合已基于时间戳输出的应用 |
| API 成熟度 | 托管模型,集成历史悠久 | 新一代模型 | 新一代高效模型 | 现有系统可优先考虑兼容性,新增应用建议对比测试 |
| 原生说话人分离 | 未确认 | 请查阅最新模型文档 | 请查阅最新模型文档 | 需说话人标签的流程需验证功能 |
| 实时应用 | 未说明原生实时支持 | 请查阅最新实时支持情况 | 请查阅最新实时支持情况 | 实时场景应选用专门实时转录模型 |
没有哪款转录模型适用于所有场景。Whisper 1 适合依赖其模型 ID、翻译行为或时间戳格式的既有集成。新应用建议在代表性音频上测试 Whisper 1 及新一代转录模型,并对比准确率、延迟、响应特性及总体成本。
如何通过 Gate.AI 访问 Whisper 1?
根据 Gate.AI 模型卡(https://gate.ai/models),Gate.AI 的模型 ID 为:
openai/stt-whisper-1
Gate.AI 提供兼容 OpenAI 的 API 基础 URL:
https://api.gate.ai/openai/v1
其语音转文本接口说明包括:POST /audio/transcriptions,Bearer-token 认证,multipart/form-data 请求体,同步文本输出,使用信息及按时长计费。
Python 示例
Python import os
from pathlib import Path
import OpenAI from openai
audio_path = Path(“audio.mp3”)
if audio_path.is_file():
raise FileNotFoundError(f”Audio file not found: {audio_path}”)
client = OpenAI(
api_key=os.environ[“GATEAI_API_KEY”],
base_url=”https://api.gate.ai/openai/v1“,
)
with audio_path.open(“rb”) as audio_file:
transcription = client.audio.transcriptions.create(
model=”openai/stt-whisper-1”,
file=audio_file,
)
print(transcription.text )
curl 示例
``` Bash curl —request POST \
—url “https://api.gate.ai/openai/v1/audio/transcriptions“ \
—header “Authorization: Bearer ${GATEAI_API_KEY}” \
—form “file=@audio.mp3” \
—form “model=openai/stt-whisper-1” ```
上述示例将 API 密钥保存在环境变量 GATEAI_API_KEY 中,避免直接写入源码。应用部署前还应校验文件类型、文件大小、错误响应、重试机制及账号限额等。
Gate.AI 将语音转文本接口描述为同步接口。因此,对于长时或高并发任务,建议设计合理的请求超时、队列、文件校验及重试策略。
开发者也可直接通过 OpenAI 的 /v1/audio/transcriptions 和 /v1/audio/translations API,使用 OpenAI 模型 ID whisper-1 访问该模型。
常见问题解答
Whisper 1 的上下文窗口是多少?
OpenAI 未以传统 token 上下文窗口定义 Whisper 1,因为其为音频转录模型而非聊天型 LLM。更相关的 API 限制是 OpenAI 转录 API 的 25 MB 文件上传上限。
Whisper 1 的定价是多少?
OpenAI 将 Whisper 1 定价为每分钟音频 0.006 美元(截至 2026年7月)。未公布单独的输入 token、缓存 token 或输出 token 价格。Gate.AI 记录 whisper-1 按时长计费;部署前应查阅账号当前定价。
开发者如何访问 Whisper 1?
开发者可直接通过 OpenAI 音频 API,使用模型 ID whisper-1 访问。根据 Gate.AI 模型卡,也可通过 Gate.AI 兼容 OpenAI 的 /audio/transcriptions 端点,以 openai/stt-whisper-1 调用。
Whisper 1 适用于哪些场景?
Whisper 1 适合录音访谈、会议、讲座、字幕、播客、多语言转录、可检索音频档案及语音转英文翻译。准确率受语言、口音、录音质量、说话人重叠、背景噪音及专业词汇影响,重要转录内容需人工复核。


