GPT-4o 转写与分角色记录:完整规格、定价、API 接入与应用场景(2026)
什么是 GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize 是 OpenAI 推出的自动语音识别模型,具备内置说话人分离功能。该模型的正式发布时间尚未公布,拥有 16,000 个 token 的上下文窗口,2026年7月的 token 定价为每百万音频输入 token 2.50 美元、每百万输出 token 10 美元。
该模型能够将录音语音转化为文本,并将转录片段与不同说话人关联。说话人分离能够回答“谁在什么时候说话”,让转录文本区分会议、访谈、播客、研究会话及客服通话中的参与者。
OpenAI 将该 API 模型标识为 gpt-4o-transcribe-diarize。其模型页面描述该模型为识别说话人的转录模型,并指出可通过 Transcription API 获取。该模型专为音频处理设计,不适用于通用聊天、推理、图像生成或文本转语音等任务。
目前官方模型页面未明确公布具体上线时间。为避免将推测日期误作官方事实,本文截至2026年7月,记录该模型发布时间为 OpenAI 正式产品文档未确认。
GPT-4o Transcribe Diarize 的主要参数与定价
以下参数主要基于 OpenAI 官方模型页面、语音转文本文档及转录 API 参考,所有内容均为2026年7月的官方状态。
| 参数 | 官方数值 |
|---|---|
| 服务商 | OpenAI(截至2026年7月) |
| 模型系列 | GPT-4o Transcribe(截至2026年7月) |
| 模型类型 | 自动语音识别模型,具备说话人分离功能(截至2026年7月) |
| 发布时间 | 官方渠道未确认(截至2026年7月) |
| 上下文窗口 | 16,000 个 token(截至2026年7月) |
| 最大输出 | 2,000 个 token(截至2026年7月) |
| 输入定价 | 每百万音频输入 token 2.50 美元(截至2026年7月) |
| 缓存输入定价 | 官方文档未说明(截至2026年7月) |
| 输出定价 | 每百万输出 token 10.00 美元(截至2026年7月) |
| 定价单位 | 输入与输出均按每百万音频 token 计费(截至2026年7月) |
| 支持输入模态 | 文本相关请求字段及音频输入(截至2026年7月) |
| 支持输出模态 | 文本输出,可选说话人片段元数据(截至2026年7月) |
| 支持响应格式 | json、text、diarized_json(截至2026年7月) |
| 说话人标注输出 | 需使用 diarized_json(截至2026年7月) |
| 服务商 API 接入 | OpenAI Audio Transcriptions API(截至2026年7月) |
| 服务商模型 ID | gpt-4o-transcribe-diarize(截至2026年7月) |
| Gate.AI 模型 ID | openai/gpt-4o-transcribe-diarize,Gate.AI 模型卡片所述(截至2026年7月) |
| Gate.AI 定价 | Gate.AI 模型卡片显示暂不可用(截至2026年7月) |
| 可用性 | OpenAI API 与 Gate.AI 模型目录均有列出(截至2026年7月) |
| 知识截止日期 | 2024年6月1日(截至2026年7月) |
| 微调支持 | 官方模型页面未列为支持(截至2026年7月) |
| 批量 API 支持 | 官方渠道未确认(截至2026年7月) |
| 工具/函数调用 | 不适用于已记录的转录工作流(截至2026年7月) |
| 结构化输出 | diarized_json 提供结构化说话人片段;未见通用 JSON Schema 强制(截至2026年7月) |
| 提示词支持 | 转录请求 schema 不支持该模型(截至2026年7月) |
| Token 概率日志 | 转录请求 schema 不支持该模型(截至2026年7月) |
| 速率限制 | 取决于 OpenAI 账户使用等级,具体需在账户后台查阅(截至2026年7月) |
| 许可/使用限制 | 受 OpenAI API 条款及相关使用政策约束(截至2026年7月) |
OpenAI 官方模型页面列出 16,000 token 上下文窗口、2,000 token 最大输出、音频输入、文本输出,以及每百万音频 token 输入 2.50 美元、输出 10 美元。
该定价按 token 计费,并非保证每分钟费用。实际转录请求成本会因录音时长、语速、token 化及生成输出而变化。
GPT-4o Transcribe Diarize 在生产环境中的主要优势
生成带说话人标注的转录文本
该模型可将转录片段归属不同说话人,无需额外的转录与分离服务,适用于会议、访谈、播客、研究会话及客服通话。
当说话人声音相近、语音重叠或互相打断时,建议人工复核说话人标签。
返回结构化说话人数据
模型支持 diarized_json 响应格式,适用于需要说话人标注的应用,而非单一转录文本。
结构化输出可支持可检索存档、说话人摘要、通话复核面板、字幕流程及会话分析。说话人标签仅代表模型分离结果,并非法律身份认证。
支持已知说话人参考
可选的说话人姓名与参考片段有助于将常见参与者与如主持人、采访者、客服或客户等标签关联。
这些参考可提升使用体验,但无法保证准确分配,尤其在发言短、音质差、背景噪音、语音重叠或声音相似时。
支持长录音分段处理
对于超过 30 秒的音频,API 要求采用分段策略。官方自动选项可将长录音分割处理。
分段简化长文本转录,但片段边界可能影响连贯性、时间戳及说话人归属。
支持下游自动化流程
结构化转录文本可用于检索、摘要、质量复核、合规支持及分析系统。例如,应用可将客服与客户发言分离后生成摘要。
任何下游流程都可能继承转录与分离错误。涉及就业、医疗、法律、信贷、保险、合规或公共安全的高风险决策需人工复核。
GPT-4o Transcribe Diarize 支持哪些模态?
| 模态或输出类型 | 是否支持 | 说明 |
|---|---|---|
| 音频输入 | 是 | 转录的主要输入模态 |
| 文本请求字段 | 是 | 用于参数及已知说话人标签(如支持) |
| 图像输入 | 否 | 未列为支持 |
| 视频帧理解 | 否 | 仅转录音频,不分析视频帧 |
| 文本输出 | 是 | 返回转录文本 |
| JSON 输出 | 是 | 标准 JSON 响应格式支持 |
| 分离 JSON 输出 | 是 | 获取说话人标注必须使用 |
| 纯文本输出 | 是 | 支持无结构化说话人元数据 |
| 说话人标签 | 是 | 分离输出中可用 |
| 片段时间标注 | 是 | 分离响应含说话人片段与时间数据 |
| 音频输出 | 否 | 不生成语音 |
| SRT 输出 | 否 | 未列为支持响应格式 |
| VTT 输出 | 否 | 未列为支持响应格式 |
| 单词级时间戳粒度 | 未确认 | 不可假定支持其他转录模型的相关功能 |
OpenAI API 参考文档指出 GPT-4o Transcribe Diarize 支持 json、text、diarized_json,其中 diarized_json 用于说话人标注。
GPT-4o Transcribe Diarize 的局限性
GPT-4o Transcribe Diarize 是专用转录模型,并非通用会话模型、推理模型、图像模型、翻译复核流程或文本转语音服务的替代品。
说话人标签可能错误
当说话人重叠、互相打断、低声、远距离、麦克风质量差或声音相似时,分离效果会下降。标签如 speaker_1 仅代表模型分配的片段,并不能独立证明身份。
仍可能存在转录错误
模型可能误听姓名、数字、专业术语、口音、低音量或被背景噪音遮蔽的词汇。标点及句子边界也可能需人工编辑。
这是自动语音识别的通用限制,并非 GPT-4o Transcribe Diarize 独有。
部分转录控制不可用
OpenAI 转录请求文档指出,GPT-4o Transcribe Diarize 不支持提示词引导及 token 概率日志。
当应用需通过转录提示词提供术语表或检查 token 级置信信息时,GPT-4o Transcribe 或 GPT-4o Mini Transcribe 更适用,具体以当前 API 文档为准。
长录音需分段处理
超过 30 秒的输入需在转录请求中采用分段策略。分段增加实现复杂度,并可能影响说话人连续性。
高风险转录需人工复核
自动转录文本不应作为最终证据,需核查原始录音。法律、医疗、金融、就业、合规及安全相关转录需专业人员复核。
隐私与同意由开发者负责
录音可能包含个人、机密、生物识别或受监管信息。开发者需评估本地法规下的同意、通知、存储、访问控制、跨境处理及删除要求。
文档存在访问范围不明
OpenAI 模型页面称仅可通过 Transcription API 获取,但实时 API 参考页也将其列为分离会话选项。
由于官方页面描述不同,生产团队应在上线前核实当前实时行为是否支持分离架构。
GPT-4o Transcribe Diarize 最适合哪些场景?
该模型适用于需语音识别与说话人分离的流程。“最适用”取决于具体场景,并不意味着它是所有 ASR 模型中最强。
| 应用场景 | 适用原因 | 主要限制 |
|---|---|---|
| 商务会议 | 区分参与者片段,便于会议纪要与摘要 | 重叠语音与远距离麦克风会影响准确性 |
| 访谈 | 区分采访者与受访者发言 | 姓名、引用及敏感内容需人工复核 |
| 播客 | 生成结构化说话人转录,便于编辑与检索 | 交谈与音乐会影响片段分离 |
| 客服通话 | 区分客服与客户语音,便于质量复核 | 自动合规结论需人工审核 |
| 质性研究 | 生成可检索的参与者转录文本 | 需处理同意、匿名化与存储规则 |
| 会话分析 | 支持说话人级主题或情感处理 | 分析结果受转录与分离错误影响 |
| 字幕制作 | 提供带时间戳片段,支持字幕流程 | SRT 与 VTT 格式未直接列为支持输出 |
| 内部知识归档 | 转化录音为结构化可检索文本 | 机密录音需权限控制与治理 |
若录音仅有一位说话人,内置分离功能价值有限。无分离转录模型可能更简单或更经济,具体取决于当前定价与流程需求。
GPT-4o Transcribe Diarize 与 GPT-4o Transcribe、GPT-4o Mini Transcribe 比较
| 比较维度 | GPT-4o Transcribe Diarize | GPT-4o Transcribe | GPT-4o Mini Transcribe | 适用场景 |
|---|---|---|---|---|
| 主要用途 | 语音转文本并分离说话人 | 通用语音转文本 | 低价语音转文本 | 根据说话人标签与成本需求选择 |
| 内置说话人标签 | 支持(diarized_json) | 未列为内置输出 | 未列为内置输出 | Diarize 适合多说话人录音 |
| 上下文窗口 | 16,000 token | 16,000 token | 16,000 token | 无明显差异 |
| 最大输出 | 2,000 token | 2,000 token | 2,000 token | 输出上限相同 |
| 输入价格 | 每百万音频 token 2.50 美元 | 每百万音频 token 2.50 美元 | 每百万音频 token 1.25 美元 | Mini 适合成本敏感场景 |
| 输出价格 | 每百万 token 10 美元 | 每百万 token 10 美元 | 每百万 token 5 美元 | Mini 输出价格更低 |
| 提示词引导 | 不支持转录 schema | 支持转录流程 | 支持转录流程 | 非分离模型适合术语表引导转录 |
| 概率日志 | 不支持 | 支持 | 支持 | 需置信度分析时相关 |
| 分离 JSON | 支持 | 未列为支持 | 未列为支持 | Diarize 适合结构化说话人输出 |
| 典型场景 | 会议、访谈、通话、多说话人归档 | 高质量通用转录 | 高量或成本敏感转录 | 需用代表性音频测试选型 |
OpenAI 官方页面显示 GPT-4o Mini Transcribe 输入价格每百万音频 token 1.25 美元,输出价格每百万 token 5 美元,而 GPT-4o Transcribe Diarize 分别为 2.50 美元与 10 美元。三者均为 16,000 token 上下文窗口、2,000 token 最大输出。
没有绝对优选。GPT-4o Transcribe Diarize 适合多说话人录音;GPT-4o Transcribe 适合需提示词引导转录;GPT-4o Mini Transcribe 适合优先考虑低价的应用。
如何通过 Gate.AI 接入 GPT-4o Transcribe Diarize?
Gate.AI 模型卡片将 GPT-4o Transcribe Diarize 列为模型 ID:
openai/gpt-4o-transcribe-diarize
Gate.AI 文档说明其通用 API 网关兼容 OpenAI,并指定 OpenAI 兼容基址 https://api.gate.ai/openai/v1,开发者需采用 provider/model-name 格式的模型 ID。
但当前 Gate.AI 文档未明确说明 GPT-4o Transcribe Diarize 的音频转录端点、multipart 请求 schema、响应字段或模型定价。为避免将通用聊天示例误作转录请求,本文不提供该模型的 Gate.AI 可执行代码。
实施前建议查阅 Gate.AI 模型卡片,确认:
- 当前模型可用性
- 支持的转录端点
- 请求与上传要求
- 分离响应支持
- token 或音频定价
- 账户访问限制
OpenAI API 接入
OpenAI 官方文档描述该模型通过 Audio Transcriptions API 使用:
- 端点:
POST https://api.openai.com/v1/audio/transcriptions - 认证: Bearer 认证,需 OpenAI API key
- 模型 ID:
gpt-4o-transcribe-diarize - 请求格式:
multipart/form-data - 说话人标注响应:
diarized_json
Python 示例
import osfrom openai import OpenAIclient = OpenAI(api_key=os.environ["OPENAI_API_KEY"])with open("meeting.wav", "rb") as audio_file:transcription = client.audio.transcriptions.create(model="gpt-4o-transcribe-diarize",file=audio_file,response_format="diarized_json",chunking_strategy="auto",)for segment in transcription.segments:print(f"{segment.speaker}: {segment.text} "f"({segment.start:.2f}s–{segment.end:.2f}s)")
curl 示例
curl https://api.openai.com/v1/audio/transcriptions \-H "Authorization: Bearer $OPENAI_API_KEY" \-F "file=@meeting.wav" \-F "model=gpt-4o-transcribe-diarize" \-F "response_format=diarized_json" \-F "chunking_strategy=auto"
如需说话人标注,必须使用 diarized_json 格式。对于超过 30 秒的输入,OpenAI 要求采用分段策略。
生产应用需验证文件类型、录音时长、错误响应、重试机制、隐私控制及速率限制,确保处理敏感或大批量录音安全可靠。
常见问题解答
GPT-4o Transcribe Diarize 的上下文窗口是多少?
OpenAI 官方列出 GPT-4o Transcribe Diarize 的上下文窗口为 16,000 token,最大输出为 2,000 token(截至2026年7月)。
GPT-4o Transcribe Diarize 的费用是多少?
OpenAI 官方定价为每百万音频输入 token 2.50 美元、每百万输出 token 10 美元(截至2026年7月)。Gate.AI 定价在参考模型卡片中显示暂不可用。
如何通过 API 获取说话人标签?
将音频发送至 OpenAI Audio Transcriptions API,模型 ID 设为 gpt-4o-transcribe-diarize,response_format 设为 diarized_json。该格式为获取说话人标注所必需。
何时选择 GPT-4o Transcribe Diarize 而非 GPT-4o Mini Transcribe?
当录音需内置说话人分离时,GPT-4o Transcribe Diarize 更适用;若仅需低价转录且无需说话人标签,则 GPT-4o Mini Transcribe 更合适。建议根据代表性音频测试、延迟、准确度及当前价格综合选择。


