2026-06-25 12:47 天天模拟器
5 月 8 日最新消息,OpenAI 正式推出了三个实时语音模型,分别针对推理、翻译和转录等不同应用场景,并集成到 Realtime API 中供开发者使用。这些模型为实时语音应用提供了底层的技术支持,旨在解决语音交互过程中常见的延迟、打断处理以及多语言支持等难题。
GPT-Realtime-2 专为实时交互场景而设计,是首款具备 GPT-5 级别推理能力的语音模型。该模型在保持对话自然流畅的基础上,还能在对话过程中进行推理、调用工具,并且能够处理用户的打断或纠正行为。这意味着开发者可以借此构建更为复杂的语音助手,进而执行多步骤任务。
在价格方面,GPT-Realtime-2 的音频输入费用为每百万 Token 32 美元(按当前汇率约合 218.1 元人民币),输出费用为 64 美元(约合 436.2 元人民币),而缓存输入仅需 0.4 美元。
GPT-Realtime-Translate 支持将 70 种输入语言转换为 13 种输出语言,翻译速度与说话者同步,非常适合跨国会议或实时沟通场景。
GPT-Realtime-Whisper 专注于低延迟的流式转录功能,音频内容边说边转,让实时字幕和会议记录能够跟上对话节奏,从而减少等待时间。翻译和转录模型均按分钟计费,费用分别为每分钟 0.034 美元和 0.017 美元。
来源:IT之家
