OpenAI发布新一代语音模型,让AI智能体语音表达更自然

OpenAI发布新一代语音模型,让AI智能体语音表达更自然

3月21日消息,OpenAI昨日(3月20日)发布博文,宣布推出语音转文本(speech-to-text)和文本转语音(text-to-speech)模型,提升语音处理能力,支持开发者构建更精准、可定制的语音交互系统,进一步推动人工智能语音技术的商业化应用。

在语音转文本模型上,OpenAI主要推出了gpt-4o-transcribe和gpt-4o-mini-transcribe两个模型,官方表示在单词错误率(WER)、语言识别和准确性上超越现有Whisper系列。

这两个模型支持超100种语言,主要通过强化学习和多样化高质量音频数据集训练,能捕捉细微语音特征,减少误识别,尤其在嘈杂环境、口音及不同语速下表现更稳定。

在文本转语音上,OpenAI最新推出了gpt-4o-mini-tts模型,开发者通过“模拟耐心客服”或“生动故事叙述”等指令,控制语音风格,可以应用于客服(合成更具同理心的语音,提升用户体验)和创意内容(为有声书或游戏角色设计个性化声音)方面。

援引博文介绍,附上三款模型费用如下:

gpt-4o-transcribe:音频输入每100 万tokens费用6美元、文本输入每100万tokens费用2.5美元,输出每100万tokens费用10美元,每分钟成本0.6美分。

gpt-4o-mini-transcribe:音频输入每100万tokens费用3美元、文本输入每100万tokens费用1.25美元,输出每100万tokens费用5美元,每分钟成本0.3美分。

gpt-4o-mini-tts:每100万tokens输入费用为0.60美元,每100万tokens输出费用为12美元,每分钟成本1.5美分。

特别声明:[OpenAI发布新一代语音模型,让AI智能体语音表达更自然] 该文观点仅代表作者本人,今日霍州系信息发布平台,霍州网仅提供信息存储空间服务。

猜你喜欢

回收站恢复:Windows 和 Mac 用户完整指南(回收站恢复的文件去哪里找)

如果您不小心删除了重要文件,并且它们仍在回收站中,那么在 Windows 上恢复它们非常简单。步骤2.打开奇客数据恢复,选择您删除或丢失文件的驱动器以开始数据恢复。 虽然回收站或废纸篓是恢复意外删除文件的…

回收站恢复:Windows 和 Mac 用户完整指南(回收站恢复的文件去哪里找)

GPT-5发布在即:OpenAI被控违反服务条款,Claude API访问权限被撤销(gpt,gop)

8 月 2 日消息,《连线》昨日(8 月 1 日)发布博文,报道称在 OpenAI 发布 GPT-5 模型之际,Anthropic公司称 OpenAI 违反了服务条款,撤销了 OpenAI 对其模…

GPT-5发布在即:OpenAI被控违反服务条款,Claude API访问权限被撤销(gpt,gop)

乌克兰总统与英国首相通电话 讨论防御合作及制裁议题(乌克兰总统英语水平)

乌克兰总统泽连斯基与英国首相斯塔默通电话,讨论了加强乌克兰防御、扩大对俄制裁以及推动和平谈判等议题。通话中,双方特别强调了扩大无人机生产的紧迫性,特别是在拦截型无人机领域,并表示将共同寻找解决资金需求的具体方案

乌克兰总统与英国首相通电话 讨论防御合作及制裁议题(乌克兰总统英语水平)

怎么确定有没有脑水肿(怎么确定有没有糖尿病)

脑水肿的确诊需要结合影像学检查和临床症状。主要的识别方式包括头颅CT或MRI检查、颅内压监测、神经系统查体、脑脊液检测以及病史与症状评估。 头颅CT能迅速显示脑组织密度变化,典型脑水肿表现为低密度影伴脑沟回变浅

怎么确定有没有脑水肿(怎么确定有没有糖尿病)

从口碑看家用净水器什么牌子好,真实用户来揭秘(净家用水器哪个牌子好)

冰尊净水器的核心优势在于其专利滤芯技术和智能监测系统,能够实时显示水质状况和滤芯寿命,确保饮水安全。此外,冰尊的产品设计高端大气,适用于不同家庭需求,无论是厨下式还是台上式,都能提供稳定高效的净水体验。冰尊…

从口碑看家用净水器什么牌子好,真实用户来揭秘(净家用水器哪个牌子好)