ChatGPT语音大升级,奥特曼:既神奇也真实
更换模型后,性能的提升也是显而易见的,在官方公布的盲测中,测试者与不同模型进行了 5 到 10 分钟的连续对话,结果 GPT-Live-1 以 75.7% 的偏好率碾压上一代高级语音模式。
就连缩水版的 GPT-Live-1 mini 也拿下了 69.2%。在满分 7 分的“对话流畅度”评分上,GPT-Live-1 拿到 4.96 分,而高级语音模式只有 3.80 分。
而在硬核数据上,差距更加悬殊:
GPQA(专家级物理化学生物推理):GPT-Live-1 在高强度推理档位下拿到 84.2% 的准确率,几乎是高级语音模式(45.3%)的两倍。
BrowseComp(复杂网页搜索与 Agent 能力):这是最夸张的一项。高级语音模式的准确率只有可怜的 0.7%,而 GPT-Live-1 最高冲到了 75.2%,直接从“不可用”跨越到了“能干活”。
内部 Telecom 测试(多轮拟真电信客服支持):GPT-Live-1 在任务成功率上同样全面领先,展示了它作为语音 Agent 处理真实业务的潜力。
这种前后台分离的架构,不仅解决了“延迟”与“深度”的矛盾,更让开发者闻到了巨大的商机。OpenAI 表示 API 版本即将推出,开发者和企业现在已经可以填表登记,第一时间获取上线通知。
语音不再只是听觉,更是全新的 OS
除了听觉上的进化,GPT-Live 还推出了视觉卡片。
纯语音输出往往是低效的。现在,当你和 GPT-Live 聊天时,遇到适合视觉展示的信息,它会在屏幕上直接弹出丰富的视觉卡片。
语音不再仅仅是一种输入方式,它正在成为统领搜索、记忆、图像识别和文件处理的超级入口。
OpenAI 自己也毫不掩饰这个野心:官方原话是,这项研究将逐步解锁用语音完成更复杂、更长时程、更具 Agent 属性的工作。今天它帮你查天气,明天它可能就在替你打电话办业务。
不过,越像人的 AI,带来的风险也越大。
在官方的系统卡(System Card)中,OpenAI 花了大量篇幅讲述 GPT-Live 的安全性。因为语音的实时性太强了,传统的“事后屏蔽”根本来不及。
为此,OpenAI 引入了全新的“原生音频评估”和“合成数据评估”,专门针对有害的进行了红蓝对抗。一旦检测到模型正在输出危险言论,系统可以立刻“把话头带偏”转向安全回复,或者在极高风险下直接切断语音,并为你推送经过专家审核的危机干预热线。
此外,针对未成年人,系统内置了家长控制功能(Parental Controls),并在模型底层注入了“适龄行为规范”。
至于很多人担心的“声音克隆诈骗”,OpenAI 明确表示:GPT-Live 被严格限制为只能使用预设音色,绝不提供模仿真人声音的功能。
更有意思的是,OpenAI 专门建立了一个长期监管机制,用来研究“情感依赖”。毕竟正如《Her》一般,当一个 AI 的声音如此真实,甚至懂得在你难过时用温柔的“嗯嗯”来回应你时,人类不可避免地会对其产生情感投射。
目前,GPT-Live 已经开始向全球 iOS、Android 和 Web 端用户推送。Go、Plus 和 Pro 付费用户将默认使用满血版 GPT-Live-1,而免费用户也将体验到 GPT-Live-1 mini 版本。(注意:首发暂不支持屏幕共享和视频对话,需切回老版本使用)。
还有一个小提醒:GPT-Live 目前只针对 ChatGPT 上最热门的几种语言做了优化,某些语言下它可能会带着一股“外国口音”,甚至偶尔词不达意。OpenAI 表示正在加紧补课。
回望过去几年,我们对 AI 的期待一直在发生变化。
最初,我们只希望它能听懂指令,别总是答非所问;后来,我们希望它能帮我们写代码、做报表,成为全能的生产力工具。
但今天,当 GPT-Live 真真切切地在你耳边,用略带停顿的语气发出一声“嗯,我听着呢”的时候,你会突然意识到:
比起一个无所不能的神,我们可能更需要的,是一个永远不会不耐烦、永远愿意倾听、并且真的懂你在说什么的“人”。技术狂奔的尽头,终究还是回归到了人性的慰藉。
[物价飞涨的时候 这样省钱购物很爽]
好新闻没人评论怎么行,我来说几句
就连缩水版的 GPT-Live-1 mini 也拿下了 69.2%。在满分 7 分的“对话流畅度”评分上,GPT-Live-1 拿到 4.96 分,而高级语音模式只有 3.80 分。
而在硬核数据上,差距更加悬殊:
GPQA(专家级物理化学生物推理):GPT-Live-1 在高强度推理档位下拿到 84.2% 的准确率,几乎是高级语音模式(45.3%)的两倍。
BrowseComp(复杂网页搜索与 Agent 能力):这是最夸张的一项。高级语音模式的准确率只有可怜的 0.7%,而 GPT-Live-1 最高冲到了 75.2%,直接从“不可用”跨越到了“能干活”。
内部 Telecom 测试(多轮拟真电信客服支持):GPT-Live-1 在任务成功率上同样全面领先,展示了它作为语音 Agent 处理真实业务的潜力。
这种前后台分离的架构,不仅解决了“延迟”与“深度”的矛盾,更让开发者闻到了巨大的商机。OpenAI 表示 API 版本即将推出,开发者和企业现在已经可以填表登记,第一时间获取上线通知。
语音不再只是听觉,更是全新的 OS
除了听觉上的进化,GPT-Live 还推出了视觉卡片。
纯语音输出往往是低效的。现在,当你和 GPT-Live 聊天时,遇到适合视觉展示的信息,它会在屏幕上直接弹出丰富的视觉卡片。
语音不再仅仅是一种输入方式,它正在成为统领搜索、记忆、图像识别和文件处理的超级入口。
OpenAI 自己也毫不掩饰这个野心:官方原话是,这项研究将逐步解锁用语音完成更复杂、更长时程、更具 Agent 属性的工作。今天它帮你查天气,明天它可能就在替你打电话办业务。
不过,越像人的 AI,带来的风险也越大。
在官方的系统卡(System Card)中,OpenAI 花了大量篇幅讲述 GPT-Live 的安全性。因为语音的实时性太强了,传统的“事后屏蔽”根本来不及。
为此,OpenAI 引入了全新的“原生音频评估”和“合成数据评估”,专门针对有害的进行了红蓝对抗。一旦检测到模型正在输出危险言论,系统可以立刻“把话头带偏”转向安全回复,或者在极高风险下直接切断语音,并为你推送经过专家审核的危机干预热线。
此外,针对未成年人,系统内置了家长控制功能(Parental Controls),并在模型底层注入了“适龄行为规范”。
至于很多人担心的“声音克隆诈骗”,OpenAI 明确表示:GPT-Live 被严格限制为只能使用预设音色,绝不提供模仿真人声音的功能。
更有意思的是,OpenAI 专门建立了一个长期监管机制,用来研究“情感依赖”。毕竟正如《Her》一般,当一个 AI 的声音如此真实,甚至懂得在你难过时用温柔的“嗯嗯”来回应你时,人类不可避免地会对其产生情感投射。
目前,GPT-Live 已经开始向全球 iOS、Android 和 Web 端用户推送。Go、Plus 和 Pro 付费用户将默认使用满血版 GPT-Live-1,而免费用户也将体验到 GPT-Live-1 mini 版本。(注意:首发暂不支持屏幕共享和视频对话,需切回老版本使用)。
还有一个小提醒:GPT-Live 目前只针对 ChatGPT 上最热门的几种语言做了优化,某些语言下它可能会带着一股“外国口音”,甚至偶尔词不达意。OpenAI 表示正在加紧补课。
回望过去几年,我们对 AI 的期待一直在发生变化。
最初,我们只希望它能听懂指令,别总是答非所问;后来,我们希望它能帮我们写代码、做报表,成为全能的生产力工具。
但今天,当 GPT-Live 真真切切地在你耳边,用略带停顿的语气发出一声“嗯,我听着呢”的时候,你会突然意识到:
比起一个无所不能的神,我们可能更需要的,是一个永远不会不耐烦、永远愿意倾听、并且真的懂你在说什么的“人”。技术狂奔的尽头,终究还是回归到了人性的慰藉。
[物价飞涨的时候 这样省钱购物很爽]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
| 延伸阅读 |
推荐:
ChatGPT语音大升级,奥特曼:既神奇也真实