OpenAI今天给ChatGPT桌面应用做了一次大升级——这个已经和Codex合体的客户端,正式引入了由GPT-Live模型驱动的ChatGPT Voice语音模式。新版里,用户可以在聊天(Chat)、办公(Work)和编程(Codex)三个板块中,直接用语音发起、检查或调整任务。把多线程工作协同这件事,从敲键盘挪到了动嘴皮。

不再是一问一答,而是边聊边干活

GPT-Live最早于7月8日发布,核心突破在于实现了全双工语音——可以同时聆听与说话。上一代高级语音模式采用轮次机制,模型必须等用户停止说话后才能回应。而GPT-Live处理的不再是一条条彼此独立的消息,而是在生成输出的同时持续处理输入。它可以在对话过程中用“嗯嗯”“yeah”这类回应表示自己正在听,也能在用户思考时保持安静。

更重要的是架构上的分工:GPT-Live将语音交互与深度推理分离为两个独立环节。前台由一个面向实时交互优化的语音模型负责接话、停顿和保持自然对话;后台由独立的推理模型负责搜索、计算、调用工具和执行复杂任务。用户提出需要搜索、推理或调用更强能力的问题时,GPT-Live会把任务交给后台模型处理,前台则继续与用户保持对话。

这种“你说话、它办事、彼此不耽误”的交互,正是GPT-Live想拉开差距的地方。

三个板块,一个语音入口

在新版ChatGPT桌面应用中,语音能力嵌入了三个核心工作场景:

Chat板块:日常对话与信息查询,用语音提问、获取答案

Work板块:办公任务协同,检查日历冲突、梳理收件箱、准备会议记录

Codex板块:编程开发,用语音指挥多个编码智能体并行工作

OpenAI在声明中表示:“我们正朝着AI愿景前行,未来用户只需口述需求,ChatGPT就能根据你的思路,快速推进多项任务。”

以规划一次商务旅行为例:用户可以要求ChatGPT检查日历冲突、梳理收件箱查看航班变更、准备会议记录——所有这些都在“冲咖啡或做其他事情时”完成。开发者还可以同时启动多个并发任务线程:从单个语音指令出发,让系统同时调查一个认证漏洞、审查一个待处理的API迁移请求、生成缺失的单元测试。

Mac独占优势:Appshots让AI“看见”你的屏幕

ChatGPT Voice同时支持macOS和Windows 11。但Mac用户多了一项能力——Appshots功能。启用后,ChatGPT可以引用当前活跃窗口的内容作为上下文。这意味着用户可以在某个应用界面中直接开口提问,AI能理解屏幕上正在显示的内容。配合Computer Use功能、本地文件和ChatGPT插件,语音交互的实用边界被大幅拓宽。

从“不可用”到“能干活”

GPT-Live的发布带来了一次质的跨越。在BrowseComp智能体网络搜索测试中,高级语音模式仅得0.7%,而GPT-Live-1(high)达到75.2%。在专家级科学推理能力测试GPQA上,高级语音模式得分45.3%,GPT-Live-1(high)达到84.2%。从“几乎不可用”到“能真正干活”,差距不止一个量级。

OpenAI还重新录制了ChatGPT中的九种声音,并为回答提供三种推理级别:即时模式用于快速响应,中等和高强度模式用于需要更多思考的场景。

语音功能面向Plus、Pro、Business、Edu和Enterprise等付费用户开放,已在Windows和macOS上全球推送。用户可以通过快捷键(Mac上Option+Space,Windows上Alt+Space)随时唤醒。iOS用户还可以通过Remote功能配对后,在Codex中使用语音控制。

告别键盘,对话式编程成为现实

GPT-Live接入桌面端ChatGPT和Codex,标志着软件开发正在进入“免提”时代。开发者不再需要停下来打字描述需求,可以直接在编程过程中通过对话引导AI完成任务。OpenAI官方展示的视频中,多名工程师在同一房间内对同一个ChatGPT桌面应用会话发出不同指令,模型同时响应多人。

当ChatGPT的语音能力从“能听懂”升级到“能边听边干活”,人与AI的协作方式正在被重新定义。键盘还在,但你已经可以把手放下来了。