月24日,OpenAI宣布升级ChatGPT桌面应用,正式引入由GPT-Live全双工语音模型驱动的ChatGPT Voice模式。用户可以在聊天(Chat)、办公(Work)和编程(Codex)三个板块中,通过语音发起、检查或调整任务,实现多线程工作协同。
告别“对讲机”模式,AI终于能边听边干了
GPT-Live最早于7月8日发布,核心突破在于实现了全双工架构——可以同时聆听与说话。上一代高级语音模式采用轮次机制,模型必须等用户停止说话后才能回应。而GPT-Live可以在对话过程中用“嗯嗯”“对”这类回应表示自己正在听,也能在用户思考时保持安静。
更关键的是架构上的分工:GPT-Live将语音交互与深度推理分离为两个独立环节。前台由面向实时交互优化的语音模型负责接话、停顿和保持自然对话;后台由独立的推理模型(如GPT-5.5)负责搜索、计算、调用工具和执行复杂任务。用户提出需要搜索、推理或调用更强能力的问题时,GPT-Live会在后台直接把任务交给更强模型处理。
这种“你说话、它办事、彼此不耽误”的交互方式,让AI从一个打字对话工具,变成了一个能听懂指令并推进工作的数字助手。
三个板块,一个语音入口
在新版ChatGPT桌面应用中,语音能力嵌入了三个核心工作场景:
Chat板块:日常对话与信息查询,用语音提问、获取答案
Work板块:办公任务协同,检查日历冲突、梳理收件箱、准备会议记录
Codex板块:编程开发,用语音指挥多个编码智能体并行工作
以规划一次商务旅行为例:用户可以要求ChatGPT检查日历以查找冲突、梳理收件箱以查看航班变更,并准备会议记录——所有这些都在“用户冲咖啡或做其他事情时”完成。开发者还可以从单个语音指令出发,同时让系统调查一个认证漏洞、审查一个待处理的API迁移请求、生成缺失的单元测试。
OpenAI在声明中表示:“我们正朝着AI愿景前行,未来用户只需口述需求,ChatGPT就能根据你的思路,快速推进多项任务。”
Mac独占优势:Appshots让AI“看见”你的屏幕
ChatGPT Voice同时支持macOS和Windows 11。但Mac用户多了一项能力——Appshots功能。启用后,ChatGPT可以引用当前活跃窗口的内容作为上下文。这意味着用户可以在某个应用界面中直接开口提问,AI能理解屏幕上正在显示的内容。配合本地文件、代码库结构和活跃插件,语音交互的实用边界被大幅拓宽。
从“不可用”到“能干活”
GPT-Live的发布带来了一次质的跨越。在BrowseComp智能体网络搜索测试中,上一代高级语音模式仅得0.7%,而GPT-Live-1(high)达到75.2%;在专家级科学推理能力测试GPQA上,从45.3%跃升至84.2%。差距不止一个量级。
OpenAI还重新录制了ChatGPT中的九种声音,并为回答提供三种推理级别:即时模式用于快速响应,中等和高强度模式用于需要更多思考的场景。
语音功能面向Plus、Pro、Business、Edu和Enterprise等付费用户开放,已在Windows和macOS上全球推送。用户可以通过快捷键(Mac上Option+Space,Windows上Alt+Space)随时唤醒。
告别键盘,对话式工作成为现实
GPT-Live接入桌面端ChatGPT和Codex,标志着软件开发正在进入“免提”时代。开发者不再需要停下来打字描述需求,可以直接在编程过程中通过对话引导AI完成任务。OpenAI官方展示的视频中,多名工程师在同一房间内对同一个ChatGPT桌面应用会话发出不同指令,模型同时响应多人。
当ChatGPT的语音能力从“能听懂”升级到“能边听边干活”,人与AI的协作方式正在被重新定义。键盘还在,但你已经可以把手放下来了。


