摘要:8月9日,OpenAI更新ChatGPT桌面应用,上线ChatGPT Voice语音功能。基于GPT-Live全双工语音模型,用户可通过语音下达多步骤复杂指令,控制AI智能体在电脑上执行任务,支持Work和Codex两大模块。Mac端支持Appshots屏幕内容读取。AI正在从“能聊”走向“能干”。
跟 ChatGPT 聊天不用再打字了。8 月 9 日,OpenAI 宣布更新 ChatGPT 桌面应用,正式加入 ChatGPT Voice 语音功能。用户可以直接对着电脑说话,让 AI 智能体在后台执行任务——打开网页、查资料、写代码、提交 PR,一句话就能启动一串操作。
从“能聊”到“能干”,中间隔了一个 GPT-Live
手机上的语音对话,核心是“聊得更自然”——能打断、能插话、反应更快。但桌面版 Voice 的定位完全不同:它要“干活”。
支撑这次升级的是 OpenAI 在本月早些时候推出的 GPT-Live 语音模型系列。这是 OpenAI 的第三代语音系统,核心变化是去掉了“轮次检测器”。之前的语音系统遵循“你一句、我一句”的轮次规则,模型得先判断用户有没有说完,再开始处理——猜早了会打断用户,猜晚了响应就变慢。GPT-Live 直接把这一步砍掉了,采用全双工架构,可以同时听和说。遇到需要深度推理或调用工具的任务,GPT-Live 会异步调用 GPT-5.5 等前沿模型处理,不影响对话的连续性。用户感受不到“等一下,我在想”——后台已经在跑了,前台对话照常继续。
一句话,启动一串操作
功能落地的关键是多步骤复杂指令。用户不需要把任务拆成一步步下达,一句话说清楚目标,ChatGPT 会自己拆解、执行、反馈。
OpenAI 给出的一个典型场景是规划商务旅行:用户口头告诉 ChatGPT 检查日历冲突、梳理收件箱里的航班变更、准备会议纪要——所有这些都可以在用户“冲咖啡或做其他事情”的同时完成。另一个演示案例中,一名开发者通过一句语音指令,让 ChatGPT 创建新的代码线程、提交 Pull Request,并定位一个 Bug 的根本原因。
Voice 同时支持 ChatGPT Work 和 Codex 两个模块。Work 对应办公场景,Codex 对应编程场景。用户可以在一个对话中启动多个工作流,AI 在后台执行任务的同时,用户可以继续用语音推进其他事情。
Mac 用户多一个优势:让 AI“看见”屏幕
Windows 和 macOS 都支持 ChatGPT Voice,但 Mac 用户多了一个能力:Appshots。启用后,ChatGPT 可以读取当前屏幕上显示的内容,包括图片的替代文本。这意味着用户可以在某个应用界面中直接开口提问,AI 能理解屏幕上正在显示的内容,不需要手动复制粘贴上下文。
快捷键也做得很顺手。用户可以设置热键(Hotkey)随时唤醒 ChatGPT Voice,在工作其他应用的同时与它对话。
背后是一场战略转向
OpenAI 在 7 月 9 日将 Codex 合并进 ChatGPT,形成了新的 ChatGPT Work 产品。合并时 Codex 每周有 500 万用户;Voice 上线后,Codex 用户数已突破 1000 万。
把语音能力和桌面操作能力整合进同一个应用,OpenAI 走了一条和 Anthropic 不同的路。几乎同一时间,Anthropic 也更新了 Claude 的语音模式,可以在 Gmail、Calendar、Slack、Notion 和 Canva 等应用中完成任务。但 OpenAI 选择把所有能力——对话、编程、语音、电脑控制——塞进同一个桌面应用里。
OpenAI 在官方声明中表示:“今天的发布是朝着这个未来迈出的一步:说出你需要什么,ChatGPT 就能以你想法的速度推进多个任务。”从打字到说话,从一问一答到多任务并行,这一步跨得不算大,但方向已经清晰了。



