传统语音助手“你一句、我一句”的对话模式,正在被微软改写。
8月2日,科技媒体TestingCatalog报道称,微软正在测试其首款原生实时语音模型 MAI Realtime。该模型已邀请部分合作伙伴在MAI Playground平台进行测试,但何时上线Microsoft Foundry、何时扩展至Copilot语音功能,目前尚无明确时间表。
一、全双工:打破一问一答的“对讲机时代”
MAI Realtime的核心突破在于双向、全双工交互方式。传统语音助手遵循严格的“用户说完、模型再答”轮次交替模式,而MAI Realtime可以同步聆听和回应,用户无需等待AI说完就能开口插话。
技术实现上,系统依靠端点检测技术识别说话的开始、停顿和结束,当用户中途插话时,模型能即时调整输出。这意味着对话体验正在无限逼近真人交流——不是“对讲机”式的一按一松,而是自然流畅的同步对话。
这是微软MAI语音模型家族从单向走向双向的关键一步。此前发布的MAI-Voice-2(语音合成)和MAI-Transcribe-1.5(语音识别)均只能完成单向任务。MAI Realtime的出现,标志着微软首次将“听”与“说”整合进同一个原生实时模型中。
二、16种语言,自动识别、中途切换
语言覆盖上,MAI Realtime支持中文、英语、日语、韩语、法语、德语、阿拉伯语等16种语言。完整列表为:英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、中文、荷兰语、印地语、印度尼西亚语、阿拉伯语、俄语、土耳其语、越南语、泰语。
用户可主动指定对话语言,也可启用自动检测功能,模型能在对话过程中自动识别并无缝切换语种。这意味着一个跨国会议场景中,参与者可以使用各自习惯的语言与AI对话,无需手动切换设置。
三、两种自然语音,定位仍是对话系统
语音风格方面,测试版本提供 Victoria 和 Grant 两种声音。据称比Copilot目前的语音模式更加自然。
不过,微软给MAI Realtime的定位非常克制——“仍是对话系统”。模型不支持唱歌或生成非语音音效。调试面板可显示实时延迟、模型思考内容和处理步骤。
四、战略意义:技术自主与成本节约
MAI Realtime的曝光,首先是一次技术自主权的宣告。微软此前在语音交互领域高度依赖OpenAI的技术——Copilot的语音模式、Azure的实时语音API,底层多为GPT-4o系列模型。拥有自研的全双工语音模型,意味着微软在关键技术环节上不再受制于外部供应商。
更深层的价值在于成本。据IT-Boltwise报道,MAI Realtime属于微软在Build 2026大会上展示的更大规模模型家族的一部分。自研替代第三方授权,将为微软省下巨额授权费用。在AI算力和模型调用成本持续攀升的背景下,这种“降本”本身就是竞争力。
从2025年8月首次预览MAI-Voice-1,到2026年4月推出MAI-Voice-2,再到如今MAI Realtime的测试曝光——微软正在用不到一年的时间,构建起覆盖语音识别、语音合成、实时对话的完整自研语音技术栈。当全双工从“实验室能力”变成“产品级交付”,AI语音交互的“对讲机时代”,或许真的正在成为过去式。



