摘要:腾讯推出多模态助手 Gander,可处理语音、图像与文本,并用后台任务机制借"小脑"维持对话连贯,用可切换"大脑"做文件检索、编程或复杂工作,基准中仅 8% 情况打断用户。
腾讯今天端出的 Gander,是个挺有意思的"助手范式"尝试。它同时吃语音、图像和文本,但真正的卖点不是多模态输入本身,而是一套"小脑+大脑"的分工:一个常驻的"小脑"负责维持对话的连贯和上下文,让对话不丢线;需要干具体活时,再调用一个可切换的"大脑"——可以是文件检索模块、编程模块,也可以是处理复杂任务的模块。后台任务机制让它在你不盯着它的时候也能跑。官方基准里,它打断用户的比例只有 8%,但在任务准确率上仍落后于几个头部对手。

这个设计的巧思在于:它把"对话"和"执行"拆开了。很多助手的问题是,一旦去干活,对话就被打断、上下文就散了;Gander 用常驻小脑把"我是谁、我们在聊什么"兜住,让"大脑"去轮换处理不同任务。这其实非常贴近真实办公场景——你不会希望 AI 一帮你查资料就忘了上一句在说什么。腾讯把它做成能处理语音的多模态助手,也明显冲着"下一代入口"去:手机、车机、会议场景里,语音才是主交互。
我的判断:Gander 目前的关键短板是"任务准确率落后",这决定了它现在更像一个方向验证,而非能直接抢市场的成品。但"小脑维持对话 + 可换大脑执行"这个结构,值得所有做助手和 Agent 的团队认真看——它解决的是长会话里的状态保持难题,而这正是把 AI 从"单次问答"变成"长期协作者"的必经之路。对腾讯,Gander 的价值也不只在 C 端,更在它能否接进企业微信、腾讯文档、会议这套生态,把"对话连贯"变成"办公连贯"。方向对,剩下的就是准确率这场硬仗。







