AB
AiBoss
News

腾讯 Gander 提出「小脑+大脑」架构:边对话边在后台干活

腾讯混元语音团队与多所高校研究者提出 Gander,一个可边实时对话边在后台处理复杂任务的模型。它把工作拆成负责对话的「小脑」和负责推理的「大脑」,据报在打断时机上表现较好,但任务准确率略逊。

核心事实

据 the-decoder.com 报道,腾讯混元语音团队与多所高校的研究者提出了一款名为 Gander 的 AI 模型,目标是让模型在后台处理复杂任务的同时保持实时对话。据其技术报告,Gander 可同时接收语音、图像和文本,用户可随时打断,模型也能在未被提示的情况下追问或汇报进度。

架构上,研究团队借用人体解剖学命名,把工作拆成两部分:负责实时对话的「小脑」,以及负责推理与复杂任务、在后台运行的「大脑」。报道称「大脑」可替换为 Codex、Claude Code 等智能体系统,而无需重新训练对话模型。

背景与影响

研究者认为,现有语音助手多为轮流发言,而真实对话中人们会互相打断、边听边说,因此需要持续处理视频、语音与文本。Gander 将对话切分为一秒一段,由「小脑」判断何时听、说或停止,并以约最近两分钟对话作为记忆。

报道提到,在 Full-Duplex-Bench v3 上,Gander 在全部 100 个场景中都在合适时机开口,打断用户的比例为 8%,而对比系统分别为 13.5% 和接近 48%。不过其任务准确率略低于最弱的对比系统,视频与音频理解也偏弱。研究团队表示,计划在完成开源发布流程后公开模型权重与训练数据,代码的 GitHub 仓库已存在。

限制与来源

需要说明的是,上述性能数字均来自研究团队自述的技术报告,尚未获官方独立确认,也不代表实际产品表现。报道称该工作仍处早期,如何扩展规模尚无定论,也缺乏评估此类系统的标准方法。关于权重与数据的具体开放时间、许可条款、可用地区与语言支持,均以官方后续发布信息为准。

本文内容整理自 the-decoder.com 的相关报道,原文链接:the-decoder.com