- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月16日 19:01
- 状态
- 单一信源
发生了什么
arXiv 论文提出一种前后端分离架构,用于全双工语音模型中的工具调用:双工语音转文本前端学习发出委派 token,并把流式 ASR 转写转发给文本后端 LLM 执行工具调用,结果经轻量 prefill-and-repeat 机制回注前端,再由流式 TTS 合成给用户。单轮评测工具调用召回率 92-97%,拒绝无关调用准确率 81.2%;接入 Qwen3-235B-A22B 等较大后端后,在 Full-Duplex-Bench-V3 上与开源及闭源模型相当,并在 EVA-Bench 上显著优于 GPT-realtime-mini 和 Qwen3-Omni-30B-A3B-Instruct。
为什么重要
此前全双工语音模型侧重低延迟自然对话,工具调用能力通常受限;该方案在不破坏双工轮流发言与打断处理的前提下引入后端委派,使语音交互同时具备较强 agentic 工具调用能力,并显示后端可替换、可扩容。
底层逻辑
前端只做流式语音识别与委派 token 触发,把工具调用决策交给文本 LLM 后端,避免在前端模型中大改结构;后端结果通过 prefill-and-repeat 回注并流式 TTS 播报,因此对话延迟与打断行为基本保持,同时后端能力可独立升级。
产品与商业机会
产品可在保留语音助手低延迟体验的同时接入更复杂的工具链;研发上前后端解耦,前端模型改动小,后端可替换不同规模 LLM 以平衡成本与效果;需关注无关调用拒绝率与端到端时延。
- 在现有语音助手链路中增加委派 token 与文本后端 LLM 接口,先覆盖查询类工具调用场景。
- 将后端 LLM 设计为可插拔模块,按任务复杂度切换小模型与大模型以控制推理成本。
- 针对误触发问题,补充无关工具调用的拒绝策略与评测集,降低错误调用带来的体验与安全风险。
仍待确认
- 该架构在多轮、多工具并发场景下的召回率与延迟表现尚未在证据中给出。
- prefill-and-repeat 机制对端到端延迟的具体影响未量化。
- 证据仅来自单一论文,缺少独立复现与其他团队的对照结果。
- 大规模生产部署下的成本与稳定性尚未被验证。