- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年9月23日 09:11
- 状态
- 单一信源
发生了什么
Qwen 发布 Qwen-Audio-3.1 系列,包含 ASR、TTS、Realtime 三条产品线升级,并新增音频创作模型 TTS-Next 与音频理解模型 ASR-Next,共五个模型,覆盖理解、生成、交互与创作。同时全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off。Realtime 支持边说边听、随时打断,并在检测到低落情绪时放慢语速并作共情回应。
为什么重要
相较此前版本,这次变化集中在两点:一是模型数量从单点能力扩展到覆盖理解、生成、交互与创作的五个模型,并新增 TTS-Next 与 ASR-Next 两个方向;二是价格大幅下调,其中 ASR 最高降幅达 95%,改变了音频能力的调用成本结构。
底层逻辑
证据显示 Qwen 以统一系列方式打包 ASR、TTS、Realtime 与新增的 TTS-Next、ASR-Next,形成从音频理解到音频生成再到实时交互的能力组合。大幅降价可能是通过规模效应或推理优化压低单位调用成本,从而降低开发者接入音频能力的门槛,但证据未说明具体实现方式。
产品与商业机会
对产品与研发而言,音频理解、语音合成和实时语音交互的调用成本明显下降,原本因价格受限的语音功能更易进入常规产品设计。Realtime 的打断与情绪感知能力,为语音助手、客服和陪伴类场景提供更自然的交互基础,但需验证实际延迟与稳定性。
- 在现有客服或语音助手流程中接入降价后的 ASR 与 TTS,重新测算单次通话成本,评估是否扩大语音入口覆盖。
- 基于 Realtime 的打断与情绪识别能力,设计面向陪伴、心理疏导或教育场景的语音交互原型并做小范围验证。
- 利用新增的 TTS-Next 与 ASR-Next,探索音频内容创作与音频理解两类新功能,例如批量生成配音或结构化音频摘要。
仍待确认
- TTS-Next 与 ASR-Next 的具体能力边界、输入输出形式和可用性限制尚不明确。
- Realtime 的情绪检测与共情回应在不同语种、口音和噪声环境下的准确率未在证据中说明。
- 各模型的实际延迟、并发上限和价格调整的生效与持续期限未被确认。
- 五个模型之间的调用关系、是否可组合以及迁移成本在证据中未提及。