AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

语音与音频

覆盖语音识别、合成、实时对话与音乐生成,关注延迟、自然度和可用性。

全部 Story
57
近 7 天
1
当前结果
57
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

文章用 Gemini 3.8 文本转语音创建自定义声音

筛选线索语音与音频AI 公司模型家族2 个独立信源

此前语音合成多依赖录制素材或较长样本调校,此次把声音设计变为提示词驱动,并允许逐句控制表演、节奏、语气词与方言切换,同时以短样本快速复刻音色。合规侧首次在同一发布中组合同意验证、SynthID 与 C2PA,降低开发者与配音者之间的版权与授权风险。

多源确认
YouTube · Google DeepMind/9月23日 19:11
63
02

产品AI 群组通话

筛选线索语音与音频AI 主题发布动态1 个独立信源

Product Hunt 上发布了一款名为 AI Group Call 的产品,用户输入目标后,即可加入一场与六个 AI 思维的实时语音通话。该产品将多智能体协作引入语音场景,帮助用户通过群组对话形式解决问题或达成目标。

Product Hunt/8月9日 16:50
40
03

模型OpenAI 将 GPT-Live-1 语音模型开放至 API

筛选线索语音与音频AI 公司模型家族1 个独立信源

此前该语音能力仅服务于 1-800-ChatGPT 这一自有场景,第三方开发者无法调用。开放至 API 意味着外部产品可以直接复用同一套语音交互能力,而不必自行搭建语音链路,语音智能体的接入门槛由此下降。

AIHOT · X / 公众号精选/9月12日 23:16
64
04

论文Qwen-Audio-3.1-Realtime:面向可靠智能体语音交互

筛选线索Agent 智能体语音与音频模型家族推理能力1 个独立信源

相比 Qwen-Audio-3.0-Realtime,3.1 不仅提升任务成功率,更把对背景人声的误响应率从 73.0% 压到 13.0%,说明实时语音助手从“能听懂”转向“知道何时该说、何时该做”,半双工与全双工场景的行为边界被明确量化。

arXiv AI/9月21日 14:20
76
05

文章GPT-Live-1 已上线 API

筛选线索Agent 智能体语音与音频模型家族发布动态1 个独立信源

此前 ChatGPT 的自然对话体验主要局限在 OpenAI 自有产品内,开发者难以直接调用。此次进入 API 意味着第三方应用可以接入同类语音交互能力,且允许自行选择模型与 harness,说明 OpenAI 把实时语音对话从产品功能转为可编程接口,竞争点转向语音 agent 的集成能力。

YouTube · OpenAI/9月11日 17:06
51
06

产品阿里巴巴推出 AI 音乐生成工具 Happy Shrimp

筛选线索语音与音频AI 主题发布动态1 个独立信源

Happy Shrimp 是阿里巴巴推出的一款 AI 音乐生成产品,旨在将创意转化为歌曲。它通过 AI 技术帮助用户快速生成音乐作品,降低音乐创作门槛。产品在 2026 年 8 月 31 日上架 Product Hunt,面向需要便捷音乐创作的用户。

Product Hunt/8月31日 04:01
40
07

模型Qwen 发布 Qwen-Audio-3.1 五个音频模型并大幅降价

筛选线索语音与音频模型家族模型雷达1 个独立信源

相较此前版本,这次变化集中在两点:一是模型数量从单点能力扩展到覆盖理解、生成、交互与创作的五个模型,并新增 TTS-Next 与 ASR-Next 两个方向;二是价格大幅下调,其中 ASR 最高降幅达 95%,改变了音频能力的调用成本结构。

AIHOT · X / 公众号精选/9月23日 09:11
61
08

论文SceneJail:利用视频场景上下文越狱多模态大模型

筛选线索多模态大模型与推理模型家族推理能力1 个独立信源

此前的视频越狱多把视频视为有害查询的视觉载体,只改变呈现方式,忽略了周边场景本身也是攻击面。该工作把场景上下文变成可搜索、可优化的变量,并在含专有模型的八种 Video-MLLM 上给出高成功率,说明安全对齐在场景语义层面存在系统性缺口。

arXiv AI/9月30日 03:47
74
09

新闻阿里发布 Qwen Audio 3.1,新增多款模型并将 AI 音频价格最高下调 95%

筛选线索语音与音频AI 主题模型家族1 个独立信源

此次变化集中在两点:一是模型能力细化,ASR 从单纯转写扩展到多语言方言、说话人区分、情绪与环境声识别;二是价格最高下降 95%,直接改变音频 AI 的调用成本结构,可能影响开发者和产品团队的模型选型。

The Decoder AI News/9月23日 12:31
46
10

产品Bolcho AI:语音 AI 代理构建工具

筛选线索语音与音频AI 主题发布动态1 个独立信源

Bolcho AI 是一款在 Product Hunt 上发布的产品,旨在帮助开发者构建语音 AI 代理,且特别针对印度市场进行了优化,使其能够真正说印度语。这解决了语音 AI 在印度语境下本地化不足的问题。

Product Hunt/8月1日 22:44
40
11

模型阶跃星辰发布 StepAudio 3 系列语音大模型,多款称在 Artificial Analysis 榜单全球第一

筛选线索大模型与推理语音与音频模型雷达1 个独立信源

此前阶跃星辰的语音能力多以单点模型形式出现,此次以五款模型组成系列并一次性上线开放平台,覆盖实时交互、识别、合成、生成与音乐等方向,说明其语音能力从零散供给转向成体系的产品化输出;榜单排名说法若成立,也意味着竞争位置发生变化。

AIHOT · X / 公众号精选/9月15日 07:29
58
12

论文ClawSentry:保护自主 LLM 代理的渐进式多层级安全监控器

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

现有防护通常局限于单一生命周期边界或单次调用,而 ClawSentry 将风险视为渐进式过程,覆盖代理控制循环的四个关键点,并统一应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改代理内部结构,提供了跨框架的安全监督方案。

arXiv AI/8月21日 13:47
74
13

新闻Gemini 3.5 实时翻译打造自然流畅的语音翻译体验

筛选线索语音与音频AI 主题模型家族1 个独立信源

相比此前各平台分散的翻译方案,Gemini 3.5 将高质量实时语音翻译整合进日常工具(AI Studio、Translate、Meet),显著降低跨语言协作门槛,可能改变用户对语音翻译延迟和自然度的预期。

Google DeepMind Blog/6月9日 15:16
44
14

模型Suno v6 发布,支持图片、视频与语音备忘录生成音乐

筛选线索多模态语音与音频模型雷达1 个独立信源

此前音乐生成工具的输入通常以文本提示为主,v6 将输入扩展到图片、视频和语音备忘录,并加入对已创建歌曲的精确修改能力,意味着从一次性生成转向可迭代编辑,同时多模态输入降低了非专业用户表达音乐意图的门槛。

AIHOT · X / 公众号精选/9月10日 00:34
56
15

论文该不该信任:语音场景下的检索增强事实核查

筛选线索语音与音频AI 公司推理能力1 个独立信源

此前事实核查评估多集中于书面文本,而新闻片段、播客、访谈、政治演讲和社交媒体视频中的语音信息正在增多。VeriSpeak 首次把核查能力从文本迁移到语音作为可测量问题,并指出文本表现不能直接代表语音表现。

arXiv AI/9月24日 17:50
74
16

新闻Google 新 Flash TTS 模型支持用文字描述设计 AI 音色

筛选线索语音与音频AI 主题模型家族1 个独立信源

此前文本转语音多为选择既有音色并朗读文本,这次把音色创建本身变成可由文字描述驱动的环节,并允许在脚本层面加入舞台指示与双人对话,语音生成的可控维度从“读什么”扩展到“怎么演”和“用谁的声音”。

The Decoder AI News/9月23日 17:39
43
17

模型腾讯混元发布 Hy ASR 3.0 preview:上下文感知的语音识别

筛选线索开源模型与生态大模型与推理开发者平台模型雷达1 个独立信源

腾讯混元推出 Hy ASR 3.0 preview,将语音识别与语义理解结合,支持上下文纠错和热词注入,相比传统 ASR 在准确性和场景适应性上有实质提升,尤其在粤语和高噪环境下表现突出,已落地腾讯云和元宝 App。

AIHOT · X / 公众号精选/8月4日 08:12
53
18

论文全双工语音模型工具调用的前后端架构

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前全双工语音模型侧重低延迟自然对话,工具调用能力通常受限;该方案在不破坏双工轮流发言与打断处理的前提下引入后端委派,使语音交互同时具备较强 agentic 工具调用能力,并显示后端可替换、可扩容。

arXiv AI/9月16日 19:01
73
19

新闻OpenAI 发布 GPT-Live-1 API,支持应用同时说话与聆听

筛选线索语音与音频AI 公司模型家族1 个独立信源

相较上一代,交互性测试成绩从 45.4% 提升到 80.1%,说明语音交互从轮流说话向同时听说推进。对开发者而言,这类能力此前难以直接获得,现在可通过 API 调用,但每分钟 0.05 美元的价格会影响其适用场景。

The Decoder AI News/9月10日 17:47
42
20

模型小红书开源连续自回归语音合成模型 dots.tts,定位可扩展 TTS 基座

筛选线索开源模型与生态语音与音频模型雷达1 个独立信源

此前 TTS 模型多采用离散 token 或非自回归架构,dots.tts 以连续端到端自回归方式实现更高准确度,且开源 20 亿参数模型,为行业提供可扩展的 TTS 基座,有望降低语音合成应用的门槛。

AIHOT · X / 公众号精选/8月13日 09:59
50
21

论文面向 MyBuddy 人形机器人的基于 LLM 的对话式 AI 知识助手

筛选线索具身智能大模型与推理AI 主题大语言模型1 个独立信源

传统机器人对话多依赖规则式对话系统、预设回复和有限知识库,难以应对复杂提问和长对话。该工作把知识来源从封闭知识库改为可扩展的互联网引擎检索,并借助 LLM 维持上下文,说明机器人知识助手的实现路径正在从规则编排转向 LLM 加检索的架构。

arXiv AI/9月21日 15:11
73
22

新闻Google 发布 Gemini 3.5 Transcribe,AI 驱动的语音转文字工具

筛选线索语音与音频AI 主题模型家族2 个独立信源

Gemini 3.5 Transcribe 的推出意味着 Google 将其先进的语音识别能力从 Gboard 扩展到 Chrome 等更广泛的产品线。对于依赖语音输入的产品,这可能带来更精准的转录体验,并可能影响未来语音交互类应用的技术选择。

多源确认
Ars Technica AI/8月26日 19:19
42
23

模型通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

筛选线索语音与音频模型雷达1 个独立信源

相比此前TTS模型,Qwen-Audio-3.0-TTS首次同时支持实时与高质量双版本,引入细粒度情感/动作标签(如耳语、生气)和自然语言风格控制,可一次生成3分钟长文本,并覆盖16种语言,综合能力获得第三方排行榜第一,显著降低了语音合成的使用门槛。

AIHOT · X / 公众号精选/7月23日 12:33
48
24

论文AI代理签名流程的硬件密钥库:零信任MCP强制架构

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

此前AI代理的私钥常以明文或环境变量形式存储,存在被窃取风险。该方案通过硬件隔离密钥,使任何软件进程都无法直接获取密钥,将攻击成功率从19.3%降至0%,为高价值自动化操作提供了新的安全基线。

arXiv AI/8月6日 15:04
72
25

新闻Google 发布 Gemini 3.8 Live,以远低于 GPT-Live-1 的价格展开竞争

筛选线索语音与音频AI 公司模型家族1 个独立信源

此前语音到语音模型的竞争多集中在自然度与延迟,而 Gemini 3.8 Live 同时给出榜单第一和每小时 1.38 美元的定价,把竞争维度拉到价格。Google 用低价切入,而 OpenAI 仍以 full duplex 的听感作为差异化,双方卖点出现分化。

The Decoder AI News/9月15日 18:23
41
26

模型通义实验室发布Qwen-Audio-3.0-TTS实时语音合成模型

筛选线索语音与音频模型家族模型雷达1 个独立信源

相比此前TTS模型,Flash版本实现了约300毫秒的首包延迟,大幅降低实时交互的等待时间;Plus版本在客观指标上达到行业领先水平,且支持多语言与方言,显著扩展了应用边界。

AIHOT · X / 公众号精选/7月20日 08:53
48
27

论文NeuronFuzz:基于安全神经元引导的模糊测试用于大模型安全评估

筛选线索多模态开源模型与生态大语言模型多模态1 个独立信源

现有自动化测试依赖生成响应获取反馈,成本高且在强对齐模型上反馈稀疏。NeuronFuzz 直接利用内部神经元激活,避免生成响应,显著提升测试效率,并突破了传统响应级方法的局限,为安全评估提供了新思路。

arXiv AI/8月26日 12:44
71
28

新闻Google 在 Gemini 应用中推出由 Lyria 3.5 驱动的 AI 音乐生成功能

筛选线索语音与音频AI 主题模型家族1 个独立信源

此前 Google 的 AI 音乐生成能力分散在独立研究项目或较不稳定的工具中,且与 Gemini 主应用集成度不足。此次将 Lyria 3.5 直接嵌入 Gemini 应用,并同步提供 API 及多个产品入口,表明 Google 正将音乐生成作为标准功能向主流用户和开发者开放,而非仅作为实验性技术展示。

The Decoder AI News/9月6日 09:56
41
29

论文减少六层:Whisper 编码器剪枝与无标签恢复

筛选线索大模型与推理语音与音频AI 公司模型推理1 个独立信源

此前对 Whisper 的压缩主要集中于 decoder,例如 whisper-large-v3-turbo 将 decoder 从 32 层减到 4 层,Distill-Whisper 减到 2 层;encoder 压缩因常需定制推理实现而未被广泛采用。该工作给出无需定制推理的 encoder 剪枝路径,并通过无标签数据蒸馏缩小精度损失。

arXiv AI/9月23日 12:05
70
30

新闻苹果申请禁令制止OpenAI泄密;ChatGPT Atlas浏览器停服;微软研发实时语音模型

筛选线索语音与音频AI 主题AI 公司1 个独立信源

苹果与OpenAI的冲突升级,可能影响AI行业合作模式;ChatGPT浏览器停服标志产品调整,用户数据迁移紧迫;微软实时语音模型预示语音交互技术新方向。

公众号 · 极客公园/8月5日 00:14
39
当前展示各类别评分靠前的 30 条,共 57 条