TechCrunch AI64
Anthropic 于周四发布一份报告,称来自中国的 AI 公司持续对其实施蒸馏攻击,涉及 Alibaba、Moonshot AI 和 DeepSeek。报告指出,随着该领域竞争加剧,这类攻击在近几个月有所升级。目前信息来自 Anthropic 单方面指控,尚无论证细节与第三方核实。
为什么值得看此前模型蒸馏争议多停留在行业猜测层面,此次由头部模型厂商以报告形式点名具体公司,并声称攻击在近几个月升级,意味着模型能力外流问题正从技术争议转向公开指控与合规议题。
The Decoder AI News61
Deepseek 发布多模态模型 V4.1-Flash,参数规模 5520 亿,但每 token 仅激活 160 亿参数。相较上一代,KV cache 内存降至四分之一。在 DeepSWE 编程基准上,它以微弱优势超过 Opus 5 和 GPT-5.6 Sol。模型以 MIT 许可证发布,目标指向成本更低的 AI 智能体。
为什么值得看此前大模型部署中 KV cache 内存占用是限制长上下文与多智能体并发的主要成本项之一。V4.1-Flash 将内存需求压缩到上一代四分之一,同时在编程基准上不牺牲性能,意味着同等硬件下可承载更多并发智能体或更长上下文。
The Decoder AI News59
OpenAI 以开发者 API 形式发布 GPT-Live-1 全双工语音模型。该模型在交互性测试中得分 80.1%,其上一代为 45.4%。定价为每分钟 0.05 美元。信源未披露模型架构、支持语言、并发或延迟等技术细节。
为什么值得看相较上一代,交互性测试成绩从 45.4% 提升到 80.1%,说明语音交互从轮流说话向同时听说推进。对开发者而言,这类能力此前难以直接获得,现在可通过 API 调用,但每分钟 0.05 美元的价格会影响其适用场景。
The Decoder AI News54
OpenAI 的 GPT-6 Astra 在 ErdosBench 开放数学问题上取得最高成绩,但首席科学家 Jakub Pachocki 表示数学并非优先级。OpenAI 将资源更多投向递归自我改进与对齐研究。报道认为这表明 AI 发展路径日益“尖峰化”,即在特定领域极强,而非全面进步。
为什么值得看此前业界常以数学能力作为衡量模型推理水平的关键指标,而这次模型在该榜单领先却非公司主攻方向,说明能力增长不再沿统一曲线推进,评估模型强弱需要更细分的领域视角。
The Decoder AI News54
即将离开 Anthropic 的研究员 Jacob Coxon 在 CNN 上警告,可自我改进的 AI 对人类构成生存威胁。报道称 Anthropic 与 OpenAI 的安全研究人员持相似看法,美国政界人士与 Joe Rogan 也关注该话题,相关警告由此进入主流媒体。但文章同时指出,文化与经济利益也在其中起作用,灭绝情景仍是极端且有争议的立场。
为什么值得看此前 AI 安全争论多集中在技术圈与专业论坛,如今通过 CNN、Fox News 等主流电视渠道传播,并牵连政治人物与大众播客,意味着该议题从行业内部讨论转为公共政治话题,可能影响监管讨论与公众认知。