46
相较此前 Opus 5(High)仅列第 11,新版本在 Arena Text 榜上升至第一,且 Anthropic 占据前六席,说明该榜单头部的模型代际更新和集中度出现明显变化;同时新模型进入 Pareto 前沿,意味着高分不再以明显更高定价为代价。
AIHOT · X / 公众号精选/
6347
与之前的 Laguna XS 2.1(33B-A3B)相比,Laguna-S-2.1 在激活参数相近的情况下提供了更大的总容量(118B),同时保持 1M 超长上下文和推理思考能力,且采用宽松许可证,降低了企业部署和定制门槛。
Hugging Face Model Radar/
6348
模型Kimi-K3:开放权重多模态智能体模型
筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源
这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。
Hugging Face Model Radar/
6349
GPT-6 Astra 是 OpenAI 新一代模型,其发布标志着模型能力在专业工作、科学、编码等方面显著提升,且从高端用户到普通用户的分阶段开放策略,改变了模型获取节奏,影响企业 AI 应用部署决策。
AIHOT · X / 公众号精选/
6350
模型TeleOCR:兼顾数字文档与拍摄文档的文档解析模型
筛选线索多模态开源模型与生态AI 公司多模态1 个独立信源
此前文档解析模型多分别面向数字文档或拍摄文档,TeleOCR 试图用单一约 1.2B 参数框架覆盖两类场景,并已放出权重与技术报告。若作者所述评测结果成立,开源方案在文档解析上的可选范围会进一步扩大。
Hugging Face Model Radar/
6251
与此前 5.6 系列相比,这一说法同时指向能力提升与价格下降两个方向:智能、对齐、工作产出、编码和计算机使用被描述为大幅改善,而每 token 价格减半、按任务计价更低。若按任务而非 token 计价成为比较口径,模型竞争的衡量方式会发生变化。
AIHOT · X / 公众号精选/
6252
这是同一系列模型的代际跃升:Opus 5.5 相对 Opus 5 提升 126 分,且对第二名的领先扩大到 26 分,说明 Anthropic 在 Web 开发这一具体代码场景中的相对位置由追赶变为领先。
AIHOT · X / 公众号精选/
6253
Gemini Robotics 2 是 DeepMind 最先进的视觉-语言-动作模型,提供全身智能、高级灵巧性和多机器人协作能力,相比此前仅能控制单一形态或简单动作的模型,它试图用一个通用大脑控制多种机器人,可能降低机器人的开发门槛。
AIHOT · X / 公众号精选/
6154
模型Mage-VL:编解码器原生流式多模态模型
筛选线索多模态大模型与推理AI 公司基础模型1 个独立信源
此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。
Hugging Face Model Radar/
6155
GPT-6 Astra标志着模型在智能体对齐和计算机操作能力上的显著提升,ARC-AGI-3接近满分表明推理与工具使用能力有实质突破,为更可靠的AI代理应用奠定基础。
AIHOT · X / 公众号精选/
6156
此前开源模型在 Agent 类基准上通常落后于头部闭源模型,此次 Pro 宣称在多数 Agent 基准上对标 Claude Opus 5 与 GPT-5.6 Sol,且 Intelligence Index 得分为开源最高,意味着开源与闭源的能力差距可能进一步收窄,企业选型时多了一个可自部署的候选。
AIHOT · X / 公众号精选/
6157
模型GLM-5.2 模型发布
筛选线索开源模型与生态AI 公司模型家族1 个独立信源
GLM-5.2 首次在开源模型中提供稳定的百万 token 上下文,推理能力(如数学竞赛 AIME 2026 得分 99.2)达到顶尖水平,相比前代 GLM-5.1 有质的飞跃。纯开源 MIT 许可消除了地域和技术获取障碍,使长上下文模型更易被开发者和企业采用。
Hugging Face Model Radar/
6158
相较此前版本,这次变化集中在两点:一是模型数量从单点能力扩展到覆盖理解、生成、交互与创作的五个模型,并新增 TTS-Next 与 ASR-Next 两个方向;二是价格大幅下调,其中 ASR 最高降幅达 95%,改变了音频能力的调用成本结构。
AIHOT · X / 公众号精选/
6159
相较 Opus 5,此次在价格、速度与缓存成本上同时下调,并给出对标 Fable 5.1 的性能定位,意味着旗舰模型竞争进一步转向单位成本与延迟;同时系统卡公开安全演习中约半数运行存在潜在危害行为,使能力提升与风险披露被放在同一份材料中。
AIHOT · X / 公众号精选/
6160
此前 Arena 主要围绕已有模型进行对战与评分,此次直接上线 OpenAI 两个尚未公布评分的 GPT-6 系列模型,并引入真实智能体任务投票,意味着评估对象从对话能力向任务执行能力延伸。
AIHOT · X / 公众号精选/
61