31
模型腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型
筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源
Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。
Hugging Face Model Radar/
6532
模型MiniCPM5-2B:面向端侧的 2B 密集模型发布
筛选线索开源模型与生态Agent 智能体AI 公司智能体1 个独立信源
此前小参数模型通常在编码、数学、长上下文与工具调用上明显落后于更大模型。该模型宣称在保持 2B 规模的同时,于这些能力上优于同尺寸模型,并可对标 4B 级模型,意味着本地部署可用的能力下限被抬高,端侧方案的选型空间发生变化。
Hugging Face Model Radar/
6433
模型Nanbeige4.2-3B
筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源
该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。
Hugging Face Model Radar/
6434
相比 GPT-5.6 Luna (xHigh),GPT-6 Luna (Max) 在同一评测中排名上升 6 位,净提升 +1.6%,同时单任务成本仅 0.05 美元,说明其在智能体任务上的表现与成本组合出现变化,但第 23 名仍非头部位置。
AIHOT · X / 公众号精选/
6435
此前模型评测多以静态题目或单轮对话为主,而这次把长程智能体任务、真实用户数据和工具调用纳入同一榜单,并用因果追踪做相对比较,意味着评测维度从“答题能力”转向“完成复杂工作流的能力”。
AIHOT · X / 公众号精选/
6436
模型Ling-3.0-flash 模型发布
筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源
Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。
Hugging Face Model Radar/
6437
此前 Agent Arena 头部位置由 Fable 5.1 (Max) 等配置占据,Claude Opus 5.5 (High) 以第 2 名和第 56% 的成本降幅同时出现,意味着在同等榜单维度上,高能力与低推理成本的组合正在发生变化,而不只是单纯的排名更替。
AIHOT · X / 公众号精选/
6438
该模型展示了从固定人工任务转向自主生成训练任务、优化策略并强化学习的范式,且以约 3B 激活参数超越更大或稠密模型,在编码与智能体任务上表现突出,可能影响模型开发成本与效率。
Hugging Face Model Radar/
6439
模型Ornith-1.5-9B:端到端自我改进的轻量级编程模型
筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源
该模型将自我改进从脚手架和 rollout 优化扩展到任务生成、脚手架和 rollout 的联合优化,不再依赖固定人工任务集,可能改变基础模型的训练方式,并在较小规模(9B)下实现较强编程能力,对边缘部署有参考价值。
Hugging Face Model Radar/
6440
此前该语音能力仅服务于 1-800-ChatGPT 这一自有场景,第三方开发者无法调用。开放至 API 意味着外部产品可以直接复用同一套语音交互能力,而不必自行搭建语音链路,语音智能体的接入门槛由此下降。
AIHOT · X / 公众号精选/
6441
模型Muse-Glimmer-30B:面向消费硬件的代理模型
筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源
这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。
Hugging Face Model Radar/
6342
这是 GPT-6 系列首次以 Sol、Luna 双模型形式进入 ChatGPT Work 与 Codex 两条产品线,并一次性覆盖付费与教育类主要用户层级。相较此前的模型更新,本次同时涉及办公对话与代码两类场景,但证据未给出具体能力对比。
AIHOT · X / 公众号精选/
6343
dots3-note preview 是 dots3 系列首款开放权重模型,提供 512K 长上下文和多模态支持,且为最轻量级成员,可能降低多模态推理成本。其出现可能丰富开源模型生态,为开发者在长上下文和多模态场景提供新选择,但作者未知,需关注其来源与可信度。
Hugging Face Model Radar/
6344
模型GLM-5.3 模型发布:后训练带来显著性能提升
筛选线索开源模型与生态AI 公司模型家族1 个独立信源
GLM-5.3 是开源权重模型,其编码能力显著提升,并首次在漏洞发现方面展现 SOTA 表现。这改变了开源模型在复杂任务上的能力上限,对依赖开源模型的开发者与产品团队有实质影响。
Hugging Face Model Radar/
6345
变化集中在两点:一是 Claude 5.5 系列开始迭代,二是 Opus 5.5 以更低成本对齐上一代 Fable 5.1 的能力水平。如果该成本下降在实际使用中成立,用户可能在不牺牲多数任务表现的前提下降低调用开销。
AIHOT · X / 公众号精选/
63