模型Nex-N2.5-Pro:面向长周期任务的智能体模型系列
相较 Nex-N2,该系列把视觉从输入模态提升为智能体感知环境、验证结果的交互接口,并首次完成万亿参数规模的系统化后训练,同时把训练环境与任务类型扩展到更多真实场景,指向长周期任务的连续执行能力。
TOPIC · CURATED VIEW
模型从回答问题走向规划、调用工具和完成多步任务。这里追踪 Agent 框架、产品与可靠性评测。
相较 Nex-N2,该系列把视觉从输入模态提升为智能体感知环境、验证结果的交互接口,并首次完成万亿参数规模的系统化后训练,同时把训练环境与任务类型扩展到更多真实场景,指向长周期任务的连续执行能力。
此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
此前后续模型通常在能力与价格上同步上探,而 GPT-6.1 Sol 定位为面向智能体编码与跨应用工作流的专用型号,且价格低于 GPT-6 Astra,意味着 OpenAI 可能在细分场景上尝试能力与成本的不同组合,而非单纯堆叠通用能力。
Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
相比GLM-5.2,GLM-5.3-Flash在性能提升的同时将价格降至十分之一,首次引入混合注意力架构和mHC以降低长上下文服务成本,标志着智谱在高效多模态模型上的重要进展,可能改变市场定价和部署格局。
这是 DeepSeek-V4 系列首次引入多模态能力,从纯文本模型扩展至视觉理解,标志着其模型能力范围的实质性扩展。基准测试显示多模态智能体任务(如 ApexBench、Agents' Last Exam)上较此前版本有明显提升,且文本能力基本持平。
此前同类模型的 RL 多按代码、通用智能体、视觉等领域分别训练,该模型宣称用一次混合 RL 同时覆盖多领域,并让策略迁移到训练中未见过的 harness,把能力增长从分域堆叠转向统一扩展。
此前的做法通常按编码、通用 agent、视觉、安全等方向分别做 RL,而该报告称用一次混合 RL 同时覆盖这些领域,并把不同任务与多种 harness 混在同一批次。这意味着能力可能跨域相互增强,并迁移到训练中未见过 harness,同时把评分信号从二元通过/失败升级为组内排序。
相比原始 Qwen3.5-9B,该 SFT checkpoint 在多项评测上明显提升,尤其是通用 agent 与网络安全任务,说明小米正把自身生成的训练数据用于改造第三方开源基座,并以 9B 规模切入 agentic 场景。
Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。
这是DeepSeek-V4-Flash从预览走向正式版的实质更新,模型智能体能力(如终端能力、代码生成)相较预览版本有巨大提升,部分基准超越同期Pro版本,但整体仍略逊于Opus-4.8,同时以更小规模达到接近顶级模型的水平。
此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
Coding Agent 的评测开始同时呈现能力分数与每任务成本,而不是只比单一的模型能力。榜首模型虽然得分最高,但成本也最高,说明“最强”与“最划算”可能不是同一个选择,选型维度从分数转向性价比。
相比预览版,DeepSeek-V4-Pro-0813 在代理能力、基准测试上有显著提升,尤其在终端任务、软件工程等场景,表明 DeepSeek 在 Agent 领域取得进展,对依赖大模型的工具类产品构成竞争压力。
同一系列从上一代开源第13、净得分为负,变为新一代开源第5且净得分为正,名次提升9位,说明该模型在真实智能体任务上的可用性出现明显跃迁,而非仅参数或基准分数的变化。
此前 Qwen-Max 级能力仅限闭源 API,本次 Qwen3.8-2.4T-A95B 将同类能力开源,使开发者可自行部署,降低了使用高性能模型的门槛,可能影响行业对开源与闭源模型的性能认知和选型。
这是 Gemini 4 Argon 在 Agent 类评测中的一次公开排名披露,Agent Arena 关注的是多步任务执行能力,与常规对话评测维度不同。净提升 +7.92% 与每任务 0.62 美元同时出现,说明排名提升伴随可量化的单任务成本,为后续比较不同模型在智能体场景下的性价比提供了参考点。
与此前以静态问答或短任务为主的评测方式相比,这次把模型放进可调用搜索、文件系统与终端的真实长时程任务中,并让用户投票参与评估。评测场景从单轮回答转向多步骤工作流,考核维度更贴近实际使用中的智能体能力。
Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。
此前小参数模型通常在编码、数学、长上下文与工具调用上明显落后于更大模型。该模型宣称在保持 2B 规模的同时,于这些能力上优于同尺寸模型,并可对标 4B 级模型,意味着本地部署可用的能力下限被抬高,端侧方案的选型空间发生变化。
相比 GPT-5.6 Luna (xHigh),GPT-6 Luna (Max) 在同一评测中排名上升 6 位,净提升 +1.6%,同时单任务成本仅 0.05 美元,说明其在智能体任务上的表现与成本组合出现变化,但第 23 名仍非头部位置。
该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。
此前模型评测多以静态题目或单轮对话为主,而这次把长程智能体任务、真实用户数据和工具调用纳入同一榜单,并用因果追踪做相对比较,意味着评测维度从“答题能力”转向“完成复杂工作流的能力”。
此前 Agent Arena 头部位置由 Fable 5.1 (Max) 等配置占据,Claude Opus 5.5 (High) 以第 2 名和第 56% 的成本降幅同时出现,意味着在同等榜单维度上,高能力与低推理成本的组合正在发生变化,而不只是单纯的排名更替。
Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。
该模型展示了从固定人工任务转向自主生成训练任务、优化策略并强化学习的范式,且以约 3B 激活参数超越更大或稠密模型,在编码与智能体任务上表现突出,可能影响模型开发成本与效率。
该模型将自我改进从脚手架和 rollout 优化扩展到任务生成、脚手架和 rollout 的联合优化,不再依赖固定人工任务集,可能改变基础模型的训练方式,并在较小规模(9B)下实现较强编程能力,对边缘部署有参考价值。
这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。
dots3-note preview 是 dots3 系列首款开放权重模型,提供 512K 长上下文和多模态支持,且为最轻量级成员,可能降低多模态推理成本。其出现可能丰富开源模型生态,为开发者在长上下文和多模态场景提供新选择,但作者未知,需关注其来源与可信度。
与之前的 Laguna XS 2.1(33B-A3B)相比,Laguna-S-2.1 在激活参数相近的情况下提供了更大的总容量(118B),同时保持 1M 超长上下文和推理思考能力,且采用宽松许可证,降低了企业部署和定制门槛。