AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

Agent 智能体

模型从回答问题走向规划、调用工具和完成多步任务。这里追踪 Agent 框架、产品与可靠性评测。

全部 Story
1222
近 7 天
151
当前结果
45
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

模型Nex-N2.5-Pro:面向长周期任务的智能体模型系列

筛选线索多模态Agent 智能体AI 公司基础模型1 个独立信源

相较 Nex-N2,该系列把视觉从输入模态提升为智能体感知环境、验证结果的交互接口,并首次完成万亿参数规模的系统化后训练,同时把训练环境与任务类型扩展到更多真实场景,指向长周期任务的连续执行能力。

Hugging Face Model Radar/9月8日 11:01
75
02

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
74
03

模型OpenAI 发布 GPT-6.1 Sol:主打智能体编码与跨应用工作流,定价低于 GPT-6 Astra

筛选线索Agent 智能体AI 公司模型家族1 个独立信源

此前后续模型通常在能力与价格上同步上探,而 GPT-6.1 Sol 定位为面向智能体编码与跨应用工作流的专用型号,且价格低于 GPT-6 Astra,意味着 OpenAI 可能在细分场景上尝试能力与成本的不同组合,而非单纯堆叠通用能力。

AIHOT · X / 公众号精选/9月29日 23:13
74
04

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
73
05

模型GLM-5.3-Flash发布:原生多模态、低成本高效推理

筛选线索多模态Agent 智能体AI 公司模型家族1 个独立信源

相比GLM-5.2,GLM-5.3-Flash在性能提升的同时将价格降至十分之一,首次引入混合注意力架构和mHC以降低长上下文服务成本,标志着智谱在高效多模态模型上的重要进展,可能改变市场定价和部署格局。

Hugging Face Model Radar/8月25日 06:43
73
06

模型DeepSeek 推出实验性多模态模型 V4-Flash-Vision-Exp

筛选线索多模态Agent 智能体AI 公司模型家族1 个独立信源

这是 DeepSeek-V4 系列首次引入多模态能力,从纯文本模型扩展至视觉理解,标志着其模型能力范围的实质性扩展。基准测试显示多模态智能体任务(如 ApexBench、Agents' Last Exam)上较此前版本有明显提升,且文本能力基本持平。

Hugging Face Model Radar/8月31日 06:16
72
07

模型MiMo-V2.6-Flash-RL:面向自我改进的强化学习扩展模型

筛选线索Agent 智能体AI 公司智能体1 个独立信源

此前同类模型的 RL 多按代码、通用智能体、视觉等领域分别训练,该模型宣称用一次混合 RL 同时覆盖多领域,并让策略迁移到训练中未见过的 harness,把能力增长从分域堆叠转向统一扩展。

Hugging Face Model Radar/9月21日 15:39
71
08

模型MiMo-V2.6-Pro-RL:面向自我改进的强化学习旗舰模型

筛选线索Agent 智能体AI 公司智能体1 个独立信源

此前的做法通常按编码、通用 agent、视觉、安全等方向分别做 RL,而该报告称用一次混合 RL 同时覆盖这些领域,并把不同任务与多种 harness 混在同一批次。这意味着能力可能跨域相互增强,并迁移到训练中未见过 harness,同时把评分信号从二元通过/失败升级为组内排序。

Hugging Face Model Radar/9月21日 15:39
71
09

模型小米 MiMo 发布 9B 蒸馏版 Qwen Agent 模型

筛选线索多模态开源模型与生态AI 公司智能体1 个独立信源

相比原始 Qwen3.5-9B,该 SFT checkpoint 在多项评测上明显提升,尤其是通用 agent 与网络安全任务,说明小米正把自身生成的训练数据用于改造第三方开源基座,并以 9B 规模切入 agentic 场景。

Hugging Face Model Radar/9月21日 18:18
70
10

模型Qwen3.8-27B:新一代视觉语言模型发布

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。

Hugging Face Model Radar/8月5日 08:22
68
11

模型DeepSeek V4闪存版官方发布,智能体能力大幅增强

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

这是DeepSeek-V4-Flash从预览走向正式版的实质更新,模型智能体能力(如终端能力、代码生成)相较预览版本有巨大提升,部分基准超越同期Pro版本,但整体仍略逊于Opus-4.8,同时以更小规模达到接近顶级模型的水平。

Hugging Face Model Radar/7月31日 07:30
66
12

模型Solar-Open2-250B模型:250B参数激活15B的百万token上下文开源大模型

筛选线索开源模型与生态Agent 智能体AI 公司大语言模型1 个独立信源

此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。

Hugging Face Model Radar/7月22日 02:40
66
13

模型Artificial Analysis:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 登顶 Coding Agent Index 但成本差异大

筛选线索Agent 智能体AI 编码模型家族模型雷达1 个独立信源

Coding Agent 的评测开始同时呈现能力分数与每任务成本,而不是只比单一的模型能力。榜首模型虽然得分最高,但成本也最高,说明“最强”与“最划算”可能不是同一个选择,选型维度从分数转向性价比。

AIHOT · X / 公众号精选/10月2日 00:17
66
14

模型DeepSeek 发布 V4-Pro-0813 正式版,性能大幅提升

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

相比预览版,DeepSeek-V4-Pro-0813 在代理能力、基准测试上有显著提升,尤其在终端任务、软件工程等场景,表明 DeepSeek 在 Agent 领域取得进展,对依赖大模型的工具类产品构成竞争压力。

Hugging Face Model Radar/8月13日 03:05
66
15

模型MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

筛选线索开源模型与生态Agent 智能体模型雷达1 个独立信源

同一系列从上一代开源第13、净得分为负,变为新一代开源第5且净得分为正,名次提升9位,说明该模型在真实智能体任务上的可用性出现明显跃迁,而非仅参数或基准分数的变化。

AIHOT · X / 公众号精选/10月1日 18:57
66
16

模型Qwen 发布开源模型 Qwen3.8-2.4T-A95B

筛选线索开源模型与生态Agent 智能体AI 公司模型家族1 个独立信源

此前 Qwen-Max 级能力仅限闭源 API,本次 Qwen3.8-2.4T-A95B 将同类能力开源,使开发者可自行部署,降低了使用高性能模型的门槛,可能影响行业对开源与闭源模型的性能认知和选型。

Hugging Face Model Radar/8月8日 01:50
66
17

模型Gemini 4 Argon (High) 在 Arena Agent Arena 位列第 8,净提升 +7.92%

筛选线索Agent 智能体模型家族模型雷达1 个独立信源

这是 Gemini 4 Argon 在 Agent 类评测中的一次公开排名披露,Agent Arena 关注的是多步任务执行能力,与常规对话评测维度不同。净提升 +7.92% 与每任务 0.62 美元同时出现,说明排名提升伴随可量化的单任务成本,为后续比较不同模型在智能体场景下的性价比提供了参考点。

AIHOT · X / 公众号精选/9月30日 21:35
65
18

模型GPT-6.1 上线 Agent Arena 评测平台

筛选线索Agent 智能体AI 公司模型家族1 个独立信源

与此前以静态问答或短任务为主的评测方式相比,这次把模型放进可调用搜索、文件系统与终端的真实长时程任务中,并让用户投票参与评估。评测场景从单轮回答转向多步骤工作流,考核维度更贴近实际使用中的智能体能力。

AIHOT · X / 公众号精选/9月29日 18:46
65
19

模型腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。

Hugging Face Model Radar/7月2日 13:23
65
20

模型MiniCPM5-2B:面向端侧的 2B 密集模型发布

筛选线索开源模型与生态Agent 智能体AI 公司智能体1 个独立信源

此前小参数模型通常在编码、数学、长上下文与工具调用上明显落后于更大模型。该模型宣称在保持 2B 规模的同时,于这些能力上优于同尺寸模型,并可对标 4B 级模型,意味着本地部署可用的能力下限被抬高,端侧方案的选型空间发生变化。

Hugging Face Model Radar/9月6日 11:12
64
21

模型Arena 评测:GPT-6 Luna (Max) 居 Agent Arena 第 23 名,单任务成本 0.05 美元

筛选线索Agent 智能体模型家族模型雷达1 个独立信源

相比 GPT-5.6 Luna (xHigh),GPT-6 Luna (Max) 在同一评测中排名上升 6 位,净提升 +1.6%,同时单任务成本仅 0.05 美元,说明其在智能体任务上的表现与成本组合出现变化,但第 23 名仍非头部位置。

AIHOT · X / 公众号精选/9月28日 20:44
64
22

模型Nanbeige4.2-3B

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。

Hugging Face Model Radar/7月21日 08:39
64
23

模型Claude Sonnet 5.5 进入 Arena 的 Agent Arena 与 Battle Mode 评测

筛选线索Agent 智能体AI 公司模型家族1 个独立信源

此前模型评测多以静态题目或单轮对话为主,而这次把长程智能体任务、真实用户数据和工具调用纳入同一榜单,并用因果追踪做相对比较,意味着评测维度从“答题能力”转向“完成复杂工作流的能力”。

AIHOT · X / 公众号精选/9月28日 18:30
64
24

模型Claude Opus 5.5 (High) 位列 Agent Arena 第 2,成本较 Opus 5 (Max) 低 56%

筛选线索Agent 智能体模型家族模型雷达1 个独立信源

此前 Agent Arena 头部位置由 Fable 5.1 (Max) 等配置占据,Claude Opus 5.5 (High) 以第 2 名和第 56% 的成本降幅同时出现,意味着在同等榜单维度上,高能力与低推理成本的组合正在发生变化,而不只是单纯的排名更替。

AIHOT · X / 公众号精选/9月28日 17:00
64
25

模型Ling-3.0-flash 模型发布

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。

Hugging Face Model Radar/8月2日 16:14
64
26

模型Ornith-1.5-35B-A3B:端到端自我改进的 MoE 模型

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

该模型展示了从固定人工任务转向自主生成训练任务、优化策略并强化学习的范式,且以约 3B 激活参数超越更大或稠密模型,在编码与智能体任务上表现突出,可能影响模型开发成本与效率。

Hugging Face Model Radar/8月18日 06:24
64
27

模型Ornith-1.5-9B:端到端自我改进的轻量级编程模型

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

该模型将自我改进从脚手架和 rollout 优化扩展到任务生成、脚手架和 rollout 的联合优化,不再依赖固定人工任务集,可能改变基础模型的训练方式,并在较小规模(9B)下实现较强编程能力,对边缘部署有参考价值。

Hugging Face Model Radar/8月18日 06:20
64
28

模型Muse-Glimmer-30B:面向消费硬件的代理模型

筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源

这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。

Hugging Face Model Radar/8月9日 17:51
63
29

模型dots3-note预览版发布:280B参数多模态MoE模型

筛选线索多模态开源模型与生态AI 公司推理能力1 个独立信源

dots3-note preview 是 dots3 系列首款开放权重模型,提供 512K 长上下文和多模态支持,且为最轻量级成员,可能降低多模态推理成本。其出现可能丰富开源模型生态,为开发者在长上下文和多模态场景提供新选择,但作者未知,需关注其来源与可信度。

Hugging Face Model Radar/8月9日 07:33
63
30

模型Laguna-S-2.1:面向智能体编程的118B MoE模型

筛选线索Agent 智能体AI 主题AI 公司1 个独立信源

与之前的 Laguna XS 2.1(33B-A3B)相比,Laguna-S-2.1 在激活参数相近的情况下提供了更大的总容量(118B),同时保持 1M 超长上下文和推理思考能力,且采用宽松许可证,降低了企业部署和定制门槛。

Hugging Face Model Radar/7月13日 13:58
63
当前展示各类别评分靠前的 30 条,共 45 条