AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

Agent 智能体

模型从回答问题走向规划、调用工具和完成多步任务。这里追踪 Agent 框架、产品与可靠性评测。

全部 Story
1222
近 7 天
151
当前结果
1222
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

文章用 NVIDIA VSS Blueprint 3.3 在 30 分钟内构建视觉 AI Agent

筛选线索Agent 智能体AI 编码AI 主题智能体1 个独立信源

此前构建多能力视觉 AI Agent 需手工串联告警、搜索、摘要等微服务,开发与运维成本高。此次新增 skill 把微服务编排放进编码 Agent 自动完成,并通过 Adaptive Efficient Video Sampling 将推理时 VLM token 用量降低 80%,把部署门槛和运行成本同时压低。

YouTube · NVIDIA Developer/9月29日 22:30
75
02

产品CrawlRaven MCP:在 AI agent 中完成 SEO 工作

筛选线索Agent 智能体AI 主题智能体1 个独立信源

CrawlRaven MCP 是在 Product Hunt 上出现的一款产品,主张让用户在自己的 AI agent 中完成 SEO 相关工作,口号为“Your SEO work, done from your AI agent”。从现有证据看,它把 SEO 操作嵌入 AI agent 的交互流程,而不是让用户单独打开传统 SEO 工具后台。产品发布方、具体功能清单与底层实现均未在证据中说明。

Product Hunt/9月30日 06:51
72
03

模型Nex-N2.5-Pro:面向长周期任务的智能体模型系列

筛选线索多模态Agent 智能体AI 公司基础模型1 个独立信源

相较 Nex-N2,该系列把视觉从输入模态提升为智能体感知环境、验证结果的交互接口,并首次完成万亿参数规模的系统化后训练,同时把训练环境与任务类型扩展到更多真实场景,指向长周期任务的连续执行能力。

Hugging Face Model Radar/9月8日 11:01
75
04

论文PhysAI-Bench:面向以无人机为中心的自主物理 AI 的 LLM 智能体决策基准

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

既有基准多测物理感知、直觉物理、具身导航和协作推理,很少评测可靠自主所需的智能体决策。PhysAI-Bench 把决策前信息隔离、时序依赖、物理约束、MCP/A2A 交互和 6G 网络条件一起纳入评测,相当于把“自主系统能不能在动态环境里做对决策”变成可量化对象,并首次给出 29 个基础模型在该任务上的可比分数。

arXiv AI/9月20日 15:14
85
05

文章用 NVIDIA NeMo Relay 与 Phoenix 追踪和评估 Hermes Agent

筛选线索Agent 智能体AI 主题智能体1 个独立信源

此前 agent 的工具调用、数据访问和成本往往难以整体复盘,调试与评估缺少统一视图。该教程把执行路径追踪、PII 脱敏和 Phoenix 可视化串成可操作流程,使 agent 行为审查从零散日志转向可配置的标准做法。

YouTube · NVIDIA Developer/9月30日 16:09
75
06

产品OpenAI 发布新版 Codex Cloud,Agents API 开启预览并支持 computer use

筛选线索Agent 智能体AI 编码AI 公司工具调用1 个独立信源

OpenAI 推出大幅升级的新版 Codex Cloud,主打可配置的云端开发环境,有使用者称配置完成后很难再回到本地开发。同时,OpenAI 开放 Agents API 预览,该 API 与驱动 dots 等云智能体的技术相同,并支持 computer use,可用于构建同类云智能体产品。

AIHOT · X / 公众号精选/9月29日 17:32
72
07

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
74
08

论文面向持续演进的企业 AI Agent 技能的过程级持续评估

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前企业多依赖最终输出数值判断 Agent 是否正确,该论文显示这种方式会遗漏大量过程偏差:即便最终数值全部通过,仍有约九成运行存在工具选择、参数或执行顺序等问题。这说明评估对象需要从单一结果扩展到轨迹,否则隐患难以暴露。

arXiv AI/10月1日 15:06
85
09

新闻Shopify 推出 Canvas:通过与 AI 对话搭建线上店铺

筛选线索Agent 智能体AI 主题智能体1 个独立信源

此前商家搭建和调整线上店铺,多依赖模板、拖拽编辑器或代码操作,改动与结果之间存在操作链路。Canvas 把建站入口改为与 Sidekick 对话,并将修改实时呈现,意味着 AI agent 从辅助问答进一步进入店铺配置与页面生成环节,对建站工具形态和商家操作习惯都有直接影响。

TechCrunch AI/10月1日 16:44
71
10

产品Vitra.ai:面向内容创作与本地化的智能体平台

筛选线索Agent 智能体智能体发布动态1 个独立信源

Vitra.ai 是由 Vitra.ai 在 Product Hunt 发布的一款产品,被描述为“用于创建和本地化内容的智能体内容平台”。根据该条信息,它面向内容生产与本地化两个环节,试图用一个平台承接从内容生成到多语言适配的流程,而不再只做单点翻译或单点写作工具。

Product Hunt/9月30日 19:36
68
11

模型OpenAI 发布 GPT-6.1 Sol:主打智能体编码与跨应用工作流,定价低于 GPT-6 Astra

筛选线索Agent 智能体AI 公司模型家族1 个独立信源

此前后续模型通常在能力与价格上同步上探,而 GPT-6.1 Sol 定位为面向智能体编码与跨应用工作流的专用型号,且价格低于 GPT-6 Astra,意味着 OpenAI 可能在细分场景上尝试能力与成本的不同组合,而非单纯堆叠通用能力。

AIHOT · X / 公众号精选/9月29日 23:13
74
12

论文SkinAgent AI:面向非诊断护肤支持的安全约束多模态智能体框架

筛选线索多模态Agent 智能体AI 主题大语言模型1 个独立信源

此前消费级护肤 AI 多停留在单点识别或对话建议,缺少安全边界、审计与工具调用约束。该工作把路由、工具、数据库推荐、隐私与安全检查和审批串联为可追踪流程,并分开评估视觉模型与系统级智能体行为,使非诊断护肤助手的工程可行性有了量化参照,而非仅凭模型精度宣称可用。

arXiv AI/9月24日 10:15
84
13

文章H-Company 如何借助 NVIDIA Dynamo 优化计算机使用代理的 VLM 服务

筛选线索开源模型与生态Agent 智能体智能体工具调用1 个独立信源

此前计算机使用代理的部署多依赖闭源模型和通用推理栈,模型行为与基础设施难以透明控制。该分享把透明基础模型、开放代理架构与专用推理部署工具结合,为代理型 VLM 工作负载提供了可参考的部署路径,可能降低此类代理的落地门槛。

YouTube · NVIDIA Developer/9月28日 13:57
70
14

产品ChatGPT 可内置构建并部署 MCP 服务器

筛选线索Agent 智能体模型家族发布动态1 个独立信源

ChatGPT 新增在 ChatGPT Sites 中托管 MCP 服务器的能力,用户可以直接在 ChatGPT 内构建并部署 MCP 服务器,并将其转为插件,安装到 web、移动端和桌面端。作者补充,可将访问权限限制给指定的人,也可向全世界公开分享。

AIHOT · X / 公众号精选/10月1日 04:44
67
15

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
73
16

论文APEXA:面向同步辐射数据处理的执行完整性约束多智能体框架

筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源

此前的 LLM 智能体评测基本停留在对话与文本任务,无法暴露“智能体报告了根本没执行的计算”这类失败。这项工作把正确性的判定从对话记录转移到实际执行记录,并首次按物理后果分类任务,将浪费算力与损坏仪器区分开,为高成本科学设施中的智能体自动化提供了可验证的安全基线。

arXiv AI/9月21日 06:33
83
17

文章如何用 NVIDIA OpenShell 安全运行 AI Agent

筛选线索Agent 智能体AI 主题智能体1 个独立信源

此前 AI agent 的安全与合规控制往往需要改动 agent 本体或其运行框架,治理边界与业务代码耦合。该教程展示把治理下沉到运行时层,使既有 agent 在不重写的前提下获得策略、凭证与审计控制,这意味着 agent 上线前的安全改造成本和迁移阻力可能下降。

YouTube · NVIDIA Developer/9月28日 09:41
69
18

产品IntellAgents.io:为每通电话、聊天和私信配一个 AI agent

筛选线索Agent 智能体AI 主题智能体1 个独立信源

IntellAgents.io 在 Product Hunt 上发布,定位为「每次通话、聊天和私信都有一个 AI agent」。从现有证据看,它试图覆盖电话、实时聊天和私信等多种客户沟通渠道,由 AI agent 承接这些对话入口,减少人工逐一响应的负担。发布方、具体功能清单、集成方式与定价均未在证据中给出。

Product Hunt/9月23日 10:45
61
19

模型GLM-5.3-Flash发布:原生多模态、低成本高效推理

筛选线索多模态Agent 智能体AI 公司模型家族1 个独立信源

相比GLM-5.2,GLM-5.3-Flash在性能提升的同时将价格降至十分之一,首次引入混合注意力架构和mHC以降低长上下文服务成本,标志着智谱在高效多模态模型上的重要进展,可能改变市场定价和部署格局。

Hugging Face Model Radar/8月25日 06:43
73
20

论文面向 LLM、Agentic AI 与多模态系统的统一可信评估框架

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

此前评估多依赖单一 benchmark 分数,难以反映 agent 轨迹、多模态输出与安全失效。该框架把评估对象从结果扩展到过程与证据可信度,并主张安全关键项可覆盖聚合分数,避免平均分掩盖严重问题,同时对接治理框架与国际标准、欧盟监管要求。

arXiv AI/9月17日 00:31
82
21

新闻DoorDash 推出可通过短信点餐的 AI 智能体

筛选线索Agent 智能体AI 主题智能体1 个独立信源

此前 DoorDash 的入口是基于图形界面的应用和网页,用户需要自行浏览菜单并逐项下单;引入可对话的 AI 智能体后,点餐入口从“翻页选择”变成“用自然语言表达需求”,这可能改变外卖平台之间竞争的关键维度,从商家供给和配送速度扩展到交互体验。

TechCrunch AI/9月30日 16:00
65
22

产品Jango:用 AI agent 模拟真实用户测试多用户应用

筛选线索Agent 智能体AI 主题发布动态1 个独立信源

Jango 是一款在 Product Hunt 上线的产品,定位为用 AI agent 模拟真实用户来测试多用户应用。它试图解决多人协作类应用难以在开发阶段还原真实用户行为的问题:让多个 AI agent 以接近真人的方式参与测试,而不是只做单人流程验证。目前证据仅含一句产品描述,发布方、具体能力边界和适用平台均未说明。

Product Hunt/9月25日 02:16
57
23

模型DeepSeek 推出实验性多模态模型 V4-Flash-Vision-Exp

筛选线索多模态Agent 智能体AI 公司模型家族1 个独立信源

这是 DeepSeek-V4 系列首次引入多模态能力,从纯文本模型扩展至视觉理解,标志着其模型能力范围的实质性扩展。基准测试显示多模态智能体任务(如 ApexBench、Agents' Last Exam)上较此前版本有明显提升,且文本能力基本持平。

Hugging Face Model Radar/8月31日 06:16
72
24

论文CineMR:面向定量心脏 MRI 评估的工具集成视觉语言推理

筛选线索多模态Agent 智能体AI 主题推理能力1 个独立信源

此前医学视觉语言模型难以从多维 cine 图像中直接得出定量测量结果,多停留在定性描述。该工作把外部分析工具接入推理链路,并给出多队列基准和量化对比,使医学 VLM 从“看图说话”向可核验的数值评估推进,并显示工具调用能力可被训练显著提升。

arXiv AI/10月1日 06:43
82
25

新闻网络热议 xAI 疑似借域名 dot.com 蹭 OpenAI Dots 发布

筛选线索Agent 智能体具身智能AI 主题AI 公司1 个独立信源

此前 AI Agent 赛道的竞争多集中在模型能力与产品功能层面,此次事件把竞争延伸到了发布节点与域名的卡位。xAI 在 OpenAI 发布前拿下与产品名高度接近的域名,使对方的产品名在用户搜索时被导流至 Grok,这改变了新品发布时流量入口的可控性。

TechCrunch AI/9月29日 22:20
64
26

产品Once UI 2.0:面向开发者与 AI agents 的 React 应用构建工具

筛选线索Agent 智能体AI 主题发布动态1 个独立信源

Once UI 2.0 是一款在 Product Hunt 上发布的产品类工具,官方定位是帮助开发者与 AI agents 构建风格一致的 React 应用。从现有证据看,它面向 React 开发场景,主打一致性输出,但发布方、具体功能清单、许可与价格均未在证据中说明。

Product Hunt/9月24日 23:05
57
27

模型MiMo-V2.6-Flash-RL:面向自我改进的强化学习扩展模型

筛选线索Agent 智能体AI 公司智能体1 个独立信源

此前同类模型的 RL 多按代码、通用智能体、视觉等领域分别训练,该模型宣称用一次混合 RL 同时覆盖多领域,并让策略迁移到训练中未见过的 harness,把能力增长从分域堆叠转向统一扩展。

Hugging Face Model Radar/9月21日 15:39
71
28

论文隐性语言税:2026 年 LLM 分词器对法语及地区语言的多收 token,以及法语优化原型

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

此前业界多将多语言成本差异视为大致现象,该研究把差异量化到具体分词器和语料,并指出法语相对英语存在稳定且幅度较大的 token 溢价。这意味着按 token 计费和按 token 计量的上下文窗口,会让同一法语内容在价格和可用长度上系统性劣于英语;对法国及地区语言用户,成本差距在智能体多轮重发场景中会被进一步放大。

arXiv AI/9月30日 05:14
82
29

新闻FTC 对 OpenAI、Anthropic 等 AI 实验室展开消费者保护调查

筛选线索Agent 智能体AI 主题AI 公司1 个独立信源

此前 FTC 的动作主要围绕企业是否应为智能体行为担责,属于责任界定的延伸;此次则升级为正式调查,并动用强制调取文件和强制高管作证等法律手段,意味着监管从表态和指引转向取证与问责程序,AI 实验室面临的实际合规压力明显上升。

The Decoder AI News/9月30日 16:20
64
30

产品Floot MCP:在 Claude 或 ChatGPT 中构建并发布应用

筛选线索Agent 智能体模型家族发布动态1 个独立信源

Floot MCP 是一款在 Product Hunt 上发布的产品,其核心主张是让用户在 Claude 或 ChatGPT 内直接构建并发布 Web 与移动应用。从现有信息看,它试图把应用开发与上线流程嵌入对话式 AI 界面,减少在多个工具之间切换的步骤。发布方、底层实现与具体能力边界尚未在证据中说明。

Product Hunt/9月23日 20:54
56
当前展示各类别评分靠前的 30 条,共 1222 条