AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
2026年10月2日星期五

本期概览

13

约 9 分钟读完

新闻
3
论文
5
产品
2
模型
3
阅读本期日报

今日焦点

Albertsons 如何从内部重塑零售体验

发生了什么
OpenAI News 报道,Albertsons Companies 正在使用 ChatGPT Enterprise 与 OpenAI API,帮助内部团队提升工作速度,同时让数百万消费者的食品杂货购物体验更便利。这一消息来自 OpenAI 官方渠道,发布时间为 2026 年 10 月 1 日,但披露内容停留在合作方式与目标层面,未给出具体门店、业务环节或量化结果。
为什么值得看
此前大型连锁零售商引入生成式 AI 多集中在单点客服或营销试验,而 Albertsons 同时把 ChatGPT Enterprise 用于内部团队协作、把 OpenAI API 用于面向消费者的购物流程,说明零售企业的 AI 部署正从局部试点转向覆盖内部效率与前端体验的组合方式。
新闻评分78类别:新闻来源:OpenAI News阅读全文
全部新闻论文产品模型

情报流

#Story为什么值得看类别评分
31

模型腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。

Hugging Face Model Radar/7月2日 13:23
65
32

模型MiniCPM5-2B:面向端侧的 2B 密集模型发布

筛选线索开源模型与生态Agent 智能体AI 公司智能体1 个独立信源

此前小参数模型通常在编码、数学、长上下文与工具调用上明显落后于更大模型。该模型宣称在保持 2B 规模的同时,于这些能力上优于同尺寸模型,并可对标 4B 级模型,意味着本地部署可用的能力下限被抬高,端侧方案的选型空间发生变化。

Hugging Face Model Radar/9月6日 11:12
64
33

模型Nanbeige4.2-3B

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。

Hugging Face Model Radar/7月21日 08:39
64
34

模型Arena 评测:GPT-6 Luna (Max) 居 Agent Arena 第 23 名,单任务成本 0.05 美元

筛选线索Agent 智能体模型家族模型雷达1 个独立信源

相比 GPT-5.6 Luna (xHigh),GPT-6 Luna (Max) 在同一评测中排名上升 6 位,净提升 +1.6%,同时单任务成本仅 0.05 美元,说明其在智能体任务上的表现与成本组合出现变化,但第 23 名仍非头部位置。

AIHOT · X / 公众号精选/9月28日 20:44
64
35

模型Claude Sonnet 5.5 进入 Arena 的 Agent Arena 与 Battle Mode 评测

筛选线索Agent 智能体AI 公司模型家族1 个独立信源

此前模型评测多以静态题目或单轮对话为主,而这次把长程智能体任务、真实用户数据和工具调用纳入同一榜单,并用因果追踪做相对比较,意味着评测维度从“答题能力”转向“完成复杂工作流的能力”。

AIHOT · X / 公众号精选/9月28日 18:30
64
36

模型Ling-3.0-flash 模型发布

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。

Hugging Face Model Radar/8月2日 16:14
64
37

模型Claude Opus 5.5 (High) 位列 Agent Arena 第 2,成本较 Opus 5 (Max) 低 56%

筛选线索Agent 智能体模型家族模型雷达1 个独立信源

此前 Agent Arena 头部位置由 Fable 5.1 (Max) 等配置占据,Claude Opus 5.5 (High) 以第 2 名和第 56% 的成本降幅同时出现,意味着在同等榜单维度上,高能力与低推理成本的组合正在发生变化,而不只是单纯的排名更替。

AIHOT · X / 公众号精选/9月28日 17:00
64
38

模型Ornith-1.5-35B-A3B:端到端自我改进的 MoE 模型

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

该模型展示了从固定人工任务转向自主生成训练任务、优化策略并强化学习的范式,且以约 3B 激活参数超越更大或稠密模型,在编码与智能体任务上表现突出,可能影响模型开发成本与效率。

Hugging Face Model Radar/8月18日 06:24
64
39

模型Ornith-1.5-9B:端到端自我改进的轻量级编程模型

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

该模型将自我改进从脚手架和 rollout 优化扩展到任务生成、脚手架和 rollout 的联合优化,不再依赖固定人工任务集,可能改变基础模型的训练方式,并在较小规模(9B)下实现较强编程能力,对边缘部署有参考价值。

Hugging Face Model Radar/8月18日 06:20
64
40

模型OpenAI 将 GPT-Live-1 语音模型开放至 API

筛选线索语音与音频AI 公司模型家族1 个独立信源

此前该语音能力仅服务于 1-800-ChatGPT 这一自有场景,第三方开发者无法调用。开放至 API 意味着外部产品可以直接复用同一套语音交互能力,而不必自行搭建语音链路,语音智能体的接入门槛由此下降。

AIHOT · X / 公众号精选/9月12日 23:16
64
41

模型Muse-Glimmer-30B:面向消费硬件的代理模型

筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源

这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。

Hugging Face Model Radar/8月9日 17:51
63
42

模型GPT-6 Sol 与 GPT-6 Luna 开始在 ChatGPT Work 和 Codex 推送

筛选线索AI 编码AI 公司模型家族1 个独立信源

这是 GPT-6 系列首次以 Sol、Luna 双模型形式进入 ChatGPT Work 与 Codex 两条产品线,并一次性覆盖付费与教育类主要用户层级。相较此前的模型更新,本次同时涉及办公对话与代码两类场景,但证据未给出具体能力对比。

AIHOT · X / 公众号精选/9月22日 18:16
63
43

模型dots3-note预览版发布:280B参数多模态MoE模型

筛选线索多模态开源模型与生态AI 公司推理能力1 个独立信源

dots3-note preview 是 dots3 系列首款开放权重模型,提供 512K 长上下文和多模态支持,且为最轻量级成员,可能降低多模态推理成本。其出现可能丰富开源模型生态,为开发者在长上下文和多模态场景提供新选择,但作者未知,需关注其来源与可信度。

Hugging Face Model Radar/8月9日 07:33
63
44

模型GLM-5.3 模型发布:后训练带来显著性能提升

筛选线索开源模型与生态AI 公司模型家族1 个独立信源

GLM-5.3 是开源权重模型,其编码能力显著提升,并首次在漏洞发现方面展现 SOTA 表现。这改变了开源模型在复杂任务上的能力上限,对依赖开源模型的开发者与产品团队有实质影响。

Hugging Face Model Radar/8月25日 06:42
63
45

模型Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 系列首个模型

筛选线索AI 公司模型家族1 个独立信源

变化集中在两点:一是 Claude 5.5 系列开始迭代,二是 Opus 5.5 以更低成本对齐上一代 Fable 5.1 的能力水平。如果该成本下降在实际使用中成立,用户可能在不牺牲多数任务表现的前提下降低调用开销。

AIHOT · X / 公众号精选/9月22日 16:31
63
上一页
1234…9
下一页