AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期日报

10月2日星期五1610月1日星期四209月30日星期三189月29日星期二139月28日星期一59月27日星期日39月26日星期六149月25日星期五79月24日星期四149月23日星期三129月22日星期二139月21日星期一19月20日星期日89月19日星期六39月18日星期五39月17日星期四39月16日星期三59月15日星期二89月14日星期一69月13日星期日79月12日星期六139月11日星期五109月10日星期四149月9日星期三109月8日星期二139月7日星期一59月6日星期日99月5日星期六109月4日星期五179月3日星期四188月28日星期五148月27日星期四118月26日星期三118月25日星期二108月24日星期一68月23日星期日58月22日星期六178月21日星期五108月20日星期四148月19日星期三108月18日星期二78月17日星期一58月16日星期日78月15日星期六148月14日星期五168月13日星期四148月12日星期三158月11日星期二108月10日星期一78月9日星期日98月8日星期六118月7日星期五98月6日星期四118月5日星期三128月4日星期二178月3日星期一108月2日星期日98月1日星期六97月31日星期五37月30日星期四117月29日星期三147月28日星期二177月27日星期一157月26日星期日87月25日星期六77月24日星期五107月23日星期四107月22日星期三117月21日星期二137月20日星期一107月19日星期日17月18日星期六57月17日星期五127月16日星期四10
返回情报流
AILORE SIFTDAILY · 2026.09.23

AI 日报

2026年9月23日星期三

本期重点
12
预计阅读
9 分钟
01模型进展502行业动态203论文研究5
00

PERIOD HIGHLIGHTS

本期看点

  1. 01OpenAI 发布 GPT-6 Sol 与 Luna,上线 OpenRouter 且价格减半模型
  2. 02GPT-6 Sol 与 GPT-6 Luna 开始在 ChatGPT Work 和 Codex 推送模型
  3. 03Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 系列首个模型模型
  4. 04Sam Altman 称 GPT-6 Sol 与 Luna 按任务定价无对手模型
  5. 05Arena 上线 GPT-6 Sol 与 GPT-6 Luna 测试,评分待公布模型
01

MODEL RADAR

模型进展

5 条
AIHOT · X / 公众号精选70

OpenAI 发布 GPT-6 Sol 与 Luna,上线 OpenRouter 且价格减半

OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,并上线 OpenRouter。两款模型基于 GPT-6 Astra 的技术成果,通过更高效的缓存与推理,API 价格比 GPT-5.6 促销价低 50%。Sol 输入 $2/M、输出 $10/M,Luna 输入 $0.10/M、输出 $0.50/M。在 AutomationBench 上,两款模型均以更低单任务成本超过前代最好成绩。

为什么值得看此前 GPT-5.6 已处促销定价,新模型再降 50%,意味着同等预算可支撑更大规模调用;同时两款模型在 AutomationBench 上以更低单任务成本超过前代最好成绩,说明降价并非单纯牺牲能力换取低价。
AIHOT · X / 公众号精选62

GPT-6 Sol 与 GPT-6 Luna 开始在 ChatGPT Work 和 Codex 推送

OpenAI 的 ChatGPT 官方账号宣布,GPT-6 Sol 与 GPT-6 Luna 两款模型即日起开始推送,覆盖 Plus、Pro、Business、Enterprise 和 Edu 用户,并可在 ChatGPT Work 与 Codex 两处使用。证据未说明模型能力差异、定价变化或推送完成时间。

为什么值得看这是 GPT-6 系列首次以 Sol、Luna 双模型形式进入 ChatGPT Work 与 Codex 两条产品线,并一次性覆盖付费与教育类主要用户层级。相较此前的模型更新,本次同时涉及办公对话与代码两类场景,但证据未给出具体能力对比。
AIHOT · X / 公众号精选61

Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 系列首个模型

Anthropic 发布 Claude Opus 5.5,这是 Claude 5.5 系列的首个模型。官方表示,该模型在多数任务上达到 Claude Fable 5.1 的水平,同时运行成本比 Opus 5 低 40%。目前信息来自单一信源摘要,发布时间为 2026 年 9 月 22 日,尚无更详细的技术说明。

为什么值得看变化集中在两点:一是 Claude 5.5 系列开始迭代,二是 Opus 5.5 以更低成本对齐上一代 Fable 5.1 的能力水平。如果该成本下降在实际使用中成立,用户可能在不牺牲多数任务表现的前提下降低调用开销。
AIHOT · X / 公众号精选58

Sam Altman 称 GPT-6 Sol 与 Luna 按任务定价无对手

Sam Altman 表示,按任务定价衡量,GPT-6 Sol 和 Luna 在市场上没有可竞争的对手。引用内容称,这两款模型相比 5.6 系列在智能、对齐、工作产出、编码和计算机使用上有大幅提升,每 token 价格减半,按任务计算的价格更低。他同时表示希望人们能大量使用 AI,并认为这对探索眼前的新复兴很重要。

为什么值得看与此前 5.6 系列相比,这一说法同时指向能力提升与价格下降两个方向:智能、对齐、工作产出、编码和计算机使用被描述为大幅改善,而每 token 价格减半、按任务计价更低。若按任务而非 token 计价成为比较口径,模型竞争的衡量方式会发生变化。
AIHOT · X / 公众号精选57

Arena 上线 GPT-6 Sol 与 GPT-6 Luna 测试,评分待公布

Arena 于 2026 年 9 月 22 日宣布,OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 已上线其测试环境,两项评分即将公布。平台邀请用户前往实测,并通过投票参与真实智能体任务,以支持其排行榜结果。

为什么值得看此前 Arena 主要围绕已有模型进行对战与评分,此次直接上线 OpenAI 两个尚未公布评分的 GPT-6 系列模型,并引入真实智能体任务投票,意味着评估对象从对话能力向任务执行能力延伸。
02

INDUSTRY

行业动态

2 条
The Decoder AI News65

OpenAI 推出 GPT-6 Sol 与 Luna,token 价格减半但性能提升有限

OpenAI 发布两款更便宜的模型 GPT-6 Sol 和 Luna,以约前代一半的 token 价格提供与前代相当的性能,目标指向 Anthropic 价格更高的产品。独立分析显示其实际智能水平提升有限。报道还称,OpenAI 可能未预料到 Anthropic 同期发布 Opus 5.5。

为什么值得看此前模型迭代通常同时强调能力提升与价格,而此次变化主要是价格减半、性能基本持平,竞争重心从智能水平转向单位推理成本,同时面临 Anthropic 同期的正面对抗。
The Decoder AI News64

Xiaomi 平价旗舰 AI 领跑开放模型,Anthropic 称 Claude 助力其中

Xiaomi 推出 MiMo-V2.6-Pro,据 The Decoder 报道,该模型在公开可用的 AI 模型中升至领先位置,并在价格上大幅低于竞争对手。其训练依赖大规模强化学习,成本为 262 万美元。同一报道还称,Anthropic 指控 Xiaomi 从 Claude 获取训练数据,使这一成绩伴随争议。

为什么值得看此前开放模型多由专门 AI 实验室主导,且高性能往往对应高训练成本和高调用价格。若 MiMo-V2.6-Pro 确实以约 262 万美元强化学习成本登顶并低价提供,意味着硬件公司也能以较低投入进入开放模型第一梯队;但 Anthropic 的数据来源指控同时把竞争焦点从能力转向训练数据合规。
03

RESEARCH

论文研究

5 条
arXiv AI67

Qwen3.8-Omni:走向原生全模态智能体

论文提出 Qwen3.8-Omni-Flash,一个原生多模态 agentic 模型,相比以往偏重感知与交互的 omni 模型,显著提升多模态理解、推理和长程智能体任务表现。模型沿用 Qwen3.8-Next 的稀疏 MoE 架构,上下文窗口扩展至一百万 token,并同步开源 Qwen-MM-Plugins 插件框架与 Qwen-Live-Harness 实时多模态框架。

为什么值得看此前 omni 模型主要强调感知与交互,而该模型把重心转向多模态理解、推理与长程任务,并通过原生多模态协同训练把文本域已有的 agentic 能力迁移到音频和视频任务,使多模态模型不再只是对话前端,而更接近可直接承担生产流程的智能体。
arXiv AI66

间接推翻:AI agent 群体中的社会攻击面

该论文指出,随着生成式 AI agent 大规模部署,安全性不仅取决于技术防护和单个模型设计,还取决于 agent 群体处理信息、排序行动和应对不确定性的集体均衡。作者通过 LLM agent 群体实验和解析框架,把协调均衡纳入一个有向加权拓扑,发现经由中间“踏脚石”均衡的间接推翻可降低所需对抗 agent 的最小比例,绕过多数门槛,完成直接挑战无法实现的转移。

为什么值得看此前评估 AI 群体风险多采用临界质量动态,即寻找单一临界点、衡量直接竞争所需的最小对抗比例。该研究指出这种方法会低估系统脆弱性:间接路径可能以更少的对抗 agent 改变群体均衡,说明安全评估不能只看单点阈值,还要看均衡之间的连通结构。
arXiv AI66

LingLan:基于多模态数据的中医诊断大模型

该论文针对中医诊断依赖望闻问切、主观性强、难以量化对齐现代医学体系的问题,提出多模态数据统一框架 UFMD,将舌象与脉象图像自动转化为结构化、临床标准的描述,并汇总为望闻问切过程的统一数字记录。基于该数据,作者通过监督微调构建了中医专用大模型 LingLan-14B。实验显示诊断准确率相对基线提升 103.5%(62.72% 对 30.82%),F1 最高达 82%。

为什么值得看此前中医诊断的舌象、脉象等核心信息难以量化和标准化,AI 介入缓慢。该工作报告了从多模态图像到结构化临床描述、再到统一数字记录的处理路径,并给出相对基线的显著准确率提升,说明中医诊断的标准化建模在方法层面出现了可测量的进展。
arXiv AI64

DUMA-Bench:评估 LLM Agent 安全性的双控多智能体基准

研究者提出 DUMA-Bench,一个用于评估 LLM Agent 安全性的基准与评测协议。它在 τ²-bench 基础上扩展出对抗环境,覆盖 RAG 投毒、跨 Agent 操纵和不安全输出处理等八类漏洞,并测试来自 OpenAI、Anthropic、DeepSeek、Qwen、Z.ai 五个模型家族共 14 个模型、八个领域和多种用户行为模式。结果显示,引入双控交互后攻击成功率从 26.9% 升至 41.1%。

为什么值得看以往多数 Agent 安全评测默认用户被动、环境静态,忽略了真实部署中用户与 Agent 会共同改变环境状态这一动态。该工作把双控交互纳入评测,并给出跨模型家族的横向数据,说明安全表现不能只看模型本身,还取决于用户与环境交互方式。
arXiv AI63

AgenticSizing:基于大语言模型的多智能体模拟电路尺寸设计框架

该论文提出 AgenticSizing,一个基于 LLM 的多智能体框架,用于复杂模拟电路尺寸设计。框架先分析电路拓扑,将网表拆解为功能模块与子结构,并提取可复用的轻量设计知识;再由规划器协调多个角色专用智能体更新设计变量,达成全局性能指标。方法在八个电路上验证,最大设计含 55 个晶体管和 60 个尺寸变量;在 LDO 基准上以平均 83 次迭代取得 60% 成功率,而经典优化器未能找到可行解。

为什么值得看此前的 LLM 电路尺寸方法多缺少显式拓扑理解,且主要在较简单的模拟模块上评估。该工作把评估对象扩展到含 55 个晶体管、60 个尺寸变量的复杂电路,并在经典优化器失效的 LDO 基准上给出可行解,说明 LLM 方法开始进入传统优化难以覆盖的复杂模拟设计场景。
前一期返回情报流后一期