AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期日报

10月2日星期五1610月1日星期四209月30日星期三189月29日星期二139月28日星期一59月27日星期日39月26日星期六149月25日星期五79月24日星期四149月23日星期三129月22日星期二139月21日星期一19月20日星期日89月19日星期六39月18日星期五39月17日星期四39月16日星期三59月15日星期二89月14日星期一69月13日星期日79月12日星期六139月11日星期五109月10日星期四149月9日星期三109月8日星期二139月7日星期一59月6日星期日99月5日星期六109月4日星期五179月3日星期四188月28日星期五148月27日星期四118月26日星期三118月25日星期二108月24日星期一68月23日星期日58月22日星期六178月21日星期五108月20日星期四148月19日星期三108月18日星期二78月17日星期一58月16日星期日78月15日星期六148月14日星期五168月13日星期四148月12日星期三158月11日星期二108月10日星期一78月9日星期日98月8日星期六118月7日星期五98月6日星期四118月5日星期三128月4日星期二178月3日星期一108月2日星期日98月1日星期六97月31日星期五37月30日星期四117月29日星期三147月28日星期二177月27日星期一157月26日星期日87月25日星期六77月24日星期五107月23日星期四107月22日星期三117月21日星期二137月20日星期一107月19日星期日17月18日星期六57月17日星期五127月16日星期四10
返回情报流
AILORE SIFTDAILY · 2026.09.25

AI 日报

2026年9月25日星期五

本期重点
7
预计阅读
6 分钟
01模型进展102行业动态103论文研究5
00

PERIOD HIGHLIGHTS

本期看点

  1. 01Claude Opus 5.5 以 1818 分登顶 Code Arena WebDev 榜模型
  2. 02AI 性能成本下降速度快于以往任何技术新闻
  3. 03SkinAgent AI:面向非诊断护肤支持的安全约束多模态智能体框架论文
  4. 04区块链赋能的 AI 与 AI 智能体:面向安全数据共享与网络安全应用论文
  5. 05控制 harness 即控制成本:企业内 AI 编程 agent 的路由与治理论文
01

MODEL RADAR

模型进展

1 条
AIHOT · X / 公众号精选57

Claude Opus 5.5 以 1818 分登顶 Code Arena WebDev 榜

Arena 宣布 Claude Opus 5.5(Max)以 1818 分在 Code Arena: WebDev 榜单登顶,领先第二名 GPT-6 Astra(Max)26 分,同时比 Opus 5(Max)的 1692 分高出 126 分,成为该榜单当前最高分模型。

为什么值得看这是同一系列模型的代际跃升:Opus 5.5 相对 Opus 5 提升 126 分,且对第二名的领先扩大到 26 分,说明 Anthropic 在 Web 开发这一具体代码场景中的相对位置由追赶变为领先。
02

INDUSTRY

行业动态

1 条
The Decoder AI News59

AI 性能成本下降速度快于以往任何技术

Epoch AI 测算,AI 在固定基准性能水平上的成本每年下降约 13 倍。MIT 在剔除硬件进步与市场竞争因素后,认为算法层面的年进步约为 3 倍。报道同时指出,这并不意味着今天最强的模型一定更便宜,推理模型因每项任务消耗算力更多,成本可能更高。

为什么值得看以往技术成本的下降多由硬件迭代和规模效应驱动,而这次在剥离硬件与竞争因素后,算法本身仍带来约 3 倍的年度进步,说明成本下行有独立于芯片供应的来源,这会改变企业评估模型采购与自建推理时的长期假设。
03

RESEARCH

论文研究

5 条
arXiv AI71

SkinAgent AI:面向非诊断护肤支持的安全约束多模态智能体框架

一项 arXiv 研究提出 SkinAgent AI,一个非诊断性多模态智能体框架,结合视觉问题路由与基于大模型的编排,覆盖痤疮、毛孔、皱纹路由,照片肤质估计,以及基于计数的痤疮严重度支持,并配有类型化工具、数据库推荐、确定性安全与隐私检查、状态变更前审批和可回放追踪。实验显示,肤况路由准确率 99.84%±0.07%,肤质估计 88.85%,痤疮严重度支持 84.59%、二次加权 kappa 0.9076。在 240 例系统基准上,意图准确率 80.00%,工具集完全匹配 62.92%,严格任务完成率 47.08%。

为什么值得看此前消费级护肤 AI 多停留在单点识别或对话建议,缺少安全边界、审计与工具调用约束。该工作把路由、工具、数据库推荐、隐私与安全检查和审批串联为可追踪流程,并分开评估视觉模型与系统级智能体行为,使非诊断护肤助手的工程可行性有了量化参照,而非仅凭模型精度宣称可用。
arXiv AI63

区块链赋能的 AI 与 AI 智能体:面向安全数据共享与网络安全应用

一篇 arXiv 论文对四项研究进行元综合分析,覆盖对抗性机器学习、云端 AI 异常检测、多智能体 LLM 流水线自动修补漏洞,以及 AI 系统全生命周期的安全防护。作者提出分层参考架构,将抗对抗攻击模型、区块链锚定的数据溯源、AI 异常检测与智能合约治理的多智能体修复结合起来,用于分布式系统中的数据共享与自主决策安全。

为什么值得看此前相关研究多分散在对抗攻击、异常检测、自动补丁与 AI 生命周期安全等单点议题,本论文把它们统一到“缺乏中心权威时如何建立信任”这一共同缺口下,并给出整合区块链的架构主张,标志着该方向开始从单点工具转向组合式基础设施叙事。
arXiv AI63

控制 harness 即控制成本:企业内 AI 编程 agent 的路由与治理

这篇论文指出,企业部署 AI 编程 agent 的规模已从几百席试点扩展到上万席,且多采购 Anthropic 的 Claude Code 或 OpenAI 的 Codex 等商业 harness。harness 默认决定了模型选择、读取内容、prompt cache 用法和 subagent 调度,直接决定采购成本。作者构建了可自定义路由器 Jev,按自带分类法标注请求,并只在会话开始、侧路和 subagent 启动时切换,避免缓存重建。重定价约 1 万个真实会话后,在 1 万席模拟企业中可回收 14% 至 21% 的模型支出,按 2026 年 9 月 21 日 Anthropic 标价折合每年 330 万至 500 万美元。

为什么值得看此前企业的 AI 编程成本讨论多围绕席位采购或模型单价,而这项研究把焦点转向 harness 本身的默认配置,将其视为可被路由和治理的成本杠杆,并给出了在真实价格表下的量化回收区间和供应商依赖定价方法。
arXiv AI63

面向编程教育的风险自适应与证据约束生成式 AI 反馈框架

研究团队基于 215 名学生的 2993 个失败提交状态,开发了一个面向入门编程的风险自适应、证据约束反馈框架。学生隔离模型预测持续失败,验证集选出的逻辑回归测试 PR-AUC 为 0.550、ROC-AUC 为 0.681。在 544 条新生成消息中 519 条通过标准化修复与证据门控包含全部必需组件。固定阈值序列策略在测试集选中 17.8% 的合格状态,覆盖 25.2% 的持续失败。

为什么值得看该工作把生成式反馈从“一有错误就生成提示”转向风险校准与证据门控:先预测持续失败风险,再决定何时介入、用哪些记录证据、给多少帮助。相较以往直接生成反馈的做法,它把预测、决策和生成三个环节分开评估,并给出了可量化的覆盖率与生成合规率。
arXiv AI62

别读日志:执行轨迹污染视频生成智能体的验证器

一篇 arXiv 论文研究智能体式视频生成中生成器与验证器的闭环。研究者在 109 条带人工标注的双事件视频片段上,向多模态评审模型额外提供执行轨迹、计划等文本信息,同时保持画面不变。结果显示,报告工具调用成功的轨迹使三个开源 Qwen-VL 评审模型(7B、8B、32B)把 78%–90% 的失败片段误判为通过,无文本时仅为 7%–19%。

为什么值得看此前评测多关注生成质量与提示词,而这份证据指出评测环节本身会被与被测画面无关的文本带偏。仅凭“工具调用成功”的日志,就能让开源评审模型大规模放行明显失败的片段,说明自动验证结果在闭环系统中可能不具备可信度。
前一期返回情报流后一期