AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

大模型与推理

追踪基础模型、推理能力、上下文与训练方法的关键变化,不收录只有参数宣传的更新。

全部 Story
1585
近 7 天
206
当前结果
1585
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

文章H-Company 如何借助 NVIDIA Dynamo 优化计算机使用代理的 VLM 服务

筛选线索开源模型与生态Agent 智能体智能体工具调用1 个独立信源

此前计算机使用代理的部署多依赖闭源模型和通用推理栈,模型行为与基础设施难以透明控制。该分享把透明基础模型、开放代理架构与专用推理部署工具结合,为代理型 VLM 工作负载提供了可参考的部署路径,可能降低此类代理的落地门槛。

YouTube · NVIDIA Developer/9月28日 13:57
70
02

产品Token Forecaster:按 Enter 前预测 LLM 回复耗时

筛选线索大模型与推理大语言模型发布动态1 个独立信源

Token Forecaster 是一款在 Product Hunt 上发布的产品,核心能力是在用户按下 Enter 之前,预测某次 LLM 回复大概会运行多久。它针对的是调用大模型时等待时间不确定的问题,让使用者在提交请求前对响应时长有一个预期。证据仅包含一句话产品描述,未说明发布方、底层模型、支持平台或具体使用方式。

Product Hunt/9月25日 04:40
60
03

模型Nex-N2.5-Pro:面向长周期任务的智能体模型系列

筛选线索多模态Agent 智能体AI 公司基础模型1 个独立信源

相较 Nex-N2,该系列把视觉从输入模态提升为智能体感知环境、验证结果的交互接口,并首次完成万亿参数规模的系统化后训练,同时把训练环境与任务类型扩展到更多真实场景,指向长周期任务的连续执行能力。

Hugging Face Model Radar/9月8日 11:01
75
04

论文PhysAI-Bench:面向以无人机为中心的自主物理 AI 的 LLM 智能体决策基准

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

既有基准多测物理感知、直觉物理、具身导航和协作推理,很少评测可靠自主所需的智能体决策。PhysAI-Bench 把决策前信息隔离、时序依赖、物理约束、MCP/A2A 交互和 6G 网络条件一起纳入评测,相当于把“自主系统能不能在动态环境里做对决策”变成可量化对象,并首次给出 29 个基础模型在该任务上的可比分数。

arXiv AI/9月20日 15:14
85
05

文章在 Nebius 上部署 NVIDIA Cosmos 3 Super 世界模型:延迟与吞吐的权衡

筛选线索AI 视频大模型与推理AI 主题AI 公司1 个独立信源

此前关于世界模型和视频生成的讨论多集中在模型能力本身,而这次公开对比的是服务层的工程取舍:视频生成不像大语言模型那样只追求吞吐或延迟单点最优,副本数和并发度会同时改变单节点产出与单请求响应时间。把延迟、吞吐和输出质量校验放在同一套基准里,意味着世界模型开始进入可量化部署阶段。

YouTube · NVIDIA Developer/9月23日 20:12
60
06

产品Desert Ant Labs 发布面向语音、文本、视觉的小型专用 AI 模型

筛选线索大模型与推理AI 主题发布动态1 个独立信源

Desert Ant Labs 在 Product Hunt 上发布,定位为提供面向语音、文本和视觉三类任务的小型专用 AI 模型。从公开信息看,它解决的是通用大模型在特定场景下体积大、成本高的问题,转而以更小、更聚焦的模型覆盖单一模态任务。目前尚无更细的模型清单、参数规模或使用方式说明。

Product Hunt/9月9日 19:54
44
07

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
74
08

论文面向持续演进的企业 AI Agent 技能的过程级持续评估

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前企业多依赖最终输出数值判断 Agent 是否正确,该论文显示这种方式会遗漏大量过程偏差:即便最终数值全部通过,仍有约九成运行存在工具选择、参数或执行顺序等问题。这说明评估对象需要从单一结果扩展到轨迹,否则隐患难以暴露。

arXiv AI/10月1日 15:06
85
09

文章Solus Linux 采用正式 AI 与 LLM 贡献政策

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前多数开源发行版对 AI 生成代码的提交多依赖社区惯例或个案判断,缺少成文规则。Solus Linux 将 AI 与 LLM 贡献写入正式政策,意味着该项目开始把此类提交纳入可审查、可执行的治理框架,可能影响贡献者提交代码和补丁的方式。

Hacker News AI/9月26日 22:29
58
10

产品IQ Routing:轨迹感知的大模型路由,降低智能体成本

筛选线索Agent 智能体大模型与推理大语言模型发布动态1 个独立信源

IQ Routing 是一款大模型路由产品,于 2026 年 8 月 27 日在 Product Hunt 上发布。它通过感知用户请求轨迹来智能选择最合适的模型,目标是降低智能体(agent)的运行成本。该产品面向使用大模型的开发者或企业,帮助他们在保证任务质量的同时减少昂贵模型的调用次数。

Product Hunt/8月27日 06:54
41
11

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
73
12

论文AGO AI 质量门:面向 RAG 的证据优先发布决策

筛选线索大模型与推理AI 主题模型家族1 个独立信源

此前企业上线 RAG 版本多依赖 LLM 评审分数直接拍板,却缺少对评审器本身质量的验证。该工作把缺失数据与评审错误显式建模为决策结果,并要求先对 LLM 评审器做元评估,这使发布决策从单点评分转向可量化风险的概率判断。

arXiv AI/10月1日 07:24
84
13

文章理解 LLM 水印对 AI Agent 行为的影响

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

以往关于 LLM 水印的讨论多集中在文本检测与版权溯源,此条目把关注点转向水印对 Agent 实际执行行为的影响,并提出“溯源税”这一概念,意味着水印可能不只是合规附加项,而会改变 Agent 的决策与运行表现,值得产品与研发团队提前评估。

Hacker News AI/9月26日 13:05
57
14

产品Kimi K3:全球首个开放型3T参数模型发布

筛选线索开源模型与生态大模型与推理模型家族发布动态1 个独立信源

Kimi(月之暗面)在Product Hunt发布了Kimi K3模型,宣称这是全球首个开放型3T参数级别的模型。该产品面向AI开发者和研究者,提供大规模参数的开源模型,旨在突破以往模型参数规模的限制,但具体能力和应用场景尚未披露。

Product Hunt/7月17日 02:39
41
15

模型DeepSeek-V4.1-Flash 多模态 MoE 模型现身 Hugging Face 热门榜

筛选线索多模态大模型与推理AI 公司模型家族1 个独立信源

相较此前同类模型,该模型宣称在 prefill 阶段每 token 仅激活 8B 参数、decode 阶段 16B,并把持久化 KV cache 占用压缩到 DeepSeek-V4-Flash 的约八分之一,指向长上下文与高输入量场景的成本变化。

Hugging Face Model Radar/9月10日 02:17
70
16

论文SkinAgent AI:面向非诊断护肤支持的安全约束多模态智能体框架

筛选线索多模态Agent 智能体AI 主题大语言模型1 个独立信源

此前消费级护肤 AI 多停留在单点识别或对话建议,缺少安全边界、审计与工具调用约束。该工作把路由、工具、数据库推荐、隐私与安全检查和审批串联为可追踪流程,并分开评估视觉模型与系统级智能体行为,使非诊断护肤助手的工程可行性有了量化参照,而非仅凭模型精度宣称可用。

arXiv AI/9月24日 10:15
84
17

文章Jump Trading 将最难、最模糊的任务交给 GPT-6 Astra

筛选线索大模型与推理AI 主题模型家族1 个独立信源

此前 AI 在交易类公司的使用多集中在边界清晰的任务上;该案例显示任务范围扩展到长周期、跨数据源、目标不明确的分析与完整服务构建,意味着模型开始承担原先由人主导的开放性问题。

YouTube · OpenAI/9月17日 18:03
56
18

产品Unabyss:为Claude提供跨应用与LLM的共享内存

筛选线索大模型与推理模型家族发布动态1 个独立信源

Unabyss 为 Claude 推出了一项共享内存功能,使 Claude 能够在所有应用程序和大语言模型之间保留和访问上下文信息,从而减少重复输入并提升多工具协作的连贯性。当前证据仅表明该功能存在于 Claude 环境中,未提供具体实现细节或发布方信息。

Product Hunt/7月10日 19:19
41
19

模型Qwen3.8-Flash-Next:Qwen4 架构的开放权重实验预览

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

该模型是首次以开放权重形式发布的 Qwen4 架构预览,代表了对 LLM 核心组件交互方式的根本性重新思考,而非单纯参数规模或上下文的扩展。它可能为高效可扩展的 AI 发展提供新方向,并影响未来模型的设计范式。

Hugging Face Model Radar/8月24日 08:24
69
20

论文APEXA:面向同步辐射数据处理的执行完整性约束多智能体框架

筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源

此前的 LLM 智能体评测基本停留在对话与文本任务,无法暴露“智能体报告了根本没执行的计算”这类失败。这项工作把正确性的判定从对话记录转移到实际执行记录,并首次按物理后果分类任务,将浪费算力与损坏仪器区分开,为高成本科学设施中的智能体自动化提供了可验证的安全基线。

arXiv AI/9月21日 06:33
83
21

文章Show HN:Wallstreetclaws.com,可创建交易用 AI Agent

筛选线索图像生成Agent 智能体AI 主题大语言模型1 个独立信源

此前个人做 AI 交易策略通常需要自行拼装数据、回测和下单环节,该平台把 LLM 代理与量化规则策略放进同一套创建、回测和排行榜体系,并打通 Robinhood 账户,降低了从想法到可运行交易代理的门槛,也把策略表现公开比较变成平台内建功能。

Hacker News AI/9月25日 22:37
54
22

产品Soup CLI:在 4GB 显存笔记本上微调 8B 大模型

筛选线索大模型与推理大语言模型发布动态1 个独立信源

Soup CLI 是一个命令行工具,由其在 Product Hunt 上发布,宣称用户可以在配备 4GB 显卡的笔记本电脑上对 8B 参数规模的大语言模型进行微调。该产品面向资源受限的开发者,降低了本地微调大模型的硬件门槛。

Product Hunt/8月8日 07:59
39
23

模型Qwen3.8-27B:新一代视觉语言模型发布

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。

Hugging Face Model Radar/8月5日 08:22
68
24

论文面向 LLM、Agentic AI 与多模态系统的统一可信评估框架

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

此前评估多依赖单一 benchmark 分数,难以反映 agent 轨迹、多模态输出与安全失效。该框架把评估对象从结果扩展到过程与证据可信度,并主张安全关键项可覆盖聚合分数,避免平均分掩盖严重问题,同时对接治理框架与国际标准、欧盟监管要求。

arXiv AI/9月17日 00:31
82
25

新闻不到一个月估值涨 100 亿美元,Jev 创造者称 ChatGPT 把 AI 带偏

筛选线索大模型与推理AI 主题模型家族1 个独立信源

此前行业普遍把对话式大模型当作 AI 产品的默认形态;这一表态把焦点从聊天交互转向自动化执行,同时伴随估值快速上升,说明资本与创业者开始为「非 ChatGPT 路线」定价,路线分歧从技术讨论进入商业叙事。

公众号 · 极客公园/9月26日 04:00
50
26

产品小红书开源 BigMac:多模态模型训练的新流水线范式

筛选线索多模态开源模型与生态大语言模型发布动态1 个独立信源

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它利用 LLM 流水线作为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

AIHOT · X / 公众号精选/7月22日 10:04
34
27

模型ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token

筛选线索多模态大模型与推理AI 公司模型家族1 个独立信源

以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。

Hugging Face Model Radar/7月6日 13:16
67
28

论文SPLASH:在 LLM 服务中无缝切换注意力并行布局

筛选线索大模型与推理模型家族大语言模型1 个独立信源

此前服务引擎在启动时固定并行布局,因为换布局需要排空请求并重启 worker,导致低并发、大量独立请求、长 prompt 以及推理、agentic、RL-rollout 等混合负载无法随负载变化调整。SPLASH 让布局可在同一批请求运行中改变,把原本的停机式切换变为近乎免费的在线操作。

arXiv AI/9月29日 14:02
82
29

文章Show HN:我做了个可本地运行的开源全能 AI 平台

筛选线索开源模型与生态Agent 智能体AI 主题大语言模型1 个独立信源

此前要在本地同时使用多家模型与个人邮件、日历等数据,通常需要自行拼装多个工具并处理密钥管理。ENZO 把多模型调用、Agent 创建、个人数据连接和编程预览收进一个开源入口,并强调数据与密钥本地存储,使个人用户不依赖单一厂商即可获得较完整的工作流,但项目目前仅为作者自述,尚无独立验证。

Hacker News AI/9月19日 23:47
49
30

产品Meta 开源 Muse Glimmer 登陆 OpenRouter

筛选线索多模态开源模型与生态AI 主题发布动态1 个独立信源

Meta AI 超级智能实验室发布了首个开放权重模型 Muse Glimmer,并已上线 OpenRouter。这是一款 30B 参数的密集文本+图像模型,采用 Apache 2.0 许可证,定位为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。

AIHOT · X / 公众号精选/8月12日 12:00
32
当前展示各类别评分靠前的 30 条,共 1585 条