AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

开源模型与生态

追踪开放权重模型、框架与社区生态,关注部署门槛、许可证和真实可用性。

全部 Story
448
近 7 天
50
当前结果
286
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文LazySloth:面向长视频快速理解的有界 LLM 惰性树搜索

筛选线索多模态开源模型与生态模型家族大语言模型1 个独立信源

此前长视频理解多依赖逐帧粗描述或带损嵌入的多模态 RAG,计算开销大且丢失时序与细节;LazySloth 把检索优化问题聚焦到 VLM 自身的查询相关信息筛选上,在不明显损失准确率的前提下大幅提速,并缩小开源模型与闭源模型差距。

arXiv AI/9月29日 12:53
82
02

论文Qwen3.8-Omni:走向原生全模态智能体

筛选线索多模态开源模型与生态模型家族推理能力1 个独立信源

此前 omni 模型主要强调感知与交互,而该模型把重心转向多模态理解、推理与长程任务,并通过原生多模态协同训练把文本域已有的 agentic 能力迁移到音频和视频任务,使多模态模型不再只是对话前端,而更接近可直接承担生产流程的智能体。

arXiv AI/9月22日 03:07
81
03

论文OpenMTB-Audit:揭示基于大模型的分子肿瘤委员会安全评估中的过度拒答与临床专家视角

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

此前对医疗大模型安全的评估多依赖总体分数,容易掩盖模型把复杂边界病例一律归为不支持或信息不足的行为。该研究用带对抗类别和四级标签的基准,把过度拒答量化为可复现指标,并引入两位肿瘤科医生标注,显示分歧集中在信息充分性与治疗优化的边界,说明高分未必等于临床可用的区分能力。

arXiv AI/10月1日 11:39
80
04

论文开源 LLM 多智能体系统的问题、成因与解决方案实证研究

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

此前关于 LLM 多智能体系统的讨论多集中于能力演示与架构设计,缺少对真实开源项目故障分布的大样本量化证据。该研究用近千条真实 issue 给出问题类型、成因与解决方案的优先级排序,使工程团队能按实际高频痛点而非直觉分配精力。

arXiv AI/10月1日 01:34
80
05

论文不能只看价目表选服务商:面向开放权重模型推理的市场感知路由

筛选线索开源模型与生态大模型与推理大语言模型模型推理1 个独立信源

此前 LLM 路由主要在模型之间按静态单模型成本做选择,默认选定模型后服务商选择无关紧要。该研究指出开放权重推理市场存在被忽略的第二决策轴:同模型不同服务商的端到端表现并不同质。这使路由问题的输入从价目表转向实测状态,也意味着按价格选服务商可能同时损失质量和可用性。

arXiv AI/9月29日 16:02
79
06

论文AI 评估沙箱配置器:支持 AI 监管沙箱技术评估的框架

筛选线索开源模型与生态AI 主题人工智能1 个独立信源

欧盟 AI Act 要求各成员国在 2027 年 8 月前建立 AI 监管沙箱,此前测试工具生态分散,输出难以比较、追溯与复用。该框架把评估工具、数据模型与报告结构化,为跨成员国沙箱的可比性和可复用性提供基础设施雏形。

arXiv AI/10月1日 12:10
79
07

论文用 AI agent 驱动流行病模型:Epydemix Agent Framework

筛选线索开源模型与生态Agent 智能体AI 主题人工智能1 个独立信源

此前 LLM agent 接入科学软件多是零散的自然语言包装,可靠性依赖偶然。该框架把发现、验证、执行和检查拆成固定步骤并保留输出包,使 agent 建模过程可审计、可复现,同时给出 50 次会话的对照评估,而非仅演示单次成功案例。

arXiv AI/9月23日 18:31
79
08

论文别读日志:执行轨迹污染视频生成智能体的验证器

筛选线索多模态开源模型与生态模型家族大语言模型1 个独立信源

此前评测多关注生成质量与提示词,而这份证据指出评测环节本身会被与被测画面无关的文本带偏。仅凭“工具调用成功”的日志,就能让开源评审模型大规模放行明显失败的片段,说明自动验证结果在闭环系统中可能不具备可信度。

arXiv AI/9月23日 10:53
79
09

论文Agentic-SQL再审视:基于自主性的分类法与LLM文本转SQL经验基准分析

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

该研究改变了LLM文本到SQL领域的评估方式。此前跨系统比较因异质基准和协议而脆弱,难以客观判断模型优劣。此研究提供统一的自主性轴和排行榜聚合方法,有助于更透明地比较不同系统,为产品选型和技术演进提供更可靠的参考依据。

arXiv AI/8月15日 19:40
79
10

论文面向AI友好的制图学:颜色设计如何影响基础模型在顺序等值区域图上的空间推理

筛选线索多模态开源模型与生态AI 主题基础模型1 个独立信源

此前制图原则主要基于人类感知设计,但机器感知可能与人类不同。该研究首次系统评估了颜色设计对基础模型空间推理的影响,发现顺序排序和对比度对机器理解依然重要,为未来针对AI优化的制图设计提供了实证依据。

arXiv AI/8月16日 13:24
79
11

论文面向做运筹优化的 AI:在 OSCAR 框架内沿阶梯路由大模型

筛选线索开源模型与生态AI 编码AI 主题模型家族1 个独立信源

此前大模型做优化建模,往往只保证可行或看似合规,却可能把约束和目标写错,求解器于是对错误问题给出最优解。该工作把重点从“可行”转向“可认证的改进”,并给出成本与能力的分配规则,同时支持本地部署。

arXiv AI/10月1日 01:43
78
12

论文AgentJudgeBench:评估 LLM 法官在代理工具调用中的多难度基准

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前 LLM-as-a-judge 的研究多集中于开放式文本或偏好评估,未深入依赖关系驱动的工作流。本基准首次系统关注代理工具调用场景,揭示了任务难度主导的评估上限,且规模无法解决,提示构建可靠代理评估系统需超越模型扩展。

arXiv AI/8月27日 05:20
78
13

论文RankEvolve:面向排序模型演化的可靠多智能体自动研究框架

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前自动研究智能体的瓶颈多被视为模型能力,而该工作把长周期实验中的执行准确性作为核心约束,指出数据泄漏、漏归一化、梯度断开、训练评估标志未接等问题会静默污染昂贵运行。它用状态机与多产品互审把执行可靠性变成可度量指标,并给出预算匹配下的准确率提升,说明自动研究流程的竞争点正从生成想法转向可靠执行。

arXiv AI/9月30日 11:50
78
14

论文Ascribe:面向泰语临床 SOAP 病历生成的原子事实与重要性推理

筛选线索开源模型与生态大模型与推理模型家族大语言模型1 个独立信源

此前临床摘要的推理方法常遗漏关键临床信息并生成无依据内容,泰语又因缺少公开数据集而进展受限。该工作同时给出可复用的推理框架与真实就诊基准,改变的是评估与训练数据的可得性,而非单纯提升通用模型能力。

arXiv AI/10月1日 07:35
78
15

论文UniK:面向数字与物理 AI 的通用知识感知平台

筛选线索开源模型与生态AI 主题模型家族1 个独立信源

此前数字 AI 与 physical AI 通常各自建设数据与检索管线,私有异构知识难以可靠接入。该工作提出用同一套知识生命周期基础设施同时服务两类系统,并在多个领域报告了无需微调即可接近或超过更大专有模型的结果,若可复现将改变知识层的构建假设。

arXiv AI/9月21日 00:56
78
16

论文Hunyuan-A13B 技术报告:开源混合专家模型

筛选线索开源模型与生态大模型与推理大语言模型推理能力1 个独立信源

此前开源模型往往在参数规模、推理成本与能力之间难以兼顾。Hunyuan-A13B 以 800 亿总参数、130 亿激活参数的形式公开,并给出接近更大模型的多任务评测结果,意味着中等规模开源模型在延迟敏感场景中的可用性提高,同时双模式推理为按任务复杂度分配算力提供了可参考设计。

arXiv AI/9月23日 03:21
78
17

论文SparseEngine:稀疏优先的推理引擎

筛选线索开源模型与生态Agent 智能体AI 公司大语言模型1 个独立信源

长上下文 agent 的交互历史会持续挤压 KV-cache 与注意力计算,但已有稀疏注意力方案因缓存表示和工作流异构,难以接入现有推理引擎,且既有稀疏服务抽象只覆盖特定布局。SparseEngine 试图把稀疏方法统一纳入同一服务框架,并首次提供跨请求 KV 状态复用与选择性裁剪能力。

arXiv AI/9月30日 06:05
78
18

论文当上下文变化:理解 LLM 的更新失败

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前对上下文记忆的评估多关注模型能否记住新信息,该工作把问题重新定位到“能否在回答时选用当前值”。它给出的基准、探针证据与一层 transformer 分析,使 stale binding 从现象变为可测量、可定位到 attention 层面的失败模式。

arXiv AI/9月30日 03:19
78
19

论文QATFactory:面向大模型量化感知训练与蒸馏的部署对齐框架

筛选线索开源模型与生态大模型与推理AI 公司大语言模型1 个独立信源

此前量化多依赖训练后量化(PTQ),激进压缩会损伤模型质量;该工作把量化感知训练与蒸馏、强化学习结合,并让训练结果直接落到生产推理引擎,减少转换环节,实验显示部署后质量优于强 PTQ 基线。

arXiv AI/9月30日 08:00
78
20

论文通过串联 Skill 劫持 LLM Agent

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前对 agent 的攻击多集中在单次提示注入或单个工具调用,这次展示的是跨 skill 的信任传递:上游 skill 的产物被下游当作可信依据,从而把攻击意图拆散藏在正常流程里。更关键的是,把工作流合并为单个 skill 后成功率从 84.3% 降到 17.4%,说明多 skill 串联本身放大了风险,而简单的检查文件防御会明显损害正常任务表现。

arXiv AI/10月1日 12:28
77
21

论文确定且可审计的 AI 安全风险评估框架:ATLAS 对齐可执行规则与形式化验证

筛选线索开源模型与生态安全与对齐AI 主题人工智能1 个独立信源

此前 AI 安全评估多依赖叙述性清单或评估者主观打分,结果难以复现,也难以在审计中辩护,且缺少从可观测工程产物到技术级结论的机器可评估映射。该框架把评估变成可复算、可追溯的决策函数,并给出形式化性质验证,使复评与审计具备一致性基础。

arXiv AI/10月1日 10:33
77
22

论文SEPAL:用分离专家对与答案级融合实现可靠 LLM 协作

筛选线索开源模型与生态Agent 智能体大语言模型推理能力1 个独立信源

以往多智能体协作常让多个模型共享讨论,纠错的同时也会互相传染同类错误,削弱投票所需多样性;自一致性采样虽有多样性但无反馈,单对 Actor-Critic 又只打磨一个候选。SEPAL 把角色分工与隔离反馈结合,仅在答案层融合,提供了不同于共享讨论的协作路线。

arXiv AI/9月30日 12:49
77
23

论文从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

筛选线索多模态开源模型与生态AI 主题生成式 AI1 个独立信源

该研究展示了视觉语言模型(VLMs)替代传统实地调查进行大规模街道质量评估的可行性,降低了时间和资源成本,为城市规划提供了一种高效、可扩展的诊断工具,尤其适用于郊区和大都市边缘地区。

arXiv AI/8月20日 13:34
77
24

论文基于账本控制的零样本自编排提升 LLM 编码性能

筛选线索开源模型与生态Agent 智能体模型家族大语言模型1 个独立信源

此前多智能体系统声称优于单模型,但证据混杂且对比受干扰。该研究通过严格对照,揭示提升条件性存在,并量化了成本效益,为理智选用多智能体架构提供依据。

arXiv AI/8月27日 00:11
76
25

论文多智能体评估对角色扮演语言智能体的对抗压力测试

筛选线索开源模型与生态Agent 智能体AI 主题模型家族1 个独立信源

现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。

arXiv AI/8月4日 05:54
76
26

论文LLM服务的实证研究:框架、方法与系统设计

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。

arXiv AI/8月4日 02:33
76
27

论文Taramandal-GPT:用知识检索与结构化思维提升天体力学问题求解

筛选线索开源模型与生态大模型与推理AI 主题人工智能1 个独立信源

此前 LLM 在 astronomy 与 astrodynamics 等专业领域受限于多步推理、符号运算和术语理解,效果有限。该工作把领域适配、外部知识检索与回退机制组合起来,并给出可复用的 299 题基准与双重评测口径,使专业领域小模型的可用性有了可比较的证据。

arXiv AI/9月21日 08:11
76
28

论文TelecomGPT-R1:面向异构电信任务的统一推理后训练框架

筛选线索开源模型与生态大模型与推理模型家族推理能力1 个独立信源

此前通用大模型缺少电信领域知识支撑,而电信专用模型多面向单一任务族,多任务推理能力有限。该工作用统一后训练流程同时覆盖协议、知识、建模与故障四类异构任务,并把奖励拆解为可验证推理单元,尝试让模型从可核验的电信证据中学习通用解题行为,方向与单一任务微调不同。

arXiv AI/9月21日 19:48
76
29

论文Ventor-QTest:基于威胁模型的供应商托管 LLM API 验证方法

筛选线索开源模型与生态大模型与推理AI 主题大语言模型1 个独立信源

大型语言模型生态中,第三方提供商部署开放权重模型日益普遍,但审计其推理 API 质量仍是难题。Ventor-QTest 提出一种无需目标 API 提供概率信息的黑盒审计方法,可独立评估模型保真度,填补了此领域空白。

arXiv AI/8月17日 10:41
76
30

论文RAIM:面向幻觉检测的廉价模型鲁棒聚合方法

筛选线索开源模型与生态大模型与推理模型家族大语言模型1 个独立信源

此前自动忠实度评估高度依赖昂贵的前沿专有模型做裁判,难以支撑高吞吐监控。该工作显示,经过合理聚合的多个小型开源裁判可在多数基准上接近前沿裁判水平,同时把主要开销从持续推理转为一次性校准,为大规模、低成本的幻觉监测提供了可量化的替代路径。

arXiv AI/9月30日 08:03
76
当前展示各类别评分靠前的 30 条,共 286 条