arXiv AI71
一篇 arXiv 论文提出面向可信 AI 的统一评估框架,覆盖 LLM、agentic 系统与多模态模型。框架用能力、鲁棒性、安全、公平、透明、治理、监督、效率八个维度,把输出级、轨迹级和跨模态评估串联起来,在保留各系统自有指标的同时映射到统一性能区间,并附不确定性估计与可追溯证据,另设元评估层检验评估本身的有效性与可复现性。
为什么值得看此前评估多依赖单一 benchmark 分数,难以反映 agent 轨迹、多模态输出与安全失效。该框架把评估对象从结果扩展到过程与证据可信度,并主张安全关键项可覆盖聚合分数,避免平均分掩盖严重问题,同时对接治理框架与国际标准、欧盟监管要求。
arXiv AI69
一项基于 12 门 AI 相关课程、118 名学生问卷的研究发现,学生对生成式 AI 的使用和感知存在分化:高使用群体报告收益较多,轻度使用者依赖和收益都较少,中度使用群体收益水平不一。付费与免费版本、单工具与多工具、不同教师政策之间差异显著。回归显示,学业收益与早期依赖和任务支持相关,正面影响与认知依赖、任务支持、可靠性信心和教师政策相关,负面影响与早期依赖和态度变化相关;评估素养越高,早期依赖与负面影响的关联越强。
为什么值得看此前关于生成式 AI 教育影响的讨论多集中在“有用还是有害”的二元判断,这项研究把课程情境、依赖程度、评估素养和教师政策同时纳入,指出同一工具在不同学生群体和课程政策下产生不均等结果。这意味着教育机构不能只关注是否允许使用 AI,而需要区分谁在用、怎么用、课程如何规范,否则可能放大而非缩小学习差距。
arXiv AI66
一篇 arXiv 论文提出 DASE 查询引擎,用于面向 AI agent 数据工程流程的多步推理检索。该引擎包含基于结构化谓词、多向量与关系链的查询模型、面向稀疏近邻对的物化索引 SemJI,以及结合 ANN 遍历、批量访问与阈值分数聚合的执行层。在科学发现类负载上,DASE 在召回率相当的情况下比 RDBMS、重排与向量数据库基线快 6 至 46 倍;在 SemBench E-Commerce 上,它将 BigQuery 质量从 0.67 提升到 0.80,成本从 2.42 美元降到 0.54 美元。
为什么值得看此前多步推理检索通常把多属性过滤、向量搜索、关系连接与相似度连接拆成多个系统串联执行,容易在召回与成本之间取舍。该工作把这些操作收敛到一个查询模型与执行层中,并给出科学发现和电商语义算子场景下的速度、质量与成本对照,说明检索预过滤可能成为降低下游 LLM 调用成本的独立优化环节。
arXiv AI63
这篇 arXiv 论文提出 A-RAM 框架,将用户意图与零件文件转化为可追溯、可执行的机器人增材制造工艺规划。LLM 负责解读制造目标与约束,并生成受 schema 限制的请求,确定性 Planning Agent 据此实例化搜索流程,领域工具计算切片、摆放、逆运动学、轨迹时间、Joint-6 jerk 与挤出等量化证据。在六轴机械臂 AM 单元上,通过三个案例研究进行评估,所选方案相比最差候选集最多降低 53.5% 的最大 Joint-6 jerk,平均绝对 Joint-6 jerk 降低 48.3%。
为什么值得看现有切片工具、基于 LLM 的决策辅助与数字孪生系统,无法在执行前对切片决策、零件朝向和工作空间摆放等耦合变量做集成评估。该工作把 LLM 意图理解与确定性规划搜索和运动学量化工具连接起来,使机器人相关可行性在打印前即可被检验,而不再只在零件坐标系里判断方案优劣。
arXiv AI61
一篇 arXiv 论文提出 On-Demand Attention(ODA):作者发现预训练模型的解码状态在全局读取之前,已包含可预测该读取收益的信息;据此设计轻量 recall head,在生成过程中按预测收益选择性触发全局注意力。该方法只训练 recall head,不改动预训练权重,并在 vLLM 中实现 GPU 端条件执行,从而把减少的全局读取转化为长上下文下的解码加速。
为什么值得看此前长上下文解码通常每一步都读取不断增长的历史,局部注意力虽省算力但会损失性能。该工作把“是否读取全局历史”交给模型自身状态判断,在不改预训练权重的前提下尝试同时保留性能并降低全局读取,为长上下文推理提供了一种新的取舍方式。