AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

图像生成

覆盖文生图、图像编辑与视觉创作工具,重点关注可控性、质量和生产效率。

全部 Story
55
近 7 天
5
当前结果
34
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文LLM unbranding:在保留通用能力的同时消除商业品牌身份

筛选线索图像生成大模型与推理大语言模型模型推理1 个独立信源

此前品牌合规主要关注图像生成中的视觉标识去除,文本层面的品牌身份管理缺乏正式定义和评测基准。这篇论文把“文本 trade dress”作为可度量对象,说明现有机器遗忘方法无法胜任细粒度的品牌特征消除,并给出不改参数、只在推理阶段干预的替代路径,使品牌方和模型方有了可对比的评测基线。

arXiv AI/9月29日 09:33
74
02

论文关注推理中真正重要的部分:通过选择性概率质量集中对齐跨模态注意力

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前改进多模态推理多依赖推理过程监督或推理时策略,而该工作提出一种互补路径:不直接监督推理过程,只通过选择性正则化少量视觉接地相关注意力头来增强隐式视觉 grounding,为提升推理能力提供了更稀疏、更聚焦的训练信号。

arXiv AI/9月24日 15:05
74
03

论文Boogu-Image-0.1:提升开源统一多模态理解与生成能力

筛选线索图像生成多模态模型家族智能体1 个独立信源

此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。

arXiv AI/7月14日 17:52
73
04

论文Uni-LaDiR:用潜在扩散统一多模态推理

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前的多模态推理多把各模态的 thought tokens 直接拼接在同一序列中,模型需自行弥合表示差异。该工作改为在共享潜在空间中生成推理块,为多模态推理和机器人操作提供了一种统一表示与生成路径,并报告了跨 11 个 VLM 基准与 2 个 VLA 套件的相对提升。

arXiv AI/9月17日 08:28
73
05

论文PrismGPT:代理引导学习实现区域感知修图与自合成推理

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前自动化修图方法只能部分覆盖“全局调整加局部语义掩码编辑”的专业流程,且常依赖商业黑盒工具;该工作把全局与局部诊断、编辑参数预测统一到一个可自训练的 VLM 框架内,并以约 6% 训练数据达到 SOTA,降低了对外部强教师模型与大规模标注的依赖。

arXiv AI/9月21日 15:35
73
06

论文ShieldCLIP:面向多模态基础模型有害内容的选择性安全对齐

筛选线索图像生成多模态多模态向量检索1 个独立信源

此前安全对齐往往把生成样本整体标记为不安全,即使其中某一模态本身安全,会误伤正常表征。ShieldCLIP 改以逐模态安全状态为条件,试图在抑制有害关联的同时不破坏原有嵌入效用,把安全与可用性的权衡从样本级细化到模态级。

arXiv AI/9月30日 13:14
72
07

论文与 agentic「teammate」共事:新组织行动者如何碰撞人类工作生态

筛选线索图像生成Agent 智能体AI 主题智能体1 个独立信源

此前企业 AI 多被当作单用户、被动响应的工具,而该研究记录的是持续在线、主动参与多用户协作的 agent 进入真实团队。它把关注点从模型能力转向组织后果:协作默契、关系边界和信任分配的重新协商,这在此前多为猜测而非实证。

arXiv AI/9月24日 14:44
72
08

论文Uranus:面向具身智能的下一代仿真基础设施

筛选线索图像生成开源模型与生态AI 主题模型推理1 个独立信源

传统模拟器依赖人工建模,成本高,真实交互又昂贵。Uranus 用数据驱动的生成式方案替代手工构建,且不设固定时域、可在线接收轨迹,把仿真从静态环境搭建转向可流式驱动的生成过程,并开源权重降低社区使用门槛。

arXiv AI/9月21日 16:06
71
09

论文用可渲染程序实现多模态思考

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前视觉语言模型主要把图像当作输入来理解,图像难以进入推理链;Omnimodal 模型虽统一文本与图像生成,但依赖栅格化或隐表示,过程不可追踪。SVGLM 把图像改为可读、可编辑的 SVG 代码参与推理,使图像生成步骤可解释、可检查,为数字域智能体提供新路径。

arXiv AI/9月24日 17:03
71
10

论文循环扩散 Transformer:固定参数下增加计算深度

筛选线索图像生成大模型与推理推理能力模型推理1 个独立信源

此前提升文生图质量主要依赖扩大模型规模或增加去噪步数,两者都直接抬高训练与推理成本。该工作给出第三条路径:不增加参数、不增加推理预算,而是把计算重复投入共享块。若结果可复现,模型规模与质量之间的传统换算关系会被改写,小模型在同等算力下可能获得更高画质。

arXiv AI/9月30日 17:52
71
11

论文主动式人工智能:面向复杂系统的决策中心架构

筛选线索图像生成AI 主题人工智能1 个独立信源

该论文提出将 AI 从模型能力转向系统感知行动的框架,关注真实商业与工业场景中的可靠性、可行性、韧性与责任性,为 AI 在复杂系统的落地提供了新的组织化思路,可能影响企业级 AI 架构设计。

arXiv AI/8月4日 10:06
70
12

论文射频卷积神经网络:复用无线通信硬件做 CNN 推理

筛选线索图像生成AI 主题人工智能1 个独立信源

此前边缘 AI 多依赖新增数字加速器,而手机、可穿戴设备和无人机本就受尺寸、重量、功耗、成本限制。该工作改为复用设备已有的射频混频器执行卷积,不再额外增加计算硬件,并在能耗上比外挂数字处理器低约两个数量级,指向用已部署无线基础设施承载 AI 推理的路径。

arXiv AI/9月16日 18:00
70
13

论文AtumAI:用于数据中心控制平面策略智能体生成的原则性框架

筛选线索图像生成Agent 智能体AI 主题大语言模型1 个独立信源

此前数据中心控制平面策略设计依赖人工且耗时数月,现役智能体 AI 在正式性、可迁移性和系统性上存在不足。AtumAI 提出将这一过程自动化并形式化,有望显著缩短策略设计周期,提升数据中心运营效率。

arXiv AI/8月3日 17:45
69
14

论文自动困难样本合成与多级智能体数据筛选

筛选线索图像生成多模态大语言模型智能体1 个独立信源

传统主动学习和人工标注在面对复杂新型多模态威胁时难以规模化,该框架完全自动化地合成边界样本,无需人类参与即可显著提升模型鲁棒性,代表内容安全防护从人工审查向自主红队测试的转变。

arXiv AI/7月15日 18:13
68
15

论文SymbOmni:通过符号概念学习进化代理式全模态模型

筛选线索图像生成多模态模型家族推理能力1 个独立信源

传统多模态模型每次任务都从零推理,无法积累知识。SymbOmni通过符号概念学习实现了知识的累积与重用,解决了“永久新手”问题,标志着从静态知识到运行时持续进化的范式转变。

arXiv AI/7月13日 18:00
67
16

论文使用大语言模型智能体对概念擦除进行压力测试

筛选线索图像生成Agent 智能体AI 主题大语言模型1 个独立信源

此前概念擦除评估采用静态预定义方法,难以覆盖多样自然语言探测和挑战条件下的漏洞。STACE通过自适应假设搜索,由智能体迭代生成并验证测试,系统性扩展了失败模式覆盖,为可信AI部署提供了更有效的验证手段。

arXiv AI/7月20日 12:38
67
17

论文统一具身合成与世界基础模型:小米机器人U0

筛选线索图像生成多模态模型家族基础模型1 个独立信源

过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。

arXiv AI/7月13日 14:57
66
18

论文LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

筛选线索图像生成多模态智能体多模态1 个独立信源

此前视频扩散模型随机性强、难以精确控制,长时段场景易在观感、交互和时间一致性上漂移;智能体视觉创作虽提供显式参考与可编辑状态,却难保证对象与角色保真度。该工作尝试把两者放入同一模型,用统一条件组合替代重复采样。

Hugging Face Daily Papers/9月15日 00:00
65
19

论文LLaDA-Image:以完全开放的训练配方构建强大图像生成器

筛选线索图像生成多模态模型家族多模态1 个独立信源

该模型在 Qwen-Image-Bench 上取得开源模型最佳成绩,且完全公开权重、代码和训练细节,降低了复现门槛,便于开发者在其基础上定制,可能推动图像生成领域的开放研究。

Hugging Face Daily Papers/9月4日 00:00
65
20

论文当组合不成立:人类识别AI生成图像缺陷的研究

筛选线索图像生成AI 主题模型家族1 个独立信源

此前文生图模型在复杂组合场景下的缺陷缺乏系统性量化数据,该研究提供了可复用的缺陷标注数据集(CO-AID),并证明了其可用于缺陷预测与生成优化,为改进模型组合能力提供了数据基础。

arXiv AI/8月26日 15:47
65
21

论文基础模型条件化的扩散模型用于降水降尺度

筛选线索图像生成大模型与推理AI 主题基础模型1 个独立信源

此前AI降尺度方法多侧重于精度指标,往往牺牲极端事件的分布真实感。本研究系统对比了三种条件化策略,揭示了扩散模型在降水降尺度中条件化机制的影响,发现基础模型条件化能显著改善极端降水捕捉,为气候影响评估提供更可靠的降水数据。

arXiv AI/8月26日 14:30
65
22

论文Mage-Flow:一种高效的原生分辨率图像生成与编辑基础模型

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前大模型生成与编辑需高算力成本、训练部署困难。Mage-Flow在同等规模下显著降低分词与训练开销,Turbo变体实现亚秒级高分辨率生成,使交互式实时图像编辑变得实用,降低了高质量生成模型的准入壁垒。

arXiv AI/7月21日 12:55
64
23

论文无辜画面,仇恨故事:多轮视觉故事生成中仇恨意图的评估与检测

筛选线索图像生成多模态模型家族推理能力1 个独立信源

此前研究只关注单张图像的仇恨内容,忽略多张图像组合产生的群体级仇恨含义。前沿 T2I 系统支持跨轮一致的角色和场景,使得大规模制作仇恨视觉故事变得廉价,而现有审核工具对此类内容几乎失效,凸显新的安全漏洞。

arXiv AI/8月5日 08:56
64
24

论文EviRank:基于结构化相关性证据的多模态图像重排序

筛选线索图像生成多模态多模态向量检索1 个独立信源

此前重排序器要么将多面相关性压缩为不透明嵌入,要么依赖自由链式思维,容易遗漏或幻觉细微约束。EviRank 将重排序重构为语义约束满足问题,提供结构化证据包,显著提升组合查询的准确性和可解释性。

arXiv AI/8月21日 09:04
64
25

论文CN101:面向生成式AI的数字热力学计算机

筛选线索图像生成AI 主题生成式 AI1 个独立信源

此前热力学计算依赖Langevin动力学,受限于模拟硬件。该研究将形式化方法推广到任意遍历过程,并首次在数字CMOS上实现,可能降低硬件门槛,提升精度可控性。

arXiv AI/8月1日 16:37
63
26

论文ReDiTT: 用于异步时间序列的检索增强条件扩散Transformer

筛选线索图像生成开源模型与生态模型推理检索增强1 个独立信源

相比传统时间序列预测方法,ReDiTT 通过检索历史中的类似结构序列作为生成条件,克服了长时预测中的不确定性累积问题,同时提高了样本多样性。这是扩散模型在异步时间序列上首次结合检索增强机制,为处理不规则间隔事件序列提供了新范式。

arXiv AI/7月14日 06:11
63
27

论文PosterMELD:基于多智能体的论文转海报生成,实现可控设计多样性与可编辑打印输出

筛选线索图像生成多模态智能体多模态1 个独立信源

与现有系统相比,PosterMELD将打印就绪率提升3.4至5.2倍,同时成本仅为Codex+Skill的3.5%。它解决了直接图像生成不可编辑、编码智能体工作流昂贵的问题,使生成的海报既可直接打印,又保持原生可编辑性,为学术海报自动化生成提供了更实用的方案。

arXiv AI/8月3日 13:39
63
28

论文PathAgentBench:全切片病理图像上证据寻找视觉语言模型的基准测试

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前病理基准测试多基于预裁剪补丁或预提取特征,无法评估模型从千兆像素原图中自主寻找证据的能力。PathAgentBench首次直接考核该能力,并揭示当前视觉语言模型在精确区域定位和自主探索方面的显著短板,为模型改进指明了关键方向。

arXiv AI/7月21日 16:33
63
29

论文视觉-语言模型供应链中通过表示引导的架构后门

筛选线索图像生成多模态多模态向量检索1 个独立信源

此前模型供应链安全主要关注数据投毒或微调阶段的后门,该研究证明攻击者无需接触训练数据或控制微调,仅通过修改架构定义就能嵌入不影响正常功能但可被触发利用的后门,大幅改变了供应链安全威胁模型,迫使产业界重新审视对第三方模型组件的信任边界。

arXiv AI/7月28日 09:12
63
30

论文通过自监督语义扩散训练类似参数的技能

筛选线索图像生成Agent 智能体大语言模型智能体1 个独立信源

此前封闭模型无法通过微调或强化学习提升专业技能,且依赖昂贵的人工标注或LLM评判。该方法无需访问权重、无需标注,利用现有高质量人类作品作为自监督信号,自动提取技能并增强专业能力,为提升闭源模型在特定领域的表现提供了新路径。

arXiv AI/7月30日 01:03
63
当前展示各类别评分靠前的 30 条,共 34 条