AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

图像生成

覆盖文生图、图像编辑与视觉创作工具,重点关注可控性、质量和生产效率。

全部 Story
55
近 7 天
5
当前结果
55
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

新闻Sean Parker 正围绕音乐重建 Stability AI

筛选线索图像生成AI 主题AI 公司1 个独立信源

Stability AI 此前以图像生成模型闻名,此次方向调整意味着公司重心可能转向音乐。更值得注意的是,Sean Parker 这次带着唱片公司的认可和资金回归,与此前科技公司绕过版权方自行训练的做法形成对比,可能改变 AI 音乐领域的合作方式。

TechCrunch AI/10月2日 21:09
71
02

产品Qwen-Image-2.1 登顶 Arena 图像编辑与文生图开源榜

筛选线索图像生成开源模型与生态模型家族发布动态1 个独立信源

通义千问宣布 Qwen-Image-2.1 在 Arena 的 Image Edit Arena 和 Text-to-Image Arena 两个榜单上均取得开源模型第一。其中 Image Edit Arena 得分 1367,位列总榜第 16,与第 15 名 GPT-Image-1.5-high-fidelity 仅差 3 分,官方同时邀请用户体验该模型。

AIHOT · X / 公众号精选/9月23日 01:24
52
03

模型Artificial Analysis 评测:Qwen-Image-2.1 在两个 AA-Image 榜单中成为排名第一的开源权重模型

筛选线索图像生成开源模型与生态模型家族模型雷达1 个独立信源

此前开源权重图像模型在两个 AA-Image 榜单上均未达到这一位置,Qwen-Image-2.1 同时超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct,说明开源权重方案在文生图与图像编辑两个维度上已进入可对比头部模型的行列,而不再只是低成本的替代选项。

AIHOT · X / 公众号精选/10月1日 22:43
65
04

论文LLM unbranding:在保留通用能力的同时消除商业品牌身份

筛选线索图像生成大模型与推理大语言模型模型推理1 个独立信源

此前品牌合规主要关注图像生成中的视觉标识去除,文本层面的品牌身份管理缺乏正式定义和评测基准。这篇论文把“文本 trade dress”作为可度量对象,说明现有机器遗忘方法无法胜任细粒度的品牌特征消除,并给出不改参数、只在推理阶段干预的替代路径,使品牌方和模型方有了可对比的评测基线。

arXiv AI/9月29日 09:33
74
05

文章Show HN:Wallstreetclaws.com,可创建交易用 AI Agent

筛选线索图像生成Agent 智能体AI 主题大语言模型1 个独立信源

此前个人做 AI 交易策略通常需要自行拼装数据、回测和下单环节,该平台把 LLM 代理与量化规则策略放进同一套创建、回测和排行榜体系,并打通 Robinhood 账户,降低了从想法到可运行交易代理的门槛,也把策略表现公开比较变成平台内建功能。

Hacker News AI/9月25日 22:37
52
06

产品Qwen-Image-2.1 支持 ComfyUI 并开放权重下载

筛选线索图像生成开源模型与生态模型家族发布动态1 个独立信源

Qwen 宣布 Qwen-Image-2.1 已支持 ComfyUI,并开放权重下载。该版本用单个 7B checkpoint 同时承担图像生成与图像编辑,支持原生 2K 生成,单次最多可基于 10 张参考图做指令编辑,并输出含 alpha 通道的 RGBA 图像。

AIHOT · X / 公众号精选/9月20日 13:52
50
07

模型通义千问发布 Qwen-Image-2.1:7B 单检查点兼顾图像生成与编辑

筛选线索图像生成大模型与推理AI 公司模型家族1 个独立信源

此前图像生成与编辑通常需要分别部署模型或检查点,Qwen-Image-2.1 将两类能力合并到 7B 单检查点中,并支持最多 10 张参考图,意味着生成与编辑可以在同一模型内完成,模型部署和调用链路可能因此简化。

AIHOT · X / 公众号精选/9月21日 02:50
65
08

论文关注推理中真正重要的部分:通过选择性概率质量集中对齐跨模态注意力

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前改进多模态推理多依赖推理过程监督或推理时策略,而该工作提出一种互补路径:不直接监督推理过程,只通过选择性正则化少量视觉接地相关注意力头来增强隐式视觉 grounding,为提升推理能力提供了更稀疏、更聚焦的训练信号。

arXiv AI/9月24日 15:05
74
09

文章OpenAI 在 API 中推出 GPT-Image-2.5 模型

筛选线索图像生成模型家族发布动态1 个独立信源

GPT-Image-2.5 是图像生成能力的显著升级,新增了专门提升速度和细节的模型选项,并原生支持透明背景,这为开发者提供了更精细的控制和更高效的图像生成选择,可能改变图像类应用的性能基准和设计流程。

YouTube · OpenAI/9月8日 19:11
49
10

产品Qwen-Image-3.0 发布:高分辨率生成低至 0.03 美元

筛选线索图像生成模型家族发布动态1 个独立信源

阿里巴巴发布 Qwen-Image-3.0 图像生成模型,已可投入生产使用。该模型支持 4.5K token 输入,实现 100% 以上文本准确率且无破损 logo,原生支持 12 种语言,并提供灵活定价,高分辨率生成成本低至 0.03 美元。产品可通过 Model Studio 和 Qwen Cloud 平台访问。

AIHOT · X / 公众号精选/8月6日 06:12
36
11

模型Qwen-Image-3.0-Pro 上线 Qwen Cloud

筛选线索图像生成模型家族模型雷达1 个独立信源

Qwen-Image-3.0 发布并上线云平台,标志着阿里在文生图领域达到中国领先、国际主流水准,且提供 API 定价,意味着开发者可直接使用该能力,推动应用落地。

AIHOT · X / 公众号精选/8月5日 02:40
49
12

论文Boogu-Image-0.1:提升开源统一多模态理解与生成能力

筛选线索图像生成多模态模型家族智能体1 个独立信源

此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。

arXiv AI/7月14日 17:52
73
13

新闻Black Forest Labs 发布 FLUX 3 Action 开源机器人 AI 模型

筛选线索图像生成开源模型与生态AI 主题评测基准1 个独立信源

此前 Black Forest Labs 主要以图像生成模型为人所知,此次是其首次进入机器人领域,并且选择开源路线。70 亿参数的规模配合速度优势,意味着机器人动作模型可能在更小算力条件下达到基准领先水平,竞争维度从单纯精度转向精度与推理速度的平衡。

The Decoder AI News/9月24日 17:01
42
14

模型OpenRouter 上线 FLUX 3 Video 统一多模态模型

筛选线索图像生成多模态AI 主题模型雷达1 个独立信源

此前多模态模型多针对单模态或简单组合,此次 FLUX 3 Video 在 OpenRouter 平台向所有人开放,提供一个基础上同时覆盖视频、音频、图像和动作预测的统一模型家族,降低了多模态应用开发的接入门槛。

AIHOT · X / 公众号精选/8月4日 17:54
49
15

论文Uni-LaDiR:用潜在扩散统一多模态推理

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前的多模态推理多把各模态的 thought tokens 直接拼接在同一序列中,模型需自行弥合表示差异。该工作改为在共享潜在空间中生成推理块,为多模态推理和机器人操作提供了一种统一表示与生成路径,并报告了跨 11 个 VLM 基准与 2 个 VLA 套件的相对提升。

arXiv AI/9月17日 08:28
73
16

新闻Adobe Firefly 新增 AI 音频工具及 Google Gemini Omni Flash

筛选线索图像生成多模态AI 主题模型家族1 个独立信源

此前 Firefly 主要聚焦图像生成,此次将能力扩展至音频领域,并整合 Google 的 Gemini Omni Flash,意味着创作者可以在 Firefly 内部完成更多模态的生成任务,工作流更集中,也显示 Adobe 与 Google 在生成式 AI 上的合作加深。

The Decoder AI News/8月20日 19:29
41
17

模型商汤开源 SenseNova U1:统一推理与图像生成

筛选线索图像生成多模态模型雷达1 个独立信源

以往推理与图像生成通常由不同模型或流程完成,SenseNova U1 将两者统一,可能简化多模态任务的处理方式,降低集成复杂性,并提高内容生成的连贯性。

AIHOT · X / 公众号精选/8月4日 15:46
49
18

论文PrismGPT:代理引导学习实现区域感知修图与自合成推理

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前自动化修图方法只能部分覆盖“全局调整加局部语义掩码编辑”的专业流程,且常依赖商业黑盒工具;该工作把全局与局部诊断、编辑参数预测统一到一个可自训练的 VLM 框架内,并以约 6% 训练数据达到 SOTA,降低了对外部强教师模型与大规模标注的依赖。

arXiv AI/9月21日 15:35
73
19

新闻Stable Diffusion 开发商 Stability AI 获 7600 万美元新融资

筛选线索图像生成AI 主题AI 公司1 个独立信源

这笔融资使 Stability AI 累计融资额从之前的水平提升至 2.32 亿美元,表明投资者在生成式 AI 领域持续投入,为该公司进一步开发图像生成模型提供资金支持。

TechCrunch AI/8月25日 19:03
40
20

论文ShieldCLIP:面向多模态基础模型有害内容的选择性安全对齐

筛选线索图像生成多模态多模态向量检索1 个独立信源

此前安全对齐往往把生成样本整体标记为不安全,即使其中某一模态本身安全,会误伤正常表征。ShieldCLIP 改以逐模态安全状态为条件,试图在抑制有害关联的同时不破坏原有嵌入效用,把安全与可用性的权衡从样本级细化到模态级。

arXiv AI/9月30日 13:14
72
21

新闻xAI 的 Imagine Image 2.0 在 Arena 基准测试中紧随 OpenAI 的 GPT-Image-2 之后

筛选线索图像生成AI 公司模型家族1 个独立信源

此次发布表明 xAI 在图像生成领域进入顶级行列,与 OpenAI 的最强模型差距缩小。新编辑工具和模板针对实际工作流,可能提升 Grok 的竞争力。

The Decoder AI News/8月8日 08:22
40
22

论文与 agentic「teammate」共事:新组织行动者如何碰撞人类工作生态

筛选线索图像生成Agent 智能体AI 主题智能体1 个独立信源

此前企业 AI 多被当作单用户、被动响应的工具,而该研究记录的是持续在线、主动参与多用户协作的 agent 进入真实团队。它把关注点从模型能力转向组织后果:协作默契、关系边界和信任分配的重新协商,这在此前多为猜测而非实证。

arXiv AI/9月24日 14:44
72
23

新闻阿里开源 Qwen-Image-2.1,70 亿参数宣称在图像生成上超越闭源模型

筛选线索图像生成开源模型与生态模型家族发布动态1 个独立信源

此前的图像生成竞争多由闭源大模型主导,而这次是开源权重模型在参数量较小的前提下宣称达到更强效果,并把多参考图编辑与透明通道等能力下放到消费级 GPU 可运行的范围,开源与闭源之间的能力差距被进一步压缩。

The Decoder AI News/9月20日 16:10
39
24

论文Uranus:面向具身智能的下一代仿真基础设施

筛选线索图像生成开源模型与生态AI 主题模型推理1 个独立信源

传统模拟器依赖人工建模,成本高,真实交互又昂贵。Uranus 用数据驱动的生成式方案替代手工构建,且不设固定时域、可在线接收轨迹,把仿真从静态环境搭建转向可流式驱动的生成过程,并开源权重降低社区使用门槛。

arXiv AI/9月21日 16:06
71
25

新闻OpenAI 的 GPT-Image-2 新增无背景图像生成功能

筛选线索图像生成AI 公司模型家族1 个独立信源

此前生成图片后需额外进行背景移除,现在生成时即可获得透明背景,简化了流程,提高了效率,并可能影响图像编辑工具的市场格局。

The Decoder AI News/8月21日 07:53
38
26

论文用可渲染程序实现多模态思考

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前视觉语言模型主要把图像当作输入来理解,图像难以进入推理链;Omnimodal 模型虽统一文本与图像生成,但依赖栅格化或隐表示,过程不可追踪。SVGLM 把图像改为可读、可编辑的 SVG 代码参与推理,使图像生成步骤可解释、可检查,为数字域智能体提供新路径。

arXiv AI/9月24日 17:03
71
27

新闻Flux 3可生成20秒带原生音频视频,Black Forest Labs首次实现

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。

The Decoder AI News/7月23日 18:03
38
28

论文循环扩散 Transformer:固定参数下增加计算深度

筛选线索图像生成大模型与推理推理能力模型推理1 个独立信源

此前提升文生图质量主要依赖扩大模型规模或增加去噪步数,两者都直接抬高训练与推理成本。该工作给出第三条路径:不增加参数、不增加推理预算,而是把计算重复投入共享块。若结果可复现,模型规模与质量之间的传统换算关系会被改写,小模型在同等算力下可能获得更高画质。

arXiv AI/9月30日 17:52
71
29

新闻Google Vids 新增个性化 AI 头像,用户可创建自己的数字分身视频

筛选线索图像生成AI 视频AI 主题模型家族1 个独立信源

此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。

TechCrunch AI/7月16日 18:32
37
30

论文主动式人工智能:面向复杂系统的决策中心架构

筛选线索图像生成AI 主题人工智能1 个独立信源

该论文提出将 AI 从模型能力转向系统感知行动的框架,关注真实商业与工业场景中的可靠性、可行性、韧性与责任性,为 AI 在复杂系统的落地提供了新的组织化思路,可能影响企业级 AI 架构设计。

arXiv AI/8月4日 10:06
70
当前展示各类别评分靠前的 30 条,共 55 条