新闻Sean Parker 正围绕音乐重建 Stability AI
Stability AI 此前以图像生成模型闻名,此次方向调整意味着公司重心可能转向音乐。更值得注意的是,Sean Parker 这次带着唱片公司的认可和资金回归,与此前科技公司绕过版权方自行训练的做法形成对比,可能改变 AI 音乐领域的合作方式。
TOPIC · CURATED VIEW
覆盖文生图、图像编辑与视觉创作工具,重点关注可控性、质量和生产效率。
Stability AI 此前以图像生成模型闻名,此次方向调整意味着公司重心可能转向音乐。更值得注意的是,Sean Parker 这次带着唱片公司的认可和资金回归,与此前科技公司绕过版权方自行训练的做法形成对比,可能改变 AI 音乐领域的合作方式。
此前 Black Forest Labs 主要以图像生成模型为人所知,此次是其首次进入机器人领域,并且选择开源路线。70 亿参数的规模配合速度优势,意味着机器人动作模型可能在更小算力条件下达到基准领先水平,竞争维度从单纯精度转向精度与推理速度的平衡。
此前 Firefly 主要聚焦图像生成,此次将能力扩展至音频领域,并整合 Google 的 Gemini Omni Flash,意味着创作者可以在 Firefly 内部完成更多模态的生成任务,工作流更集中,也显示 Adobe 与 Google 在生成式 AI 上的合作加深。
这笔融资使 Stability AI 累计融资额从之前的水平提升至 2.32 亿美元,表明投资者在生成式 AI 领域持续投入,为该公司进一步开发图像生成模型提供资金支持。
此次发布表明 xAI 在图像生成领域进入顶级行列,与 OpenAI 的最强模型差距缩小。新编辑工具和模板针对实际工作流,可能提升 Grok 的竞争力。
此前的图像生成竞争多由闭源大模型主导,而这次是开源权重模型在参数量较小的前提下宣称达到更强效果,并把多参考图编辑与透明通道等能力下放到消费级 GPU 可运行的范围,开源与闭源之间的能力差距被进一步压缩。
此前生成图片后需额外进行背景移除,现在生成时即可获得透明背景,简化了流程,提高了效率,并可能影响图像编辑工具的市场格局。
此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。
此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。
此前,高质量人类行为数据多被各家公司私有,成为物理AI发展的瓶颈。光轮智能此次开源全球最大规模的全标注第一人称数据集,首次将具身智能最昂贵的资产公开,为行业提供了可复用的训练资源,可能加速机器人模型的发展,并验证了人类数据作为物理AI关键资源的趋势。