- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月30日 17:34
- 状态
- 单一信源
发生了什么
FrontisAI 发布论文,介绍 AI4AI 模型 Frontis-MA1(35B),在开放的 OpenMLE 全栈系统上,通过执行反馈的 SFT 和 RL 训练,结合进化搜索,使 MLE-Bench Lite 的 Medal Average 从 39.39% 提升至 60.61%,在 OpenMLE-Evo-Max 下达到 71.21%,超过 GPT-5.5+Codex,接近 GPT-5.6 Sol 和 Kimi K3。模型和代码已开源。
为什么重要
该工作将递归自我改进从概念推进到可执行系统:开放全栈 OpenMLE 支持训练、验证和进化,且模型性能在标准基准上显著提升,并超越 GPT-5.5+Codex,接近更大规模模型。这为 AI 自我改进提供了可复现的工程路径,可能加速 AI 研发效率。
底层逻辑
其机制是将机器学习工程分解为四个原子程序进化算子(Draft、Improve、Debug、Crossover),通过执行反馈的训练使模型掌握这些算子,然后用长时程搜索组合算子,形成学习与进化耦合的循环。OpenMLE-Evo-Max 使用独立于基准的经验先验和异步搜索以增强探索。
产品与商业机会
该技术可能降低 AI 模型的优化成本:用单个 35B 模型在单卡 RTX 4090(12GB 显存)上即可大幅提升代码生成性能,避免依赖更大规模模型。对产品研发而言,可加速模型迭代和自动化调试,但对硬件资源和训练框架有较高要求。
- 评估将 OpenMLE-Evo 集成到内部 ML 流水线,以自动化模型调优和代码改进。
- 基于 Frontis-MA1 构建 MLE 辅助工具,面向开发者提供自动调试和代码优化建议。
- 探索将 OpenMLE-Gym 用于内部模型的回归测试和验证环境。
- 研究将原子算子复用于特定领域(如数据处理)的自动化优化。
仍待确认
- OpenMLE 和 Frontis-MA1 在实际业务系统中的稳定性与泛化性尚未验证。
- 该技术对计算资源的要求是否在一般团队可负担范围内尚不明确。
- 训练数据的去重细节和基准泄漏风险未完全披露。
- 相比 GPT-5.6 Sol 和 Kimi K3 的差距,在更广泛任务上的表现是否一致未证实。