- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月24日 11:45
- 状态
- 单一信源
发生了什么
论文提出 Rufus-Air,一个在 GLM-4.5-Air-Base(106B-A12B)上可复现的开源后训练方案,由 SFT、Reasoning RL、Coding RL、指令遵循 RL、通用 Agent、Coding Agent、Search Agent、RLHF 八个阶段串行组成。作者公开了数据、奖励设计、基础设施、阶段顺序与分阶段结果,未使用新的人工标注或内部蒸馏教师,并称其效果优于官方 GLM-4.5-Air 后训练版本,且与同规模开源模型相当。
为什么重要
以往后训练细节多被厂商保留,外部难以复现。该工作把八阶段流程、奖励设计和基础设施一并公开,并给出相较官方后训练版本的改进结果,使后训练从内部经验变为可被外部检查和复用的工程流程。
底层逻辑
方案按能力由基础到高级推进,奖励信号从可验证的硬奖励逐步过渡到基于评判的软信号;高质量多样化 SFT 抬高能力下限,难度过滤把 RL 提示控制在有效学习区间,奖励可靠性则决定阶段排序。工程与基础设施选择被视为方案本身而非实现细节。
产品与商业机会
团队可参照其阶段划分和奖励设计规划自身后训练流程,减少从零摸索的试错成本;公开的数据与基础设施说明有助于评估算力与工程投入,并根据奖励可靠性安排各能力阶段的上线顺序。
- 按 Rufus-Air 的八阶段顺序搭建内部后训练流水线,先固定 SFT 与难度过滤环节
- 针对自有业务建立奖励可靠性评估,用它决定各 RL 阶段的先后与取舍
- 复用其公开数据与开源组件,验证能否在不新增人工标注的前提下提升模型表现
- 将基础设施与工程配置纳入后训练方案文档,作为可复现交付的一部分
仍待确认
- 八个阶段各自的完整超参与数据配比是否足以让第三方完全复现
- 在没有内部蒸馏教师的情况下,该方法在更大或更小模型上的效果是否保持
- 与官方 GLM-4.5-Air 后训练版本的对比评测范围与具体指标尚未明确
- 公开数据的许可与商用限制是否会限制企业直接复用该方案