- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年9月30日 12:30
- 状态
- 单一信源
01
发生了什么
蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B,每 Token 激活约 25B,上下文窗口上限为 1M。该模型延续混合线性架构,并提高线性 Attention 层比例,采用 7 层 KDA 配 1 层 Gated MLA,以及 512 个路由专家选 8 个加 1 个共享专家的设计,定位面向真实世界长任务。
02
为什么重要
该模型将上下文上限拉到 1M,同时以约 560B 总参数、约 25B 激活参数控制推理成本,并提高线性 Attention 层比例。这使长任务处理在容量与效率之间有了新的折中方案,值得关注其对长上下文场景的实际可用性。
03
底层逻辑
通过混合线性架构降低长序列注意力计算开销,以 KDA 与 Gated MLA 分层组合平衡表达能力和效率;MoE 结构用 512 个路由专家中激活 8 个加 1 个共享专家,在扩大总参数的同时限制每 Token 计算量,从而支持 1M 上下文。
04
产品与商业机会
对产品和研发而言,1M 上下文与较低激活参数意味着可尝试更长的文档、代码或多轮任务链路,同时控制单次调用成本。但实际效果取决于长上下文的稳定性与推理延迟,需要在具体业务中验证后再决定替换或新增模型。
- 在长文档分析、代码库理解或多轮代理任务中接入该模型做 A/B 测试,对比现有模型的长上下文准确率与单次成本。
- 围绕 1M 上下文设计分段缓存或增量处理方案,降低重复长输入带来的推理开销。
- 评估将高价值但长输入的业务流程(如合同审阅、日志分析)迁移到该模型的可行性。
05
仍待确认
- Ling-3.1-flash 的实际推理延迟和吞吐数据尚未披露。
- 1M 上下文在真实任务中的有效信息保持能力尚未得到独立验证。
- 模型是否开放 API、权重或仅限内部使用,证据未说明。
- 与同级别长上下文模型的基准对比结果尚未提供。