- 类型
- 模型
- 来源
- Hugging Face Model Radar
- 发布
- 2026年8月25日 06:43
- 状态
- 单一信源
01
发生了什么
智谱发布GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型,总参数320B,激活参数仅18B。在基准和实际任务中优于GLM-5.2,价格为其十分之一,编码和智能体基准接近Claude Opus 4.8。采用稀疏与线性注意力混合架构和mHC连接,基于30T token多模态语料训练。
02
为什么重要
相比GLM-5.2,GLM-5.3-Flash在性能提升的同时将价格降至十分之一,首次引入混合注意力架构和mHC以降低长上下文服务成本,标志着智谱在高效多模态模型上的重要进展,可能改变市场定价和部署格局。
03
底层逻辑
通过稀疏与线性注意力混合架构减少长上下文计算开销,mHC改进扩展效率,配合30T token的多模态预训练数据,实现更少算力获得更高智能。激活参数仅18B,总参数320B,采用MoE式设计,在推理时只激活部分参数,从而降低成本。
04
产品与商业机会
开发者和企业可以更低成本使用高性能多模态模型,长上下文场景服务成本显著降低;支持SGLang、vLLM等框架本地部署,并可通过reasoning_effort控制思维预算,影响产品集成成本和推理速度选择。
- 在长文档或代码库场景中采用该模型,利用低推理成本降低API费用。
- 基于reasoning_effort参数开发不同深度需求的AI功能,如快速问答与深度推理。
- 通过本地部署框架(如vLLM、SGLang)为私有化客户提供高性价比多模态方案。
05
仍待确认
- GLM-5.3-Flash在中文和多语言任务上的具体表现尚未有对比数据。
- 其价格十分之一的具体基准计算方式未明确。
- '接近Claude Opus 4.8' 的差距幅度未量化。