版本概况
智谱于 2026 年 8 月 26 日发布 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B。官方表示其在多项基准与真实负载中全面超越参数量接近两倍的 GLM-5.2,而调用价格约为后者的十分之一,适合作为大规模业务的默认模型选择。开放平台 API 与官方应用已同步上线该模型。
性能表现
在第三方综合智能指数评测中,GLM-5.3-Flash 取得 57 分,进入前沿模型能力区间,单位任务成本显著低于同级别模型。在编程与智能体类基准上,其 DeepSWE v1.1 得分 63.4(上一代为 46.2),AutomationBench 得分 48.8(上一代为 26.2),自研编程体感评测中最高推理档位已接近国际前沿闭源模型水平。模型上线前以匿名代号在海外开发者平台公测,成为当周调用量最高的模型,且全部推理流量运行于国产算力平台,发布当日即完成国产加速卡适配。
架构与成本优化
GLM-5.3-Flash 采用全新训练的基座模型,在 GLM 系列中首次引入稀疏注意力与线性注意力的混合架构:线性注意力通过状态建模捕获局部依赖,稀疏注意力借助轻量索引器检索全局上下文。为降低百万级上下文下索引器的延迟与显存开销,新增索引池机制,将四组索引键向量加权压缩为一组。模型同时采用流形约束超连接提升扩展效率,并基于约 30 万亿 token 的多模态预训练语料训练。相比上一代同规模模型,总参数量基本持平(320B 对 355B),激活参数量与层数接近减半(18B 对 32B、45 层对 92 层)。
多模态与编程协同
视觉能力被原生融入编程循环,模型可主动观察界面、渲染结果与交互反馈,并据此持续测试与改进,适用于前端开发、游戏构建、三维场景搭建以及浏览器与图形界面驱动的真实环境操作。配合此前发布的 GLM-5.3 在复杂软件工程与长程智能体任务上的强化,智谱形成由旗舰模型与轻量多模态模型组成的新一代模型矩阵,模型权重已在官方开源仓库同步开放。