首页 > 开源 > GLM-5.3-FlashX 上线,智谱把国产卡上的推理速度顶到 200 token/s

GLM-5.3-FlashX 上线,智谱把国产卡上的推理速度顶到 200 token/s

OSChina资讯 2026-09-18 15:26 5 阅读 查看原文

GLM-5.3 前阵子以"Ox Alpha"的匿名身份上线时,就已经是 OpenCode 和 OpenRouter 双平台调用量最大的模型。今天智谱给它加了个更快的版本,名字也直白——GLM-5.3-FlashX,最高 200 tokens/s。

背后的一张牌值得单独说。上一代 GLM 上线时,团队是在 10 万张国产芯片组成的集群上把推理服务从零搭起来的,当时的难点是内存带宽受限、还要扛 1M 上下文和多模态。这个"国产卡上把吞吐压出来"的底子,正是这次 FlashX 提速的前提——智谱说的措辞是"在 10 万张国产芯片提供的推理算力基础上,进一步加大对 Infra 侧的投入与推理优化"。

短期看,这是一次产品化的速度升级:Flash 系列本身就是"同尺寸最强智能 + 极高性价比"的定位,这次把速度抬上去,等于在智能、价格、速度三个维度上都要占住。API 用了独立的 Model Key(GLM-5.3-FlashX),和原来的 Flash 分开计。

比较少见的是,智谱这次把发布说明写得特别松弛——"大大方方、好好用用、嗖嗖嗖嗖",连标题都透着股不端着。对比上一代那段"坦白说,在 GLM-4.7 之前,我们内部用 GLM 写代码多少带着被迫的成分"的长文,同一个团队,前后两种语气,也算是自家模型从"亲儿子"变"每天离不开的伙伴"的一个注脚。

使用方式


来源:GLM-5.3-FlashX上线:大大方方、好好用用、嗖嗖嗖嗖 - 智谱