9月18日,智谱正式推出GLM-5.3-FlashX,最高推理速度达200 tokens/s,为企业与开发者带来更快、更流畅的模型体验。API已同步上线,Model Key为GLM-5.3-FlashX。

从Ox Alpha到FlashX:匿名测试到速度升级
GLM-5.3-Flash此前以匿名模型Ox Alpha(中文社区称“牛来”)之名与全球开发者见面,获得海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在10万张国产芯片提供的推理算力基础上,进一步加大对Infra侧的投入与推理优化。
智谱表示,GLM-5.3-Flash长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。
性能表现:综合智能指数57分,比肩Claude Opus 4.8
GLM-5.3-Flash总参数量为320B,激活参数仅18B,是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。在Artificial Analysis Intelligence Index中取得57分,进入全球前沿模型能力区间,与Anthropic的Claude Opus 4.8得分持平。
在编程与Agent能力上,其表现同样与Claude Opus 4.8相当,原生支持最长1M上下文、图片与视频输入。
定价策略:FlashX定位“速度溢价”
GLM-5.3-FlashX相比GLM-5.3-Flash价格更高,形成清晰的产品梯度:
| 模型 | 上下文 | 输入(元/百万Token) | 输出(元/百万Token) | 缓存命中(元/百万Token) | 输入模态 |
|---|---|---|---|---|---|
| GLM-5.3 | 1M | 8 | 28 | 2 | 文本 |
| GLM-5.3-Flash | 1M | 0.8 | 2.8 | 0.23 | 图片、视频、文件、文本 |
| GLM-5.3-FlashX | 1M | 2 | 7 | 0.57 | 图片、视频、文件、文本 |
FlashX的定价约为Flash的2.5倍,但换来更快的推理速度。对于需要高频调用、低延迟响应的场景(如实时Agent、交互式编程),这一“速度溢价”具备明确的价值。
国产芯片承载:10万卡集群支撑全球流量
GLM-5.3-FlashX的提速背后,是智谱在超过10万张国产芯片集群上的持续投入。此前匿名测试期间,全部请求流量均由国产芯片承载,峰值日处理能力达100万亿Token,通过自研高带宽互联网络连接,并基于SGLang构建了专用推理引擎,端到端服务性能相比初始基线提升3倍。
这一实践表明,国产算力已具备承载全球顶级大模型推理的能力,并在成本与效率上逐步逼近国际主流方案。
GLM-5.3-FlashX的推出,标志着智谱的策略正在从“极致性价比”向“性能梯度产品化”演进。此前的Flash以1/20于GLM-5.3的价格树立了性价比标杆,如今的FlashX则通过“速度溢价”满足了不同开发者的差异化需求——追求极致成本可继续使用Flash,追求极致响应速度则可选择FlashX。这种清晰的产品矩阵,正是大模型厂商走向成熟的标志。而这一切的底座,是10万张国产芯片的稳定支撑。