智谱开源GLM-5.3-Flash:Ox Alpha神秘面纱揭开,全部跑在国产芯片上,价格仅为Opus 4.8的1/40

8.27 GLM-5.3-Flash采用稀疏注意力与线性注意力混合架构,是首个采用此架构的开源前沿模型

过去一周,一个名为Ox Alpha(中文社区称“牛来”)的匿名模型在OpenRouter和OpenCode上引发全球开发者热议,创下双平台调用量新高。8月26日晚,谜底揭晓——智谱正式上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。而更令人震撼的是,匿名测试期间全部流量均由国产芯片承载,峰值日处理能力达100万亿Token。此次调用共涉及超过10万张国产芯片集群。

2026-08-27_095457_157

一、性能比肩Claude Opus 4.8,综合智能指数57分

GLM-5.3-Flash总参数量320B(3200亿),激活参数仅18B(180亿)。在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数) 中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在智谱自研的Z.ai Code Bench体感评估中,其编程表现同样与Opus 4.8相当。

与上一代旗舰GLM-5.2相比,GLM-5.3-Flash全面超越,定价却仅为后者的1/10。在多项基准测试中,其表现甚至优于参数量高出一倍的GLM-5.2。

2026-08-27_095547_652

二、架构革命:首个稀疏+线性混合注意力开源模型

这一性价比突破源自架构层面的根本创新。GLM-5.3-Flash采用稀疏注意力与线性注意力混合架构,是首个采用此架构的开源前沿模型。

与GLM-4.5相比,总参数量相当(355B vs 320B),但激活参数量从32B降至18B,层数从92层减至45层。相较于GLM-5.3,注意力计算量降低3.01倍,KV缓存大小降低4.44倍,在保持精准长上下文能力的同时大幅降低服务成本。

此外,该模型采用流形约束超连接(mHC) 提升模型Scaling能力,并基于30T Token多模态预训练语料实现以更少计算资源达成更强性能。模型原生支持最长1M上下文、图像与视频输入,将视觉能力融入Coding循环,实现“生成-观察-修正”的闭环。

三、国产芯片承载:10万卡集群接受全球流量“压力测试”

Ox Alpha匿名测试期间最受关注的算力谜底也随之揭开。这些请求流量全部由国产芯片提供算力支持。

智谱调用超过10万张国产芯片集群用于该模型服务,通过自研高带宽互联网络连接。为克服单张芯片内存容量与带宽限制,智谱在SGLang基础上构建专用推理引擎,采用W8A8量化、INT8/FP8/BF16混合缓存量化、节点内张量并行等技术,并引入生产级EPD分离架构(Encode-Prefill-Decode),将多模态编码、Prompt预填充和逐Token解码拆分为独立调度的工作池。

智谱表示,与同一硬件上的初始基线相比,端到端服务性能提升3倍,硬件效率和单Token成本已达到与主流英伟达GPU相当的水平。

据《晚点LatePost》了解,这批芯片供应商或来自华为、摩尔线程与海光,智谱官方未予置评。半导体研究机构SemiAnalysis在X平台评论称:“继Jalapeño(OpenAI自研推理芯片)宣布之后,CUDA护城河再度受到考验。”

四、定价仅为Opus 4.8的1/40

GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣期内为GLM-5.3的1/20,为Claude Opus 4.8的1/40。API定价为每百万Token输入0.8元、输出2.8元、缓存命中0.23元,比DeepSeek V4 Flash更便宜。

模型权重已在Hugging Face开源,开发者可自由下载、修改并用于商业场景。目前该模型已接入ZCode等编码平台,纳入GLM Coding Plan(每日限量发放10,000张体验卡),API同步开放。

GLM-5.3-Flash的发布至少传递了三个信号:第一,国产芯片已具备承载全球顶级大模型推理的能力,10万卡集群承接每日100万亿Token的真实流量,证明国产算力已从“能用”迈向“好用”;第二,模型架构创新与国产算力优化的结合正在重新定义成本曲线,以Claude Opus 4.8四十分之一的价格实现相同智能水平,这不仅是价格战,更是工程能力的验证;第三,开源依然是智谱的核心战略,匿名测试、开源权重、接入Coding Plan的组合拳,正在将技术优势转化为开发者生态的护城河。

相关链接:

BigModel:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash

Z.ai:https://docs.z.ai/guides/vlm/glm-5.3-flash

GLM Coding Plan:https://bigmodel.cn/glm-coding

HuggingFace:https://huggingface.co/zai-org/GLM-5.3-Flash