Featured image of post 悬案结案:「牛来」认领之后,国产模型GLM-5.3-Flash和Qwen3.8-Max-0902交出的两份成绩单

悬案结案:「牛来」认领之后,国产模型GLM-5.3-Flash和Qwen3.8-Max-0902交出的两份成绩单

智谱认领 Ox-Alpha 为 GLM-5.3-Flash 并开源,OpenRouter 首日纪录与 OpenCode 霸榜终结有了主;同一周 Arena 榜单上,Qwen3.8-Max-0902 首秀登顶前端榜。国产模型的竞争,正在从追赶故事变成分工故事。

上个月我写过一篇《Ox Alpha 还没认领,开发者已经开始给它验明正身》。当时那个在 OpenRouter 上挂着的匿名模型,没有厂商署名,没有发布会,只有一份由开发者完成的黑盒鉴定:分词器指纹、报错字符串、温度归零后的输出比对,线索一路指向智谱 GLM。文章结尾留了个尾巴,说身份之谜过几天或许就有答案。

答案在 8 月 26 日晚上揭晓了。智谱宣布上线并开源 GLM-5.3-Flash,官方确认它就是那个被中文社区叫作「牛来」的 Ox-Alpha。更有意思的是,独立研究员此前那份「99% 把握」的指纹报告,被官方原样证实:25 组提示词的分词计数与 GLM-5.3 完全一致,11 项探针交叉测试与 GLM 家族全匹配。社区用最笨的办法,猜中了一家前沿实验室的底牌。OpenRouter 的模型页也同步把新模型挂到了 Z.ai 名下,FAQ 里直接写明「Ox Alpha 就是 Z.ai 的 GLM-5.3 Flash」。

OpenRouter 官方模型页卡片:GLM 5.3 Flash,1.31M 上下文,限时五折价 $0.075/$0.25,8 月 26 日发布

谜底本身不算意外,社区几轮测试下来,指向已经相当集中。我更想看的是认领之后交出来的东西:一份关于这个模型自己的成绩单,加上同一周 Arena 榜单上国产模型的表现。两份放在一起读,能看到一个和「追赶 GPT」的老故事不太一样的局面。

本文依据科创板日报(财联社)对智谱的报道、IT之家转述的 Arena 第 35 周榜单、OpenCode 公开数据页及社区讨论整理。涉及调用量、算力规模的数据均为厂商披露或媒体报道口径,未经独立审计;榜单排名反映盲测投票偏好,不等于绝对能力,文中会具体标注。

第一份成绩单:OpenRouter 纪录、霸榜终结和 1/40 的价格

先把认领公告里的硬信息捋一遍。

GLM-5.3-Flash 是一个总参数 320B、激活参数仅 18B 的 MoE 模型(混合专家模型),GLM-5 系列第一个原生多模态型号,以 MIT 协议开放权重,上线即登陆 Hugging Face。按科创板日报的报道,它上线 OpenRouter 首日调用量登顶并创下该平台单日历史纪录,同时终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜,测试期单日处理 tokens 达 62T。

能力层面,智谱给的参照系是 Artificial Analysis Intelligence Index(一个第三方模型能力指数):GLM-5.3-Flash 拿下 57 分,与 Claude Opus 4.8 持平,高于 GLM-5.2 的 53 分和 DeepSeek V4 Pro 正式版的 53 分。

智谱官方公布的评测对比图:六项基准对照 GLM-5.2、DeepSeek-V4-Vision-Exp、Claude Opus 4.8、GPT-5.6 Terra 与 Gemini 3.7 Flash

上图是智谱随发布放出的官方评测图,六项基准由厂商自选,对照对象也由厂商挑选,看的时候记得自带折扣系数。OpenRouter 页面引用的第三方数据倒是给出了另一个侧面:Artificial Analysis 的推理基准里,GPQA Diamond 91.2%、HLE 39.9%,Agentic Index 58.2 分「好于 96% 的受比模型」,数字同样来自 Artificial Analysis 而非智谱自测。

价格是这次发布里最具攻击性的部分。GLM-5.3-Flash 定价为 GLM-5.3 的 1/10,限时折扣期低至 1/20,折算下来只有 Opus 4.8 的 1/40。具体数字是每百万 tokens 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。作为一个把「对标国际旗舰」写进介绍材料的模型,这个定价已经很难用「性价比」来形容了,更像是直接把前沿模型的价格底线往下掰。

还有一个此前悬而未决的问题有了答案。Ox-Alpha 测试期免费放量时,海外社区一直有人追问:每天几十万亿 tokens 的算力供给从哪来的?智谱的披露是,「牛来」测试期间的全部线上流量,加上 GLM-5.3-Flash 发布后的线上服务,都由 10 万张国产芯片承载,芯片据科创板日报记者多方了解或来自华为、海光、摩尔线程。如果这一口径属实,这算得上国产算力第一次大规模直接服务全球真实负载,而不只是内部评测或演示环境。

架构上的交代也值得记一笔。按披露信息,这个模型在 GLM 系列里首次引入稀疏注意力与线性注意力的混合架构,配合所谓流形约束超连接(mHC),注意力计算量较 GLM-5.3 下降约 3 倍,KV 缓存(键值缓存)缩小 4.4 倍。换句话说,1M 上下文窗口之所以能以 1/40 的价格提供,靠的是把「记住一切」的开销在架构层砍掉,而不是单纯亏本补贴。这个逻辑能不能撑住长期运营,要打个问号,但至少账面上是自洽的。

第二份成绩单:前端榜登顶,和四款新模型的集体亮相

如果说 GLM-5.3-Flash 的成绩单是单点突破,那么同一周 Arena 平台的第 35 周榜单(8 月 24 日至 30 日)给出的是群像。

Arena 是基于匿名盲测投票的排行榜,用 ELO 积分(一种从国际象棋借用来的相对评分体系)计算排名。IT之家 9 月 2 日转述的这份周榜里,最扎眼的一条是:阿里 Qwen3.8-Max-0902 首次入榜,直接以 1691 分登上前端开发榜榜首,把之前的 Claude Opus 5-Max(1687 分)挤到第二。同一个前端榜上,腾讯 Hy4-Preview 首秀第 8,阿里 Qwen3.8-Flash-Next 首秀第 9,智谱 GLM-5.3-Flash 首秀第 12。四款国产新模型,集体进入前 12。

其他分榜的看点细一些。综合榜头部仍是 Anthropic 的天下,Claude Fable-5 以 1508 分蝉联,前七名被 Anthropic 包揽;国产这边 Kimi-K3-Max 守在第 10,GLM-5.3-Max 第 17,Qwen3.8-Max 第 20,GLM-5.3-Flash 首秀第 30。代码榜上 Anthropic 前三,Kimi-K3-Max 第 6,新入榜的 GLM-5.3-Flash 直接排到第 7,身后还有小米 MiMo-v2.5-Pro 在第 24 位缓慢爬升。

不过这张榜单的生命周期,比我预想的还短。本文写作时(9 月 3 日)再打开 Arena 的 WebDev 榜单,实时数据已经变了样:Claude Fable-5.1-Max 以 1765 分反超登顶,Qwen3.8-Max-0902 以 1688 分退到第二,名字旁边挂着 Preliminary(初步排名)的标签。第九、第十位还能看到首秀上周的 Hy4-Preview 和 Qwen3.8-Flash-Next。

Arena WebDev 榜单在 9 月 2 日的实时状态:Fable-5.1-Max 已反超登顶,Qwen3.8-Max-0902 退居第二

「首秀登顶」到「被反超」只隔了几天。这不是千问一周内变弱了,而是 Anthropic 在同一周发了 Fable 5.1,新王踩着新王上位。盲测榜单的排名波动,本来就是厂商发布节奏的直接映射。

榜单里还藏着一个错位:GLM-5.3-Flash 在综合榜只排第 30,到了代码榜却是第 7。同一个模型,换个赛道排名差了 23 位。这恰恰说明它不是「全面均衡」型选手,而是把能力明显倾斜到了编码和 Agent 调用这些具体任务上。对一家要把旗舰价格打到 1/40 的公司来说,这种倾斜是合理的:通用印象靠旗舰撑,真实调用量靠细分场景的性价比换。

两份成绩单对照:GLM-5.3-Flash 的发布答卷与 Arena 榜单表现

榜单该怎么读:票数、误差和主观偏好

在为「千问登顶」欢呼之前,有几个数字得摆在台面上。

Qwen3.8-Max-0902 的前端榜首,票数是 1390,置信区间 ±19;被它挤下去的 Claude Opus 5-Max 手握 10517 票,分数 1687 ±8。两个区间大量重叠,用榜单自己的规则说,分差在误差范围内应视为并列。GLM-5.3-Flash 的代码榜第 7 同样如此:1213 票,±18 的置信区间,紧随其后的第 8 名差距也在这个范围里。

这倒不是说排名注水,而是盲测榜的固有属性。Arena 官方和 IT之家都在注里写明了:排名反映用户主观偏好,新模型需要积累投票量,不同分榜不宜跨榜比较。新模型首周冲高还有个额外因素,愿意第一时间去试新东西的用户,本身就跟普通投票人群不一样,新鲜感和期待值都会推高票数。等投票量上来,排名回落几个位次是常态。

所以这两份成绩单的正确读法,大概是这样:它们证明国产新模型已经稳定进入「值得盲测用户认真投票」的区间,在前端、编码这些细分赛道具备了和头部模型掰手腕的表观实力;但「首秀登顶」是起点信号,不是终局判定。真正的考验在三个月后的榜单上还在不在,以及在真实代码库里跑起来是不是真的顺手。

分层突进:这一次没有谁号称全面超越

拉远了看,这次周榜加认领事件,拼出来的其实是国产模型的当前站位。

月之暗面的 Kimi-K3-Max 是综合榜前 10 常客,代码榜第 6,走的一直是稳定全能路线。阿里铺了两条线,Qwen3.8-Max-0902 冲前端单点冠军,Qwen3.8-Flash-Next 用 $0.16 的输入价格抢 Flash 生态位。智谱的动作最激进,把 GLM-5.3-Flash 以 1/40 于 Opus 的价格直接推进 OpenRouter 和 OpenCode 的真实流量。腾讯的路子不太一样,Hy4-Preview 首秀前端第 8,更早之前还把 1.5TB 的模型压到 200GB 塞进消费级显存。至于小米,MiMo 在代码榜第 24,慢慢往上挪,不着急。

国产模型的分层站位:六家公司各占一个位置

六家公司,六个不同的位置,没有一家在喊「全面超越」。Flash 层拼价格和调用量,旗舰层拼单项冠军;开源权重和盲测榜单更像两件基础设施,一个管开发者关系,一个管口碑冷启动。这跟去年「哪家又追平了 GPT」的叙事很不一样:追赶的故事需要一个全能冠军,分工的故事只要求每个位置上都有人站着。

背后的时机也值得说。按科创板日报引述的说法,DeepSeek V4 Flash 此前提价,市场对「用得起的前沿模型」的呼声正在高点,GLM-5.3-Flash 恰好卡在这个空档里进场。匿名上线、全网实测、择日揭晓的节奏,让它在公布身份之前就攒好了真实流量压测数据和盲测口碑,公布身份那天直接进入第二波传播。这套打法,一个月前那篇悬案文章里描述的还是进行时,现在已经可以说跑通了第一轮。

悬案、榜单和分工,怎么连成一件事

回过头看,8 月那场匿名悬案和 9 月初的这两份成绩单,其实是同一条链上的三环。

匿名发布管的是信任的冷启动,没有品牌背书的时候,真实任务和盲测投票可以替发布会说话。认领之后的成绩单管的是商业上的可信度,OpenRouter 的流量纪录、OpenCode 的使用量、开源权重和定价,把「模型能打」翻译成「模型能用、用得起」。至于 Arena 上的分层站位,那是更长期的账:每家位置都清晰之后,比的东西就从一次发布的高光,换成了各自位置上的持续供给。三个环节各管一段,缺了哪段,故事都讲不圆。

对使用者来说,结论反而简单。如果你在意的是日常编码和 Agent 调用的成本,GLM-5.3-Flash 和 Qwen3.8-Flash-Next 这一层已经值得认真测一轮,开源权重也意味着私有化部署的路是通的。如果你需要的是前端这类单项任务的极致表现,Qwen3.8-Max-0902 的首秀数据给了个动手的理由,尽管记得给它留出验证时间。至于「国产模型全面超越」这种宏大叙事,榜单自己的置信区间都不同意,不如把它换成更实在的问题:你手头那个具体任务,谁跑得又快又稳又便宜。

下一个悬念已经在排队了。匿名发布被验证可行之后,其他家跟不跟进?Flash 层价格击穿到 1/40 之后,下一次击穿的会是什么?牛来的故事结案了,照着抄作业的人,估计已经在路上了。

参考来源

以上来源用于整理发布口径与榜单数据,其中调用量、算力规模、芯片供应商等信息为厂商披露或媒体转述,未经独立审计;Arena 榜单为盲测投票的偏好排名,不构成能力评测结论。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计