<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Arena on 奇诺分享 | 重在分享</title>
        <link>https://blog.ccino.org/tags/arena/</link>
        <description>Recent content in Arena on 奇诺分享 | 重在分享</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Thu, 03 Sep 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.ccino.org/tags/arena/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>悬案结案：「牛来」认领之后，国产模型GLM-5.3-Flash和Qwen3.8-Max-0902交出的两份成绩单</title>
        <link>https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/</link>
        <pubDate>Thu, 03 Sep 2026 08:30:00 +0800</pubDate>
        
        <guid>https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/</guid>
        <description>&lt;img src="https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/cover.png" alt="Featured image of post 悬案结案：「牛来」认领之后，国产模型GLM-5.3-Flash和Qwen3.8-Max-0902交出的两份成绩单" /&gt;&lt;p&gt;上个月我写过一篇《Ox Alpha 还没认领，开发者已经开始给它验明正身》。当时那个在 OpenRouter 上挂着的匿名模型，没有厂商署名，没有发布会，只有一份由开发者完成的黑盒鉴定：分词器指纹、报错字符串、温度归零后的输出比对，线索一路指向智谱 GLM。文章结尾留了个尾巴，说身份之谜过几天或许就有答案。&lt;/p&gt;
&lt;p&gt;答案在 8 月 26 日晚上揭晓了。智谱宣布上线并开源 GLM-5.3-Flash，官方确认它就是那个被中文社区叫作「牛来」的 Ox-Alpha。更有意思的是，独立研究员此前那份「99% 把握」的指纹报告，被官方原样证实：25 组提示词的分词计数与 GLM-5.3 完全一致，11 项探针交叉测试与 GLM 家族全匹配。社区用最笨的办法，猜中了一家前沿实验室的底牌。OpenRouter 的模型页也同步把新模型挂到了 Z.ai 名下，FAQ 里直接写明「Ox Alpha 就是 Z.ai 的 GLM-5.3 Flash」。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/openrouter-glm-53-flash-card.png&#34;
	width=&#34;1200&#34;
	height=&#34;630&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/openrouter-glm-53-flash-card_hu_79904619efa5734.png 480w, https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/openrouter-glm-53-flash-card_hu_22bb60a7fac70852.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;OpenRouter 官方模型页卡片：GLM 5.3 Flash，1.31M 上下文，限时五折价 $0.075/$0.25，8 月 26 日发布&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;190&#34;
		data-flex-basis=&#34;457px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;谜底本身不算意外，社区几轮测试下来，指向已经相当集中。我更想看的是认领之后交出来的东西：一份关于这个模型自己的成绩单，加上同一周 Arena 榜单上国产模型的表现。两份放在一起读，能看到一个和「追赶 GPT」的老故事不太一样的局面。&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;本文依据科创板日报（财联社）对智谱的报道、IT之家转述的 Arena 第 35 周榜单、OpenCode 公开数据页及社区讨论整理。涉及调用量、算力规模的数据均为厂商披露或媒体报道口径，未经独立审计；榜单排名反映盲测投票偏好，不等于绝对能力，文中会具体标注。&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;h2 id=&#34;第一份成绩单openrouter-纪录霸榜终结和-140-的价格&#34;&gt;第一份成绩单：OpenRouter 纪录、霸榜终结和 1/40 的价格
&lt;/h2&gt;&lt;p&gt;先把认领公告里的硬信息捋一遍。&lt;/p&gt;
&lt;p&gt;GLM-5.3-Flash 是一个总参数 320B、激活参数仅 18B 的 MoE 模型（混合专家模型），GLM-5 系列第一个原生多模态型号，以 MIT 协议开放权重，上线即登陆 Hugging Face。按科创板日报的报道，它上线 OpenRouter 首日调用量登顶并创下该平台单日历史纪录，同时终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜，测试期单日处理 tokens 达 62T。&lt;/p&gt;
&lt;p&gt;能力层面，智谱给的参照系是 Artificial Analysis Intelligence Index（一个第三方模型能力指数）：GLM-5.3-Flash 拿下 57 分，与 Claude Opus 4.8 持平，高于 GLM-5.2 的 53 分和 DeepSeek V4 Pro 正式版的 53 分。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/zai-glm-53-flash-benchmark.png&#34;
	width=&#34;4239&#34;
	height=&#34;2643&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/zai-glm-53-flash-benchmark_hu_e099c4a1d77cd28c.png 480w, https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/zai-glm-53-flash-benchmark_hu_30a5f57df098bb14.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;智谱官方公布的评测对比图：六项基准对照 GLM-5.2、DeepSeek-V4-Vision-Exp、Claude Opus 4.8、GPT-5.6 Terra 与 Gemini 3.7 Flash&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;160&#34;
		data-flex-basis=&#34;384px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;上图是智谱随发布放出的官方评测图，六项基准由厂商自选，对照对象也由厂商挑选，看的时候记得自带折扣系数。OpenRouter 页面引用的第三方数据倒是给出了另一个侧面：Artificial Analysis 的推理基准里，GPQA Diamond 91.2%、HLE 39.9%，Agentic Index 58.2 分「好于 96% 的受比模型」，数字同样来自 Artificial Analysis 而非智谱自测。&lt;/p&gt;
&lt;p&gt;价格是这次发布里最具攻击性的部分。GLM-5.3-Flash 定价为 GLM-5.3 的 1/10，限时折扣期低至 1/20，折算下来只有 Opus 4.8 的 1/40。具体数字是每百万 tokens 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。作为一个把「对标国际旗舰」写进介绍材料的模型，这个定价已经很难用「性价比」来形容了，更像是直接把前沿模型的价格底线往下掰。&lt;/p&gt;
&lt;p&gt;还有一个此前悬而未决的问题有了答案。Ox-Alpha 测试期免费放量时，海外社区一直有人追问：每天几十万亿 tokens 的算力供给从哪来的？智谱的披露是，「牛来」测试期间的全部线上流量，加上 GLM-5.3-Flash 发布后的线上服务，都由 10 万张国产芯片承载，芯片据科创板日报记者多方了解或来自华为、海光、摩尔线程。如果这一口径属实，这算得上国产算力第一次大规模直接服务全球真实负载，而不只是内部评测或演示环境。&lt;/p&gt;
&lt;p&gt;架构上的交代也值得记一笔。按披露信息，这个模型在 GLM 系列里首次引入稀疏注意力与线性注意力的混合架构，配合所谓流形约束超连接（mHC），注意力计算量较 GLM-5.3 下降约 3 倍，KV 缓存（键值缓存）缩小 4.4 倍。换句话说，1M 上下文窗口之所以能以 1/40 的价格提供，靠的是把「记住一切」的开销在架构层砍掉，而不是单纯亏本补贴。这个逻辑能不能撑住长期运营，要打个问号，但至少账面上是自洽的。&lt;/p&gt;
&lt;h2 id=&#34;第二份成绩单前端榜登顶和四款新模型的集体亮相&#34;&gt;第二份成绩单：前端榜登顶，和四款新模型的集体亮相
&lt;/h2&gt;&lt;p&gt;如果说 GLM-5.3-Flash 的成绩单是单点突破，那么同一周 Arena 平台的第 35 周榜单（8 月 24 日至 30 日）给出的是群像。&lt;/p&gt;
&lt;p&gt;Arena 是基于匿名盲测投票的排行榜，用 ELO 积分（一种从国际象棋借用来的相对评分体系）计算排名。IT之家 9 月 2 日转述的这份周榜里，最扎眼的一条是：阿里 Qwen3.8-Max-0902 首次入榜，直接以 1691 分登上前端开发榜榜首，把之前的 Claude Opus 5-Max（1687 分）挤到第二。同一个前端榜上，腾讯 Hy4-Preview 首秀第 8，阿里 Qwen3.8-Flash-Next 首秀第 9，智谱 GLM-5.3-Flash 首秀第 12。四款国产新模型，集体进入前 12。&lt;/p&gt;
&lt;p&gt;其他分榜的看点细一些。综合榜头部仍是 Anthropic 的天下，Claude Fable-5 以 1508 分蝉联，前七名被 Anthropic 包揽；国产这边 Kimi-K3-Max 守在第 10，GLM-5.3-Max 第 17，Qwen3.8-Max 第 20，GLM-5.3-Flash 首秀第 30。代码榜上 Anthropic 前三，Kimi-K3-Max 第 6，新入榜的 GLM-5.3-Flash 直接排到第 7，身后还有小米 MiMo-v2.5-Pro 在第 24 位缓慢爬升。&lt;/p&gt;
&lt;p&gt;不过这张榜单的生命周期，比我预想的还短。本文写作时（9 月 3 日）再打开 Arena 的 WebDev 榜单，实时数据已经变了样：Claude Fable-5.1-Max 以 1765 分反超登顶，Qwen3.8-Max-0902 以 1688 分退到第二，名字旁边挂着 Preliminary（初步排名）的标签。第九、第十位还能看到首秀上周的 Hy4-Preview 和 Qwen3.8-Flash-Next。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/arena-webdev-leaderboard.png&#34;
	width=&#34;1440&#34;
	height=&#34;1000&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/arena-webdev-leaderboard_hu_288edc526f982e7c.png 480w, https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/arena-webdev-leaderboard_hu_812485a11bf5fc9b.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;Arena WebDev 榜单在 9 月 2 日的实时状态：Fable-5.1-Max 已反超登顶，Qwen3.8-Max-0902 退居第二&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;144&#34;
		data-flex-basis=&#34;345px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;「首秀登顶」到「被反超」只隔了几天。这不是千问一周内变弱了，而是 Anthropic 在同一周发了 Fable 5.1，新王踩着新王上位。盲测榜单的排名波动，本来就是厂商发布节奏的直接映射。&lt;/p&gt;
&lt;p&gt;榜单里还藏着一个错位：GLM-5.3-Flash 在综合榜只排第 30，到了代码榜却是第 7。同一个模型，换个赛道排名差了 23 位。这恰恰说明它不是「全面均衡」型选手，而是把能力明显倾斜到了编码和 Agent 调用这些具体任务上。对一家要把旗舰价格打到 1/40 的公司来说，这种倾斜是合理的：通用印象靠旗舰撑，真实调用量靠细分场景的性价比换。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/two-report-cards.png&#34;
	width=&#34;1693&#34;
	height=&#34;929&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/two-report-cards_hu_3bb6551559743469.png 480w, https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/two-report-cards_hu_4f6f9f8da3b4f154.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;两份成绩单对照：GLM-5.3-Flash 的发布答卷与 Arena 榜单表现&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;182&#34;
		data-flex-basis=&#34;437px&#34;
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;榜单该怎么读票数误差和主观偏好&#34;&gt;榜单该怎么读：票数、误差和主观偏好
&lt;/h2&gt;&lt;p&gt;在为「千问登顶」欢呼之前，有几个数字得摆在台面上。&lt;/p&gt;
&lt;p&gt;Qwen3.8-Max-0902 的前端榜首，票数是 1390，置信区间 ±19；被它挤下去的 Claude Opus 5-Max 手握 10517 票，分数 1687 ±8。两个区间大量重叠，用榜单自己的规则说，分差在误差范围内应视为并列。GLM-5.3-Flash 的代码榜第 7 同样如此：1213 票，±18 的置信区间，紧随其后的第 8 名差距也在这个范围里。&lt;/p&gt;
&lt;p&gt;这倒不是说排名注水，而是盲测榜的固有属性。Arena 官方和 IT之家都在注里写明了：排名反映用户主观偏好，新模型需要积累投票量，不同分榜不宜跨榜比较。新模型首周冲高还有个额外因素，愿意第一时间去试新东西的用户，本身就跟普通投票人群不一样，新鲜感和期待值都会推高票数。等投票量上来，排名回落几个位次是常态。&lt;/p&gt;
&lt;p&gt;所以这两份成绩单的正确读法，大概是这样：它们证明国产新模型已经稳定进入「值得盲测用户认真投票」的区间，在前端、编码这些细分赛道具备了和头部模型掰手腕的表观实力；但「首秀登顶」是起点信号，不是终局判定。真正的考验在三个月后的榜单上还在不在，以及在真实代码库里跑起来是不是真的顺手。&lt;/p&gt;
&lt;h2 id=&#34;分层突进这一次没有谁号称全面超越&#34;&gt;分层突进：这一次没有谁号称全面超越
&lt;/h2&gt;&lt;p&gt;拉远了看，这次周榜加认领事件，拼出来的其实是国产模型的当前站位。&lt;/p&gt;
&lt;p&gt;月之暗面的 Kimi-K3-Max 是综合榜前 10 常客，代码榜第 6，走的一直是稳定全能路线。阿里铺了两条线，Qwen3.8-Max-0902 冲前端单点冠军，Qwen3.8-Flash-Next 用 $0.16 的输入价格抢 Flash 生态位。智谱的动作最激进，把 GLM-5.3-Flash 以 1/40 于 Opus 的价格直接推进 OpenRouter 和 OpenCode 的真实流量。腾讯的路子不太一样，Hy4-Preview 首秀前端第 8，更早之前还把 1.5TB 的模型压到 200GB 塞进消费级显存。至于小米，MiMo 在代码榜第 24，慢慢往上挪，不着急。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/layered-positions.png&#34;
	width=&#34;1693&#34;
	height=&#34;929&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/layered-positions_hu_1c46bdfd55e9ca12.png 480w, https://blog.ccino.org/p/ox-alpha-revealed-cn-model-ranking-2026/imgs/layered-positions_hu_8f7ff8962ae8a6de.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;国产模型的分层站位：六家公司各占一个位置&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;182&#34;
		data-flex-basis=&#34;437px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;六家公司，六个不同的位置，没有一家在喊「全面超越」。Flash 层拼价格和调用量，旗舰层拼单项冠军；开源权重和盲测榜单更像两件基础设施，一个管开发者关系，一个管口碑冷启动。这跟去年「哪家又追平了 GPT」的叙事很不一样：追赶的故事需要一个全能冠军，分工的故事只要求每个位置上都有人站着。&lt;/p&gt;
&lt;p&gt;背后的时机也值得说。按科创板日报引述的说法，DeepSeek V4 Flash 此前提价，市场对「用得起的前沿模型」的呼声正在高点，GLM-5.3-Flash 恰好卡在这个空档里进场。匿名上线、全网实测、择日揭晓的节奏，让它在公布身份之前就攒好了真实流量压测数据和盲测口碑，公布身份那天直接进入第二波传播。这套打法，一个月前那篇悬案文章里描述的还是进行时，现在已经可以说跑通了第一轮。&lt;/p&gt;
&lt;h2 id=&#34;悬案榜单和分工怎么连成一件事&#34;&gt;悬案、榜单和分工，怎么连成一件事
&lt;/h2&gt;&lt;p&gt;回过头看，8 月那场匿名悬案和 9 月初的这两份成绩单，其实是同一条链上的三环。&lt;/p&gt;
&lt;p&gt;匿名发布管的是信任的冷启动，没有品牌背书的时候，真实任务和盲测投票可以替发布会说话。认领之后的成绩单管的是商业上的可信度，OpenRouter 的流量纪录、OpenCode 的使用量、开源权重和定价，把「模型能打」翻译成「模型能用、用得起」。至于 Arena 上的分层站位，那是更长期的账：每家位置都清晰之后，比的东西就从一次发布的高光，换成了各自位置上的持续供给。三个环节各管一段，缺了哪段，故事都讲不圆。&lt;/p&gt;
&lt;p&gt;对使用者来说，结论反而简单。如果你在意的是日常编码和 Agent 调用的成本，GLM-5.3-Flash 和 Qwen3.8-Flash-Next 这一层已经值得认真测一轮，开源权重也意味着私有化部署的路是通的。如果你需要的是前端这类单项任务的极致表现，Qwen3.8-Max-0902 的首秀数据给了个动手的理由，尽管记得给它留出验证时间。至于「国产模型全面超越」这种宏大叙事，榜单自己的置信区间都不同意，不如把它换成更实在的问题：你手头那个具体任务，谁跑得又快又稳又便宜。&lt;/p&gt;
&lt;p&gt;下一个悬念已经在排队了。匿名发布被验证可行之后，其他家跟不跟进？Flash 层价格击穿到 1/40 之后，下一次击穿的会是什么？牛来的故事结案了，照着抄作业的人，估计已经在路上了。&lt;/p&gt;
&lt;h2 id=&#34;参考来源&#34;&gt;参考来源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.cls.cn/detail/2465814&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;科创板日报（财联社）：10万张国产算力卡扛起「牛来」：智谱开源GLM-5.3-Flash&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.ithome.com/0/997/432.htm&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;IT之家：AI 大模型周榜：国产 GLM-5.3-Flash 首秀杀进代码榜前十，千问 3.8-Max 登顶前端榜&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://arena.ai/leaderboard/code/webdev&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Arena：WebDev 前端开发榜（实时更新）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://openrouter.ai/z-ai/glm-5.3-flash&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;OpenRouter：GLM 5.3 Flash 模型页&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://opencode.ai/zh/data/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;OpenCode：模型使用数据页&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/zai-org/GLM-5.3-Flash&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hugging Face：zai-org/GLM-5.3-Flash 模型卡&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://blog.ccino.org/ox-alpha-stealth-model-openrouter-2026/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;本站前作：Ox Alpha 还没认领，开发者已经开始给它验明正身&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;以上来源用于整理发布口径与榜单数据，其中调用量、算力规模、芯片供应商等信息为厂商披露或媒体转述，未经独立审计；Arena 榜单为盲测投票的偏好排名，不构成能力评测结论。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
