本文基于腾讯混元官方研究博客(8 月 28 日)、Hugging Face 模型页、Hacker News 与 r/LocalLLaMA 社区讨论整理。官方基准与盲测均为厂商自评,未经独立审计;文中涉及的 Ox Alpha 身份推测均为社区观点,不代表官方结论。8 月下旬 OpenRouter 匿名模型 Ox Alpha 的既有分析见本人此前文章。
先看参数

8 月 28 日,腾讯发布并开源 Hy4 preview。三个数字先摆出来:总参数 770B,激活参数 49B,上下文窗口 1M token。
MoE(混合专家)架构下,770B 的总盘子和 49B 的激活成本是一对基本组合:容量放在专家里,单次推理只走一小部分。1M 上下文接的则是混元系的老路线,此前 Ox Alpha 被社区围观时,百万 token 窗口就是它最显眼的标签。

权重放在了能想到的所有地方:Hugging Face、GitHub、ModelScope、AtomGit,API 走腾讯云和 OpenRouter,CodeBuddy、元宝、ima 等自家产品同步接入。定价每百万 token 输入 0.834 美元、输出 2.501 美元,缓存输入只要 0.042 美元,对照同档闭源模型,摆明了是要走量。
官方没把它包装成全能冠军,给的定位是三件难事:长程软件工程、文档密集的办公任务、科研。
官方成绩单该怎么读
盲测数据是这样:163 位腾讯内部专家,对 203 个工程任务做双盲对比评分。结果 Hy4 preview 平均 2.99 分,对 GLM 5.3 胜率 46.8%(2.92 分),对 Kimi K3 胜率 51.2%(2.94 分)。
先说这份数据的成色。评审是腾讯内部专家,任务是腾讯内部的工程任务,模型是腾讯自家的模型。这是厂商自评,样本和场景都偏向自己的优势区。它可以说明「在腾讯的工作负载里 Hy4 不输同档」,不能直接外推成「Hy4 全面领先」。46.8% 对 53.2% 的负向胜率甚至还输一头的部分,官方原文用的词也只是「略微领先」(slightly ahead)。
比赢了多少更值得注意的,是官方主动列出的已知问题:复杂任务上推理时间偏长,以及一种「过度自我验证」的倾向,模型会花不必要的时间反复检查自己刚做完的工作。发布会话术里很少见到这种自我拆台,把它写进发布博客是个好信号,也符合混元一贯的「先发布、听哪坏」策略,Hy3 就是这么迭代出来的。
模型指挥 Codex 干活的那个演示
官方演示里最值得展开的是一个工作流实验:让 Hy4 preview 同时管理多个 Codex 会话,自己扮演研究员的角色,根据实验结果调整研究方向,协调 Codex 同时优化多个评估目标。
结果是在一项小模型后训练任务上,这种「Hy4 指挥、Codex 执行」的组合在全部 8 项基准上超过了 Codex 单独探索。

这个演示真正值钱的地方是角色分工:模型做方向判断和实验设计,把机械的执行外包给更便宜的工具。这跟此前社区讨论的「贵模型当监工、便宜模型当工人」的分层编排是同一个思路,只不过这次是厂商自己把它做成了官方叙事。编排能力开始成为旗舰模型的卖点,这件事比多赢两三个点更重要。
社区的 48 小时
权重放出后的两天,社区干的事比评测跑分更实在。
r/LocalLLaMA 上的热帖(710 个赞)记录了这场压缩:有人把 1.5TB 的原始权重做量化,压到约 200GB 的 GGUF 格式,据发帖者描述保留了大约 98% 的性能。770B 模型从「必须多卡服务器」变成「顶配工作站碰得到」,中间只隔了两天。HN 的讨论帖也有 219 分、132 条评论,争议点集中在自评数据的可信度和真实编码体验。
这些数字我按社区讨论转述,压缩方案的性能损失具体怎么算、在哪些任务上掉了分,原帖没有给完整口径,动手前建议自己跑一轮验证。

Ox Alpha 的指纹对不上了
现在说悬案。8 月下旬,OpenRouter 上出现过匿名模型 Ox Alpha:不署名、免费、1M 上下文,社区用黑盒方法给它「验 DNA」,当时各种指纹线索指向的方向是 GLM / z.ai。这部分此前已有文章详细写过,结论也只是推断。
Hy4 preview 开源后,剧情起了新的波澜。有用户在 Twitter 上称,arena 中 Hy4 的输出与 Ox Alpha「完全一致」。如果这个说法成立,Ox Alpha 的真实来源就要重新考虑,之前指向 GLM 的指纹分析就得解释哪里出了偏差。
两个说法目前是矛盾的:一个指向 GLM,一个指向腾讯。两边都是社区推测,没有任何官方认领。更可能的情况是其中一方观察有误。arena 的输出一致性测试本身对采样参数、系统提示都很敏感,「完全一致」的结论并不像听起来那么铁。在官方或更多证据落地之前,两边都只能当线索看,别急着站队。
不过这场悬案本身已经说明了一个趋势:匿名内测、社区鉴定、官宣收网,正在成为模型发布的标准三幕剧。发布会还没开,鉴定报告已经写完了。
国产旗舰的四强格局
放大到整个市场看,国产开源旗舰现在正好四家:DeepSeek V4 系列、智谱 GLM 5.3(含 5.3-Flash)、月之暗面 Kimi K3,加上今天的主角 Hy4 preview。
四家的打法已经开始分化。DeepSeek 把注押在性价比和 API 生态上;GLM 这周刚靠 5.3-Flash 的原生多模态抢了 GUI Agent 的位置;Kimi 的长上下文一直是看家本领;Hy4 的差异化则压在「长程工程任务 + 编排能力」上:参数最大、上下文最长、价格激进,还顺手演示了指挥别家模型干活。
对开发者来说,最直接的变化是可选面宽了:同样的工程任务,至少有四个国产开源旗舰可以横评,家家都给 API 补贴价。麻烦的是跑分越来越没法直接比,每家都在自己最强的场景里做评测。像 Hy4 这种把自家盲测写进发布博客的,至少把口径摊开了,反而好比较一些。
写在最后
Hy4 preview 是一个「preview」,官方自己承认预训练和后训练都还有空间,带着已知问题就发了。这种不等打磨完就上桌的打法,加上 48 小时内社区就把权重压到工作站能跑的尺寸,说明开源旗舰的竞争已经卷到了发布节奏本身。
至于 Ox Alpha 到底是谁,悬案继续挂着。答案揭晓的那天,值得回头看看这场社区推理哪里对了、哪里错了——那会比任何一个跑分都有营养。
参考来源
- 腾讯混元官方博客:Introducing Hy4 preview
- Hugging Face:tencent/Hy4-preview
- 腾讯官方新闻稿:Tencent Releases and Open-Sources Tencent Hy4 preview
- MindStudio: Tencent Hy4 Preview, Inside the 770B Open-Weight Model
- r/LocalLLaMA: Tencent compressed Hy4-preview from 1.5TB to about 200GB GGUF
- Hacker News: Hy4 preview 讨论
以上基准数据与盲测结果均为厂商自评口径,社区压缩实测与 Ox Alpha 身份推测未经独立验证;本文不构成模型选型建议,生产环境引入前请以自测结果为准。