Featured image of post 腾讯开源 Hy4 preview:770B 旗舰、1M 上下文,和一桩身份悬案

腾讯开源 Hy4 preview:770B 旗舰、1M 上下文,和一桩身份悬案

腾讯 8 月 28 日开源 Hy4 preview,770B 总参数、49B 激活、1M token 上下文,内部盲测以微弱优势领先 GLM 5.3 与 Kimi K3。社区 48 小时内把它从 1.5TB 压到 200GB,还有人翻出它与神秘模型 Ox Alpha 的关联疑云。本文拆解官方成绩单的读法、最值得注意的「模型指挥 Codex 做研究」演示,以及国产开源旗舰的四强格局。

本文基于腾讯混元官方研究博客(8 月 28 日)、Hugging Face 模型页、Hacker News 与 r/LocalLLaMA 社区讨论整理。官方基准与盲测均为厂商自评,未经独立审计;文中涉及的 Ox Alpha 身份推测均为社区观点,不代表官方结论。8 月下旬 OpenRouter 匿名模型 Ox Alpha 的既有分析见本人此前文章。

先看参数

腾讯滨海大厦,深圳(图源:Wikimedia Commons)

8 月 28 日,腾讯发布并开源 Hy4 preview。三个数字先摆出来:总参数 770B,激活参数 49B,上下文窗口 1M token。

MoE(混合专家)架构下,770B 的总盘子和 49B 的激活成本是一对基本组合:容量放在专家里,单次推理只走一小部分。1M 上下文接的则是混元系的老路线,此前 Ox Alpha 被社区围观时,百万 token 窗口就是它最显眼的标签。

Hy4 preview 的 MoE 架构:770B 总参数中只激活 49B,上下文窗口 1M token

权重放在了能想到的所有地方:Hugging Face、GitHub、ModelScope、AtomGit,API 走腾讯云和 OpenRouter,CodeBuddy、元宝、ima 等自家产品同步接入。定价每百万 token 输入 0.834 美元、输出 2.501 美元,缓存输入只要 0.042 美元,对照同档闭源模型,摆明了是要走量。

官方没把它包装成全能冠军,给的定位是三件难事:长程软件工程、文档密集的办公任务、科研。

官方成绩单该怎么读

盲测数据是这样:163 位腾讯内部专家,对 203 个工程任务做双盲对比评分。结果 Hy4 preview 平均 2.99 分,对 GLM 5.3 胜率 46.8%(2.92 分),对 Kimi K3 胜率 51.2%(2.94 分)。

先说这份数据的成色。评审是腾讯内部专家,任务是腾讯内部的工程任务,模型是腾讯自家的模型。这是厂商自评,样本和场景都偏向自己的优势区。它可以说明「在腾讯的工作负载里 Hy4 不输同档」,不能直接外推成「Hy4 全面领先」。46.8% 对 53.2% 的负向胜率甚至还输一头的部分,官方原文用的词也只是「略微领先」(slightly ahead)。

比赢了多少更值得注意的,是官方主动列出的已知问题:复杂任务上推理时间偏长,以及一种「过度自我验证」的倾向,模型会花不必要的时间反复检查自己刚做完的工作。发布会话术里很少见到这种自我拆台,把它写进发布博客是个好信号,也符合混元一贯的「先发布、听哪坏」策略,Hy3 就是这么迭代出来的。

模型指挥 Codex 干活的那个演示

官方演示里最值得展开的是一个工作流实验:让 Hy4 preview 同时管理多个 Codex 会话,自己扮演研究员的角色,根据实验结果调整研究方向,协调 Codex 同时优化多个评估目标。

结果是在一项小模型后训练任务上,这种「Hy4 指挥、Codex 执行」的组合在全部 8 项基准上超过了 Codex 单独探索。

Hy4 作为研究员编排多个 Codex 会话,在 8 项基准上超过 Codex 单独探索

这个演示真正值钱的地方是角色分工:模型做方向判断和实验设计,把机械的执行外包给更便宜的工具。这跟此前社区讨论的「贵模型当监工、便宜模型当工人」的分层编排是同一个思路,只不过这次是厂商自己把它做成了官方叙事。编排能力开始成为旗舰模型的卖点,这件事比多赢两三个点更重要。

社区的 48 小时

权重放出后的两天,社区干的事比评测跑分更实在。

r/LocalLLaMA 上的热帖(710 个赞)记录了这场压缩:有人把 1.5TB 的原始权重做量化,压到约 200GB 的 GGUF 格式,据发帖者描述保留了大约 98% 的性能。770B 模型从「必须多卡服务器」变成「顶配工作站碰得到」,中间只隔了两天。HN 的讨论帖也有 219 分、132 条评论,争议点集中在自评数据的可信度和真实编码体验。

这些数字我按社区讨论转述,压缩方案的性能损失具体怎么算、在哪些任务上掉了分,原帖没有给完整口径,动手前建议自己跑一轮验证。

能把 770B 塞进工作站,靠的是量化与本地推理生态多年的积累(图源:Wikimedia Commons,CC BY 2.0)

Ox Alpha 的指纹对不上了

现在说悬案。8 月下旬,OpenRouter 上出现过匿名模型 Ox Alpha:不署名、免费、1M 上下文,社区用黑盒方法给它「验 DNA」,当时各种指纹线索指向的方向是 GLM / z.ai。这部分此前已有文章详细写过,结论也只是推断。

Hy4 preview 开源后,剧情起了新的波澜。有用户在 Twitter 上称,arena 中 Hy4 的输出与 Ox Alpha「完全一致」。如果这个说法成立,Ox Alpha 的真实来源就要重新考虑,之前指向 GLM 的指纹分析就得解释哪里出了偏差。

两个说法目前是矛盾的:一个指向 GLM,一个指向腾讯。两边都是社区推测,没有任何官方认领。更可能的情况是其中一方观察有误。arena 的输出一致性测试本身对采样参数、系统提示都很敏感,「完全一致」的结论并不像听起来那么铁。在官方或更多证据落地之前,两边都只能当线索看,别急着站队。

不过这场悬案本身已经说明了一个趋势:匿名内测、社区鉴定、官宣收网,正在成为模型发布的标准三幕剧。发布会还没开,鉴定报告已经写完了。

国产旗舰的四强格局

放大到整个市场看,国产开源旗舰现在正好四家:DeepSeek V4 系列、智谱 GLM 5.3(含 5.3-Flash)、月之暗面 Kimi K3,加上今天的主角 Hy4 preview。

四家的打法已经开始分化。DeepSeek 把注押在性价比和 API 生态上;GLM 这周刚靠 5.3-Flash 的原生多模态抢了 GUI Agent 的位置;Kimi 的长上下文一直是看家本领;Hy4 的差异化则压在「长程工程任务 + 编排能力」上:参数最大、上下文最长、价格激进,还顺手演示了指挥别家模型干活。

对开发者来说,最直接的变化是可选面宽了:同样的工程任务,至少有四个国产开源旗舰可以横评,家家都给 API 补贴价。麻烦的是跑分越来越没法直接比,每家都在自己最强的场景里做评测。像 Hy4 这种把自家盲测写进发布博客的,至少把口径摊开了,反而好比较一些。

写在最后

Hy4 preview 是一个「preview」,官方自己承认预训练和后训练都还有空间,带着已知问题就发了。这种不等打磨完就上桌的打法,加上 48 小时内社区就把权重压到工作站能跑的尺寸,说明开源旗舰的竞争已经卷到了发布节奏本身。

至于 Ox Alpha 到底是谁,悬案继续挂着。答案揭晓的那天,值得回头看看这场社区推理哪里对了、哪里错了——那会比任何一个跑分都有营养。

参考来源

以上基准数据与盲测结果均为厂商自评口径,社区压缩实测与 Ox Alpha 身份推测未经独立验证;本文不构成模型选型建议,生产环境引入前请以自测结果为准。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计