<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>腾讯 on 奇诺分享 | 重在分享</title>
        <link>https://blog.ccino.org/tags/%E8%85%BE%E8%AE%AF/</link>
        <description>Recent content in 腾讯 on 奇诺分享 | 重在分享</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Sun, 30 Aug 2026 11:35:00 +0800</lastBuildDate><atom:link href="https://blog.ccino.org/tags/%E8%85%BE%E8%AE%AF/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>腾讯开源 Hy4 preview：770B 旗舰、1M 上下文，和一桩身份悬案</title>
        <link>https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/</link>
        <pubDate>Sun, 30 Aug 2026 11:35:00 +0800</pubDate>
        
        <guid>https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/</guid>
        <description>&lt;img src="https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/cover.png" alt="Featured image of post 腾讯开源 Hy4 preview：770B 旗舰、1M 上下文，和一桩身份悬案" /&gt;&lt;p&gt;本文基于腾讯混元官方研究博客（8 月 28 日）、Hugging Face 模型页、Hacker News 与 r/LocalLLaMA 社区讨论整理。官方基准与盲测均为厂商自评，未经独立审计；文中涉及的 Ox Alpha 身份推测均为社区观点，不代表官方结论。8 月下旬 OpenRouter 匿名模型 Ox Alpha 的既有分析见本人此前文章。&lt;/p&gt;
&lt;h2 id=&#34;先看参数&#34;&gt;先看参数
&lt;/h2&gt;&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/tencent-hq.jpg&#34;
	width=&#34;1280&#34;
	height=&#34;1707&#34;
	srcset=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/tencent-hq_hu_d0cc9968c1dc65.jpg 480w, https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/tencent-hq_hu_29ab33528a5d49e0.jpg 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;腾讯滨海大厦，深圳（图源：Wikimedia Commons）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;74&#34;
		data-flex-basis=&#34;179px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;8 月 28 日，腾讯发布并开源 Hy4 preview。三个数字先摆出来：总参数 770B，激活参数 49B，上下文窗口 1M token。&lt;/p&gt;
&lt;p&gt;MoE（混合专家）架构下，770B 的总盘子和 49B 的激活成本是一对基本组合：容量放在专家里，单次推理只走一小部分。1M 上下文接的则是混元系的老路线，此前 Ox Alpha 被社区围观时，百万 token 窗口就是它最显眼的标签。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/moe-architecture.png&#34;
	width=&#34;1672&#34;
	height=&#34;941&#34;
	srcset=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/moe-architecture_hu_8974c285854e8e06.png 480w, https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/moe-architecture_hu_7bac33ed242ae854.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;Hy4 preview 的 MoE 架构：770B 总参数中只激活 49B，上下文窗口 1M token&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;权重放在了能想到的所有地方：Hugging Face、GitHub、ModelScope、AtomGit，API 走腾讯云和 OpenRouter，CodeBuddy、元宝、ima 等自家产品同步接入。定价每百万 token 输入 0.834 美元、输出 2.501 美元，缓存输入只要 0.042 美元，对照同档闭源模型，摆明了是要走量。&lt;/p&gt;
&lt;p&gt;官方没把它包装成全能冠军，给的定位是三件难事：长程软件工程、文档密集的办公任务、科研。&lt;/p&gt;
&lt;h2 id=&#34;官方成绩单该怎么读&#34;&gt;官方成绩单该怎么读
&lt;/h2&gt;&lt;p&gt;盲测数据是这样：163 位腾讯内部专家，对 203 个工程任务做双盲对比评分。结果 Hy4 preview 平均 2.99 分，对 GLM 5.3 胜率 46.8%（2.92 分），对 Kimi K3 胜率 51.2%（2.94 分）。&lt;/p&gt;
&lt;p&gt;先说这份数据的成色。评审是腾讯内部专家，任务是腾讯内部的工程任务，模型是腾讯自家的模型。这是厂商自评，样本和场景都偏向自己的优势区。它可以说明「在腾讯的工作负载里 Hy4 不输同档」，不能直接外推成「Hy4 全面领先」。46.8% 对 53.2% 的负向胜率甚至还输一头的部分，官方原文用的词也只是「略微领先」（slightly ahead）。&lt;/p&gt;
&lt;p&gt;比赢了多少更值得注意的，是官方主动列出的已知问题：复杂任务上推理时间偏长，以及一种「过度自我验证」的倾向，模型会花不必要的时间反复检查自己刚做完的工作。发布会话术里很少见到这种自我拆台，把它写进发布博客是个好信号，也符合混元一贯的「先发布、听哪坏」策略，Hy3 就是这么迭代出来的。&lt;/p&gt;
&lt;h2 id=&#34;模型指挥-codex-干活的那个演示&#34;&gt;模型指挥 Codex 干活的那个演示
&lt;/h2&gt;&lt;p&gt;官方演示里最值得展开的是一个工作流实验：让 Hy4 preview 同时管理多个 Codex 会话，自己扮演研究员的角色，根据实验结果调整研究方向，协调 Codex 同时优化多个评估目标。&lt;/p&gt;
&lt;p&gt;结果是在一项小模型后训练任务上，这种「Hy4 指挥、Codex 执行」的组合在全部 8 项基准上超过了 Codex 单独探索。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/orchestrator-codex.png&#34;
	width=&#34;1672&#34;
	height=&#34;941&#34;
	srcset=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/orchestrator-codex_hu_7ac4ac70b49748bc.png 480w, https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/orchestrator-codex_hu_5e4fb4034989fc76.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;Hy4 作为研究员编排多个 Codex 会话，在 8 项基准上超过 Codex 单独探索&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;这个演示真正值钱的地方是角色分工：模型做方向判断和实验设计，把机械的执行外包给更便宜的工具。这跟此前社区讨论的「贵模型当监工、便宜模型当工人」的分层编排是同一个思路，只不过这次是厂商自己把它做成了官方叙事。编排能力开始成为旗舰模型的卖点，这件事比多赢两三个点更重要。&lt;/p&gt;
&lt;h2 id=&#34;社区的-48-小时&#34;&gt;社区的 48 小时
&lt;/h2&gt;&lt;p&gt;权重放出后的两天，社区干的事比评测跑分更实在。&lt;/p&gt;
&lt;p&gt;r/LocalLLaMA 上的热帖（710 个赞）记录了这场压缩：有人把 1.5TB 的原始权重做量化，压到约 200GB 的 GGUF 格式，据发帖者描述保留了大约 98% 的性能。770B 模型从「必须多卡服务器」变成「顶配工作站碰得到」，中间只隔了两天。HN 的讨论帖也有 219 分、132 条评论，争议点集中在自评数据的可信度和真实编码体验。&lt;/p&gt;
&lt;p&gt;这些数字我按社区讨论转述，压缩方案的性能损失具体怎么算、在哪些任务上掉了分，原帖没有给完整口径，动手前建议自己跑一轮验证。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/server-racks.jpg&#34;
	width=&#34;1920&#34;
	height=&#34;1280&#34;
	srcset=&#34;https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/server-racks_hu_1b1cb8edda6590b1.jpg 480w, https://blog.ccino.org/p/tencent-hy4-preview-open-source-2026/imgs/server-racks_hu_62b0fd587b80ccd2.jpg 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;能把 770B 塞进工作站，靠的是量化与本地推理生态多年的积累（图源：Wikimedia Commons，CC BY 2.0）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;150&#34;
		data-flex-basis=&#34;360px&#34;
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;ox-alpha-的指纹对不上了&#34;&gt;Ox Alpha 的指纹对不上了
&lt;/h2&gt;&lt;p&gt;现在说悬案。8 月下旬，OpenRouter 上出现过匿名模型 Ox Alpha：不署名、免费、1M 上下文，社区用黑盒方法给它「验 DNA」，当时各种指纹线索指向的方向是 GLM / z.ai。这部分此前已有文章详细写过，结论也只是推断。&lt;/p&gt;
&lt;p&gt;Hy4 preview 开源后，剧情起了新的波澜。有用户在 Twitter 上称，arena 中 Hy4 的输出与 Ox Alpha「完全一致」。如果这个说法成立，Ox Alpha 的真实来源就要重新考虑，之前指向 GLM 的指纹分析就得解释哪里出了偏差。&lt;/p&gt;
&lt;p&gt;两个说法目前是矛盾的：一个指向 GLM，一个指向腾讯。两边都是社区推测，没有任何官方认领。更可能的情况是其中一方观察有误。arena 的输出一致性测试本身对采样参数、系统提示都很敏感，「完全一致」的结论并不像听起来那么铁。在官方或更多证据落地之前，两边都只能当线索看，别急着站队。&lt;/p&gt;
&lt;p&gt;不过这场悬案本身已经说明了一个趋势：匿名内测、社区鉴定、官宣收网，正在成为模型发布的标准三幕剧。发布会还没开，鉴定报告已经写完了。&lt;/p&gt;
&lt;h2 id=&#34;国产旗舰的四强格局&#34;&gt;国产旗舰的四强格局
&lt;/h2&gt;&lt;p&gt;放大到整个市场看，国产开源旗舰现在正好四家：DeepSeek V4 系列、智谱 GLM 5.3（含 5.3-Flash）、月之暗面 Kimi K3，加上今天的主角 Hy4 preview。&lt;/p&gt;
&lt;p&gt;四家的打法已经开始分化。DeepSeek 把注押在性价比和 API 生态上；GLM 这周刚靠 5.3-Flash 的原生多模态抢了 GUI Agent 的位置；Kimi 的长上下文一直是看家本领；Hy4 的差异化则压在「长程工程任务 + 编排能力」上：参数最大、上下文最长、价格激进，还顺手演示了指挥别家模型干活。&lt;/p&gt;
&lt;p&gt;对开发者来说，最直接的变化是可选面宽了：同样的工程任务，至少有四个国产开源旗舰可以横评，家家都给 API 补贴价。麻烦的是跑分越来越没法直接比，每家都在自己最强的场景里做评测。像 Hy4 这种把自家盲测写进发布博客的，至少把口径摊开了，反而好比较一些。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后
&lt;/h2&gt;&lt;p&gt;Hy4 preview 是一个「preview」，官方自己承认预训练和后训练都还有空间，带着已知问题就发了。这种不等打磨完就上桌的打法，加上 48 小时内社区就把权重压到工作站能跑的尺寸，说明开源旗舰的竞争已经卷到了发布节奏本身。&lt;/p&gt;
&lt;p&gt;至于 Ox Alpha 到底是谁，悬案继续挂着。答案揭晓的那天，值得回头看看这场社区推理哪里对了、哪里错了——那会比任何一个跑分都有营养。&lt;/p&gt;
&lt;h2 id=&#34;参考来源&#34;&gt;参考来源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://hy.tencent.ai/research/hy4-preview&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;腾讯混元官方博客：Introducing Hy4 preview&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/tencent/Hy4-preview&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hugging Face：tencent/Hy4-preview&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;腾讯官方新闻稿：Tencent Releases and Open-Sources Tencent Hy4 preview&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.mindstudio.ai/blog/tencent-hy4-preview-open-weight-model&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;MindStudio: Tencent Hy4 Preview, Inside the 770B Open-Weight Model&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.reddit.com/r/LocalLLaMA/comments/1w1o324/tencent_compressed_hy4preview_from_15tb_to_about/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;r/LocalLLaMA: Tencent compressed Hy4-preview from 1.5TB to about 200GB GGUF&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://news.ycombinator.com/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hacker News: Hy4 preview 讨论&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;以上基准数据与盲测结果均为厂商自评口径，社区压缩实测与 Ox Alpha 身份推测未经独立验证；本文不构成模型选型建议，生产环境引入前请以自测结果为准。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
