<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>模型评测 on 奇诺分享 | 重在分享</title>
        <link>https://blog.ccino.org/tags/%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B/</link>
        <description>Recent content in 模型评测 on 奇诺分享 | 重在分享</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Sat, 22 Aug 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://blog.ccino.org/tags/%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Ox Alpha 还没认领，开发者已经开始给它验明正身</title>
        <link>https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/</link>
        <pubDate>Sat, 22 Aug 2026 09:00:00 +0800</pubDate>
        
        <guid>https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/</guid>
        <description>&lt;img src="https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/cover.png" alt="Featured image of post Ox Alpha 还没认领，开发者已经开始给它验明正身" /&gt;&lt;p&gt;8 月 21 日，OpenRouter 发了一条短得近乎敷衍的动态。&lt;/p&gt;
&lt;p&gt;一个忍者表情，一个模型名：&lt;code&gt;stealth/ox-alpha&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;没有厂商署名，没有技术报告，也没有那套熟悉的参数、榜单和“重新定义”的发布会话术。开发者能看到的只有几个条件：它暂时免费，号称支持超过 100 万 Token 的上下文，能接收文本、图像和视频输入，目标是编程、工具调用和长时间运行的 Agent 任务。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/openrouter-ox-alpha-official.png&#34;
	width=&#34;1200&#34;
	height=&#34;630&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/openrouter-ox-alpha-official_hu_643556f5a9f299a2.png 480w, https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/openrouter-ox-alpha-official_hu_2c4e7ef1c2bf6ef5.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;OpenRouter 的 Ox Alpha 官方模型页面&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;190&#34;
		data-flex-basis=&#34;457px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;正常情况下，这种信息量不大的新模型很容易被刷过去。Ox Alpha 没有。接下来两天，大家没有只盯着“它是不是又比谁强”，而是干起了另一件更有技术宅气质的事：给它验明正身。&lt;/p&gt;
&lt;p&gt;有人对 Token 计数，有人专门触发报错，有人把温度设为 0 反复问同一道题，还有人盯着接口吐出来的边角信息。线索慢慢往智谱 GLM / z.ai 方向聚拢。&lt;/p&gt;
&lt;p&gt;截至本文写作时，Ox Alpha 仍未被任何团队公开认领。所以先把话放在前面：它是否来自 GLM / z.ai，目前仍是社区依据黑盒测试得出的推断，不是官方结论。&lt;/p&gt;
&lt;p&gt;但身份之谜反而不是整件事最有意思的地方。更值得看的是，一家模型厂商没有先召开发布会，而是先把能力丢进开发者的终端。还没公布名字，真实任务、吐槽、试用数据和猜测已经铺开了。模型的第一场发布会，某种意义上已经由社区办完了。&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;本文依据 OpenRouter 的公开动态、模型页面信息，以及 Reddit、X 和媒体报道整理。社区指纹分析和小样本实测均未经过独立审计，文中将把公开信息与社区推断分开说明。&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;h2 id=&#34;这个模型究竟拿什么吸引人&#34;&gt;这个模型究竟拿什么吸引人
&lt;/h2&gt;&lt;p&gt;Ox Alpha 的卖点并不玄。&lt;/p&gt;
&lt;p&gt;公开信息显示，它的上下文窗口超过 100 万 Token，最大输出约 13 万 Token，支持工具调用和结构化 JSON 输出。对每天要把需求文档、日志、代码片段和终端反馈往同一个上下文里塞的人来说，百万上下文听着确实有吸引力。&lt;/p&gt;
&lt;p&gt;当然，上下文大不代表它就能把整个代码库读明白。许多模型的真实问题不在“能不能装下”，而在长材料里会不会漏掉关键约束，会不会在调用工具时走偏。只是至少，它少了一个很常见的借口：内容太长，前面忘了。&lt;/p&gt;
&lt;p&gt;真正让人愿意动手试的，还是价格。预览期内，OpenRouter 页面把输入和输出都标成 0 美元；OpenCode 也提供了短期免费试用。平时做模型横评，不少人刚跑几轮就会开始算账。免费以后，试错的门槛突然低了：可以拿它修一个无关紧要的 bug，丢一段公开日志进去，或者让它看张截图做个小页面。&lt;/p&gt;
&lt;p&gt;这也正是该克制的地方。匿名模型的服务方是谁、数据怎样保留、免费什么时候结束，都还没有清楚答案。第三方整理的资料提示，某些调用路径下提示词和输出可能会被保留。公开代码、脱敏数据、小项目都可以试，密码、客户资料、私有仓库和没发布的文档，还是别交给一个不肯报名字的服务方。&lt;/p&gt;
&lt;p&gt;免费计算资源从来不是无条件礼物。至少在这件事上，先把它当成一次面向开发者的公开试运行，会比把它当成长期基础设施更稳妥。&lt;/p&gt;
&lt;h2 id=&#34;那个80该怎么读&#34;&gt;那个“80%”，该怎么读
&lt;/h2&gt;&lt;p&gt;Ox Alpha 最容易被转发的一组数据，来自一项只有 10 个任务的软件工程对比测试。按发布者给出的结果，Ox Alpha 的通过率是 80%，同一轮测试里的 Fable 5、GLM-5.3 和 GPT-5.6 Sol 更低。&lt;/p&gt;
&lt;p&gt;数字很醒目，但别急着把它写进“新王登基”的叙事里。&lt;/p&gt;
&lt;p&gt;十个任务实在太少了。选了哪些题、提示词怎么写、有没有重试、给模型配了什么工具、验收标准由谁定，这些细节都足以改变结果。一个模型在十道题上跑得好，说明它值得继续测试；它不说明这个模型已经在通用编码能力上超过了其他模型，更不能直接拿去替换生产环境里的既有方案。&lt;/p&gt;
&lt;p&gt;不过，小样本测试也不是完全没有价值。它至少说明，确实有人愿意把 Ox Alpha 放进真实编码场景里跑，而且其中一部分结果没有让人立刻关掉窗口。对一个没有品牌、没有论文、连身份都不公开的预览模型而言，这已经很不容易。&lt;/p&gt;
&lt;p&gt;社区反馈也比那张汇总表更有参考价值。有用户觉得它处理长上下文、界面任务和工具链协作时挺顺手；也有人抱怨它会想很久却不动手，复杂后端项目里时灵时不灵。这种不那么整齐的评价，反而更像早期模型真实的样子。没有哪一张榜单能替你回答，它在自己的仓库、自己的工具链和自己的约束下到底行不行。&lt;/p&gt;
&lt;h2 id=&#34;社区是怎么给它验-dna的&#34;&gt;社区是怎么给它“验 DNA”的
&lt;/h2&gt;&lt;p&gt;早期的猜测名单很长。小米 MiMo、腾讯混元、Gemini、智谱 GLM 都有人提过。百万上下文、视频输入、大规模免费试用、此前出现过的匿名预览先例，每一项都能被拼进不同的推理里。&lt;/p&gt;
&lt;p&gt;后来，讨论从“看着像谁”慢慢变成了“接口行为像谁”。&lt;/p&gt;
&lt;p&gt;Reddit 上一篇讨论度很高的帖子列出三类黑盒线索。测试者拿多语言文本、代码和 emoji 去比较 &lt;code&gt;prompt_tokens&lt;/code&gt;，称 Ox Alpha 和 GLM-5.3 的分词结果存在稳定对应关系，Ox Alpha 始终多出固定的 75 个 Token。接着，他们发现模型报错时的字符串疑似和 z.ai 服务相同。最后，在温度设为 0 时，某些回答又与 GLM-5.3 非常接近。&lt;/p&gt;
&lt;p&gt;X 上还有用户放出截图，显示模型曾自称“powered by GLM, trained by z.ai”。这条证据单独看并不算数。模型会胡说，系统提示能影响回答，截图也不足以替人确认后台到底跑了什么。可当它和分词器、错误文本、确定性输出这些痕迹摆在一起时，社区自然会把注意力更多放到 GLM / z.ai 身上。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/openrouter-ox-alpha-announcement.jpg&#34;
	width=&#34;1200&#34;
	height=&#34;630&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/openrouter-ox-alpha-announcement_hu_e60dcf0b1ada1211.jpg 480w, https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/openrouter-ox-alpha-announcement_hu_f47170beec766e52.jpg 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;OpenRouter 发布 Ox Alpha 的原始社交媒体配图&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;190&#34;
		data-flex-basis=&#34;457px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;更准确的表述应该是：&lt;strong&gt;这些线索支持 Ox Alpha 可能与 GLM / z.ai 存在密切关联，但不足以证明它的完整模型身份、具体版本或发布主体。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这场讨论真正值得记下的，不是“网友破案了”这种爽文式结论。它展示了一套在模型越来越黑盒时仍然能用的笨办法。&lt;/p&gt;
&lt;p&gt;没有权重，没有论文，也没有内部访问权限，开发者仍可比较 Token 计数、罕见字符的分词方式、报错文本、缓存行为和固定条件下的输出。它们未必能锁定一家公司的身份，却能把空泛的营销词拉回接口可观察的细节。&lt;/p&gt;
&lt;p&gt;以后匿名模型再出现，很多人可能会先做这些测试，再看它的宣传页。这个变化比一次猜中厂商更重要。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/black-box-fingerprint.png&#34;
	width=&#34;1672&#34;
	height=&#34;941&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/black-box-fingerprint_hu_9aeb792ee63b34db.png 480w, https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/black-box-fingerprint_hu_618b7f04d62088fd.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;Ox Alpha 黑盒指纹分析&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;0-美元买到的可能是一次真实世界考试&#34;&gt;0 美元买到的，可能是一次真实世界考试
&lt;/h2&gt;&lt;p&gt;匿名模型为什么要免费放出来？公开资料没有给出开发方的答案，只能做有限推测。&lt;/p&gt;
&lt;p&gt;实验室里的评测再多，也不太容易复现真实世界里的混乱。开发者会把模型接进不同的 Agent 框架，给它不同质量的仓库、网络环境、工具权限和模糊需求。有人让它补测试，有人用它读截图，有人拿超长日志逼它找问题。那些没按预期发生的工具调用、突然变慢的延迟、上下文里莫名其妙丢掉的约束，才是产品团队最想知道、也最难在内部造出来的东西。&lt;/p&gt;
&lt;p&gt;免费能让这个过程跑得更快。收费模型的测试往往浅尝辄止，尤其是涉及大量工具调用时。价格归零之后，人们会多试几轮，多开几个并发任务，也更愿意把失败案例贴出来讨论。至于传播中提到的“每天 100T Token”容量，目前仍应视为合作方的宣传口径，而非已经独立验证的实际消耗。&lt;/p&gt;
&lt;p&gt;匿名还有一个微妙的好处。用户不知道背后是谁，多少能少一点品牌滤镜。有人本来就相信某家大厂，自然容易把一次成功当成实力证明；有人反感某个名字，也可能对同样的结果挑刺。把名字遮住后，注意力会更容易落在完成度、速度、稳定性和成本上。&lt;/p&gt;
&lt;p&gt;也别把这件事浪漫化。神秘感同样会制造偏差。“未知强者”很容易让人转发一段惊艳演示，却忽略它翻车的时刻。匿名测试能减少一部分品牌偏见，不会自动让评测变得科学。&lt;/p&gt;
&lt;p&gt;对 OpenRouter 来说，这也是一次角色变化。它过去更像把各家模型接到统一接口上的路由层。现在，它有机会成为模型发布前的试验场：厂商快速接入，开发者提供真实流量，平台则把试用、计费和讨论聚到一起。模型甚至不用先在发布会上亮相，先在终端里活下来就行。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/real-world-trial.png&#34;
	width=&#34;1672&#34;
	height=&#34;941&#34;
	srcset=&#34;https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/real-world-trial_hu_c7c27c4bb198a6d3.png 480w, https://blog.ccino.org/p/ox-alpha-stealth-model-openrouter-2026/imgs/real-world-trial_hu_f000bc865c8947f6.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;匿名模型的真实世界试运行&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;匿名发布不适合所有人但可能会越来越常见&#34;&gt;匿名发布不适合所有人，但可能会越来越常见
&lt;/h2&gt;&lt;p&gt;所谓 stealth model，可以把它理解为匿名预览模型。传统发布的顺序是先宣布名字、参数、团队和榜单，再让用户验证。匿名预览反了过来，先让能力进入工具链，品牌之后再说。&lt;/p&gt;
&lt;p&gt;如果模型表现不错，厂商公开身份时还能得到第二波传播；如果问题很多，也能在全面发布前修正。开发者也能暂时忘掉厂牌，做一轮更直接的比较。这些都是它有吸引力的原因。&lt;/p&gt;
&lt;p&gt;可企业不会只看能力。谁运营服务、数据流向哪里、出了事故找谁、价格能不能持续、模型会不会明天就下线，这些问题都没有答案时，匿名模型就不适合承担高风险任务。它可以帮人发现一个值得关注的工具，不能替代供应商评估、隐私审查和可复现测试。&lt;/p&gt;
&lt;p&gt;所以，匿名预览更像试车，不像采购。你可以开出去跑一圈，看看方向、刹车和油门的感觉，别因为一段顺畅路况就把它直接拉去跑长途。&lt;/p&gt;
&lt;h2 id=&#34;还没开发布会开发者已经投了第一票&#34;&gt;还没开发布会，开发者已经投了第一票
&lt;/h2&gt;&lt;p&gt;Ox Alpha 最终会不会被公开认领，GLM / z.ai 的推断能否被证实，过几天或许就有答案。但这件事已经留下一种新的发布画面。&lt;/p&gt;
&lt;p&gt;模型公司把能力和试运行成本摆出来，平台把入口接进开发者日常使用的工具里，开发者用实际任务、失败案例和横向比较给出第一轮反馈。Agent 做具体工作，平台和评测过程则把它在真实环境里的短板暴露出来。过去那种“发布会讲完，用户再慢慢试”的顺序，被压缩在了一起。&lt;/p&gt;
&lt;p&gt;这不意味着排行榜、模型卡和正式的评测会失去价值。恰好相反。匿名预览的热度越高，越需要这些东西来收尾。否则，人们只会记住那条带忍者表情的推文和几张很会传播的截图。&lt;/p&gt;
&lt;p&gt;下一次遇到这种模型，或许不必先问它出自哪家公司。先拿一项低风险但足够贴近自己工作的任务试试，记录它完成了什么、在哪一步开始含糊、调用了多少次工具、输出是否稳定。厂商身份会在某个时刻揭晓，工作流里的结果不会替你保密。&lt;/p&gt;
&lt;h2 id=&#34;参考来源&#34;&gt;参考来源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://x.com/OpenRouter/status/2090544970923184269&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;OpenRouter：Ox Alpha 发布动态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://openrouter.ai/stealth/ox-alpha&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;OpenRouter：Ox Alpha 官方模型页面&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.infoq.cn/article/3MNJh5F34GSsRQJJWJzY&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;InfoQ：神秘“Ox Alpha”突袭 OpenRouter，性能超过 Fable 5？&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.reddit.com/r/singularity/comments/1vufbx1/i_fingerprinted_ox_alpha_same_tokenizer_as_glm53/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Reddit r/singularity：对 Ox Alpha 与 GLM-5.3 的指纹比对&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.reddit.com/r/accelerate/comments/1vubpcv/new_stealth_model_on_openrouter_oxalpha_80_on/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Reddit r/accelerate：Ox Alpha 的早期测试讨论&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://coursiv.io/blog/ox-alpha-stealth-model/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Coursiv：Ox Alpha 匿名预览的规格、风险与社区反馈整理&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://manifold.markets/Sketchy/who-is-behind-ox-alpha-the-mysterio&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Manifold：Ox Alpha 身份预测市场&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;以上来源用于观察公开发布口径与社区反馈，不等同于独立的基准测试，也不构成对 Ox Alpha 身份或能力的最终确认。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
