8 月 21 日,OpenRouter 发了一条短得近乎敷衍的动态。
一个忍者表情,一个模型名:stealth/ox-alpha。
没有厂商署名,没有技术报告,也没有那套熟悉的参数、榜单和“重新定义”的发布会话术。开发者能看到的只有几个条件:它暂时免费,号称支持超过 100 万 Token 的上下文,能接收文本、图像和视频输入,目标是编程、工具调用和长时间运行的 Agent 任务。

正常情况下,这种信息量不大的新模型很容易被刷过去。Ox Alpha 没有。接下来两天,大家没有只盯着“它是不是又比谁强”,而是干起了另一件更有技术宅气质的事:给它验明正身。
有人对 Token 计数,有人专门触发报错,有人把温度设为 0 反复问同一道题,还有人盯着接口吐出来的边角信息。线索慢慢往智谱 GLM / z.ai 方向聚拢。
截至本文写作时,Ox Alpha 仍未被任何团队公开认领。所以先把话放在前面:它是否来自 GLM / z.ai,目前仍是社区依据黑盒测试得出的推断,不是官方结论。
但身份之谜反而不是整件事最有意思的地方。更值得看的是,一家模型厂商没有先召开发布会,而是先把能力丢进开发者的终端。还没公布名字,真实任务、吐槽、试用数据和猜测已经铺开了。模型的第一场发布会,某种意义上已经由社区办完了。
本文依据 OpenRouter 的公开动态、模型页面信息,以及 Reddit、X 和媒体报道整理。社区指纹分析和小样本实测均未经过独立审计,文中将把公开信息与社区推断分开说明。
这个模型究竟拿什么吸引人
Ox Alpha 的卖点并不玄。
公开信息显示,它的上下文窗口超过 100 万 Token,最大输出约 13 万 Token,支持工具调用和结构化 JSON 输出。对每天要把需求文档、日志、代码片段和终端反馈往同一个上下文里塞的人来说,百万上下文听着确实有吸引力。
当然,上下文大不代表它就能把整个代码库读明白。许多模型的真实问题不在“能不能装下”,而在长材料里会不会漏掉关键约束,会不会在调用工具时走偏。只是至少,它少了一个很常见的借口:内容太长,前面忘了。
真正让人愿意动手试的,还是价格。预览期内,OpenRouter 页面把输入和输出都标成 0 美元;OpenCode 也提供了短期免费试用。平时做模型横评,不少人刚跑几轮就会开始算账。免费以后,试错的门槛突然低了:可以拿它修一个无关紧要的 bug,丢一段公开日志进去,或者让它看张截图做个小页面。
这也正是该克制的地方。匿名模型的服务方是谁、数据怎样保留、免费什么时候结束,都还没有清楚答案。第三方整理的资料提示,某些调用路径下提示词和输出可能会被保留。公开代码、脱敏数据、小项目都可以试,密码、客户资料、私有仓库和没发布的文档,还是别交给一个不肯报名字的服务方。
免费计算资源从来不是无条件礼物。至少在这件事上,先把它当成一次面向开发者的公开试运行,会比把它当成长期基础设施更稳妥。
那个“80%”,该怎么读
Ox Alpha 最容易被转发的一组数据,来自一项只有 10 个任务的软件工程对比测试。按发布者给出的结果,Ox Alpha 的通过率是 80%,同一轮测试里的 Fable 5、GLM-5.3 和 GPT-5.6 Sol 更低。
数字很醒目,但别急着把它写进“新王登基”的叙事里。
十个任务实在太少了。选了哪些题、提示词怎么写、有没有重试、给模型配了什么工具、验收标准由谁定,这些细节都足以改变结果。一个模型在十道题上跑得好,说明它值得继续测试;它不说明这个模型已经在通用编码能力上超过了其他模型,更不能直接拿去替换生产环境里的既有方案。
不过,小样本测试也不是完全没有价值。它至少说明,确实有人愿意把 Ox Alpha 放进真实编码场景里跑,而且其中一部分结果没有让人立刻关掉窗口。对一个没有品牌、没有论文、连身份都不公开的预览模型而言,这已经很不容易。
社区反馈也比那张汇总表更有参考价值。有用户觉得它处理长上下文、界面任务和工具链协作时挺顺手;也有人抱怨它会想很久却不动手,复杂后端项目里时灵时不灵。这种不那么整齐的评价,反而更像早期模型真实的样子。没有哪一张榜单能替你回答,它在自己的仓库、自己的工具链和自己的约束下到底行不行。
社区是怎么给它“验 DNA”的
早期的猜测名单很长。小米 MiMo、腾讯混元、Gemini、智谱 GLM 都有人提过。百万上下文、视频输入、大规模免费试用、此前出现过的匿名预览先例,每一项都能被拼进不同的推理里。
后来,讨论从“看着像谁”慢慢变成了“接口行为像谁”。
Reddit 上一篇讨论度很高的帖子列出三类黑盒线索。测试者拿多语言文本、代码和 emoji 去比较 prompt_tokens,称 Ox Alpha 和 GLM-5.3 的分词结果存在稳定对应关系,Ox Alpha 始终多出固定的 75 个 Token。接着,他们发现模型报错时的字符串疑似和 z.ai 服务相同。最后,在温度设为 0 时,某些回答又与 GLM-5.3 非常接近。
X 上还有用户放出截图,显示模型曾自称“powered by GLM, trained by z.ai”。这条证据单独看并不算数。模型会胡说,系统提示能影响回答,截图也不足以替人确认后台到底跑了什么。可当它和分词器、错误文本、确定性输出这些痕迹摆在一起时,社区自然会把注意力更多放到 GLM / z.ai 身上。

更准确的表述应该是:这些线索支持 Ox Alpha 可能与 GLM / z.ai 存在密切关联,但不足以证明它的完整模型身份、具体版本或发布主体。
这场讨论真正值得记下的,不是“网友破案了”这种爽文式结论。它展示了一套在模型越来越黑盒时仍然能用的笨办法。
没有权重,没有论文,也没有内部访问权限,开发者仍可比较 Token 计数、罕见字符的分词方式、报错文本、缓存行为和固定条件下的输出。它们未必能锁定一家公司的身份,却能把空泛的营销词拉回接口可观察的细节。
以后匿名模型再出现,很多人可能会先做这些测试,再看它的宣传页。这个变化比一次猜中厂商更重要。

0 美元买到的,可能是一次真实世界考试
匿名模型为什么要免费放出来?公开资料没有给出开发方的答案,只能做有限推测。
实验室里的评测再多,也不太容易复现真实世界里的混乱。开发者会把模型接进不同的 Agent 框架,给它不同质量的仓库、网络环境、工具权限和模糊需求。有人让它补测试,有人用它读截图,有人拿超长日志逼它找问题。那些没按预期发生的工具调用、突然变慢的延迟、上下文里莫名其妙丢掉的约束,才是产品团队最想知道、也最难在内部造出来的东西。
免费能让这个过程跑得更快。收费模型的测试往往浅尝辄止,尤其是涉及大量工具调用时。价格归零之后,人们会多试几轮,多开几个并发任务,也更愿意把失败案例贴出来讨论。至于传播中提到的“每天 100T Token”容量,目前仍应视为合作方的宣传口径,而非已经独立验证的实际消耗。
匿名还有一个微妙的好处。用户不知道背后是谁,多少能少一点品牌滤镜。有人本来就相信某家大厂,自然容易把一次成功当成实力证明;有人反感某个名字,也可能对同样的结果挑刺。把名字遮住后,注意力会更容易落在完成度、速度、稳定性和成本上。
也别把这件事浪漫化。神秘感同样会制造偏差。“未知强者”很容易让人转发一段惊艳演示,却忽略它翻车的时刻。匿名测试能减少一部分品牌偏见,不会自动让评测变得科学。
对 OpenRouter 来说,这也是一次角色变化。它过去更像把各家模型接到统一接口上的路由层。现在,它有机会成为模型发布前的试验场:厂商快速接入,开发者提供真实流量,平台则把试用、计费和讨论聚到一起。模型甚至不用先在发布会上亮相,先在终端里活下来就行。

匿名发布不适合所有人,但可能会越来越常见
所谓 stealth model,可以把它理解为匿名预览模型。传统发布的顺序是先宣布名字、参数、团队和榜单,再让用户验证。匿名预览反了过来,先让能力进入工具链,品牌之后再说。
如果模型表现不错,厂商公开身份时还能得到第二波传播;如果问题很多,也能在全面发布前修正。开发者也能暂时忘掉厂牌,做一轮更直接的比较。这些都是它有吸引力的原因。
可企业不会只看能力。谁运营服务、数据流向哪里、出了事故找谁、价格能不能持续、模型会不会明天就下线,这些问题都没有答案时,匿名模型就不适合承担高风险任务。它可以帮人发现一个值得关注的工具,不能替代供应商评估、隐私审查和可复现测试。
所以,匿名预览更像试车,不像采购。你可以开出去跑一圈,看看方向、刹车和油门的感觉,别因为一段顺畅路况就把它直接拉去跑长途。
还没开发布会,开发者已经投了第一票
Ox Alpha 最终会不会被公开认领,GLM / z.ai 的推断能否被证实,过几天或许就有答案。但这件事已经留下一种新的发布画面。
模型公司把能力和试运行成本摆出来,平台把入口接进开发者日常使用的工具里,开发者用实际任务、失败案例和横向比较给出第一轮反馈。Agent 做具体工作,平台和评测过程则把它在真实环境里的短板暴露出来。过去那种“发布会讲完,用户再慢慢试”的顺序,被压缩在了一起。
这不意味着排行榜、模型卡和正式的评测会失去价值。恰好相反。匿名预览的热度越高,越需要这些东西来收尾。否则,人们只会记住那条带忍者表情的推文和几张很会传播的截图。
下一次遇到这种模型,或许不必先问它出自哪家公司。先拿一项低风险但足够贴近自己工作的任务试试,记录它完成了什么、在哪一步开始含糊、调用了多少次工具、输出是否稳定。厂商身份会在某个时刻揭晓,工作流里的结果不会替你保密。
参考来源
- OpenRouter:Ox Alpha 发布动态
- OpenRouter:Ox Alpha 官方模型页面
- InfoQ:神秘“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?
- Reddit r/singularity:对 Ox Alpha 与 GLM-5.3 的指纹比对
- Reddit r/accelerate:Ox Alpha 的早期测试讨论
- Coursiv:Ox Alpha 匿名预览的规格、风险与社区反馈整理
- Manifold:Ox Alpha 身份预测市场
以上来源用于观察公开发布口径与社区反馈,不等同于独立的基准测试,也不构成对 Ox Alpha 身份或能力的最终确认。