
9 月
神秘「牛来」模型 Ox Alpha:4 万亿 token 终结 DeepSeek 霸榜,中国团队的第五次匿名实验

核心结论:一款没有公司名、没有参数规模、连价格都只写「免费」的匿名模型,上线 12 小时就刷屏了开发者社区。它终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录,首日调用量冲到 4 万亿 token。所有证据链都指向同一家公司——但这家公司至今不肯认领。
AI 摘要
- 匿名模型 Ox Alpha 上线 OpenRouter,首日登顶,终结 DeepSeek 56 天霸榜纪录
- 前五大入口累计调用量突破 4 万亿 token,刷新 OpenRouter 单日模型用量历史纪录
- 104 万上下文、支持多模态输入、免费调用,OpenCode 准备了每天 100 万亿 token 容量
- 独立测试抽 10 道 DeepSWE 任务,通过率 80%,高于 Claude Fable 5 的 65%
- 这是中国团队在 OpenRouter 上线的第五款「匿名模型」,前四款最终都被确认来自中国公司
发生了什么?
8 月 24 日,全球最大 AI 模型聚合平台 OpenRouter 的目录里,多了一个奇怪的条目:stealth/ox-alpha。
没有公司名,没有参数规模,没有定价——价格栏就两个字「免费」。官方只留了一句介绍:「面向编码、长周期智能体任务和实际生产环境的前沿模型」。
开发者们给它起了个外号——「牛来」(Ox 在英文里是「牛」)。上线 12 小时,这头「牛」就刷屏了。
最直观的数据来自 OpenRouter:仅 Hermes、Claude Code 等前五大入口,对 Ox Alpha 的累计调用量就突破了 4 万亿 token。它终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录,首日冲至平台榜首,刷新了 OpenRouter 单日模型用量的历史纪录。
OpenCode 随后宣布接入,为它准备了每天 100 万亿 token 的调用容量,而且不计入用户原本的额度。
这头「牛」到底牛不牛?

热度归热度,实际能力才是开发者关心的。目前最硬的一份实测来自独立研究员 Ben Davis。
他从软件工程基准 DeepSWE 里抽了 10 项真实任务,让几个模型在同一套脚手架里跑。结果:Ox Alpha 完成了 8 项,通过率 80%。同一组任务里,Claude Fable 5 是 65%,GPT-5.6 Sol 是 52%。
不过 Ben Davis 自己也提醒,这是高方差的小样本——完整 DeepSWE v 1.1 有 113 道题,从 10 道到 113 道还差得很远。
规格层面,Ox Alpha 官方页显示:104 万(1,048,576)token 上下文,最多输出 131,072 token,支持文本、图片、视频输入,也能调用工具。
爱范儿做了一件很「抓马」的测试——把 Ox Alpha 接进 Claude Code,让它查查自己到底是谁。它交回了一份 7 章网页报告,规格、流量、前代匿名模型、社区猜测全翻了一遍,最后在第 7 章停下来,列了一张「我不能知道的事」。
为什么所有人都猜它是智谱?
身份是这款模型最大的谜。随着「技术指纹」被一层层扒开,几乎所有证据链都指向同一家公司:智谱(Z.ai)。
最直接的一条:根据 APPSO 的实测,Ox Alpha 的推理链和 GLM-5.3 非常接近。爱范儿也做了类似判断,给一道数论题让它推,风格和智谱模型如出一辙。
智谱此前就有过「马甲」前科——今年 2 月,代号 Pony Alpha 的匿名模型上线,5 天后公布身份,确认是智谱 GLM-5。智谱也是国产大模型里开源动作最激进的一家,此前曾一口气开源 6 款模型。上次的马甲是「马」,这次是「牛」,网友调侃:「无论从分类学还是从『牛马』的隐喻来看,都很合理。」
这个猜测的置信度,还得看匿名模型的完整历史。
匿名模型为什么成了中国团队的固定节目?

Ox Alpha 不是个例。它是 OpenRouter 上线的第五款「Stealth Model」(匿名模型),而前四款的结局出奇一致:
- Pony Alpha(2026 年 2 月):上线首日 400 亿 token,5 天后确认是智谱 GLM-5
- Hunter Alpha(3 月):万亿参数、百万上下文,小米确认是 MiMo-V 2-Pro
- Elephant Alpha(4 月):蚂蚁集团 Inclusion AI 公布身份,对应 Ling-2.6-flash
- Owl Alpha(4 月底):6 月 30 日确认来自美团 LongCat-2.0
四款匿名模型,全部来自中国团队。这已经不是偶然,而是一套被反复验证的发布策略:先用实力在开发者社区里打出声量,再揭晓身份收割关注。
从传播角度看,这套策略很聪明。一个「神秘免费模型」天然比「某公司发布新版本」更勾人,开发者会自发去测、去猜、去传播。当模型实力足够强,即便隐去姓名,也能在全球最硬核的开发者社区里杀出重围——这本身就是中国 AI 模型技术实力跃升的证明。
这件事对行业意味着什么?
有三层信号值得注意。
第一,「开源/免费」正在成为国产模型出海的通用打法。Ox Alpha 免费、104 万上下文、多模态,这套配置本身就是冲着「让开发者先用起来」去的。配合匿名营销,本质是用产品力替代品牌力,在海外开发者心智里先占位。想了解这轮国产模型竞争的全貌,可以参考智盒整理的国产大模型选型指南。
第二,DeepSeek 的霸榜被终结,说明国产模型内部竞争在加剧。56 天霸榜已经是现象级纪录,但终结它的不是海外模型,而是另一个中国团队的匿名马甲。国产模型的「内卷」已经从国内市场卷到了 OpenRouter 这种全球性平台。
第三,匿名发布的边界问题被重新摆上台面。OpenRouter 页面显示,匿名提供方会保留提示词和生成结果(不用于训练),而 OpenCode 则承诺零数据留存。同一款模型在两个入口的数据政策不一致,对开发者来说是个需要自己权衡的风险点。
有哪些不确定性需要警惕?
现在下任何结论都太早,有几个关键点要盯:
- 身份未确认:所有「智谱」的猜测都基于推理链相似度,没有官方认领。截至发稿,这头「牛」的真实身份仍是谜。
- 小样本测试的局限:80% 的 DeepSWE 通过率来自 10 道题的抽样,高方差,不能代表完整基准成绩。
- 免费窗口有限:按此前几款匿名模型的节奏,Ox Alpha 的免费测试可能在 8 月 27 日前后结束,届时「牛爹」身份大概率浮出水面。
FAQ
Ox Alpha 真的是智谱的模型吗?
极大概率是,但目前没有官方确认。证据是推理链风格与 GLM-5.3 高度接近,加上智谱此前有 Pony Alpha(GLM-5)的匿名发布先例。最终答案预计在免费测试结束(8 月 27 日前后)时揭晓。
它真的比 Claude Fable 5 强吗?
不能这么简单下结论。Ben Davis 的 10 题抽样测试里 Ox Alpha 通过率 80%,高于 Fable 5 的 65%,但这是高方差小样本。完整 DeepSWE v 1.1 有 113 道题,需要等更完整的第三方评测。
现在能免费用到什么时候?
OpenRouter 和 OpenCode 两个入口都能免费调用,OpenCode 准备了每天 100 万亿 token 的容量。但按匿名模型的历史节奏,免费窗口可能在本周(8 月 27 日前后)关闭,之后大概率转入收费或正式发布。
这对国产大模型意味着什么?
这是中国团队第五次用「匿名模型」在 OpenRouter 打出声量,前四次最终都确认来自中国公司。它说明国产模型已经能凭产品力(而非品牌)在全球开发者社区立足,也标志着国产模型出海进入了「免费+匿名」的新打法阶段。
参考来源
- 上证报/腾讯新闻:《终结 DeepSeek 霸榜,神秘「牛来大模型」火了》(2026-08-24)
- 爱范儿:《神秘「牛来」模型刷屏,还抢了 DeepSeek 头条,实测到底牛不牛》(2026-08-24)
- 新智元:《奥特曼炮轰达里奥「反人类」,绝密模型同日曝光》(2026-08-24)
- OpenRouter:Ox Alpha 模型页(stealth/ox-alpha)
- Ben Davis:DeepSWE 10 题抽样测试(X)










