
9 月
「牛来」身份揭晓:智谱正式开源 GLM-5.3-Flash,六天匿名测试换来双平台调用量新高

核心结论:持续一周的「匿名模型侦探战」尘埃落定。智谱 8 月 26 日官方确认,此前刷屏的匿名模型 Ox Alpha 就是 GLM-5.3-Flash——一款 320 B 总参数、仅激活 18 B 的原生多模态模型。它以 MIT 许可证开源,定价低至 Opus 4.8 的 1/40。六天匿名测试,换来了 OpenRouter 和 OpenCode 双平台的调用量新高。
AI 摘要
- 智谱 8 月 26 日认领匿名模型 Ox Alpha,正式命名 GLM-5.3-Flash 并开源
- 320 B 总参数、仅激活 18 B,是 GLM-5 系列首个原生多模态模型
- 六天匿名测试,Ox Alpha 调用量冲到 OpenRouter 第一,超 DeepSeek 两倍以上
- 定价约为 GLM-5.3 的 1/10(限时 1/20),为 Opus 4.8 的 1/40
- AA 智能指数 57 分,与 Claude Opus 4.8 持平
悬念怎么落地的?
一周前,一个叫 Ox Alpha 的匿名模型悄悄上线 OpenRouter。没有公司名、没有参数、价格栏写着「免费」。开发者们给它起了个外号叫「牛来」(Ox 意为牛),随后全网掀起一场「侦探式溯源」。
昨天(8-25),所有证据链都指向智谱:视频编码器的 token 消耗逐一吻合、文本分词器特征、独特的错误码 [1210]、后端中文报错信息——五条技术指纹,全指向这家总部位于北京的公司。但智谱一直没松口。
今天(8-26),谜底揭晓。智谱向彭博社确认,Ox Alpha 就是其 GLM 系列的新一代模型,正式定名 GLM-5.3-Flash,并于当晚开源模型权重。
这场「先匿名跑真实流量、再官宣身份」的发布,就此画上句号。
GLM-5.3-Flash 到底是什么?

它是一款「专为极低成本设计」的多模态 MoE 模型。这是智谱继此前一口气开源 6 款模型之后,在开源路线上的又一步。几个关键数字:
- 总参数 320 B,激活仅 18 B:参数量与 GLM-4.5 相当,但激活参数(32 B→18 B)和层数(92→45)几乎减半
- GLM-5 系列首个原生多模态:支持文本、图片、视频输入,配备 100 万 token 上下文窗口
- AA 智能指数 57 分:与 Anthropic 最受欢迎的 Claude Opus 4.8 持平,进入全球前沿区间
- 定价极低:约为 GLM-5.3 的 1/10,限时折扣内 1/20,为 Opus 4.8 的 1/40
架构上有两个值得一提的创新。它是首个采用「稀疏注意力 + 线性注意力」混合架构的开源前沿模型,在保持精准长上下文能力的同时大幅降低长上下文服务成本。另一个是「流形约束超连接」(Manifold-Constrained Hyper-Connections,mHC),用于提升模型的 Scaling 能力。
六天匿名测试,换来了什么?

这套「匿名发布」策略的回报,用数据说话。
从 8 月 20 日匿名上线,到 8 月 26 日被认领,六天之内,Ox Alpha 让全球开发者用掉了数十万亿 Token。截至 8 月 25 日,它在 OpenRouter 最近七天的统计窗口内处理了约 23.2 万亿 Token,排名第一;同期 DeepSeek V 4 Flash 0731 约为 11.6 万亿 Token。Ox Alpha 上线不到一周,处理量已经达到 DeepSeek 的两倍。
更值得注意的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,这是其首次在大规模流量中尝试用国产芯片集群提供服务,芯片通过自研高带宽互联网络连接。这本身就是一个独立的信号——国产芯片扛住了「泼天流量」。
匿名发布为什么成了国产模型的固定打法?
Ox Alpha 不是孤例。智谱此前就有先例:今年 2 月,匿名模型 Pony Alpha 上线,5 天后确认是 GLM-5。
把这几年的匿名模型串起来,能看出一条清晰的模式:Pony Alpha 是智谱 GLM-5、Hunter Alpha 是小米 MiMo-V 2-Pro、Owl Alpha 是美团 LongCat 2.0。甚至连 OpenAI 也曾以 Quasar Alpha 为代号测试 GPT-4.1。
这套打法的逻辑很清晰:匿名上架规避品牌风险,免费开放换取真实生产流量,压测反馈比内部测试数据更有参考价值,最终认领并完成商业化。 一位前百度、阿里高管在 X 上的分析指出,这正是这套策略的核心——用「隐身」换「真实」。
对开发者和行业意味着什么?
对开发者来说,最实际的是:MIT 许可证开源、权重可下载、可以本地部署。这意味着你可以自己跑一遍,验证它在编程、长程 Agent、多模态任务上的真实表现,而不只是看官方 benchmark。
对行业来说,GLM-5.3-Flash 的发布是「国产模型出海」的又一个注脚。从 OpenRouter 月榜前六名全被中国开源模型占据,到 Ox Alpha 六天冲上榜首,再到这次「国产芯片扛住全球流量」,国产模型正在用「开源 + 免费 + 极致性价比」的组合,在全球开发者社区里系统性攻城略地。想了解这轮国产模型竞争的完整版图,可以参考智盒整理的国产大模型选型指南。
不过也有一个需要冷静看待的点:AA 指数 57 分、DeepSWE 抽样 80%,这些是「纸面优势」和「小样本测试」。MoE 稀疏架构的输出一致性,还是要靠开发者实际部署才能看出真实落地表现。这代 GLM 到底有多强,权重开放后,让开发者自己跑一遍就知道了。
FAQ
Ox Alpha 和 GLM-5.3-Flash 是同一个模型吗?
是。智谱官方确认,匿名上线的 Ox Alpha 就是 GLM-5.3-Flash,只是正式发布前的匿名测试版。正式发布后定名 GLM-5.3-Flash 并开源。
免费期结束后还免费吗?
Ox Alpha 的免费使用期是一周,此后定价尚未公布。但官方已给出 GLM-5.3-Flash 的正式定价——约为 GLM-5.3 的 1/10,限时折扣内 1/20。
国产芯片真的扛住了流量吗?
智谱表示,Ox Alpha 的全部请求流量都由国产芯片提供算力支持,芯片通过自研高带宽互联网络连接。这是智谱首次在大规模流量中尝试国产芯片集群,属于「通过了实战检验」的信号,但长期稳定性还需观察。
智谱为什么要匿名发布?
核心是「用隐身换真实反馈」。匿名上架规避品牌风险,免费开放换取真实生产流量,压测得到的反馈比内部测试更真实。最终认领并完成商业化,这套打法智谱、小米、美团、OpenAI 都用过。
参考来源
- 腾讯新闻:《智谱认领「牛来」:匿名六天,让全球开发者用掉数十万亿 Token》(2026-08-26)
- IT 之家:《Ox Alpha 现身:智谱开源 GLM-5.3-Flash 原生多模态模型》(2026-08-26)
- 华尔街见闻:《智谱「认领」神秘 AI 模型 Ox Alpha,使用量已达 DeepSeek 两倍以上》(2026-08-26)
- 彭博社报道(2026-08-26)










