9 月
Arena 第 35 周盲测榜:Qwen 3.8-Max 登顶前端榜,国产模型集体冲击第一梯队
一句话结论:在 LMArena 第 35 周(8 月 24–30 日)的第三方盲测中,Qwen 3.8-Max-0902 首次入榜即以 1691 分登顶前端开发榜,GLM-5.3-Flash 闯入代码榜前十,这是国产模型第一次在多个细分榜单同时逼近全球第一梯队。
AI 摘要
- 发生了什么:LMArena 发布 2026 年第 35 周盲测榜,多款国产新模型集体亮相。
- 核心变化:Qwen 3.8-Max-0902 前端开发榜登顶(1691 分),把 Claude Opus 5 Max 挤到第二;GLM-5.3-Flash 代码榜首进 Top 10。
- 影响对象:国产大模型开发者、模型选型团队、关注 AI 编程工具的从业者。
- 下一步观察:Qwen 3.8-Max 的 AA 智能指数评测何时补上,以及 GLM-5.3-Flash 的排名能否站稳。
发生了什么
LMArena(arena.ai)在 9 月 2 日更新了 2026 年第 35 周(8 月 24 日至 30 日)的大模型盲测排行榜。这一周最显著的变化是国产新模型集中亮相:阿里 Qwen 3.8-Max-0902、智谱 GLM-5.3-Flash、腾讯 Hy 4-Preview 等都在各自的细分榜单上取得靠前位置。
Arena 的机制是「用户盲测」:投票者看不到模型名字,只凭回答质量打分,最后折算成 ELO 分。这套机制的好处是它贴近真实对话体验,而不是厂商自报的基准跑分——这也是这份榜单值得认真对待的原因。
国产模型在哪些榜单上表现突出?
前端开发榜:Qwen 3.8-Max 首次登顶
这是本周最大的看点。Qwen 3.8-Max-0902 首次入榜就直接登上前端开发榜榜首,ELO 1691 分,把此前一直领先的 Claude Opus 5 Max 挤到第二名。
同一周还有四款国产新模型集体闯入前端榜前 12:腾讯 Hy 4-Preview 排第 8(1627 分)、Qwen 3.8-Flash-Next 排第 9(1622 分)、GLM-5.3-Flash 排第 12(1604 分)。前端开发一直是国产模型的短板,这次集中上榜说明中文场景下的 UI 代码能力正在快速补课。

代码榜:GLM-5.3-Flash 首次进入前十
综合代码榜上,Kimi K 3 Max 稳在第 6 名(1542 分),GLM-5.3-Flash 作为本周新入榜模型直接排到第 7(1535 分)。这意味着 GLM-5.3-Flash 以 320 B 参数、18 B 激活的规模,在代码能力上已经能与更大体量的旗舰模型正面竞争。

综合榜:Anthropic 仍垄断,但国产模型守住前十
综合榜前五仍然被 Anthropic 的 Claude 系列包揽,但 Kimi K 3 Max 守住了第 10 名(1489 分),GLM-5.3-Max 排第 17(1482 分),Qwen 3.8-Max 排第 20(1479 分)。国产模型离「综合榜登顶」还有距离,但前十已经出现了稳定的国产身影。
为什么这轮盲测值得关注?
对普通用户:盲测榜单比厂商发布会更接近「真实使用感受」。如果你在选 AI 工具,前端榜登顶意味着 Qwen 3.8-Max 在写网页、做 UI 这类任务上,已经达到和 Claude 掰手腕的水平。
对开发者:GLM-5.3-Flash 以 320 B 参数进入代码榜前十,是一个强信号——「小模型靠后训练追平大模型」的路线正在见效。如果你在控制 API 成本,这类高性价比模型值得纳入测试。
对行业生态:过去国产模型的突破多集中在「综合榜追近」或「中文榜领先」,这次是在「前端开发」「代码」这类国际竞争最激烈的工程类榜单上取得名次,含金量更高。关于国产模型整体的选型逻辑,可参考我们整理的2026 国产大模型选型指南。
智盒判断
短期:Qwen 3.8-Max 前端榜登顶是「新版本发布窗口期」的表现,能否守住取决于 0902 版本是否稳定迭代。GLM-5.3-Flash 的代码榜前十,则验证了智谱「后训练 Scaling」路线的有效性——这与我们此前解读的「牛来」模型 GLM-5.3-Flash 开源形成呼应。
中期:国产模型正在从「综合能力追近」转向「细分场景反超」。前端、代码、智能体这些工程类榜单,比综合榜更能反映真实生产力价值。
长期:真正需要补齐的短板是第三方独立评测的完整性。Qwen 3.8-Max 至今没有 Artificial Analysis 智能指数,GLM-5.3-Flash 的样本量也还小(1213 次投票)。在盲测样本进一步累积之前,这些排名应当被理解为「上升趋势」而非「最终定论」。
风险与不确定性
- Arena 盲测是用户投票,样本量和投票人群分布会影响结果,不应等同于标准基准测试。
- Qwen 3.8-Max-0902 是新版本,其前端榜第一名的样本量有限,排名可能随投票增加而波动。
- GLM-5.3-Flash 在综合榜排第 30(1473 分),说明其在非代码、非前端的通用能力上仍与旗舰有差距。
后续观察
- Qwen 3.8-Max 何时获得 Artificial Analysis 智能指数评测,这是验证其「厂商声称」的关键一步。
- GLM-5.3-Flash 的代码榜排名能否在下一周站稳,还是「新模型窗口期」后的回落。
- 腾讯 Hy 4-Preview、小米 MiMo-V 2.5-Pro 这些新入榜模型是否会有进一步的榜单表现。
FAQ
Arena 盲测榜和厂商跑分有什么区别?
Arena 是用户盲测,投票者不知道自己在评价哪个模型,只根据回答质量投票。它更接近真实对话体验,但受样本量和投票人群影响。厂商跑分则是标准化基准测试,可复现但可能与真实使用脱节。两者应该配合看。
国产模型这次是「真第一」吗?
前端开发榜确实是 Qwen 3.8-Max 排第一,但这是「单一榜单、新版本窗口期、有限样本」下的第一,不能等同于「全面超越 Claude」。综合榜前五仍是 Anthropic 垄断。更准确的表述是:国产模型在工程类细分场景上,已经能和国际旗舰正面竞争。
想用国产模型做前端开发,应该选哪个?
可以优先关注 Qwen 3.8-Max(前端榜登顶),同时把 GLM-5.3-Flash(代码榜前十、成本更低)作为对比选项。具体选型还是要回到自己的任务上做小规模测试,榜单只能作参考。
参考来源
- IT 之家(凤凰网)《AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜》2026-09-02
- LMArena(arena.ai)第 35 周盲测榜









