3 6 月

JetBrains 开源 Mellum2:一个 12B 的模型,凭什么能让 AI 工作流快两倍?

> AI 摘要 > - Mellum2 是 JetBrains 开源的 12B MoE 模型,每次推理仅激活 2.5B 参数 > - 定位为 AI 系统中的「focal model」——处理路由、RAG、子 Agent 等高频低延迟任务 > - Apache 2.0 许可,从零训练 10.6 ...
3 6 月

Step 3.7 Flash vs 腾讯 Hy3 Preview:国产 Agent 基座模型的「效率」军备赛

> AI 摘要 > - Step 3.7 Flash:198B MoE(仅激活 11B),400 tokens/s,Agent 单任务成本仅为 Claude Opus 4.6 的 1/9 > - 腾讯 Hy3 Preview:295B MoE(激活 21B),256K 上下文,快慢思考融合,两...
3 6 月

Cerebras 跑 Kimi K2.6 达到 981 tokens/s:速度数据、适用边界与选型意义

核验 Cerebras 与 Kimi K2.6 的 981 tokens/s 数据,区分吞吐、首 token 延迟和任务完成时间,并说明企业私有推理服务的适用边界
2 6 月

MiniMax M3 全解析:国产开源模型首次配齐「前沿三件套」,百万上下文不再只是纸面参数

为什么 MiniMax M3 值得你花10分钟读完? 6月1日,MiniMax 发布了新一代旗舰模型 M3。如果你已经对模型发布会感到麻木 - - 理解。但这次有三件事同时发生,而且每一件单独拿出来都够写一篇文章。 第一:M3 是国产开源模型里第一个同时具备 Frontier Codin...
2 6 月

NVIDIA GTC 台北三连击:Cosmos 3、Vera CPU、Nemotron 3 Ultra 同台发布

比「黄氏定律」更值得关注的三样东西 2026年6月1日,NVIDIA GTC 台北。Jensen Huang 穿着一贯的黑色皮衣走上台北音乐中心的舞台。这一次,他没有讲太多「算力翻倍」的故事 - - 虽然算力确实在翻倍。他拿出了三样真正能改变 AI 格局的产品。 Cosmos 3,全球首...