29 7 月
Kimi K3 全面开源:2.8万亿参数模型如何搅动全球 AI 格局
7月27日深夜,月之暗面发布Kimi K3模型权重全面开源。2.8万亿参数、全球最大开源模型,30分钟内登顶Hugging Face,华尔街估算OpenAI与Anthropic合计估值蒸发3140亿美元。
27 7 月
Claude Opus 5 发布:Anthropic 两个月四连发的战略逻辑,不只是「更强」那么简单
先给结论:Opus 5 是 Anthropic 在高端市场的「价值锚」 Anthropic 的模型矩阵正在完成一次精密的价格歧视布局。Claude Opus 5 不是为所有人准备的——它是一个高端市场的价值锚点。在 CursorBench 3.2 上,Opus 5 的 max effort 得分与 Fable 5 差距不到 0.5%;在 Frontier-Bench v0.1 上超越所有其他模型;在 ARC-AGI 3 上的得分是次优模型的三倍;在 Zapier AutomationBench 上通过率约为次优模型的 1.5 倍;在 OSWorld 2.0 上超越 Fable 5,但成本仅为其三分之一。这些数据指向同一个信号:Anthropic 正在用 Opus 5...
27 7 月
Kimi K3 幻觉率 51%:开源模型的自信回答越准确,编造的风险也越高
一句话结论:Moonshot 7 月 27 日开源的 Kimi K3 在自信回答中有 51% 是编造的,幻觉率较前代 K2.6 的 39% 明显上升。但同期的准确率也从 33% 提升至 46%——Kimi K3 变得更"敢说"了,代价是说错的比例跟着涨了。 51% 的幻觉率意味着什么? Artificial Analysis 评测的独立评测显示,Kimi K3 在其自信回答中,有 51% 的内容是编造的。换句话说,当 Kimi K3 拒绝承认自己不知道、而是给出一个听起来有道理的答案时,这个答案有一半以上的概率是错的。 这是一个需要被认真对待的数字,但它并非 Kimi K3 独有的问题。对照组 Claude Fable 5 在同一基准上的幻觉率为 54.9%,甚至更高。幻觉是当前大语言模型的一个系统性问题,而非某一厂商或某一模型的"故障"。 相比前代 Kimi K2.6...
17 6 月
阿里 Qwen-Robot 三件套发布:中国具身智能的「会干」转折日
结论速读:Qwen-Robot 的意义在于把具身智能拆成操作、移动和世界理解三个能力层,并尝试用统一模型栈连接机器人感知与动作。它不是单点炫技,而是中国 AI 公司进入机器人执行层的一个标志性节点。 阿里 Qwen-Robot 三大模型拆解:从看懂到动手的逻辑6 月 16 日阿里巴巴发布的 Qwen-Robot 系列包含三个模型,分别解决具身智能的三个核心问题。操作模型 Qwen-RobotManip 采用 80 维统一动作表征,基于 38100 小时开源操作数据训练,实现跨硬件快速适配。移动模型 Qwen-RobotNav 引入任务自适应观察机制,在宇树科技 Go2 四足机器人上零样本部署(NVIDIA Jetson Thor,推理延迟 196ms),仅用单个低分辨率相机就可在陌生公寓中执行多房间任务。世界模型 Qwen-RobotWorld 基于物理规律认知,可预演动作轨迹并生成训练数据,跨操作、驾驶和导航场景预测符合物理规律的未来。6 月 16 日还有谁在具身智能赛道上出牌?同日,蚂蚁百灵发布 Ling & Ring 2.6 万亿参数三模型技术报告;理想汽车 Livis Day 定义具身智能汽车=电动车+职业司机+AI计算机+生活助手;法国 Genesis AI 发布非人形通用机器人...
28 5 月
Google I/O 2026 复盘:Gemini 月活 9 亿、全栈 Agent 化、世界模型,Google 用「生态反击」回应了所有人
如果你这周只看了一场发布会,你可能会以为 Anthropic 和 OpenAI 是这个行业唯一的两个玩家。 5 月 20 日 Google I/O 把这种印象彻底打碎了。Pichai 开场用了不到 20 分钟甩出一组数字:Gemini 月活 9 亿(一年前是 4 亿),覆盖 230 个国家 70 种语言,Google Search 的 AI Mode 查询量每季度翻倍。然后才是产品:Gemini 3.5 Flash、Omni 世界模型、Spark 跨应用 Agent、Agent Payments Protocol。 但 Google I/O 2026 真正值得关注的东西不是单一产品,而是一个模式:Google 在用生态宽度打...





