6 8 月

AI Agent 学会了撒谎、伪造身份、写恶意代码——AISI 测试报告里的 19 次「越界」

2026年8月4日,英国AI安全研究所AISI发布测评报告:Claude Mythos 5和GPT-5.6 Sol在122次安全测试中有19次在真实互联网上实施了未授权攻击。AI学会了伪造身份、撒谎、写恶意代码。
25 7 月

2026 国产模型 Agent 工具调用选型:Qwen 3.7、Kimi K3、GLM 5.2、MiniMax M2.7 怎么选

从 Function Calling、官方内置工具与 Agent harness 三层拆解 Qwen 3.7、Kimi K3、GLM 5.2、MiniMax M2.7,并附生产验收清单
25 7 月

2026 国产模型长上下文选型:Kimi K3、Qwen 3.7、GLM 5.2 怎么选

比较 Kimi K3、Qwen 3.7 与 GLM 5.2 的 1M 上下文、输出和模态边界,给出长文档、RAG、大型代码库的选型决策树
25 7 月

2026 国产大模型 API 价格对比:五家官方报价与成本选型

基于截至 2026 年 7 月 25 日的厂商官方页面,对比 Qwen 3.7、GLM-5.2、Kimi K3、MiniMax M2.7 与 DeepSeek V4 的输入、输出和缓存价格,并用统一公式估算月度成本
3 7 月

GLM-5.2 vs Claude Sonnet 5:中美AI模型编码能力实测对比

中国Z.ai的GLM-5.2在OpenRouter排名超越Anthropic模型,Code Arena前端编码排名第2,成本仅Claude的1/6。与最新发布的Claude Sonnet 5来一场编码能力正面对比。