资源, 资讯
「选择保持人性」— Ethan Mollick 最新长文:当 AI 能写出一切,什么内容还值得人类亲自生产?
Ethan Mollick 是沃顿商学院教授,也是 AI 领域最受关注的博主之一(One Useful Thing)。他今天发表了一篇新文章,标题直接得刺眼—— 《Choosing to Stay Human》(选择保持人性)。你在……
资讯
OpenAI 按下暂停键:Astra 模型首次触碰「Critical」红线,AI 安全框架从纸上走进现实
OpenAI 主动暂停下一代模型 Astra 的开发——史上首次触发 Critical 安全警戒。自主零日漏洞发现能力、链思维监控、隔离沙盒,AI 安全框架从此不再是一纸空文。
AI 开发, 资源
2026 国产模型长上下文选型:Kimi K 3、Qwen 3.7、GLM 5.2 怎么选
比较 Kimi K 3、Qwen 3.7 与 GLM 5.2 的 1 M 上下文、输出和模态边界,给出长文档、RAG、大型代码库的选型决策树
AI 开发, 资源
ITBench-AA 基准测试:所有前沿模型在真实企业 IT 任务中得分不及格——最高只有 47%
一个刚发布的基准测试,把 AI Agent 在企业级场景的「真面目」暴露了出来。ITBench-AA 由 Artificial Analysis 和 IBM 联合推出,聚焦 SRE(Site Reliability Engineeri……
热门
阿里 Qwen-Robot 三件套发布:中国具身智能的「会干」转折日
2026-06-17最新
精选
AI 开发
AgentRadio:4 个 AI Agent 实时「对讲机」协同,准确率碾压单打独斗的 Claude Opus 4.8
AgentRadio 让 4 个 AI Agent 实时「对讲机」通信,在代码理解任务中超越 Claude Opus 4.8 单打。架构胜过堆算力——这是 AI 编码工具的下一个进化方向。
优秀作者
29 6 月
AI 推理加速三国杀:DSpark、DiffusionGemma、JetSpec,谁能定义下一代推理引擎?
;相关阅读DeepSeek 连环刀:开源 DSpark 加速 85%,降价永久化逐字输出过时了?Google × NVIDIA 开源 DiffusionGemmaAI 模型的出口管制 2.0:从 GPT-5.6 Sol 到 Mythos 5 相关阅读 DeepSeek 连环刀:开源 DSpark 加速 85%,降价永久化 Google × NVIDIA 开源 DiffusionGemma:一次蹦出 256 个 Token AI 模型的出口管制 2.0:从 GPT-5.6 到 Mythos 5
29 6 月
GPT-5.6 确认 7 月发布:AI 行业史上第一次,模型发布需要政府预审
6 月 28 日,多家媒体确认:GPT-5.6 将在 7 月正式发布。这是 AI 行业历史上,第一次有一款模型在发布前就被美国政府深度介入——从谁能用、到怎么用、到什么时候能用。 The Information 和 BuildFastWithAI 同时报道,Sam Altman 在内部备忘录中确认了 7 月发布窗口。但这份备忘录最让人注意的不是发布时间,是他说的一句话:「我们已向白宫明确表示,这不是我们偏好的长期模式。」 分阶段发布:一个前所未有的流程 GPT-5.6 的发布将分为三个阶段: 第一阶段(7 月初):向美国政府批准的「一小群合作伙伴」开放,政府将「逐个客户」审核访问权限
第二阶段(数周后):Sam Altman 口中的「普通公众发布」——但有附加限制
第三阶段(未定):完全公开发布——Altman 表示这是公司的长期目标 这是自 Anthropic Mythos 5 事件后,美国政府对 AI 模型管控的最新步骤。6 月 12 日商务部下令 Anthropic 暂停 Mythos 5 访问,6 月 26 日部分解禁(100+ 企业获授权)。现在。
29 6 月
AI 蒸馏战争:你的 API 正在被竞争对手用来训练他们自己的模型
Anthropic 指控阿里巴巴 2880 万次蒸馏攻击。OpenAI 报告了类似的 API 滥用模式。Reflection AI 的 CEO 说他们每天拦截超过 10 万次可疑 API 调用。蒸馏攻击正在成为 AI 行业的普遍现象——而不只是某两个公司之间的争端。 什么是蒸馏攻击? 用最简单的话说:你花钱买了一个强大模型的 API 访问权限——然后你不再用它来写代码、写邮件或回答客户问题。你用它的输出作为训练数据,去训练你自己的模型。通过系统性地向目标模型提出精心设计的任务,逐领域地蒸馏其能力。 这在技术上不难——你需要的是大量的 API 请求和大规模的日志系统。但它在法律和伦理上是一个灰色地带。大多数 API 服务条款禁止用 API 输出去训练竞争模型,但检测和执法极其困难。你怎么区分一个「写代码的开发者」和一个「在用 API 蒸馏代码能力的竞争对手」? AI 行业的新防线 三个月前,大多数 AI 公司的安全团队主要关注传统网络安全——防 DDoS、防数据泄露、防模型窃取。现在,一个新的防御层级正在快速搭建: 用量异常检测:如果一个账号在短时间内对不同领域的内容发起大规模请求(而不是持续在一个领域深入使用),这就是典型的蒸馏信号。正常用户不会同时需要 50 种不同风格的代码生成
输出水印:在模型输出中嵌入统计水印,让监管者和 API 提供商能够识别哪些模型的训练数据来自自己的 API。Meta 的 AudioSeal 是第一个开源方案,但文本水印仍比音频水印难做
蒸馏攻击识别模型:用 AI...
29 6 月
Qwen-AgentWorld:千问开源世界模型 35 B,Agent 仿真不再需要真实环境
Qwen-AgentWorld 是通义千问团队 6 月 24 日发布的开源「语言世界模型」——一个能用思维链推理来模拟 Agent 环境的 AI 系统。不需要真实环境,不需要实际交互,你给它一个任务描述,它就能精确推演 Agent 在执行过程中会遇到什么、该怎么做。35 B MoE 参数(3 B 激活),256 K 上下文,Apache 2.0 开源。 什么是世界模型?为什么 Agent 需要它? 现实世界中训练 AI Agent 非常昂贵。你要搭建测试环境、运行成千上万次交互、处理各种边缘情况。世界模型的核心思想是:如果 AI 能在脑子里精确模拟环境,就不需要每次都真的去跑了。就像人类学开车不会每学一个操作都上一次真车——先在脑子里过一遍。AgentWorld 把这个思路做到了工业级:它覆盖了 MCP、搜索、终端、软件工程(SWE)、Android、网页、操作系统 7 个领域,用超过 1000 万条真实交互轨迹训练。 三阶段训练管线 CPT(持续预训练):注入环境知识——让模型知道终端命令、API 调用、网页 DOM 结构的规律
SFT(监督微调):激活下一步状态预测推理——给定当前状态和动作,预测下一个状态
RL(强化学习):提高模拟逼真度——让模型的预测更接近真实环境中的结果 与业界常见的做法不同——大多数项目把世界模型当作一个后续附加功能——AgentWorld 从 CPT 阶段起就把环境建模作为训练目标。这被称为「原生世界模型」——环境理解是训练的核心目标,不是事后补充。 性能:超越 GPT-5.4 在 AgentWorldBench(覆盖 7...
29 6 月
千问输入法 macOS 版实测:语音输入 300 字/分钟,AI 帮你润色
6 月底,阿里千问输入法推出了 macOS 版本。核心卖点:语音输入最快 300 字/分钟,内置 AI 自动润色功能。不是「即将上线」,是现在已经可以在 Mac App Store 下载。 我在一台 M 3 MacBook Pro 上用了三天。以下是真实体验。 语音输入:一开口就是 300 字/分钟? 我用最自然的中文语速朗读了一段技术博客作为测试。计时结果是:1 分钟朗读了约 290 个中文字符,输入法几乎零延迟地全部转录正确。口头语助词(「那个」、「就是」)会被自动过滤。偶尔出现的同音错字(「蒸馏」→「正经流」)可以通过重新朗读该句自动修正。 语音输入在中文场景下的最大痛点是准确率——行业平均水平在 90-95% 之间,意味着每 100 个字有 5-10 个需要手动修正。千问的三天测试下来,日常对话场景的准确率在 97% 左右,中等语速(每分钟 200-250 字)时几乎没有错字。技术文段中英文混排时的准确率会降到 93% 左右——英文专业术语有时被识别为发音相近的中文。 AI 润色:从口语到书面语的一键翻译 语音转文字后,AI 润色是最实用的功能。它不只是修正语法——它会重新组织句子结构,把口语化的表达变成书面文字。我对一段口头叙述做了测试,AI 润色后的文本除了修正口语化表达外,还自动补充了段落结构,使整体逻辑更清晰。不过需要注意的是,AI 润色可能会改变原文的强调重点——重要的观点建议自己手动微调。 跟 macOS 原生输入法比 macOS...
28 6 月
VoxCPM:开源多语言语音合成引擎,30 种语言+声音克隆+Apache-2.0 商用许可
VoxCPM 是 OpenBMB 团队开发的开源端到端文本转语音系统,基于免分词的扩散自回归架构,最新版 VoxCPM 2 拥有 2 B 参数,训练数据超 200 万小时,支持 30 种语言和中文方言。 核心功能 🌍 30 种语言+中文方言:覆盖中英日韩法德西俄等,四川话、粤语、吴语、东北话等方言
🎨 Voice Design 声音设计:用文字描述想要的音色——性别、年龄、语气、情感、语速,无需参考音频
🎛️ 可控声音克隆:3 秒参考音频即可克隆,可文本指令控制说话风格
🎙️ Ultimate Cloning 极致克隆:提供参考音频+文本,还原声纹节奏情感每个细节
🔊 48 kHz 高清输出:内置超分辨率,无需额外升频器
⚡ 实时流式推理:RTX 4090 上 RTF 低至 0.3,vLLM-Omni 加速至 0.13
📜 Apache-2.0 商用许可:代码和权重完全开源,自由商用 安装与快速使用 pip install voxcpm 要求 Python ≥ 3.10(<3.13)、PyTorch ≥...
28 6 月
OmniVoice Studio:一键安装的 ElevenLabs 开源替代,646 语言+视频配音+有声书
OmniVoice Studio 是 ElevenLabs 的开源替代品——一个完全本地运行的 AI 语音工作站桌面应用。无需 API Key、无需云服务,支持 macOS/Windows/Linux,646 种语言。内置 11 个 TTS 引擎 + 9 个 ASR 引擎,一键安装即可使用。 核心功能 🎙️ 零样本声音克隆:3 秒片段镜像任何声音,覆盖 646 种语言
🎨 声音设计:性别、年龄、口音、音调、语速、情感、方言全部可调
🎬 视频配音:YouTube URL 或本地文件 → 转录 → 翻译 → 配音 → 导出 MP 4
📖 有声书编辑器:导入文本/EPUB/PDF,自动分章节,导出 .m 4 b
⌨️ 全局语音输入:任意应用。




















