27 7 月
Kimi K3 幻觉率 51%:开源模型的自信回答越准确,编造的风险也越高
一句话结论:Moonshot 7 月 27 日开源的 Kimi K3 在自信回答中有 51% 是编造的,幻觉率较前代 K2.6 的 39% 明显上升。但同期的准确率也从 33% 提升至 46%——Kimi K3 变得更"敢说"了,代价是说错的比例跟着涨了。 51% 的幻觉率意味着什么? Artificial Analysis 评测的独立评测显示,Kimi K3 在其自信回答中,有 51% 的内容是编造的。换句话说,当 Kimi K3 拒绝承认自己不知道、而是给出一个听起来有道理的答案时,这个答案有一半以上的概率是错的。 这是一个需要被认真对待的数字,但它并非 Kimi K3 独有的问题。对照组 Claude Fable 5 在同一基准上的幻觉率为 54.9%,甚至更高。幻觉是当前大语言模型的一个系统性问题,而非某一厂商或某一模型的"故障"。 相比前代 Kimi K2.6...
27 7 月
倒计时一周:EU AI Act 透明度规则即将生效,全球AI监管迎来第一块多米诺骨牌
距今仅剩一周——2026年8月2日,欧盟《人工智能法案》(EU AI Act)中关于AI系统透明度的核心条款将正式生效。这意味着,从这一天起,任何在欧盟境内运营或影响欧盟用户的AI系统,都必须向用户明确告知:你正在与机器互动,或者你所看到的内容由AI生成。 这是全球范围内首次对AI系统施加广泛、有约束力的透明度要求。它不再是行业自律倡议,也非自愿性指南,而是一部带有罚款机制的法律。距离截止日期已不到十天,许多AI系统提供商仍在紧急评估自己的合规差距。 为什么说这是全球AI监管的第一块多米诺骨牌? EU AI Act 的独特之处不在于它是第一部AI法,在此之前,中国、美国各州均已出台各自的AI治理框架。它之所以被称为第一块多米诺骨牌,是因为它采用了域外管辖原则:只要你的AI系统在欧盟境内被使用,或者其输出影响了欧盟用户,无论你的公司注册在哪里,都需要遵守。 这种布鲁塞尔效应在GDPR时代已经上演过一次。当欧盟率先确立数据保护标准,全球企业纷纷跟进,最终推动了数十个国家的数据立法。EU AI Act 的透明度条款很可能复制这一路径——从布鲁塞尔到硅谷,再到深圳和班加罗尔,形成监管标准的事实性全球化。 一个值得关注的信号是:Alphabet 在近期的资本开支指引中给出了 $1950-2050 亿美元的年度预算。AI基础设施的军备竞赛与合规体系建设正在并行发生,这在科技监管史上几乎没有先例。 透明度规则具体规定了什么?谁需要做什么? 透明度条款的核心义务分为三层: 第一层:交互告知义务。 如果用户正在与AI系统直接对话,无论是客服聊天机器人、语音助手,还是AI面试官,系统提供商必须确保用户知道自己面对的是机器。这项义务适用于所有面向终端用户的AI交互场景。 第二层:合成内容标识义务。 如果AI生成了文本、图像、音频或视频内容,且该内容可能被误认为是人类创作或真实记录,则必须进行标识。这包括 deepfake 视频、AI生成的新闻文章、合成语音等。生成式AI系统(GPAI)提供商和合成媒体创作者均在此列。 第三层:例外与豁免。 法律明确排除了某些场景:如果AI仅用于辅助性任务(如拼写检查、图像滤镜),或内容明显不会被误判(如AI生成的创意艺术作品且标注了作者身份),则可获得豁免。执法机构在特定条件下也享有例外。 对于通用AI(GPAI)系统提供商,包括大语言模型、图像生成模型等基础模型厂商,还需要额外披露训练数据摘要,并建立内部合规政策。 为什么高风险系统推迟了,透明度却没让步? 这可能是EU AI Act实施节奏中最值得分析的一笔。 今年6月底,欧盟通过了综合条例(omnibus regulation),作出了一系列重大让步:独立附件中敏感用例的高风险AI系统合规期限推迟至2027年末,监管产品(如医疗器械、汽车)中嵌入的AI系统推迟至2028年。根据 DX Today 分析,这一调整意味着许多本来需要在今年完成合规评估的企业获得了关键的缓冲期。官方给出的理由非常直白,标准、测试体系和行业指南的成熟度不足以支撑按时执行。 但透明度的最终期限纹丝未动。 这个差异背后透露出欧盟的监管优先级:透明度是地基,高风险分类是上层建筑。在监管者的逻辑中,即便你还没有能力全面评估一个AI系统的风险等级,你至少可以告诉用户这是一个AI系统。这是一个低门槛、高杠杆的要求:对企业的技术负担最小,对用户的信息价值最大。 EU AI Act 对中国AI企业出海欧洲意味着什么? 这是一个无法绕过的问题。中国AI企业在欧洲市场的参与度正在加深——从基础模型到应用层的AI写作工具、图像生成产品、AI客服系统,以及跨境电商中的AI推荐引擎。 EU AI Act 的域外管辖意味着,一家在深圳注册的AI SaaS公司,只要有欧洲用户使用其服务,就需要遵守透明度规则。这在短期内会带来三重成本: 合规评估成本:需要逐产品、逐功能识别是否落入法案适用范围,并确定对应的义务层级;
产品改造成本:在用户交互界面中加入AI标识、调整合成内容的呈现方式;
法律风险成本:违规罚款最高可达全球年营业额的1.5%或750万欧元(以较高者为准)。 但从长远看,这未必完全是坏事。中国AI企业在国内已经习惯了较为严格的监管语境,包括算法备案、深度合成标识等制度。在适应欧盟透明度规则方面,中国企业的起点可能比美国同行更高。关键在于能否将合规成本转化为市场竞争优势:一个明确标注了AI身份的产品,可能更能赢得欧洲用户的信任。正如我们在 ChatGPT Health 的医疗监管困境 中所分析的,AI产品在缺乏明确监管标识时,用户信任度会显著下降,这一问题在高度敏感领域尤为突出。 禁止条款阴影:AI风险分级正在加速成型 透明度条款只是第一波。2026年晚些时候,EU AI Act 的禁止条款将正式启动,首当其冲的是生成非自愿私密图像的系统——所谓去衣应用被与儿童性虐待材料归入同一禁止类别。这一定性极其严厉,且无可辩护余地。 将AI用于制造非自愿私密内容的行为与CSAM(儿童性虐待材料)并列,反映了欧盟在此问题上的零容忍立场。对涉足图像生成领域的AI企业而言,内容安全审核不再是一个可以后续优化的功能,它直接决定了产品是否能够在欧盟市场上合法存在。此前
9 7 月
Nvidia + Hugging Face 联手:开源机器人迎来「Android 时刻」— GR00T 1.7 进入 LeRobot
一句话结论:Nvidia 和 Hugging Face 将开源 humanoid 基础模型 GR00T 1.7 和 Teleop 数据采集框架整合进 LeRobot,连接 300 万机器人开发者与 1600 万 AI 开发者——这是开源机器人生态的「Android 时刻」。 宣布了什么? 7 月 7 日,Nvidia 和 Hugging Face 宣布将 Nvidia 的核心物理 AI 技术栈整合进 Hugging Face 开源的 LeRobot 机器人库。具体包括: Isaac GR00T 1.7:首个开源且可商用的 humanoid(人形机器人)基础模型,现已直接可用
Isaac Teleop:数据采集框架,用于收集机器人操作数据
Cosmos...
9 7 月
中国考虑限制 AI 模型出口:中美「技术铁幕」从单向封锁变为双向关门
一句话结论:7 月 7 日,Reuters 独家报道中国正与阿里巴巴、字节跳动、Z.ai 讨论限制最先进 AI 模型的海外访问——这是中美 AI 铁幕从「单向封锁」变为「双向关门」的关键转折点。免费开源这张中国 AI 最大的牌,可能即将被收回。 发生了什么? Reuters 7 月 7 日援引三名知情人士报道,中国政府部门已与阿里巴巴、字节跳动和 Z.ai(智谱)举行会谈,讨论是否限制外国用户访问其最先进的 AI 模型——包括尚未发布的模型。目前尚未做出最终决定,相关部委也未发表官方评论,但讨论中已出现具体选项:禁止公开发布、限制国内使用、分级授权访问。 TIME 杂志次日发表评论,点出了最尖锐的矛盾:中国 AI 公司通过免费开源策略获得了全球影响力,而限制访问意味着放弃这张牌。一个追赶者不会放弃最大的优势,除非担忧的是国家安全。 几乎同步发生的连锁事件让这场博弈的轮廓更加清晰: 阿里巴巴宣布 7 月 10 日起内部禁用 Claude Code,并将所有 Anthropic 产品列入高风险软件清单,要求全员转向自研 Qoder 平台
此举直接回应 Anthropic 在 Claude Code 中嵌入的隐写检测代码(检查时区和代理,识别中国用户)
Z.ai 6 月底发布了 GLM-5.2,声称在漏洞发现能力上对标...
7 7 月
Anthropic J-space 深度解读:Claude 内部自发形成了「全局工作空间」— AI 可解释性的第三个里程碑
一句话结论:继 NLA 读取 Claude「内心」之后,Anthropic 7 月 6 日发布新研究——Claude 内部自发形成了一个被称为 J-space 的全局工作空间,它能持有不写出来的「无声思维」,其功能特性与人类意识的核心机制高度吻合。这是继电路追踪(2024)和 NLA(2026.05)之后,AI 可解释性领域的第三个里程碑。 发生了什么? 2026 年 7 月 6 日,Anthropic 发布了一篇 16 位作者署名的重磅论文——Verbalizable Representations Form a Global Workspace in Language Models。论文的核心发现是:Claude 的语言模型在训练过程中自发地形成了一个内部「全局工作空间」(global workspace),研究人员称之为 J-space。 这个发现的意义在于——它不是被设计的。没有工程师写代码说「现在创建一个工作空间层」。它是在模型通过海量数据学习语言和推理的过程中涌现出来的结构。 更引人注目的是,J-space 的功能特性与神经科学中 Bernard Baars 提出的「全局工作空间理论」(Global Workspace Theory)高度一致。这个理论是理解人类意识的关键框架之一:大脑像一个剧院,数十个专门处理器在后台并行工作,只有一个狭窄的「聚光灯」——全局工作空间——在任意时刻广播信息,成为我们意识到的思维。 J-lens:一扇读取 AI「无声思维」的新窗口 这次发现的工具基础是一种新的可解释性技术——Jacobian lens(J-lens)。 J-lens...




