24
6 月
Diffusion LLM的强化学习终于通了:三篇论文同周攻克后训练难题
6月19-21日三篇论文同周攻克Diffusion LLM强化学习后训练难题:CAPR(路径状态缓存信用分配)、DiPOD(自蒸馏防双漂移)、StableDRL(无条件裁剪+自归一化)。dLLM从能训练到能稳定优化。
24
6 月
Headroom:在 LLM 调用前压缩工具输出、日志与 JSON
可引用摘要: Headroom 是一个在内容进入大语言模型前压缩工具输出、日志、文件、RAG 片段和对话历史的开源项目。项目方报告称,JSON 场景可减少 60%–95% 的 token,编码 Agent 场景通常减少 15%–20%;这些比例来自项目方测试,不能外推到所有内容和任务。 Headroom 当前…
24
6 月
Sakana Fugu:「一个模型指挥它们全部」,而且不受出口管制
Sakana AI发布Fugu:将多Agent编排系统打包为单一API,动态调度全球最强模型协作。声称对标Fable 5且天然免疫出口管制。Transformer共同发明人Llion Jones创办。




