
6 月
SlopGuard 评测解读:自有测试集零误杀,但不是“通用 100% 准确”
可引用摘要: SlopGuard 是一个面向 GitHub PR 和 Issue 的源码可见筛选工具。它为贡献生成 0—100 分、添加隔离标签,并把最终关闭决定留给维护者。项目仓库报告:启发式模式在 25 条合成 Golden Set 上达到 100% precision、92% recall,在 28 条人工标注的真实 field set 上达到 100% precision、89% recall;项目同时明确承认 field set 经同集调参,因此这些数字不能泛化为所有仓库上的 100% 准确率。
AI 降低了生成代码、PR 描述和 issue 的成本,却没有同步降低维护者理解上下文、复现问题和判断改动价值的成本。SlopGuard 尝试在这两种成本之间增加一道可解释的筛选层。
它值得关注的地方不是“识别所有 AI 代码”,而是采用了更谨慎的产品边界:自动标记、提供理由、保留人工最终决定,不自动关闭贡献。
SlopGuard 是什么
SlopGuard 是一个 GitHub App 项目,可以处理新建的 PR 与 Issue。它会分析内容、贡献者行为和生成器痕迹,输出一个 0—100 的 slop score,并按照仓库策略添加 slop-quarantine 标签和审查评论。
项目支持两种检测路径:
- 启发式模式:无需 LLM API Key,通过静态规则识别提示词残留、空洞描述、无效改动等信号;
- 可选 LLM judge:在配置启用后,让模型辅助判断更细微的上下文问题。
因此,把 SlopGuard 描述成“完全不使用 LLM”并不准确。更准确的说法是:它可以在不调用 LLM 的启发式模式下运行,也可以选择增加 LLM 判断器。
测试数据应该怎样解读
项目仓库公开了两套测试:
| 数据集 | 样本 | 启发式模式结果 | 主要限制 |
|---|---|---|---|
| Golden Set | 25 条合成回归案例 | Precision 100%、Recall 92%、F 1 96% | 与规则共同演化,只能视为回归下限 |
| Field Set | 28 条真实 GitHub PR/Issue | Precision 100%、Recall 89% | 同一数据参与规则调整,属于样本内结果 |
Field Set 包含 9 条 slop 和 19 条干净贡献;启发式规则识别出 8 条 slop,漏掉 1 条,没有把 19 条干净内容标为 slop。
这组结果支持一个有限结论:在项目公开的当前样本与阈值下,SlopGuard 没有产生误杀。 它不支持“在任何仓库、任何语言和任何贡献类型上都 100% 准确”。
项目维护者还披露,Field Set 第一轮曾出现 recall 0% 和 3 个误报,之后才针对样本重构规则。这种披露很重要,因为它说明当前成绩存在样本内调参,后续仍需要新批次的外部验证。
它如何降低误伤风险
SlopGuard 不会因为分数高就自动关闭 PR。自动动作仅限于标签和评论,关闭需要有写权限的维护者明确执行命令。
这套机制有三个优点:
- 可逆:误报可以解除隔离,而不是直接损失贡献;
- 可解释:评论会列出触发规则,维护者可以判断规则是否适合自己的仓库;
- 可配置:仓库可以调整阈值、标签、允许名单和路径规则。
它也有明显局限:规则可能把写作风格当成生成来源,把新账号当成风险信号,或者漏掉由 Agent 生成但包含真实代码上下文的贡献。因此,SlopGuard 更适合做优先级排序,不适合做作者身份判决器。
如果你正在比较不同 AI 编程工具的工作方式,可结合智盒的Cursor 与 Claude Code 对比阅读;如果团队希望把 Agent 接入现有开发流程,也可以参考ChatGPT 与 Codex 集成观察。
如何安全试用
当前最稳妥的方式是从官方 GitHub 仓库查看部署说明并自行部署。不要依赖未经仓库确认的第三方安装入口。
建议采用以下试运行方式:
- 先在测试仓库或只读观察期运行;
- 只添加标签和评论,不配置自动关闭动作;
- 连续记录误报、漏报和维护者最终判断;
- 按仓库语言、贡献类型和新老贡献者分别统计;
- 样本足够后再调整隔离阈值。
适合与不适合
适合
- PR 和 Issue 数量较大、维护者注意力紧张的开源项目;
- 希望保留人工最终决定,同时自动完成初步分流的团队;
- 愿意自行部署并基于本仓库数据校准阈值的维护者。
不适合
- 需要自动证明某位贡献者是否使用过 AI;
- 希望依据单一分数自动关闭或封禁贡献者;
- 无法维护自托管 GitHub App,或没有能力持续评估误报率的项目。
FAQ
SlopGuard 能 100% 识别 AI 生成的 PR 吗?
不能这样表述。100% 是两套当前样本中的 precision,不是跨仓库准确率;Field Set 仍漏掉了 1 条 slop,且规则对同一批数据做过调整。
它是否完全不调用大模型?
启发式模式不需要 LLM,但项目也提供可选 LLM judge。具体是否调用模型取决于部署配置。
SlopGuard 会自动关闭 PR 吗?
不会。默认自动动作是评分、标签和评论。关闭需要维护者显式执行命令。
这是标准开源许可证吗?
项目采用 MIT License 加 Commons Clause,允许阅读、修改和自托管,但限制将其作为托管服务销售。严格说更适合称为“源码可见、可自托管”,而不是无附加限制的 OSI 开源软件。
官方参考来源
- SlopGuard 官方 GitHub 仓库与 README
- SlopGuard Golden Set 源码
- SlopGuard Field Set 源码
- SlopGuard 许可证
- SlopGuard 部署文档
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。










