paper-pilot-before-batch — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited paper-pilot-before-batch (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
批量任务的可怕之处:跑错 1 个 = 跑错 100 个。 小样本花 1 分钟,全量跑错回滚要 1 小时。
批量是放大器。脚本对了,放大效率;脚本错了,放大灾难。
满足任一条 → 触发:
检测到批量操作
│
▼
随机抽 3–5 个样本(不要只取前 3 个,前 3 个常常是规整数据)
│
▼
只对样本执行
│
▼
把样本结果展示给用户:
- 每个样本的"改动前 vs 改动后"
- 每个样本的"判断依据"(为什么这样改)
│
▼
明确问用户:
「这是 N 个样本的改法,逻辑对的话我推全量(共 M 个)。
有不对的请指出,我调整后重新跑样本。」
│
▼
确认 → 全量(≥ 30 时配合 paper-parallel-audit 用并行 Agent)
不对 → 改逻辑 → 重新跑样本抽样要覆盖边界情况:
不要 head -3 —— 前 3 个常常是规整数据,跑过样本不代表跑过全量。
这是个批量操作,共 M 个对象。 先抽 5 个样本跑一下,包括 1 个常见情况、1 个边界情况、1 个不该被改的情况。
>
[样本 1] 改前 → 改后,依据:… [样本 2] … [样本 3] …
>
5 个看着对的话,我就推剩下的 M-5 个。 有看着不对的请指出来,我调整后重跑样本。
用户:「把所有引用的格式按 GB/T 7714 统一一下。」(共 156 条)
错误做法:写一个正则脚本,一次性跑 156 条——结果发现:
正确做法:先跑 5 条样本(含 1 条中文姓名、1 条多作者带"等"、1 条单作者)→ 用户检查 → 修正脚本 → 再推 156 条。
| 念头 | 现实 |
|---|---|
| "我已经在脑子里推演过了,肯定对" | 推演 ≠ 实测。书里的 156 条惨案,AI 也"推演过" |
| "用户着急,跳过样本更快" | 跑样本 1 分钟 vs 跑错回滚 1 小时 |
| "这个任务很简单,正则一行就搞定" | 简单的正则吃掉的都是边界情况 |
| "我跑前 3 个验证一下" | 前 3 个不是样本,是规整数据 |
| "我备份了,跑错了能回滚" | 回滚是兜底,不是策略 |
| "用户说他相信我直接全量跑" | 仍然先 5 个样本,跑出来给他看 |
paper-parallel-audit 用并行 Agentpaper-confirm-before-doing 已经确认过方案《Claude Code 科研手记》第 10 章「并行 Agent」、§4.2「批量文献核查」
~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.