paper-one-session-one-task — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited paper-one-session-one-task (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
每多做一件事,前一件事的上下文就被稀释一分。 Claude Code 的会话越长,决策质量越差——这不是它"懒",是上下文窗口的物理规律。
一个会话搞定 5 件小事 = 5 件事的质量都打了折。 5 个会话各自做 1 件事 = 5 件事都干干净净。
用户的请求里出现以下任一信号 → 触发:
检测到多任务
│
▼
立即停下,不开始任何子任务
│
▼
列出所有任务,标号
│
▼
告诉用户:「这看起来是 N 件独立的事。
为了不让它们互相污染上下文,建议这次会话只做其中一件。
你想先做哪一件?其他的我们下次开新会话。」
│
▼
等用户选 → 只做被选中的那件我看到这里其实是 N 件事:
>
1. [任务 1] 2. [任务 2] 3. [任务 3]
>
一次会话同时做这几件,到后面 AI 的判断会越来越糊。 建议这次只做其中一件,其他的开新会话各自单做。 你想先做哪一件?
用户:「帮我把第三章润色一下,顺便把参考文献按 GB/T 7714 统一,还有图 3 重新画一下。」
错误做法:依次做完三件事。
正确做法:「这是 3 件独立的事,建议这次只做润色,引文和画图各开一个新会话——这样每件事的输出质量都最高。先做哪个?」
只有以下三种情况:
| 念头 | 现实 |
|---|---|
| "都开着会话了,多做点更省事" | 省下了开新会话的 30 秒,赔进去 30 分钟的质量损失 |
| "用户既然一起说了,肯定希望一起做" | 用户希望"做完",不是"一次说完一次做完" |
| "这几件事我看着不冲突" | 不冲突 ≠ 不污染上下文 |
| "我的上下文还没满,能装下" | 上下文质量不是布尔值,是滑变的 |
| "等我做完 A 再问要不要做 B" | 先把所有任务列清再让用户选才是专业 |
| "用户都打了 3 句话过来了,再让他选很啰嗦" | 不让他选,做错了更啰嗦 |
《Claude Code 科研手记》§3.5「一次会话只做一件事」
~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.