thesis-critical-review — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited thesis-critical-review (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
版本:0.1.0-draft 创建日期:2026-04-13 来源:从真实论文项目多轮critical review + 答辩预演经验中提炼 定位:模拟答辩委员/审稿人对论文的深度攻击。纯LLM判断,无机械检测
这个skill的角色是对抗者,不是帮手。它的工作不是让论文"更好",是找到论文中审稿人/答辩委员最可能攻击的点,让用户在被攻击之前先堵上。
以下任一情况触发:
stage=design 设计期审查审查对象: Research Blueprint / 研究提纲 / 开题报告
输入:
维度(B1-B6):
| # | 维度 | 核心质疑 |
|---|---|---|
| B1 | 问题价值 | 这个问题的答案对谁有用?文献留下的gap是真gap还是别人不做是因为不值得做?如果答案是"和预期一致",论文还有贡献吗? |
| B2 | 方法-问题匹配 | 你选的方法能回答这个问题吗?有没有更直接的方法被跳过了?方法的固有局限是否会让结论打折到不值得做? |
| B3 | 数据架构 | 各部分用的数据之间是什么关系?同一队列/独立队列/子集?这个关系对论证是优势还是弱点?如果是独立队列,是否需要披露?如果是子集,嵌套偏倚怎么处理? |
| B4 | 逻辑递进 | 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?如果某部分结论不支持预期,后续还能立住吗?呈现顺序和研究顺序如果不同,是否需要管理? |
| B5 | Fallback | 最可能失败的环节是什么?失败后论文还能成立吗?有Plan B吗?Plan B是降级版本(缩小scope)还是替代路径(换方法)? |
| B6 | 攻击预演 | 如果审稿人只看摘要就写reject,最可能的理由是什么?如果答辩委员只问一个问题,最可能问什么? |
输出特点:
stage=drafting 写作中审查审查对象: 单章草稿(引言+方法+结果+讨论的任意组合)
输入:
维度(D1-D5,章级版本):
| # | 维度 | 章级审查聚焦 |
|---|---|---|
| D1 | 跨章逻辑连贯性 | 这章的引言是否承接了上一章的结论?这章的结论是否为下一章铺路?章间是否有逻辑断层? |
| D2 | 因果与时间假设 | 这章的因果推断链条是否清晰?观察性数据是否被当作因果证据?时间尺度是否匹配? |
| D3 | 选择偏倚与外推性 | 这章的样本筛选过程是否透明?排除标准是否合理?结论外推到什么范围? |
| D4 | 测量效度 | 这章用的指标是否在测想测的东西?替代指标的局限是否在方法或讨论中说明? |
| D5 | 统计方法充分性 | 计划/已用的统计方法是否匹配数据结构?假设是否满足?样本量是否足够? |
D6(临床解读)和D7(内容比例)在这个阶段不跑——讨论和全文结构还没成型。
输出特点:
stage=final 成文后审查审查对象: 完整论文
输入:
thesis_full.txt(完整论文)study_design.md(研究设计摘要——有则审查精度更高)known_limitations.json(用户已知局限——避免重复指出)维度(D1-D7,全文级):
| # | 维度 | 全文级审查聚焦 |
|---|---|---|
| D1 | 跨章逻辑连贯性 | 各章之间的递进关系是否自洽?数据来源关系是否披露?前一章的结论是否被后一章真正使用?呈现顺序与研究顺序的差异是否被管理? |
| D2 | 因果与时间假设 | 全文的因果推断链是否一致?即时测量→长期结局的推断是否有disclaimer?中介分析/回归分析的因果暗示是否过强? |
| D3 | 选择偏倚与外推性 | 跨章的样本嵌套关系是否交代?各章排除标准的差异是否说明?子集代表性是否讨论? |
| D4 | 测量效度 | 同一指标在不同章节的测量精度是否一致?观察者一致性是否评估?影像终点vs临床终点是否区分? |
| D5 | 统计方法充分性 | 各章统计方法的选择是否一致(如GEE vs logistic,患者级 vs 侧级)?不一致是否解释?敏感性分析是否覆盖关键假设? |
| D6 | 临床/实践解读深度 | 统计显著→临床意义的转化是否完成?对临床实践的建议是否具体?还是停留在"有待进一步研究"? |
| D7 | 内容比例恰当性 | 非核心内容是否过长?局限性是否流于形式?创新点是否overclaim?禁用词检查(首次/首个/开创性/突破性/革命性)。 |
输出特点:
当thesis-critical-review被触发时,Claude按以下流程执行。这不是给用户看的文档,是给Claude自己的操作手册。
B1 问题价值
B2 方法-问题匹配
B3 数据架构
B4 逻辑递进
B5 Fallback
B6 攻击预演
D1 跨章逻辑连贯性
D2 因果与时间假设
D3 选择偏倚与外推性
D4 测量效度
D5 统计方法充分性
D6 临床/实践解读深度
D7 内容比例恰当性
在扫描完所有维度后,用以下标准做最终优先级调整:
跑当前stage的全部维度。
/thesis-critical-review stage=final只跑指定维度。
/thesis-critical-review stage=final dimensions=D1,D5用户给出具体担忧,skill围绕这个点深度挖掘,不限于预设维度。
/thesis-critical-review stage=final focus="我担心中介分析那段的论证力度不够"三个stage共享同一输出格式。
# 批判审查报告
> 生成时间: YYYY-MM-DD HH:MM
> 技能版本: thesis-critical-review 0.1.0
> 审查阶段: design / drafting / final
> 维度范围: [B1-B6 / D1-D5 / D1-D7 / 用户选择的子集]
> 输入文件: [列表]
---
## 第一部分:优先级汇总
| # | 维度 | 问题摘要 | 位置 | 优先级 |
|---|------|---------|------|--------|
| 01 | D1 | ... | Ch2讨论, 约第400行 | ★★★ |
| 02 | D5 | ... | Ch3方法, 约第480行 | ★★★ |
| ... | | | | |
**优先级说明:**
- ★★★ = 必须处理(逻辑缺陷或答辩/审稿必问)
- ★★ = 强烈建议(显著提升论证说服力)
- ★ = 时间允许时处理(打磨)
**统计:** ★★★: N条 / ★★: N条 / ★: N条
---
## 第二部分:逐条详述
### #01 [问题标题] ★★★
**维度:** D1 跨章逻辑连贯性
**位置:** Ch2讨论, 约第400行
**原文:**
> ......前一句。**包含问题的句子或段落**。后一句......
**问题描述:**
[用审稿人/答辩委员的口吻描述这个问题]
**攻击路径:**
[审稿人最可能怎么写这条意见?答辩委员最可能怎么追问?]
**建议处理方向:**
[不写具体文字,只给方向。如"在某章引言中加一段显式说明某关键设计点及其对结论的影响"]
---
[后续条目...]
---
## 第三部分:维度覆盖确认
| 维度 | 状态 | 发现数 |
|------|------|--------|
| D1 跨章逻辑 | ✅ 已扫描 | 3 |
| D2 因果假设 | ✅ 已扫描 | 2 |
| D3 选择偏倚 | ✅ 已扫描 | 1 |
| D4 测量效度 | ✅ 已扫描 | 2 |
| D5 统计充分性 | ✅ 已扫描 | 4 |
| D6 临床解读 | ✅ 已扫描 | 2 |
| D7 内容比例 | ✅ 已扫描 | 1 |
---
## 第四部分:已知局限声明
本审查基于LLM对论文文本的理解,受以下限制:
- 无法验证原始数据的正确性(那是thesis-qc M1-M4的职责)
- 无法评估图表与数据的一致性(那是thesis-qc M7的职责)
- 领域判断基于训练数据,可能遗漏高度专业化的方法学问题
- 审查结果是"供决策参考",不是审稿意见本身stage=finalcritical_review_report.md 注册到MASTER_QC.md文件清单不经过thesis-qc直接触发:
/thesis-critical-review — 自动检测输入内容判断stage/thesis-critical-review stage=design — 显式指定阶段~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.