dr-reconstruct — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited dr-reconstruct (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
核心原则: Deep Research 是侦察兵,不是测绘兵。DR 报告的价值在于发现方向,不在于提供可直接使用的引用。任何来自 DR 的具体文献、数值、归因,必须经过独立验证后才能进入正式写作或战略决策。
防杜撰原则(CLI 多分支必读): 主 agent 在视图里看不到 subagent tool call 历史时,必须先 ls 文件系统验证产物,再判断工作是否完成。视图缺失 ≠ 工作未做。未经文件系统验证的自我怀疑会导致主 agent 编造"坦白未执行"的错误输出——这是本 skill 在 CLI 端多 btw/resume 分支场景下最严重的已知失败模式。
依赖技能: -literature-search-omfs— Entrez API 规范(检索前读取references/entrez-api.md) -literature-manager— 验证通过的文献存入管理库 -humanizer-zh— 重构文本去 AI 痕迹(如适用中文写作)
Deep Research(launch_extended_search_task / Claude web DR / 其他)是独立搜索代理,不使用 project-level skills,不调用 Entrez API,不遵循 literature-search-omfs 的反幻觉规则。基于本地核查 100+ 学术 claim 和 175+ 战略 claim 的经验,DR 错误分布:
| 问题类型 | 发生率 |
|---|---|
| 完全捏造文献 | ~5% |
| 作者归因错误(通讯作者代替第一作者) | ~11% |
| 标题/内容描述偏差 | ~15% |
| 具体数值无法从摘要验证 | ~20% |
| 问题类型 | 实战案例形态 |
|---|---|
| 数量级/汇率错($B → $0.1B 级) | 上市公司年收入 10× 高估、RMB 估值未换汇率直接乘 1 写错 |
| 股票代码错 | DR 把相近上市公司代码互相张冠李戴 |
| 产品码/监管分类错 | 某骨科产品码被 DR 误作相近领域产品码的衍生;产品码 device description 定义错 |
| IPO/融资完成状态错 | Brainlab €1.67B IPO 被推迟误作完成 |
| 流行病学/手术率错 | 某国手术量 10× 高估;"某国率最高"类 folklore |
| 整段论据崩塌 | 某章节核心论点三条证据全挂(捏造 + 论文不存在 + 方向相反 三类错误并发) |
这些错误对论文写作 + 战略决策 + FDA 申报均不可接受。
原则:完全由用户人工判定,不做自动判定。主 agent 的任务是:读 DR → 汇报 DR 特征 → 提供推荐参考 → 请用户决策。
主 agent 读完 DR 后,向用户汇报以下要素(作为决策依据):
推荐参考(仅供参考,不代替用户决策):
| DR 特征 | 参考倾向 |
|---|---|
| 纯学术引用 + claim 少(<30) | 倾向模式 A 轻量 |
| 多域(含 FDA / 财报 / 市场 / CPT / 监管 / 流行病学 任一) | 倾向模式 B 战略 |
| claim 很多但单域 | 介于两者之间,列出 token/时长/产物差异让用户权衡 |
| 面向战略决策 / 监管申报 / PhD proposal | 倾向模式 B(产物直接可用) |
| 面向综述写作 / 文献整理 | 倾向模式 A(快速定位文献) |
绝不自动启动——把判定权交给用户。询问示例:
"DR 特征汇报完毕:约 X 条 claim,覆盖 [学术 + FDA + 商业],产出目标 [<用户指定>]。 参考倾向:模式 B 战略(预估 1-2 h、1-2M token、多产物)。 或可走模式 A 轻量(15-20 min、2 产物,但非学术 claim 需手动处理)。 你选哪种?"
战略模式 Phase 1 学术组直接复用轻量模式的 Entrez 三重匹配子流程(不重复实现,避免代码分叉)。
literature-search-omfs/references/entrez-api.md;先查 DR 引用存在性,再用纯主题关键词扩展见 references/light-output-templates.md
| 指标 | DR 单独 | + 轻量重构 |
|---|---|---|
| 文献可验证率 | ~70% | 100% |
| 作者归因准确率 | ~80% | 100% |
| 捏造文献 | ~5% | 0% |
| 耗时 | 几分钟 | 15-20 min |
Phase 0:读 DR + 原子化 claim + 按域分组 + 估算 subagent 数量和主题
Phase 1:并行 subagent 核查(通常 5 组,按内容类型分工)
Phase 2:可选分叉(用户决定 or agent 推荐)
- B 路径:Tier 1 战略锚点独立二次验证(纠错深挖)
- C 路径:DR 盲区扩展补充(新主题)
Phase 3:多产物输出(主报告 + URL 表 + claim-diff + MANIFEST)详细执行指南 → references/strategic-pipeline.md
按内容类型而非 DR 章节分组(5 种典型域):
| 组 | 负责主题 | 主要工具 |
|---|---|---|
| A 学术论文 | AI / ML / Foundation Model / Agent 论文 | arXiv + Semantic Scholar + PubMed + 会议 proceedings (NeurIPS/ICML/ICLR/ICCV/CVPR/ACL) |
| B 临床医学 | 临床证据 / 流行病学 / 方法学 | PubMed Entrez + 期刊官网 + 国家级 registry (NIS/NASS/DRG/NHIS/NHIRD) |
| C 监管 | FDA 510(k)/De Novo/PMA / NMPA / CE / PCCP | FDA Innolitics + fda.report + 21 CFR 原文 + 公司 PR |
| D 商业 | 公司估值 / IPO / 融资 / 装机量 / 并购 | SEC EDGAR + 公司 IR + Bloomberg + BusinessWire + 中文财经 |
| E 市场 | TAM 规模 / CPT 支付 / NTAP / 手术量 / 市场研报 | Grand View Research + MarketsandMarkets + Mordor + CMS PFS + AMA |
每个 subagent 的 prompt 规范 → references/subagent-prompt-template.md
Phase 1 核查时对每条 claim 标注 Tier:
| Tier | 判定标准 | 处理强度 |
|---|---|---|
| Tier 1 | 战略锚点级(影响用户项目决策的关键数字/引用) | 必须原文句子级溯源 + 战略影响分析 |
| Tier 2 | 重要但非战略(数字错可能误导下游引用) | 二次验证 + URL 溯源 |
| Tier 3 | 细节偏差(年份/venue/作者归属微差) | 快速扫描 + 简表标注 |
Tier 1 典型特征:用户项目的核心商业对标数字 / 核心监管 predicate / 核心学术 baseline / 核心导师/合作者归属。
B 路径(纠错深挖):针对 Phase 1 Tier 1 做独立二次验证
C 路径(盲区扩展):对 DR 未覆盖但应覆盖的主题做独立核查
可选性:轻量 DR 不需要 B/C;战略 DR 建议至少跑 B;盲区多时加 C。
| 产物 | 用途 |
|---|---|
| 主报告重构版 | 保留 DR 原结构 + 每章可信度评分 + 战略叙事 ready-to-copy 替换段落 |
| URL 溯源总表 | 所有 claim × 源头 URL/DOI/PMID(引用时 Ctrl+F 查) |
| claim-diff 对照表 | DR 原版 → Phase 1 → B → C → 最终 多层修正轨迹(方法论价值,向导师展示时的差异化资产) |
| SESSION-MANIFEST | 分支 session-id + 产物清单 + 决策节点 + 最终结论(CLI 多分支回溯必备) |
文件命名规则 + 格式模板统一放在 → references/strategic-output-templates.md
当 subagent A 和 B 判断冲突时:
N 个 subagent 各写独立 md 落盘 + 最后主 agent 合并
<项目根目录>\<项目名>\ 下子目录| 指标 | DR 单独 | + 战略重构 |
|---|---|---|
| 数字可靠率 | ~70% | 95%+ |
| 数量级/汇率错识别 | 0% | 100% |
| 完全捏造识别 | 0% | 100% |
| 产物直接可用于 proposal/申报 | 否 | 是 |
| 耗时 | 几分钟 | 1-2 h(含 subagent 调度 + 合并) |
| Token 消耗 | 小 | 1-2 M(学术任务强制 opus,不降级) |
FDA / SEC / 公司 IR / CMS / 中文财经 / 股票代码 / 市场研报 的 primary sources 索引与具体方法 → references/non-academic-verification.md
触发条件:DR 出现
触发:DR 出现 $XX B、X 亿元、X 万例、X 万/年 等大数字
流程:
实战案例形态:
信号(满足 ≥3 条即判定):
结论:标记 ❌ 建议删除;寻找真实等价文献作替代引用。
实战案例形态:
机制提示:DR 更可能在 近 2-3 年内新文献上捏造(LLM 训练数据对最新文献覆盖不足)。
当某论点的核心证据全部失效(≥2 条核心引用捏造 / 错归属 / 方向相反):
流程:
实战套路:某章节核心论点若干条证据全挂后,先判断底层论断方向是否仍成立(DR 可能引用错但论断方向对),再用多篇真实文献(含最强定量锚 + 正反双向证据)重建完整证据链,产出 ready-to-copy 段落供用户直接替换进正式产物。
工作完成后,所有产物整理到项目目录(避免散落根目录):
<项目根目录>\<项目名>\<DR核查主题>_<YYYY-MM-DD>\
├── 00_README.md ← SESSION-MANIFEST 副本作导航
├── 01_输入_DR原报告_<主题>.md ← DR 原文(重命名避免 artifact 长哈希名)
├── 02_Phase1_并行核查/ ← 5 组 subagent 输出
├── 03_Phase2B_纠错深挖/ ← 战略模式 B 路径(如启用)
├── 04_Phase2C_盲区扩展/ ← 战略模式 C 路径(如启用)
├── 05_Phase2_最终合并.md ← 综合战略判断
├── 06_Phase3_最终产物/ ← 主报告 + URL 表 + claim-diff + MANIFEST
└── 99_辅助数据/ ← subagent 拉取的原始 PDF/TXT(如 arXiv PDF)轻量模式产物少,可平铺不分子目录。
文件夹命名:主题 + 日期(支持未来二次核查版本区分);中文可用,× 号(U+00D7)在 Windows 路径合法。
ls <产物路径> 验证| 文件 | 内容 | 何时读取 |
|---|---|---|
references/light-output-templates.md | 轻量模式核查清单 + 重构报告格式模板 | 触发轻量模式第 7 步输出前 |
references/strategic-pipeline.md | 战略模式 Phase 0/1/2/3 完整执行指南 + Phase 2 B/C 决策细节 | 触发战略模式 Phase 0 读 DR 后 |
references/subagent-prompt-template.md | 5 类 subagent prompt 模板(Phase 1 A/B/C/D/E)+ β/γ 深挖 prompt 模板 | 启动 subagent 前 |
references/strategic-output-templates.md | 主报告 / URL 表 / claim-diff / MANIFEST 四种产物格式模板 | Phase 3 输出前 |
references/non-academic-verification.md | FDA / SEC / IR / CMS / 市场研报 / 股票 / 中文财经 验证方法清单 | 战略模式 Phase 1 C/D/E 组启动前 |
本 skill 基于多域 DR 核查项目的实战经验迭代
~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.