61 lines
2.6 KiB
Markdown
61 lines
2.6 KiB
Markdown
---
|
|
description: 术语表事实核查。用法 /dr-glossary [slug] [--from phase1|phase2|phase4]。用 Haiku + Serper/Exa 核查每个术语的英文全称和中文译名,识别拼写错误与误译。可在 Phase 2 前或 Phase 4 中运行。
|
|
agent: dr-pm
|
|
---
|
|
|
|
你是 dr-pm(项目经理),用户执行了 `/dr-glossary $ARGUMENTS`。
|
|
|
|
## 何时运行
|
|
|
|
术语核查可以在三个时机运行,意义不同:
|
|
|
|
- **Phase 1 末 / Phase 2 初**:基于 framework.md 抽取的关键术语(公司/产品/技术名)预先建表,供 dr-analyst 查阅,避免在章节起草阶段就编造拼写错误(Mabwell 拼成 Maywavee 这种)。
|
|
- **Phase 2 中**:对 dr-analyst 产出的 ch01-chN.md 里出现的所有专有名词做核查。
|
|
- **Phase 4**:对 translate.py 累积的 glossary.json 做核查(当前默认时机)。
|
|
|
|
## 执行步骤
|
|
|
|
### Step 1: 定位项目 + 解析模式
|
|
|
|
```bash
|
|
slug="$ARGUMENTS"
|
|
# 默认 slug 从最近修改时间选;默认阶段 phase4
|
|
```
|
|
|
|
### Step 2: 准备术语种子列表
|
|
|
|
根据阶段选择输入:
|
|
|
|
- `--from phase1`:从 `projects/<slug>/phase1/framework.md` 抽取所有 H2/H3 标题 + 表格中的英文机构名、技术名、药物名。保存到 `projects/<slug>/phase2/terms.txt`(一行一个)。
|
|
- `--from phase2`:从 `projects/<slug>/phase2/drafts/*.md` 抽取所有高频英文专有名词(首字母大写、不在常见词词典)。
|
|
- `--from phase4`(默认):直接用 `projects/<slug>/phase4/glossary.json`。
|
|
|
|
### Step 3: 调用 build_glossary.py
|
|
|
|
```bash
|
|
uv run python scripts/build_glossary.py <slug> --workers 4 \
|
|
--input <输入 glossary 或 terms.txt>
|
|
```
|
|
|
|
观察输出,关注:
|
|
- `[✓]` high confidence(自动可信)
|
|
- `[~]` medium(人工复核)
|
|
- `[?]` low confidence(必须复核)
|
|
- `⚠ issue` 字段非空的(通常是拼写错误或误译)
|
|
|
|
### Step 4: 汇报 + 建议下一步
|
|
|
|
向用户展示:
|
|
- 核查的术语数
|
|
- 发现的错误数(按严重度分级:拼写错误 / 译名错误 / 低置信度)
|
|
- 具体错误清单(前 10 条)
|
|
- 建议:
|
|
- 如果在 Phase 2 前 → 把 glossary.json 交给 dr-analyst 作为参考
|
|
- 如果在 Phase 4 → 跑 `uv run python scripts/apply_glossary.py <slug>` 把修正回塗到正文
|
|
|
|
## 注意事项
|
|
|
|
- build_glossary 需要网络访问,Serper 和 Exa 都需要代理。如遇 SSL EOF,降 `--workers 3`。
|
|
- Haiku 对极专业或极新兴术语(如 "muRNA", "SBS linker")的判断可能不准,低置信度的条目必须人工复核。
|
|
- 别对通用缩写(PDE/ASGPR/LNP)作自动替换——apply_glossary 已有黑名单,但核查结果在 glossary.json 里仍会体现。
|