架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。
新架构:
scripts/lib/zenmux_client.py HTTP 客户端,指数退避重试、token 统计
JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py 按 H1/H2 切块,稳定 anchor ID(order+title
sha1),支持合并/统计
scripts/prompts/translate_system.txt 英译中 prompt,用自定义 <<<TRANSLATION>>>
分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt 中文润色 prompt(留给下一步 polish.py)
scripts/translate.py 主入口:章节级切块 → 逐块翻译 → 拼接
关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force
实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作
下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。
Co-authored-by: User <human>
24 lines
1.1 KiB
Markdown
24 lines
1.1 KiB
Markdown
## 附录
|
|
|
|
### A. 研究方法
|
|
|
|
本报告采用四阶段研究流程完成:
|
|
|
|
1. **框架规划** — 主题界定、10章大纲、63篇文献初步扫描。
|
|
2. **深度研究** — 以15,000英文字为预算并行起草各章节,内嵌来源追踪([src_xxx]格式),并由独立模型对每章进行反证审查。
|
|
3. **编辑审核** — 对全部10章进行端到端一致性核查。
|
|
4. **定稿** — 章节合并、执行摘要/摘要/词汇表撰写、英译中及输出规范验证。
|
|
|
|
所有来源按权威性、时效性、原始性、可核实性和利益冲突五个维度进行0–10分评分。最终数据集共收录44篇独立文献:14篇第一层级(一次文献、监管文件),25篇第二层级(咨询报告、系统综述、行业数据库),5篇第三层级(行业媒体、预印本)。
|
|
|
|
### B. 排除范围
|
|
|
|
以下主题经审慎评估后不纳入本报告:
|
|
|
|
- 超出管线标注范围的临床疗效与安全性细节
|
|
- 非siRNA模式(mRNA、ASO、saRNA、基因编辑),仅在比较背景下作参照
|
|
- 市场规模、收入预测或投资估值
|
|
- 疾病机制与药理学讨论
|
|
|
|
---
|