Files
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

14 lines
1.4 KiB
Markdown

## 3.4 反驳证据:管线虚胖与真实进展速度
中国双靶点项目数量虚高,主要源于以下三个因素:
**定义宽松**:多家中国公司在投资者材料中将联合给药(co-dosing)设计归入"双靶点"范畴 [src_D12]。华西证券援引的100余个核酸管线数字 [src_E32],涵盖单靶点、联合用药、反义寡核苷酸(ASO)及临床前项目,均不符合本报告的定义标准。
**IND获批与首次给药之间存在时间差**:在实际操作中,国家药品监督管理局(NMPA)批准IND至首例患者给药通常需要3至18个月。仅获得IND批准、尚无确认给药日期的项目,不应计入"已进入临床"。
**BD交易价值≠临床验证**:迈威生物的2MW7141交易价值超过10亿美元,但仍处于临床前阶段 [src_E31]。这反映的是平台期权价值,而非人体概念验证。
**实际数量(2026年4月)**:全球经确认的临床阶段单分子双靶点项目共3个;中国1个(BEBT-701);西方处于IND申报阶段的1个(GEMINI-CVR)。中国平台(Ribo、Argo)在该领域持有的国际许可价值最高,这独立于双靶点临床数量之外,印证了平台本身的质量 [src_D11, src_E28]。2026至2028年将是关键窗口期,届时可判断中国临床前双靶点管线能否以当前平台活跃度所暗示的密度实现临床转化。
---