架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。
新架构:
scripts/lib/zenmux_client.py HTTP 客户端,指数退避重试、token 统计
JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py 按 H1/H2 切块,稳定 anchor ID(order+title
sha1),支持合并/统计
scripts/prompts/translate_system.txt 英译中 prompt,用自定义 <<<TRANSLATION>>>
分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt 中文润色 prompt(留给下一步 polish.py)
scripts/translate.py 主入口:章节级切块 → 逐块翻译 → 拼接
关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force
实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作
下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。
Co-authored-by: User <human>
8 lines
1.8 KiB
Markdown
8 lines
1.8 KiB
Markdown
## 9.2 FDA尚无专门的寡核苷酸CMC指南,但其积累的监管信号所设定的标准已远超现行公开规则
|
|
|
|
截至2026年4月,FDA/CDER尚未发布任何针对合成寡核苷酸原料药化学、生产与控制(CMC)的通用指南文件[src_J01]。FDA/CDER在2022年SBIA演讲中明确指出:"目前既无ICH监管指南,也无FDA通用CMC指南"涵盖寡核苷酸领域;与此同时,该演讲也表明,审评层面的实际操作标准已是基于高分辨质谱(HRMS)对同质量数缺失序列的分辨——即区分名义质量相同、但质量差仅为0.004 Da的n-U与n-C变体[src_J01]。首个寡核苷酸产品专项指南(PSG)于2022年2月针对诺西那生钠发布。
|
|
|
|
对于双靶点siRNA而言,上述空白带来的挑战更为复杂。携带两个功能性双链体的构建体,须同时证明两条靶向链的序列一致性、两个双链体各自的双链完整性,以及两条不同反义链之间不存在跨链异源双链体(hetero-duplex)形成。CDER仿制药办公室已承认,双靶点构建体的"API同一性"缺乏既定监管定义——该概念本身预设的是单一靶向序列[src_J01]。申办方应为每条链的全链级杂质表征及跨链杂质控制预留充足资源,并预判FDA将对每条链独立适用HRMS同质量数分辨要求。
|
|
|
|
FDA于2024年11月发布的非临床指南草案明确要求对寡核苷酸产品的"正义链和反义链"分别进行评估[src_J06]。这一药理学指南对CMC预期具有直接影响:若两条链须在非临床研究中单独评估,则在原料药申报文件中亦须对两条链分别进行规格设定与质量控制。2020至2024年间,CMC缺陷占FDA完全答复函(CRL)的74%[src_J07]——对于双靶点siRNA而言,这一风险敞口只会更高。
|