Files
deep_research/projects/dual-target-rnai-pipeline-2026/phase4/zh_chunks/055-b055-bd3cdced.md
T
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

18 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
## 9.4 四个监管向量共同构成供应商资质壁垒
任何新兴合同开发与生产组织(CDMO)若要获得双靶点siRNA合格供应商地位,必须满足上述四个监管向量所要求的全套文件:
**依据国家药品监督管理局(NMPA)2026年指南及欧洲药品管理局草案对齐要求** [src_B18][src_J05]:三层杂质规格(每条链中间体及最终双链体,需同时覆盖变性和非变性条件);对每种起始物料中所有第III类和第IV类杂质进行归趋与清除评估;任何酶法步骤均须提供宿主细胞蛋白(Host-Cell Protein)、内毒素及残留酶规格,并以最少3批次数据证明批间一致性;还须提供酶的身份信息(物种、序列)、保真度(每核苷酸错误率)以及针对2'-修饰连接位点的底物特异性。
**依据FDA/CDER惯例及ICH Q11问答** [src_J01][src_J05]:受保护核苷亚磷酰胺单体通常可作为起始物料,但须有充分依据;对于酶连接步骤,GMP管控须从片段合成阶段开始;能够区分两条靶链同质量异构缺失序列的高分辨质谱(HRMS)分析方法是现行操作标准,即便尚无已发布的限度阈值。
**依据ICH Q3D(R2)** [src_J02]ICP-MS铜残留规格须不超过控制阈值(按每日等效剂量调整后为30%×300 µg/天,对于已获批GalNAc-siRNA剂量范围通常为50–90 ppm);若超出阈值,须提供有据可查的铜清除验证,必要时还需提供毒代动力学亚因子论证;固相载体来源的接头可浸出物须作为第IV类非寡核苷酸杂质进行评估。
**依据ICH Q13(适用于流动酶法合成)** [src_J03]:批次定义须包含明确的起止判据及物料转移策略;需考虑连续工艺验证要求;实时在线酶活力监测作为符合ICH Q13的控制策略。
**反向证据:ICH Q13落地存在真实的监管阻力。** 截至2026年4月,尚无任何FDA批准的寡核苷酸产品采用符合ICH Q13的连续酶法工艺——已获批的7款GalNAc-siRNA药物均依赖批次固相合成 [src_E04]。ICH Q13明确指出,新型制造模式需与监管机构直接沟通;申办方若将ICH Q13应用于酶连接步骤,将面临更严格的审查,原因正是缺乏先例,与批次合成路线相比,提交前沟通周期将额外增加6–18个月 [src_J01]。NMPA 2026年指南的适用范围也仅限于"创新药",不涵盖仿制药——杂质阈值未必适用于未来可能出现的寡核苷酸简化申报路径,因此同时面向创新药和仿制药市场的供应商,在NMPA和FDA明确后续申报框架之前,须按更高的创新药标准维护全套文件。
上述阻力客观存在,但对于提前布局的供应商而言恰恰是优势。以上资质核查清单并非临时性监管要求——随着更多双靶点新药临床试验申请(IND)推进至新药申请(NDA)阶段、监管机构积累先例,要求只会趋严。能够向申办方提供覆盖全部四个监管向量预验证文件包的CDMO或酶供应商,可将申办方的化学、生产和控制(CMC)开发周期缩短6–12个月。这种时间压缩效应,远比单位成本优势更具商业护城河价值,也正是投资文件基础设施的根本理由。
---