Files
deep_research/projects/dual-target-rnai-pipeline-2026/phase4/zh_chunks/008-b008-6b20f9ad.md
T
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

2.5 KiB

1.2 每种双靶点设计范式都积累了一笔尚未被行业充分认识的工艺债务

引入第二条沉默序列绝非渐进式的化学改动——它从根本上重构了制造任务。当前四种主流范式(共价连接串联siRNA、多价GalNAc簇骨架、二价分支构建体、鸡尾酒制剂/muRNA)各自带来不同的工艺成本,但无一例外地放大了上游制造步骤的数量、多样性与精度要求。

即便是基准难度,也已相当可观。某领先合同开发与生产组织(CDMO)在将一款标准GalNAc-siRNA推进至GMP生产时,初始收率仅为13%,粗品纯度仅为18%;经过工艺开发后,收率提升至62%,粗品纯度达到75%——但这一结果是在对GalNAc供应链、合成条件及分析方法进行反复迭代优化之后才实现的[src_E05]。双靶点构建体在同样的基准起点上,分子复杂度更高。

三种放大机制同时发挥作用。第一,每增加一条链、一个接头或一个汇聚偶联步骤,净新增合成操作数量为1至3步[src_A01]。对于多价GalNAc簇骨架构型——单一骨架携带4至7个GalNAc单元——在连接寡核苷酸之前,簇的汇聚合成需要完成多步臂偶联反应。市售GalNAc预载固相合成载体(CPG)的载量低于100 µmol/g,对于复杂构建体而言,这"制约了工业规模固相合成"[src_E06];高价态簇因500 Å孔径内的扩散限制,每个位点的偶联循环时间从2分钟延长至6分钟[src_E07]。第二,对于两条链修饰模式各异的共价连接双靶点构建体,亚磷酰胺单体的种类增加20%至40%——每新增一种亚磷酰胺单体,均需通过HPLC独立认证纯度高于99.5%,而特种单体的全球合格供应商本已十分有限[src_A01][src_D03]。第三,酶连接路线——目前已通过Codexis的ECO Synthesis平台实现GMP规模生产,该平台于2025年完成了3 kg临床级siRNA批次的生产[src_B12]——每摩尔原料药所需质控生物催化剂的用量约为纯固相合成路线的3倍,原因在于每个酶连接位点均需通过测序兼容的核酸酶消化和磷酸酶处理来确认链的身份[src_B06]。

瓶颈已向上游迁移。问题不再是"能否沉默基因X",而是"能否在GMP规模下组装并质控这一更复杂的分子"。四个工艺节点集中体现了这一挑战:特种亚磷酰胺单体、高载量固相合成载体、固定化糖基转移酶生物催化剂,以及GMP级质控酶。相对于当前正在成形的管线发展轨迹,上述每一项均存在结构性供给不足。