Files
deep_research/projects/dual-target-rnai-pipeline-2026/phase4/zh_chunks/024-b024-80ebd6f8.md
T
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

24 lines
4.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
## 4.3 酶法与化学酶法连接——异军突起的技术路线
酶法连接(enzymatic ligation)将全长siRNA拆分为若干短片段(7–12 nt),以接近定量的效率分别合成各片段,再借助工程化dsRNA连接酶将其拼接。这种模块化逻辑从根本上改变了较长构建体的产率计算方式。
**产率对比**60 nt双功能构建体):
- **固相亚磷酰胺合成(SPOS)按99.5%/循环**0.995^59 = **74.4%**
- **酶法连接:6×10 nt片段**(各片段99.9%/循环 = 99.1%+ 5次连接反应(Codexis工程化连接酶,每次效率95%):(0.999^9)^6 × 0.95^5 = 94.6% × 77.4% = **73.3%**
在60 nt长度下,采用优化连接酶的酶法连接产率与SPOS基本持平,同时片段输入更为纯净,可降低下游纯化负担。构建体超过80 nt时,产率数学进一步向连接法倾斜。
该技术的核心在于连接酶本身。野生型T4 RNA连接酶1(T4 Rnl1)需要5'-磷酸基、3'-OH,且连接位点处必须保留游离2'-OH,因此与2'-OMe修饰末端不兼容[src_E42]。野生型T4 RNA连接酶2虽在双链环境中具有更宽底物耐受性,但在生产浓度下对2'-F/2'-OMe底物的连接效率仍然较低。Codexis提供"专为在生产相关条件下高效组装双链RNAi构建体而开发的优化dsRNA连接酶",与野生型对照相比,其体积生产率和底物通用性均有明显提升[src_B11]。
**20252026年关键验证节点。** 2025年,Codexis的ECO Synthesis平台连接酶在一家领先合同开发与生产组织(CDMO)完成了3 kg siRNA临床批次的生产——这是首个公开披露的治疗性siRNA临床规模酶法连接批次[src_B11]。ECO Synthesis平台的技术转让规模额定值为>10 kg/批次;位于加利福尼亚州海沃德附近的专用ECO GMP生产中心计划于2027年底投入运营[src_B11]。2026年3月,Codexis与一家创新药企业签署了50 g siRNA生产协议,用于一项心血管临床前项目,印证了该平台的商业化吸引力[src_E43]。三项CDMO验证信号进一步佐证了平台的成熟度:
1. **BachemCodexis**TIDES USA 2025):双方联合发布壁报,在Bachem自有设施内对Codexis连接酶与野生型酶进行基准测试;Codexis酶在体积生产率和底物通用性方面均表现更优[src_B12]。
2. **Nitto Denko AveciaCodexis**(2025年10月29日):双方签署评估协议,Nitto Avecia将对ECO Synthesis全平台进行评估,以推进许可合作[src_B15]。
3. **ST PharmCodexis**TIDES USA 2025):第三家CDMO独立在内部验证Codexis连接技术。
**兆维化学酶法连接(中国)。** 兆维于2025年披露了一项化学酶法连接工艺,声称组装寡核苷酸的纯度>95%[src_B16]。短片段在兆维现有48条合成线基础设施上通过SPOS制备,再经酶法拼接。这一方案在充分利用既有资本投入的同时,拓展了合成边界。具体构建体、规模及所用酶尚未公开,但>95%的纯度数据与TIDES会议报告的片段连接法数据相符。
**国家药品监督管理局(NMPA)的监管降险。** NMPA/药品审评中心(CDE)于2026年2月28日以CDE公告第21号发布的《化学合成寡核苷酸药物(创新药)药学研究技术指导原则(试行)》[src_B18],明确列举了三种生产方式:固相合成、液相合成,以及"酶催化片段连接合成"。这是全球首个在寡核苷酸药物指导原则中正式认可化学酶法连接的主要监管机构,早于美国食品药品监督管理局(FDA)或欧洲药品管理局(EMA)的任何同类表态。该指导原则要求针对特定风险实施管控(酶引入的杂质、片段中间体纯度、偶联效率监测),但并不要求连接法证明优于SPOS。对于中国CDMO和开发商而言,这一相对西方时间线领先12–24个月的监管先发优势,是实质性的竞争壁垒。
**现存局限。** 目前仍有三项制约因素。其一,连接位点的序列约束——连接位点处(−1位)需要连接相容性核苷酸(通常为2'-OH或2'-F,而非2'-OMe)——限制了片段设计空间,即便工程化连接酶也尚无法完全绕过。其二,酶法连接与SPOS在商业规模下的每克成本对比数据尚未以同行评审形式公开发表。其三,GMP先例缺口——3 kg批次属于非GMP临床物料级别,ECO GMP设施距正式投产约还需18个月——意味着2026–2027年需要>10 kg批次的III期项目仍将默认采用SPOS。