Files
deep_research/projects/dual-target-rnai-pipeline-2026/phase4/zh_chunks/041-b041-eb573bd8.md
T
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

24 lines
3.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
## 7.1 双靶点siRNA批次放行所需的强制性质控酶试剂盒
批次放行遵循类似USP <1239>寡核苷酸身份测试的工作流程:完整质量液相色谱-质谱/飞行时间质谱(LC-MS/TOF)确认、核苷组成分析、自下而上序列图谱分析、双链体验证及杂质谱分析。每个步骤至少需要一种高特异性生物催化剂。
**核苷组成分析(nucleoside composition analysis**采用核酸酶P1(来源于*Penicillium citrinum*,具有广谱3'→5'单链RNA/DNA活性,释放5'-单磷酸核苷)+ 蛇毒磷酸二酯酶ISVPD,3'→5'外切核酸酶,完成二核苷酸消化)+ 碱性磷酸酶(小牛肠碱性磷酸酶或rSAP,去磷酸化生成游离核苷,用于反相液相色谱-质谱检测)[src_C14]。若去磷酸化不完全(37°C下30分钟内转化率须>99%),79.97 Da的磷酸基团质量偏移将产生重叠电荷态,导致核苷定量比例失效 [src_D07]。
**自下而上序列图谱分析**采用核糖核酸酶T1(来源于*Aspergillus oryzae*11 kDa),该酶在单链RNA中鸟苷3'端切割(特异性标记为Gp↓N),每条21聚体GalNAc-siRNA链可生成3至6个可唯一比对的片段 [src_C14]。辅以核糖核酸酶ARNase A)消化(Cp↓N / Up↓N),提供重叠覆盖以完成全序列验证。对于双靶点构建体,基因A和基因B的正义链/反义链均须独立进行图谱分析,与单靶点药物相比,每批次酶用量翻倍。
**单独使用核酸酶P1**已成为高度修饰siRNA的首选单酶方案。Jones等人2023年发表于《分析化学》(Analytical Chemistrydoi:10.1021/acs.analchem.2c04902)的研究表明,部分核酸酶P1消化可提供稳健的5'端和3'端覆盖及重叠片段,不受2'-氟化状态、硫代磷酸酯含量或2'-OMe取代程度影响——其表现优于核糖核酸酶T1,后者的Gp↓N切割活性因2'-修饰鸟苷而部分减弱 [src_H01]。
**无RNase的DNase I**在工作流程中有两处应用:(1)拼接RNA连接中的在制品DNA夹板去除——兆维的sgRNA/siRNA工艺明确在色谱纯化前用DNase I消化DNA夹板;(2)DNA模板或基因组残留的质控检测 [src_B16]。关键规格要求RNase交叉活性<0.01%;即使微量污染也会降解RNA分析物并使序列图谱分析失效 [src_D07]。
**多核苷酸激酶(T4)**在连接位点引入T4 RNA连接酶1和2所需的5'-磷酸基团 [src_E42]。对于由约7聚体片段组装的批次,每条21聚体链需进行三次T4 PNK反应(每个双链体共六次),使其成为连接批次的化学计量量在制品酶,同时也是短链杂质32P末端标记检测的关键质控试剂 [src_B16]。
| 酶 | 特异性 | 主要检测用途 | 双靶点影响 | GMP供应商数量 |
|---|---|---|---|---|
| 核酸酶P1 | 广谱单链RNA/DNA 3'→5' | 核苷图谱;自下而上序列分析 | 每对链用量翻倍 | 3–4 |
| 核糖核酸酶T1 | Gp↓N(单链RNA) | 自下而上图谱分析 | 两对链均须图谱分析 | 3–4 |
| 核糖核酸酶A | Cp↓N / Up↓N(单链RNA | 重叠覆盖 | 标准 | 23 |
| SVPDPDE I | 3'→5'外切核酸酶 | 核苷消化完成 | 标准 | 2–3 |
| 小牛肠碱性磷酸酶 / rSAP | 5'-磷酸水解 | 质谱前去磷酸化 | 必需 | 4–6 |
| DNase I(无RNase | 双链DNA/单链DNA | 夹板去除;DNA纯度质控 | 连接批次强制要求 | 4–6 |
| T4 PNK | 5'-OH → 5'-P | 连接底物制备;32P杂质检测 | 连接批次强制要求 | 3–5 |