架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。
新架构:
scripts/lib/zenmux_client.py HTTP 客户端,指数退避重试、token 统计
JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py 按 H1/H2 切块,稳定 anchor ID(order+title
sha1),支持合并/统计
scripts/prompts/translate_system.txt 英译中 prompt,用自定义 <<<TRANSLATION>>>
分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt 中文润色 prompt(留给下一步 polish.py)
scripts/translate.py 主入口:章节级切块 → 逐块翻译 → 拼接
关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force
实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作
下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。
Co-authored-by: User <human>
3.4 KiB
7.1 双靶点siRNA批次放行所需的强制性质控酶试剂盒
批次放行遵循类似USP <1239>寡核苷酸身份测试的工作流程:完整质量液相色谱-质谱/飞行时间质谱(LC-MS/TOF)确认、核苷组成分析、自下而上序列图谱分析、双链体验证及杂质谱分析。每个步骤至少需要一种高特异性生物催化剂。
**核苷组成分析(nucleoside composition analysis)**采用核酸酶P1(来源于Penicillium citrinum,具有广谱3'→5'单链RNA/DNA活性,释放5'-单磷酸核苷)+ 蛇毒磷酸二酯酶I(SVPD,3'→5'外切核酸酶,完成二核苷酸消化)+ 碱性磷酸酶(小牛肠碱性磷酸酶或rSAP,去磷酸化生成游离核苷,用于反相液相色谱-质谱检测)[src_C14]。若去磷酸化不完全(37°C下30分钟内转化率须>99%),79.97 Da的磷酸基团质量偏移将产生重叠电荷态,导致核苷定量比例失效 [src_D07]。
自下而上序列图谱分析采用核糖核酸酶T1(来源于Aspergillus oryzae,11 kDa),该酶在单链RNA中鸟苷3'端切割(特异性标记为Gp↓N),每条21聚体GalNAc-siRNA链可生成3至6个可唯一比对的片段 [src_C14]。辅以核糖核酸酶A(RNase A)消化(Cp↓N / Up↓N),提供重叠覆盖以完成全序列验证。对于双靶点构建体,基因A和基因B的正义链/反义链均须独立进行图谱分析,与单靶点药物相比,每批次酶用量翻倍。
单独使用核酸酶P1已成为高度修饰siRNA的首选单酶方案。Jones等人2023年发表于《分析化学》(Analytical Chemistry,doi:10.1021/acs.analchem.2c04902)的研究表明,部分核酸酶P1消化可提供稳健的5'端和3'端覆盖及重叠片段,不受2'-氟化状态、硫代磷酸酯含量或2'-OMe取代程度影响——其表现优于核糖核酸酶T1,后者的Gp↓N切割活性因2'-修饰鸟苷而部分减弱 [src_H01]。
无RNase的DNase I在工作流程中有两处应用:(1)拼接RNA连接中的在制品DNA夹板去除——兆维的sgRNA/siRNA工艺明确在色谱纯化前用DNase I消化DNA夹板;(2)DNA模板或基因组残留的质控检测 [src_B16]。关键规格要求RNase交叉活性<0.01%;即使微量污染也会降解RNA分析物并使序列图谱分析失效 [src_D07]。
**多核苷酸激酶(T4)**在连接位点引入T4 RNA连接酶1和2所需的5'-磷酸基团 [src_E42]。对于由约7聚体片段组装的批次,每条21聚体链需进行三次T4 PNK反应(每个双链体共六次),使其成为连接批次的化学计量量在制品酶,同时也是短链杂质32P末端标记检测的关键质控试剂 [src_B16]。
| 酶 | 特异性 | 主要检测用途 | 双靶点影响 | GMP供应商数量 |
|---|---|---|---|---|
| 核酸酶P1 | 广谱单链RNA/DNA 3'→5' | 核苷图谱;自下而上序列分析 | 每对链用量翻倍 | 3–4 |
| 核糖核酸酶T1 | Gp↓N(单链RNA) | 自下而上图谱分析 | 两对链均须图谱分析 | 3–4 |
| 核糖核酸酶A | Cp↓N / Up↓N(单链RNA) | 重叠覆盖 | 标准 | 2–3 |
| SVPD(PDE I) | 3'→5'外切核酸酶 | 核苷消化完成 | 标准 | 2–3 |
| 小牛肠碱性磷酸酶 / rSAP | 5'-磷酸水解 | 质谱前去磷酸化 | 必需 | 4–6 |
| DNase I(无RNase) | 双链DNA/单链DNA | 夹板去除;DNA纯度质控 | 连接批次强制要求 | 4–6 |
| T4 PNK | 5'-OH → 5'-P | 连接底物制备;32P杂质检测 | 连接批次强制要求 | 3–5 |