架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。
新架构:
scripts/lib/zenmux_client.py HTTP 客户端,指数退避重试、token 统计
JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py 按 H1/H2 切块,稳定 anchor ID(order+title
sha1),支持合并/统计
scripts/prompts/translate_system.txt 英译中 prompt,用自定义 <<<TRANSLATION>>>
分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt 中文润色 prompt(留给下一步 polish.py)
scripts/translate.py 主入口:章节级切块 → 逐块翻译 → 拼接
关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force
实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作
下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。
Co-authored-by: User <human>
12 lines
2.1 KiB
Markdown
12 lines
2.1 KiB
Markdown
## 2.1 共价连接串联siRNA引入专用接头单体及强制性异源双链纯化步骤
|
||
|
||
该设计范式的知识产权核心为美国专利US 9,187,746 B2(阿尔尼拉姆,2031年到期)。该专利主张一种双靶向制剂:靶向PCSK9的第一条dsRNA与靶向XBP-1的第二条dsRNA通过两条正义链之间的二硫键共价相连[src_A08]。专利的更宽泛权利要求涵盖RNA、DNA、肽及六乙二醇(hexaethyleneglycol,HEG)接头;每条dsRNA被限制在≤30个核苷酸,以维持RNA诱导沉默复合体(RISC)装载所需的空间构型[src_A08]。
|
||
|
||
二硫键设计利用了细胞内的氧化还原生化特性:细胞质中谷胱甘肽浓度为1–10 mM,而血浆中仅约2–20 µM,约500倍的梯度差使接头在循环中保持完整,同时在细胞质内触发快速还原裂解[src_E11]。对于完全2'修饰的双链体而言,血清稳定性在生理时间尺度内足够充分(>48 h)[src_E11];主要风险在于,若血浆中的游离巯基——尤其是白蛋白结合的Cys34——在内吞前于细胞表面短暂还原二硫键,则可能导致过早裂解。
|
||
|
||
与单靶点路线相比,该方案带来三项工艺成本。其一,需要含二硫键或受保护巯基的亚磷酰胺单体——该专用单体在标准GalNAc-siRNA单体目录中尚无GMP级别产品[src_D03]。其二,合成后须进行可控氧化脱保护,选择性形成二硫键,同时避免氧化其他杂原子。其三,退火步骤会产生三类群体:目标异源双链体、同源双链副产物及未退火单链;通过变性离子对反相液相色谱-质谱(IP-RP-LC-MS)分离上述组分,至少需增加一个经验证的纯化步骤,以及单靶点构建体所不需要的双链身份确认[src_E12]。阿尔尼拉姆在内部Bis-RNAi会议披露中指出,刚性接头会损害RISC装载效率,而柔性HEG接头虽可保留效力,但会引入构象异质性,增加分析难度[src_A08]。
|
||
|
||
**工艺特征**:增加2–3个步骤,增加1种接头亚磷酰胺单体,异源双链质控为必要环节,GalNAc价数为3。
|
||
|
||
---
|