Files
deep_research/projects/dual-target-rnai-pipeline-2026/phase4/zh_chunks/057-b057-ee59e448.md
T
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

18 lines
2.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
## 10.1 证据验证了核心论点,并对两项关键假设作出修正
**三项确认。**
四种设计范式(design paradigm)各自具有独特的工艺特征(process signature)——共价串联siRNAcovalent tandem)额外增加2–3个合成步骤及一种接头亚磷酰胺单体;多价GalNAc簇(multivalent cluster)额外增加2–6个汇聚式偶联步骤;二价分支构建体(di-valent scaffold)则使核酸酶P1与核糖核酸酶T1图谱分析(nuclease-P1 and RNase-T1 mapping)从辅助性检测变为强制性要求 [src_A08, src_A06, src_E12]。相较于单靶点21聚体,任何范式在工艺上均非中性。制造体系(manufacturing stack)论点经跨范式证据检验后依然成立。
中国的平台推进速度是真实的。BEBT-701(AGT + PCSK9双靶点)已于2026年1月在国家药品监督管理局(NMPA)IND批准下完成首例患者给药 [src_E08, src_A14]。锐博、Argo及Sirnaomics各平台均具有差异化的工艺特征,需要定制化的上游供应体系;截至2025年中,中国小核酸领域的交易价值已超过360亿美元 [src_E32]。一旦进入任一平台的合格供应商体系,即可形成3–5年的深度供应关系。
药品审评中心(CDE)2026年第21号通告已正式生效——这是全球首个明确将酶连接(enzymatic-fragment ligation)认定为寡核苷酸药物合法生产方法的国家级监管文件 [src_B18]。中国在监管层面领先西方12–24个月,对于现在即着手资质认证的国内供应商而言,这是结构性的商业优势。
**两项修正改变了优先级排序。**
糖基转移酶(GT)级联反应的技术成熟度(TRL)须下调。SUGAR-TARGET糖基转移酶级联反应(SUGAR-TARGET glycosyl-transferase cascade)所有四轮循环复用数据均来自不足2 mL的实验室规模 [src_C05];在100 mL1 L填充床色谱柱(packed-bed column)放大过程中,微珠磨损(bead attrition)和压降效应(pressure-drop effects)在该规模下尚不可见。截至2026年4月,固定化糖基转移酶级联反应的TRL实为5–6级,而非6–7级。对于资源充足的进入者而言,该路线达到TRL 8级尚需24–36个月。
Codexis ECO Synthesis平台的适用范围须精确界定:该平台覆盖链连接(strand ligation),不涵盖GalNAc簇连接(GalNAc cluster attachment [src_E43]。GalNAc偶联的固定化生物催化缺口至今无人填补——ECO Synthesis平台无法解决这一问题,西方或中国供应商均未提供经验证的捆绑解决方案。这一缺口,而非连接环节,才是差异化程度最高的市场切入点。
---