Files
deep_research/projects/dual-target-rnai-pipeline-2026/phase4/zh_chunks/042-b042-f85fcb8d.md
T
kaiandUser <human> 1b47b50d3c v0.6-wip: Python-based Phase 4 translation pipeline
架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。

新架构:

scripts/lib/zenmux_client.py     HTTP 客户端,指数退避重试、token 统计
                                  JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py   按 H1/H2 切块,稳定 anchor ID(order+title
                                  sha1),支持合并/统计
scripts/prompts/translate_system.txt  英译中 prompt,用自定义 <<<TRANSLATION>>>
                                       分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt     中文润色 prompt(留给下一步 polish.py)
scripts/translate.py              主入口:章节级切块 → 逐块翻译 → 拼接

关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force

实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作

下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。

Co-authored-by: User <human>
2026-04-22 10:43:43 +08:00

8 lines
2.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
## 7.2 为何这一支柱长期供给不足
供应短缺源于结构性矛盾,而非偶然因素。质控酶的需求量以毫克计:一次25 µg siRNA核苷组成分析约需0.5 U核酸酶P1(Nuclease P1);一家每年执行20至30批GMP生产的活跃合同开发与生产组织,每种酶的年消耗量约为50至200 mg。GMP级核酸酶P1的价格为每毫克500至2,000美元,单家合同开发与生产组织的年质控酶支出不足40万美元——这一营收规模不足以支撑专用GMP发酵设施的建设 [src_D07]。寡核苷酸质控酶的全球市场规模估计为2,000万至5,000万美元——对大型酶企业而言体量太小,优先级不高;对小型生产商而言技术门槛又过高,难以进入 [Unverified: single-source estimate; independent market data unavailable]。
核酸活性酶的GMP级规格要求(参照NEB公开标准)涵盖:SDS-PAGE蛋白纯度≥90%;内毒素≤5 EU/mL;无动物及人源成分(AOF)配方;明确的关键质量属性(CQA)/关键工艺参数(CPP)批次记录;ISO 9001及ISO 13485认证;以及残留外切/内切核酸酶活性的交叉污染检测 [src_H02]。宝生物工程(Takara Bio)公开发布的GMP级质量检验报告(以RNase Inhibitor为最具代表性的参考文件)显示:内毒素≤5 EU/mL,纯度≥97%,生物负荷<5 CFU/mL——相当于注射级相邻的B/C级洁净区规格 [src_D07]。满足上述要求需建立专用ISO 13485设施、主细胞库及经验证的变更控制体系,这一资本投入只有在覆盖宽泛GMP酶产品组合时才具经济性,仅针对一两种专用核酸酶则无从摊薄成本。
宝生物工程(日本滋贺县草津市)凭借其ISO 13485/cGMP草津工厂,主导亚洲市场GMP级核糖核酸酶T1(RNase T1)、核糖核酸酶HRNase H)及T7 RNA聚合酶的供应 [src_D07]。NEB(马萨诸塞州罗利及伊普斯威奇)在西方市场占据同等地位——其2018年启用的43,000平方英尺GMP设施覆盖多核苷酸激酶(T4 PNK)、无RNase的DNase I及碱性磷酸酶 [src_H02]。罗氏定制生物技术(Roche Custom Biotech)和Worthington Biochemical分别在蛇毒磷酸二酯酶(SVPD)和核糖核酸酶A(RNase A)细分领域占据一席之地。上述四家供应商之外,目前没有任何供应商能为完整质控酶组合提供GMP文件支持。