架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。
新架构:
scripts/lib/zenmux_client.py HTTP 客户端,指数退避重试、token 统计
JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py 按 H1/H2 切块,稳定 anchor ID(order+title
sha1),支持合并/统计
scripts/prompts/translate_system.txt 英译中 prompt,用自定义 <<<TRANSLATION>>>
分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt 中文润色 prompt(留给下一步 polish.py)
scripts/translate.py 主入口:章节级切块 → 逐块翻译 → 拼接
关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force
实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作
下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。
Co-authored-by: User <human>
6 lines
1.4 KiB
Markdown
6 lines
1.4 KiB
Markdown
# 第6章 — 固定化生物催化为GalNAc偶联从实验室原型到GMP候选药物提供可信路径
|
||
|
||
三条平行发展路线在2020年至2026年间交汇,共同确立了固定化生物催化(immobilized biocatalysis)作为替代GalNAc偶联中化学保护基策略的最具技术可信度的路径——针对的是双靶点siRNA的GalNAc偶联:SUGAR-TARGET糖基转移酶级联反应(Makrydaki等,*Nat Chem Biol* 2024)在80余小时内实现四轮酶循环利用,活性保留率超过70% [src_C05];CLEA-LentiKats脂肪酶制剂在深共熔溶剂(DES)中经至少六个连续流循环累计产出每升10 g产品 [src_C10];Codexis ECO固定化聚合酶/磷酸酶反应器在底物浓度6 mM条件下实现寡核苷酸偶联效率超过98% [src_B11]。上述路线的技术成熟度(TRL)现已达到5–7级,较2022年前的3–4级显著提升——与GMP就绪状态(TRL 8–9)的差距已缩小至监管工艺验证文件层面,而非基础化学层面的障碍。
|
||
|
||
双靶点siRNA的战略价值逻辑清晰。每增加一条GalNAc臂——从三天线(3×)到四天线(4×)乃至更多——化学合成中的保护基操作步骤就成倍增加。固定化糖基转移酶能以超过95%的转化率完成末端GalNAc残基的安装,从而规避原子经济性损失,也免去了铜催化叠氮-炔烃环加成(CuAAC)点击化学在商业化规模下难以满足ICH Q3D铜残留要求的合规负担 [src_C08, src_C09]。
|