架构变更:把 dr-translator 从 opencode agent 降级为 Python 脚本编排下的 LLM
调用。根本原因是 agent 一次性处理 19k 英文词整文,单次 output token 接近
Sonnet 4.6 上限(~32k),多次重跑都卡在同一个坑里——问题是架构本身,不是
prompt。
新架构:
scripts/lib/zenmux_client.py HTTP 客户端,指数退避重试、token 统计
JSONL 日志、secrets.env 自动加载
scripts/lib/markdown_chunker.py 按 H1/H2 切块,稳定 anchor ID(order+title
sha1),支持合并/统计
scripts/prompts/translate_system.txt 英译中 prompt,用自定义 <<<TRANSLATION>>>
分隔符格式(规避 Markdown-in-JSON 问题)
scripts/prompts/polish_system.txt 中文润色 prompt(留给下一步 polish.py)
scripts/translate.py 主入口:章节级切块 → 逐块翻译 → 拼接
关键设计:
- 0 依赖 LLM 遵从性:Python 控制切块/循环/重试,LLM 只做单块翻译
- 断点续传:每块翻译完立即写 phase4/zh_chunks/<order>-<anchor>.md
- 术语表累积:每块的 glossary_patch 合并回 phase4/glossary.json
- 失败隔离:单块失败不影响其他块,重跑只补缺
- 调试友好:--only N,M / --limit K / --force
实测(dual-target-rnai-pipeline-2026):
- 63 块全部成功,17 分钟,$1.70
- 33,441 中文字(符合"研究类 ≥30,000 字"硬标准)
- 310 条双语术语
- 翻译质量:接近母语咨询分析师写作
下一步:polish.py(按 H2 section 润色)、merge_chapters.py(从 phase2/drafts
合并生成 final_en.md)、重构 dr-editor-in-chief 调度脚本、更新 /dr-finalize。
Co-authored-by: User <human>
1.8 KiB
1.8 KiB
反驳证据
以下三个因素可能缓解供应约束。
需求量触发点或将提前到来。 阿尔尼拉姆Norton工厂扩建计划以2027年底投入运营为目标,届时核酸酶P1与T4多核苷酸激酶(T4 PNK)的需求将高度集中,足以支撑美国第二家一级供应商的进入 [src_H04]。若siRELIS工厂按计划扩产,寡核苷酸质控酶市场规模有望达到1亿至2亿美元区间——届时供应格局将发生质变。
自上而下完整质量测序可部分替代酶法。 Waters(BioAccord)、Agilent和Bruker的液相色谱-飞行时间质谱(LC-MS/TOF)平台,可通过电荷态反卷积与碰撞诱导解离(CID)碎裂,直接从完整链确认siRNA序列,无需核糖核酸酶消化 [src_H01]。若自上而下工作流程能在GMP通量下,对交替2'-OMe/2'-F修饰的21聚体实现可靠的全序列覆盖——目前尚未实现——则依赖酶法的自下而上图谱分析需求将随之收缩。
I/II期IND的CMC申报不要求GMP级分析试剂。 监管机构接受研究级酶用于早期阶段表征,前提是方法适用性与批间变异系数(CV)有据可查。GMP级供应约束的实质压力仅在生物制品上市许可申请(BLA)/新药申请(NDA)阶段才真正显现——对大多数现有双靶点资产而言,这一节点还在3至5年之后——紧迫窗口因此大幅收窄。
上述考量并不能扭转根本性的结构失衡。目前没有任何中国供应商能在GMP级核酸酶P1、核糖核酸酶T1(RNase T1)或蛇毒磷酸二酯酶(SVPD)上替代宝生物工程或NEB。该市场的经济逻辑本身不足以自然吸引新进入者,除非出现催化性需求事件。酶连接浪潮或许正是这一触发点——但拐点在2027至2028年,而非当下。