| 时间 | 事件 | 要点 |
|---|---|---|
| 2026-05 | Isomorphic Labs B 轮 21 亿美元 | Thrive Capital 领投,刷新 AI 制药单笔融资纪录。持 AlphaFold 商业化授权,与礼来、诺华合作。 |
| 2026-05 | BMS × Anthropic | Claude Enterprise 部署至全球 3 万员工,覆盖研发、开发、制造、医学事务。MNC 首次把 LLM 从"工具"升级为"基础设施级智能体"。 |
| 2026-01/06 | MNC 平台级合作密集落地 | 赛诺菲 × Earendil Labs(华深智药子公司)25.6 亿美元;施维雅 × 英矽智能 8.88 亿美元;礼来 × 英伟达最高 10 亿美元共建 AI 联合创新实验室;辉瑞 × Chai Discovery 定制模型协议。 |
| 2026-03 | 礼来 × 英矽智能 | 最高 27.5 亿美元(首付 1.15 亿美元)取得部分化合物全球权益。 |
| 2026-05 | 行业另一面 | 多家 AI 制药公司关停、裁员 20%+、寻求退市。已宣布的"biobucks"与实际首付之间的比例约 50:1,估值自 2021-2022 IPO 后大幅回落。融资向头部集中。 |
2024 年 AlphaFold3 把扩散模型引入结构模块,把蛋白、核酸、配体、修饰放在同一个生成框架里。2025-2026 年,开源复现集体追平,并在此基础上长出两个关键能力:亲和力联合预测和训练数据/权重完全开放。
| 模型 | 机构 | 许可 | 状态与定位 |
|---|---|---|---|
| AlphaFold 3 | Google DeepMind | 权重非商业 | 精度标杆。代码 2024-11 非商业发布,2025-02 公开可用;权重需申请且限制商用。P1团队已并入 Gemini 路线,核心作者(John Jumper 等)出走,维护归属不明(详见 §7.3)。 |
| OpenFold3 | Columbia / OpenFold 联盟 | Apache 2.0 | 2026-03 起权重、训练代码、评测脚本连训练数据一起开放,多模态上接近 AF3 水平。商用首选之一。 |
| Boltz-2 | MIT + Recursion | MIT | 2025-06 发布,结构 + 亲和力联合预测;单 GPU ~18s;下载量超 120 万次,绝大多数用户是做药的人。2026-05 MIT/Recursion 再发亲和力微调框架。 |
| Protenix v1 / v2 | 字节跳动 | Apache 2.0 | v1(2026-02,368M)、v2(2026-04,464M)。v2 在抗体—抗原上明显提升。注意 cutoff 设计:protenix_base_default_v1.0.0 训练截止 2021-09-30(对齐 AF3,用于公平对比),protenix_base_20250630 才是实际应用版——这是评测污染问题的最佳实践范例。 |
| ESMC-6B / ESMFold2 | Chan Zuckerberg Biohub | 开源 | 2026-05 发布,覆盖 6.8 亿序列、1.1 亿结构预测。定位"蛋白质生物学世界模型"——不只预测静态结构,还建模折叠路径、别构转换、结合位点暴露。ESMFold2 在抗体—抗原结合姿态上报告优于 AF3。 |
| Chai-1 | Chai Discovery | 开源(后放宽) | 竞争压力下放宽条款。注意:Chai-2 完全闭源,无权重、无 API,需付费合作(辉瑞、礼来)。 |
| HelixFold3 / -S1 | 百度 | 开源 + 云服务 | S1(2025-07)为推理大模型,采用"接触感知采样策略",主打抗体改造 / 蛋白设计 / 药物筛选的低成本方案。 |
| Uni-Fold | 深势科技 | 开源 | "深势·宇知"体系中的蛋白折叠模型,与 Uni-Mol / Uni-Dock / Uni-FEP 打通。 |
| tFold | 腾讯 AI Lab / 云深智药 | 平台内 | de novo folding,曾长期在 CAMEO 周/月/季榜首。2026-02 腾讯公开完全由 AI 设计的 GLP-1 多肽减肥药专利(CN120248083B)。 |
传统流程是"逐一分子对接打分",本质是串行的物理优化问题。2026 年的新范式是把蛋白口袋和小分子映射到同一个高维向量空间,再做最大内积检索(MIPS)——即 DrugCLIP 路线。这把筛选从 O(N) 的物理计算变成了可并行的向量检索。
| 工具 | 类型 | 要点 |
|---|---|---|
| GalaxyVS清华 AIR + 天河 | 向量检索式超大规模筛选 | 基于 DrugCLIP(Science),整合 Enamine REAL Space + WuXi GalaXi 约千亿可合成分子。用 PipeANN 磁盘原生图索引 + Lustre→本地内存异步预加载。普惠模式:20 节点 / 5.2 小时 / 约 300 元完成单靶点千亿库筛选;极限模式:160 个口袋批量检索约 32 秒(单个 0.014 秒),日吞吐 1.5×10¹⁶ 打分,比此前超算纪录高 6 个数量级。DUD-E / LIT-PCBA 上 EF0.01% 分别达 1594.3 / 297.6。用 ECFP4 聚类 + 多样性因子对抗多样性坍缩,再级连亲和力模型重排序。结果库 GalaxyDB 将公开(galaxyvs.drugclip.com)。 |
| Uni-Dock深势 | GPU 加速对接 | 开源,相比 Vina 有数量级加速,配合 Uni-Mol Docking V2 做"生成—精修"混合。 |
| GNINA | CNN 对接 + rescoring | 3D 卷积打分,可作为 drop-in 引擎替代 Vina,适合做 rescoring 层。 |
| DiffDock / DynamicBind / DeltaDock / FABind+ / KarmaDock / CarsiDock | 深度学习对接 | 各有侧重:DiffDock 是 SE(3) 等变扩散做 blind docking;DynamicBind 建模全柔性复合物;KarmaDock 主打高通量;CarsiDock 做 pose 预测+排序。学术上新方法密集,工程落地建议先做自家靶点的回测。 |
| Deep Docking(DD_protocol) | AI 加速虚拟筛选 | 用 QSAR/DL 模型在对接子集上训练,剪枝超大库。十亿级 VS 的经典工程方案。 |
| AutoDock Vina / Smina | 传统对接基线 | 仍然是必须留着的 baseline。任何新模型都应该拿 Vina 做对照。 |
| Protenix-Dock | 经典对接框架 | 字节开源,不用深度网络,在刚性对接任务上有竞争力的表现——作为"非 DL 对照"很有价值。 |
| 工具 | 许可 | 说明 |
|---|---|---|
| REINVENT 4AstraZeneca | Apache 2.0 | 强化学习做 de novo 设计的事实标准,支持多目标打分函数自定义,可直接接自己的 ADMET/亲和力模型。工程成熟度最好。 |
| DiffSBDD / TargetDiff / Pocket2Mol / ResGen | 多为 MIT | 基于口袋的 3D 生成。学术 SOTA 密集区,真实项目的 hit rate 数据稀缺。 |
| JT-VAE / GraphAF / MolGPT | 开源 | 图/串生成经典方法,适合作为对照基线。 |
| TorchDrug | Apache 2.0 | PyTorch 原生,40+ 数据集、20+ 模型,覆盖性质预测 / 分子生成 / 逆合成 / 知识图谱推理。自定义 GNN 架构开发最方便。 |
| DeepChem | MIT | 老牌工具箱,MoleculeNet 基准 + 丰富 featurizer(MolGraphConv、Grover、ChemBERTa 等)。入门和做传统 QSAR 最省事。 |
| Chemistry42英矽智能 | 商业 | 生成化学平台,与 PandaOmics(靶点发现)构成端到端 Pharma.AI。Rentosertib 的分子即由此产出。 |
| 工具 | 许可 | 说明 |
|---|---|---|
| RFdiffusion / RFdiffusion3Baker Lab | BSD | 主干生成的默认选择,实验验证记录最强。RFdiffusion3(168M 参数)被称为"迄今最强最通用的蛋白工程技术",已能做接近天然水平的酶设计。All-Atom 版可围绕小分子/金属/核酸设计。 |
| ProteinMPNN / LigandMPNN / ESM-IF1 | MIT | 给定骨架倒推序列。ProteinMPNN 约 1.7M 参数,最可靠;LigandMPNN 在含非蛋白原子时显著更好;ESM-IF1 是 transformer 备选(父仓库已归档只读)。 |
| BindCraft | MIT + 陷阱 | 反传通过冻结 AF2 做 hallucination,一次性给出可用 binder,湿实验成功率报告 10–100%。P0 许可证风险:仓库标 MIT,但依赖 PyRosetta——学术免费,商用需向华盛顿大学单独付费。商用请改用社区分支 FreeBindCraft。 |
| PXDesign字节 | 基于 Protenix | de novo binder 设计套件,多靶点实验成功率 20–73%,作者称比 AlphaProteo / RFdiffusion 高 2–6 倍。可通过 Protenix Server 免费使用。 |
| BoltzGen / ODesign / Protpardelle / Protpardelle-1c | 开源 | 2026 年新一代 binder/抗体设计模型。BoltzGen 支持 protein-anything / antibody-anything / nanobody-anything / peptide-anything。横向湿实验对比尚不存在。 |
| Chroma / ProGen3 | 权重非商业 | 代码 Apache 2.0,但权重分别受"Chroma Parameters License"和 CC BY-NC-SA 4.0 约束,仅学术/非营利。ProGen3 仅 ≤3B 权重可下载,6B/46B 旗舰未发布。 |
| Chai-2 | 完全闭源 | 唯一专为抗体设计打造,报告 16–20% hit rate(对照计算方法约 0.1%)。无权重、无 API、无公开服务器,仅付费合作。且 Chai-1 本是开源的——同一家公司从开放转向封闭的标志性案例。 |
| 资源 | 许可 | 说明 |
|---|---|---|
| TDC(Therapeutics Data Commons) | MIT | 做 ADMET 建模的基准基础设施,22+ 任务、跨发现全阶段的排行榜。用它做评估,不要自己造 split。 |
| Chemprop(D-MPNN) | MIT | 有向消息传递网络,分子性质预测的经典强基线,很多"新模型"其实打不过调好的 Chemprop。 |
| Uni-Mol / unimol-tools深势 | 开源 | 3D 分子预训练框架(旋转平移不变位置编码 + 原子对表征 + 双分支 Transformer)。Uni-Mol2 有 84M / 300M / 1.1B 多档。衍生 Uni-QSAR、Uni-MOF、Uni-Mol Docking V2。pip install unimol-tools。 |
| ADMETlab 3.0 / admet-AI | 学术免费 | 开箱即用的 ADMET 预测服务/模型。适合先导化合物早期过滤。 |
| molfeat / MedChem | 开源 | featurizer 与类药性规则(Lipinski、Veber、PAINS、Brenk、SA score)。做生成流程的过滤器必配。 |
行业现状:ADMET 是 AI 在早期发现中渗透最深、商业价值最确定的环节,也是数据最被药企私库锁死的一环。公开模型在溶解度、hERG、CYP450 上可用,但在项目特异性(series-specific)问题上普遍失效。
pip install biomni,需自备 LLM API key。对生信岗位的含义:Agent 先吃掉的是"跑标准流程 + 写分析报告"这类工作(文献检索、差异表达、富集分析、单细胞注释、GWAS locus 解读)。Bruce Schneier 式的判断在这里同样适用——真正稀缺的是问题定义和对结果的判断力,不是执行。Zou 组(Stanford,2026-02)的 virtual-CSO 系统就是样板:11 个 agent 分工,但人负责设定问题、判断推进哪个假设、做物理实验。
| 环节 | 首选开源方案 | 备选 / 补充 |
|---|---|---|
| 靶点发现 | Open Targets(开放平台 + 数据)、PrimeKG / Hetionet(知识图谱)、TorchDrug KG 模块 | PandaOmics(英矽,商业);DepMap(CRISPR 依赖性,开放);Open Targets Genetics |
| 结构获取 | Boltz-2 / OpenFold3 本地部署;AFDB 快照 | Protenix-v2、ESMFold2、ESMFold(单序列快速)、HelixFold3 |
| 复合物 / 对接 | Boltz-2(结构+亲和力)、GNINA( rescoring) | DiffDock、DynamicBind、KarmaDock、Uni-Dock、AutoDock Vina(基线) |
| 超大规模筛选 | GalaxyVS(在线,千亿库)、Deep Docking(本地十亿级) | Uni-Dock 集群、VirtualFlow、RosettaVS / OpenVS |
| 分子生成 | REINVENT 4(RL,工程最成熟) | DiffSBDD、TargetDiff、Pocket2Mol、TorchDrug 生成模块 |
| ADMET / 性质 | Chemprop + TDC(建模);ADMETlab 3.0(开箱) | DeepChem、Uni-Mol、molfeat + MedChem(过滤) |
| 逆合成 | AiZynthFinder(AZ,本地快)、ASKCOS(MIT,含条件推荐) | IBM RXN(托管)、RAscore(可合成性过滤)、Open Reaction Database(数据) |
| 蛋白 / binder 设计 | RFdiffusion + ProteinMPNN(BSD/MIT,全链路可商用) | BindCraft(学术)/ FreeBindCraft(商用)、PXDesign、BoltzGen、LigandMPNN |
| 组学基础模型 | ESM 系列(蛋白)、Evo 2(基因组,40B / 9.3T bp)、scGPT / Geneformer(单细胞) | Nucleotide Transformer、DNABERT-2、HyenaDNA、Enformer、scvi-tools、Uni-RNA |
| Agent 编排 | Biomni(生物医学通用) | ChemCrow(化学)、Future House API、自建 Codex/Claude + MCP |
| 分子动力学 / FEP | OpenMM、GROMACS、MDAnalysis | Uni-FEP(深势,商业)、Alchemy/BioSimSpace |
| 基准与评测 | TDC、PXMeter(字节,含去噪的高质量结构预测基准) | OpenBind(结构-亲和力)、PoseCheck、DUD-E / LIT-PCBA |
| 主体 | 核心资产 | 开放程度 | 定位 |
|---|---|---|---|
| 深势科技 | Uni-Mol / Uni-Fold / Uni-RNA / Uni-SMART / DPA;Uni-Dock、Uni-FEP;Hermite®、玻尔科学空间、Uni-Lab-OS | 模型开源平台商业 | "多尺度建模 + ML + HPC"范式;2025-12 完成超 8 亿元 C 轮;服务全球 1000+ 高校、300 万+ 科研用户。 |
| 清华 AIR / THU-ATOM | DrugCLIP(Science)、GalaxyVS、AlphaRank、书生 AMix 蛋白大模型 | 论文 + 平台开放 | 兰艳艳组。GalaxyDB 将公开。与阿斯利康共建"AI 药物研发"联合研究中心。 |
| 百度 | HelixFold / HelixFold3 / HelixFold-S1、PaddleHelix(飞桨生物计算) | 开源 + 云服务 | PaddleHelix 含螺旋桨系列预训练模型与中药成分数据库,对中药现代化方向友好。 |
| 华为 | 盘古药物分子大模型(与中科院上海药物所共研,学 17 亿分子结构)、昇腾算力、EIHealth | 云服务 | 最克制:不自研管线,只做算力底座 + 模型。 |
| 腾讯 | 云深智药 iDrug、tFold、scBERT | 平台 + 资本 | 近四成医疗健康出手砸向创新药与 AI 制药;2026-02 公开 AI 设计 GLP-1 多肽专利。 |
| 百图生科 | xTrimo 全模态生命科学大模型(V4 达 2680 亿参数)、BioMapOS | 部分模型开源 | xTrimoPGLM 已上 HuggingFace / GitHub。服务 800+ 机构;与赛诺菲合作潜在总额超 10 亿美元。 |
| 字节跳动 | Protenix / Protenix-v2、PXDesign、PXMeter、Protenix-Dock | Apache 2.0 | 对社区最实在的中国贡献之一:模型、评测工具、经典对接实现全开源。 |
| 英矽智能 | PandaOmics、Chemistry42、LabClaw | 商业 | Rentosertib 是全球首个 AI 端到端发现靶点+分子并进入 III 期的药物。2025-12 港股上市。 |
| 剂泰科技 | NanoForge(AI 纳米递送,1000 万+ 脂质库) | 商业 | 全球 AI 药物递送第一股。2026-06 与 Deerfield 授权合作潜在总额超 16 亿美元。 |
| 晶泰科技 | 量子物理 + AI + 机器人研发平台 | 商业 | 2025 年实现全年盈利——AI 制药少见的盈利案例。 |
AlQuraishi(Columbia,OpenFold 负责人)的判断值得记住:AlphaFold2 之所以成功,靠的是 PDB 几十年积累的实验数据;而"蛋白—药物复合物"的同类开放资源几乎不存在。von Delft(Oxford / Diamond)说得更直白——药物-靶点相互作用的数据"少得惊人"。
| 数据集 | 内容 |
|---|---|
| PDB / AFDB | 约 25 万实验结构 / 1.58 亿 AlphaFold2 预测结构(覆盖 UniProt 2 亿条目的 78%)。P1 AFDB 维护归属不明,用了就做本地快照并锁版本。 |
| ChEMBL / BindingDB / PDBbind | 生物活性与复合物结构-亲和力数据。PDBbind 是亲和力模型的主要训练源,规模有限且激酶等热门家族过代表。 |
| ZINC / Enamine REAL / WuXi GalaXi | 可购买/可合成化合物库。REAL Space 约数百亿,GalaXi 同量级——这是"千亿可合成化学空间"的来源。 |
| TDC | 22+ ADMET/发现任务的标准化基准与 split,做方法学对比的默认选择。 |
| PXMeter | 字节开源的结构预测评测工具包,附经人工审核去噪(剔除实验假象与非生物相互作用)的高质量基准集。 |
| Open Reaction Database | 社区驱动的百万级反应记录,用于训练反应/产率模型。 |
BindCraft 是最典型的坑:仓库 MIT,但它不是模型而是一条 pipeline,依赖 PyRosetta(学术免费,商用需向 UW 付费)。MIT 徽章不会告诉你这件事。商用请用 FreeBindCraft 分支。
同类问题:Chroma(代码 Apache 2.0 / 权重自定义非商业许可)、ProGen3(代码 Apache 2.0 / 权重 CC BY-NC-SA 4.0 且 6B、46B 不发布)、AlphaFold3(权重非商业)。
做法:把 pip-licenses 或依赖树审计写进 CI,对新引入的每个模型单独记录"代码许可 / 权重许可 / 关键依赖许可"三栏。在引入时就查,不要等要交付时才查。
AF3 训练截止 2021-09-30。任何在此之后发表的结构,对 AF3 系模型都是测试集;反之,用 2021 年前的数据评测 2025 年训练的模型,是在测记忆。
字节 Protenix 给出了正确示范:同时提供 default(cutoff 2021-09-30,与 AF3 对齐,用于公平比较)和 20250630(新 cutoff,用于实际应用)两套权重。你做评测时也必须照此区分。
做法:所有评测报告里显式写出训练集 cutoff、评测集时间范围、序列/化学相似度阈值(建议做 30%/80% 序列同一性去冗余 + 骨架级别 split)。用 OpenBind 这类"不在任何训练集里"的盲测集做最终验证。
有报道称 Google 将 AlphaFold 团队并入 Gemini 路线、核心作者(含诺奖得主 John Jumper)离职前往 Anthropic。DeepMind 只确认了战略调整,未确认产品关停;EMBL-EBI 与 DeepMind 已续签合作并更新 AFDB。源头是单一媒体(FT),下游均为转述——请当作"归属不明"而非"已关停"处理。
做法:依赖 AFDB 的话立刻做本地快照并锁版本;依赖 AlphaFold Server 的话,本季度内在本地起一套 Boltz-2 或 OpenFold3(单 GPU 可跑,不要 license 认证)。这是低成本的对冲。
Boltz-2 的亲和力能力来自微调后可用,零样本的绝对亲和力值不可直接采信;公开模型在项目特异性 SAR(同一化学系列内的活性梯度)上普遍失效——这正是 OpenBind 存在的理由(它专门造"同系列 + 有梯度 + 结构配对"的数据)。
做法:把共折叠模型的亲和力输出当作排序/富集指标,不是绝对 KD。做 hit 排序可以,做 lead optimization 的活性预测必须用自己的数据微调 + 物理方法(FEP/ABFEP)交叉验证。GalaxyVS 在 BRD4 上的做法值得学:ML 粗筛 + ABFEP 验证。
深势、百度、华为、百图的基础模型大多可在 GitHub / HuggingFace 拿到,但玻尔空间站、Hermite®、EIHealth、BioMapOS 都是商业平台。把"能下载权重"理解为"可自主可控"是有风险的——推理框架、数据处理管线、更新节奏都在对方手里。
做法:关键环节至少保留一条完全自建的路径(如本地 Boltz-2 + 自建筛选流程),把商业平台当加速选项而非唯一依赖。
AI 能把临床前候选分子开发压到 13–18 个月(传统 3–4 年),但临床试验时长、监管审评、生产放大完全没变。业内"10 倍提速"的说法是把临床前加速偷换成全流程加速。做汇报和立项时把这两件事分开讲,否则会在预期管理上翻车。
| 现状 | 建议迁移到 | 理由 |
|---|---|---|
| AlphaFold Server 网页提交 | Boltz-2 或 OpenFold3 本地部署 | 无许可限制、可批量、可微调、不依赖外部服务可用性。单 GPU 即可。 |
| AutoDock Vina 单线程 | GNINA / Uni-Dock(GPU)+ Boltz-2 共折叠 | GPU 加速带来数量级提升;共折叠在 pose 质量上普遍优于传统对接。 |
| 自己写 ADMET 脚本 | Chemprop + TDC + ADMETlab 3.0 | TDC 提供标准 split 与排行榜,避免自造基准导致的自欺。 |
| 手工跑 RNA-seq / 单细胞流程 | 接入 Biomni 或自建 agent 编排 | 标准流程已被 agent 吃掉,把时间投到实验设计与结果判断上。 |
| 无许可证管理 | CI 中加依赖许可审计 | 见 P0-1。PyRosetta 这类隐藏依赖会在商业化时引爆。 |
| 你的方向 | 优先掌握 |
|---|---|
| 小分子药物发现 | Boltz-2(含亲和力微调)→ REINVENT 4 或 DiffSBDD → Chemprop/TDC 做 ADMET → AiZynthFinder 做可合成性过滤。全流程打通一遍,跑通一个自有靶点的 retrospectiv e 回测。 |
| 大分子 / 抗体 | Protenix-v2 / ESMFold2(抗体-抗原姿态)→ RFdiffusion + ProteinMPNN → BoltzGen(antibody-anything)。湿实验门槛高,务必先做 in-silico 的自洽性验证。 |
| 靶点发现 / 多组学 | Evo 2 / ESM 系列做表征 → scGPT / Geneformer / scvi-tools 做单细胞 → Open Targets + PrimeKG 做知识图谱推理 → Biomni 做编排。 |
| 平台 / 工程 | 重点不是模型,是数据资产与评测体系:建自有结构-亲和力数据集、建去冗余的评测集、把 GalaxyVS / OpenFold3 / Protenix 的更新做成可插拔的后端。 |