AIDD 2026 全景报告:趋势 · 技术 · 开源算法与平台

面向生物信息岗位的技术地图与选型参考
生成日期 2026-09-08 · 数据截至 2026 年 8 月 · 覆盖:产业趋势 / 五条技术主线 / 开源工具全谱系 / 国内生态 / 数据基础设施 / 风险与落地路径

0. 结论先行

七条核心判断
  1. 范式已从"结构预测"切换到"共折叠 + 亲和力联合预测"。Boltz-2(MIT 许可)把复合物结构和结合亲和力塞进同一个模型,单张消费级 GPU 约 18 秒,作者自评逼近 FEP 精度而快约 1000 倍。2026 年 5 月 MIT 与 Recursion 又放出亲和力微调框架,这是目前开源界最实用的一块拼图。
  2. 开源在"能不能商用"这一维度上已经赢了闭源。AF3 权重非商业、AlphaFold Server 是托管服务,而 OpenFold3(Apache 2.0,2026-03 起连训练数据一起放)、Boltz-2(MIT)、Protenix(Apache 2.0)全部可自由部署。Boltz-2 累计下载已超 120 万次。
  3. 瓶颈从算法转向数据。PDB 约 25 万结构中,绝大多数没有配对的亲和力数据;药企自建库封闭。OpenBind(牛津 + Diamond,800 万英镑 DSIT 资助)用高通量晶体学批量造"结构—亲和力"配对数据,首个数据集 2026-05 发布:925 个晶体结合事件 / 699 化合物 / 601 个 KD。
  4. Agent 化是 2026 年最大的组织级变量。Stanford Biomni 已上 Science 正刊,开源、150 个工具 + 59 个数据库,15000 名科研人员在用;BMS 把 Claude Enterprise 铺给 3 万员工;深势 2026-08 发布"玻尔·科学空间"。生信岗位的日常工作正在被这类系统吞掉第一层。
  5. 国内走的是"算法 + 国产超算"路线,且在超大规模筛选上做出了世界纪录级成果。清华 AIR + 国家超算天津中心的 GalaxyVS 把虚拟筛选重构为向量检索,千亿化合物库单靶点 亚秒级,日吞吐 1.5×10¹⁶ 次打分,普惠模式 20 节点 / 5.2 小时 / 约 300 元;结果库 GalaxyDB 将开放。
  6. 临床验证仍是未兑现的支票。2026 年最关键的事件是 III 期读数:Rentosertib(英矽智能,全球首个 AI 端到端发现靶点+分子并推进到 III 期)、Zasocitinib、Zovegalisib、GB-0895。批评意见很直接——AI 发现的分子进入临床的推进率与传统分子并无显著差异,快 ≠ 更可能成功。
  7. 对生信岗位最实在的一句话:把工具链从"AlphaFold Server + AutoDock Vina"迁移到"Boltz-2 / OpenFold3 + 本地共折叠 + 开源亲和力微调",同时把许可证审计做进 CI。后者是被大多数人忽略的 P0 风险(详见第 7 节)。
~6%
AIDD 在全球制药研发中的渗透率
(2026 基准,3130 亿美元盘子)
30-40%
早期发现阶段可压缩的周期
临床与监管环节不变
13-18 月
AI 流程下临床前候选分子周期
传统为 3-4 年
~90%
临床失败率,AI 尚未证明能改变
2026 III 期读数是决定性检验

1. 产业态势:从"效率工具"到"范式革命"的叙事与现实的落差

1.1 资本:单笔纪录被刷新,但整体转向纪律

时间事件要点
2026-05Isomorphic Labs B 轮 21 亿美元Thrive Capital 领投,刷新 AI 制药单笔融资纪录。持 AlphaFold 商业化授权,与礼来、诺华合作。
2026-05BMS × AnthropicClaude Enterprise 部署至全球 3 万员工,覆盖研发、开发、制造、医学事务。MNC 首次把 LLM 从"工具"升级为"基础设施级智能体"。
2026-01/06MNC 平台级合作密集落地赛诺菲 × Earendil Labs(华深智药子公司)25.6 亿美元;施维雅 × 英矽智能 8.88 亿美元;礼来 × 英伟达最高 10 亿美元共建 AI 联合创新实验室;辉瑞 × Chai Discovery 定制模型协议。
2026-03礼来 × 英矽智能最高 27.5 亿美元(首付 1.15 亿美元)取得部分化合物全球权益。
2026-05行业另一面多家 AI 制药公司关停、裁员 20%+、寻求退市。已宣布的"biobucks"与实际首付之间的比例约 50:1,估值自 2021-2022 IPO 后大幅回落。融资向头部集中。

1.2 监管:框架成型,但早期发现大概率被排除在外

1.3 中国:从跟跑到局部领跑

商业化兑现
国内首款 AI 辅助研发原创药盐酸伊司特韦片(艾普司韦)获附条件批准上市,全球首款基于 DNA 编码化合物库(DEL)获批的小分子创新药,从源头发现到临床完成仅 3.5 年。DEL 库规模 490 亿种化合物。
港股"AI 制药三小龙"
英矽智能 2025-12-30 上市,募资 22.77 亿港元,当年香港最大生物技术 IPO;晶泰科技 2025 全年盈利;剂泰科技 2026-05 挂牌,超 6900 倍认购,募资超 21 亿港元。百图生科 2026-03 递表港交所。
算力—算法协同
GalaxyVS 依托新一代天河超算,把 AI 虚拟筛选推进到千亿级可合成化学空间。这是"国产算法 + 国产算力"全栈自主的标志性成果,而非单点模型创新。

2. 五条技术主线

主线一:共折叠(co-folding)——结构预测的终局形态

2024 年 AlphaFold3 把扩散模型引入结构模块,把蛋白、核酸、配体、修饰放在同一个生成框架里。2025-2026 年,开源复现集体追平,并在此基础上长出两个关键能力:亲和力联合预测和训练数据/权重完全开放。

模型机构许可状态与定位
AlphaFold 3Google DeepMind权重非商业精度标杆。代码 2024-11 非商业发布,2025-02 公开可用;权重需申请且限制商用。P1团队已并入 Gemini 路线,核心作者(John Jumper 等)出走,维护归属不明(详见 §7.3)。
OpenFold3Columbia / OpenFold 联盟Apache 2.02026-03 起权重、训练代码、评测脚本连训练数据一起开放,多模态上接近 AF3 水平。商用首选之一。
Boltz-2MIT + RecursionMIT2025-06 发布,结构 + 亲和力联合预测;单 GPU ~18s;下载量超 120 万次,绝大多数用户是做药的人。2026-05 MIT/Recursion 再发亲和力微调框架。
Protenix v1 / v2字节跳动Apache 2.0v1(2026-02,368M)、v2(2026-04,464M)。v2 在抗体—抗原上明显提升。注意 cutoff 设计:protenix_base_default_v1.0.0 训练截止 2021-09-30(对齐 AF3,用于公平对比),protenix_base_20250630 才是实际应用版——这是评测污染问题的最佳实践范例。
ESMC-6B / ESMFold2Chan Zuckerberg Biohub开源2026-05 发布,覆盖 6.8 亿序列、1.1 亿结构预测。定位"蛋白质生物学世界模型"——不只预测静态结构,还建模折叠路径、别构转换、结合位点暴露。ESMFold2 在抗体—抗原结合姿态上报告优于 AF3。
Chai-1Chai Discovery开源(后放宽)竞争压力下放宽条款。注意:Chai-2 完全闭源,无权重、无 API,需付费合作(辉瑞、礼来)。
HelixFold3 / -S1百度开源 + 云服务S1(2025-07)为推理大模型,采用"接触感知采样策略",主打抗体改造 / 蛋白设计 / 药物筛选的低成本方案。
Uni-Fold深势科技开源"深势·宇知"体系中的蛋白折叠模型,与 Uni-Mol / Uni-Dock / Uni-FEP 打通。
tFold腾讯 AI Lab / 云深智药平台内de novo folding,曾长期在 CAMEO 周/月/季榜首。2026-02 腾讯公开完全由 AI 设计的 GLP-1 多肽减肥药专利(CN120248083B)。

主线二:从对接到检索——虚拟筛选的量级跃迁

传统流程是"逐一分子对接打分",本质是串行的物理优化问题。2026 年的新范式是把蛋白口袋和小分子映射到同一个高维向量空间,再做最大内积检索(MIPS)——即 DrugCLIP 路线。这把筛选从 O(N) 的物理计算变成了可并行的向量检索。

工具类型要点
GalaxyVS清华 AIR + 天河向量检索式超大规模筛选基于 DrugCLIP(Science),整合 Enamine REAL Space + WuXi GalaXi 约千亿可合成分子。用 PipeANN 磁盘原生图索引 + Lustre→本地内存异步预加载。普惠模式:20 节点 / 5.2 小时 / 约 300 元完成单靶点千亿库筛选;极限模式:160 个口袋批量检索约 32 秒(单个 0.014 秒),日吞吐 1.5×10¹⁶ 打分,比此前超算纪录高 6 个数量级。DUD-E / LIT-PCBA 上 EF0.01% 分别达 1594.3 / 297.6。用 ECFP4 聚类 + 多样性因子对抗多样性坍缩,再级连亲和力模型重排序。结果库 GalaxyDB 将公开(galaxyvs.drugclip.com)。
Uni-Dock深势GPU 加速对接开源,相比 Vina 有数量级加速,配合 Uni-Mol Docking V2 做"生成—精修"混合。
GNINACNN 对接 + rescoring3D 卷积打分,可作为 drop-in 引擎替代 Vina,适合做 rescoring 层。
DiffDock / DynamicBind / DeltaDock / FABind+ / KarmaDock / CarsiDock深度学习对接各有侧重:DiffDock 是 SE(3) 等变扩散做 blind docking;DynamicBind 建模全柔性复合物;KarmaDock 主打高通量;CarsiDock 做 pose 预测+排序。学术上新方法密集,工程落地建议先做自家靶点的回测。
Deep Docking(DD_protocol)AI 加速虚拟筛选用 QSAR/DL 模型在对接子集上训练,剪枝超大库。十亿级 VS 的经典工程方案。
AutoDock Vina / Smina传统对接基线仍然是必须留着的 baseline。任何新模型都应该拿 Vina 做对照。
Protenix-Dock经典对接框架字节开源,不用深度网络,在刚性对接任务上有竞争力的表现——作为"非 DL 对照"很有价值。

主线三:生成式设计——从小分子到大分子

小分子

工具许可说明
REINVENT 4AstraZenecaApache 2.0强化学习做 de novo 设计的事实标准,支持多目标打分函数自定义,可直接接自己的 ADMET/亲和力模型。工程成熟度最好。
DiffSBDD / TargetDiff / Pocket2Mol / ResGen多为 MIT基于口袋的 3D 生成。学术 SOTA 密集区,真实项目的 hit rate 数据稀缺。
JT-VAE / GraphAF / MolGPT开源图/串生成经典方法,适合作为对照基线。
TorchDrugApache 2.0PyTorch 原生,40+ 数据集、20+ 模型,覆盖性质预测 / 分子生成 / 逆合成 / 知识图谱推理。自定义 GNN 架构开发最方便。
DeepChemMIT老牌工具箱,MoleculeNet 基准 + 丰富 featurizer(MolGraphConv、Grover、ChemBERTa 等)。入门和做传统 QSAR 最省事。
Chemistry42英矽智能商业生成化学平台,与 PandaOmics(靶点发现)构成端到端 Pharma.AI。Rentosertib 的分子即由此产出。

蛋白 / 抗体 / Binder 设计

工具许可说明
RFdiffusion / RFdiffusion3Baker LabBSD主干生成的默认选择,实验验证记录最强。RFdiffusion3(168M 参数)被称为"迄今最强最通用的蛋白工程技术",已能做接近天然水平的酶设计。All-Atom 版可围绕小分子/金属/核酸设计。
ProteinMPNN / LigandMPNN / ESM-IF1MIT给定骨架倒推序列。ProteinMPNN 约 1.7M 参数,最可靠;LigandMPNN 在含非蛋白原子时显著更好;ESM-IF1 是 transformer 备选(父仓库已归档只读)。
BindCraftMIT + 陷阱反传通过冻结 AF2 做 hallucination,一次性给出可用 binder,湿实验成功率报告 10–100%。P0 许可证风险:仓库标 MIT,但依赖 PyRosetta——学术免费,商用需向华盛顿大学单独付费。商用请改用社区分支 FreeBindCraft。
PXDesign字节基于 Protenixde novo binder 设计套件,多靶点实验成功率 20–73%,作者称比 AlphaProteo / RFdiffusion 高 2–6 倍。可通过 Protenix Server 免费使用。
BoltzGen / ODesign / Protpardelle / Protpardelle-1c开源2026 年新一代 binder/抗体设计模型。BoltzGen 支持 protein-anything / antibody-anything / nanobody-anything / peptide-anything。横向湿实验对比尚不存在。
Chroma / ProGen3权重非商业代码 Apache 2.0,但权重分别受"Chroma Parameters License"和 CC BY-NC-SA 4.0 约束,仅学术/非营利。ProGen3 仅 ≤3B 权重可下载,6B/46B 旗舰未发布。
Chai-2完全闭源唯一专为抗体设计打造,报告 16–20% hit rate(对照计算方法约 0.1%)。无权重、无 API、无公开服务器,仅付费合作。且 Chai-1 本是开源的——同一家公司从开放转向封闭的标志性案例。
选型提示:能力账 vs 验证账
蛋白设计领域存在两套账本。能力账(designability、self-consistency)数据便宜、量大、与现实弱相关;验证账(湿实验 hit rate、晶体结构)稀疏、昂贵、且各实验室靶点与判据不同,无法横向比较。Chroma、Genie、SALAD、FrameDiff 等没有任何作者报告的湿实验验证。当两套账冲突时,信湿实验;只有能力账数据的数字,只能当假设。

主线四:ADMET / 性质预测——最"工业化"也最容易被高估的一环

资源许可说明
TDC(Therapeutics Data Commons)MIT做 ADMET 建模的基准基础设施,22+ 任务、跨发现全阶段的排行榜。用它做评估,不要自己造 split。
Chemprop(D-MPNN)MIT有向消息传递网络,分子性质预测的经典强基线,很多"新模型"其实打不过调好的 Chemprop。
Uni-Mol / unimol-tools深势开源3D 分子预训练框架(旋转平移不变位置编码 + 原子对表征 + 双分支 Transformer)。Uni-Mol2 有 84M / 300M / 1.1B 多档。衍生 Uni-QSAR、Uni-MOF、Uni-Mol Docking V2。pip install unimol-tools。
ADMETlab 3.0 / admet-AI学术免费开箱即用的 ADMET 预测服务/模型。适合先导化合物早期过滤。
molfeat / MedChem开源featurizer 与类药性规则(Lipinski、Veber、PAINS、Brenk、SA score)。做生成流程的过滤器必配。

行业现状:ADMET 是 AI 在早期发现中渗透最深、商业价值最确定的环节,也是数据最被药企私库锁死的一环。公开模型在溶解度、hERG、CYP450 上可用,但在项目特异性(series-specific)问题上普遍失效。

主线五:Agent 与自主实验室

Biomni(Stanford SNAP)
开源 已上 Science 正刊。150 个工具 + 105 个软件包 + 59 个数据库,覆盖 25 个生物学领域。自然语言提问 → 自主规划 → 写 Python 并执行 → 纠错重试。443 个问题平均准确率 57%,显著高于同类 agent。已在 15000 名科研人员中运行超 10 万个工作流。衍生 Biomni-AD 获阿尔茨海默病数据 Initiative 百万美元奖。商业化公司 Phylo 于 2026-02 获 1350 万美元种子轮(a16z / Menlo / Anthropic 参投)。
pip install biomni,需自备 LLM API key。
Future House(Crow / Falcon / Finch)
商用 API 多智能体系统 Robin 曾提出 ripasudil 用于干性 AMD,但被指出贡献是"药物—适应症配对"而非机制发现——原创性存疑。Sakana 的 AI Scientist 独立评测中,7 篇稿件有 4 篇出现数值幻觉、把已知概念误判为新颖。P1 当前 agent 的可靠区间是文献综述与数据分析,不是提出可验证的新机制。
深势"玻尔·科学空间"(2026-08)
平台 Science Navigator 连接 2 亿+ 文献专利;DeployMaster 部署 5 万+ 科学计算工具,与 DPA / Uni-Mol / Uni-AIMS / Uni-FEP / Uni-Dock 打通;Uni-Lab-OS 已连接 150 大类、1800 款仪器。SciX 智能体框架负责任务拆解与容错,Sandbox 在 185 万次启动统计中成功率 98.8%。
Insilico LabClaw(2026-05)
商业 多智能体架构的实验室操作系统,基于上海浦东全自动机器人实验室(6 个工作站)。设计/监控/分析/决策四类智能体协同,宣称 Hit-to-Lead 时间缩短 50%+。

对生信岗位的含义:Agent 先吃掉的是"跑标准流程 + 写分析报告"这类工作(文献检索、差异表达、富集分析、单细胞注释、GWAS locus 解读)。Bruce Schneier 式的判断在这里同样适用——真正稀缺的是问题定义和对结果的判断力,不是执行。Zou 组(Stanford,2026-02)的 virtual-CSO 系统就是样板:11 个 agent 分工,但人负责设定问题、判断推进哪个假设、做物理实验。

3. 开源算法与平台全谱系(按研发环节索引)

环节首选开源方案备选 / 补充
靶点发现Open Targets(开放平台 + 数据)、PrimeKG / Hetionet(知识图谱)、TorchDrug KG 模块PandaOmics(英矽,商业);DepMap(CRISPR 依赖性,开放);Open Targets Genetics
结构获取Boltz-2 / OpenFold3 本地部署;AFDB 快照Protenix-v2、ESMFold2、ESMFold(单序列快速)、HelixFold3
复合物 / 对接Boltz-2(结构+亲和力)、GNINA( rescoring)DiffDock、DynamicBind、KarmaDock、Uni-Dock、AutoDock Vina(基线)
超大规模筛选GalaxyVS(在线,千亿库)、Deep Docking(本地十亿级)Uni-Dock 集群、VirtualFlow、RosettaVS / OpenVS
分子生成REINVENT 4(RL,工程最成熟)DiffSBDD、TargetDiff、Pocket2Mol、TorchDrug 生成模块
ADMET / 性质Chemprop + TDC(建模);ADMETlab 3.0(开箱)DeepChem、Uni-Mol、molfeat + MedChem(过滤)
逆合成AiZynthFinder(AZ,本地快)、ASKCOS(MIT,含条件推荐)IBM RXN(托管)、RAscore(可合成性过滤)、Open Reaction Database(数据)
蛋白 / binder 设计RFdiffusion + ProteinMPNN(BSD/MIT,全链路可商用)BindCraft(学术)/ FreeBindCraft(商用)、PXDesign、BoltzGen、LigandMPNN
组学基础模型ESM 系列(蛋白)、Evo 2(基因组,40B / 9.3T bp)、scGPT / Geneformer(单细胞)Nucleotide Transformer、DNABERT-2、HyenaDNA、Enformer、scvi-tools、Uni-RNA
Agent 编排Biomni(生物医学通用)ChemCrow(化学)、Future House API、自建 Codex/Claude + MCP
分子动力学 / FEPOpenMM、GROMACS、MDAnalysisUni-FEP(深势,商业)、Alchemy/BioSimSpace
基准与评测TDC、PXMeter(字节,含去噪的高质量结构预测基准)OpenBind(结构-亲和力)、PoseCheck、DUD-E / LIT-PCBA

4. 国内生态地图

主体核心资产开放程度定位
深势科技Uni-Mol / Uni-Fold / Uni-RNA / Uni-SMART / DPA;Uni-Dock、Uni-FEP;Hermite®、玻尔科学空间、Uni-Lab-OS模型开源平台商业"多尺度建模 + ML + HPC"范式;2025-12 完成超 8 亿元 C 轮;服务全球 1000+ 高校、300 万+ 科研用户。
清华 AIR / THU-ATOMDrugCLIP(Science)、GalaxyVS、AlphaRank、书生 AMix 蛋白大模型论文 + 平台开放兰艳艳组。GalaxyDB 将公开。与阿斯利康共建"AI 药物研发"联合研究中心。
百度HelixFold / HelixFold3 / HelixFold-S1、PaddleHelix(飞桨生物计算)开源 + 云服务PaddleHelix 含螺旋桨系列预训练模型与中药成分数据库,对中药现代化方向友好。
华为盘古药物分子大模型(与中科院上海药物所共研,学 17 亿分子结构)、昇腾算力、EIHealth云服务最克制:不自研管线,只做算力底座 + 模型。
腾讯云深智药 iDrug、tFold、scBERT平台 + 资本近四成医疗健康出手砸向创新药与 AI 制药;2026-02 公开 AI 设计 GLP-1 多肽专利。
百图生科xTrimo 全模态生命科学大模型(V4 达 2680 亿参数)、BioMapOS部分模型开源xTrimoPGLM 已上 HuggingFace / GitHub。服务 800+ 机构;与赛诺菲合作潜在总额超 10 亿美元。
字节跳动Protenix / Protenix-v2、PXDesign、PXMeter、Protenix-DockApache 2.0对社区最实在的中国贡献之一:模型、评测工具、经典对接实现全开源。
英矽智能PandaOmics、Chemistry42、LabClaw商业Rentosertib 是全球首个 AI 端到端发现靶点+分子并进入 III 期的药物。2025-12 港股上市。
剂泰科技NanoForge(AI 纳米递送,1000 万+ 脂质库)商业全球 AI 药物递送第一股。2026-06 与 Deerfield 授权合作潜在总额超 16 亿美元。
晶泰科技量子物理 + AI + 机器人研发平台商业2025 年实现全年盈利——AI 制药少见的盈利案例。

5. 数据基础设施:2026 年真正的战场

AlQuraishi(Columbia,OpenFold 负责人)的判断值得记住:AlphaFold2 之所以成功,靠的是 PDB 几十年积累的实验数据;而"蛋白—药物复合物"的同类开放资源几乎不存在。von Delft(Oxford / Diamond)说得更直白——药物-靶点相互作用的数据"少得惊人"。

OpenBind(UK)
牛津 + Diamond Light Source 共建,DSIT 800 万英镑资助,成员含 Columbia、MSKCC、Open Molecular Software Foundation、UW(Frank DiMaio、AlQuraishi、John Chodera、Čondić-Jurkić)。首个数据集 2026-05 发布:EV-A71 2A 蛋白酶(用 CVA16 2A 做替代体系,序列仅差 5 个残基且都不在活性位点),925 个晶体结合事件 / 699 化合物 / 601 个 KD(Creoptix WAVEsystem)。同时给出对接、共折叠、亲和力三类方法的参考基准,通用模型 OpenBind v1 也已发布。数据 7 个月采集完成,后续扩展至 COVID-19、疟疾、登革热、寨卡、癌症。
关键价值:该靶点不在任何公开训练集里,是干净的盲测集。
ASAP Discovery Consortium
全球抗病毒发现联盟,OpenBind 的首个靶点即与其协同选定。提供大规模共价/非共价片段筛选数据与化合物进展数据,是疫情准备方向最重要的开放资源之一。
GalaxyDB(清华 AIR)
GalaxyVS 筛选结果库:6 个物种、近 10 万个蛋白结构、400 万个口袋 × 千亿化合物的互作图谱,16 小时完成。承诺公开释放(galaxyvs.drugclip.com)。若如期开放,将是最大规模的跨物种蛋白—配体互作数据。
联邦学习 / TuneLab
数据不出域的另一条路:礼来 TuneLab 让其他公司使用其 ML 工具,条件是礼来可用对方数据训练模型。药企之间"用工具换数据"正成为主流折中方案。
数据集内容
PDB / AFDB约 25 万实验结构 / 1.58 亿 AlphaFold2 预测结构(覆盖 UniProt 2 亿条目的 78%)。P1 AFDB 维护归属不明,用了就做本地快照并锁版本。
ChEMBL / BindingDB / PDBbind生物活性与复合物结构-亲和力数据。PDBbind 是亲和力模型的主要训练源,规模有限且激酶等热门家族过代表。
ZINC / Enamine REAL / WuXi GalaXi可购买/可合成化合物库。REAL Space 约数百亿,GalaXi 同量级——这是"千亿可合成化学空间"的来源。
TDC22+ ADMET/发现任务的标准化基准与 split,做方法学对比的默认选择。
PXMeter字节开源的结构预测评测工具包,附经人工审核去噪(剔除实验假象与非生物相互作用)的高质量基准集。
Open Reaction Database社区驱动的百万级反应记录,用于训练反应/产率模型。

6. 人才与组织层面的变化

7. 风险清单(按严重度)

P0 许可证陷阱:MIT 徽章不等于可以商用

BindCraft 是最典型的坑:仓库 MIT,但它不是模型而是一条 pipeline,依赖 PyRosetta(学术免费,商用需向 UW 付费)。MIT 徽章不会告诉你这件事。商用请用 FreeBindCraft 分支。

同类问题:Chroma(代码 Apache 2.0 / 权重自定义非商业许可)、ProGen3(代码 Apache 2.0 / 权重 CC BY-NC-SA 4.0 且 6B、46B 不发布)、AlphaFold3(权重非商业)。

做法:把 pip-licenses 或依赖树审计写进 CI,对新引入的每个模型单独记录"代码许可 / 权重许可 / 关键依赖许可"三栏。在引入时就查,不要等要交付时才查。

P0 基准污染:你的"新模型更好"可能只是数据泄露

AF3 训练截止 2021-09-30。任何在此之后发表的结构,对 AF3 系模型都是测试集;反之,用 2021 年前的数据评测 2025 年训练的模型,是在测记忆。

字节 Protenix 给出了正确示范:同时提供 default(cutoff 2021-09-30,与 AF3 对齐,用于公平比较)和 20250630(新 cutoff,用于实际应用)两套权重。你做评测时也必须照此区分。

做法:所有评测报告里显式写出训练集 cutoff、评测集时间范围、序列/化学相似度阈值(建议做 30%/80% 序列同一性去冗余 + 骨架级别 split)。用 OpenBind 这类"不在任何训练集里"的盲测集做最终验证。

P1 AlphaFold 生态的维护归属不明

有报道称 Google 将 AlphaFold 团队并入 Gemini 路线、核心作者(含诺奖得主 John Jumper)离职前往 Anthropic。DeepMind 只确认了战略调整,未确认产品关停;EMBL-EBI 与 DeepMind 已续签合作并更新 AFDB。源头是单一媒体(FT),下游均为转述——请当作"归属不明"而非"已关停"处理。

做法:依赖 AFDB 的话立刻做本地快照并锁版本;依赖 AlphaFold Server 的话,本季度内在本地起一套 Boltz-2 或 OpenFold3(单 GPU 可跑,不要 license 认证)。这是低成本的对冲。

P1 亲和力预测的精度没有宣传的那么好

Boltz-2 的亲和力能力来自微调后可用,零样本的绝对亲和力值不可直接采信;公开模型在项目特异性 SAR(同一化学系列内的活性梯度)上普遍失效——这正是 OpenBind 存在的理由(它专门造"同系列 + 有梯度 + 结构配对"的数据)。

做法:把共折叠模型的亲和力输出当作排序/富集指标,不是绝对 KD。做 hit 排序可以,做 lead optimization 的活性预测必须用自己的数据微调 + 物理方法(FEP/ABFEP)交叉验证。GalaxyVS 在 BRD4 上的做法值得学:ML 粗筛 + ABFEP 验证。

P1 国内平台的"开源"多为模型开源、平台闭源

深势、百度、华为、百图的基础模型大多可在 GitHub / HuggingFace 拿到,但玻尔空间站、Hermite®、EIHealth、BioMapOS 都是商业平台。把"能下载权重"理解为"可自主可控"是有风险的——推理框架、数据处理管线、更新节奏都在对方手里。

做法:关键环节至少保留一条完全自建的路径(如本地 Boltz-2 + 自建筛选流程),把商业平台当加速选项而非唯一依赖。

P2 不要把"早期发现提速"误读为"研发提速"

AI 能把临床前候选分子开发压到 13–18 个月(传统 3–4 年),但临床试验时长、监管审评、生产放大完全没变。业内"10 倍提速"的说法是把临床前加速偷换成全流程加速。做汇报和立项时把这两件事分开讲,否则会在预期管理上翻车。

8. 给生信岗位的落地路径

8.1 工具栈迁移建议(3 个月内完成)

现状建议迁移到理由
AlphaFold Server 网页提交Boltz-2 或 OpenFold3 本地部署无许可限制、可批量、可微调、不依赖外部服务可用性。单 GPU 即可。
AutoDock Vina 单线程GNINA / Uni-Dock(GPU)+ Boltz-2 共折叠GPU 加速带来数量级提升;共折叠在 pose 质量上普遍优于传统对接。
自己写 ADMET 脚本Chemprop + TDC + ADMETlab 3.0TDC 提供标准 split 与排行榜,避免自造基准导致的自欺。
手工跑 RNA-seq / 单细胞流程接入 Biomni 或自建 agent 编排标准流程已被 agent 吃掉,把时间投到实验设计与结果判断上。
无许可证管理CI 中加依赖许可审计见 P0-1。PyRosetta 这类隐藏依赖会在商业化时引爆。

8.2 分方向的学习重点

你的方向优先掌握
小分子药物发现Boltz-2(含亲和力微调)→ REINVENT 4 或 DiffSBDD → Chemprop/TDC 做 ADMET → AiZynthFinder 做可合成性过滤。全流程打通一遍,跑通一个自有靶点的 retrospectiv e 回测。
大分子 / 抗体Protenix-v2 / ESMFold2(抗体-抗原姿态)→ RFdiffusion + ProteinMPNN → BoltzGen(antibody-anything)。湿实验门槛高,务必先做 in-silico 的自洽性验证。
靶点发现 / 多组学Evo 2 / ESM 系列做表征 → scGPT / Geneformer / scvi-tools 做单细胞 → Open Targets + PrimeKG 做知识图谱推理 → Biomni 做编排。
平台 / 工程重点不是模型,是数据资产与评测体系:建自有结构-亲和力数据集、建去冗余的评测集、把 GalaxyVS / OpenFold3 / Protenix 的更新做成可插拔的后端。

8.3 值得持续跟踪的信号源

方法与局限:本报告基于 2026 年 9 月前可获取的公开信息整理,涵盖产业媒体、机构公告、bioRxiv 预印本、Science 正刊及开源仓库 README。需要标注的不确定性:(1) Google DeepMind 内部重组细节源自单一媒体(FT)报道,DeepMind 仅确认战略调整,未确认产品关停;(2) 多数湿实验成功率数据(BindCraft 10-100%、Chai-2 16-20%、PXDesign 20-73%)来自各自实验室、靶点与判据不同,不可横向比较;(3) 部分 2026 年模型(ESMFold2、Boltz-2 亲和力微调框架)的核心结论尚未经过完整同行评议。所有涉及临床与商业决策的判断,请以原始文献和官方公告为准。