AIDD 增量简报 · 2026-09-16

面向生物信息岗位 · 第 7 次执行 · 基于 09-15b 版的增量 diff(不重复全景)· 20 轮检索(d3/d7/d30/m1/m2,中英双语)
一、结论先行 二、新增硬事实 三、上版 10 问回执 四、风险清单 五、岗位落地清单 六、下轮盯什么
本轮主线:竞争维度从「模型」正式移到「数据所有权」。 同一周出现三个互相印证的样本——AISB-1-Fed(私有数据联邦共训,模型不公开)、Therna Chronos(数据公开、基础模型与协议闭源)、OpenBind(数据+模型+配方全公开)。 「开放」不再是一个布尔值,而是一条光谱。选型第一问从「哪个模型强」变成「这个结果的证据我能拿到哪一层」。
数据开放光谱 · 2026-09 三个同周样本 横轴 = 外部研究者能拿到的证据层级;越靠右越可复现、越靠左越依赖信任 只给结论 数据+模型+配方全公开 AISB-1-Fed 5 家药企 · 20,167 私有结构 联邦微调 OpenFold3 ✗ 模型不公开 ✗ 未同行评审 · 自留测试集 Therna Chronos 50 细胞系 × 数万合成 mRNA 数百万功能测量 · HF 可下载 ✓ 数据集公开 ✗ 协议 / RNA 基础模型闭源 OpenBind / LIGAND-AI 主动新造结构 + 亲和力 英国 £800 万 / SGC €6000 万 ✓ 数据 · 模型 · 配方 Apache-2.0 ✓ 可独立复现 共同结论 瓶颈在「药企保险柜里的类药结构」——PDB 里这类只有约 1 万个;谁能补上,谁就掌握下一代共折叠模型的上限 信任联盟 看见数据 能重跑

一、结论先行(6 条)

1竞争维度从「模型」移到「数据所有权」。开放是一条光谱,不是布尔值(见上图)。选型第一问变成「这个结果的证据我能拿到哪一层」。
2AlphaFold 的数据墙第一次有了工程级绕行证据。1,056 个留出测试结构上,高精度界面预测从 35.6% → 52.1%,正确配体姿态 28.9% → 46.8%,同时跑赢各家公司「孤岛版」。但模型不公开、未同行评审、测试集由参与方自留——方向可信、幅度不可核。
3「共折叠模型在背题」从预印本变成正式发表。Runs N' Poses(Nat Struct Mol Biol, 2026-05-08)见刊,并新增物理对接对照。这是你现在就能装进 pipeline 的前置闸门指标。
4P0 实操 OpenFold3 v0.5.0 已把默认权重从 preview-2 换成 OpenBind-0。未 pin 版本的流程模型已静默更换,新旧结果不可直接比较。详见风险清单。
5核酸赛道今年最硬的一记负面信号。诺华一周三连败、市值蒸发约 360 亿美元;其中 AOC(抗体偶联 siRNA)del-desiran III 期未达主要终点。判读:递送效率提升 ≠ 临床表型改善。
6国内这一周是「集体亮肌肉」。中关村两院八项成果、上海 AI 实验室书生-S2、中山生物医药政策 2.0。共同点是开源 + 国产算力。

二、本轮新增硬事实

2.1 结构预测 / 共折叠:数据联盟成为新竞争主体

项关键数字证据等级
AISB-1-Fed
Nature 头条 2026-09-14
DOI d41586-026-02882-x
艾伯维 / Astex / BMS / 强生 / 武田;20,167 份私有蛋白-配体结构;联邦微调 OpenFold3 Preview 2;1,056 个留出测试结构 联盟自报
Nature 新闻报道
核心指标 PL-lDDT≥0.8:35.6% → 52.1%(Boltz-2 40.9%)
bisyRMSD≤2Å:28.9% → 46.8%(Boltz-2 36.5%)
PPI 子集 lDDT≥0.8 62.6% vs Boltz-2 40.9%
同上
工程口径Apheris 联邦平台 + NVIDIA FLARE + AWS;每轮仅回传约 2GB 模型更新,原始结构不出公司同上
关键限定 博客发布、未同行评审、模型不公开、评测细表未披露、外部无法复现。Boltz CEO Gabriele Corso 公开质疑「未在公开基准上与最新前沿共折叠模型全面对比」—
数据缺口背景PDB >24 万结构中药物相关约 1.06 万;Astex 的 Paul Mortenson 估计「实验解析 + 类药分子」仅约 1 万个—

Runs N' Poses 正式发表:Škrinjar, Eberhardt, Studer, Tauriello, Schwede, Durairaj,Nature Structural & Molecular Biology,2026-05-08,DOI 10.1038/s41594-026-01797-5(题目去掉了问号,结论没变)。

量化口径(可直接当闸门用)

相似度得分 <50 时共折叠成功率约 10–40%;80–100 区间约 80–90%。本次见刊版新增物理对接(Glide 类)对照。

OpenBind 首批数据落在哪

881 个结晶结合事件,与 2021-09-30 前公开结构相比中位相似度约 40、几乎全部 <50——正好落在塌方区。所以它是检验泛化的好料,不是好刷分料。

补数据两条路线已明确分叉:

2.2 基因组 / RNA 基础模型:这一周密度最高

模型规格开源关键结果
NucleicBERT
Nat Mach Intell
10.1038/s42256-026-01295-9
404M;32 层 / 32 头 / 1024 维;字符级 BPE(clump size=1),词表 25;MARS 筛出 3,000 万 ncRNA;192×A100-40GB × 300 epoch 论文已发
KIT + 于利希
MLM 验证准确率 83.1%;TS0 二级结构 F1 0.649(RNAErnie+ 0.622);长程接触 Top-L 0.460(RiNALMo 0.389);剪接 0.948;CPEB3 适应度 R² 0.994、收敛快 8.5×
Carbon
北京中关村学院 × HuggingFace
30 亿参数,对标 Evo2 70 亿;推理效率 +275×;已注释 16 万亿碱基 Carbon Database
2026-09-15 开源
厂商自评「3B 全面超越 7B」;主打 DNA 序列设计(调控元件、mRNA 疫苗)+ 免比对的基因组注释
MIST
密歇根大学
Encoder-only Transformer;Enamine REALSpace SMILES + Smirk 分词;Polaris 超算训练 HF + GitHub 全开源 约 400 个分子 / 混合物性质任务
HoloCell
中关村两院
6 亿细胞多组学;以基因为锚点统一编码染色质 / RNA / 蛋白 权重未确认 6 项核心任务优于 8 类领域专用模型;13 家单位共建虚拟细胞系统

NucleicBERT 最值得抄的不是分数,是方法论(可直接迁移到 caiPro)

2.3 虚拟细胞 / 扰动预测

2.4 Agent / ADMET / 工具层

ADMET-EvO 代码已开源

github.com/OTeam-AI4S/ADMET-EvO(上版只查到论文,本轮补上)。22 项 TDC ADMET 任务归一化得分 96.77;证据门控选择让累计拟合时间 −72.2%(非劣效界内);形式化 43 个毒性相关任务。作者含 Tingjun Hou(浙大)、Stanford、CUHK。

Orchestra · 多路证据强制互证 可复用架构

两个独立构建的生物信息 MCP Server(RegNetAgents 拓扑 + CASCADE 四路证据)合成 LangGraph 多智能体。要求 ≥2 路独立证据:预测 OncoKB 状态 BRCA/COAD OR 2.89(BH p=0.0166)、STAD OR 5.82(p=0.0047),COSMIC CGC 上复现。单路证据(≥1)则不稳定。

为什么这条重要:MI 边权本身是最强单预测因子(p=0.0003),但互证在此之上仍显著增量(p=0.0234)。⇒「多路独立证据强制互证」是可度量的,不是修辞。这是本轮最值得抄进生信流程的架构模式。

2.5 核酸药物:一手正面、一手重击

本轮最重要的一则 诺华「黑色九月」:一周内三连败,市值蒸发约 360 亿美元。

失败项时间内容
del-desiran(AOC)2026-09-08 DM1 关键 III 期 HAEBOR 未达 vHOT 主要终点,仅次要/探索性终点见微弱活性。全球首个 III 期折戟的 AOC 核心管线;诺华 120 亿美元收购 Avidity 所得平台
pelacarsen(Lp(a) ASO)09-04Lp(a) 降但心血管事件未降
CAR-T09 月死亡事件紧急叫停

正面:

2.6 国内产业与政策

事件时间要点
中关村两院八项成果
Xᴬᴵ 科技节
09 月中 除 Carbon / HoloCell 外:FlexRibbon 药物设计引擎——覆盖 TCR / 抗体 / 纳米抗体 / 线性肽 / 环肽 5 类模态,14 个靶点实验验证,平均首轮成功率 34%,与 10 家企业推进 20+ 管线;商空间扩散模型(训练效率 +45%,30% 参数量超越现有方法,分布误差较 AF3 对齐方案降 >70%,已被字节跳动 AI 制药采纳)
宇道生物 C1 轮2026-09-15数千万美元,信宸资本 + 德诚资本领投,达晨财智 / 中生锡创鼎祺跟投;AI 原生 Biotech,难成药靶标。PR 口径,数字不可核
中山生物医药政策 2.02026-09-1512 条;「人工智能+生物医药」首次单列为独立条款,填补政策空白;AI 辅助靶点发现与设计、蛋白结构预测与工程设计单项目最高 1000 万元;「算力券」单主体年度最高 100 万元;1 类新药单企年补最高 8000 万元
上海「十五五」战新规划 / 江苏三年行动09 月均明确支持 AI 驱动研发、基础模型与药物设计模型布局

三、上版 10 个未决问题 · 核查回执

#上版待办状态回执
1AI BioDesign 首次 release未查到仍无公开 release
2书生-S2 接口与第三方复现部分09-13 发布;Memory Decoder 机制披露(56.92→60.32);第三方复现仍无
3Inference Runtime 支持 / 第三方实测未变本轮无新支持公告、无第三方实测
4VCC 10-22 终测进展赛制细节已补全;终测未到
5siProGenA 代码实质收获仓库仍无(CC-BY-NC-ND 4.0),但拿到 full-text 完整实现规格,见下
6VenusFold 独立复现未变仍厂商自评;本轮拿到完整 FoldBench 对比图(9 模型)与三项 RMSD
7OpenADMET 下一场盲测未查到—
8ASOMAR 后续管线 / 代码未查到—
9ICH M15 实施日期 + 元因·百靶首批名单未查到—
10AI 医药创新联合体成员名单未查到—

顺带:RFOptimization 许可、Mol-JEPA 正式论文 —— 仍未查到。

siProGenA 可复现规格 本周可直接跑

数据

Huesken + Mix + Takayuki(经 OligoFormer 整理),19-nt guide + 57-nt mRNA 窗口;按转录本合并重叠窗口 → 1,258 个重建片段,其中 726 个含至少一个已验证活性位点(≥70% 敲低);转录本层级 80/10/10 划分(test 120 / 62 阳性)。

Stage 1 · 位置提议

4 层 Transformer + D3PM(T=100、uniform-absorbing、cosine schedule);50 epoch,AdamW,batch 4,4 步梯度累积,200 warmup。

Stage 2 · guide 生成

6 层 BFN Transformer,Best-of-N 蒸馏,用预训练 OligoFormer 作 pairwise evaluator。

算力 & 结果

单张 RTX 4080 SUPER,Stage 1 约 6 h、Stage 2 约 4 h。多样性感知 rerank 后 Hit@1 0.790 / Hit@5 0.903;受控评测下 seed-与切割位点保留的变体在 89.8% 已测位点上优于 canonical 互补链。

对 caiPro 的意义:目前唯一一份把「位置提议 + guide 生成」两阶段拆开、且算力门槛低到单卡可复现的 siRNA 生成方案——对应 caiPro 现存的 candidate-construction gap。

四、风险清单

级别风险后果验证 / 修复
P0 OpenFold3 v0.5.0 默认权重已切换
2026-08-21;DEFAULT_CHECKPOINT_NAME = "openbind-2025-06-30-174k"(174k step,数据截止 2025-06);preview-2 被列入 LEGACY_CHECKPOINTS「不支持下载使用」
静默换模型:未 pin 版本的流程,历史结果与新结果不可比;依赖 preview-2 的回归测试会凭空漂移 立即执行:
python -c "from openfold3.entry_points.parameters import DEFAULT_CHECKPOINT_NAME; print(DEFAULT_CHECKPOINT_NAME)"
要么显式指定 ckpt,要么 pip install "openfold3<0.5" 并 setup_openfold 重跑。
注 此条来自二手 wiki 转述,请到 aqlaboratory/openfold-3 的 v0.5.0 tag 自行核对
P0 AISB-1-Fed 的证据等级:博客、未同行评审、模型不公开、测试集由参与方自留 若把 52.1% 当公开基准引用,会在评审/汇报中被直接质疑 引用时必须同时写 Boltz CEO 的公开质疑;不要用于跨团队横向对比
P0 核酸领域:递送效率提升 ≠ 临床表型改善(del-desiran III 期) 只做序列/修饰优化、不做递送与表型证据链的项目,估值逻辑会被重估 任何 siRNA 项目汇报里,把「递送假设」单独列成显式风险项,不要藏在化合物优势里
P1VenusFold 全部数字为厂商自评(本轮再确认)直接替换现有折叠模型可能在新靶点上塌自建 holdout 前不进生产
P1融资稿口径不可核(如「准确率 94.7%」「BioLlama-3 / HelixFlow」等来自营销号)误当事实进入决策一律降级为「PR 口径」,只采信有论文/监管机构背书的数字
P2榜单排名可比性(如 GPT-6 在 Insilico DDD Benchmark 抗体可开发性第一,更新 2026-09-04)跨榜单比较失真该榜单有防污染设计(URSA-expert-2026 分子新生成 + 专家确认、6 种自有数据),但归一化算法未完整公开、无第三方复测;总分口径与模块单独口径不一致,必须同一口径比

五、给生信岗位的落地清单(本周可执行)

序动作成本为什么现在做
1核查本机/服务器的 openfold3 版本与默认 ckpt10 分钟P0 静默换模型
2在对接流程前加一道 ligand-pocket 相似度闸门(Runs N' Poses 度量,已正式发表):得分 <50 的体系强制走物理对接兜底 + 人工复核1–2 天把「这个 pose 能不能信」从直觉变成可计算的前置数
3按 siProGenA full-text 规格,在 caiPro 数据上跑一轮最小复现(Stage 1 D3PM 位置提议 + 多样性感知 rerank)单卡 4080 SUPER 约 6 h规格完整、单卡可跑;直接对应 caiPro 现存的 candidate-construction 缺口
4RNA 表征对比:NucleicBERT(404M,免 MSA)vs 现用 RNA-FM,同时保留 MI/DCA 基线1 天MLI 上限低于 MI/DCA,别无脑替换
5把 four-way 对照 + 长度配平写进 caiPro 评测规范半天防「看似有效、实则只学到长度和 GC」
6接入 MCP:BioThings MCP + Protein Design MCP + pubmed-mcp-server(均 MIT / Apache-2.0)半天编排层已成熟,不必自造
7立硬规矩:任何外部模型结论必须配自建 holdout 才进生产—本轮 AISB / VenusFold / 榜单三条同时指向同一件事

六、下轮(09-17 起)建议盯的 10 件事

  1. AISB-1-Fed 是否提交同行评审论文 / 是否放出评测细表
  2. OpenBind 下一批结构释放量(目标数十万级)
  3. VCC 2026 终测集 10-22 下发 → 11 月下旬结果
  4. siProGenA 是否放出仓库
  5. Carbon / HoloCell / FlexRibbon 权重与代码的公开程度(目前只有 Carbon Database 明确 09-15 开源)
  6. 书生-S2 第三方复现 + NCP-ArchPreview
  7. Therna Chronos 是否放开协议 / 免疫细胞数据集
  8. 诺华 del-desiran 完整数据披露(次要终点细节)
  9. ICH M15 正式实施日期
  10. 中山市「AI+生物医药」首批资助名单(政策落地检验点)