一句话结论: 「方法好不好」第一次被系统性地降级为「数据和评测怎么设计」的问题。 三个互不相关的第三方复现同时给出条件性/负结论(共折叠微调的 keystone 依赖、V-SYNTHES2 选择配方的反富集、SynthID Bio 水印可被剥离),而且三者都公开发布了自己的失败模式 。与此同时可审计性被写进产业条款:DeepMind 给 AI 蛋白打水印、FDA 把非临床术语改为承认 NAMs、国家数据局给医疗数据集发产权登记。
本周数字 ①
51%
PXR 共享核心 pose 差异 >2.0 Å 的比例;同一指标在 PDE10A / EV-A71 上全部 <2.0 Å —— 微调成败的分水岭
本周数字 ②
0.65
V-SYNTHES2 已发表 CapSelect 配方在换打分器后的 EF100(<1.0 = 反富集)。论文规模做不出的全真值实验做出来的
本周数字 ③
157.65 亿 / 四家占六成
国内 AI 制药 2026 前 9 月融资(57 笔 / 44 家),集中度极高
§1 上版 10 项追踪回执
# 上版待追踪项 状态 本轮结论
1 Anthropic×Adaptyv Challenge 1 + Track 3 格式 部分回执 首窗确认 09-28 → 10-04 ;Track 3 = 开放、自费、Claude 使用可选 、无保证测试名额 ;Track 1 约 30 队(学术 ≤$5 万 / 产业 ≤$2.5 万 Claude credits,每题保留约 15 个设计名额),Track 2 ≤3 人送 Claude Max 20x。P0 条款 Section 3.1 禁赛名单含 China 已多源确认。 资源口径升级为三版本 → 统一写「合计约 200 万美元量级」
2 VCC 10-22 公开榜 → 11-05 截止 未到期 顺延
3 Bepirovirsen PDUFA 10-26 未到期 顺延
4 OpenBind 后续版本 + OB0 第三方复现 重大回执(负) 见 §2.1 —— OpenADMET 用自己的 PXR 数据把 OpenBind / Apheris 的微调成功拆解成机制 :收益来自 keystone 结构,不是数据量
5 ★ RNASeek 是否放仓库与权重 重大回执(正) 权重已放 :huggingface.co/JoyXiangLab/rnaseek-full;bioRxiv DOI 10.64898/2026.09.24.754173;16 亿参数、DeepSeek 架构;微调预测核酶自剪切 + 病毒 mRNA 稳定性 → reward model → GRPO (支持 IUPAC 约束);湿实验:核酶达野生型活性、3′UTR 超过训练数据与对照 AI 生成 UTR;无利益冲突声明
6 Isomorphic 官方日期与 IsoDDE 技术报告 部分 21 亿美元 B 轮再确认(Thrive 领投;Alphabet/GV、MGX、Temasek、CapitalG、英国主权 AI 基金;伙伴诺华/礼来/强生),仍无确切日期 → 继续只写「2026 年 B 轮 21 亿美元」
7 Ortet 首个技术披露 未检索到 连续 2 轮为 0,降级为长期观察
8 国家数据局医疗健康实施细则 + 江苏数据集 回执 见 §5.1
9 时安 SA030 首例给药 / SA1211 Phase 1b 未检索到 顺延(第 3 轮)
10 Ginkgo×OpenAI coopetition 10 月中旬首轮 回执 见 §3.3
第三方复现观察池
本轮 1 项命中(§2.1)。RetroChimera / BoltzProt-1 / siProGenA / Anthropic 36 套件 / TorchX 70.1% 本轮未查,按季度节奏执行。
§2 本轮最硬的三条「条件性 / 负结论」
2.1 OpenADMET:微调共折叠模型,成败在 same-pose coverage,不在数据量 ★ 最高价值
来源:OpenADMET 官方博客 Tune In: What Fine-tuning OpenFold3 Taught Us (作者 Kate Huddleston),对 Apheris(PDE10A)与 OpenBind(EV-A71 2A)两项已发表微调成功做了消融重做。
项 硬数字
从零训练 OpenFold3 256 GPU × 约 3 周
微调成本 单 GPU,几小时 ~ 约 1 天
off-the-shelf 基线成功率 CYP3A4 / PXR 基准上仅 约 1/3 的结构配体 pose 落在实验 pose 2.0 Å 内
PDB 公开含配体 PXR 结构 74 个(来源与分辨率混杂)
UCSF/OpenADMET 自建 PXR 数据集 184 个晶体结构(fragment → drug-like),迄今最大公开
本文分析子集 PXR-BCS 89 个 full-ligand;MW 241–474 Da,中位 348 Da
Apheris PDE10A 27 个 PDB 结构,10 train / 17 test ,全部 held out
OpenBind EV-A71 2A 79 个内部片段结构训练 / 63 个 follow-on 化合物测试
keystone 贡献度 PDE10A 每个阈值下覆盖都追溯到单个结构 5SDY (贡献训练结构数 1–3,最多占 10 个的 30% );EV-A71 追溯到 x0926a + x0812a 两个共显性片段(2–13 个,占 79 的 16.7% );少数训练结构覆盖测试集约一半或更多
消融结果 两例中 keystone-only 模型最好 ;去掉 keystone → RMSD 分布变宽、优势消失;EV-A71 中加入非 keystone 数据「主动损害」性能
PXR 失败根因 51% 的 keystone–member 对,其共享核心 pose 差异 > 2.0 Å (PDE10A/EV-A71 均 < 2.0 Å);PXR-BCS 严格划分下每组仅 2–5 个化合物、无显性 keystone ;随机划分微调零提升 (中位略降但分布变宽),人工 curated split 只在被覆盖的 19 个验证结构上有增益,70 个 held-out 无效且误差最高
相似度度量的坑 5SDY(train) vs 5SH8(test):共享核心 18 重原子 、MCS coverage 62% ,但全分子 Morgan FP(r=2, 2048bit) Tanimoto 仅 0.37 → 全分子相似度会误导,要看子结构 + 结合位点 pose 一致性
结论一句话
模型学的不是化学,是
原子在空间中的相对位置 。同一子结构若在你的训练集中结合在不同位置,就没有一致的空间 lesson 可学 ——
问题在于不一致性,不在于数据量不足 。作者收尾明确呼吁「领域需要 physics-informed 模型,而不只是更多数据」。
对 caiPro 的直接映射(P0): 这条就是「内部数据增量回路」的
反例说明书 。如果 7295 阳 / 1120 阴 里同一 scaffold / 同一 seed 匹配模式的序列呈现不一致的实测读数(很可能),那微调只会让分布变宽。
先做一致性诊断,再决定能不能微调。
2.2 Pauling AI:V-SYNTHES2 的发布配方在换打分器后「反富集」
V-SYNTHES2(Nazarova et al., npj Drug Discovery 2026,Katritch Lab @ USC + Chemspace + Enamine)本身是硬成果:
暴力对接 360 亿 REAL Space 化合物需 ~3.6×10⁸ CPU 小时 ;V-SYNTHES2 只对接 ~380 万 化合物/片段,>10,000× 降算力
新组件 CapSelect (几何判断:已对接片段是否有足够口袋空间长出第二个合成子),替代原方法针对每个靶点的人工调参
1730 亿 xREAL Space 首次应用,较 110 亿 REAL 空间成本仅增 10–15% ,近线性扩展
CACHE #2(SARS-CoV-2 NSP13 RNA 结合位点 )盲评:77 个选中化合物中 6 个实验结合 = 8% 命中率 ,vs 全场平均 2.3% ,进前三;CACHE #4(CBLB)1 个化合物达标
前瞻筛选 cPLA2:117 个测试 → 19 个命中 = 16% ,得到 0.88 nM 先导且有体内活性
但 Pauling AI 做了一个论文规模做不了的全真值实验 :挑一个足够小的反应空间,把全部 10,704 个产物全对接 ,拿完美 ground truth 打分:
策略 对接占比 命中真实 top-100 命中真实 top-500 EF100
全空间(ground truth) 100%(10,704) 100 500 —
随机(期望) 18.5%(1,983) 18 92 1.0
CapSelect,论文权重 18.5%(1,983) 5 33 0.65
反富集 :按论文规则对接 18.5% 的空间,拿到的最优化合物比随机抓同样 18.5% 还少。他们的一行修复版变成 7.7% 的对接量抓到真实 top-100 中的 53 个 。
⚠ P1 必须同时引用 caveat
该复现把打分器从 ICM 换成了 Vina(UniDock),作者自己标了 "Caveat #1: the paper's recipe did worse than random
on our scorer "。所以正确读法是「
选择配方强依赖打分器,不具备跨打分器迁移性 」,而不是「V-SYNTHES2 无效」。谁要把它搬进内部流水线,
必须先在自己的打分器上重跑一遍全真值对照 ,别直接抄论文权重。
2.3 SynthID Bio:生物设计的「溯源」第一天就把失败模式写进论文
Google DeepMind 09-30 发布(Nature 方法论文同日),与 Stanford Hie Lab、Arc Institute 合作,合作方含 Twist Bioscience。
序列水印 :改造 ProteinMPNN 的采样,密钥偏置氨基酸选择 + 水印分数过滤;检测需同密钥
结构水印 :SynthIDBio-structure 微调 AF3 的扩散与置信模块 + 检测器,生成坐标携带 zero-bit 水印(只能判有无,不能区分用户)
湿实验 :VEGF-A / SARS-CoV-2 spike RBD / PD-L1 三个靶点,Adaptyv Bio 做实验验证;对每靶点重测序 15 个已验证 AlphaProteo 骨架 (不是完整 de novo 设计战役 ),两种水印设置各 222 个非水印 / 267 个水印 序列;命中率与亲和力分布无统计学显著差异
结构水印在 AF3 评估集上近完美可检测、对全局精度影响可忽略、抗刚体变换/坐标噪声/裁剪
已知失败(原文自述) :重测序攻击可基本剥离序列水印 (包括从已知 binder 出发重新生成替换序列);结构水印不耐结构松弛 、无法归因到具体用户 、未测试与其他结构水印方案的区分度
许可 :代码 Apache 2.0 、数据 CC BY 4.0 ;AF3 权重仍受单独条款约束
判读
这是「可审计性」第一次被做成产品级能力,但
它自己证明的第一件事是自己可被绕过 。对做内部流程的人来说,价值不在水印本身,而在
它把「设计溯源」变成了必须进台账的一项 (与上版安徽/湖北药监口径同源)。
§3 模型、方法与开源平台(本轮新增)
3.1 开源模型 / 算法
名称 来源 / 时间 许可 硬数字与要点
LEMON-ZEST arXiv 2609.37675(09-29) MIT 代码+权重+结果全放ZEST 进化感知分词(MSA 保守区导出词表),平均 4 残基/token ,1024 上下文装 4000 残基 ;LEMON 仅 200M 参数 、单张 H100 训一周 ,远同源检测上胜过 600M–3B 的 SOTA → 算力受限团队的现实选项
RF–PepTune bioRxiv 10.64898/2026.09.24.754053 预印本 环肽多目标优化的结构准入图 :先建 parent-specific pair-complete 准入图 (单替代 + 全部位置不同的对),再在图上做 Pareto MCTS(通透性/溶解度/抗污/低溶血),选出序列再做完整结构复评。334 个 parent(MDM2/GABARAP/MCL1)三臂对照:10.2%(无准入)→ 51.5%(单替代)→ 77.5%(对完备) ;对完备比单替代 +26.0 个百分点(95%CI 20.7–31.4) ;「属性达标但结构失败」从 88.3% 降到 9.3% ;另 90 个输出四项分数全涨且满足预设结构标准
HBDesigner bioRxiv(Kuhlman lab,v2 09 修订) 预印本,无利益冲突 深度学习采样 + 原子级能量打分设计埋藏氢键网络 ;在同源异源二聚体家族中装特异性(此前设计工具失败);单体埋藏极性相互作用、同源二聚体扩展界面 H-bond 网络
MOSAIC Yale + Boehringer Ingelheim,Nature DOI 10.1038/s41586-026-10131-4 完全开源 2,498 个专家 LLM 各自代表一个化学细分领域;合成 35 个以上未见报道化合物 ;输出不确定性估计 (按请求与专家知识契合度排实验优先级);超越商业 LLM
Murmurent bioRxiv 10.64898/2026.09.24.753565 开源 CC-BY 4.0面向学术协作环境 的 agentic AI 底座:多成员 choreography、专用 agent(统计/可视化/文献/EDID 审查)、分层记忆 、可追溯记录 (避免重复走进死胡同的决策)、跨成员强制 SOP 与数据治理 。用 Pin1(浅催化口袋、难成药)做抑制剂发现演示
ScienceBuddy Preview PhAI Labs,09-24,arXiv + GitHub 技术报告公开 浏览器 workspace,224 个工具 / 22 个模块 ;双循环自改进 (内循环改 harness、外循环 RL 训任务模型)。Qwen3.5-4B 起步,三轮递归:held-out 单次准确率 42.2% → 73.3% (33.3% 错→对,2.2% 对→错);固定权重下 harness 适配 31.1% → 51.1% ;固定 harness 下 RL 使 pass@4 48.3% → 67.8% 。⚠ 自述为案例研究、非与其他系统的对照实验
Paper2Agent Stanford(Miao / Zou / Pritchard),Nature 09-16 MIT ;可装为 Claude Code / Codex skill;HF Spaces 有 AlphaGenome / Scanpy / TISSUE 预置 server把论文+代码库转成 MCP server (「虚拟通讯作者」)。校验门很硬 :文件必须出现 + 数值 3% 容差 内匹配 + 图 perceptual hash Hamming <20 ,每函数最多 6 次重试,失败工具直接剔除。100 篇计算生物论文:74 篇成功 agentify,599 个提案工具中 593 通过 ;300 题基准 91.2 ± 1.6% vs Claude+Repo 80.3%(Sonnet 4)/ 86.3%(Sonnet 4.6) ;$0.20/query、1.6 分钟 vs $0.38/4.3 分钟。AlphaGenome agent:45 分钟建 22 个工具、$14 ,教程题 98.7 ± 1.3% vs Claude+Repo 82.7% vs Biomni 37.3% 。26 篇失败 ,原因可枚举:缺可执行代码 / 缺数据或模型产物 / 环境失败 / 脚本不可泛化。10 篇非生物论文(TabPFN、SAM 2、SAELens)42 个执行任务 98.1% 。多 agent 协作把 rs887314(银屑病)候选因果基因定为 GPR137 ;重看 chr1:109274968:G>T 给的是 SORT1 ,而原论文强调 CELSR2/PSRC1(GTEx 显示三者都有显著肝脏 eQTL)→ 顺带证明这类位点的因果基因指派本身就难
NeurIPS 2026: Two Stages of Folding Clausthal / Technion 等,NeurIPS 2026 主会接收 — 对 ESMFold / OpenFold / Boltz-1 做因果干预:一致的两阶段 计算结构 —— 早期 block 建立成对生化信号 (电荷等),晚期 block 建立成对空间特征 (距离/接触);pairwise states 可跨模型线性对齐并互相替换 → 与上版「pair representation scaling」同源
GluePlex Baylor,Nat Commun — AI 结构预测 + 物理建模发现分子胶 :预测 VAV1 SH3-2 结构域 接触点,无任何已有复合物实验结构 的前提下被实验证实;靶 VAV1(T 细胞淋巴瘤/自身免疫)
DSSNA bioRxiv,GROMACS 模块 开源 自动分类 MD 轨迹中的核酸结构特征(碱基对/堆积/螺旋),发现只有一部分观测到的相互作用随时间稳定
HelixDTA 中科院合肥物质科学研究院,JCIM 66(18):12128–12142 — 双分支序列-结构学习 + 完整靶标结构;Davis / KIBA 稳定;在陌生药物结构、远源蛋白序列、新结构上仍可靠
LongevityBench (补齐)Cell 189(19):5980–5994.e8 ,DOI 10.1016/j.cell.2026.08.026CC BY 4.0 OA;权重在 HuggingFace 17 个任务 / 25,457 条 prompt / 5 个生物学域 (NHANES 临床、GEO 甲基化、GTEx 转录组、Olink 血浆蛋白组、OpenGenes+CellAge+SynergyAge);5 个 0.6B–9B 模型 (LFM2 与 Qwen3/3.5 基座),用 Insilico MMAI Gym 多任务微调 + 混入 10%/20% 通用对话数据防过拟合 + 等权线性合并。L-Qwen3.5-9B 总榜第一,超过 Gemini 3.1-Pro ;L-LFM2-2.6B 在 Olink 蛋白组与 GEO 甲基化上超过所有前沿模型 ;L-LFM2-1.2B 在 OpenGenes 掩蔽二分类进前三;Longevity Claw(开源 agent 平台)。设计意图明确:降低「靠复述训练信息拿高分」的可能
自进化 agent 现状盘点 zata.cc 审计(09-24~28) Apache-2.0 三项 AlphaEvolve 未开源 (只放结果仓库 + 白皮书);FunSearch「开源等于没开」 (最后 push 2024-02-05,不含 LM/沙箱/分布式);可用替代品:OpenEvolve 7,450★ (09-28)、ShinkaEvolve 1,416★ (09-24)、EvoScientist 5,025★ (09-26)
3.2 核酸 / RNA 侧(caiPro 直接相关)
★ RNASeek 权重已放(§1.5)
这是本轮对 siRNA 方向最重要的一条 :pretrain → 功能预测器 →
GRPO 的完整三段式已经开源可跑,且是
RNA 而非蛋白 。
MTNA 专刊 (Molecular Therapy Nucleic Acids ,DOI 10.1016/j.omtn.2026.103095)一批核酸算法新供给,其中明确开源 的:ClinASO (gapmer ASO 快速发现平台,DOI …102933);RNase H 介导 ASO 效力建模(深度学习 + 结构能量计算,…103004);化学修饰 siRNA 的快速活性预测 :结构基能量计算 + 推断增强表格深度学习 (…103029)→ 与上版 OpenADMET「tabular foundation model + 外部嵌入」同一条路线,只不过落在 siRNA 上 ;BRPtools(AutoML)、mRNA 稳定性(细尺度结构特征大幅提升)、密码子优化(Transformer + 对比学习)、无 PAM 限制的碱基编辑器
RNAExplorer (CSBJ Vol 35, 09-22,DOI 10.34133/csbj.0224,Sailem lab):RNA-FM embedding → 可解释生物特征 ,系统比较 miRNA / piRNA / siRNA ;piRNA 的 GC 含量与 Tm 显著更高;网页应用 www.rnaexplorer.com 可交互分析。→ 「把黑盒 embedding 映射回可解释特征」这一步值得抄进报告模板
siProGenA (西湖大学,CC-BY-NC-ND,仍未见仓库 ,第 4 轮):本轮拿到 full-text 细节 —— 明确点名 candidate-construction gap (现有管线在模型开始排序前就把候选位置和 guide 序列固定了);Stage 1 D3PM 做 mRNA 条件的位置提案 + 多样性感知重排;Stage 2 BFN 做温度可控 guide 生成,保留 seed 与切割位点互补性 、允许其他位置受控变异。62 个阳性片段 Hit@1 0.790 / Hit@5 0.903;89.8% 的已测位点上 seed/cleavage-preserving 变体优于经典反向互补。P0 仍是 n=62 且为计算打分
Wave Life Sciences 09-30 :GSK 选中一个肝脏适应症候选进入 GSK 管线,用 Wave 自有的 SpiNA design GalNAc-siRNA (自述较对照格式有更好效力、持久性与 Ago2 装载 );Wave 收 1,200 万美元里程碑 ,每个合作项目另有最高 3.3–3.75 亿美元 开发/上市/商业化里程碑 + 分级特许权;另有 3 个项目向候选推进。→ siRNA「设计格式」本身被定价
前沿生物 FB7023 (PCSK9/Lp(a) 双靶)入选 AHA 2026 Late-Breaking Science ,11-08 口头报告 ,公布动物药效 + 首次人体研究数据 。管线矩阵:FB7023(ASCVD)、FB7033(MASH,HSD17B13/CIDEB,曾登 EASL 2026)、FB7013 + FB7011(肾病,去年 ASN 肾脏周);截至 6 月末已提交 11 项 PCT 。→ FB7023 状态升级为「已有 FIH 数据」,FB7011 仍用半年报口径
3.3 竞赛与「人机」格局
赛事 状态与硬事实
Anthropic × Adaptyv 5 题每周一题(09-28 → 10-31):物种交叉反应性 / pH 敏感性 / 肽-MHC / GPCR 等;实验 11-30 前完成,数据 12-15 全公开 Proteinbase(含阴性)。无现金奖 ;Track 1/2 需申请(09-16→09-24);Track 3 为国内唯一通道
Ginkgo × OpenAI 10 月中旬开赛至年底,三轮。首轮 sfGFP ,标准 = 最低成本产最多蛋白 ;后两轮难度递增并加入是否正确折叠 等判据。Ginkgo 提供可选化学品清单,允许自带 ≤10 种清单外化学品 ;OpenAI agent 与人类团队互不知晓对方选材 。背景:2026-02 双方把无细胞蛋白合成成本降 40% ;Jewett 学生手工 1,231 次 vs 机器人约 3 万 次。CEO Jason Kelly 原话「所有人都害怕输 」
对照组 Edison Scientific(Sam Rodriques)在列 AI 可解生物问题清单;FutureHouse 组建评审团 + 现金奖;Geodesic Intelligence(顾全全,09-10)Grand Challenges 征题不问国籍、100 万美元
§4 产业与资本
英矽智能 09-30 :提名 ISM1354 (新一代小分子 GIPR 拮抗剂 ,潜在 best-in-class,肥胖/2 型糖尿病,可拓展心血管)。2026 前 9 个月已提名 10 款 PCC,刷新年度纪录,2021 年以来累计 34 款 。对照 1 月提名的 ISM0676(人源化小鼠与司美格鲁肽联用最高 31.3% 减重),ISM1354 在 PK 与安全性上多维度优化。当日股价 +8.48% 至 60.1 港元 。H1 营收 1.06 亿美元 +287.2%、期内利润 3,554 万美元、经营现金流转正、期末现金及投资组合 5.85 亿美元。⚠ 收入主体是 BD 首付款与里程碑,具一次性特征
国内 AI 制药融资(前 9 月) :57 笔 / 44 家 / 157.65 亿元 ,为 2025 全年(51 亿)的 3.1 倍 ,超 2023–2025 三年之和;头部 4 笔约 95 亿占六成 (华深智药 7.87 亿美元 B 轮、Anew Labs 2.9 亿美元、元思生肽 1.5 亿美元、寻明生科 1 亿美元)。集中度极高 → 大多数 AI 制药公司没分到这轮繁荣
Biossil(09-28) :OpenAI Startup Fund 领投 1.53 亿美元 (全股权),估值 10 亿美元 ,成加拿大最新独角兽;2023 年成立,用 LLM 从「被药企丢弃的分子堆」里翻候选,买/授权后重启;已买或授权 12 个分子 ;项目覆盖镰状细胞病(senicapoc,强生曾放弃,正在 SickKids / CHUM / McGill 招募)、IPF、胶质母细胞瘤、乳腺癌、阿尔茨海默。⚠ 未经公司正式公告,Globe and Mail 引消息人士;CEO 是否确认各源说法不一
Enveda (回执):3.11 亿美元 E 轮,累计 >8.45 亿 ;Catalio 的 George Petrocheilos 进董事会
Retro Biosciences :据 FT,正在融 10 亿美元 ,Altman 参与(此前给过 1.8 亿);GPT-4b micro 让两个 Yamanaka 因子效率提升 50 倍以上 ;三个疗法,阿尔茨海默临床试验年内澳洲启动。⚠ 传闻阶段
成都先导 H1 业绩说明会(09-30) :小核酸 OBT 板块收入 5,402.93 万元,同比 +94.03% ;参股公司先衍生物 已建「新颖小核酸修饰 + 肝外递送 + 单分子双靶点」体系,三个项目进临床 :AGT 超长效降压 LDR2402 IIb 入组中;INHBE 肥胖 LDR2515 I 期入组完成待读数;PCSK9/Lp(a) 双靶 LDR1259 近期获 IND 批准将启 I 期
Codexis :与某 siRNA 开发者合作评估酶法 寡核苷酸合成(ECO Synthesis + StereoSelect 立体化学控制),用连接而非传统固相合成组装 siRNA 双链;对照纯度/质量/连接性能
分子胶 :TRI-611(ALK 分子胶降解剂,cereblon)临床前降解 ALK 融合蛋白含 TKI 耐药型、能入脑 、颅内模型有效;I/II 期首例给药 2026-03 ,已获 FDA Fast Track
§5 政策与监管
5.1 国内
「计算医学」首次作为专有名词进入国家规划 (科技日报 09-26 专家解读《医药工业发展"十五五"规划》)。中科计算技术西部研究院赵宇:以往创新药走单/多靶点路径难以反映真实情况,是「双十魔咒」症结;《规划》要求 2030 年 FIC 占全球 ≥25% ,数据基础已具备。另有「AI 制药全流程数据自动采集与追溯系统 」作为高价值场景写入(澎湃/中华网口径)。→ 写本子可直接引的两句
国家数据局首批数据产权登记 :全行业 56 个 数据集,其中医疗机构数据集 6 个 (5 个来自北京;地方代表为山西国药同煤总医院「2016–2026 胸腹部疾病多模态全病程数据集」)。该院 7 月在北京国际大数据交易所 完成登记挂牌(山西省医疗机构首家),8 月获「数据要素×」山西分赛一等奖(全省唯一获奖公益性医疗机构)
刘烈宏 09-21~23 江苏调研 (国家数据局官网 09-29 发布):已建成「抗体、药效、知识产权、乐理、运河文化」等行业高质量数据集 ;全省数据产业规模 4,700 亿元 ;省市一体化公共数据授权运营平台发布授权运营目录 1,808 类 、供给数据 超 200 亿条 ;泰州依托人群队列融合「三医」数据支撑疾病早筛、创新药研发、精准诊疗
数据标注产业医疗健康领域先行先试试点城市 :国家数据局批复大连与上海、广州、成都、济南、温州 ;目标打通「数据供给→专业标注→模型训练→场景验证→成果转化」闭环
可信数据空间 :截至 2026-06 全国 36 个 试点上线,医疗健康等五行业占比 >40% ;广州注册医疗机构近 50 家、22 个数据产品、39 个专病数据集、入组周期缩短 20%+ 。国家数据局将适时启动第二批试点 并落地「可信数据空间 + AI」融合应用
5.2 国际
FDA 09-21 直接最终规则 :把「动物试验」替换为「非临床研究」,承认 NAMs (细胞实验、器官芯片、计算模型)可用于临床前安全性评价;若无显著反对意见则 2027-02-04 生效
FDA AI 可信度指南 (FDA-2024-D-4689)仍为 Draft Level 1「Not for implementation」 :七步框架(定义问题 → 定义 COU → 评估模型风险 → 制定可信度评估计划 → 执行 → 说明局限 → 沟通证据);核心是 COU + 双因素风险评估(错误影响 × 人工监督程度) 。外部验证要求明确:留出整份临床试验数据集优于同一数据的切分 。FDA 已有 15 项 AI 药物开发工具(DDT)进入资格认定程序 ;EMA 有 QoNM 机制;EMA 与 PIC/S 正在研议 AI 用于 GMP 的草案(按用途区分「关键 / 非关键」)
中国台湾 2026-01 公布施行《人工智慧基本法》,尚缺药品专属规范;年底将出 AI 白皮书
⚠ 美国《生物安全法案》2026 年正式生效并纳入国防授权框架 (生物谷报道口径)→ 国内企业用 AI 做全球化研发的外部不确定性,本轮首次进入简报,下轮需核原文
§6 国产算力:从「模型适配」下沉到「算子栈」
DeepSeek 09-30 开源昇腾基础设施六件套 (与英伟达侧组件一一对应 )—— 本轮国产算力最硬的一条,且是基础设施 而非模型适配:
组件 作用 硬数字
TileLang-Ascend 高级语言封装 Ascend C 底层指令 DeepSeek 训练用到的每一个 TileLang 算子在昇腾都有高性能实现;承载 V4 系列大部分算子。项目自测 GEMM 约手写 Ascend C 的 0.98× 、向量算子 0.96× 、Flash Attention 类 0.95× (自测非独立 )
DeepGEMM-Ascend 矩阵乘,API 兼容原版,支持 BF16/FP8/FP4 BF16 密集矩阵乘达硬件上限 99.8% ,FP8 约 99.5% (Ascend 950DT,CANN 9.20)
DeepEP-Ascend MoE expert-parallel 通信 EP8 下 FP8 dispatch 373–375 GB/s 、combine 345–347 GB/s (用概念验证固件;华为商用版计划 10-15 左右 );EP32 下 sustain 约物理载荷上限的 90–95%
FlashMLA-Ascend 稀疏注意力 prefill 410 TFLOPS(理论上限 95%) 、decode 360 TFLOPS(83%)
TileKernels / DeepSelect 向量与访存算子(自动选 NV/华为后端、同一 Python API)/ TopK 选择 —
双方联合定义 128 卡 Ascend 950 SuperPoD Flex + UBL128 组网:单层 scale-up 3.2 Tbps ,两层 scale-out 达 256K 卡 ;华为在 CANN 社区发布 recipes(大 EP 低延迟推理、单卡/单节点部署、大规模训练、长上下文 KV cache 池化、agentic RL);EP32 + 128K 上下文离线测试 DeepSeek-V4.1-Flash 2,469 output tokens/s/卡 @5ms 、5,102 @10ms (不含服务调度与框架负载均衡)。未声称 V4 已在昇腾完成全规模训练
华为 openPangu-2.0(09-28) :全代码开源 (预训练 + SFT + RL 完整训练管线,不只是权重),可在昇腾集群复现全流程
昇腾路线图补齐 :960DT 提前三个季度 2027 Q1 就绪、960PR 提前一个季度 2027 Q3 ;970 / 980 于 2028 / 2029;昇腾 910C 超节点已部署 超 1000 套 ,950 超节点已规模商用
摩尔线程 :MTT S5000 完成 Protenix-v2 全链路推理,端到端较国际主流 GPU 提速约 26% 、精度对齐(字节 Seed 团队研发,2026-04 发布)
判读
对做生物计算的人来说,这条链的意义是
「换卡」的成本结构变了 —— 过去换国产卡要重写算子,现在至少在 DeepSeek 这条栈上是 API 兼容的。生物模型侧的适配(TorchX 昇腾、Protenix on MTT S5000)已在跑。
§7 岗位信号(本轮 5 条 JD)
岗位 薪资 / 时间 关键原文
AI 算法专家(化学方向 AIDD) 30–50k·14薪 关键职责第 4 条:「规划并建设模型训练与推理平台及 MLOps 机制 ,覆盖数据与模型版本管理、实验追踪、评估、部署、在线/离线推理及运行监控 」;第 6 条:「系统评估模型的准确性、泛化能力、鲁棒性、可解释性和适用边界 ,并以可量化的业务价值或实验结果作为项目验收依据 」;技术栈点名 GNN/Transformer/Diffusion/LLM/Agent
AIDD 算法工程师 (元思生肽 Syneron Bio,合成肽)— 任职要求第 7 条:「能够将多个模型、科研工具和数据处理步骤整合为自动化、可复现的计算工作流 」;第 8 条:「理解基于大语言模型的工具调用、函数调用、工作流编排或 AI Agent 框架 ,并能够将相关概念应用于科研工作流」;第 4 条:用过 AF2/AF3 或同类「并能够解释模型的输出和各类指标 」
AIDD 抗体算法研究员 (上海)35–65k·13薪,09-14 「对模型预测结果能进行评估解释;若遇到预测与实验数据不吻合的时候,有能力自主解决并提高模型性能 」;基于 NGS + SPR/DSF/SEC/细胞活性标签做增量训练 ;跟踪前沿文献「评估、复现、改进开源模型 」
AIDD 研究员-模型开发 (上海)25–50k·13薪,09-20 「建设领域数据与训练评测体系 ,完成多模态数据清洗、表征、对齐、数据集构建、实验设计、基准评测及误差分析 」;「搭建从实验原型到工程部署的完整链路,推进模型微调、推理加速、服务化、监控和版本管理 」
AIDD 研究员 (丽珠医药,珠海)12–20k,09-29 传统 CADD/DeepChem 配置(PyMOL/AutoDock/MOE/Gromacs + Python + GNN/Transformer),门槛明显低于上四条
共性统计(连续第 11 轮)
维度 本轮 趋势
干湿闭环 5/5 连续第 11 轮 100%
可复现工作流 / MLOps / 版本管理 4/5 ★ 新维度,本轮最高 —— 从加分项直接进主职责
AI Agent / 工具编排 3/5 ★ 首次进「任职要求」而非加分项 (上版 2/6 且仍在加分项)
评测体系(基准评测 / 误差分析 / 适用边界) 3/5 稳定高位
结构预测 3/5 稳定
核酸 0/5 连续两轮算法岗缺席
结论
「会训模型」继续贬值,「能把它做成可复现、可监控、可解释边界的服务」在涨价。 Agent 编排从 nice-to-have 变成硬要求,只用了一轮。
§8 对 chen 的 6 条可执行动作
级别 动作 依据 成本
P0 给 caiPro 的 7295 阳 / 1120 阴做一次「一致性诊断」再谈微调 :按 scaffold / seed 匹配模式 / 修饰模式分组,统计组内实测读数的离散度(类比 PXR 的 51% pose >2Å)。组间不一致就别微调 —— OpenADMET 证明随机划分会零提升甚至让分布变宽§2.1 低(SQL + 一天)
P0 照 RF–PepTune 建「结构/生物学准入图」 :把「效力/脱靶达标但可开发性失败的端点」比例作为主指标 (他们 88.3% → 9.3%)。caiPro 侧准入条件 = 合成纯度 / 脱靶谱 / 免疫刺激 / 稳定性 / 修饰可行性,先枚举单替换 + 全位置对 ,再在准入图上做多目标搜索§3.1 中
P0 立刻拉 RNASeek 权重跑一遍 :huggingface.co/JoyXiangLab/rnaseek-full。先复现它的「功能预测器 → reward model」这段 (核酶自剪切 / mRNA 稳定性),把 caiPro 的效力与脱靶预测器训成 reward model,再谈 GRPO 生成§1.5 中(1–2 卡·天)
P1 照 MTNA 那条「结构基能量计算 + 推断增强表格深度学习」做化学修饰 siRNA 活性预测 :与上版 OpenADMET(MAE 0.50→0.43)同一技术路线,且已被用在 siRNA 上。比先上扩散便宜一个数量级§3.2 中
P1 补「可复现 + Agent 编排」到能力栈 :JD 已把它写进任职要求。caiPro 侧具体落点 = 数据/模型版本管理 + 实验追踪 + 一键重跑;可与 patent-cli Web 控制台复用同一套工程§7 中
P2 设计溯源进台账 :SynthID Bio 已经把「AI 生成序列/结构的溯源」做成产品议题(哪怕它自己可被剥离)。内部流程至少应记录:模型版本、权重来源、参数、prompt/约束、时间 —— 对齐安徽/湖北药监「台账、来源、脱敏、授权、人工复核、全程留痕」口径§2.3 低
§9 口径冲突与失真源
# 冲突 处理
1 Isomorphic 21 亿美元 B 轮日期 三个源均无确切日期 → 继续只写「2026 年 B 轮 21 亿美元」不写月份 (第 3 轮)
2 Anthropic×Adaptyv 资源口径三版本 写「合计约 200 万美元量级」
3 V-SYNTHES2 CapSelect 复现 EF100 = 0.65 ⚠ 必须连 caveat 一起引 :复现换了打分器(Vina/UniDock 而非 ICM),正确读法是「配方不跨打分器迁移」,不是「方法无效」
4 aidrugsearch.com 连续第 6 轮命中失真源 (本轮 4 次:FDA 指南、虚拟细胞基准、AI 生成分子 FDA 批准、免费工具清单)显式排除,一律不采用
5 境外无关域名挂英文/中文 live-blog 注入,第 3 轮 :bophin.com、betebt.com、verdice.news、cronfeed.work、thequantumdispatch.com、wpnews.pro、dataphoenix.info、allweatherfinance.com、svmuu.com 内容可能为真但多为二手且有 AI 生成腔,必须回原站核实
6 前沿 FB 系列状态 FB7023 升级 为「已进临床 + 11-08 AHA 公布 FIH 数据」;FB7011 仍用半年报口径(IND-enabling)
7 十五五「计算医学首次进规划」「AI 制药全流程数据自动采集与追溯系统写入高价值场景」 均为解读/媒体口径 ,与工信部联规〔2026〕210 号原文表述(「加快人工智能、量子计算、超级计算、计算医学等新技术赋能药物研发」)不冲突但不完全等价,引用时标「专家解读/媒体口径」
8 Biossil 1.53 亿美元 未经公司公告 ,Globe and Mail 引消息人士;CEO 是否确认各源说法不一 → 标「据报道」
§10 本周三个数字
数字 ①
51%
PXR 共享核心 pose 差异 >2.0 Å 的比例;同一指标在 PDE10A / EV-A71 上全部 <2.0 Å。微调成败的分水岭。
数字 ②
0.65
V-SYNTHES2 已发表 CapSelect 配方在换打分器后的 EF100(<1.0 = 反富集)。论文的规模做不出的全真值实验做出来的。
数字 ③
157.65 亿 / 四家占六成
国内 AI 制药前 9 月融资总额与集中度。
§11 下轮(10-02 起)执行建议
Anthropic×Adaptyv Challenge 2(10-05 前后)+ Track 3 实际提交格式与入口 (首窗 10-04 已关,看 Track 3 是否仍可提交)
VCC 10-22 公开榜 → 11-05 截止 (榜首能否显著高出 0.2629)
Bepirovirsen PDUFA 10-26
OpenBind 后续版本 ;OB0「48%→61%」第三方复现(进观察池)
siProGenA 是否放出仓库 (第 5 轮);ClinASO 开源平台实测
FDA 非临床术语最终规则:2027-02-04 是否因反对意见撤回
美国《生物安全法案》2026 生效原文与对国内 AI 研发的实际约束 (新增,需核一手)
国家数据局医疗健康实施细则 + 江苏「抗体/药效」数据集是否开放申请
时安 SA030 首例给药 / SA1211 Phase 1b (第 4 轮)
Ginkgo×OpenAI 首轮 sfGFP 实际开赛与结果
降级与顺延
降级为长期未回执 :Ortet(2 轮 0)、北京 1 亿算力首批名单(4 轮 0)、RIBOSPAN 一手核证、Isomorphic 官方日期。
顺延 :ICH S13、ScienceIDE 许可、OpenADMET Phase II 首批盲测。
AIDD 增量简报 · 2026-10-01 | 基线版本 2026-09-30 | 18 轮中英双语检索 | 本简报对每条数字标注来源层级,标注「据报道 / 二手 / 自评」的内容不作为事实引用依据。