AIDD 增量简报 · 2026-09-30

以 09-29 版为基线的 diff | 检索窗口 2026-09-23 → 09-30 | 中英双语 16 轮
增量 diff 开源算法与平台 国内外趋势 生信岗位可执行
一句话结论:"开源"在本周从一个布尔值变成了一份六维契约。OpenBind-0 发布模型的同时发布用来审判它的 717 个新结构;Anthropic binder 的 26.8% 终于补齐了分母(354/1320);RNASeek 把"预训练→预测→GRPO 优化→湿实验"四段跑通。三条独立的线指向同一件事:可审计性(auditability)正在取代准确性,成为 AIDD 最稀缺的东西。
本周数字 ①
354 / 1320 = 26.8%
AI 蛋白 binder 命中率,分母与对照组首次完整(HTS 0.01–0.1%、计算从头设计 10–15%)
本周数字 ②
48% → 61%
OpenBind-0 加 inference-time chemical steering 后"姿态正确 + 物理合理"联合成功率
本周数字 ③
157.65 亿 / 四家占六成
国内 AI 制药 2026 前 9 月融资(57 笔 / 44 家),集中度极高

§0 上版 10 项追踪回执

#上版待追踪项状态本轮结论
1Anthropic × Adaptyv Track 3 提交格式回执Challenge 1 = EGFR 条件性结合(肿瘤酸性 pH 结合 / 生理 pH 不结合)+ 人鼠交叉;首个提交窗口 09-28 → 10-04,之后每周一题至 10-31。Track 3 仍无保证测试名额(设计由 Claude 工作流挑选)
2★ Anthropic binder 22–35% vs 26.8% 口径冲突重大回执冲突解决:15 个靶点 14 个拿到 binder;1,320 个设计 → 354 个湿实验验证结合 = 26.8%;Anthropic 自述区间 22.6–26.7%;排名第一的设计命中率 49%;16 靶点中只有 1 个零命中。参照系:HTS 随机筛 0.01–0.1%,人工计算从头设计 10–15%
3VCC 10-22 公开榜未到期赛制补齐:Cell Vol.189(09-17)设计论文;2025 首届 114 国 / 5,000+ 注册 / 1,200+ 队提交 / 300 队完成最终提交;Arc 自述"没有模型能在全部评价指标上稳定替代真实实验测量";2026 验证集 3 条癌细胞系(各约 300 次扰动 / 约 400 细胞 / 只给非靶向对照基线 + 敲低基因 ID),测试集另 3 条独立细胞系且不给真值,Cell-Eval 六项指标聚合
4Bepirovirsen FDA PDUFA 10-26未到期—
5BoltzProt-1 第三方复现未回执第 2 轮仍 0。保留"两级口径 + 可开发性联合门槛"为可用模板
6Ginkgo × OpenAI coopetition 10 月中旬未到期—
7前沿 FB7011/FB7023/FB7033 IND未检索到新增本轮未出现新披露,不臆造
8时安 SA1211 Phase 1b 数据部分SA1211 无新数据;新增 SA030(ALK7 siRNA,肥胖/超重)2026-09-28 启动中国 I 期(CTR20263625,24 例,单次给药剂量递增)
9十五五配套 / 北京 1 亿算力首批名单部分配套有进展(国家数据局十大行业数据攻坚,09-22,首轮安徽,含医疗健康);北京首批名单连续第 3 轮未检索到
10RIBOSPAN-10K arXiv 原文部分细节补齐:6,760 万条序列 / 857 亿核苷酸 token(RNAcentral + Ensembl),15%→40% 两阶段 MLM,注意力隔离打包;但来源仍为中文二手解读、权重未核 → 仍不作主证引用
降级
BoltzProt-1 第三方复现、北京算力首批名单、RIBOSPAN 一手核证 —— 三项转入"长期未回执",不再每轮占追踪位。

§1 开源层:本轮出的是"契约",不是"模型"

1.1 OpenBind-0(OB0)—— 发布模型的同时,发布审判它的标尺

项目硬数字
整体截止后复合物上与 AF3、Protenix-v1-20250630 相当
chemical steering 增益联合成功率 48% → 61%(姿态正确 + PoseBusters 物理合理,双条件)
EV-A71 2A 蛋白酶top-25 92.2% / top-1 73.8%
FatA 硫酯酶OB0 28.2% vs OpenFold3-preview2 14.5%(Protenix-v1 最高 39.4%)
RdRp(DENV-2 / ZIKV)top-25 仅 7.7% / 6.7%
配套数据集717 个配体结合结构 = 547 个片段结合事件 + 170 个 hit 结合事件(298 unique 片段 / 101 unique hit)
首个 OpenBind 数据集EV-A71 2A:925 个晶体结合事件 / 699 个化合物,601 个带亲和力
★ 最重要的负面结论
对 RdRp,微调目标特异片段结构的收益因体系而异,"微调本身不能解决所有复杂靶点的预测缺口";失败模式是找不到正确口袋 + 口袋构象错误(靶点柔性高、训练集相似度低)。→ 这句话应贴在每份"数据不够就微调"的方案首页。
对生信岗的意义
本轮最该抄的一件事:发布模型时同步发布"评测它的新结构"。caiPro 若要做内部基线,应当固定留出一批"训练截止后才产生"的实测序列作为永久 held-out,并公开它的构建规则。

1.2 六约束矩阵:别再问"哪个模型最好"

来源:rewire.it《A FASTA File Is Not a Specification》(2026-08-24,09-23 修订),六部分系列 Part 1。把"开放"拆成六个部署问题:

约束要记录什么为什么改变结论
生物范围精确支持的链、配体、离子、修饰单体 / 界面 / 混合实体的失败方式不同
条件化路径MSA / paired MSA / templates / restraints / 单序列输入证据本身就是实验的一部分
采样预算seeds、recycles、loops、diffusion samples一次性运行不能和 25-sample 协议比
选择规则置信度排序器 + 保留候选数生成器可能产出排序器漏掉的好样本
计算与可复现CPU 预处理、数据库、显存、checkpoint、训练访问运行时声明常统计不同流水线阶段
权利代码、权重、训练数据、服务、输出条款仓库许可很少能描述整个部署
评估一个"开源"生物模型,要问六个问题而不是一个 ① 生物范围:支持哪些链/配体 ② 条件化:MSA / 模板 / 约束 ③ 采样预算:seeds × samples ④ 选择规则:谁挑、挑几个 ⑤ 算力与可复现:库/显存 ⑥ 权利:代码+权重+数据 结论不是一个名次,而是一份可复现的运行记录 谁、在什么预算下、用哪个排序器、挑了几个 本轮落点:OpenBind-0 是唯一把 ⑥ 做到"数据+代码+权重+配方"全覆盖的 且额外发布 717 个新结构作为④的公开标尺 —— 模型与标尺同发布,才是可审计 反面:HelixFold3 非商用 / 旧 RoseTTAFold 权重非商用 / PyRosetta 商业需授权
图:六约束矩阵(rewire.it 提出)与本轮落点。caiPro 内部选型表可直接照此建列。
系统许可关键限制 / 协议
OpenFold3通用线仍是 preview(preview2 为最新有文档版本,截至 08-24)基准协议:MSA 子采样 1,024 条 / 10 recycles / 5 MSA seeds × 5 diffusion samples;★ oracle 挑选时与 AF3 差距显著小于置信度排序器挑选 → 生成与选择是两个独立瓶颈
OpenBind-0Apache 2.0(数据+代码+权重+配方)不是最终通用 OpenFold3;当前包默认 checkpoint 已指向 OB0
ProtenixApache 2.0(代码+参数)v2 约 4.64 亿参数,开发者自述较 v1 提升 9–13 pp(三个集合);v1 的采样对数线性增益不能算到 v2 头上;FoldBench 的 Protenix 行测的是 v1
RF3 / RoseTTAFold3Foundry 许可(允许源码与二进制再分发,附条件)不覆盖旧 RoseTTAFold 产物(旧仓库:代码 MIT,权重与数据非商业);全原子 + 隐式手性 + 原子级几何条件化;不自动生成 MSA,需自备;可提前终止低置信运行
BoltzMIT,代码与权重,学术 + 商业可用—
Chai-1当前仓库已改为 Apache 2.0,代码与权重均含商业使用(取代 2024 报告中的非商业本地条款)—
HelixFold3下载的代码与参数非商业精简数据库约 530 GB;A100 40GB bf16 约 1,200 tokens
FoldBench 协议—1,522 个 assembly / 九类靶点;H800 80GB;每靶 25 个预测(5 seeds × 5 samples)/ 10 recycles;PDB 时间窗 2023-01-13 → 2024-11-01 + 训练相似性过滤;Ab-Ag 172 对上 AF3 在 DockQ≥0.23 的成功率降到 47.9%;配体越像训练集配体越准 → 对未见配体泛化有限
P1 实操提醒
HelixFold3 不能商用、旧 RoseTTAFold 权重非商业、PyRosetta 商业需授权 —— 这三条是国内 binder 流水线最常见的隐性合规雷。

1.3 本轮其余开源 / 新发布

名称出处 / 许可硬数字备注
RNASeekbrvai16 亿参数生成式 RNA 基础模型,DeepSeek 架构,跨物种转录组语料;zero-shot 捕获物种特异转录特征与内含子-外显子边界;微调预测核酶自剪切活性与病毒 mRNA 稳定性;GRPO 强化学习优化生成;湿实验:生成核酶达野生型活性,生成 3′UTR 超过训练数据与对照 AI 生成 UTR★★ pretrain→predict→optimize 三件套 + 湿实验闭环,与 caiPro 目标结构同构度最高的一条
Chronos(Therna Biosciences)公司开源数据引擎 + 数据集,Lightning Studio 免费用在单次实验中用数万条合成基因与 mRNA、覆盖 ~50 个人类细胞系训练★ 少数把核心数据资产开放的公司动作;CMO Betty Junod / CFO Heather Paduck
MIMOSAbioRxiv 09-24,DOI 10.64898/2026.09.24.753155,无竞争性利益声明推理时框架,不重训练,约束扩散式抗体设计复现该靶点已知同源配体的作用几何与化学;挂到 RFAntibody / BoltzGen 上;在 KEAP1、uPA、IL-8 三个无约束方法零命中的靶点上取得 20–26% 命中率,亚微摩尔到个位数 nM★★ "有已知配体结构的靶点"立刻变可设计
AtomWeaverProteinQure,bioRxiv 09-23,DOI 10.64898/2026.09.23.753608,GitHub ProteinQure/atomweaver + pepbench非天然氨基酸(NCAA)反向折叠;多组分 flow matching;身份只在解码时决定 → 词表是推理时属性,加一个 NCAA 只需一份参考结构、无需重训;300 残基词表含 4 个训练中未见类型⚠️ 全部作者为 ProteinQure 雇员/股东
DS3dRNAbioRxiv 09-26,DOI 10.64898/2026.09.26.754601,GitHub TOVI-YUEN/DS3dRNA三体统计势 + 物理引导采样;支持多构象设计;Mango II 三个设计全部保留荧光活性(亚–低 nM 表观亲和力);twister 核酶 5 个设计终点剪切 37.7–50.6% vs 野生型 23.5%CPU + CUDA;自带 DS3dRank 给外部 FASTA 打分
MetExPredbioRxiv 09-21,DOI 10.64898/2026.09.21.753060代谢+排泄 17 个分类终点 + 2 个回归终点;序列 + 图 + 可选 ESM-2 蛋白表征;protein-aware masking 使同一架构可在"只有分子"和"有靶点"两种设置下跑;AUROC 0.844 / AUPRC 0.734 / F1 0.697;清除率 RMSE 0.686、半衰期 0.668★ 架构设计(同一模型支持有无蛋白上下文)值得抄
MoTIF-XarXiv 2609.37384(09-29)motif 中心多模态;在 OpenADMET ExpansionRx 全部 9 个终点上 MAE 最低;motif 归因分与实验测得的活性偏移相关亚结构级可解释性
OpenADMETopenadmet.ghost.io09-24 宣布新资助(生成前瞻性 ground-truth 与结构数据);09-25 发布 CYP 挑战中期排行榜 + 新增 Structure Track;CheMeleon 嵌入 + 初筛预测喂进 tabular foundation model,MAE 0.50 → 0.43;盲测竞赛基础设施模板开源★ 内部季度盲测可直接照抄
T-REX—高通量 de novo binder 设计的 agentic 控制器(Target-adaptive Rescue-Explore-eXploit),把蛋白设计框成在线资源分配问题智能体从"写代码"进到"调度设计战役"
PhiFold—联合生成骨架 + 二阶动力学(残基位移协方差),分解为局部柔性 + 低秩集体运动 + 残基参与度从"长什么样"到"怎么动"
BioDyadarXiv 2609.31939BioXArena 76 个任务、每种方法每任务 2 小时墙钟、离线沙箱;对比 BioDyad / MLEvolve / Biomni / BioXArena Harness × GPT-5.6-sol / GLM-5.1 / DeepSeek-V4-Flash智能体评测开始有统一定时定量预算
annoreport—单脚本 Python(仅需 3.9+),汇总 Prokka/Bakta 全部 bin 注释;206 个南极土壤宏基因组 bin、603,799 CDS、47.1% 注释率小工具,但零依赖
Arc Institute 工具链GitHub ArcInstituteState(704★)、Stack(166★,推理时 in-context learning)、cell-eval2(GPU 加速的扰动预测评测)、Arc Virtual Cell Atlas、pdex、ScreenPro2、binseq/scx/bqtools/cytoMIT / Apache-2.0 / BSD-3 混用,商用前逐个核

§2 命中率分母:本周把 Anthropic 那笔账算平了

层数字来源
靶点数15 个靶点,14 个拿到有效结合物Anthropic,Adaptyv Bio + Twist Bioscience 湿实验
设计数1,320 个设计同上
表达95% 表达成功Adaptyv
结合354 个结合靶点同上
命中率26.8%(Anthropic 自述区间 22.6%–26.7%)354/1320
最好单靶49%⚠️ 券商口径(华福证券 09-20),二手
对照组HTS 随机筛 0.01%–0.1%;人工主导计算从头设计 10%–15%券商整理
P0 判读
数字本身不是新闻,"分母 + 表达率 + 对照基线三者同时公布"才是。此前所有"AI 命中率 X%"的说法都缺乏其中至少一项。
P1 保留意见
15 个靶点是 Anthropic 自选;设计由 Claude 工作流挑选后送测(存在选择偏差);49% 为二手;"类 CRISPR"仍是 Anthropic 自己的类比。

Adaptyv 侧(补齐产业底座)

其他抗体设计

§3 RNA / 核酸侧

管线

综述锚点(Cell Reports Medicine,DOI 10.1016/j.xcrm.2026.103058,Godinho / Ferguson / Aartsma-Rus)
★ 与上版 Arrowhead"AI 上限就是你喂给它的数据"同向的独立证据。"必须含失败数据"第一次出现在权威综述里,写方案可直接引。

§4 产业与资本

新公司

Isomorphic Labs 21 亿美元 B 轮(口径补齐)

Thrive Capital 领投,Alphabet / GV 跟投,MGX、Temasek、CapitalG、英国主权 AI 基金新进;平台 IsoDDE;合作方诺华、礼来、强生。⚠️ 日期冲突 英文源为近日宣布,中文源称"5 月完成" → 引用时只写"2026 年 B 轮 21 亿美元",不写月份。

罗氏(本轮最硬的企业级数字)

项数字
模式自动化实验室 "Lab in the Loop":AI 提假设 → 机器人做湿实验 → 数据回流迭代 → 成果转 IP
资金约 20 亿瑞士法郎(约 24.1 亿美元)研发结余资金重新调配
目标2030 年前最多上市 20 个 NME
渗透率AI 工具 Target Nexus 有望在 2026 年底前参与 80% 的研究组合决策
成功率AI 赋能下 III 期临床成功率从 2025 年 65% 升至 80% 以上
决策2025Q4–2026Q2,40% 的管线决策有可追踪 AI 支持
⚠️
上述均为公司自述,成功率归因未披露对照组。

国内

§5 政策与数据要素

§6 岗位信号(本轮 6 条 JD)

岗位地点 / 薪资值得记的点
环肽 AIDD 算法工程师上海浦东 35–65k×15薪(09-21 更新)AF3/Boltz2/RoseTTAFold + RFDiffusion/BindCraft/PocketXMol + GROMACS/AMBER/OpenMM + MM-GBSA;"构建干湿实验闭环"进核心职责
AIDD上海黄浦 45–70k×14薪"把 AI 预测结果转化为可验证的实验假设,并参与设计-合成-验证闭环";"形成可复用的平台化能力和工具链"
AIDD 算法科学家(映恩生物)上海浦东 25–55k×15薪"AI 深度学习 + 分子动力学模拟多技术融合"(GROMACS/AMBER/NAMD 全流程:体系构建→参数→平衡→结合自由能→轨迹分析)
AI 制药高级研究员(上海医药)上海(09-25)加分项原文:"有将 AI 模型部署为 web 网站、内网平台经验"、"有 Docker、Linux、GPU 服务器使用和服务器管理经验"、"有 LLM、分子生成在药物设计中的应用经验"
小核酸高通量筛选研究员(扬子江药业上海海路生物)上海浦东(截止 2027-09-23)湿实验岗:siRNA/ASO 文库 96/384 孔高通量筛选、板内质控、识别孔板污染/边缘效应/转染异常、hit 富集与排序、SOP
Oligonucleotide Project Lead上海 40–60k×14薪siRNA/ASO 序列设计优化(结合亲和力、效力、稳定性、特异性)+ 体外表征(敲低效率、脱靶、细胞毒性、摄取)+ 递送(抗体偶联/LNP)+ 临床前
共性
干湿闭环 6/6(连续第十轮 100%);结构预测 4/6;MD 2/6;平台化/工程化(Docker、内网部署、GPU 服务器管理)2/6 且进加分项;核酸 2/6(本轮均为湿实验为主,算法岗缺席)。
给 chen 的读数
核酸方向的 JD 本轮全部偏湿实验(高通量筛选、体外表征、递送),算法岗缺席 → 结合上版"CADD/AIDD 分子优化—siRNA 方向"与"时安 AI 模型研究员",核酸算法岗是稀疏但真实存在的细分位,稀缺本身就是议价权,但要求的是"能打通到湿实验"而不是"会训模型"。"把模型部署成内网平台 + 管 GPU 服务器"这条正在从加分项往主职责爬 —— 这是生信岗最容易被低估的护城河。

§7 口径冲突与信息源风险

#项处理
1Isomorphic 21 亿美元 B 轮日期英文源近日宣布 vs 中文源"5 月完成" → 只写"2026 年 B 轮 21 亿美元",不写月份
2Anthropic binder 命中率 22–35% / 22.6–26.7% / 26.8% / 49%已收敛:26.8% = 354/1320;22.6–26.7% 为 Anthropic 自述区间(口径可能不同);49% 为单一二手源,引用须标"券商口径、待核"
3AnewFold FoldBench 数字(Ab-Ag 76.2% vs IsoDDE 75.6%;蛋白-配体 77.4% vs 76.0%)来源为产业公众号(09-19),非一手论文 → 本轮只作趋势参考,不作事实引用
4aidrugsearch.com 连续第 5 轮命中失真源出现"FDA 2026-03 精准肿瘤 AI 草案要求前瞻性验证""68% 公司合规成本上升""联邦学习使 PRS 群体偏倚降 31%""2.7× 计算开销"等精确但无法定位的数字 → 一律不采用,后续检索显式排除
5境外无关域名挂中文 live-blog 注入(第 2 轮)fytokomia.gr / windowstorussia.com / atikcevre.com.tr / vaseinstruments.com / worldattention.com 下挂中文或聚合内容 —— 内容可能为真(Adaptyv €3,435 万、AIntibody 结果),但必须回原站核实后再引
6Tautomer-Predictor 数字被挑刺独立评述指出:宣传的 0.97 是 pooled、拆分后 0.72;"3.2 小时 460 万化合物"取自四个库中最宽松的那个 → 引用须带这两条 caveat;PDBbind 5,075 个配体中 126 个(2.5%)互变异构体指派可能有误
7AI 临床管线口径已达 5 个以上 → 固定引"比率":I 期 80–90% 完成、II 期 ~40%(≈历史基线)、III 期个位数
8罗氏"III 期成功率 65% → 80%+"公司自述,无对照组、无归因方法 → 引用必须带"公司自述,未经独立验证"

§8 对 chen 的 6 条可执行动作

优先级动作依据 / 成本
P0照 OpenBind-0 的做法,给 caiPro 建一条"永久 held-out 实测集":从 7295 阳 / 1120 阴 中固定留出一批入库时间最晚的序列,永不进训练、永不调参,并公开它的构建规则。以后任何模型升级只报这个集上的数OpenBind-0 用 717 个新结构做基线;成本在整理历史入库时间,不是重训
P0把"命中率"改成带分母与表达率的两级口径:候选级(计算打分通过)/ 确认级(湿实验有效),并强制报朴素基线 + 经典规则 + 历史随机三对照Anthropic 26.8% 之所以可信,是因为给了 1320 / 354 / 95% 三个数;<1 人日
P1抄 RNASeek 的 pretrain→predict→GRPO 三件套:先把"效力预测器 + 脱靶预测器"训成 reward model,再用 GRPO 去优化生成,而不是先上扩散RNASeek 已用核酶与 3′UTR 湿实验验证"生成序列超过训练数据";caiPro 有 7295/1120 正好够训 reward model
P1照 MIMOSA 做"已知约束注入":把已知种子匹配 / 已知内源 miRNA 同源关系作为推理时约束注入生成,而不是指望模型自己学MIMOSA 在不重训练的前提下,把三个零命中靶点做到 20–26%
P1用六约束矩阵重做内部选型表(范围/条件化/采样预算/选择规则/算力可复现/权利),重点核 HelixFold3 非商用、旧 RoseTTAFold 权重非商用、PyRosetta 商业需授权 三条半天;避免商业交付时的许可雷
P2把"模型部署成内网平台 + 管 GPU 服务器"写进个人能力栈本轮上海医药 JD 已把它列为加分项;与 patent-cli Web 控制台经验直接复用
可直接引用的三句原话
  1. Cell Reports Medicine 综述:AI 不会取代经验性测试,且依赖包含"失败与不安全"数据的大规模高质量数据集
  2. FDA 2026-04 警告信:人类对法规与药效质量的问责权绝不能转嫁给算法
  3. Arc Institute(VCC 2026 设计论文):没有模型能在全部评价指标上稳定替代真实实验测量

§9 下轮(10-01 起)追踪建议

  1. Anthropic × Adaptyv Challenge 1 结果 + Track 3 提交格式(10-04 首窗关闭,之后每周一题至 10-31)
  2. VCC 2026:10-22 公开榜 → 11-05 提交截止 → 11 月下旬获奖(榜首能否显著高出 0.2629;测试集 3 条独立细胞系 + Cell-Eval 六项)
  3. Bepirovirsen FDA PDUFA 10-26
  4. OpenBind 后续版本 / OB0 是否被第三方在自有靶点上复现(尤其"chemical steering 48%→61%")
  5. RNASeek 是否放仓库与权重(本轮未见仓库声明)
  6. Isomorphic 21 亿美元的官方日期与 IsoDDE 技术报告
  7. Ortet 首个技术披露(5 亿美元承诺后是否有模型/数据)
  8. 国家数据局十大行业攻坚的医疗健康实施细则 + 江苏"抗体/药效数据集"是否开放申请
  9. 时安 SA030 中国 I 期首例给药 / SA1211 Phase 1b 数据
  10. Ginkgo × OpenAI coopetition 10 月中旬首轮(sfGFP)

顺延:前沿 FB7011/FB7023/FB7033 IND、ICH S13、ScienceIDE 许可、OpenADMET Phase II 首批盲测结果。