AIDD_增量简报_2026-09-20.md · 8 轮中英双语检索(d3/d7/m1/m2) · 新增锚点标 ★
| # | 结论 | 严重度 / 可信度 |
|---|---|---|
| 1 | 竞争单位落到"干湿闭环的所有权"。Anthropic MHS + 自建湿实验室 + 验证计划 + Arrowhead CEO 数据护城河论,四源互证。 | 高置信,四源互证 |
| 2 | ★AIntibody 首届盲测上 Nat Biotechnol(DOI 10.1038/s41587-026-03238-6):29 机构 / 511 条抗体 / 全独立湿实验。寻明生科 AuraIDE 夺冠 94.7 pM,优于湿实验最优克隆 113 pM。 | 本年度最强单一正面证据 |
| 3 | ★OpenDDE = Aureka 的开源版。此前当独立模型跟踪的 OpenDDE(Apache-2.0)实为 AuraIDE 开放权重版本,已过第三方评测。 | 高置信 |
| 4 | ★Anthropic MHS(08-27 research preview):read/write 原语 + 自然语言 tag + MCP/CLI/code。QuEra 激光锁恢复 99.3% vs 58%,150s→6s;CMU 集成数周→8 小时。 | P1 尚未开源 |
| 5 | ★Proto(Stanford + Arc,2026-06-23):生成式生物学高级语言,4 原语 + 7 运行时抽象 + 120+ 工具集成 + MCP。 | 对生信最像"流水线 DSL" |
| 6 | ★Cell 09-17 整期"Focus on AI in biology"专刊:VCC 2026 + Eric Xing 世界模型 + Zitnik 世界模型 + 15 大挑战 + AI 医疗失败模式综述。 | 官方问题清单 |
| 7 | ★VCC 2025 首届完整排名曝光:百图第一 / 天府锦城第二 / 芝大纯统计第三 / Altos 通用奖。Goodarzi:纯端到端神经网络尚未跑赢混合模型。 | P0 先跑线性基线 |
| 8 | ★十五五配套细则到位(工信部联规〔2026〕210 号):10 项指标 + 25 项任务 + 9 个专栏 + AI 应用场景逐条清单。上版悬案解决。 | 政策确定性最高 |
| 上版待查 | 本轮结果 | 判定 |
|---|---|---|
| ① VCC 10-22 终测 | 时间线未变;Cell 专刊背景补全;2025 首届完整排名曝光(百图 / 天府锦城 / 芝大统计 / Altos) | ⚠ 部分 |
| ② Bepirovirsen FDA 10-26 | 无新增 | ✕ 未变 |
| ③ Anthropic 36 套件独立复现 | 仍 0 篇独立复现。官方分类补全:6 大类 36 包(折叠预测 14 / 幻觉设计 3 / 结构生成 6 / 逆折叠 3 / 基因组学 7 / 蛋白 LM 3,含 Borzoi);H100 上 Exact 1.6×、Fast 4.2×、Big 3.5×;Fast 最快 Chai-1 6.4×、最慢 AtlasFold 2.8×;Exact 最快不超 2.5×。Atlas 已被收录 | ⚠ 部分 |
| ④ TorchX GPU 版许可 / 复现 | 无第三方复现。许可口径收紧:官方只写"模型权重按 MIT 许可开放",推理/训练代码许可未单独声明 | ⚠ 降级 |
| ⑤ siProGenA 仓库(第 4 次) | 仍无代码(CC-BY-NC-ND)。按上版规则 停止追踪,降级为方法论参考。补偿:拿到 siDiff 代码 github.com/cybericha/siDiff | ⛔ 停追 |
| ⑥ FlexRibbon / HoloCell / MatOS | 无新增 | ✕ 未变 |
| ⑦ OpenBind / LIGAND-AI | 无新增 | ✕ 未变 |
| ⑧ AISB 正式论文 | 仍未评审、模型不公开。新增误述风险:中文券商研报已写"AISB 训练出开源 OpenFold3"——实际 AISB 微调权重未公开 | ✕ 未变 |
| ⑨ Carbon Database | 无新增 | ✕ 未变 |
| ⑩ 十五五配套细则 | 解决:10 项指标 + 25 项任务 + 9 专栏 + AI 场景清单 | ✓ 解决 |
| ⑪ ARO-RAGE / ARO-DIMER-PA | 官方口径确认为 "mean maximal single dose reductions"(PCSK9 −72% / APOC3 −88%),仍无安慰剂校正;ARO-RAGE-1001 安全性:SAD 40 例 TEAE 72.5%、MAD 33 例 60.6%、哮喘 MAD 9 例 88.9% | ⚠ 部分 |
| ⑫ Paper2Agent / 书生-S2 复现 | 无新增 | ✕ 未变 |
| 维度 | 事实 |
|---|---|
| 规模 | 29 家机构、511 条 AI 设计/预测抗体;Challenge 1 有 25 家提交 165 条;每队 ≤10 条;14 天提交窗口 |
| 靶点 | SARS-CoV-2 Spike RBD —— 公开数据最密集的靶点之一,恰好能区分"记住了"还是"学会了" |
| 三项任务 | Ch1 计算亲和力成熟(只给第一阶段 NGS 数据)/Ch2 现有候选按亲和力排序/Ch3 筛选数据之外的新 CDR 组合 |
| 验证链路 | 统一全长 IgG 表达 → SPR 初测 → 单点 + 标准 KinExA 复核;五项可开发性门槛(HIC 疏水 / BVP 多反应性 / AC-SINS 自相互作用 / Tm 热稳定 / Tagg 聚集);全程盲测 |
| 稳定性 | AuraIDE 占前五的第 1、2、5;共 6 条 <10 nM 且满足可开发性;Ch2 第三、Ch3 第九,唯一三项全进前十 |
| 新颖性 | 全长 CDR 拼接 Levenshtein:与亲本差 19 aa,与数据集最相似序列仍差 ≥12 aa —— 不是高频突变的拼接 |
| 其他 | UTHealth Houston Novamab AI 进前五;Aureka 累计融资近 2 亿美元;其开源版 OpenDDE 已过第三方独立评测 |
| 名次 | 团队 / 方法 |
|---|---|
| 第 1 | 百图生科 xTrimoSCPerturb —— 深度学习 + 统计特征 + 生物学先验的混合模型 |
| 第 2 | 天府锦城实验室 彭玺 XLearning Lab(中国学术团队) |
| 第 3 | 芝加哥大学 Outlier —— 经典统计方法 |
| 通用奖 | Altos Labs —— 流匹配生成模型 + 700 万精选私有细胞(高质量小数据 > 单纯堆量) |
| 名称 | 来源 / 日期 / 许可 | 关键内容 | 相关性 |
|---|---|---|---|
| Proto | Stanford + Arc Institute(Hie 组) 2026-06-23 bioRxiv 10.64898/2026.06.22.733870 软件与 UI 全开放 |
4 原语(Sequence / Generator / Constraint / Optimizer)+ 7 运行时抽象;120+ 工具集成;proto-tools 隔离依赖/权重/数据库/GPU 调度;多目标 = 约束能量之和(product of experts);支持拒绝采样、梯度优化、MCMC 退火;Python / JSON / Web canvas / Agentic / MCP 五入口;可选 Modal 远程容器。湿实验验证两例:细胞系选择性内含子、细菌启动子-阻遏子对 |
★★★★★ |
| seqme | szczurek-labgithub.com/szczurek-lab/seqmeBSD-3 Bioinformatics Advances |
生成序列设计评测库。三类指标(sequence / embedding / property);覆盖小分子、DNA、ncRNA、mRNA、肽、蛋白;支持 one-shot 生成与迭代优化;自带诊断与可视化 | ★★★★ |
| EM3DFold | 华中科技大学 黄胜友组 bioRxiv 2026-09-18 DOI 10.64898/2026.09.16.752067 CC-BY-NC 4.0 |
语言模型驱动的 cryo-EM 密度图 de novo 蛋白 + 核酸建模 | ★★ |
| BFVD v3 | Steinegger 组(SNU) bioRxiv 2026-09-18 DOI 10.64898/2026.09.16.752260 |
UniProt-complete 级病毒蛋白结构预测 | ★★ |
| OpenDDE (身份补全) |
寻明生科 Aureka 2026-07 Apache-2.0 |
= AuraIDE 的开放权重版本(AIntibody 冠军模型),已过第三方独立评测 | ★★★★ |
| siDiff (代码地址) |
github.com/cybericha/siDiff |
离散掩码扩散 + 效能引导;三阶段采样:结构候选过滤 → 动态去掩码引导 → 聚类去冗余 | ★★★★ |
起源:Anthropic × HHMI Janelia。标准化 driver,read / write 两类原语;自然语言 tag 描述设备特性与安全边界(如机械臂重量);自动生成设备参考文件;MCP / CLI / code files(API)三种控制通道,可跨设备编排。
| 实测地点 | 结果 |
|---|---|
| QuEra Computing | 激光锁恢复控制器:700 次试验 99.3% 成功 vs 手工脚本 58%;恢复时间 ~150s → ~6s;随后调 12 个相互依赖的 PID 参数,残差噪声 15.7 mV → 1.55 mV(−90%),专家验证下锁定 19 小时(手工约 1.6 次/小时失锁) |
| CMU | 调度软件 + ActiveX/COM 脚本 + GUI-only 工具打通:数周 → 8 小时;随后无人干预重跑系列稀释剂量反应并调整浓度范围,R² > 0.98 |
| HHMI Janelia | 7 个厂商程序经共享内存字典归一;新增一台相机支持只用"几分钟" |
| UW(Baker / Pinglay) | 6 台仪器监控 <1 周搭好;AI 监督 qPCR 在最佳时刻终止反应 |
| Genentech | Claude 协调移液工作站 + 机械臂 + 读板机做蛋白检测交接 |
2026-04 ~4 亿美元收购 Coefficient Bio(技术与人才)
2026-06 Claude Science 发布(部分实验由 Claude 指挥机器人单元)
2026-08-27 MHS 发布(面向物理设备的 AI 智能体控制标准)
2026-09-17 Life Sciences Verification Program 公测申请
(Standard / High-risk Use 两档,首次开放 Mythos)
2026-09-17 36 个推理优化套件开源(Apache-2.0)
2026-09-17 与 Adaptyv Bio 合办蛋白设计竞赛
(5 道难题 / 100 万美元 Claude credits + 25 万美元 Modal / Twist 供 DNA /
5000+ 设计湿实验验证 / 优化后模型开源)
2026-09-18 曝出自建湿实验室(旧金山湾区,招募生化人才)
| 问题 | 回答要点 |
|---|---|
| 中国 siRNA 公司竞争 | "任何时候都有大约十几个中国 siRNA 公司,很多跑得很快……这对患者是好事。但我们撞 RNAi 这堵墙撞了 15 年以上,能触及 7 种细胞类型、其中 5 种已有临床项目,是唯一能用 dimer 技术的。我们有多年先发优势,但不是永远。" |
| AI 用在哪 | "主要用于 新靶点发现(跑靶点筛选、多因素排序)、新型配体设计、序列选择。有专职 AI 团队。大概只是刚刮到表面。" |
| AI 能否弯道超车 | "AI 引擎的能力不会超过你能喂给它的数据。我们这些年做了数十万条 RNAi 分子,学到了大量什么 potent、什么不 potent 的规律。这种数据集配上 AI,新玩家很难啃动 —— brute force is a hell of a thing。" |
| 补刀 | Hamilton:"也没有任何东西能替代跑临床试验。就算发现阶段省下几个月,后面所有开发阶段你还是得一步步磨过去。" |
| 优先级 | 动作 | 依据 / 预期收益 |
|---|---|---|
| P0 | 任何"上模型"之前,先把线性/均值基线跑出来并写进报告(PCA+LR、预测训练集均值、随机 kNN、只数长度 —— NucleicBERT 的 four-way 对照是范本) | VCC 2025 第三名是纯统计;Nat Methods:scGPT/GEARS 打不过 PCA+LR;首届 VCC MAE 全线输给"预测平均细胞"。直接决定你的模型有没有真实增量,也是审稿人第一个问的问题 |
| P0 | 换掉泄漏的切分:转录本层级 + 相似度阈值(leakage-aware),不要随机切 | BenchAudit 审计 51 个 benchmark 配置;DTI 最近邻相似度中位数 0.779;NAR siRNA 综述 lqag099 明确要求 leakage-aware。你的 Hit@1 可能有一半来自泄漏 |
| P1 | 引入 seqme 做生成质量评测(BSD-3,ncRNA 原生支持) | 你目前只有 pairwise efficacy 打分,缺"生成分布对不对"这一层。补齐生成器与评估器的独立性 —— 这正是 siProGenA / RNet / DrugCLIP 的共享范式 |
| P1 | 用 Proto 的原语重构 caiPro 流水线(Sequence / Generator / Constraint / Optimizer) | 哪怕不用它的代码,照接口分层也能让 4 步流水线解耦,使"换打分器""换生成器"变成配置而不是改代码 |
| P1 | 多样性感知 reranker 替代纯分数排序 | siProGenA Stage 1 就是这设计(Hit@1 0.790 / Hit@5 0.903);Arrowhead 明确 AI 用在"序列选择"。同样的候选预算覆盖更多位点 |
| P2 | 把 7295 阳 / 1120 阴 组织成可回流的数据资产:加剂量、时间序列、化学修饰标签,而不是一次性打分集 | Anzalone:"AI 引擎的能力不会超过你喂给它的数据";Altos 用 700 万精选私有细胞拿 VCC 通用奖。这是你唯一别人拿不走的东西 |
| P2 | 照 AIntibody 的赛制做内部验收:盲测 + 前瞻 + 独立湿实验 + 可开发性多门槛 | 本年度唯一 AI 打赢湿实验的正面样本,其赛制设计可直接抄 |
| P2 | MHS 只跟踪,不排期 | research preview + 需申请 + 未开源 + 官方自认缺物理直觉 |
| 级别 | 风险 | 后果 / 处置 |
|---|---|---|
| P0 | "AI 打赢湿实验"被过度外推 | AIntibody 只有 1 个靶点、1 个环节,冠军是闭源商业模型 + 专有数据。引用必须带"单靶点 / 单环节 / 闭源"三个限定词 |
| P0 | VCC / 单细胞基础模型能力被高估 | 纯端到端神经网络至今没跑赢混合模型或简单统计基线 → 选型被"SOTA 大模型"带偏,浪费算力与排期 |
| P1 | TorchX 许可口径被放大 | 官方只说"模型权重按 MIT",推理/训练代码许可未单独声明;GPU 版与 NPU 版是否同许可不明 → 商用前直接问,或只读权重自写推理 |
| P1 | MHS 按"已开源"排期 | 实际 research preview + 需申请 + 官方自认缺物理直觉(气泡事件)→ 项目依赖落空 |
| P1 | AISB 被中文研报误述为"开源" | 实际 AISB 微调权重未公开,OpenFold3 本来就开源 → 国内信息源二次失真已在发生,引用前回原始来源 |
| P1 | Anthropic 36 套件零独立复现 | 官方明示 unmaintained → 只用于提速实验,不进生产依赖 |
| P2 | Evo 2 噬菌体数字两个口径 | 302 合成→16 活 / 285 候选→16 活 → 统一表述为"合成 302 个(一说 285 个候选),16 个具备活性" |