AIDD 增量简报 · 2026-10-08

生物信息岗位 · AIDD 趋势与开源技术追踪 · 第 16 轮增量 diff(基线 10-07)

AIDD 增量简报 · 2026-10-08

定位:以 10-07 版为基线做 diff,不重写。上版 12 项追踪回执见 §1,新增硬锚点见 §2–§5,岗位信号见 §6,口径冲突见 §7,可执行动作见 §8,下轮追踪见 §9。
方法:16 轮中英双语检索(freshness d7 / d14 / m1 / m2 混用),本轮新引入两个高信噪比源:biomldigest.com 周报、gist.science 论文拆解。
本轮核心判读(三条):
① "数据即瓶颈"从论断变成了 18 亿美元的采购订单,而且出现了两种互斥的数据治理解法 —— Biohub Virtual Biology Initiative 拉到 18 亿美元(DOE + NIH + Google DeepMind + Isomorphic + Meta),走的是"造公共数据,商业资助方 embargo 一年后公开";AISB-1-Fed 与本周新增的 Antibody Developability Consortium 走的是"数据永不移动,只回传模型更新"。两条路在 siRNA 侧都还是空白。
② 核酸侧的 AI 栈第一次同时补齐了"生成"与"结构"两端,而且都是能拿到的 —— RNASeek(16 亿参数 RNA 生成基础模型 + GRPO,湿实验验证超过训练集最优)与 OFoldNA(核酸/蛋白-核酸全原子结构,FoldBench 上 DNA 单体 TM-score 0.329 vs AF3 0.243)。上轮 siFormer 是闭源形态对标,这两个是真能 clone 的。
③ 诺奖化学奖给了不对称合成,不是 AI;同一周 AP Novo 的诚实口径也出来了 —— Kagan + Soai 拿了化学奖(手性非线性效应与自催化),与 2024 年化学奖(Baker/Hassabis/Jumper)形成一次外部校准;同时 AP Novo 的规模与局限首次可引用:测了 5,600+ 个设计、最佳设计分支命中率最高 80%,但催化活性仍比天然酶或定向进化酶低几个数量级、基序构建需要针对具体反应的专家、模型尚未真正捕捉催化的物理学。

本周三个数字:18 亿美元(Biohub VBI 总盘子) · +35%(OFoldNA DNA 单体 TM-score 相对 AF3) · 5,600+ / 80%(AP Novo 实测设计数与最佳分支命中率)


§1 上版 12 项追踪回执

#上版追踪项状态本轮回执
1Bepirovirsen FDA 决定(2026-10-26)✅ 有料(倒计时 18 天)PDUFA 2026-10-26 三源再确认(pdufa.bio 更新至 10-06、PharmExec、GSK 官方稿)。新增中国商业化信号(上轮没有):GSK 与 SBP Group(中国生物制药/正大天晴 CTTQ)签署中国大陆独家合作(GSK 官方新闻稿 2026-05-11),初始期 5.5 年,CTTQ 负责进口、分销、医院准入与推广(网络覆盖 5,000+ 家医疗中心),GSK 保留上市许可与监管/质量/药物警戒/全球医学策略;GSK 还将获得审阅 SBP 早期管线资产的权利。 background:中国约 7,500 万乙肝感染者、年死亡约 45 万、84% 肝癌与慢乙肝相关;《国家病毒性肝炎防治行动计划(2025—2030)》已把功能性治愈写入目标。
⚠️ 口径注意:" resultant China hepatology burden" 的 7500 万/45 万/84% 是 GSK 稿援引,非中国官方口径,引用时写"GSK 新闻稿口径"。
2VCC 2026 公开榜(10-22 截止 / 11-05 终榜)⚠️ 无新分数,但有赛制权威口径未拿到新榜单分数。补齐两个此前只有零散提及的硬口径(来之 HP/nexi 综述 + Arc 官方资料):2026 赛自 2026-08-20 开放,赛道从 2025 的 few-shot(同一细胞系预测未见扰动)升级为 zero-shot 跨六细胞系;参赛者只拿到未扰动对照转录组;六系中三系跑实时榜、另三系留作最终盲测;奖金 10 万美元,赞助方 NVIDIA / 10x Genomics / Ultima Genomics;2026 数据在 Ultima UG100 + 10x Flex 上生成。对标 Arc State:Embedding 在 1.67 亿观测细胞上训练,Transition 在 70 个细胞系、>1 亿扰动细胞上训练;权重公开但为非商业许可;Arc Virtual Cell Atlas 已 >3 亿细胞,目标 >10 亿扰动实验。
判读口径(沿用上轮):0 = 给所有问题同一个平均答案,1 = 真实实验重跑;榜首仍在 0.26 量级,全距 ≤0.3。→ VCC 与 Biohub §2.1 是同一件事的两个面:一个在造评测,一个在造数据。
3晶泰 Kodexia 是否有第三方/合作方披露❌ 无(第 2 轮)全部仍为 PR Newswire 原文转写链(本轮又捕获 4 个新转载站:unite.ai / wisevoter.com / third-news.com / cloudspress.com / pannaphat.me / 富途),零新增原始信息、零第三方。
本轮唯一有价值的新增:cloudspress.com 做了少见的诚实核对 —— XtalPi 2025 年报(2026-04 报送)已把 Kodexia 描述为"AI 驱动的 siRNA 序列发现与化学修饰平台 + 闭环工作流",并提及体内疗效预测、肝外递送、双靶点 siRNA。→ 确认 10-06 是"正式对外发布"而非"首次出现",此前 8-19 中期业绩口径成立。下轮仍无第三方 → 与技术部分一起降级为"仅形态对标",不再追数据
4Apheris / AISB-1-Fed 是否有正式论文或技术报告 + 是否有第二个联邦联盟✅✅ 双重大回执(a) Apheris 官方技术博客全文拿到:本轮回执到接近逐句的完整口径(数据/评估/消融/限制)。新增硬细节:五家 = AbbVie / Astex / BMS / J&J / Takeda;总训练数据 >20,000 条来自活性药物发现项目的实验解析结构,"约把可用于训练的药物相关蛋白-配体数据放大三倍,构成迄今药物发现领域最多样的数据集";明确写"By necessity, the underlying structures and the trained model weights remain private... what we are making public are the aggregate results"。
(b) ★ 第二个联邦联盟已出现,且方向不同 —— 见 §2.2 Antibody Developability Consortium。
(c) 官方定位措辞值得抄:> "To our knowledge, this is the first clear demonstration that federated training delivers a step-change in co-folding accuracy, the start of a new era for federated drug discovery." 同时坦承 "Federation is not new to drug discovery. Earlier large-scale pharma federation efforts proved that cross-company training was feasible but delivered only modest gains" —— 这句话是本系列第一次拿到"为什么这次不一样"的行业自述,可直接进立项材料。
5AlphaProtein Novo 第二篇预印本 / 是否同行评审 / 是否开源权重✅ 重大回执(三项全部有答案的一半)第二篇预印本:确认存在但 DeepMind 未点名(多个二级源一致观察到官方连结到 second preprint + supporting materials "without naming the second paper")。同行评审:否(bioRxiv 预印本,全部数字为公司自测)。权重:不开源,多条独立确认(@anshulkundaje 明确 model weights not open-sourced;AGI Hunt 标题即 "weights stay closed";tricaitory 写 "pretrained weights sit behind a separate terms-of-use download and the repository carries its own output-use policy")。
★ 上版完全没有的两个规模数字(本轮新增,极其重要):测试了 5,600 多种设计;在表现最佳的设计分支中实现最高 80% 的命中率。
★ 局限三条(此前没有,现在可以诚实引用):① 催化活性仍比天然酶或经定向进化优化的酶低几个数量级;② 催化基序构建需要针对具体反应的专业知识;③ 模型尚未真正捕捉催化作用的物理学原理。
新增机构与合作方:除 Caltech 外还有 匹兹堡大学 Peng Liu 组;Frances Arnold 实验室参与。
迭代事实(重要):某个应用案例中首轮设计仅 0.1%,经一轮设计优化后大幅提升 → "AI 画出起点、定向进化收尾"是当前真实分工,不是"AI 端到端替代"。
6MAGI / T-REX 仓库是否真可执行⚠️ 部分(仅 T-REX)T-REX:bioRxiv v3 页面来源复核,仓库 github.com/ml-struct-bio/T-REX、CC-BY 4.0、"openly release" 表述属实;v3 的修订很小(Updated Figures 2a 和 3c、修订 Figure 5 caption、改正 Discussion 里的 typos)→ 说明 v1/v2 已被人认真读过,是个好信号。
MAGI:本轮仍未验证仓库,第 2 轮欠账。
7ROBUST-2026 能否跑通 + 是否含原始 Ki 数值表⚠️ 未专项验证(第 2 轮)页面复核:Posted 2026-10-01、DOI 10.64898/2026.09.25.754496、Competing Interest = 无、Funding NIH R01 GM135919 / R35 GM151996 + NSF ACCESS BIO250064 / BIO260054,摘要口径与上版一致。原始 Ki 表是否随仓库发布仍未验证。
8《十五五》AI 制药专栏配套名单 / 实施细则⚠️ 无名单,但有落地口径名单细则仍未发布。
★ 本轮拿到专栏的"具体培育方向"颗粒度:太美医疗科技披露 —— 其"AI 辅助临床试验预测和优化平台"精准契合《规划》"AI 制药高价值应用场景 — 辅助临床试验方案评审与科学评估"的培育方向。→ 专栏六项下列还有第二层子条目(此前只拿到六项第一层)。
配套硬数字:2026 年 1—9 月中国创新药对外授权交易总额突破 1,200 亿美元、同比 +36%(H1 已接近千亿美元);2026H1 超 60% 的 NMPA 批准上市 1 类新药经由其 AI 临床开发平台开发(公司自述,谨慎引用)。
9药监局《"人工智能+药品监管"实施意见》原文与准确印发日期⚠️ 未回执(第 3 轮)未命中原文。再一轮无 → 降级季度池
旁证增量:国家卫健委等五部门联合印发《AI+医疗卫生应用实施意见》,8 大方向、24 项重点应用(二手,待核原文)。
10OpenAI GPT-Rosalind 是否有正式发布/技术报告✅ 有料(间接但重要)未检索到 GPT-Rosalind 的技术报告或正式产品发布 —— 它目前只是 Freda Duan 文中与多个二级源反复引用的"模型族存在性"声称。
★ 但本轮拿到一条更硬的 OpenAI 实际动作:OpenAI Foundation 已启动超过 1.25 亿美元的资助计划,用于生物与医学数据集(Reuters 口径,经 AGI Hunt / AI Tech Daily 转引)。→ 与上轮"OpenAI 已有 GPT-Rosalind 模型族"相比,这条是花钱的证据而非声称。 见 §7-4。
11TychoBio × PacBio 首批 >10,000 样本数据集是否公开⚠️ 未回执未见公开。
★ 但拿到一条同方向的独立岗位信号:Basecamp Research 招聘 Scientist I 明确要求"developing novel methods for gene editing off-target analytics using both long and short-read sequencing"(见 §6)→ 长+短读长联合做脱靶分析,正在从论文主张变成岗位硬要求。
12《Biotechnology Investment National Security Act》与新 BIOSECURE 是否成法⚠️ 未专项检索本轮未安排。保留。

回执统计:重大回执 2(#4 联邦双联盟、#5 AP Novo 诚实口径)· 有料 3(#1、#8、#10)· 部分 2(#6、#11)· 未回执/未专项 5。


§2 本轮最硬锚点

2.1 Biohub Virtual Biology Initiative 扩至 18 亿美元(2026-10-07 官方稿)★ 本轮第一

这是"数据瓶颈论"从投资人 PPT 变成政府预算的那一刻。

出资方金额性质
US DOE(能源部)>5 亿美元 / 5 年实验室测量、建模、算力
NIH>5 亿美元(已投入的前期联邦资金,非新增)协调并交由 Biohub 标准化的既有数据集/仓储
Google DeepMind + Isomorphic Labs + Meta合计 3 亿美元企业联合投资
Biohub(Zuckerberg / Chan)5 亿美元(2026-04 已宣布的种子承诺)慈善
合计约 18 亿美元(官方稿口径 "nearly $2 billion")—
Alex Rives(Biohub head of science):"With commercial funders we have embargo periods where there's a period of time where the groups can work on the data, and then it becomes available as a public scientific resource."

2.2 Antibody Developability Consortium:第二个跨药企联邦联盟(2026-10-03 官宣)★ 直接回执 §1-4

Athena Hadjixenofontos(AbbVie AI 负责人): federated infrastructure 解決的是"datasets collected for ease rather than for machine learning"——convenience datasets 这个词是本轮最好的中文难译但值得保留的批评语汇。
Robin Röhm(Apheris CEO & 联创):"For AI to impact developability decisions in a drug program, it has to perform on a pharma's own molecules."
Rich Cohen(Ginkgo Datapoints 高级总监):目标是"建立这个领域最大的、为 ML 设计的标准化数据集 + 训练在其上的预测模型"。
维度AISB-1-FedAntibody Developability Consortium
对象蛋白-配体 co-folding(小分子 SBDD)抗体 developability(生物药 CMC 属性)
数据移动无(只回传参数更新)无(模型进各成员环境)
谁出数据五家纯私有私有 + 第三方公开混合(Ginkgo 补)
是否外购数据生产否是 —— 花钱 Kok 高通量表征补齐 label
已有成果已出结果(+16.5pp / +17.9pp)进行中(2027 初交付)
监督无外部披露Deane + Tessier 独立监督

2.3 核酸 AI 栈补齐两端:RNASeek(生成)+ OFoldNA(结构)★ 本轮技术侧第一优先级

RNASeek —— 第一个把"预训练→预测→RL 优化"跑通并有湿实验超出训练集的公开 RNA 生成基础模型

  1. Pretrain:跨物种转录组 → 生成式基础模型
  2. Predict:微调出功能性预测器作 reward model —— 核酶自剪切活性(validation Pearson r = 0.628,超过 RNA-FM / Nucleotide Transformer / 各类 BERT 式模型与自研 LSTM 基线);病毒 mRNA 稳定性 / 3′ UTR(Spearman r = 0.342,与 UTR-BERT-6mer、RiNALMo-micro 可比)
  3. Optimize:GRPO(Group Relative Policy Optimization)更新生成策略,支持用户指定的 IUPAC 约束
上三轮的线索在这里合流了 —— NARGAB 综述说"基础模型 embedding 必需性证据不足";FENNEC 说"embedding + 热力学 + 实验协变量可行";siFormer 说"把机制约束放进生成";RNASeek 给出了第四种、也是工程上最完整的答案:把预训练模型和想要的打分器解耦 —— 预训练只负责"会说话",真正决定生成方向的是你微调出来的 reward model + GRPO。
直接可用的一点:IUPAC 约束这个接口意味着"必须避开某个序列基序/必须包含某个修饰位点"这类硬约束,可以作为 RL 的约束条件直接写进生成过程,而不是事后过滤。caiPro 现在的行为是"生成候选 + 打分排序",RNASeek 展示的是"直接优化到满足约束且分数高"。
风险:reward model 偏置是这条路的头号 failure mode —— GRPO 会把 reward model 的漏洞当成目标来利用。若要用,必须做"reward model 与最终湿实验读数是否相关"的独立验证(本系列第 14 轮已反复强调同一件事)。

OFoldNA —— 核酸结构预测第一次拿到可直接对比 AF3 的公开数字

任务OFoldNAAlphaFold 3相对提升
DNA 单体折叠(平均 TM-score)0.3290.243+35%
蛋白–DNA 界面(核酸链 >20 nt,平均 DockQ)0.2860.238+20.2%

2.4 2026 诺贝尔奖:化学奖给了手性,不是 AI

奖项公布得主理由
生理学或医学10-05Karl Deisseroth(美)、Peter Hegemann(德)、Georg Nagel(德)光门控离子通道与光遗传学的发现
物理学10-06Francis Halzen(美)对 IceCube 中微子天文台的决定性贡献与天体物理源高能中微子的发现
化学10-07Henri B. Kagan(法)、Kenso Soai(硖合宪三)(日)不对称有机合成中的非线性效应与自催化
  1. 距 2024 年化学奖给了 Baker / Hassabis / Jumper(蛋白结构预测与设计)仅两年,诺奖委员会这次明确回到经典有机化学 —— 这是在提醒:AI 在化学领域的地位目前是"工具"而非"发现范式",这条外部校准很及时。
  2. 手性是药物化学的硬约束(一个分子的两个对映体可能一个是药一个是毒)。Soai 的自催化故事本质是"对称性破缺如何被放大",这与 generative model 里"如何打破对称、如何避免 mode collapse"是同一类问题,虽然是不同尺度。
  3. 与本周 §2.3 的 AP Novo(AI 从头造酶,但活性低几个数量级、还需要定向进化)放在一起看非常清楚:AI 目前在主战场上的位置,是"给出更好的起点",不是"给出答案"。 这与 ANY 之前 15 轮的 physics-informed / mechanism-informed 主线并不矛盾,但校准了预期。

§3 其他开源 / 方法增量

项类型硬事实备注
MolGenBench★ 评测基准(本輪最缺的一类)Nat Commun,2026-10-01;Cao Duanhua / Fan Zhehuan / Teng Dan / Zheng Mingyue 等;对 17 个基于结构的生成模型做基准,暴露靶点感知(target awareness)/活性分子回收(actives recovery)/泛化三处缺口,并给出标准化数据集与指标这是继 Ptarmigan/离评测之后的又一块"评测基建",且来自国内。岗位要求里 benchmark 维度持续升温(见 §6)
Gen-COMPASNature 正刊 · physics-informed2026-10;Chenyu Tang、Mayank Prakash Pandey 等(Univ. de Lorraine / CNRS + Madrid / Chicago / Urbana-Champaign);扩散模型 + committor(transition state theory),仅从起止两端结构重建稀有转变路径;" regulates NHS→sub-μs 聚合采样尺度 vs 常规方法高几个数量级";三个测试体系含 Trp-cage 与线粒体 ADP/ATP 载体;从 generated intermediate 发起的短 unbiased 模拟做验证筛选★ 本系列 physics-informed 主线的第 6 个独立来源(前有 LiGANN/FLAG/DeepICL/PocketFlow、ROBUST、张健组 Perspective、FENNEC、AP Novo)。且它的"用短 unbiased 模拟验证生成结果"是可抄的方法学
GluePlex分子胶 · AI+物理Baylor College of Medicine,Nat Commun;在没有任何实验三元复合物结构引导的情况下预测 VAV1–CRBN–分子胶三元复合物;命中 VAV1 SH3-2 结构域上的一段表面 loop 作为 degron(不是传统的 G-loop);实验验证通过含义:CRBN 分子胶的可成药靶点空间比此前认为的更宽。 另有独立团队用不同实验方法得出相同结论
GuideFlip柔性靶点 binderJamali & Scheres(MRC LMB),bioRxiv 2026-09-30;guided discrete flow matching 协同设计序列与结构,面向柔性/无序靶点的 de novo binder,降低疏水偏好;实验高命中率,含 cryo-EM 确认的 state-selective GPCR nanobody与 §2.3 OFoldNA 同属"结构建模向柔性/非经典构象扩展"这一支;Scheres 组(cryo-EM 方法学大本营)连续出手,值得单独盯
TurboPairFormer工程加速arXiv 2610.05854(2026-10-05);三角注意力(triangular attention)在 NVIDIA Hopper 上的实现,集成进 OpenFold3;16×H100 上 1.73× vs OpenFold3 Triton backend、1.13× vs cuEquivariance(crop 768);residual compensation 把梯度 RMSE 降低 28–47%;600 个输入案例下四次梯度 bitwise identical★ 与 §1-4 联邦训练直接互补 —— 联邦微调的成本大头是训练时间,这块落后很容易被忽略。同时"bitwise identical"是 federated/可复现场景的硬保证
OpenKinetics Predictor★ 生信日常工具predictor.openkinetics.org + data.openkinetics.org;开源平台整合 13 种 kcat / KM / kcat/KM 预测方法,隔离环境统一接口;可选报告 query 蛋白与各方法训练集的相似度以提示可靠性;配 CatLog 数据集(含预计算 embedding、预测结合位点、标准化切分);GECKO 建模工具箱已直接调用其 API"指标不相容导致下游锁定最容易拿的方法"这个问题终于有人做工程解了。可先用,不必自造。 独立第三方(含原作者)贡献了多个方法 —— 这点很罕见
2-step(LC 保留时间)Nature Methods 2026Fleming Kretschmer 等,DOI 10.1038/s41592-026-03243-2;小分子液相色谱保留时间预测,无需在目标系统上重训即可开箱精确预测(针对竞品"需大量训 target system"的对照优势);有软件包 + web appmetabolomics / 天然产物 / 环境分析的日常工具
stFormer空间转录组基础模型Cell Reports Methods 2026-09-30;Cao Shenghao / Li Jiachen / Shen Hong-Bin / Pan Xiaoyong / Yuan Ye(上海大学等);cross-attention 注入空间配体信号 + biased SC learning,统一 Visium 数据集国内组
RNASeek / OFoldNA / pCoMole / Tiberius核酸与序列模型见 §2.3 与下表—
pCoMole分子编辑arXiv 2026-10-01;Pareto 约束离散流序列编辑,强制硬生化可行性同时优化多属性;湿实验在激进删除后保留 GFP 荧光、保留 Cas9 PAM 特异性—
Tiberius基因预测bioRxiv 2026-10-01;Stanke / Hoff 组;端到端深度 ab initio 真核基因预测、谱系特异模型,接近基于证据的流程,算力只是零头大规模基因组注释
国产 AIVC(虚拟细胞)全景综述源xTrimo 在首届 VCC 夺冠;百图生科 × 华大智造 2026-09 签战略合作共建专属细胞大模型;阿里达摩院 Lingshu-Cell(2026-03,细胞世界模型,VCC 扰动基准领先);CellFM(中山大学杨跃东 + 华为 + 新格元,8 亿参数 / 1 亿细胞 / 天河星逸超算 / MindSpore + 国产芯片);OCTO-VC(约 15 亿参数,近 2 亿空间分辨肿瘤与免疫细胞,号称生物基础模型许可第一单);临港实验室"元生"(2025-07 多智能体,2026-03 Nat Mach Intell 虚拟细胞 + RL 设计肿瘤序贯治疗);晶泰孵化"无界进化"(2026-06 天使轮,OCOO-T 在药物/基因/细胞因子扰动基准 SOTA);华源智因(2026-07 种子轮,CTO 曾主导 VCC 冠军模型);诺禾致源已把 AIVC 平台建设写入规划;华大基因单细胞测序 2026H1 同比 +57%★ 这是本系列第一次系统拿到国内 AIVC 的完整图谱,含三条路线:基础模型 / 国产算力+上游数据协同 / 应用落地。 ⚠ 综述与二手源,个股/公司论断不予采用

§4 产业 / 资本


§5 核酸侧(本轮重点)

  1. RNASeek(UC Riverside,bioRxiv 10.64898/2026.09.24.754173) —— 见 §2.3。16 亿参数 RNA 生成基础模型 + GRPO,湿实验 3′ UTR 超过训练集最优。核酸侧目前最值得 clone 的两个资产之一。
  2. OFoldNA(Valhalla Team,arXiv 2609.37414) —— 见 §2.3。核酸结构侧第一次拿到 vs AF3 的可引用数字(DNA 单体 TM-score 0.329 vs 0.243)。
  3. ★ RAG-17:国产首个 SOD1-ALS siRNA 药物(本次 umask 的新党组书记)
  1. Bepirovirsen:PDUFA 10-26;GSK × SBP Group(正大天晴 CTTQ)中国大陆独家合作,5.5 年,覆盖 5,000+ 家医疗中心(见 §1-1)。

§6 岗位信号(本轮 5 条,其中 4 条新增)

岗位薪酬关键信号
Genentech / Roche · ML Scientist / Senior ML Scientist(Synthesis Planning & Optimization)(San Francisco,10-05 发布)$148k–274k★ 组织情报:Roche 已成立 Computational Sciences Center of Excellence(CoE),统一 gRED(Genentech)与 pRED;原 Prescient Design 现称 AI4DD。
★ 职责三条原文值得抄:① "Design novel batch synthesis-planning algorithms that maximise chemical-space coverage, information gain and experimental efficiency" —— "批次 / batch" + "最大化信息增益"第一次以算法目标的形式出现在药企 JD 里,与主动学习直接挂钩;② "Build ... active-learning loops that interface directly with automated and high-throughput synthesis platforms";③ "Drive scientific impact through publications, open-source releases, and conference talks" —— 开源发布写进 value 主张。
★ 动员增添指向 "design molecules we can actually make —— closing the loop between generative design and automated synthesis"
Merck & Co · Senior Specialist, Modeling & Informatics(Cambridge MA,10-03 发布)$159.6k–251.2k★ 要求单列 "predictive modeling, active learning, explainable ML";覆盖 modality 明确为 small molecules / peptides / targeted protein degraders;职责含 "evaluate new technology and software from commercial sources, open innovation, or external collaborations" —— "外部/开源技术评估"作为独立动词出现
Basecamp Research · Scientist I, Platform Innovation(Boston / London)$110k–140k base★★ 本轮最贴近 chen 的一条:要求 "developing novel methods for gene editing off-target analytics using both long and short-read sequencing";同时要 "Experience integrating AI protein design tools with high-throughput wet lab screening methodologies" 与 "traceable data pipelines";还需理解多样的基因编辑工具(nucleases / base editors / transposons / retrotransposons / recombinases)。
→ 长+短读长联合做脱靶分析,正在从本系列追踪的论文主张变成岗位硬要求。
杭州某 · 人工智能应用高级研究员(AIDD 方向)(西湖区,博士,09-27 更新)40–70k × 17 薪上版记录为"农夫山泉、薪资未明",本轮薪资明确。职责 3 原文:"持续跟踪并调研 AlphaFold 3、Diffusion Models、大语言模型等在生物医药领域的 SOTA 进展,并将其转化为实际生产力,沉淀内部算法库与工具链";加分项含"熟悉并能复现或微调当前主流 AIDD 大模型(AF3、Boltz-1、RFDiffusion、ESM 系列)"与"AI Agent 在科研场景的搭建与应用经验"
北京安必奇 · AI 药物开发工程师(CADD)(通州,硕士 2 年+)25–45k × 13 薪JD 中出现 "预测蛋白质结构的大预言模型 LLM、生成式人工智能"(原文如此,"大预言模型"为笔误),"在药物领域有实际应用经验者优先"
Xaira Therapeutics · Scientist(类器官 + CRISPR 筛选)$110k–155k要求 "Familiarity with perturb-seq, single-cell genomics, or spatial omics, and interest in exploring new readout methods";"Partner with computational biology, AI/ML, and drug discovery teams" —— 本系列第 3 轮出现 Xaira,其"自上而下"screening 路线的用人口径稳定

共性统计(本轮 6 条):


§7 口径冲突与失真源

  1. crew.you 第 2 轮重复同一错误 —— 该源本轮仍写 "Bepirovirsen (Geron) PDUFA";上版已用三源确认归属为 GSK + Ionis。同时它报 "Chinese-designed drugs now account for ~50% of global pipeline"(中文 coelhox.com 口径),此数字未见权威出处 → 该源整体列入低可信名单,其独家数字不采用。
  2. 新增失真形态(本轮第 3 种):"PR 稿转载链"继续膨胀 —— 本轮对 Kodexia 又捕获 unite.ai、wisevoter.com、third-news.com、cloudspress.com、pannaphat.me、富途;对 Biohub 有 insideai.news、el-fondo.com、aitechdaily.com、agihunt.info。处置:凡单一企业稿的多源"报道"一律视为一个源,只取原始出处(PR Newswire / 公司官网 / Reuters 原始线)。
  3. Biohub "18 亿美元" 与官方稿 "nearly $2 billion" 的表述差异:18 亿是各分项加总,官方口径是"接近 20 亿"(可能含未列明的算力与物资折价)。写"约 18 亿美元(官方称近 20 亿)",不要只取一边。
  4. NIH 的 >5 亿美元不是新钱 —— 是"协调用此前联邦资金投入建成的数据集与仓储"。不要把 NIH 与 DOE 并列为"新增出资方"。
  5. OpenAI GPT-Rosalind 仍无一手证据 —— 目前只存在于 Freda Duan 投资文章与其转述链。可引的硬动作是 OpenAI Foundation 的 >1.25 亿美元数据集资助计划(Reuters 口径)。两者必须分开写。
  6. AP Novo 权重口径收敛到"不开源"(此前写作"走单独 Terms",容易被读成"可申请到")。多个独立观察者的措辞是 "not open-sourced / closed weights / behind a separate terms-of-use download"。→ 统一写:代码 Apache-2.0 公开,权重不公开且需单独条款,产物另有使用条款。
  7. OFoldNA 的开源状态未确认 —— 有技术报告与详细第三方解读,但未见 repo / license。不得写成"开源"。
  8. 以下四条均为公司/机构自述,不得混入事实叙述:英矽智能 ISM1354 的"超 50 个基准任务达到 SOTA";康方"候选分子发现周期缩短近 40%";太美"2026H1 超 60% 的 NMPA 批准 1 类新药经由其平台";GSK 新闻稿的中国乙肝负担数据(7,500 万 / 45 万 / 84%)。
  9. VCC 榜单本轮仍无新分数 —— 上轮的 "0.2629 榜首 / 0.1511 Team 42" 仍是最新可用数字。
  10. 持续未回执:siDiff 仓库(第 3 轮 → 降级)、FENNEC 代码(第 3 轮)、Ptarmigan-1 第三方评测(已转季度池)、PMxAgent 代码(第 3 轮)、BioLab Bench(第 3 轮)、MAGI 仓库(第 2 轮)、ROBUST 原始 Ki 表(第 2 轮)、药监局实施意见原文(第 3 轮 → 下轮降级)、TychoBio 数据集(第 2 轮)、OFoldNA 开源状态(本轮新欠)。

§8 对 chen 的 8 条动作

#级别动作成本依据
①P0clone RNASeek 与核对 OFoldNA 开源状态;把 RNASeek 的"预训练/预测/优化"三段解耦当作 caiPro 下一版架构候选。 具体做三件事:①确认 pretrain 权重可下;②用你自己的 7295 阳/1120 阴数据微调两个 reward model(效力 + 脱靶),先验证 reward 值与湿实验读数的相关性再做 GRPO;③把"必须避开某段序列 / 必须落在某个修饰位置"写成 IUPAC-style 硬约束进生成过程而非事后过滤。不要一步到位换成 GRPO —— 先用现有打分器做一遍 symptom check。调研 1 天 + 试点 3–5 人日§2.3
②P0把"数据联盟"从"想法"写成一页可发出的方案,并明确选边:要么学 Biohub(出资联合生产标准化的公开数据,出资方享有一段时间差后转为公共科学资源),要么学抗体 developability consortium(各家的私有 label 不搬家,由第三方补充公开序列并做高通量表征补齐样本,再把基座模型送进各家本地环境做联合微调)。无论选哪条,方案里必须写进这四件事:一个共享底座、project-level 切分做 held-out、只回传参数更新不回传序列、引入独立第三方科学监督(照 Deane + Tessier 的位置)。siRNA 侧目前公认底座缺位 —— 这是位置机会。半天写文档§2.1 / §2.2 / §1-4
③P1立项材料里把 Apheris 那两句原话引用进去:①"早期的联邦联合训练只带来 modest 提升"(说明为什么这事此前没人做成功)②"to our knowledge this is the first clear demonstration that federated training delivers a step-change"(说明为什么现在可以做)。这两句一起引才诚实。30 分钟§1-4
④P1补上核酸结构维度。用 OFoldNA 的思路评估"给 siRNA 双链注入二级结构 / 碱基配对先验"能否提升打分。最低成本验证:先不跑模型,只看现有 7295 条里"预测二级结构特征"与实测效力是否有边际相关;若有边际贡献,再投资接入工具(前提是 OFoldNA 或其同类真的开源,见 §9-2)。同时把"核酸三维结构预测"写进你的能力栈 —— 它已经从 JD 加分项变成方向主责。调研半天§2.3 / §6
⑤P1把"批次建议能力"做成 caiPro 的显式功能。Genentech 那条 JD 给了明确的产品形态定义:不是给单个分子打分,而是设计 batch 使"化学空间覆盖 + 信息增益 + 实验效率"最大化。对照 §6 的"批次设计 2/6"新维度 —— 这是雇主刚开始要求、供给还很少的能力。 起步:在现有候选池上实现一个最简单的 batch 多样性 + 不确定性采样组合,给出 batch size vs expected information gain 曲线。2–3 人日§6
⑥P1正式重估"肝外 / CNS"是否纳入路线图。本轮的证据密度已经足够高:RAG-17(CNS,Nature Medicine,NfL 降 52–81%)、ADARx ADX-077/ADX-199(脂肪/CNS)、时安 SA030(脂肪)、晶泰 Kodexia(肾/脾/脂肪)、Vivatides(肝外平台)、杭州核酸药谷。建议动作:在立项文档里明确写"当前版本作用域 = 肝脏;肝外列为 v2,触发条件是 X",把默认假设变成显式决策。1 小时§5-3
⑦P2把 open-source release 纳入自己的年度绩效口径。Genentech 那条 JD 把 "publications, open-source releases, and conference talks" 并列作为 scientific impact 的三条出口;Merck 那条把 " external / open innovation 评估" 写成职责。对一个对外产出有限的内部生信岗,开源发布可能是性价比最高的一条。0(规划动作)§6
⑧P2关注 Genentech/Roche 的新组织结构与 Xaira 的用人口径。CoE(gRED + pRED 统一)意味着 Roche 把计算科学变成横向组织 —— 这类重组通常伴随一批新岗位。另:本轮所有国际 JD 里没有一条提 siRNA;如果你的目标是国际化路线,需要把"siRNA 序列设计"翻译成 JD 语言最大公约数:RL / batch design / off-target analytics / data pipelines。0§6

§9 下轮追踪(优先度排序)

  1. Bepirovirsen FDA 决定(2026-10-26,倒计时 18 天) —— 是否获批、标签是否限定 HBsAg ≤1000/≤3000 亚组;附带追 GSK×正大天晴 CTTQ 的中国上市准备节奏。到期倒计时
  2. ★ OFoldNA 是否开源(repo / license) —— 本轮最大缺口,直接决定 §8-④ 能否执行。
  3. ★ RNASeek 权重与数据是否可下 —— 决定 §8-① 能否从调研进到试点。同时追是否有人用它做过 siRNA / ASO。
  4. Biohub VBI 的更多机制细节 —— embargo 期限是否正式写入(Axios 口径 vs Reuters 措辞)、首个数据集的具体模态(空间转录组占比)、是否接受新成员。
  5. VCC 2026 公开榜 10-22 截止 —— 榜首分数是否突破 0.30;结合 §1-2 补齐的赛制理解重新估计"超出 baseline"的判据。
  6. Antibody Developability Consortium 是否有技术报告 + 是否扩员;AISB 是否有第二轮 azarichia federated round。
  7. AP Novo 第二篇预印本是否被点名 + 是否有独立第三方重复五个反应中的任何一个(尤其是 Kemp 消除 / 丝氨酸酯水解这两个有明确 kcat/Km 的)。
  8. Gen-COMPAS 是否有代码(Nature 正刊,通常有)—— 它是"用短 unbiased 模拟验证生成结构"这个可抄方法学的载体。
  9. MolGenBench 的完整内容(17 个模型的排名与三个缺口的具体度量)—— 这是 caiPro 做自评时可对照的标准之一。
  10. RAG-17 II 期启动信息(中美瑞康 / 天坛医院);SCAD 平台是否有文献披露细节。
  11. 《十五五》AI 制药专栏第二层子条目全表 + 五部门《AI+医疗卫生应用实施意见》原文(8 大方向 24 项)。
  12. TychoBio × PacBio 首批数据集是否公开(第 3 轮)。

降级为季度池:OpenBind OB0 · 北京算力名单 · RIBOSPAN · Isomorphic 日期(第 7 轮)· CODesign · siProGenA(第 9 轮 0)· 十五五配套名单(转季度池)· Ptarmigan-1 第三方评测(已在)· siDiff 仓库(3 轮无回执,本次降级) · 药监局《"人工智能+药品监管"实施意见》原文(3 轮无回执,下轮再无即降级) · Anthropic×Adaptyv Track 2 境内开放(第 6 轮)· MAGI 仓库(下轮再无转季度池)。


§10 一句话给周会 / 立项

本周最值得说的一句话:过去七天 AIDD 的主线没有任何一条是"模型又变强了",而是三条基础设施同时定价 —— 有人用 18 亿美元告诉你数据是瓶颈且给出了"资助方 embargo 一年后公开"的可复制模版;有人用 第二个跨药企联邦联盟告诉你私有数据只要不搬家就能换 LoRA 级别的收益;还有两家团队用 RNASeek(生成)和 OFoldNA(结构)告诉你核酸这条此前被认为"缺模型"的赛道,两端的公开基座都已经就位了。对一个 siRNA 生信岗来说,这意味着"我们没有足够的模型和算力"这个理由,从本周起基本不成立了 —— 剩下的问题只剩数据联盟能不能组起来,以及你敢不敢把 GRPO 接上去。