AIDD 增量简报 · AIDD_岗位信号深度扩展_2026-09-25

针对 09-25 简报 §4 的两条岗位信号做纵深展开:
① 主动学习 / 自监督 / 在线学习进主职责;② 环肽/多肽独立成岗 + RFDiffusion / BindCraft / PocketXMol + GROMACS / AMBER / OpenMM + MM-GBSA。
附:干湿闭环连续第八轮 100% 的口径、成因与含义。
diff 基线 09-2410 轮检索开源算法 / 平台生信岗位可执行
D · 设计RFD3 / BC2 / PocketXMol M · 合成可行性 / 环化 T · 测试SPR / BLI / 细胞 A · 分析⚠ 最常被跳过 数据回流 闭环四层 L0 数据契约 · L1 采集策略(主动学习,必留随机对照)· L2 重训与门控(可回滚)· L3 效果归因 ★ L3 是 90% 团队缺失的一环,也正是 JD 加分项真正的考点

第一部分 · 工具栈拆解(第二条)

0. 先建立一个直觉:为什么 JD 要"既能生成又会算自由能"

类比:

关键:形状对得上 ≠ 拧得动。生成模型优化的是"结构合理性 + 界面互补性",它基本不知道:

生成模型不知道的事后果
结合自由能的真实大小几千个候选里真正有活性的可能只有个位数
结合态是不是稳定的(会不会一秒钟就散)设计出来跑不动
构象应变(ligand strain)环肽尤其严重 —— 环化约束会强迫分子采取高能构象
界面水分子的桥接作用PPI / 多肽–蛋白界面上,一个桥接水可能贡献大半结合能
能不能合成、稳不稳、有没有免疫原性全在下游

所以这条 JD 的真实意思是:公司要的不是"会用某个模型的人",而是"能把'造候选 → 算自由能 → 送实验 → 拿数据回来改模型'整条链跑通的人"。 这也正好解释了第一条为什么把主动学习写进主职责 —— 见第二部分。


1. RFdiffusion3(RFD3)—— 原子级扩散的统一基础模型

项内容
主体Baker Lab / Institute for Protein Design + Rosetta Commons
仓库 / 分发RosettaCommons/foundry(Docker Hub rosettacommons/foundry),RFD3 作为 Foundry 的一个模型
许可BSD-3-Clause(Foundry 全包),训练代码 + 推理代码 + 模型权重全部开放
与前代关系与 RFdiffusion / RFdiffusion2 零共享代码,全新实现(换用了更新的高效 transformer 架构)
速度比 RFdiffusion2 快 10 倍
核心创新原子级扩散(atom-level diffusion) —— 以单个原子为设计的基本单元,而不是残基;因此能直接设计小分子、DNA、金属离子、非天然氨基酸参与的相互作用
统一性一个模型覆盖对称组装、结合蛋白、酶设计 —— 以前需要多个专用模型
基准表现在蛋白–蛋白结合、蛋白–DNA 结合、蛋白–小分子结合、酶设计等任务上匹配或超越此前工具
预印本De novo Design of All-atom Biomolecular Interactions with RFdiffusion3

落地命令(Docker 形态)

docker run -it --rm \
  -v "$PWD:/work" -w /work \
  rosettacommons/foundry rfd3 \
    out_dir=rfd3_out1/ \
    inputs=./rfd3.json \
    ckpt_path=/app/foundry/checkpoints/rfd3_latest.ckpt

同容器里还能跑 ProteinMPNN / LigandMPNN(--model_type ligand_mpnn)和 RoseTTAFold3(rf3 fold)—— 设计 → 序列回填 → 结构验证在一个镜像里闭环,这是 Foundry 真正的价值。

⚠️ P1 — 与你直接相关的硬伤:Docker Hub 页面明写 "This image is not compatible with systems using the ARM architecture." 你是 macOS + Apple Silicon(M 系列),本机直接跑不了。可行路径只有:①x86 Linux 服务器 / 云 GPU;②Rosetta 官方的源码安装(需 CUDA,Apple 平台无 CUDA)。面试/方案里提到 RFD3 时,把算力方案一起说,否则会被追问。

RFdiffusion2 的湿实验基线(作为 RFD3 的参照系):Nature 论文,设计的酶合成即有活性,其中一个催化效率达到天然酶常见水平,X 射线晶体学确认活性位点与设计模型吻合。这是"生成模型能直接产出功能分子"的少数硬证据 —— 但也请注意:这是酶,不是结合剂,也不是环肽。


2. BindCraft2(BC2)—— 本轮最重要的一条回执

状态更新:这是简报里连续 4 轮"未回执"的追踪项(BindCraft2 预印本 + LICENSE 正式文本),本轮回执了,但带一个 P0 风险。
项内容
主体PacesaLab(Martin Pacesa),基于 ColabDesign(Sergey Ovchinnikov)的 hallucination / design 框架 + AlphaFold 2 + ProteinMPNN
仓库PacesaLab/BindCraft2,Python,348 stars / 47 forks / 19 commits per 4 weeks
版本v1.0.1(约 2026-09-23),内容为稳定性更新
发布方式⭐ "code first, paper later" —— 论文还没发就把完整代码开源了
发布时间点刻意卡在 Adaptyv–Anthropic 蛋白设计竞赛开题(09-28)之前,明确目的就是让参赛者立刻能用
速度远快于原版基于 PyRosetta 的 BindCraft
收费学术与工业均免费(软件层面);Ariax Bio 上托管只收算力费

BC2 支持的结合剂格式(这张表直接对应 JD 的"环肽/多肽")

格式说明
Linear and cyclic peptides⭐ 短肽结合剂,包含为首尾环化(head-to-tail cyclization)设计的形式
VHH单域抗体(纳米抗体),基于提供的 scaffold
大结合剂 / miniproteins尺寸范围更宽的从头蛋白
ARP(Ankyrin Repeat Protein)锚蛋白重复 scaffold
Scaffolded binders基于已有骨架移植
同源寡聚、多结构域结合剂特殊设置

BC2 能优化的目标(这是它比"生成一把钥匙"更值钱的地方)

类别具体能力
靶点相关多靶点同时优化;主动规避指定的 off-target;把接触聚焦到选定表位;避开靶点的特定区域
性质相关类人序列特征、蛋白酶稳定性、二硫键形成、末端相对位置
构象相关游离态 ↔ 结合态的构象变化目标(multistate design)
★ 对你最有价值的一条:BC2 能显式地把"避开某个 off-target"和"蛋白酶稳定性"写进设计目标。这和 siRNA 设计的约束结构几乎同构 —— caiPro 现在的脱靶过滤是"事后筛",BC2 的思路是"把负向约束放进生成目标"。这是可以直接迁移的范式。
⚠️ ⚠️ P0 — 许可风险(这条必须记住)
GitHub 上 BindCraft2 的 License 字段是 NOASSERTION(GitHub 无法识别为任何标准 OSI 许可)。Ariax Bio 的官方页面把话说得更明白:BC2 的上游许可是 "source-available 且限制第三方托管"(restricts third-party hosting)。
这意味着:它不是标准开源。 "免费用于学术和工业" ≠ "OSI 开源"。企业在生产环境引入前,必须逐字读 LICENSE 文本,重点看三条:①是否允许再分发;②是否允许 SaaS/托管;③衍生模型与输出序列的归属。
对比:同一条 JD 里的 PocketXMol 是明确的 MIT,RFD3 是明确的 BSD-3-Clause。三者许可强度完全不同,别混为一谈。
⚠️ P2 — 新鲜度风险:v1.0.1 的 hotfix 修的是"多链靶点用 monomer 模型重预测时的索引错误"(由 Aaron Ring 报告)。刚发布就出多链 bug,说明多链 / 复合物场景的成熟度弱于单链。上生产前请先用自己的多链用例验证一遍。

3. PocketXMol —— 三家工具里唯一明确 MIT 的

项内容
论文**Cell 2026*,DOI 10.1016/j.cell.2026.01.003(Unified modeling of 3D molecular generation via atomic interactions with PocketXMol*)
作者彭欣昶等,王新泉 / 马剑竹(清华)等
仓库pengxingang/PocketXMol(基于 MolDiff 改造)
许可⭐ MIT License(仓库明确,无歧义)
架构E(3)-等变几何网络;纯原子级表征(不显式建模氨基酸,肽完全由原子生成)
机制原子提示(atomic prompts) —— 在原子层面直接定义任务的输入/输出,用一个模型统一多任务,不需要针对单个任务微调
训练数据200 万个 3D 结构,来自 PDBBind / Binding MOAD / CrossDocked2020 / PepBDB / AlphaFold DB / ChEMBL / ZINC / GEOM-Drug / CREMP
可得性Colab notebook(Dock / Peptide Design / Small Molecule Design 三个);权重在 Zenodo records/17801271

13 个任务中 11 个超过 SOTA(对比 55 个基线方法、51 个评测指标):小分子对接、线性肽对接、环肽对接、构象生成、SBDD、3D 分子生成、fragment linking、PROTAC 设计、fragment growing、分子优化、线性肽设计、环肽设计、肽逆折叠。

湿实验验证(这是它罕见的地方 —— 大多数生成模型停在计算层)

实验数字
Caspase-9 抑制剂第一轮 16 个候选中 1 个(84663)阻断 ABT-737 诱导的 caspase-9/3 激活;第二轮 15 个类似物中 4 个(含 D12)在细胞实验中与商用泛 caspase 抑制剂 QVD-OPh / Z-LEHD-FMK 效力相当
PD-L1 靶向肽从 382 个选出肽中:76 个达到 10⁻⁷ M,15 个达到 10⁻⁸ M;3 个做了细胞级验证(PD-L1 阳性/阴性细胞对比明显);小鼠尾静脉注射验证体内肿瘤靶向
⚠️ P1 — 别把"76/382"读成"20% 成功率":382 个是已经经过计算筛选后选出的候选,分母不是随机库。真实端到端命中率 = 生成总量 → 计算筛选 → 合成 → 实测 的全链条乘积,论文没有给出总生成量。引用时必须说清分母。
⚠️ P2 — 复现成本:官方说明全数据集训练需要 >500 GB 原始数据处理。如果只想做推理/微调,用 Zenodo 上的 model_weights.tar.gz 即可;不要一上来就说"我要重训 PocketXMol"。

4. 三个工具怎么选(决策表)

场景首选理由
从头设计蛋白/微型蛋白结合剂RFdiffusion3原子级扩散、统一基础模型、训练代码开放;非蛋白组分(小分子/DNA/金属)也能一起设计
已有靶点结构,要快速出结合剂(含环肽/VHH/ARP)BindCraft2统一工作流 + 格式最全 + 可写"避开 off-target / 蛋白酶稳定"等目标;⚠️ 但许可要审
口袋条件下的分子/肽生成 + 对接 + 构象,一个模型搞定PocketXMolMIT 许可(唯一无歧义可商用)、有 Cell 湿实验验证、Colab 可直接试
序列回填(给定骨架设计序列)ProteinMPNN / LigandMPNNFoundry 容器里就有;BC2 内部也用它
结果验证(反向折叠检验)AF2 / AF3 / Boltz-2 / Protenix-v2生成 ≠ 成立,必须独立重预测

5. GROMACS / AMBER / OpenMM + MM-GBSA —— 为什么 JD 把它和生成模型并列

#### 5.1 三个 MD 引擎的分工(不是三选一,是各有地盘)

引擎强项在 AIDD 流水线里的位置
GROMACSCPU/GPU 上最快的经典 MD,适合长时程、大体系生成候选的稳定性筛选、构象系综采样
AMBER力场生态最完整(ff19SB、GAFF2、Lipid 等),MMPBSA.py 官方工具链小分子/肽的参数化 + MM-GBSA 计算的原生环境
OpenMMPython 可编程性最强,易嵌入自定义采样/增强采样/ML 势需要把 MD 塞进主动学习回路时的首选
★ 对你的提示:JD 写"熟练运用 GROMACS / AMBER / OpenMM",真实含义往往是"MD 只是 pipeline 里的一站,而不是终点"。真正稀缺的不是"会跑 MD",而是"能把 MD 的输出变成模型的训练信号"。

#### 5.2 MM-GBSA 在精度–成本阶梯里的准确位置

方法单次成本典型精度适用
对接打分(Vina / GNINA 等)秒只能排序,绝对值无意义亿级库初筛
MM-GBSA分钟–小时相对值可用,绝对值不可信百–千级候选重排序
MM-PBSA更慢同上,静电处理更严格同上
FEP / TI(炼金术自由能)天–周可逼近实验(~1 kcal/mol)十–百级先导优化
实验(SPR / BLI / ITC)天–周 + 样品金标准最终裁决

MM-GBSA 公式(要能背下来)

ΔG_bind = ΔE_MM + ΔG_solv − TΔS
        = (ΔE_bond + ΔE_angle + ΔE_tors + ΔE_vdW + ΔE_ele)
          + (ΔG_GB + ΔG_SA)  − TΔS

其中 ΔG_GB 是广义 Born 极性溶剂化能,ΔG_SA 是非极性(表面面积)项。

#### 5.3 ⚠️ MM-GBSA 的六个坑(这是本节最值钱的部分)

#坑严重度症状 / 后果验证或规避方法
1单轨迹(ST)假设被滥用P0ST 假设"结合态与游离态采样的构象空间几乎相同",把 complex/receptor/ligand 的快照从同一条轨迹抽取 —— 收敛快、省算力,但如果结合时发生显著构象变化(环肽、诱导拟合、无序区),ST 直接失效先看结合前后 RMSD / 回旋半径的分布重叠度;重叠度低就改 MT(多条独立轨迹),代价是标准差变大
2省略熵项 −TΔSP0绝大多数"跑个 MM-GBSA"的脚本干脆不算熵,得到的其实是有效焓不是自由能。对柔性配体(多肽!)误差可达数 kcal/mol三选一:NMA(正态模式)、QHA(准谐)、Interaction Entropy(IE)。IE 从相互作用能涨落直接算,绕开 Hessian / 协方差矩阵对角化,性价比最高(JACS DOI 10.1021/jacs.6b02682);gmx_MMPBSA 里 interaction_entropy=1, ie_segment=50
3跨化学系列比较P0MM-GBSA 只在同源同系系列(congeneric series)内排序可靠;拿它给不同骨架的分子排序基本是噪声明确声明比较范围;跨骨架必须升级到 FEP
4忽略界面水P1PPI / 蛋白–多肽界面上桥接水常贡献关键结合能;隐式溶剂模型抓不到把结合界面附近固定数目的显式水纳入受体(Contini & Maffucci:纳入 30 个最接近界面残基的水,与实验 ΔG 的相关性提升约 30%);进阶用 MnM(Mix-and-Match)用聚类代表构象重构复合物
5忽略配体应变(ligand strain)P1环肽尤其严重 —— 环化约束强迫分子采取高能构象,MM-GBSA 不显式扣掉这部分应变能,导致系统性高估亲和力单独算"结合态构象 vs 自由态最优构象"的内能差
6采样不收敛却报了很小的误差棒P1帧数太少 / 帧间相关(相邻帧不独立)→ 标准误被严重低估,看起来很准,实际是假象做分块标准误(block averaging)而不是简单 SEM;跑 ≥3 条不同初始速度的重复;报告帧数、帧间隔、重复数
已知的反面证据(引用前请一并给出):Coveney 等证明 MM-GBSA/PBSA 在排序临床相关的 HIV-1 蛋白酶抑制剂时有重大局限;Mobley 等在 D3R Grand Challenges 上报告其复现实验结合自由能表现差。在 PPI 上相关性尤其差(构象空间维度高 + 界面水关键)。

一个可复制的 gmx_MMPBSA 配置(含熵项)

&general
  sys_name = "IE",
  startframe = 1, endframe = 10,
  PBRadii = 4,
  interaction_entropy = 1, ie_segment = 50,
  temperature = 303.15
/
&gb
  igb = 8,          ! GB-Neck2,当前较稳妥的默认
  saltcon = 0.150,  ! 生理盐浓度
/
gmx_MMPBSA -O -i mmpbsa.in \
  -cs com.tpr -ct com_traj.xtc \
  -ci index.ndx -cg 3 4 -cp topol.top \
  -o FINAL_RESULTS_MMPBSA.dat -eo FINAL_RESULTS_MMPBSA.csv
⚠️ 注意 -ct 必须是已做 PBC 校正并拟合(fitted)的轨迹 —— 这一步漏了不会报错,只让结果整体偏移。

6. 一条完整的环肽/多肽干湿闭环流水线(把上面串起来)

[0] 靶点结构 ── AlphaFold3 / Boltz-2 / Protenix-v2 ──► pocket 定义 + hotspot 残基
        │
[1] 生成 ──┬── RFdiffusion3   (从头骨架,原子级,可含非蛋白组分)
           ├── BindCraft2     (环肽 / VHH / ARP / scaffolded,可写负向约束)
           └── PocketXMol     (口袋条件生成:环肽设计 / 环肽对接 / 逆折叠)
        │
[2] 序列回填 ── ProteinMPNN / LigandMPNN ──► 每条骨架若干个序列
        │
[3] 结构复核 ── 独立重预测(AF2/AF3/Boltz-2)+ pLDDT / iPTM / PAE 过滤
        │  ⚠️ 必须用与生成不同的模型做验证,否则是自证
        │
[4] 物理层筛选 ── GROMACS / AMBER / OpenMM 短程 MD(稳定性、界面是否散架)
        │           └─► MM-GBSA(同系列内重排序,务必含熵项、核对 ST 假设、加界面水)
        │
[5] 可开发性过滤 ── 合成可行性、蛋白酶稳定性、二硫键、聚集倾向、免疫原性
        │
[6] 实验 ── 合成 → SPR/BLI(亲和力)→ 细胞活性 → 选择性/脱靶
        │
[7] 回流 ── 实测标签入库 → 主动学习挑下一批 → 模型增量更新 ──┐
        │                                                    │
        └────────────────────────────────────────────────────┘

每一环的生信交付物(面试时说得出来的那种)

环节交付物最容易被追问的点
0pocket 定义脚本 + hotspot 依据hotspot 是怎么定的?有没有实验依据?
1生成配置 + 生成量/耗时生成了多少?筛到多少?
2序列回填的多样性控制每条骨架回几条?会不会序列塌陷?
3复核模型的独立性与阈值用同一模型自证是最常见的方法论错误
4MD 时长/重复数 + MM-GBSA 参数与收敛诊断熵项算没算?ST 假设成立吗?
5可开发性规则与阈值阈值从哪来?
6实验设计(对照、重复、剂量)有没有阴性对照和随机对照?
7数据契约 + 采集策略 + 重训门控 + 效果归因见第二部分

第二部分 · 主动学习 / 自监督 / 在线学习为什么进了主职责

1. 根因:模型已经变成商品,回路才是资产

那什么构成壁垒?只有你自己那批实测数据,和把数据变成下一轮更好模型的回路。 这就是为什么 JD 从"熟悉 XX 模型"转向"能设计数据回流闭环"。

一句话:模型是自来水,回路才是水管。

2. 三个词的准确含义与 AIDD 落点(别混用)

术语一句话定义AIDD 里的落点常见误用
主动学习(Active Learning)在有限的实验预算下,用采集函数(acquisition function)挑"信息量最大"的下一批样本去测每轮湿实验只测 96 个 → 用 UCB / EI / BALD / 不确定性 + 多样性 混合挑把"随机挑一批测"也叫主动学习
自监督学习(Self-supervised)无标签时,用数据自身结构构造预训练任务用海量未标注序列/结构做 MLM、对比学习、结构去噪,再在小样本实测数据上微调把"用 ESM 提特征"等同于自监督(那只是用别人的自监督模型)
在线学习(Online Learning)数据流式到达时增量更新,不等攒够再全量重训每批实验结果回来即触发更新 + 门控评估 + 灰度上线把"定期重训"叫在线学习
⚠️ P1 — 面试最容易翻车的地方:说"我用了主动学习",被追问"你的采集函数是什么?基线是什么?"答不上来。主动学习的价值 100% 取决于采集函数相对"随机采样/不确定性采样"的增量,没有基线对照就等于没做。

3. "数据回流 → 模型更新 → 效果提升"闭环的四层结构

层要做什么常见失败
L0 数据契约统一实体定义、单位、 assay 条件、批次号、阴性定义;同一分子不同批次结果冲突时的仲裁规则各单位结果混在一张表里,assay 条件缺失,阴性定义随人变
L1 采集策略主动学习挑样;必须预留一部分随机/多样性样本做对照(否则模型会把自己引向局部)全挑"模型觉得好"的 → 探索坍缩,永远发现不了新化学空间
L2 重训与门控触发条件(新增 N 条 / 漂移超阈 / 定时);离线重评 → 影子评估 → 灰度;失败自动回滚直接覆盖线上模型,没有回滚;或者重训太频繁,把噪声当信号
L3 效果归因记录每一轮的:挑了多少、测了多少、命中率、模型前后指标、朴素基线对照只看"模型指标涨了",无法证明是闭环带来的,也无法定位是哪一环起作用
★ L3 是 90% 团队缺失的一环,也是 JD 加分项真正的考点。 "效果提升"四个字要求你能归因:这一轮提升来自数据、来自采集策略、还是来自模型改动?

4. 为什么这是"加分项"而不是"主职责"

招聘逻辑很清晰:技能可以教,"我从零设计过一条闭环并跑出过效果"这件事只能靠做过。这就是为什么它值一个加分项而不是一行要求。

5. 怎么证明你有这个闭环(可操作清单)

你要能说出来的东西具体形式
闭环的四层你各做了什么L0 契约文档 / L1 采集函数 + 对照比例 / L2 门控规则 + 回滚记录 / L3 每轮归因表
朴素基线至少一条:随机采样、最近邻、线性模型、或一条人工规则
一轮具体的数字"第 N 轮,主动学习挑 96 个,命中 X 个;同期随机对照 96 个,命中 Y 个"
一次失败的回滚说明门控真的在工作,而不是事后编故事
数据漂移的处理你检测过什么漂移、怎么处理
对 caiPro 的直接映射:7295 阳 / 1120 阴 是 L0 层的数据。如果它只是"一次性训练集",那它每用一次就贬值一次;如果它挂在一个有采集策略、有门控、有归因的回路上,它每跑一轮湿实验就增值一次。这是同一个数据集的两种命运。

第三部分 · 干湿闭环连续第八轮 100%

1. 口径先说清楚(诚实标注)

项说明
统计对象每期简报采集的 5–6 条 AIDD 相关 JD 中,命中"干湿闭环 / DMTA / 实验验证迭代 / 数据回流"字样的比例
轮次连续 8 轮(约 09-11 → 09-25),累计 n≈40
结果8/8 轮 = 100%,每轮命中率 5/5 或 6/6
⚠️ 局限①非随机抽样(猎聘 / 应届生求职网 / 全职招聘网等,按关键词检索);②中文 JD 为主;③单轮样本仅 5–6 条,单轮 100% 的置信区间很宽;④"命中"是关键词级而非能力级判定
该怎么读它证明的是趋势方向(强且一致),不是精确比例。不要说"100% 的 AIDD 岗位要求干湿闭环",要说"在连续 8 轮的中文 AIDD JD 抽样中,干湿闭环字样每轮 100% 出现"

2. 为什么是 100% 而不是 80%:三个结构性原因

#原因机制
1生成把"造候选"的成本打到趋近于零,瓶颈必然转移到"测"RFD3 比 RFD2 快 10×、PocketXMol 一个模型出 13 类任务、AdaptiveFlow 能扫 690 亿库 —— 候选不再是稀缺品,"测得起几个"才是唯一约束。约束在哪,JD 就写什么
2湿实验数据成为唯一不可复制的资产模型人人可下载,你公司内部那批实测数据下载不到。Arrowhead CEO 原话:"AI 引擎的能力上限就是你喂给它的数据……我们做了几十万条 RNAi trigger……蛮力是很可怕的东西"
3资本已经按这个标准定价沙利文毛化:要抢占自动化实验入口、专有数据资产、管线 IP;晶泰马健:"纯计算和预测的 AIDD 无法形成真正的知识沉淀,唯有构建'假设—检验'的工程化闭环";Anthropic 建实体湿实验室、Novo 全研发流程接 Claude、Lilly × NVIDIA 五年最高 10 亿美元

3. DMTA 循环与每一环的生信交付物

环全称生信侧交付物常见断点
DDesign(设计)候选列表 + 打分 + 不确定性 + 多样性保证只给 top-N,全是同一骨架的近邻
MMake(合成/构建)合成可行性评分、序列到构建体的自动化输出设计出来做不出来
TTest(测试)实验设计(对照/重复/剂量)、assay 选型没有阴性对照、没有重复 → 数据不可用
AAnalyze(分析)归因分析:为什么这批成/败;模型要改什么;下一批测什么⚠️ 最常被跳过的一环 —— 测完就丢,不回流
⚠️ 最常见的假闭环:D→M→T 跑得很快,A 环节只产出一份 PPT。没有 A 的 DMTA 只是"高通量试错",不是闭环。

4. 八轮用词演化(这条比 100% 更有信息量)

阶段JD 典型措辞含义
早期轮次"与湿实验团队合作"你是支持方
中期"根据实验结果迭代优化模型"你要响应实验
近期(本轮)"深度跟进项目管线,根据湿实验结果迭代优化模型与分子设计策略,构建干湿实验闭环"⚠️ 动词从"配合"变成"构建",闭环成为你名下的交付物
本轮新增"有自己设计过'数据回流→模型更新→效果提升'闭环的实操经验"从"参与过"升级为"自己设计过"

判读:岗位对干湿闭环的要求从"参与"升到了"拥有(Ownership)"。这也是为什么多肽岗 JD 会写"从苗头到 PCC 全链条 Ownership"。

5. 对你的含义(三条)

1. "我会跑模型"已经不够用了,要能说清楚"我的模型怎么因为实验数据变好了" —— 带数字、带基线、带失败案例。 2. caiPro 现在最缺的不是模型,是 L3 归因层 —— 没有它,任何"闭环"都只是说法,拿不出证据。 3. 核酸方向本轮回落(0/5)不代表不重要 —— 上轮 2/6 里有深圳湾实验室明确要求"蛋白/核酸结构建模 + 蛋白-核酸对接 + GROMACS MD"。核酸建模目前是少数岗位的深水要求,不是普遍要求,属于差异化机会而非主流门槛。


风险点汇总

严重度风险后果动作
P0BindCraft2 许可为 NOASSERTION / source-available 且限制第三方托管企业商用、再分发、SaaS 托管可能违约引入前逐字读 LICENSE;生产环境优先 PocketXMol(MIT)或 RFD3(BSD-3)
P0MM-GBSA 的 ST 假设在柔性配体(环肽)上常不成立结果系统性错误且不报错先查结合前后构象分布重叠度;不成立就改 MT 或加界面水
P0省略熵项 −TΔS得到的是有效焓不是自由能,对多肽误差可达数 kcal/mol至少用 Interaction Entropy;报告里必须写明
P1RFD3 官方镜像不支持 ARMApple Silicon 本机跑不了走 x86 Linux / 云 GPU;方案里写明算力
P1MM-GBSA 跨化学系列排序不可靠给不同骨架排序得到的是噪声限定 congeneric series;跨骨架升级 FEP
P1PocketXMol "76/382" 的分母是筛选后的候选高估端到端命中率引用时说明分母口径
P2BindCraft2 v1.0.1 多链索引 bug 刚修多链/复合物场景成熟度弱上生产前用自己的多链用例验证
P2MD 轨迹未做 PBC 校正MM-GBSA 结果整体偏移,不报错-ct 必须是 PBC-corrected + fitted 轨迹
P2主动学习无基线对照无法证明增益,面试/评审必被追问每轮预留随机/多样性对照

本轮追踪项状态更新

追踪项上一状态本轮
BindCraft2 预印本 + LICENSE 正式文本连续 4 轮为 0✅ 部分回执:仓库与版本已确认(v1.0.1,约 09-23),论文仍未发(code-first);许可确认为 NOASSERTION,非标准 OSI 开源 → 转为"持续跟踪 LICENSE 文本与论文"
Adaptyv–Anthropic 竞赛09-28 开题(未到期)补充动机:BC2 的发布时间是刻意卡在这个竞赛之前,参赛者可直接用

生成时间:2026-09-25 | 基于 09-25 简报 §4 的两条岗位信号做纵深扩展 | 检索 4 轮 + 前期积累

生成时间:2026-09-25 · 检索窗口 09-18 → 09-25 · 中英双语 freshness d3/d7/m1/m2 · 上版基线 09-24