类比:
关键:形状对得上 ≠ 拧得动。生成模型优化的是"结构合理性 + 界面互补性",它基本不知道:
| 生成模型不知道的事 | 后果 |
|---|---|
| 结合自由能的真实大小 | 几千个候选里真正有活性的可能只有个位数 |
| 结合态是不是稳定的(会不会一秒钟就散) | 设计出来跑不动 |
| 构象应变(ligand strain) | 环肽尤其严重 —— 环化约束会强迫分子采取高能构象 |
| 界面水分子的桥接作用 | PPI / 多肽–蛋白界面上,一个桥接水可能贡献大半结合能 |
| 能不能合成、稳不稳、有没有免疫原性 | 全在下游 |
所以这条 JD 的真实意思是:公司要的不是"会用某个模型的人",而是"能把'造候选 → 算自由能 → 送实验 → 拿数据回来改模型'整条链跑通的人"。 这也正好解释了第一条为什么把主动学习写进主职责 —— 见第二部分。
| 项 | 内容 |
|---|---|
| 主体 | Baker Lab / Institute for Protein Design + Rosetta Commons |
| 仓库 / 分发 | RosettaCommons/foundry(Docker Hub rosettacommons/foundry),RFD3 作为 Foundry 的一个模型 |
| 许可 | BSD-3-Clause(Foundry 全包),训练代码 + 推理代码 + 模型权重全部开放 |
| 与前代关系 | 与 RFdiffusion / RFdiffusion2 零共享代码,全新实现(换用了更新的高效 transformer 架构) |
| 速度 | 比 RFdiffusion2 快 10 倍 |
| 核心创新 | 原子级扩散(atom-level diffusion) —— 以单个原子为设计的基本单元,而不是残基;因此能直接设计小分子、DNA、金属离子、非天然氨基酸参与的相互作用 |
| 统一性 | 一个模型覆盖对称组装、结合蛋白、酶设计 —— 以前需要多个专用模型 |
| 基准表现 | 在蛋白–蛋白结合、蛋白–DNA 结合、蛋白–小分子结合、酶设计等任务上匹配或超越此前工具 |
| 预印本 | De novo Design of All-atom Biomolecular Interactions with RFdiffusion3 |
落地命令(Docker 形态)
docker run -it --rm \
-v "$PWD:/work" -w /work \
rosettacommons/foundry rfd3 \
out_dir=rfd3_out1/ \
inputs=./rfd3.json \
ckpt_path=/app/foundry/checkpoints/rfd3_latest.ckpt
同容器里还能跑 ProteinMPNN / LigandMPNN(--model_type ligand_mpnn)和 RoseTTAFold3(rf3 fold)—— 设计 → 序列回填 → 结构验证在一个镜像里闭环,这是 Foundry 真正的价值。
⚠️ P1 — 与你直接相关的硬伤:Docker Hub 页面明写 "This image is not compatible with systems using the ARM architecture." 你是 macOS + Apple Silicon(M 系列),本机直接跑不了。可行路径只有:①x86 Linux 服务器 / 云 GPU;②Rosetta 官方的源码安装(需 CUDA,Apple 平台无 CUDA)。面试/方案里提到 RFD3 时,把算力方案一起说,否则会被追问。
RFdiffusion2 的湿实验基线(作为 RFD3 的参照系):Nature 论文,设计的酶合成即有活性,其中一个催化效率达到天然酶常见水平,X 射线晶体学确认活性位点与设计模型吻合。这是"生成模型能直接产出功能分子"的少数硬证据 —— 但也请注意:这是酶,不是结合剂,也不是环肽。
状态更新:这是简报里连续 4 轮"未回执"的追踪项(BindCraft2 预印本 + LICENSE 正式文本),本轮回执了,但带一个 P0 风险。
| 项 | 内容 |
|---|---|
| 主体 | PacesaLab(Martin Pacesa),基于 ColabDesign(Sergey Ovchinnikov)的 hallucination / design 框架 + AlphaFold 2 + ProteinMPNN |
| 仓库 | PacesaLab/BindCraft2,Python,348 stars / 47 forks / 19 commits per 4 weeks |
| 版本 | v1.0.1(约 2026-09-23),内容为稳定性更新 |
| 发布方式 | ⭐ "code first, paper later" —— 论文还没发就把完整代码开源了 |
| 发布时间点 | 刻意卡在 Adaptyv–Anthropic 蛋白设计竞赛开题(09-28)之前,明确目的就是让参赛者立刻能用 |
| 速度 | 远快于原版基于 PyRosetta 的 BindCraft |
| 收费 | 学术与工业均免费(软件层面);Ariax Bio 上托管只收算力费 |
BC2 支持的结合剂格式(这张表直接对应 JD 的"环肽/多肽")
| 格式 | 说明 |
|---|---|
| Linear and cyclic peptides | ⭐ 短肽结合剂,包含为首尾环化(head-to-tail cyclization)设计的形式 |
| VHH | 单域抗体(纳米抗体),基于提供的 scaffold |
| 大结合剂 / miniproteins | 尺寸范围更宽的从头蛋白 |
| ARP(Ankyrin Repeat Protein) | 锚蛋白重复 scaffold |
| Scaffolded binders | 基于已有骨架移植 |
| 同源寡聚、多结构域结合剂 | 特殊设置 |
BC2 能优化的目标(这是它比"生成一把钥匙"更值钱的地方)
| 类别 | 具体能力 |
|---|---|
| 靶点相关 | 多靶点同时优化;主动规避指定的 off-target;把接触聚焦到选定表位;避开靶点的特定区域 |
| 性质相关 | 类人序列特征、蛋白酶稳定性、二硫键形成、末端相对位置 |
| 构象相关 | 游离态 ↔ 结合态的构象变化目标(multistate design) |
★ 对你最有价值的一条:BC2 能显式地把"避开某个 off-target"和"蛋白酶稳定性"写进设计目标。这和 siRNA 设计的约束结构几乎同构 —— caiPro 现在的脱靶过滤是"事后筛",BC2 的思路是"把负向约束放进生成目标"。这是可以直接迁移的范式。
⚠️ ⚠️ P0 — 许可风险(这条必须记住)
GitHub 上 BindCraft2 的 License 字段是 NOASSERTION(GitHub 无法识别为任何标准 OSI 许可)。Ariax Bio 的官方页面把话说得更明白:BC2 的上游许可是 "source-available 且限制第三方托管"(restricts third-party hosting)。
这意味着:它不是标准开源。 "免费用于学术和工业" ≠ "OSI 开源"。企业在生产环境引入前,必须逐字读 LICENSE 文本,重点看三条:①是否允许再分发;②是否允许 SaaS/托管;③衍生模型与输出序列的归属。
对比:同一条 JD 里的 PocketXMol 是明确的 MIT,RFD3 是明确的 BSD-3-Clause。三者许可强度完全不同,别混为一谈。
⚠️ P2 — 新鲜度风险:v1.0.1 的 hotfix 修的是"多链靶点用 monomer 模型重预测时的索引错误"(由 Aaron Ring 报告)。刚发布就出多链 bug,说明多链 / 复合物场景的成熟度弱于单链。上生产前请先用自己的多链用例验证一遍。
| 项 | 内容 |
|---|---|
| 论文 | **Cell 2026*,DOI 10.1016/j.cell.2026.01.003(Unified modeling of 3D molecular generation via atomic interactions with PocketXMol*) |
| 作者 | 彭欣昶等,王新泉 / 马剑竹(清华)等 |
| 仓库 | pengxingang/PocketXMol(基于 MolDiff 改造) |
| 许可 | ⭐ MIT License(仓库明确,无歧义) |
| 架构 | E(3)-等变几何网络;纯原子级表征(不显式建模氨基酸,肽完全由原子生成) |
| 机制 | 原子提示(atomic prompts) —— 在原子层面直接定义任务的输入/输出,用一个模型统一多任务,不需要针对单个任务微调 |
| 训练数据 | 200 万个 3D 结构,来自 PDBBind / Binding MOAD / CrossDocked2020 / PepBDB / AlphaFold DB / ChEMBL / ZINC / GEOM-Drug / CREMP |
| 可得性 | Colab notebook(Dock / Peptide Design / Small Molecule Design 三个);权重在 Zenodo records/17801271 |
13 个任务中 11 个超过 SOTA(对比 55 个基线方法、51 个评测指标):小分子对接、线性肽对接、环肽对接、构象生成、SBDD、3D 分子生成、fragment linking、PROTAC 设计、fragment growing、分子优化、线性肽设计、环肽设计、肽逆折叠。
湿实验验证(这是它罕见的地方 —— 大多数生成模型停在计算层)
| 实验 | 数字 |
|---|---|
| Caspase-9 抑制剂 | 第一轮 16 个候选中 1 个(84663)阻断 ABT-737 诱导的 caspase-9/3 激活;第二轮 15 个类似物中 4 个(含 D12)在细胞实验中与商用泛 caspase 抑制剂 QVD-OPh / Z-LEHD-FMK 效力相当 |
| PD-L1 靶向肽 | 从 382 个选出肽中:76 个达到 10⁻⁷ M,15 个达到 10⁻⁸ M;3 个做了细胞级验证(PD-L1 阳性/阴性细胞对比明显);小鼠尾静脉注射验证体内肿瘤靶向 |
⚠️ P1 — 别把"76/382"读成"20% 成功率":382 个是已经经过计算筛选后选出的候选,分母不是随机库。真实端到端命中率 = 生成总量 → 计算筛选 → 合成 → 实测 的全链条乘积,论文没有给出总生成量。引用时必须说清分母。
⚠️ P2 — 复现成本:官方说明全数据集训练需要 >500 GB 原始数据处理。如果只想做推理/微调,用 Zenodo 上的 model_weights.tar.gz 即可;不要一上来就说"我要重训 PocketXMol"。
| 场景 | 首选 | 理由 |
|---|---|---|
| 从头设计蛋白/微型蛋白结合剂 | RFdiffusion3 | 原子级扩散、统一基础模型、训练代码开放;非蛋白组分(小分子/DNA/金属)也能一起设计 |
| 已有靶点结构,要快速出结合剂(含环肽/VHH/ARP) | BindCraft2 | 统一工作流 + 格式最全 + 可写"避开 off-target / 蛋白酶稳定"等目标;⚠️ 但许可要审 |
| 口袋条件下的分子/肽生成 + 对接 + 构象,一个模型搞定 | PocketXMol | MIT 许可(唯一无歧义可商用)、有 Cell 湿实验验证、Colab 可直接试 |
| 序列回填(给定骨架设计序列) | ProteinMPNN / LigandMPNN | Foundry 容器里就有;BC2 内部也用它 |
| 结果验证(反向折叠检验) | AF2 / AF3 / Boltz-2 / Protenix-v2 | 生成 ≠ 成立,必须独立重预测 |
#### 5.1 三个 MD 引擎的分工(不是三选一,是各有地盘)
| 引擎 | 强项 | 在 AIDD 流水线里的位置 |
|---|---|---|
| GROMACS | CPU/GPU 上最快的经典 MD,适合长时程、大体系 | 生成候选的稳定性筛选、构象系综采样 |
| AMBER | 力场生态最完整(ff19SB、GAFF2、Lipid 等),MMPBSA.py 官方工具链 | 小分子/肽的参数化 + MM-GBSA 计算的原生环境 |
| OpenMM | Python 可编程性最强,易嵌入自定义采样/增强采样/ML 势 | 需要把 MD 塞进主动学习回路时的首选 |
★ 对你的提示:JD 写"熟练运用 GROMACS / AMBER / OpenMM",真实含义往往是"MD 只是 pipeline 里的一站,而不是终点"。真正稀缺的不是"会跑 MD",而是"能把 MD 的输出变成模型的训练信号"。
#### 5.2 MM-GBSA 在精度–成本阶梯里的准确位置
| 方法 | 单次成本 | 典型精度 | 适用 |
|---|---|---|---|
| 对接打分(Vina / GNINA 等) | 秒 | 只能排序,绝对值无意义 | 亿级库初筛 |
| MM-GBSA | 分钟–小时 | 相对值可用,绝对值不可信 | 百–千级候选重排序 |
| MM-PBSA | 更慢 | 同上,静电处理更严格 | 同上 |
| FEP / TI(炼金术自由能) | 天–周 | 可逼近实验(~1 kcal/mol) | 十–百级先导优化 |
| 实验(SPR / BLI / ITC) | 天–周 + 样品 | 金标准 | 最终裁决 |
MM-GBSA 公式(要能背下来)
ΔG_bind = ΔE_MM + ΔG_solv − TΔS
= (ΔE_bond + ΔE_angle + ΔE_tors + ΔE_vdW + ΔE_ele)
+ (ΔG_GB + ΔG_SA) − TΔS
其中 ΔG_GB 是广义 Born 极性溶剂化能,ΔG_SA 是非极性(表面面积)项。
#### 5.3 ⚠️ MM-GBSA 的六个坑(这是本节最值钱的部分)
| # | 坑 | 严重度 | 症状 / 后果 | 验证或规避方法 |
|---|---|---|---|---|
| 1 | 单轨迹(ST)假设被滥用 | P0 | ST 假设"结合态与游离态采样的构象空间几乎相同",把 complex/receptor/ligand 的快照从同一条轨迹抽取 —— 收敛快、省算力,但如果结合时发生显著构象变化(环肽、诱导拟合、无序区),ST 直接失效 | 先看结合前后 RMSD / 回旋半径的分布重叠度;重叠度低就改 MT(多条独立轨迹),代价是标准差变大 |
| 2 | 省略熵项 −TΔS | P0 | 绝大多数"跑个 MM-GBSA"的脚本干脆不算熵,得到的其实是有效焓不是自由能。对柔性配体(多肽!)误差可达数 kcal/mol | 三选一:NMA(正态模式)、QHA(准谐)、Interaction Entropy(IE)。IE 从相互作用能涨落直接算,绕开 Hessian / 协方差矩阵对角化,性价比最高(JACS DOI 10.1021/jacs.6b02682);gmx_MMPBSA 里 interaction_entropy=1, ie_segment=50 |
| 3 | 跨化学系列比较 | P0 | MM-GBSA 只在同源同系系列(congeneric series)内排序可靠;拿它给不同骨架的分子排序基本是噪声 | 明确声明比较范围;跨骨架必须升级到 FEP |
| 4 | 忽略界面水 | P1 | PPI / 蛋白–多肽界面上桥接水常贡献关键结合能;隐式溶剂模型抓不到 | 把结合界面附近固定数目的显式水纳入受体(Contini & Maffucci:纳入 30 个最接近界面残基的水,与实验 ΔG 的相关性提升约 30%);进阶用 MnM(Mix-and-Match)用聚类代表构象重构复合物 |
| 5 | 忽略配体应变(ligand strain) | P1 | 环肽尤其严重 —— 环化约束强迫分子采取高能构象,MM-GBSA 不显式扣掉这部分应变能,导致系统性高估亲和力 | 单独算"结合态构象 vs 自由态最优构象"的内能差 |
| 6 | 采样不收敛却报了很小的误差棒 | P1 | 帧数太少 / 帧间相关(相邻帧不独立)→ 标准误被严重低估,看起来很准,实际是假象 | 做分块标准误(block averaging)而不是简单 SEM;跑 ≥3 条不同初始速度的重复;报告帧数、帧间隔、重复数 |
已知的反面证据(引用前请一并给出):Coveney 等证明 MM-GBSA/PBSA 在排序临床相关的 HIV-1 蛋白酶抑制剂时有重大局限;Mobley 等在 D3R Grand Challenges 上报告其复现实验结合自由能表现差。在 PPI 上相关性尤其差(构象空间维度高 + 界面水关键)。
一个可复制的 gmx_MMPBSA 配置(含熵项)
&general
sys_name = "IE",
startframe = 1, endframe = 10,
PBRadii = 4,
interaction_entropy = 1, ie_segment = 50,
temperature = 303.15
/
&gb
igb = 8, ! GB-Neck2,当前较稳妥的默认
saltcon = 0.150, ! 生理盐浓度
/
gmx_MMPBSA -O -i mmpbsa.in \
-cs com.tpr -ct com_traj.xtc \
-ci index.ndx -cg 3 4 -cp topol.top \
-o FINAL_RESULTS_MMPBSA.dat -eo FINAL_RESULTS_MMPBSA.csv
⚠️ 注意 -ct 必须是已做 PBC 校正并拟合(fitted)的轨迹 —— 这一步漏了不会报错,只让结果整体偏移。
[0] 靶点结构 ── AlphaFold3 / Boltz-2 / Protenix-v2 ──► pocket 定义 + hotspot 残基
│
[1] 生成 ──┬── RFdiffusion3 (从头骨架,原子级,可含非蛋白组分)
├── BindCraft2 (环肽 / VHH / ARP / scaffolded,可写负向约束)
└── PocketXMol (口袋条件生成:环肽设计 / 环肽对接 / 逆折叠)
│
[2] 序列回填 ── ProteinMPNN / LigandMPNN ──► 每条骨架若干个序列
│
[3] 结构复核 ── 独立重预测(AF2/AF3/Boltz-2)+ pLDDT / iPTM / PAE 过滤
│ ⚠️ 必须用与生成不同的模型做验证,否则是自证
│
[4] 物理层筛选 ── GROMACS / AMBER / OpenMM 短程 MD(稳定性、界面是否散架)
│ └─► MM-GBSA(同系列内重排序,务必含熵项、核对 ST 假设、加界面水)
│
[5] 可开发性过滤 ── 合成可行性、蛋白酶稳定性、二硫键、聚集倾向、免疫原性
│
[6] 实验 ── 合成 → SPR/BLI(亲和力)→ 细胞活性 → 选择性/脱靶
│
[7] 回流 ── 实测标签入库 → 主动学习挑下一批 → 模型增量更新 ──┐
│ │
└────────────────────────────────────────────────────┘
每一环的生信交付物(面试时说得出来的那种)
| 环节 | 交付物 | 最容易被追问的点 |
|---|---|---|
| 0 | pocket 定义脚本 + hotspot 依据 | hotspot 是怎么定的?有没有实验依据? |
| 1 | 生成配置 + 生成量/耗时 | 生成了多少?筛到多少? |
| 2 | 序列回填的多样性控制 | 每条骨架回几条?会不会序列塌陷? |
| 3 | 复核模型的独立性与阈值 | 用同一模型自证是最常见的方法论错误 |
| 4 | MD 时长/重复数 + MM-GBSA 参数与收敛诊断 | 熵项算没算?ST 假设成立吗? |
| 5 | 可开发性规则与阈值 | 阈值从哪来? |
| 6 | 实验设计(对照、重复、剂量) | 有没有阴性对照和随机对照? |
| 7 | 数据契约 + 采集策略 + 重训门控 + 效果归因 | 见第二部分 |
那什么构成壁垒?只有你自己那批实测数据,和把数据变成下一轮更好模型的回路。 这就是为什么 JD 从"熟悉 XX 模型"转向"能设计数据回流闭环"。
一句话:模型是自来水,回路才是水管。
| 术语 | 一句话定义 | AIDD 里的落点 | 常见误用 |
|---|---|---|---|
| 主动学习(Active Learning) | 在有限的实验预算下,用采集函数(acquisition function)挑"信息量最大"的下一批样本去测 | 每轮湿实验只测 96 个 → 用 UCB / EI / BALD / 不确定性 + 多样性 混合挑 | 把"随机挑一批测"也叫主动学习 |
| 自监督学习(Self-supervised) | 无标签时,用数据自身结构构造预训练任务 | 用海量未标注序列/结构做 MLM、对比学习、结构去噪,再在小样本实测数据上微调 | 把"用 ESM 提特征"等同于自监督(那只是用别人的自监督模型) |
| 在线学习(Online Learning) | 数据流式到达时增量更新,不等攒够再全量重训 | 每批实验结果回来即触发更新 + 门控评估 + 灰度上线 | 把"定期重训"叫在线学习 |
⚠️ P1 — 面试最容易翻车的地方:说"我用了主动学习",被追问"你的采集函数是什么?基线是什么?"答不上来。主动学习的价值 100% 取决于采集函数相对"随机采样/不确定性采样"的增量,没有基线对照就等于没做。
| 层 | 要做什么 | 常见失败 |
|---|---|---|
| L0 数据契约 | 统一实体定义、单位、 assay 条件、批次号、阴性定义;同一分子不同批次结果冲突时的仲裁规则 | 各单位结果混在一张表里,assay 条件缺失,阴性定义随人变 |
| L1 采集策略 | 主动学习挑样;必须预留一部分随机/多样性样本做对照(否则模型会把自己引向局部) | 全挑"模型觉得好"的 → 探索坍缩,永远发现不了新化学空间 |
| L2 重训与门控 | 触发条件(新增 N 条 / 漂移超阈 / 定时);离线重评 → 影子评估 → 灰度;失败自动回滚 | 直接覆盖线上模型,没有回滚;或者重训太频繁,把噪声当信号 |
| L3 效果归因 | 记录每一轮的:挑了多少、测了多少、命中率、模型前后指标、朴素基线对照 | 只看"模型指标涨了",无法证明是闭环带来的,也无法定位是哪一环起作用 |
★ L3 是 90% 团队缺失的一环,也是 JD 加分项真正的考点。 "效果提升"四个字要求你能归因:这一轮提升来自数据、来自采集策略、还是来自模型改动?
招聘逻辑很清晰:技能可以教,"我从零设计过一条闭环并跑出过效果"这件事只能靠做过。这就是为什么它值一个加分项而不是一行要求。
| 你要能说出来的东西 | 具体形式 |
|---|---|
| 闭环的四层你各做了什么 | L0 契约文档 / L1 采集函数 + 对照比例 / L2 门控规则 + 回滚记录 / L3 每轮归因表 |
| 朴素基线 | 至少一条:随机采样、最近邻、线性模型、或一条人工规则 |
| 一轮具体的数字 | "第 N 轮,主动学习挑 96 个,命中 X 个;同期随机对照 96 个,命中 Y 个" |
| 一次失败的回滚 | 说明门控真的在工作,而不是事后编故事 |
| 数据漂移的处理 | 你检测过什么漂移、怎么处理 |
对 caiPro 的直接映射:7295 阳 / 1120 阴 是 L0 层的数据。如果它只是"一次性训练集",那它每用一次就贬值一次;如果它挂在一个有采集策略、有门控、有归因的回路上,它每跑一轮湿实验就增值一次。这是同一个数据集的两种命运。
| 项 | 说明 |
|---|---|
| 统计对象 | 每期简报采集的 5–6 条 AIDD 相关 JD 中,命中"干湿闭环 / DMTA / 实验验证迭代 / 数据回流"字样的比例 |
| 轮次 | 连续 8 轮(约 09-11 → 09-25),累计 n≈40 |
| 结果 | 8/8 轮 = 100%,每轮命中率 5/5 或 6/6 |
| ⚠️ 局限 | ①非随机抽样(猎聘 / 应届生求职网 / 全职招聘网等,按关键词检索);②中文 JD 为主;③单轮样本仅 5–6 条,单轮 100% 的置信区间很宽;④"命中"是关键词级而非能力级判定 |
| 该怎么读 | 它证明的是趋势方向(强且一致),不是精确比例。不要说"100% 的 AIDD 岗位要求干湿闭环",要说"在连续 8 轮的中文 AIDD JD 抽样中,干湿闭环字样每轮 100% 出现" |
| # | 原因 | 机制 |
|---|---|---|
| 1 | 生成把"造候选"的成本打到趋近于零,瓶颈必然转移到"测" | RFD3 比 RFD2 快 10×、PocketXMol 一个模型出 13 类任务、AdaptiveFlow 能扫 690 亿库 —— 候选不再是稀缺品,"测得起几个"才是唯一约束。约束在哪,JD 就写什么 |
| 2 | 湿实验数据成为唯一不可复制的资产 | 模型人人可下载,你公司内部那批实测数据下载不到。Arrowhead CEO 原话:"AI 引擎的能力上限就是你喂给它的数据……我们做了几十万条 RNAi trigger……蛮力是很可怕的东西" |
| 3 | 资本已经按这个标准定价 | 沙利文毛化:要抢占自动化实验入口、专有数据资产、管线 IP;晶泰马健:"纯计算和预测的 AIDD 无法形成真正的知识沉淀,唯有构建'假设—检验'的工程化闭环";Anthropic 建实体湿实验室、Novo 全研发流程接 Claude、Lilly × NVIDIA 五年最高 10 亿美元 |
| 环 | 全称 | 生信侧交付物 | 常见断点 |
|---|---|---|---|
| D | Design(设计) | 候选列表 + 打分 + 不确定性 + 多样性保证 | 只给 top-N,全是同一骨架的近邻 |
| M | Make(合成/构建) | 合成可行性评分、序列到构建体的自动化输出 | 设计出来做不出来 |
| T | Test(测试) | 实验设计(对照/重复/剂量)、assay 选型 | 没有阴性对照、没有重复 → 数据不可用 |
| A | Analyze(分析) | 归因分析:为什么这批成/败;模型要改什么;下一批测什么 | ⚠️ 最常被跳过的一环 —— 测完就丢,不回流 |
⚠️ 最常见的假闭环:D→M→T 跑得很快,A 环节只产出一份 PPT。没有 A 的 DMTA 只是"高通量试错",不是闭环。
| 阶段 | JD 典型措辞 | 含义 |
|---|---|---|
| 早期轮次 | "与湿实验团队合作" | 你是支持方 |
| 中期 | "根据实验结果迭代优化模型" | 你要响应实验 |
| 近期(本轮) | "深度跟进项目管线,根据湿实验结果迭代优化模型与分子设计策略,构建干湿实验闭环" | ⚠️ 动词从"配合"变成"构建",闭环成为你名下的交付物 |
| 本轮新增 | "有自己设计过'数据回流→模型更新→效果提升'闭环的实操经验" | 从"参与过"升级为"自己设计过" |
判读:岗位对干湿闭环的要求从"参与"升到了"拥有(Ownership)"。这也是为什么多肽岗 JD 会写"从苗头到 PCC 全链条 Ownership"。
1. "我会跑模型"已经不够用了,要能说清楚"我的模型怎么因为实验数据变好了" —— 带数字、带基线、带失败案例。 2. caiPro 现在最缺的不是模型,是 L3 归因层 —— 没有它,任何"闭环"都只是说法,拿不出证据。 3. 核酸方向本轮回落(0/5)不代表不重要 —— 上轮 2/6 里有深圳湾实验室明确要求"蛋白/核酸结构建模 + 蛋白-核酸对接 + GROMACS MD"。核酸建模目前是少数岗位的深水要求,不是普遍要求,属于差异化机会而非主流门槛。
| 严重度 | 风险 | 后果 | 动作 |
|---|---|---|---|
| P0 | BindCraft2 许可为 NOASSERTION / source-available 且限制第三方托管 | 企业商用、再分发、SaaS 托管可能违约 | 引入前逐字读 LICENSE;生产环境优先 PocketXMol(MIT)或 RFD3(BSD-3) |
| P0 | MM-GBSA 的 ST 假设在柔性配体(环肽)上常不成立 | 结果系统性错误且不报错 | 先查结合前后构象分布重叠度;不成立就改 MT 或加界面水 |
| P0 | 省略熵项 −TΔS | 得到的是有效焓不是自由能,对多肽误差可达数 kcal/mol | 至少用 Interaction Entropy;报告里必须写明 |
| P1 | RFD3 官方镜像不支持 ARM | Apple Silicon 本机跑不了 | 走 x86 Linux / 云 GPU;方案里写明算力 |
| P1 | MM-GBSA 跨化学系列排序不可靠 | 给不同骨架排序得到的是噪声 | 限定 congeneric series;跨骨架升级 FEP |
| P1 | PocketXMol "76/382" 的分母是筛选后的候选 | 高估端到端命中率 | 引用时说明分母口径 |
| P2 | BindCraft2 v1.0.1 多链索引 bug 刚修 | 多链/复合物场景成熟度弱 | 上生产前用自己的多链用例验证 |
| P2 | MD 轨迹未做 PBC 校正 | MM-GBSA 结果整体偏移,不报错 | -ct 必须是 PBC-corrected + fitted 轨迹 |
| P2 | 主动学习无基线对照 | 无法证明增益,面试/评审必被追问 | 每轮预留随机/多样性对照 |
| 追踪项 | 上一状态 | 本轮 |
|---|---|---|
| BindCraft2 预印本 + LICENSE 正式文本 | 连续 4 轮为 0 | ✅ 部分回执:仓库与版本已确认(v1.0.1,约 09-23),论文仍未发(code-first);许可确认为 NOASSERTION,非标准 OSI 开源 → 转为"持续跟踪 LICENSE 文本与论文" |
| Adaptyv–Anthropic 竞赛 | 09-28 开题(未到期) | 补充动机:BC2 的发布时间是刻意卡在这个竞赛之前,参赛者可直接用 |
生成时间:2026-09-25 | 基于 09-25 简报 §4 的两条岗位信号做纵深扩展 | 检索 4 轮 + 前期积累