Biomni 深度解析:Stanford 通用生物医学 AI 智能体

架构拆解 · 实测数据 · 部署实操 · 商业化现状 · 风险清单
整理日期 2026-09-15 · 主要依据:Huang et al., Science (2026), DOI 10.1126/science.adz4351 · snap-stanford/Biomni 仓库 · Phylo 官方公告 · Scale Labs × Phylo DrugDiscoveryBench

0. 结论先行

六条判断
  1. Biomni 的本质不是"一个模型",而是"环境 + 智能体"的双层设计。Biomni-E1 是从约 2500 篇论文里自动挖出来的工具环境,Biomni-A1 是在这个环境上做规划与代码执行的智能体。换掉底层 LLM,架构红利依然存在——这是它最值钱的地方。
  2. 57% 是真实水平,不是宣传口径。443 道题覆盖 10 类任务,平均准确率 57%。对比:Claude Sonnet 4.5 裸用 30%、TxAgent 25%、Claude Code 43%、同一环境下的传统 ReAct 44%。意味着近一半结果是错的——它只能当助手,不能当裁判。
  3. 它在"查库 + 标准分析"上已到专家水平,在"深层推理"上还差很远。数据库问答 74.4%(人类专家 74.7%);序列推理 81.9%(人类 78.8%);但 Humanity's Last Exam 生物医学子集只有 17.3%。任务越需要临床判断和实验推理,越弱。
  4. 真正的杀手锏是速度,不是准确率。罕见病诊断 110 分钟 → 3 分钟;GWAS 因果基因 90 分钟 → 4 分钟;单细胞注释 230 分钟 → 75 分钟。准确率与资深博后/教授持平,时间少一个数量级。
  5. Phylo 的商业逻辑已经跑通,但"开源版"和"Biomni Lab"是两回事。开源仓库给你 E1 环境 + A1 智能体;Biomni Lab 是闭源商业平台(2026-02 发布,1350 万美元种子轮,2026-07-28 日本小野制药全组织部署)。学术用户免费,重度算力付费。
  6. P1对你(macOS)最实际的问题:官方只测试过 Ubuntu 22.04。完整环境需 R + 命令行生信工具链,安装可能超过 10 小时、至少 30GB 磁盘。macOS/Apple Silicon 上会撞包冲突,要有心理准备。
150 / 105 / 59
工具 / 软件包 / 数据库
构成 E1 执行环境
57%
Biomni-Eval1 平均准确率
443 题 · 10 类任务
17.3%
HLE 生物医学子集
最硬推理基准的真实水位
0.35 → 0.67
Biomni-R0-32B 强化学习前后
超过教师模型 Claude Sonnet 4 (0.56)

1. 它到底是什么

Biomni 由 Stanford 计算机系 Kexin Huang(PhD 毕业生,现 Phylo 联合创始人兼 CEO)与 Jure Leskovec 教授主导,合作者来自 Genentech、Arc Institute、Princeton、UCSF。2025-05 首发 bioRxiv 预印本,2026 年正式发表于 Science(Autonomous biomedical research with an artificial intelligence agent)。

核心设计哲学:不做"单任务专家",做"会找工具的通才"
在此之前,生物医学 AI 基本是"一个任务训一个模型"(某个模型只做变异致病性、某个只做药物—靶点)。Biomni 反过来:先把整个生物医学的"行动空间"建成一个环境,再让一个通用智能体在上面自主组合。论文原话是——不依赖预定义的函数调用顺序或固定模板,而是为任务动态拼装动作。

1.1 双层架构

层角色构成
Biomni-E1
执行环境
工具箱 / 行动空间 一个 Action Discovery Agent 扫描 bioRxiv 上 25 个生物医学子领域、每方向约 100 篇近期论文(合计约 2500 篇),自动提取其中科学家实际使用的实验任务、工具、数据库、软件包和协议,再经人工专家核验后整合为可调用环境。
最终规模:150 个专用工具 + 105 个软件包 + 59 个数据库,可通过 Python、R、命令行调用;另有 11GB 数据湖(首次运行时自动下载)。
Biomni-A1
智能体层
大脑 + 双手 三大机制(见下节),以 ReAct 循环把「LLM 推理 + 检索增强规划 + 代码执行」串起来。入口是 biomni.agent.A1。

1.2 A1 的三大机制

① 智能资源选择
不是把 150 个工具全塞进上下文,而是先检索再选择:根据查询意图挑出最相关的工具、数据库和软件,避免上下文爆炸与工具混淆。
② 代码即动作
Code-as-action 是统一的动作接口。数据库查询、数据处理、模型预测、分析流程全部用代码串起来。好处是能灵活组合异构资源、处理不符合预定义函数签名的操作。
③ 自适应规划
先用生物医学知识生成初始计划,执行中根据中间结果不断修正细化——像人一样"边想边做",而不是一次性生成后硬跑。

1.3 仓库里的四个核心部件

路径内容
biomni/agent/A1 智能体。ReAct 循环:LLM 推理 + RAG 规划 + 代码执行。平台入口。
biomni/tool/工具层。按领域拆成 20 余个模块(基因组学、癌症生物学、药理学、单细胞分析、合成生物学等),每个模块是一组可被智能体调用的函数。
biomni/tool/schema_db/数据库 schema。30+ 预打包数据库(不同来源统计口径在 25–59 之间),含 Ensembl、gnomAD、dbSNP、UCSC、UniProt、PDB、InterPro、ClinVar、ClinicalTrials、OpenFDA、GWAS Catalog、Open Targets、KEGG、Reactome、BioGRID、cBioPortal、ChEMBL、PubChem、DrugBank 等。智能体直接查询,不用你逐个接 API。
biomni/tool/protocols/协议库。收录 Addgene 与 Thermo Fisher 共 100 余份标准操作规程(细菌转化、CRISPR 文库扩增、Western Blot 等)。任务涉及具体实验技术时自动检索对应 SOP。
biomni/know_how/Know-How Library。实验设计类最佳实践(sgRNA 设计指南、单细胞注释流程等),按查询相关性自动调取,社区可贡献。带元数据追踪(作者、机构、许可、商用限制),兼容 commercial mode(会过滤非商用内容)。

2. 性能数据:把每个数字摊开看

2.1 Biomni-Eval1(自建基准,443 题 / 10 类任务)

10 类任务包括:CRISPR 递送、因果基因识别(gene-centric / ontology-based / pathway-based 三种)、变异优先级排序、数据库查询、DNA 序列查询、患者基因检测、罕见病诊断、扰动筛选设计。

系统平均准确率说明
Biomni(A1 + E1)
57%
三次独立运行的平均
Claude Code(通用编码智能体)
43%
Biomni-ReAct(同一环境 + 传统 ReAct)
44%
说明 +13 个百分点来自 A1 的架构设计,不是来自环境本身
Claude Sonnet 4.5(裸 LLM)
30%
TxAgent(治疗研究专用智能体)
25%

2.2 与人类专家的正面对比

任务Biomni 准确率人类专家耗时对比解读
单细胞 RNA-seq 注释45.8%40.5% – 50.9%
(强专家基线区间)
230 分钟 → 75 分钟
每个数据集
准确率落在专家区间内,速度约 3 倍
罕见病诊断60%60% – 70%
(5 名专家)
110 分钟 → 3 分钟速度约 37 倍,准确率处于专家下限
GWAS 因果基因检测80%接近专家水平90 分钟 → 4 分钟速度约 22 倍

2.3 标准化基准

基准Biomni对照说明
LAB-Bench DbQA
数据库问答
74.4%人类专家 74.7%
ReAct+Code 40.8%
基本追平专家,远超纯编码智能体。这是 Biomni 最强的一块。
SeqQA
DNA / 蛋白序列推理
81.9%人类 78.8%略超人类
HLE-Bio
Humanity's Last Exam 生物医学子集
17.3%基座 LLM 6.0%
编码智能体 12.8%
文献智能体 12.2%
绝对分很低,但相对提升最大,且在多个前沿底座模型上都稳定带来 6–12 个百分点提升——证明收益来自架构而非某个模型。作者明确承认"并非所有任务都达到专家级"。
8 个真实研究任务—相对基座 LLM +402.3%
相对编码智能体 +43.0%
相对 Biomni-ReAct +20.4%
涵盖 GWAS 因果基因检测、约 2 万基因的扰动筛选设计、罕见病诊断、药物重定位等

2.4 Biomni-R0:强化学习版(开源权重)

思路:先蒸馏再强化。基座用 Qwen3 开源模型,先从前沿模型 Claude Sonnet 4(教师) 蒸馏,再用专家标注的奖励信号在 Biomni-E1 环境中做端到端任务成功率的 RL 优化。

模型RL 前RL 后说明
Biomni-R0-8B0.320.59已超过教师模型 Claude Sonnet 4(0.56)
Biomni-R0-32B0.350.67在 8B 基础上再涨约 10 个绝对百分点
Claude Sonnet 4(教师/对照)0.56被学生反超
这条结论对你很重要
把底座模型换聪明只是半场戏,把环境和执行框架搭对同样能把分数抬上去。一个 8B 的开源模型,在正确的 agent 环境里经过 RL,能反超 200B+ 级别的闭源前沿模型。这对预算有限的课题组是实质性的好消息——你不一定非要买最贵的 API。

3. 五个真实案例(论文实证)

① 可穿戴数据 → 自主复现 COVID 生理分析
输入:1027 名参与者的分钟级 Fitbit 心率与步数原始数据,14 亿+ 条心率记录、3700 万条步数,人均监测 170 天。
Biomni 自主完成端到端流程:数据清洗 → 提取六类已验证的 COVID 相关生理标志物(静息心率升高、昼夜节律振幅降低、HRV 下降、夜间心率升高、每日步数减少、变时反应减弱)→ 重建群体 24 小时节律结构 → 整合为 0–6 分风险评分 → 生成论文级图表。
关键相关性复现:静息心率 vs 昼夜振幅 r = −0.34;每日步数 vs HRV r = +0.54。
② 人类骨骼发育多组学 → 推断转录调控
数据:336,162 个 snRNA-seq + snATAC-seq,配人胚 5–11 周肩/髋/膝空间转录组。
Biomni 自主规划并执行 10 阶段流程:数据载入探索 → RNA 预处理 → 配置 pySCENIC 取 motif → GRNBoost2 推断基因调控网络 → cisTarget 剪枝 → AUCell 计算 regulon 活性 → ……这是通常需要专职生信支持的活。
③ 分子克隆方案 → 湿实验验证通过
任务:设计 B2M 基因的 sgRNA 分子克隆方案,包括酶切位点选择、引物设计、质粒图谱绘制。
结果:与资深研究员的方案盲评接近;实验室研究员完全按方案照做,测序确认克隆成功。
④ 蛋白热稳定性改造
任务:把一个蛋白改得更耐热。
结果:Biomni 自建计算优化流程,提出三个理性突变位点,与当前蛋白热稳定性工程的顶尖原则吻合。
⑤ 驱动实验室机器人
Biomni 写出可直接运行的代码,驱动实验室机器人完成一整套多步骤药物剂量—反应实验。把计算结论直接连到物理执行。
⑥ 智能手表数据(另一版本)
458 个 Excel 文件、30 名参与者连续葡萄糖监测数据;以及分析智能手表读数恢复已知的 COVID-19 感染早期预警信号。

4. 部署实操

4.1 安装路径

# 1) 建环境(官方提供单一 setup.sh)
git clone https://github.com/snap-stanford/Biomni
cd Biomni/biomni_env
conda env create -f environment.yml      # 基础版:Python 3.11,约 13GB 磁盘
conda activate biomni_e1

# 2) 装核心包
pip install biomni --upgrade
# 或装最新开发版
pip install git+https://github.com/snap-stanford/Biomni.git@main

# 3) 配置 API Key(推荐 .env)
ANTHROPIC_API_KEY=your_key
BIOMNI_TIMEOUT_SECONDS=1200

4.2 最小可用代码

from biomni.agent import A1

# 首次运行会自动下载约 11GB 数据湖
agent = A1(path='./data', llm='claude-sonnet-4-20250514')

agent.go("Plan a CRISPR screen to identify genes that regulate T cell exhaustion, "
         "generate 32 genes that maximize the perturbation effect.")
agent.go("Perform scRNA-seq annotation at [PATH] and generate meaningful hypothesis")
agent.go("Predict ADMET properties for this compound: CC(C)CC1=CC=C(C=C1)C(C)C(=O)O")

agent.save_conversation_history("report.pdf")

# 跳过数据湖下载(调试用,速度快很多)
agent = A1(path='./data', llm='claude-sonnet-4-20250514', expected_data_lake_files=[])

# 启动 Gradio Web UI(需 pip install "gradio>=5.0,<6.0",6.x 不兼容)
agent.launch_gradio_demo()

4.3 支持与配置

项说明
LLM 提供方Anthropic Claude(官方推荐)、OpenAI、Azure OpenAI、Gemini、Groq、AWS Bedrock、Ollama、自定义端点(CUSTOM_MODEL_BASE_URL)。Azure 模型名须加 azure- 前缀。
配置方式.env 文件(推荐)或环境变量。注意:直接传参给 A1() 只影响该 agent 的推理,不影响数据库查询;要全局一致请用 default_config 或环境变量。
MCP 支持agent.add_mcp(config_path="./mcp_config.yaml"),可挂外部 MCP 服务器;也支持把 Biomni 自身暴露为 MCP server。
超时 / 迭代BIOMNI_TIMEOUT_SECONDS(默认 600),default_config.max_iterations(默认 50)
环境档位基础版 environment.yml(Python 3.11,约 13GB);完整版额外装 R 与命令行生信工具链,官方仅测试 Ubuntu 22.04 64-bit,耗时可能 >10 小时,需预留 ≥30GB 磁盘。另有 bio_env_py310.yml、fixed_env.yml(固定版本)。
R 集成Rscript biomni_env/install_r_packages.R(Bioconductor 系列、ggplot2、dplyr 等)
P1 已知包冲突(官方明说)
部分 Python 包因依赖冲突默认不安装。需要相应功能时必须手动装,甚至要手动取消代码里的注释。完整清单见仓库 docs/known_conflicts.md。这意味着:你以为能用的某个工具,可能第一次调用直接报 ImportError。

5. 商业化:Phylo 与 Biomni Lab

时间事件要点
2026-02-03Biomni Lab 研究预览版发布同期宣布 1350 万美元种子轮,a16z 与 Menlo Ventures 的 Anthology Fund 共同领投,Anthropic 参投。
2026-03-20Biomni-AD 获百万美元大奖西奈山 Icahn 医学院 Kuan-lin Huang(黄冠霖)团队与 Stanford 合作,凭 Biomni-AD 获阿尔茨海默病数据倡议(AD Data Initiative)的 Alzheimer's Insights AI Prize。原设单一 100 万美元奖,因投稿质量与紧迫性扩为两个获奖团队、总奖金 200 万美元。平台后续通过 AD Workbench 向全球研究者免费开放,并启动 ADA 联盟。
2026-06-30DrugDiscoveryBench 发布Phylo 与 Scale Labs 合作。详见第 6 节。
2026-07-28小野制药(Ono Pharmaceutical)全组织部署大阪药企(东京上市 4528,以 PD-1 抗体 Opdivo 闻名)在整个药物发现组织部署 Biomni Lab。关键:不只是软件许可,而是把 Ono 自有的发现专业知识与历史数据引入环境。
2026 年内其他部署Ginkgo Bioworks(DNA 方向)、Mount Sinai(agentic 临床试验模拟)
定价模式
学术研究者免费;需要更多算力的可走付费档,学术用户享折扣(Phylo 明确表示要补贴学术界)。企业侧为付费层。Huang 称已有 10000+ 实验室(学界 + 工业界)在用原型。
Biomni Lab 定位
"Integrated Biology Environment"——把数百个数据库、工具、软件包、专用生物模型、专家 skills 和算力放在一个工作区。模型无关(model-agnostic),按任务路由到最合适的模型。核心卖点是把你的专家经验沉淀为可复用的流程,形成属于你自己的专有智能。

6. DrugDiscoveryBench:比 Biomni 本身更值得你关注的一组数据

2026-06-30,Phylo 与 Scale Labs 发布,82 个任务,由一线药物发现科学家撰写,覆盖靶点识别、专利挖掘、构效关系(SAR)分析;每个任务有可验证答案 + 专家撰写的评分细则;智能体通过写代码查询真实生物医学数据库来解题。评测环境改编自开源 Biomni。

配置通过率说明
GPT-5.5(xhigh, mini-SWE-agent)51.6%前沿模型挤在 5 个百分点内,没有全能冠军:Gemini 在结构推理上最强,GPT 在数据库筛选与专利挖掘领先,Opus 在靶点识别与遗传学占优。
(Opus 4.8 在 Phylo 博客与 Scale 论文中分别记为 47.2% / 46.8%,口径略有差异)
Gemini 3.5 Flash(high, Gemini CLI)50.0%
Opus 4.8(max, mini-SWE-agent)46.8 – 47.2%
三条比排名重要得多的发现
  1. harness(模型之外的那套架构)和模型本身一样重要。固定模型、只换外围 agent 架构:GPT-5.5 从 40.6% → 51.6%,GLM 5.2 从 24.4% → 37.8%。同一个模型,完全不同的结果。
  2. 测试时算力可以线性换分数。同一模型家族内,GPT-5.5 Codex 随算力提升:27.6% → 39.8% → 43.9%。
  3. 给"人类写的 playbook"后,通过率飙到 76–80 / 82(>90%)。也就是说:瓶颈不在模型,在没人把领域经验写清楚。反过来说——把你们组的分析 SOP 写成 agent 可执行的步骤,是当前 ROI 最高的一件事。
P0 长流程会"静默丢约束"
Phylo 自己坦白的失效模式:在长工作流中,agent 会悄悄丢掉题目里的某个约束,或者解错了对象却毫无察觉,然后给出一个自信的错误答案。实例——回答黑色素瘤的问题时,它给出了一个乳腺癌基因。这种错误任何科学家几秒钟就能识破,但如果你不看,它就直接进了你的报告。
这是当前所有 agent 在生信场景中最危险的失效模式:不报错、不降低置信度、输出格式完美、结论全错。

7. 已知局限(作者自述,不是我的推测)

8. 风险清单

P0 静默错误:57% 准确率的另一面是 43% 是错的
后果:agent 输出的脚本能跑通、图表漂亮、结论错误,且不报错、不降置信度。在长工作流中尤其容易丢约束。
验证方法:
1. 任何进入决策的结论,要求它给出可追溯的中间产物(查询原始记录、数据表、代码),而不是只看最终段落。
2. 对关键结论做独立复算——换个方式问同一个问题,或用传统工具交叉验证。
3. 长任务分段执行,每段人工确认后再往下走。Huang 本人也建议用户验证输出。
P0 数据合规:代码在本地跑,但 prompt 要发到云端
后果:Biomni 的推理依赖 LLM API。你投喂的未发表数据、患者临床信息、公司专有序列会被送到 Anthropic / OpenAI / Google。代码执行在本地 ≠ 数据不外传。
处理方式:
1. 涉敏数据走 Azure OpenAI / AWS Bedrock(企业合规协议)或本地 Ollama / 自定义端点(CUSTOM_MODEL_BASE_URL)。
2. 查询前做脱敏:基因名可以,患者标识符、未发表序列不行。
3. 检查你的 API 供应商是否默认用你的数据训练——大多数企业级协议不会,但默认档位要确认。
P1 会执行任意代码:沙箱是必须的
A1 会自己写 Python/CLI 并执行。这在你的工作机上等于给了一个会自我授权的执行器。
处理方式:第一次跑放在容器或虚拟机里;不要在有生产数据库写权限的环境中裸跑;expected_data_lake_files=[] 先跑通再放量。
P1 macOS 部署:官方只测过 Ubuntu 22.04
完整环境需要 R + 命令行生信工具链,官方明确仅测试 Ubuntu 22.04 64-bit,安装可能 >10 小时、≥30GB 磁盘。Apple Silicon 上大概率撞编译与依赖冲突。
建议:别在你日常工作的 Mac 上硬装。用 Docker/UTM 起一台 Ubuntu 22.04 x86_64 虚拟机,或直接用实验室的 Linux 服务器 / 云主机。先只装基础版(约 13GB)跑通流程,需要 R 相关工具时再补。
P1 成本不可控
A1 默认 max_iterations=50、timeout=600s,长任务会大量消耗 token。一个复杂的多组学流程可能跑掉几十到上百美元。
处理方式:设 BIOMNI_TIMEOUT_SECONDS 与 max_iterations 上限;先用小任务测单次成本;考虑 Biomni-R0-8B/32B 本地部署(RL 后已超 Claude Sonnet 4),长期看能显著压低成本。
P2 "开源" ≠ "你拿到的是完整产品"
GitHub 上的开源版给你 E1 环境 + A1 智能体;Biomni Lab 是闭源商业平台,多了企业级数据库、专有 skills、算力与模型路由。别把"能 clone 仓库"当成"可自主可控"。另外注意 Know-How Library 带商用标记过滤——商业场景下部分内容会被自动排除。
P2 中文二手教程里的 API 名不可信
检索过程中看到多篇中文技术博客给出了形如 from biomni.tool.database import query_multiple_databases、biomni.tool.genomics.gwas_causal_gene_identification() 的示例——这些在官方仓库 README 与文档中均无法印证,很可能是大模型编造的。请以 github.com/snap-stanford/biomni 的 README 与 tutorials/ 为准。不要照抄二手博客的 API 调用。

9. 给你的落地建议

9.1 短期(本周能做)

9.2 中期(一个月内)

9.3 判断标准

场景建议理由
文献检索与综述放心用这是 agent 类工具最成熟的应用,70–80% 的文献工作可被替代
标准生信流程(RNA-seq、单细胞注释、富集分析)用,但要审速度与专家持平、准确率在专家区间内;务必检查参数与版本
数据库查询、变异解读、GWAS locus放心用74–82%,是它最强的一块
ADMET 预测、化合物初筛可作参考能用,但要与 Chemprop / TDC / ADMETlab 交叉验证
机制假设生成、靶点发现不要用其结论HLE 17.3%,长流程丢约束;只能当灵感来源,必须人工验证
临床判断相关禁用作者自述在需细致临床判断的任务上明显不足
信息来源与不确定性:主要依据 Huang K. et al., "Autonomous biomedical research with an artificial intelligence agent", Science(DOI 10.1126/science.adz4351,2026 年 7 月在线、8 月 20 日刊出);snap-stanford/Biomni 仓库 README 与目录结构;Phylo 官方博客(phylo.bio/blog/drugdiscoverybench);Scale Labs DrugDiscoveryBench 论文与排行榜;AD Data Initiative 与西奈山关于 Biomni-AD 的公告。

需打折看待的数字:(1) "150 工具 / 105 软件包 / 59 数据库" 与 "11GB 数据湖" 来自不同来源、统计口径不完全一致(仓库文档中数据库数有 25–59 的多种说法);(2) Opus 4.8 在 DrugDiscoveryBench 上有 47.2% 与 46.8% 两个数字;(3) 给 playbook 后的通过数有 76/82 与 80/82 两种表述;(4) 中文技术博客中的具体 API 示例未能与官方仓库印证,本报告已刻意不收录;(5) "10000+ 实验室""15000 名科研人员""10 万+ 工作流" 等规模数字均来自 Phylo 官方口径,无独立第三方核实。