Biomni 由 Stanford 计算机系 Kexin Huang(PhD 毕业生,现 Phylo 联合创始人兼 CEO)与 Jure Leskovec 教授主导,合作者来自 Genentech、Arc Institute、Princeton、UCSF。2025-05 首发 bioRxiv 预印本,2026 年正式发表于 Science(Autonomous biomedical research with an artificial intelligence agent)。
| 层 | 角色 | 构成 |
|---|---|---|
| Biomni-E1 执行环境 |
工具箱 / 行动空间 | 一个 Action Discovery Agent 扫描 bioRxiv 上 25 个生物医学子领域、每方向约 100 篇近期论文(合计约 2500 篇),自动提取其中科学家实际使用的实验任务、工具、数据库、软件包和协议,再经人工专家核验后整合为可调用环境。 最终规模:150 个专用工具 + 105 个软件包 + 59 个数据库,可通过 Python、R、命令行调用;另有 11GB 数据湖(首次运行时自动下载)。 |
| Biomni-A1 智能体层 |
大脑 + 双手 | 三大机制(见下节),以 ReAct 循环把「LLM 推理 + 检索增强规划 + 代码执行」串起来。入口是 biomni.agent.A1。 |
| 路径 | 内容 |
|---|---|
biomni/agent/ | A1 智能体。ReAct 循环:LLM 推理 + RAG 规划 + 代码执行。平台入口。 |
biomni/tool/ | 工具层。按领域拆成 20 余个模块(基因组学、癌症生物学、药理学、单细胞分析、合成生物学等),每个模块是一组可被智能体调用的函数。 |
biomni/tool/schema_db/ | 数据库 schema。30+ 预打包数据库(不同来源统计口径在 25–59 之间),含 Ensembl、gnomAD、dbSNP、UCSC、UniProt、PDB、InterPro、ClinVar、ClinicalTrials、OpenFDA、GWAS Catalog、Open Targets、KEGG、Reactome、BioGRID、cBioPortal、ChEMBL、PubChem、DrugBank 等。智能体直接查询,不用你逐个接 API。 |
biomni/tool/protocols/ | 协议库。收录 Addgene 与 Thermo Fisher 共 100 余份标准操作规程(细菌转化、CRISPR 文库扩增、Western Blot 等)。任务涉及具体实验技术时自动检索对应 SOP。 |
biomni/know_how/ | Know-How Library。实验设计类最佳实践(sgRNA 设计指南、单细胞注释流程等),按查询相关性自动调取,社区可贡献。带元数据追踪(作者、机构、许可、商用限制),兼容 commercial mode(会过滤非商用内容)。 |
10 类任务包括:CRISPR 递送、因果基因识别(gene-centric / ontology-based / pathway-based 三种)、变异优先级排序、数据库查询、DNA 序列查询、患者基因检测、罕见病诊断、扰动筛选设计。
| 系统 | 平均准确率 | 说明 |
|---|---|---|
| Biomni(A1 + E1) | 三次独立运行的平均 | |
| Claude Code(通用编码智能体) | ||
| Biomni-ReAct(同一环境 + 传统 ReAct) | 说明 +13 个百分点来自 A1 的架构设计,不是来自环境本身 | |
| Claude Sonnet 4.5(裸 LLM) | ||
| TxAgent(治疗研究专用智能体) |
| 任务 | Biomni 准确率 | 人类专家 | 耗时对比 | 解读 |
|---|---|---|---|---|
| 单细胞 RNA-seq 注释 | 45.8% | 40.5% – 50.9% (强专家基线区间) | 230 分钟 → 75 分钟 每个数据集 | 准确率落在专家区间内,速度约 3 倍 |
| 罕见病诊断 | 60% | 60% – 70% (5 名专家) | 110 分钟 → 3 分钟 | 速度约 37 倍,准确率处于专家下限 |
| GWAS 因果基因检测 | 80% | 接近专家水平 | 90 分钟 → 4 分钟 | 速度约 22 倍 |
| 基准 | Biomni | 对照 | 说明 |
|---|---|---|---|
| LAB-Bench DbQA 数据库问答 | 74.4% | 人类专家 74.7% ReAct+Code 40.8% | 基本追平专家,远超纯编码智能体。这是 Biomni 最强的一块。 |
| SeqQA DNA / 蛋白序列推理 | 81.9% | 人类 78.8% | 略超人类 |
| HLE-Bio Humanity's Last Exam 生物医学子集 | 17.3% | 基座 LLM 6.0% 编码智能体 12.8% 文献智能体 12.2% | 绝对分很低,但相对提升最大,且在多个前沿底座模型上都稳定带来 6–12 个百分点提升——证明收益来自架构而非某个模型。作者明确承认"并非所有任务都达到专家级"。 |
| 8 个真实研究任务 | — | 相对基座 LLM +402.3% 相对编码智能体 +43.0% 相对 Biomni-ReAct +20.4% | 涵盖 GWAS 因果基因检测、约 2 万基因的扰动筛选设计、罕见病诊断、药物重定位等 |
思路:先蒸馏再强化。基座用 Qwen3 开源模型,先从前沿模型 Claude Sonnet 4(教师) 蒸馏,再用专家标注的奖励信号在 Biomni-E1 环境中做端到端任务成功率的 RL 优化。
| 模型 | RL 前 | RL 后 | 说明 |
|---|---|---|---|
| Biomni-R0-8B | 0.32 | 0.59 | 已超过教师模型 Claude Sonnet 4(0.56) |
| Biomni-R0-32B | 0.35 | 0.67 | 在 8B 基础上再涨约 10 个绝对百分点 |
| Claude Sonnet 4(教师/对照) | 0.56 | 被学生反超 | |
# 1) 建环境(官方提供单一 setup.sh)
git clone https://github.com/snap-stanford/Biomni
cd Biomni/biomni_env
conda env create -f environment.yml # 基础版:Python 3.11,约 13GB 磁盘
conda activate biomni_e1
# 2) 装核心包
pip install biomni --upgrade
# 或装最新开发版
pip install git+https://github.com/snap-stanford/Biomni.git@main
# 3) 配置 API Key(推荐 .env)
ANTHROPIC_API_KEY=your_key
BIOMNI_TIMEOUT_SECONDS=1200
from biomni.agent import A1
# 首次运行会自动下载约 11GB 数据湖
agent = A1(path='./data', llm='claude-sonnet-4-20250514')
agent.go("Plan a CRISPR screen to identify genes that regulate T cell exhaustion, "
"generate 32 genes that maximize the perturbation effect.")
agent.go("Perform scRNA-seq annotation at [PATH] and generate meaningful hypothesis")
agent.go("Predict ADMET properties for this compound: CC(C)CC1=CC=C(C=C1)C(C)C(=O)O")
agent.save_conversation_history("report.pdf")
# 跳过数据湖下载(调试用,速度快很多)
agent = A1(path='./data', llm='claude-sonnet-4-20250514', expected_data_lake_files=[])
# 启动 Gradio Web UI(需 pip install "gradio>=5.0,<6.0",6.x 不兼容)
agent.launch_gradio_demo()
| 项 | 说明 |
|---|---|
| LLM 提供方 | Anthropic Claude(官方推荐)、OpenAI、Azure OpenAI、Gemini、Groq、AWS Bedrock、Ollama、自定义端点(CUSTOM_MODEL_BASE_URL)。Azure 模型名须加 azure- 前缀。 |
| 配置方式 | .env 文件(推荐)或环境变量。注意:直接传参给 A1() 只影响该 agent 的推理,不影响数据库查询;要全局一致请用 default_config 或环境变量。 |
| MCP 支持 | agent.add_mcp(config_path="./mcp_config.yaml"),可挂外部 MCP 服务器;也支持把 Biomni 自身暴露为 MCP server。 |
| 超时 / 迭代 | BIOMNI_TIMEOUT_SECONDS(默认 600),default_config.max_iterations(默认 50) |
| 环境档位 | 基础版 environment.yml(Python 3.11,约 13GB);完整版额外装 R 与命令行生信工具链,官方仅测试 Ubuntu 22.04 64-bit,耗时可能 >10 小时,需预留 ≥30GB 磁盘。另有 bio_env_py310.yml、fixed_env.yml(固定版本)。 |
| R 集成 | Rscript biomni_env/install_r_packages.R(Bioconductor 系列、ggplot2、dplyr 等) |
docs/known_conflicts.md。这意味着:你以为能用的某个工具,可能第一次调用直接报 ImportError。
| 时间 | 事件 | 要点 |
|---|---|---|
| 2026-02-03 | Biomni Lab 研究预览版发布 | 同期宣布 1350 万美元种子轮,a16z 与 Menlo Ventures 的 Anthology Fund 共同领投,Anthropic 参投。 |
| 2026-03-20 | Biomni-AD 获百万美元大奖 | 西奈山 Icahn 医学院 Kuan-lin Huang(黄冠霖)团队与 Stanford 合作,凭 Biomni-AD 获阿尔茨海默病数据倡议(AD Data Initiative)的 Alzheimer's Insights AI Prize。原设单一 100 万美元奖,因投稿质量与紧迫性扩为两个获奖团队、总奖金 200 万美元。平台后续通过 AD Workbench 向全球研究者免费开放,并启动 ADA 联盟。 |
| 2026-06-30 | DrugDiscoveryBench 发布 | Phylo 与 Scale Labs 合作。详见第 6 节。 |
| 2026-07-28 | 小野制药(Ono Pharmaceutical)全组织部署 | 大阪药企(东京上市 4528,以 PD-1 抗体 Opdivo 闻名)在整个药物发现组织部署 Biomni Lab。关键:不只是软件许可,而是把 Ono 自有的发现专业知识与历史数据引入环境。 |
| 2026 年内 | 其他部署 | Ginkgo Bioworks(DNA 方向)、Mount Sinai(agentic 临床试验模拟) |
2026-06-30,Phylo 与 Scale Labs 发布,82 个任务,由一线药物发现科学家撰写,覆盖靶点识别、专利挖掘、构效关系(SAR)分析;每个任务有可验证答案 + 专家撰写的评分细则;智能体通过写代码查询真实生物医学数据库来解题。评测环境改编自开源 Biomni。
| 配置 | 通过率 | 说明 |
|---|---|---|
| GPT-5.5(xhigh, mini-SWE-agent) | 51.6% | 前沿模型挤在 5 个百分点内,没有全能冠军:Gemini 在结构推理上最强,GPT 在数据库筛选与专利挖掘领先,Opus 在靶点识别与遗传学占优。 (Opus 4.8 在 Phylo 博客与 Scale 论文中分别记为 47.2% / 46.8%,口径略有差异) |
| Gemini 3.5 Flash(high, Gemini CLI) | 50.0% | |
| Opus 4.8(max, mini-SWE-agent) | 46.8 – 47.2% |
CUSTOM_MODEL_BASE_URL)。expected_data_lake_files=[] 先跑通再放量。
max_iterations=50、timeout=600s,长任务会大量消耗 token。一个复杂的多组学流程可能跑掉几十到上百美元。BIOMNI_TIMEOUT_SECONDS 与 max_iterations 上限;先用小任务测单次成本;考虑 Biomni-R0-8B/32B 本地部署(RL 后已超 Claude Sonnet 4),长期看能显著压低成本。
from biomni.tool.database import query_multiple_databases、biomni.tool.genomics.gwas_causal_gene_identification() 的示例——这些在官方仓库 README 与文档中均无法印证,很可能是大模型编造的。请以 github.com/snap-stanford/biomni 的 README 与 tutorials/ 为准。不要照抄二手博客的 API 调用。
add_mcp(),把内部数据库、自有筛选流程接进去——这才是它对你真正有壁垒的用法。| 场景 | 建议 | 理由 |
|---|---|---|
| 文献检索与综述 | 放心用 | 这是 agent 类工具最成熟的应用,70–80% 的文献工作可被替代 |
| 标准生信流程(RNA-seq、单细胞注释、富集分析) | 用,但要审 | 速度与专家持平、准确率在专家区间内;务必检查参数与版本 |
| 数据库查询、变异解读、GWAS locus | 放心用 | 74–82%,是它最强的一块 |
| ADMET 预测、化合物初筛 | 可作参考 | 能用,但要与 Chemprop / TDC / ADMETlab 交叉验证 |
| 机制假设生成、靶点发现 | 不要用其结论 | HLE 17.3%,长流程丢约束;只能当灵感来源,必须人工验证 |
| 临床判断相关 | 禁用 | 作者自述在需细致临床判断的任务上明显不足 |