Basecamp以进化多样性数据训练生物AI模型

The Decoder··作者 Maximilian Schreiner

关键信息

Basecamp称,序列读取档案库中约68%的序列数据量仅来自五个物种,其中人类约占54%,因此该公司使用环境宏基因组样本补充公共数据。其治疗项目目前只有实验室和小鼠数据,尚无证据证明这种方法对人类安全且有效。

资讯摘要

Basecamp Research完成了1.4亿美元融资,本轮由S32领投,Nvidia、Anthropic旗下Anthology Fund、北约创新基金、Redalpine等机构参与。该公司于2020年成立,总部位于伦敦,计划利用这笔资金继续开发EDEN生物AI模型,并推动自主治疗候选项目迈向临床开发。其首要治疗方向是细胞疗法,包括直接在患者体内对细胞进行基因改造,使其能够对抗癌症等疾病的工具。Basecamp从研究不足的环境中采集遗传材料训练模型,包括雨林土壤、火山地带、温泉、海洋以及南极洲附近的深海。

首席技术官Philip Lorenz认为,生物AI需要比现有规模多几个数量级且更加多样的数据,同时还要配合规模较小、目标明确的实验。该公司指出,公共基因组资料库的数据高度集中于人类和少数其他物种,限制了模型学习进化所产生的广泛生物过程。目前Basecamp公布的成果仅限于实验室和小鼠数据,因此其方法距离证明对人类安全、有效并能提高临床研发成功率仍有很长的路要走。

Basecamp以进化多样性数据训练生物AI模型

资讯正文

据该公司称,本轮融资由投资机构 S32 领投,Nvidia、Anthropic 的 Anthology Fund、NATO Innovation Fund 和 Redalpine 等也参与了投资。

Basecamp 成立于 2020 年,计划利用这笔资金继续开发其名为 EDEN 的生物 AI 模型,并推动自有候选疗法进入临床开发阶段。细胞疗法将是首要方向。这类疗法会对患者的细胞进行基因改造,例如使其能够对抗癌症。Basecamp 希望直接在患者体内完成这种改造。

为实现这一目标,该公司将目光投向了来自研究人员鲜少探索的栖息地中的微生物。其模型旨在从这些微生物的基因组中学习可用于医疗的模式。

Basecamp 首席技术官 Philip Lorenz 在接受 THE DECODER 采访时表示:“鉴于生物学的复杂性,我们所需的数据量必须增加多个数量级。”他说,最重要的是将这种大规模数据收集与规模较小、目标明确的实验结合起来。

在这一切真正转化为治疗手段之前,仍有大量开发工作要做。迄今为止,Basecamp 获得的是实验室结果和小鼠数据。这些结果尚不能证明其方法能否在人类身上产生安全、有效的疗法。

为什么公共基因组数据库无法支撑生物 AI

《华尔街日报》最近报道称,制药公司正向 AI 投入数十亿美元,但目前仍鲜有确凿证据表明,AI 显著提高了临床开发的成功率。Lorenz 并不认为这足以成为怀疑该技术的理由。扩大规模很快就为语言模型带来了巨大进步。他表示,生物学领域也在取得进展,但加快临床试验等尚未解决的重大问题要困难得多。就问题本身而言,生物学“要复杂得多得多得多,规模也大得多”。

数据本身也存在根本差异。语言模型从海量文本集合中学习,而制药公司通常使用的是来自单项研究、规模较小且彼此孤立的数据集。

Lorenz 引用 Epoch AI 的一项估算来说明这种差距有多大。该估算认为,现存全部文字的上限约为 5,000 万亿个 token。Basecamp 则估计,地球上的核苷酸数量为 10 的 37 次方。Lorenz 说:“如果你把 10 的 37 次方张扑克牌叠起来,这摞牌可以环绕可观测宇宙 100 万圈。”他说,数据集不必达到如此庞大的规模,但确实需要远远大于现有数据集。

公共基因组数据库所呈现的自然界图景也并不完整。根据 Basecamp 介绍其 BaseData 数据库的研究论文,Sequence Read Archive 中约 68% 的序列数据量仅来自 5 个物种,其中仅人类就约占 54%。

这种侧重点对于医学研究来说合乎情理。但对于一个旨在尽可能多地学习不同生物过程的模型而言,Basecamp 认为这是一种局限,因为许多其他生命形式几乎没有出现在数据中。Lorenz 在该公司云服务合作伙伴 Microsoft 的一则案例研究中表示:“如果你只用 1975 年的报纸文章训练一个大语言模型,它会是一个非常、非常糟糕的模型。生物学领域目前的情况差不多就是这样。”

因此,Basecamp 与当地研究合作伙伴共同采集自己的样本,采样地点包括雨林土壤、火山地表以及南极洲近海深海。根据最新的融资公告,该网络目前已覆盖 30 多个国家和全部七大洲。Microsoft 称,共有来自 31 个国家的 208 家机构参与其中。

Lorenz 表示,截至采访时,该数据集包含约 15 万亿个 token。这已经与用于训练 Claude 或 GPT 等模型的文本数据集处于同一量级。不过在这里,一个 token 是一个 DNA 基本单元。AI 并不像聊天机器人那样处理单词,而是处理描述遗传物质的字符串。

据 Microsoft 称,第一代 EDEN 使用来自逾 100 万个新测序物种的 9.7 万亿个 DNA 基本单元进行训练。Basecamp 与 Microsoft 研究人员在 Azure 上完成了训练,据称其计算量与 GPT-4 相当。不过,OpenAI 从未正式披露过 GPT-4 的这一数据。

未来一年半内,该数据集预计将扩大约 100 倍,token 数量超过 1000 万亿。为此提供框架的是今年 3 月宣布的 Trillion Gene Atlas(万亿基因图谱)项目。Basecamp、Anthropic、Nvidia、PacBio 和 Ultima Genomics 计划通过该项目汇集规模达一万亿个基因的遗传数据。

在最新的融资公告中,Basecamp 已将 Trillion Gene Atlas 称为其 EDEN 模型的训练基础,但没有说明这项扩展计划目前进展到了什么程度。

细菌军备竞赛为新药提供蓝图

Lorenz 认为,驱动所有生物过程的进化,是连接环境样本与医学的纽带。无论是温泉中的细菌适应高温,还是癌细胞扩散,背后都有相似的选择压力在起作用。人类、哺乳动物以及几乎所有脊椎动物的基因组大多已经完成测序,而其余生物多样性却几乎尚未被编目。许多药物最初也源自植物、细菌和真菌。

他以相互竞争的微生物为例,具体说明了这一点。他说,一些效力最强的治疗分子来自生物之间的“生物战争”。当某种细菌试图主导一个生态系统时,有时会产生能够抑制或杀死竞争物种的物质,从而为自己争取食物和栖息地。这种情况在地球上无数地方发生了数十亿次,尤其是在营养物质匮乏的环境中。在医学上,这类物质可以用作抗生素。

在 Microsoft 的案例研究中,Lorenz 还以噬菌体为例。这些病毒会感染细菌,并将自身 DNA 注入细胞。这种来回攻防催生了可用于基因编辑的工具。

Basecamp 希望从这些通过进化形成的各种解决方案中学习。这些模型的目的不只是重新发现已知化合物,而是要根据学到的模式设计新的候选物。

为此,该公司在采集遗传物质的同时,还会记录每个地点的化学、物理和生态条件。它也特别关注连续的长片段 DNA。这些片段可以显示哪些基因彼此相邻,并可能协同发挥作用。短小、孤立的片段往往会丢失这类上下文信息。

AI 设计的抗生素通过首次动物试验

Lorenz 将 EDEN 设计的抗生素视为其医疗价值的早期证明。他说:“我们把一种病原体作为提示条件输入模型,然后模型会设计出一种能够杀死它的抗生素。”

在一篇尚未经过同行评审、介绍 EDEN 模型家族的研究论文中,作者报告了对一小组经过筛选的抗菌肽所做的研究。抗菌肽是能够攻击细菌的短蛋白质链。论文称,接受测试的候选物中有 97% 在实验室中表现出活性。

不过,这一比例只适用于经过筛选并接受测试的候选物,并不意味着模型设计的任何候选物都能达到这一水平。Basecamp 表示,其研究并未止步于试管实验。

该公司今年 6 月发布的一份公告介绍了对一种名为 EDEN-7 的候选物所做的测试。据称,在感染多重耐药细菌的小鼠体内,它的效果与一种最后防线抗生素大致相当;这类药物通常只用于难以治疗的感染。

Basecamp 表示,这一候选物由模型直接生成,在测试前没有经过多轮调整。相关工作由 Basecamp 与 University of Pennsylvania 的研究人员合作完成,研究团队由 Cesar de la Fuente 领导。

Lorenz 非常看重从设计走向实验的这一步。他表示,Basecamp 所做的不只是收集数据和训练模型,真正重要的是这些分子实际上是否有效。

据 Microsoft 介绍,除抗生素和下文所述的插入工具外,Basecamp 还让 EDEN 生成了一个由大约 9,000 种细菌构成的合成肠道微生物组。为了验证结果,团队邀请了 UC Berkeley 的微生物组研究员 Jill Banfield。她制定了严格的标准,如今也是相关论文的共同作者。Lorenz 说:“请一位持怀疑态度的人类来检验,而不只是询问 AI,是件好事。”

Basecamp 的治疗方案押注于在人体内插入基因

在自身的治疗研究中,Basecamp 目前以另一种方式使用 EDEN。该模型被用于设计生物工具,以便在人体基因组的指定位置插入较长的 DNA 片段。

这些工具包括大型丝氨酸重组酶,即能够重新连接 DNA 的酶。Basecamp 希望对它们进行设计,使其能在精确位置将具有治疗作用的遗传信息插入细胞。

这种方法针对的是基因治疗中的一个核心问题:许多遗传性疾病在不同患者身上由不同的突变引起。与其逐一修复每种突变,这些酶可以直接插入一份健康的基因拷贝,而不受具体突变类型的影响。这些插入工具同样源自噬菌体与细菌之间的对抗,但必须经过重新编程,才能在人类基因组中发挥作用。

在 EDEN 论文中,作者报告称,他们针对所研究的每一个疾病相关靶区,都找到了数个有效的候选酶。生成的丝氨酸重组酶中,有一半能在人类细胞中发挥作用。

一种可能的用途是 CAR-T 细胞,即经过基因改造、能够识别并攻击癌细胞的免疫细胞。Basecamp 在今年 1 月的一份公告中表示,以这种方式改造的原代人 T 细胞,也就是直接取自供体的免疫细胞,在实验室中清除了超过 90% 的肿瘤细胞。

获得新一轮融资后,该公司希望将这种方法开发成一种可直接在人体内发挥作用的疗法。这将简化细胞疗法复杂的生产流程;根据融资公告,目前这类疗法每名患者的费用可能高达数十万美元。

不过,一项基因编辑技术即使在实验室中有效,也无法回答如何将所需组分安全地递送至人体内正确细胞的问题。Arc Institute 联合创始人 Patrick Hsu 在《金融时报》2025 年 5 月的一篇报道中提出了这一点。他指出,递送、潜在毒性作用以及细胞的防御反应仍是尚未解决的挑战。

从长远来看,该公司希望将抗生素设计背后的原理推广到一般疾病领域。Lorenz 对 Microsoft 表示:“我们的目标是让生物学变得可编程。你输入一种疾病,系统就会生成一种能够应对它的分子。”他承认,公司距离这一目标仍然很远。“这些分子非常出色,它们具有活性,而且确实有效。但要让它们进入临床,还有大量工作需要完成。”

Basecamp 在其网站上公布的治疗管线显示,前路依然漫长。截至 2026 年 9 月,该公司的 6 个项目均未进入先导化合物优化之后的阶段;在这一阶段,有潜力的候选方案会得到进一步改进。下一步是临床前研究,这是申请开展人体试验前必须完成的环节,之后才是临床试验。

其中 4 个项目正处于先导化合物优化阶段,包括用于血癌和一种未披露名称的自身免疫性疾病的体内 CAR-T 细胞疗法、针对遗传性代谢疾病苯丙酮尿症(PKU)的肝脏基因疗法,以及用于对抗耐药病原体的抗菌肽。所有细胞和基因治疗项目都依赖大型丝氨酸重组酶。针对实体瘤的 CAR-T 疗法和用于治疗糖尿病的肽类药物仍处于早期研究阶段。

这份概览并未说明哪个项目将率先进入人体试验,也未说明具体时间。对于这些问题,以及临床前研究结果、相关结果是否经过独立审查、与其他 AI 系统的对比数据,Basecamp 最初并未回答 THE DECODER 的询问。该公司表示稍后会作出回应。

为什么 Basecamp 将三分之一的 GPU 用于强化学习

对 Lorenz 而言,来自自然界的数据是一项基础,而不是医学实验的替代品。在位于波士顿的实验室里,Basecamp 开展的工作包括利用人类免疫细胞的一种——T 细胞——进行实验,并从中生成数据。

这些实验不会产生数十亿个 token,通常只能得到数百至数千个数据点。作为回报,它们能够回答一些范围明确的问题,例如某种基因改变能否在特定细胞类型中发挥作用。

Basecamp 希望利用这些结果,将一个已经过广泛训练的模型引导至特定任务。这包括使用精选样本进行额外轮次的训练,也包括强化学习,即根据模型输出所得的评分对其进行调整。

“目前,我们三分之一的 GPU 都预留给了强化学习实验。”Lorenz 说。他指的是该公司用于训练模型的图形处理器。

他没有透露这些实验迄今带来了哪些可衡量的提升。但 Basecamp 分配算力的方式表明,该公司并不只押注于不断为预训练提供越来越多的数据。强化学习推动了 GPT-6 等语言模型近期的许多性能提升。

Basecamp 还希望拓宽数据本身的范围。据 Lorenz 介绍,第一代 EDEN 模型家族是纯 DNA 模型。DNA 编码蛋白质,而蛋白质又会折叠成特定结构。这意味着,DNA 模型已经能够捕捉到许多原本需要单独的蛋白质模型或结构模型才能获取的信号。下一代模型预计将处理更复杂、更贴近临床的任务,例如前文提到的安全性和毒理学评估,并处理 DNA 序列以外的其他类型数据。Lorenz 不愿透露具体是哪些数据。

更高的基准测试分数并不意味着更好的分子

“[我们]收集的数据越多,我就越觉得还需要收集更多数据。”Lorenz 说。迄今为止,Basecamp 的数据集规模每年大约增长十倍。他表示,每次进行新的训练时,团队都会看到“性能提升,但从未出现性能平台期”。

Lorenz 表示,数据质量同样重要。Basecamp 在样本处理上投入了大量精力,涵盖从提取、测序到组装的全过程。在过去六个月里,该公司以自有数据和公开数据分别训练了相同的模型架构,除此之外的条件均保持一致。自有数据产生了更陡峭的扩展曲线。对于小型模型,二者差距很小;随着模型规模增大,差距也随之扩大。

Lorenz 使用困惑度来衡量这一点,该指标反映模型预测序列中下一个字符的能力,数值越低越好。他表示,要达到 2 的困惑度,使用 Basecamp 的数据可以节省数十万至数百万 GPU 小时。若要达到 1.5 的困惑度,外推结果显示,两者的差距将达到数十亿 GPU 小时。这个数字是预测值,而非实测结果。

Lorenz 表示,语言模型中已知的扩展定律,其基本原则同样适用于生物学。不过,不同类型模型的具体比例有所不同,例如 DNA 模型与蛋白质模型之间就存在差异。

与此同时,他警告不要只依赖技术指标。Basecamp 比较了多种模型架构,其中包括 Arc Institute 的 Evo 模型所采用的 StripedHyena 架构,以及 Llama。StripedHyena 有时能达到更低的困惑度,但在随后的生物学任务中,Llama 表现得更好。

Lorenz 表示,这正是 Basecamp 选择 Llama 的原因。该公司还会定期检查训练过程中的检查点,以评估模型处理生物学任务的能力。他以预测某种分子可能引发的免疫反应为例,说明有些能力只有随着模型规模扩大才会明显显现。这种能力在最小的 EDEN 变体中较弱。他没有透露具体数据。

“不是要夸大 AI 能做什么或不能做什么,而是直接开展实验,弄清楚它究竟能做什么,”Lorenz 说。哪些特性会随着规模扩大而涌现,往往也会令团队自己感到意外。

目前,合成训练数据的优先级较低。Lorenz 表示,合成数据只会在已知的序列空间区域中增加更多数据点,并不能开辟新的区域。Basecamp 主要希望捕捉此前无人见过的生物多样性。在内部测试中,使用合成数据训练的模型有时能够生成可正常发挥作用的蛋白质,但始终无法真正泛化到新任务。

聊天机器人成为生物模型的入口

运行生物模型不应再只是专业人士才能完成的工作。Basecamp 已通过 Claude 和 Claude Science,开放了 EDEN 中部分用于抗生素设计和筛选潜在疫苗靶点的功能。

研究人员可以用自然语言描述自己的任务。随后,Claude 会调用 EDEN,例如提出值得进一步研究的候选对象。对于疫苗而言,首先要解决的问题是:病原体的哪些部分可以作为诱发保护性免疫反应的靶点。

Lorenz 表示,Basecamp 不会公开发布这些模型。他给出的理由是安全方面的担忧以及与数据合作伙伴之间的协议,并认为两者密切相关。与用途无人能够追踪的开源模型相比,许多合作伙伴更倾向于选择一种能让他们从商业使用中获得分成的模型。相比之下,Arc Institute 公开发布了其 Evo 模型,但在训练数据中排除了病原体数据。

除采取其他措施外,Basecamp 还会从训练材料中移除某些病毒数据,并将生成的序列与已知病原体数据库进行比对筛查。这些措施旨在降低被滥用的风险。不过,这并不能证明它们可以完全阻止模型生成有问题的输出。

谁应因大自然的数据而获得报酬,仍有待讨论

这项数据战略还取决于各国及当地机构是否愿意与 Basecamp 合作。Lorenz 表示,未经土地所有者以及地方和国家政府事先知情同意,该公司不会开始采样。

“EDEN 预训练所使用的每一个 token,我们都能追溯到确切的地理位置,以及对方实际给予我们的同意,”他说。

合作伙伴不应等到一种药物可能在数年后上市才能从中受益。Lorenz 提到,公司会雇用当地科学家,并投资测序技术和实验室,以建设当地的“生物经济”。BaseData 论文还介绍了许可费的分配方式,即根据训练所用数据中各合作伙伴所占的份额进行分成。

根据该论文,截至 2024 年底,Basecamp 已向 19 个国家的 52 个受益方支付款项。最快的一次,从采样到首次付款间隔了九个月。

Lorenz 曾在学术界使用开放数据库。他并不认为这种模式可以替代公共数据,而是将其视为一套并行体系。他表示,知情同意和利益分享能够建立信任,从而让合作伙伴有理由将数据收集规模扩大到满足 Basecamp 模型需求的水平。

但这种利益分配是否足够,仍存在争议。《金融时报》2025 年报道称,相关款项相当于营收的 1%。研究员 Jim Thomas 对该报表示,他赞赏这些数据具有可追溯性,但批评支付金额过低。他认为,这些数据也推高了公司的估值,但数据来源社区并未从中获得公平的份额。

喀麦隆环境部的 Aurelie Dingom 也表示,提高分配比例才更公平。Basecamp 的创始人则向该报指出,合同中设有保障条款,并表示建立长期合作关系符合公司自身的商业利益。

Basecamp 现已另获 1.4 亿美元,用于推进医疗开发的下一阶段。迄今为止的实验表明,EDEN 能够设计出具有生物活性的候选物。接下来的研究必须证明,这些候选物能否转化为安全、有效且更易制造的治疗方法。

来源与参考

  1. 原始链接
  2. Inside Basecamp Research, the AI startup turning evolution into training data

收录于 2026-09-24