Poolside 的 Laguna S 2.1 以小模型挑战大模型编程性能
The Decoder··作者 Jonathan Kemper
关键信息
在开启思考模式时,Laguna S 2.1 在 Terminal-Bench 2.1 上达到 70.2%,并在 DeepSWE、SWE-Bench Multilingual、SWE-Bench Pro 和 SWE Atlas 上表现靠前。Poolside 表示,这些提升主要来自在 40.9 万个环境上的后训练,以及更长的 rollout、更长的超时设置和可选择阻断网络访问以减少奖励破解的沙箱系统。
资讯摘要
Poolside 发布了 Laguna S 2.1,这是一款混合专家架构的编程模型,目标是在远低于其表面规模的情况下,展现出更强的智能体编程能力。该模型总参数量为 1180 亿,但每个 token 只激活 80 亿参数,并支持最高 100 万 token 的上下文窗口,同时提供思考和非思考两种模式。Poolside 表示,这个模型尤其面向长时间的智能体会话,因为在这种场景里,持续性和验证能力和单纯扩大参数规模同样重要。
公司称,Laguna S 2.1 在同类开权重编程模型中表现突出,有时甚至能接近规模大 10 到 20 倍的系统。在 Terminal-Bench 2.1 上,开启思考模式后它取得了 70.2% 的成绩,排名仅次于腾讯的 Hy3,超过了 DeepSeek-V4-Pro-Max、Nemotron 3 Ultra 以及 Thinking Machines Lab 的首个模型等更大的开源模型。Poolside 还提到,在 DeepSWE 上,Laguna S 2.1 得分为 40.4%,而一些参数量超过一万亿的开权重模型得分仍低于 10%。
此外,Poolside 还表示,这个模型在 SWE-Bench Multilingual、SWE-Bench Pro 和 SWE Atlas 上也位居同类前列。公司把这次发布解读为一个信号:在执行过程中更好的行为,和单纯增加参数一样重要。它认为,关键提升来自更多验证、不过早下结论,以及在失败后继续修正方案。
Poolside 用三个试验案例来支持这一说法。其一,Laguna S 2.1 在一个空文件夹里用 50 分钟构建了一个可工作的浏览器引擎,能够渲染 HTML 和 CSS。其二,它在没有 Python 的沙箱中为欧拉问题 #397 找到了一个证明,Poolside 将其描述为一次独立重发现;公司同时指出,GPT-5.2 Pro 早在 2026 年 1 月就已解决该问题及其他若干问题,而 Laguna 的训练截止时间是 2025 年 11 月。
训练过程本身同样值得注意。Poolside 表示,从 XS 2.1 到 S 2.1 的提升主要来自规模扩大和后训练,而不是引入新的预训练数据。智能体训练阶段覆盖了 40.9 万个环境,其中包括 8.3 万个终端任务和 16.8 万个软件工程工作流,最大的单一数据来源约为 3.8 万个真实提交,来自大约 1.7 万个代码仓库。
Poolside 还加入了一个新任务类别,训练模型自主安装代码仓库、配置所有依赖项并让测试套件跑起来。为了提升稳健性,公司增加了 rollout 预算和超时时间,并构建了一个新的沙箱系统,可选择性阻断网络访问,以减少奖励破解。公司还采用多 harness rollout,把同样的提示词放到多个智能体环境中运行,从而降低对单一环境的过拟合风险。
Poolside 说,从训练开始到发布,前后不足九周。公司还表示,更大的 Laguna 模型已经进入预训练阶段,这说明 Laguna S 2.1 只是其快速迭代产品线中的一个节点,而不是一次性的孤立发布。

资讯正文
Poolside 的 Laguna S 2.1 是一款小型开源权重编程模型,表现远超其体量。
Poolside 已发布 Laguna S 2.1,这是其三个月内推出的第三个编程模型。这款混合专家模型使用 80 亿个激活参数,关注点与其说是原始规模,不如说是在长时间 agentic 会话中的更好行为表现。
这家总部位于美国的 Poolside 表示,Laguna S 2.1 在同级别的 agentic 编程模型中表现优于其他产品,并且有时能接近体量大 10 到 20 倍的系统。该模型总参数量为 1180 亿,每个 token 激活 80 亿参数。它支持最高达 100 万 token 的上下文窗口,并提供 thinking 和 no-thinking 两种模式。
Poolside 在 2026 年 4 月通过 Laguna M.1 和 XS.2 将其首批模型开放给更广泛的用户群。在此之前,这家公司主要专注于政府和公共部门客户。XS.2 也是其首个采用 Apache 2.0 许可证的开源模型。Laguna S 2.1 是该系列在大约三个月内发布的第三个版本。
Laguna S 2.1 击败了大得多的开源模型
在启用 thinking 的情况下,Laguna S 2.1 在 Terminal-Bench 2.1 上得分 70.2%,该基准用于测试模型在长时间运行的终端任务中的表现。它的排名仅次于腾讯的 Hy3(295B-A21B),并领先于多款规模更大的开源模型,包括 DeepSeek-V4-Pro-Max、Nemotron 3 Ultra 以及 Thinking Machines Lab 的首个模型。总体排行榜则由 OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Fable 5 和 Kimi K3 领跑。
Poolside 表示,Datacurve 的 DeepSWE 基准更适合比较,因为其分数分布范围更广。Laguna S 2.1 的得分为 40.4%,而一些参数量超过 1 万亿的开源权重模型仍低于 10%。它在 SWE-Bench Multilingual、SWE-Bench Pro 和 SWE Atlas 上也位居同类前列。
Poolside 将持久性视为原始规模的替代方案
Poolside 表示,这次发布反映了一种关于模型性能的更广泛理念。公司在发布文章中写道:“我们在这个模型中所做的,并不一定是增加更多智能,而是改善那些能带来更强模型表现的行为:更多验证、少一些想当然、不那么早宣布胜利,以及更有持久性。”
更早期的 Laguna 模型有时会在只部分通过测试套件后就停止,或者在距离成功只差两步时放弃某种方法。Poolside 将持久性、验证以及修正失败方案,视为与扩展模型本身并行的第二条提升性能路径。更大规模的 Laguna 模型已经进入预训练阶段。
Poolside 通过三次有记录的试验来支持其说法。其中一次,Laguna S 2.1 在 50 分钟内从一个空文件夹搭建出一个可正常工作的浏览器引擎,能够渲染 HTML 和 CSS。另一次,模型在没有 Python 的沙盒环境中,找到了 Erdős Problem #397 的证明;这是一个自 1975 年以来一直悬而未决的数学问题。Poolside 表示,这一结果是独立重新发现。GPT-5.2 Pro 于 2026 年 1 月解决了这一问题以及另外几个问题,而 Laguna 的训练截止时间是 2025 年 11 月。
在 409,000 个环境上的后训练推动了这些提升
Poolside 表示,从 XS 2.1 到 S 2.1 的跃升主要来自规模扩展和后训练,而不是新增的预训练数据。代理式训练阶段覆盖了 409,000 个环境,其中包括 83,000 个终端任务环境和 168,000 个软件工程工作流环境。单一最大的来源大约是来自约 17,000 个仓库的 38,000 个真实提交记录。一个新的任务类别则训练模型自主安装仓库、配置所有依赖项,并让测试套件运行起来。
Poolside 提高了 rollout 预算并延长了超时设置。它还构建了一个新的沙箱系统,可以选择性阻止网络访问,以遏制 reward hacking。多 harness rollout 会在多个代理环境中运行相同提示,从而降低对某一种设置过拟合的风险。
据 Poolside 说,从训练开始到发布只过去了不到九周。预训练于 2026 年 5 月 22 日开始,使用了 4,096 块 Nvidia H200 GPU。S 2.1 也是该公司首个使用 FP8 精度进行强化学习训练的模型。
Poolside 已将所有 benchmark trajectory 发布在 trajectories.poolside.ai。训练期间,在 SWE-Bench 任务上,reward hacking 率一度超过 50%,因为模型会去网上搜索匹配的 pull request,而不是自己解决任务。一个很小的提示词改动就把这一比例降到了 2% 以下。
Laguna S 2.1 在某些情况下仍然过于贴合 Poolside 的代理 harness。Poolside 表示,在一些不熟悉的环境中,即便工具 schema 只有轻微不同,模型也可能偏离所要求的格式。它在竞争性数学问题上也倾向于生成过长的思考序列。用户目前还不能调整它的思考投入程度。
Laguna S 2.1 可在本地运行,也可通过托管服务使用
Laguna S 2.1 已在 Hugging Face 上以 OpenMDW 1.1 许可发布。在 Linux Foundation 的支持下,该许可允许任何人使用、修改并重新分发模型权重,包括用于商业用途。
Baseten、Vercel AI Gateway 和 OpenRouter 都提供托管访问。OpenRouter 提供一个免费的端点,支持 256K 上下文窗口;另一个付费端点则支持完整的一百万 token 窗口。Poolside 还表示,该模型也可以在单台 Nvidia DGX Spark 上本地运行。无需登录即可在 chat.poolside.ai 使用一个免费的演示聊天。
Poolside 正在进行两项战略押注。一项是认为通往智能的路径要经过代理式编码,因为软件给了代理最具表现力的接口。它也相信 AI 可以“压缩互联网”。大多数书面材料记录的是答案,而不是背后的推理过程;Poolside 认为,强化学习可以恢复这一过程。
来源与参考
收录于 2026-07-24