AI 日报

从预算护栏到科学底座:AI智能体走向可控与可泛化

AI系统正在从单纯追求更高分数,转向更加重视可控性、泛化能力与实际可复用性:自主代理需要硬性支出上限,自我优化的智能体需要防止测试过拟合。与此同时,NASA与IBM将17年月球观测数据汇聚为开放基础模型,展示了基础模型在科学研究中的新路径。

当天导读

从 24 条资讯中筛选出 3 条

AI系统正在从单纯追求更高分数,转向更加重视可控性、泛化能力与实际可复用性:自主代理需要硬性支出上限,自我优化的智能体需要防止测试过拟合。与此同时,NASA与IBM将17年月球观测数据汇聚为开放基础模型,展示了基础模型在科学研究中的新路径。

自主代理需要默认的硬性止损机制

软性预算提醒无法阻止自主服务继续产生费用;达到限额后暂停服务,才能真正限制失控代理带来的经济损失。

智能体优化不能只追求基准分数

RRSI通过限制修改规模、记录失败尝试和拒绝基准专用技巧,试图让自我改进的智能体在未见任务上保持泛化能力。

月球观测数据被转化为开放科研底座

NASA与IBM的开源月球基础模型汇聚17年观测数据,为冰沉积物预测和陨石坑检测等任务提供可复用的预训练系统。

AI可靠性的三重约束正在成形

本期三则故事分别从运行成本、评测泛化和科学数据复用出发,展示AI系统从“能工作”走向“可控、可信、可迁移”。

今日主题:让AI更可靠,也更可复用

本日入选的三则故事共同指向一个转变:AI能力的扩张必须配套新的工程护栏和开放基础设施。对于自主智能体,问题既包括“会不会乱花钱”,也包括“是否只会应付测试”;在科学领域,基础模型则开始承担连接海量观测数据与具体研究任务的角色。

排名速览

1. 自主代理必须默认启用硬性预算上限

按使用量收费的API、云服务和托管资源,应默认提供达到限额后立即暂停服务的硬性预算上限,而不只是发送提醒邮件。随着编码代理和个人代理能够在用户离线时调用付费API、计算和存储资源,硬性上限可以把失控或遭入侵服务的潜在损失限制在可接受范围内。

AWS已推出项目级月度支出上限,Google Cloud也提供类似的Spend Caps功能,但相关能力的开放范围和覆盖服务仍需关注。更合理的默认设置是先保护用户,愿意承担无限支出的用户再主动取消限制。

参考: 4761

2. RRSI试图阻止智能体“记住”测试

Google Cloud AI Research与学术机构提出RRSI,用于优化智能体的提示词、工具、工作流、记忆和控制逻辑,同时抑制其针对评测任务过拟合。该方法限制单次修改规模、逐步缩小编辑预算、记录失败尝试,并拒绝硬编码任务名称、答案等基准专用技巧。

研究团队在八个编程、办公智能体和工程设计基准上测试了方法。报告称,RRSI在未见任务上的表现有所提升,运行时令牌使用量约减少30%;不过其在更多模型、任务和评测环境中的泛化能力仍需验证。

参考: 4762

3. NASA与IBM发布开放月球基础模型

NASA、IBM Research及多所学术机构发布了开源NASA-IBM月球基础模型,主要利用月球勘测轨道飞行器17年的观测数据训练。其数据集SomBench整合四项任务、九台仪器的30多个空间对齐数据层,包含近200万个多模态图块集合,可支持冰沉积物预测、陨石坑检测等任务。

报告称,该模型在极区冰沉积物预测上的误差最多降低22%,粗尺度陨石坑检测效果提升近19%,相较所引用的SwinV2-B基线表现更好。开放模型与数据集降低了月球科学中重复利用大规模、低标注数据的门槛。

参考: 4763

编辑观察

今天的共同信号不是单纯的模型规模竞赛,而是围绕AI系统建立可信的运行条件:在生产环境中控制成本,在评测过程中验证真实泛化,在科研场景中通过开放基础模型提高数据复用率。智能体越自主,预算、评测和数据基础设施就越不能被视为附属功能。

当日精选 8 条

01

Simon Willison

·#ai-agents

自主代理必须默认启用硬性预算上限

Simon Willison认为,按使用量收费的API和服务应默认设置硬性支出上限,达到限额后直接暂停服务,而不是只发送警告邮件。AWS于2026年9月16日推出了项目级月度支出上限,Google Cloud也在7月推出了类似的支出上限功能。

编码代理和个人代理能够自主调用付费API、创建托管应用,或在用户离线时消耗计算和存储资源。默认硬性上限可以限制失控或遭入侵服务造成的经济损失,让按使用量收费的云产品对个人和小团队更加安全。

Simon Willison认为,默认硬性预算上限将成为按使用量收费的服务和API越来越需要提供的产品功能。用户可以设置一个月度金额,达到该金额后,服务商应停止服务并返回错误。与之相反,软性上限只会发送电子邮件提醒,而自主运行的服务可能在用户看到提醒前继续花费数百甚至数千美元。编码代理和个人代理降低了部署软件的门槛,而这些软件可能调用付费API、运行托管应用,或消耗需要付费的存储和计算资源。虽然企业可能担心预算超限会导致应用报错,但Willison认为,大多数用户更愿意接受服务停止,也不愿收到超过1万美元的意外账单。

他特别希望AWS提供这种保护,因为一些人由于担心失控服务造成高额费用,甚至不愿用AWS开展个人项目。AWS在2026年9月16日宣布了项目月度支出上限,项目达到上限后会暂停当月服务,但文档显示该功能当时仍只向有限客户逐步开放。Google Cloud也在7月推出了Spend Caps,可为项目中的特定服务设置月度财务上限。Willison还建议,未来的代理应优先推荐提供真正硬性上限的服务商,并提醒缺乏经验的开发者远离没有上限的服务。

只触发提醒的软性上限无法阻止继续产生费用,而硬性上限会在达到限额后返回错误或暂停项目。AWS的新功能最初仅向一部分客户开放;对于愿意承担无限支出的用户,取消上限应当通过明确的主动选择完成。

查看单篇正文查看原文
02

The Decoder

Google研究人员推出RRSI防止智能体过拟合测试

·#ai-agents

Google研究人员推出RRSI防止智能体过拟合测试

Google Cloud AI Research与多所大学的研究人员提出了RRSI,即“智能体工具框架的正则化递归自我改进”方法,用于优化智能体的提示词、工作流、工具、记忆和控制逻辑,同时避免其记住评测任务。据报告,RRSI在未见任务上的表现有所提升,并比未正则化方法少使用约30%的运行时令牌。

能够自我优化的智能体可能通过专门适应优化过程中使用的任务来提高基准分数,从而使分数无法真实反映其在现实任务中的泛化能力。RRSI有望让自动化智能体工程更加可靠且节省计算资源,但其更广泛的价值仍需在更多模型、任务和评测环境中验证。

现代人工智能智能体通常由一个固定的语言模型和一个工具框架组成,后者决定每一步使用哪些提示词、工具、记忆、工作流和控制逻辑。工具框架会影响智能体是否读取正确文件、能否从错误中恢复,以及能否清晰地交付结果;研究人员认为,近期智能体能力的许多进步来自对这一外围系统的改进。过去,工具框架优化主要依靠人工检查失败运行并手动修补,而较新的方法则让语言模型根据有限测试任务的反馈反复重写工具框架。论文指出,这种过程可能导致智能体记住基准特有的模式,偏爱因偶然因素得分较高的候选方案,并增加不会提升通用能力的额外复杂度。

RRSI通过限制每个候选方案包含的编辑数量、随时间缩小编辑预算、记录既往尝试,以及在进展停滞时探索新的工具框架组件来应对这一问题。它还使用批评器拒绝编码任务名称、答案或其他基准专用技巧的修改;只有能带来可测量性能提升时,系统才接受更高的计算成本,并会删除不再有帮助的组件。研究团队使用保持不变的Claude Opus 4.8模型,在八个基准上进行测试;据报告,RRSI在训练任务上的分数最高提升14.1分,在未见基准上的分数最高提升4.7分,运行时令牌使用量约减少30%,并且在任何未见基准上都没有低于基线。

RRSI限制每次候选修改可以包含的独立编辑数量,并逐步缩小编辑预算、记录失败尝试,在进展停滞时探索尚未修改的工具框架组件,还利用批评器拒绝硬编码任务名称、答案或其他基准专用技巧。研究人员在八个涵盖编程、办公智能体工作和工程设计的基准上进行了测试,整个过程中底层的Claude Opus 4.8模型保持不变。

查看单篇正文查看原文
03

The Decoder

NASA与IBM发布开放月球基础模型

·#ai-ml

NASA与IBM发布开放月球基础模型

NASA与IBM Research及多所学术机构共同发布了开源的NASA-IBM月球基础模型。该模型主要利用月球勘测轨道飞行器17年的观测数据进行训练,数据包含近200万个多模态图块集合,可用于冰沉积物预测和陨石坑检测等任务。

该模型有望让规模庞大但标注稀缺的月球数据更易于重复利用,使研究人员能够用较少标注将同一个预训练系统适配到不同科学任务。它在极区冰沉积物预测上的明显提升,也可能帮助月球资源研究和未来探测任务规划。

NASA与IBM Research发布了面向月球科学的开源NASA-IBM月球基础模型。该项目解决了一个实际问题:NASA积累了极其丰富的月球观测记录,但其中许多数据缺少训练特定机器学习系统所需的标注。研究人员使用SomBench从头训练模型,并称其为目前规模最大的配准多模态月球数据集,包含近200万个图块集合、11种模态和两种空间尺度。约100万个高分辨率图块来自月球勘测轨道飞行器的窄角相机,分辨率约为每像素1米;略低于964,000个多光谱图块来自宽角相机,分辨率为每像素100米。

数据集还加入了GRAIL、Lunar Prospector和日本宇宙航空研究开发机构Kaguya/SELENE任务提供的重力、氢和矿物学信息,总计包含来自四项任务和九台仪器的30多个空间对齐数据层。为减少训练集、验证集和测试集之间的数据泄漏,研究人员按地图区域进行划分,而不是随机分配单个图块。模型在陨石坑检测、极区冰沉积物预测和不规则月海斑块分割测试中达到或超过常见基线以及随机初始化的对照模型,其中冰沉积物预测和粗尺度陨石坑检测的提升最为明显。

训练语料库SomBench整合了来自四项任务、九台仪器的30多个空间对齐数据层,包含约1米和100米两种分辨率的影像。模型将光照几何信息作为显式输入,并通过FlexiViT处理不同图像块大小;据报道,与所引用的SwinV2-B基线相比,它将冰沉积物预测误差最多降低22%,并将粗尺度陨石坑检测效果提升近19%。

查看单篇正文查看原文