开放权重搜索智能体进入方法论竞争
AllSpark 同时发布 Iris-mini、Iris-pro 和一套网页图谱数据流程与 SFT-RL 训练方案,为可复现的搜索智能体研究提供了新样本。上下文管理对结果的影响仍需谨慎解读。
AI 日报
AI 的竞争正从单纯提升模型能力,转向构建可复现的智能体工作流、可落地的创作产品和负责任的使用机制。与此同时,研究与行业观点都在提醒我们:工具效果取决于上下文管理、用户训练、现实世界验证以及独立监督,而不仅是基准分数。
Overview
从 18 条资讯中筛选出 4 条
AI 的竞争正从单纯提升模型能力,转向构建可复现的智能体工作流、可落地的创作产品和负责任的使用机制。与此同时,研究与行业观点都在提醒我们:工具效果取决于上下文管理、用户训练、现实世界验证以及独立监督,而不仅是基准分数。
AllSpark 同时发布 Iris-mini、Iris-pro 和一套网页图谱数据流程与 SFT-RL 训练方案,为可复现的搜索智能体研究提供了新样本。上下文管理对结果的影响仍需谨慎解读。
ElevenLabs 将 Music v2.5 扩展到应用和 API,并提供免费与 Pro 使用层级;与此同时,署名、商业许可和禁止模仿现有艺人的规则成为产品核心。
阿姆斯特丹自由大学研究显示,禁用 ChatGPT 的学生表现最差,但培训优势在更大规模复现实验中减弱,说明教育重点应放在核查与负责任使用。
多位 AI 领域领袖至少部分支持对实验室引入独立监督;围绕递归自我改进的稳定性争论,则凸显现实世界验证和速度约束的重要性。
今天的四则新闻共同指向一个转变:AI 正从“模型发布”进入“系统治理与实际部署”阶段。搜索智能体开始展示完整训练流程,音乐模型则通过应用和 API 走向商业使用;教育研究与行业领袖的表态,进一步凸显了培训、监督和问责的重要性。
AllSpark 发布 Iris-mini 与 Iris-pro 两个开放权重网页搜索智能体,分别基于 Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B,均支持 256,000 个词元的上下文窗口。其训练方案交替使用监督微调与强化学习,并通过网页图谱构造需要多步检索和证据连接的问题;团队称,模型在搜索基准以及部分通用工具和办公任务上表现强劲。
关键 caveat 是,论文承认上下文管理会显著影响基准成绩,外部流程的差异可能使比较不完全反映模型本身能力。即便如此,开放权重模型加上较完整的训练方法,仍为研究者复现和改造搜索智能体提供了更具体的起点。
参考: [4266]
ElevenLabs 已通过应用和 API 发布 ElevenMusic Music v2.5,并称其在声音饱满度和乐器自然度上有所提升。在包含 47,885 组对比的盲测中,公司称听众多数情况下更偏好新版本,R&B、Soul、Hip-Hop、Rock 和管弦乐的表现尤其突出。
产品同时展示了 AI 音乐商业化的边界:免费层每天提供 5 次无损下载并要求署名,Pro 层每月提供 400 次;用户保留生成曲目的权利,但商业许可取决于行业和用途。平台禁止模仿现有音乐人,也会阻止基于其他艺人歌曲的曲目下载。
参考: [4267]
阿姆斯特丹自由大学一项持续两年的随机研究发现,禁止使用 ChatGPT 的法学生总体表现最差;获得无指导使用权限或接受 AI 使用培训的学生表现更好。研究任务是修改《欧盟人工智能法案》条款,评估内容、清晰度、比例性和创新性,但在 2025 年扩大样本后,培训组的优势几乎消失。
这项结果支持“教会学生核查和负责任使用”而非简单全面禁用的方向,但研究仅覆盖一门法律课程,不能直接推广到其他学科、年龄群体或考核形式。无指导使用也存在风险:学生可能直接接受听起来更好的建议,并保留误导性或法律上多余的术语。
参考: [4268]
OpenAI 首席执行官 Sam Altman、Elon Musk 和前 DeepMind 首席执行官 Demis Hassabis 至少部分支持 Anthropic 首席执行官 Dario Amodei 关于在 AI 实验室内部引入独立监督的主张。Altman 还表示 OpenAI 今年不会上市,并将安全问题列为原因之一;报道同时指出,公司的财务状况可能也是因素。
另一条争论聚焦递归自我改进。Google 研究员 Peyman Milanfar 认为,自我改进反馈回路未必稳定,可靠进步需要治理、抑制、速度约束以及现实世界证据,而不能只依赖基准测试。两场讨论都说明,开发速度与安全边界仍然无法被单一指标解决。
参考: [4264]
Stories
The Decoder

AllSpark 发布了 Iris-mini 和 Iris-pro 两个开放权重网页搜索智能体,参数规模分别为 350 亿和 3970 亿。配套论文介绍了一套基于网页图谱的数据流程,以及交替进行监督微调和强化学习的训练方法;团队称其在各自规模类别的开放权重智能体中取得了领先结果。
这次发布同时提供了大型智能体模型和较为完整、可复现的训练方案,有助于研究人员训练能够搜索、理解证据并判断何时停止的系统。报告中提到的通用工具使用和办公任务上的能力提升,说明面向搜索的强化学习可能迁移到更广泛的智能体能力。
AllSpark 发布了 Iris-mini 和 Iris-pro,这两个开放权重智能体旨在自主开展网页研究。搜索智能体需要理解问题、选择查询、阅读返回页面、连接不同来源的证据,并判断是否已经收集到足够信息;不过,文章指出,当前领先系统在许多基准测试中仍主要使用搜索来确认预训练阶段已经获得的知识。Iris-mini 拥有 350 亿参数,基于 Qwen3.6-35B-A3B;Iris-pro 拥有 3970 亿参数,基于 Qwen3.5-397B-A17B;两者都支持 256,000 个词元的上下文窗口。它们的训练数据从网页及其外链结构反向构造:系统先从一个种子页面和外链出发,建立术语与关系图,再生成必须沿多个关联步骤推理的问题。
除最终答案外,其他术语都会被改写为同义表述,使问题无法通过简单的文本搜索直接解决;只有那些参考模型在没有工具时无法解决、但使用正确来源后能够解决的问题,才会进入数据集。教师模型会生成包含推理、搜索查询和结果的解决路径,随后经过正确性、重复循环、搜索深度以及逐步质量等多轮筛选。训练过程交替进行监督微调和强化学习,团队将其称为“SFT-RL climbing”,并把每轮中最难且已经解决的任务和效率较高的路径反馈到下一轮。论文报告称,Iris 在多个搜索基准上表现强劲,并且在未直接训练过的通用工具使用和办公任务上也有所提升;同时,团队强调上下文管理可能显著影响不同系统之间的比较。
Iris-mini 基于 Qwen3.6-35B-A3B,Iris-pro 基于 Qwen3.5-397B-A17B,两者都使用 256,000 个词元的上下文窗口,并以不配备辅助智能体或最终验证步骤的单智能体形式进行评测。论文还指出,上下文管理技术可能显著影响基准分数,因此启用外部流程后的结果未必只反映模型本身的能力。
The Decoder

ElevenLabs已通过应用和 API 发布 ElevenMusic 的 Music v2.5,并称生成歌曲的声音更加饱满、自然。免费层每天提供 5 次无损下载,Pro 层每月提供 400 次,同时 Music v2 仍可使用。
此次发布让个人创作者和通过 API 构建音乐工作流的开发者都能更容易使用新的音乐生成模型。其版权、署名和艺人模仿规则也体现出 AI 音乐服务正在商业可用性、版权保护与身份权益之间寻求平衡。
ElevenLabs已通过其应用和 API 为 ElevenMusic 提供 Music v2.5。公司表示,该更新生成的歌曲声音更加饱满,乐器听起来更自然,整体音乐表现也有所增强。在包含 47,885 组对比的盲测中,听众更常选择 v2.5,R&B、Soul、Hip-Hop、Rock 和管弦乐等类型的结果尤其突出。用户保留自己生成曲目的权利,但商业许可会根据所属行业和具体用途而变化。
免费方案每天包含 5 次无损下载,并要求使用者署名;Pro 方案每月包含 400 次下载。ElevenLabs会阻止基于其他艺人歌曲生成的曲目下载,也不允许模仿现有音乐人。ElevenLabs最近与 Universal Music Group 达成授权协议,但公司表示该协议只适用于未来独立开发的产品,并不适用于 Music v2.5;公司称现有 Music 模型使用了经过授权的分轨音频和音乐进行训练,但没有进一步披露数据细节。
在涵盖 47,885 组对比的盲测中,ElevenLabs称听众多数情况下更偏好 v2.5,尤其是在 R&B、Soul、Hip-Hop、Rock 和管弦乐方面。商业使用取决于行业和用途,免费层需要署名,基于其他艺人歌曲的下载会被阻止,也不允许模仿现有音乐人。
The Decoder

阿姆斯特丹自由大学一项持续两年的随机研究发现,被禁止使用ChatGPT的学生总体表现最差,而获得无指导使用权限或接受培训的学生表现更好。实验分别于2024年和2025年进行,参与者人数为66人和164人。
这项发现对课堂全面禁用人工智能的做法提出质疑,并表明在监督下接触人工智能可能比单纯禁止更有教育价值。随着学生越来越熟悉聊天机器人,大学可能需要系统教授人工智能评估、法律责任和伦理使用方法。
阿姆斯特丹自由大学法学教授Thibault Schrepel用两年时间,在他的人工智能法课程中测试不同人工智能政策对学生的影响。学生被随机分为三组:禁止使用ChatGPT的小组、可以获得人工智能修改建议但没有使用指导的小组,以及接受法律提示工程和人工智能输出核查培训的小组。每组由四到五名学生组成,用20分钟修改《欧盟人工智能法案》中的一项条款,评分标准包括实质内容、清晰度、比例性和创新性。禁止使用人工智能的小组通常只进行措辞调整,并且很多小组在10到15分钟后就想不出新的内容,但他们有时会展开更深入的组内讨论。
无指导使用人工智能的小组经常因为建议“听起来更好”就直接接受,且每个小组都保留了至少一个具有误导性或法律上多余的术语。2024年,接受培训的小组表现明显更好,尤其是在要求更高的带回家考试中;但实验在2025年以更大规模重复后,三组之间的差距几乎消失。禁止使用人工智能的小组连续两年排名最后,而无指导小组的成绩略高于禁用小组,这促使Schrepel认为大学应避免全面禁用人工智能,并给教师空间教授负责任的使用方法。
学生以小组形式修改《欧盟人工智能法案》中的条款,评分依据包括实质内容、清晰度、比例性和创新性;接受培训的小组最初优势最大,但这一优势在2025年几乎消失。研究仅在一门法律教育课程中进行,因此结果未必适用于其他学科、年龄群体或考核形式。
The Decoder

OpenAI 首席执行官 Sam Altman、Elon Musk 和前 DeepMind 首席执行官 Demis Hassabis 至少部分支持 Anthropic 首席执行官 Dario Amodei 关于在人工智能实验室内部引入独立监督的主张。Altman 还表示 OpenAI 今年不会上市,理由包括安全问题;与此同时,Google 研究员 Peyman Milanfar 对递归自我改进的相关假设提出了质疑。
多位知名人工智能人士的支持,增强了建立独立于实验室管理层的前沿人工智能审查机制的理由。围绕开发速度和递归自我改进的分歧也表明,人工智能治理争论仍然与风险和系统稳定性等尚未解决的技术问题密切相关。
文章称,多位人工智能领域的重要人物正在逐渐形成共识,认为人工智能实验室内部需要独立监督。OpenAI 首席执行官 Sam Altman 和 Elon Musk 支持放慢人工智能开发的呼声,而前 DeepMind 首席执行官 Demis Hassabis 也至少部分认可 Anthropic 首席执行官 Dario Amodei 的提议。由于这些领导者在人工智能战略、风险判断和开发速度方面存在明显差异,这种共同立场尤其值得关注。Musk 的支持与他多年来公开警告人工智能风险的立场一致。
Altman 还向《财富》表示,OpenAI 今年不会上市,并将安全问题列为原因之一;他此前已在六月向内部传达这一决定。文章同时指出,与 Anthropic 相比,OpenAI 当前的财务状况可能也是推迟上市的原因,两种解释并不矛盾。Google 研究员 Peyman Milanfar 则反驳了递归自我改进必然带来快速加速的观点,认为越来越激进的优化可能扩大系统盲点,并使反馈回路变得不稳定。在他看来,稳定性本身就是速度上限,因为能够可靠改进的系统必须受到控制、保持较慢速度,并以现实世界证据作为边界。
据报道,Altman 已在六月向内部员工传达推迟上市的决定;文章指出,安全担忧和当前财务状况不佳可能同时发挥了作用。Milanfar 认为自我改进反馈回路本身不稳定,因此可靠的进步会受到治理、抑制、速度放缓和边界约束,并且必须依赖现实世界证据,而不能只依赖基准测试。