OpenAI 公开展示“AI 研究员”雏形
OpenAI 称其内部编码代理已能在人工监督下处理明确研究任务,意味着 AI 正开始参与改造自身研发流程;GPT-6 Astra 还能自主通关《传送门》,强化了智能体化趋势。[4209][4216]
AI 日报
今天的头条显示,AI 竞争已不再只是模型能力之争,而是算力规模、代理化工作流和社会治理的同步拉扯。OpenAI 与 Anthropic 的最新动向强调研发正在被 AI 自我加速,而学校、银行、新闻机构和数据中心则在被迫重写各自的使用规则。
Overview
从 16 条资讯中筛选出 10 条
今天的头条显示,AI 竞争已不再只是模型能力之争,而是算力规模、代理化工作流和社会治理的同步拉扯。OpenAI 与 Anthropic 的最新动向强调研发正在被 AI 自我加速,而学校、银行、新闻机构和数据中心则在被迫重写各自的使用规则。
OpenAI 称其内部编码代理已能在人工监督下处理明确研究任务,意味着 AI 正开始参与改造自身研发流程;GPT-6 Astra 还能自主通关《传送门》,强化了智能体化趋势。[4209][4216]
Anthropic 据报签下最高 5170 亿美元算力合同,并规划自建数据中心,显示前沿竞争已深度转向电力、芯片和基础设施规模。[4210]
内罗毕学术代写市场被 AI 冲击,UBS 则把 AI 技能列为初级岗位要求;一个在失血,一个在设门槛,说明 AI 正同时压缩旧岗位并抬高新岗位预期。[4213][4217]
纽约市限制公立学校八年级及以下使用 AI 工具,而《西雅图时报》和《新闻日报》则起诉 OpenAI 与微软,显示围绕 AI 的制度摩擦正快速增大。[4214][4215]
Lake Mariner 数据中心火灾暴露出警报、灭火与信息披露缺口,提醒行业:AI 扩张带来的不仅是性能提升,还有更高的工业风险与问责压力。[4212]
Insilico 的 rentosertib 在早期试验中出现生物年龄信号,但证据仍属间接;这类结果值得关注,但离“逆转衰老”的结论还很远。[4211]
前沿实验室正在用 AI 加速自身研究,同时以前所未有的速度锁定算力;另一边,教育、就业、版权和基础设施安全都在被迫跟进。今天的信号很清晰:AI 的影响已从产品层扩展到资本开支、组织流程和公共治理。
OpenAI 表示,其内部编码代理已达到“自动化研究实习生”的里程碑,研究人员仍负责设定优先级和评估结果,但代理已经开始处理边界清晰的研究任务。[4209] 与此同时,GPT-6 Astra 被演示为可自主通关《传送门》,进一步展示了长时程智能体在工具调用和状态循环上的能力。[4216]
Anthropic 也在扩大其算力底盘。据报道,该公司在过去 11 个月内签下最高达 5170 亿美元的算力合同,并锁定至少 14.8 吉瓦容量。[4210] 这意味着前沿竞争越来越像一场基础设施与资本的竞赛,而不仅是模型迭代。
Insilico Medicine 报告称,其 AI 设计药物 rentosertib 在一项 42 人的小型 IPF 试验中,除了疾病相关效果外,还在血液蛋白衰老时钟上显示出“更年轻”的信号。[4211] 这是少见的同时触及疾病终点与衰老生物标志的案例,但目前仍只是间接指标,不能证明真正逆转了衰老。
Ars Technica 调查称,纽约州 Lake Mariner 数据中心火灾暴露出应急准备和透明度缺口:现场据称没有可用警报、没有灭火系统,且有消火栓失效。[4212] 这起事件提醒人们,AI 基础设施扩张不仅是算力投资,也带来了更复杂的工业安全与责任链条。
《西雅图时报》和《新闻日报》已起诉 OpenAI 与微软,指控其在训练与输出中侵权使用新闻内容。[4215] 纽约市则宣布,公立学校八年级及以下学生将被禁止使用 AI 工具,显示教育系统正在收紧课堂内 AI 的使用范围。[4214]
就业市场同样在变化:UBS 计划从 2027 年起要求部分初级银行岗位候选人具备 AI 技能,把 AI 素养变成入职门槛。[4217] 而在肯尼亚,ChatGPT 已重创内罗毕学术代写及相关在线零工市场,说明 AI 不只是提升效率,也会直接吞噬依赖文本劳动的收入来源。[4213]
阿里巴巴的 Qwen-Drive 1.0 尝试把三维感知、交通问答和运动规划合并到一个系统中,并将仿真偏离道路率从 24% 降到 12%。[4218] 但其解释并不总是与实际动作一致,提示自动驾驶模型的“会做”和“会说”仍然是两件事。
今天最重要的变化不是某一项单独突破,而是 AI 正在同时向上穿透研发核心、向外扩张到基础设施、向下影响就业,并向监管和版权边界施压。接下来值得关注的,不只是模型是否更强,而是这些系统将由谁训练、部署、约束和承受后果。
Stories
Simon Willison

OpenAI发布了《Research acceleration: The view inside OpenAI》,并同步发表了首席科学家Jakub Pachocki的文章《An Alien Mind》。公司表示,内部编码代理已经达到去年秋天设定的里程碑,即一种在人工指导下处理明确研究任务的“自动化研究实习生”。
这些文章展示了OpenAI如何利用AI加速自身模型研究,这对整个行业都具有战略意义。它们也凸显了递归自我改进的机遇与风险:一方面可能更快推动系统能力提升,另一方面控制与安全问题仍未解决。
OpenAI发布了一篇博客文章,利用内部指标说明编码代理已经在重塑研究人员的日常工作。公司称,它已经达到去年秋天宣布的里程碑:一种“自动化研究实习生”,可以在人工监督下处理边界清晰的研究任务,其中一些任务对有经验的研究员来说也可能需要几天时间。与此同时,首席科学家Jakub Pachocki发表了《An Alien Mind》,讨论递归自我改进以及与AGI相关的进展速度。两篇文章都发布在OpenAI推出GPT-6 Astra后三天。OpenAI把这一步描述为迈向在2028年3月之前构建完整自动化AI研究员的过程。
与此同时,Pachocki也明确警告说,没有实验室已经解决这些系统的控制问题,因此这种进展既令人印象深刻,也带有危险性。公司强调,研究优先级仍由人类设定,结果仍由人类评估,系统何时扩展、暂停或部署也仍由人类决定。根据内部数据,OpenAI研究员按API价格计算的中位数日推理成本已超过600美元,第90百分位超过7000美元。报告还称,自2025年12月以来,中位研究员的token输出增长了124倍,说明代理辅助工作已经大幅增加。
OpenAI表示,人类研究人员仍然负责设定优先级、评估结果,并决定何时扩展、暂停或部署系统。公司没有提供独立验证,但披露称,按API价格计算,OpenAI内部研究员的中位数每天推理成本已超过600美元,第90百分位则超过7000美元。
The Decoder

据《The Information》报道,Anthropic在过去十一个月里签署了最高达5170亿美元的算力合同。自2025年10月以来,该公司还锁定了至少14.8吉瓦的算力,并在规划自建数据中心。
这则报道表明,前沿AI竞争正在越来越多地由基础设施规模决定,而不仅仅是模型质量。它也凸显出领先实验室正在承诺远超当前营收承受范围的电力和算力规模,引发外界对资本密集度和长期可持续性的担忧。
据报道,Anthropic正在以前所未有的速度签署算力协议,前沿AI竞赛也因此进一步升温。根据《The Information》的消息,该公司在短短十一个月内已承诺了最高达5170亿美元的合同。自2025年10月以来,Anthropic又锁定了至少14.8吉瓦的计算能力,外加其原本已有的1到2吉瓦。Anthropic同时还在规划自建数据中心,这表明它希望对支撑模型运行的基础设施拥有更多控制权。《The Information》指出,Anthropic计划中的总容量可能仍低于OpenAI到2030年设定的30吉瓦目标。
不过,Anthropic的许多合同期限延伸到2030年之后,因此两者的容量规划并不能直接横向比较。文章还提到,Anthropic和OpenAI目前都无法仅靠收入来覆盖这些承诺。彭博社报道称,Anthropic的年化收入已超过650亿美元,而OpenAI截至7月已超过400亿美元。值得注意的是,这一消息出现在Anthropic首席执行官Dario Amodei于2026年初警告竞争对手不要过快投资、不要低估风险之后。如今,Anthropic自己也似乎加入了此前曾提醒他人谨慎的这场算力竞赛,而OpenAI首席执行官Sam Altman也在警告neo-cloud提供商的支出存在“不可持续的愚蠢”。
《The Information》称,Anthropic计划中的总容量可能仍低于OpenAI到2030年设定的30吉瓦目标,不过Anthropic的许多合同期限超过了该时间点,因此难以直接比较。Anthropic的年化收入据称已超过650亿美元,而OpenAI截至7月也超过400亿美元,但两家公司都还无法仅靠收入覆盖这些承诺。
The Decoder

Insilico Medicine 表示,其 AI 设计药物 rentosertib 在一项 42 名特发性肺纤维化(IPF)患者的小型试验中,显示出降低生物年龄标志物的迹象。研究人员对血液蛋白数据运行了六个独立的衰老时钟,发现接受治疗的患者在模型看来比安慰剂组更“年轻”,最多相差约六年。
如果这一结果被进一步证实,这将是少见的 AI 设计药物同时影响疾病终点和衰老生物学标志的案例。它可能会进一步推动人们对“AI 加速药物发现”的兴趣,也提示某些疗法也许会影响更广泛的衰老相关通路,而不只是单一疾病。
Insilico Medicine 的 AI 设计药物 rentosertib 因一项新的分析受到关注,因为它似乎不仅能治疗肺病,还可能影响衰老指标。该药最初是为特发性肺纤维化(IPF)开发的,这是一种会让肺组织逐渐瘢痕化、呼吸越来越困难的严重疾病。此前一项 42 人试验显示该药可改善肺功能,研究人员同时保存了血液样本,供后续蛋白分析使用。发表在《Nature Biotechnology》上的新研究重新审视了这些试验数据,并从“生物年龄”的角度进行分析。研究团队对治疗组和安慰剂组的血液蛋白谱运行了六个独立的 AI 衰老时钟。结果是,六个模型都把治疗组判定得比安慰剂组“更年轻”,最明显的变化出现在第 4 周左右,约年轻 3 到 4 岁,其中一个模型甚至显示约 6 岁的差异。
作者和外部专家都强调,这并不表示患者真的生理上变年轻了,而只是血液蛋白模式发生了变化,模型把这种变化解读为更低的生物年龄。Insilico 还将试验样本与英国生物银行(UK Biobank)中超过 55,000 份蛋白谱进行比较,并称该药逆转了其中随年龄变化的蛋白模式。与此同时,评论者提醒,这项研究样本量很小,衰老时钟本身也并不完美,而且尚未在健康人群中验证。公司表示,rentosertib 是通过生成式 AI 发现的:一个系统负责寻找与疾病相关的靶点,另一个系统根据靶点结构生成匹配分子。从靶点到候选药物大约只用了 18 个月,而 rentosertib 目前已经进入 IPF 的 III 期临床试验,也就是上市前最关键的阶段之一。
这款药物也被称为 ISM001-055,是用 Insilico 的 Pharma.AI 系统开发的,靶点是 TNIK,公司的研究将其与 IPF 以及衰老相关效应联系起来。这里报告的“抗衰”信号来自血液生物标志物相关性分析,而不是对健康人群的测试,也不能证明患者真的变年轻了。
Ars Technica AI

Ars Technica 的调查称,6 月纽约萨默塞特尚未完工的 Lake Mariner 数据中心发生火灾,暴露出应急准备和信息透明方面的重大缺口。报道称,消防员到场时发现没有可用警报、没有灭火系统、还有三个消火栓失效,而本应提供给他们的安全文件也据称在火灾中烧毁了。
这篇报道表明,AI 基础设施扩张不仅是增加算力,还会在多公司、多租约和多方融资的复杂结构下带来新的工业安全与问责风险。随着 AI 基础设施规模继续扩大,地方应急部门和监管机构可能越来越难清楚了解社区里到底在建什么。
6 月初,纽约州萨默塞特的 Lake Mariner 数据中心一栋仍未完工的建筑发生火灾。报道指出,这起事故很快暴露出当地消防部门对自己要进入的建筑几乎没有掌握。消防员据称在现场没有发现可用警报、没有灭火系统,而且还有三个消火栓失效。按规定他们本应能够查看的安全资料也据称在火灾中被烧毁,使应急人员失去了关键的化学品信息。
Barker 消防部门负责人 Steve Matisz 表示,他的队员几乎是“摸黑”进去的,并面对大量无法辨认来源的浓黑烟雾。他还说,这是一种很困难的情况,并对“安全资料是在火灾中烧毁”这一说法是否成立表示不确定。文章把这起事件放在一个更大的背景中来审视:Lake Mariner 是一个价值 32 亿美元的 AI 数据中心园区,也是纽约州最大的 AI 基础设施项目之一。该项目位于安大略湖畔的一处前煤矿旧址,拥有和运营关系也很复杂:TeraWulf 拥有并运营数据中心,Fluidstack 将负责运行,Google 持有未来股权并为租赁付款提供担保,而 Anthropic 等 AI 公司对算力的需求也是项目存在的原因之一。
该地点位于安大略湖畔一处前煤矿旧址,是一个 32 亿美元园区的一部分,被描述为纽约州最大的 AI 数据中心建设项目之一。TeraWulf 拥有并运营该设施,但土地租给了与其 CEO 有关联的公司;Fluidstack 预计负责运营;Google 持有未来 14% 股权的认股权证并为 Fluidstack 的租赁付款提供担保;Anthropic 也是该设施要服务的 AI 客户之一。
The Decoder

文章称,ChatGPT 及相关 AI 工具已大幅削弱内罗毕学术代写行业的需求,这个行业曾为美国和英国的学生撰写论文和课程作业。报道还指出,肯尼亚其他在线零工岗位,如转录、数据标注和内容审核,也出现了类似下滑。
这是一个 AI 挤压全球零工经济真实收入的具体案例,而不只是改变软件工作流程。它表明,随着 AI 工具变得更便宜、更易用,许多国家依赖低利润、文本密集型的在线工作可能尤其脆弱。
文章讲述了 ChatGPT 如何在内罗毕几乎摧毁了一个庞大的学术代写产业。多年来,成千上万的肯尼亚人为美国和英国大学的学生撰写论文和课程作业,涉及医学、计算机科学、工程等要求很高的领域。文中提到,一些人甚至会使用客户的大学账号进入提交系统。研究人员称,这个行业在本世纪初达到高峰时,仅内罗毕就至少有 40,000 名从业者。资深写手 Teresios Bundi 说,他在 12 年里写了超过 2,500 篇文章,后来每篇收费 40 到 70 美元。自从 ChatGPT 于 2022 年推出后,订单和价格都迅速崩塌。
文章还指出,这种冲击并不只发生在代写行业,肯尼亚的转录、数据标注以及为 Meta 提供的内容审核工作也同样萎缩。肯尼亚政府自 2016 年起有意推动在线零工经济,而 Samasource 等公司也帮助建立了 AI 数据标注业务,但如今这个生态系统也承受着来自其所服务的 AI 工具的反噬。由于肯尼亚约 80% 的就业属于非正规就业,这种变化的影响远不止于一个细分行业。剩下的一些工人被称为“humanizers”,他们负责改写 AI 生成的文本,以避开查重系统。牛津大学教授 Mark Graham 被引述认为,类似的冲击还会在全球范围内出现,而 Bundi 则警告说,AI 还会继续进入更多职业。
文中引用的研究人员估计,这一行业在本 दशक早些时候的高峰期,仅内罗毕就至少有 40,000 人从业。肯尼亚自 2016 年起就推动在线零工经济,Samasource 等公司也帮助建立了 AI 数据标注能力,但 2022 年后需求变化使一些工人转而改写 AI 文本,以躲避查重检测。
The Decoder

纽约市教育局宣布,从新学年开始,公立学校八年级及以下学生将被禁止使用AI工具。该政策还禁止所有年级使用“陪伴型聊天机器人”,但教师仍可使用AI进行备课,不能用于评分。
这项政策来自美国最大学区之一,影响大约60万名学生,因此具有很强的示范效应。它表明,即使学校仍在讨论AI教育如何落地,教育管理者也在主动收紧课堂中的AI使用范围。
纽约市已决定禁止公立学校在初中结束之前使用AI工具,影响约60万名学生。根据教育局的说法,从新学年开始,八年级及以下学生将不能在学校使用AI工具。该政策还在所有年级全面禁止所谓的“陪伴型聊天机器人”。此外,教育局规定三年级及以下不得使用个人屏幕,初中生每天的屏幕时间也不应超过45分钟。教师仍可使用AI来准备课程,但不能用来评分。
市长Zohran Mamdani表示,科技行业试图把AI教育描绘成一种不可避免的趋势,但纽约市并不接受这种说法。包括Parents for AI Caution在内的一些家长组织认为现行规则还不够严格,希望在课堂中全面暂停AI两年。他们担心孩子会把思考过程交给软件,从而失去独立思考能力。文章还提到,英国研究人员最近把这种现象称为“认知让渡”。为制定后续政策,纽约市将成立一个由教师、政界人士、专家和工会代表组成的工作组,并计划在2027年4月前提交报告。
这项规定对低龄学生更严格:三年级及以下禁止使用个人屏幕,初中生则建议每天屏幕时间不超过45分钟。纽约市还将成立由教师、政界人士、专家和工会代表组成的工作组,并在2027年4月前提交报告,为后续AI政策提供依据。
The Verge AI

《西雅图时报》和《新闻日报》已对 OpenAI 和微软提起版权侵权诉讼,指控两家公司未经许可将其新闻内容用于训练 AI 模型,并在聊天机器人回复中复现其报道片段。诉讼还要求销毁任何包含这些作品的复制件、训练数据集以及 AI 模型。
这起诉讼加入了针对 AI 训练数据的一系列出版商法律行动,表明大型新闻机构正在质疑生成式 AI 系统的构建和商业化方式。此案可能影响 AI 公司获取训练数据的方式,以及出版商如何保护订阅收入和对报道内容的控制权。
《西雅图时报》和《新闻日报》已加入不断扩大的出版商行列,起诉 OpenAI 涉嫌版权侵权。两家媒体称,OpenAI 未经许可将其新闻内容用作训练数据,而且其系统在回应用户提问时,可能会复现其报道中的段落。诉状还将微软列为被告,因为 Copilot 是基于 OpenAI 的技术构建的。两家报纸表示,这种做法与《纽约时报》、Ziff Davis、Merriam-Webster 和《大英百科全书》此前对 OpenAI 提起的诉讼类似。
它们还指出,近 400 家地方报纸也已就类似指控起诉这两家公司,显示这一争议正在扩大。出版商认为,AI 聊天机器人会让读者无需访问新闻网站就能获取信息,从而影响订阅收入。作为诉讼请求的一部分,《西雅图时报》和《新闻日报》要求销毁其作品的所有副本,以及任何包含这些作品的训练数据集和 AI 模型。OpenAI 和微软截至目前未立即对此案发表评论。
这起诉讼同时点名微软,因为 Copilot 基于 OpenAI 的技术,争议因此不只针对 OpenAI。两家报纸认为,聊天机器人直接给出答案会减少用户访问其网站,从而损害有价值的订阅收入。
The Decoder

开发者 cozyblaze 发帖称,GPT-6 Astra 在最初设定目标后,完全无需人工帮助就从头到尾通关了《传送门》。这次运行大约耗时 23 小时 43 分钟,并最终进入了制作人员名单。
这个演示展示了更具智能体特征的游戏玩法:模型可以在很长时间跨度内反复观察、推理并采取行动,而不是只回答一次提示。对于 AI 智能体来说,这很重要,因为它暗示了工具调用和控制循环可能支持比游戏更复杂的自主任务。
根据开发者 cozyblaze 的说法,GPT-6 Astra 在只给出最初目标之后,就自主完成了整部《传送门》的通关过程。整次运行大约持续了 23 小时 43 分钟,最终以进入制作人员名单而结束。该方案使用了 MCP 以及修改过的 SourcePauseTool:模型在思考时会先暂停游戏,等它选好下一步输入后再继续执行。每次暂停期间,智能体都能看到截图、玩家位置和镜头角度,从而获得继续推进所需的状态信息。
公开视频把这些暂停片段剪掉了,因此看起来并不能直接反映真实的实时思考—执行过程。cozyblaze 还表示,如果按 Astra 的标价计算,这次运行的 token 成本至少是 570 美元,不过实际是通过 200 美元的 Codex 订阅完成的。cozyblaze 还把这次演示与 OpenAI 在 2016 年提出的、希望用单一智能体解决多种游戏的目标联系起来,认为这次通关算是对那个愿景的一次小小预演。整体来看,这更像是一段令人印象深刻的单次演示,而不是正式的基准测试结果。
该智能体通过 MCP 和修改版 SourcePauseTool 控制《传送门》,在思考时暂停游戏,然后根据截图、玩家位置和镜头角度选择输入,再继续运行。按 Astra 的标价计算,这次运行的 token 成本至少为 570 美元,不过 cozyblaze 表示实际使用的是 200 美元的 Codex 订阅。
The Decoder

据《金融时报》报道,瑞银将要求从2027年开始进入全球银行与市场部门的应届毕业生和实习生证明自己具备AI技能。面试中也会询问候选人如何使用AI,而且这一要求还会扩展到一些新发布的岗位。
这表明在金融行业的部分岗位上,AI素养正从加分项变成基础招聘门槛,尤其是初级职位。若更多大型银行跟进,入门级投行岗位的招聘与培训方式都可能被重塑,因为自动化正在接管更多重复性工作。
据报道,瑞银正在把“会用AI”作为初级银行岗位招聘流程中的一项硬性要求。根据《金融时报》的消息,这一要求将适用于2027年开始申请瑞银全球银行与市场部门应届生项目和实习项目的人选,面试中也会被问到他们如何使用AI。瑞银还表示,这一标准也会延伸到一些新发布的岗位。这样一来,瑞银就成为少数几家把AI技能正式列为入职条件的大型银行之一。此举反映出银行业的一个更大趋势:金融分析、研究和客户演示等原本由初级员工承担的重复性工作,正在被越来越多地自动化。
瑞银表示,AI技能是对学术能力和社交能力的补充,而不是替代。报道还提到,西班牙桑坦德也在部分培训项目中寻找更高级的AI使用者,摩根士丹利分析师则预计未来五年欧洲银行业将有超过20万个岗位消失。摩根大通欧洲负责人Conor Hillery此前也警告说,初级员工不能丢掉基本功。瑞银还在测试用于客户演示的分析师虚拟形象,说明该行正在积极试验AI辅助工作流。
瑞银表示,AI技能是对学术能力和社交能力的补充,而不是替代,这说明银行仍然重视传统的银行从业素质。此举发生在银行正逐步自动化金融分析、研究和客户演示等初级工作之际,而且瑞银还在测试用于客户演示的分析师虚拟形象。
The Decoder

阿里巴巴的 Qwen-Drive 1.0 是一个用于自动驾驶的视觉语言模型,把三维感知、交通问答和运动规划整合到一个系统中。文章称,重新训练后,仿真中的偏离道路率从 24% 降到 12%,但模型给出的解释并不总是与实际动作一致。
这项工作指向一种可以同时支持车载助手和驾驶系统的单一模型,这对汽车走向共享计算平台很重要。它也凸显了自动驾驶 AI 的一个核心问题:性能提升并不等于模型能够解释或真正理解自己的决策。
阿里巴巴研究部门推出了 Qwen-Drive 1.0,作为迈向统一自动驾驶模型的初步尝试,目标是同时处理感知、交通问答和路线规划。该系统基于 Qwen3.5-4B 构建,并没有用专门的驾驶模型完全替代底座模型的通用能力,而是在其上增加了两个专用模块。第一个模块通过识别三维空间中的物体、判断占用区域并勾画道路布局,生成鸟瞰式的空间表示。第二个模块名为 Planning Expert,它利用模型内部信号来规划车辆未来的运动。研究人员把这个鸟瞰模块不仅当作地图生成器,也当作一个测量工具,用来观察模型究竟从图像中提取了多少空间信息。
实验表明,仅训练新增模块会让空间精度仍然很低,这说明会描述图像并不等于真正理解三维空间。只有把视觉语言模型本身也纳入空间任务训练后,性能才会显著提升。训练流程是分阶段进行的:先做感知,再做感知加问答,然后做路线规划,最后通过强化学习进一步优化行为。团队还整合了 24 个公开交通场景数据集,并借助另一个 AI 模型统一原本不一致的问题和答案格式,同时自己构造了用于解释刹车等动作原因的样本。仿真结果显示,重新训练后的系统将偏离道路的比例从 24% 降到了 12%,但文章也指出一个重要限制:它对刹车等动作给出的解释,并不总是和实际操作一致。
Qwen-Drive 1.0 基于 Qwen3.5-4B,并新增两个模块:一个用于生成鸟瞰式空间地图,另一个 Planning Expert 用于预测未来运动。论文发现,只训练新增模块是不够的;底层视觉语言模型也必须参与空间任务训练,三维理解能力才会显著提升。