代理性能的关键不再只是模型
Nvidia 证明,长链路代理任务中,支架、监督和运行时设计可以把同一模型的表现从可用拉到接近满分。对企业来说,真正决定代理可靠性的,正在从模型参数转向系统工程。
AI 日报
今天的报道共同指向一个更成熟也更现实的 AI 周期:模型能力仍在进步,但真正拉开差距的,越来越是支架、芯片、数据、云服务和企业分发网络。与此同时,地缘政治、监管与安全问题正在把 AI 竞争从产品层面推向供应链和治理层面。
Overview
从 36 条资讯中筛选出 20 条
今天的报道共同指向一个更成熟也更现实的 AI 周期:模型能力仍在进步,但真正拉开差距的,越来越是支架、芯片、数据、云服务和企业分发网络。与此同时,地缘政治、监管与安全问题正在把 AI 竞争从产品层面推向供应链和治理层面。
Nvidia 证明,长链路代理任务中,支架、监督和运行时设计可以把同一模型的表现从可用拉到接近满分。对企业来说,真正决定代理可靠性的,正在从模型参数转向系统工程。
Waymo 自研芯片、Starcloud 追加融资、Nvidia 传闻中的软件资产交易,以及 Meta 对 Azure 的大规模依赖,共同指向一个事实:AI 竞争已经深入到底层基础设施层面。
OpenAI、Anthropic 都在靠企业收入、API 支出和安全产品争夺增长,说明商业化优势最终要在工作流中验证,而不是在消费端热度里定胜负。
Micro1 的增长说明训练数据需求仍然强劲,而 AWS Marketplace 和 ChatGPT 搜索的变化则表明,谁能被发现、被采购、被引用,同样决定 AI 产品的实际份额。
中国桌面转向 Linux、美国要求盟友选边站,以及深伪防御回归密码和回拨验证,都说明 AI 进入了更强的主权与安全时代。
AI 竞争正在从“谁的模型更强”转向“谁能控制更完整的系统栈”。从代理支架、定制芯片、轨道数据中心,到企业数据留存和供应链站队,今天的头条都在说明:模型只是入口,真正的护城河在模型之外。
Nvidia 的研究把“代理性能由模型决定”这一旧叙事往前推了一步:在长链路任务里,记忆、工具、监督与运行时规则可能比底层模型更关键。对生产级代理而言,这意味着系统工程开始和模型选型同等重要。
轨道计算继续吸引资金,但真正的瓶颈不是概念,而是发射能力。Starcloud 的融资说明投资者仍看好太空 AI 基础设施,但也暴露出火箭运力正在成为核心约束。
DeepSeek 把 Flash 系列扩展到多模态与智能体工作流,重点面向截图、图表和视觉推理任务。若其内部基准结果成立,这将增强其在多模态 AI 竞争中的位置。
Waymo 用定制芯片继续推进自动驾驶栈的垂直整合,目标是更快处理传感器数据并减少对 Nvidia、AMD 的依赖。随着规模扩大,自动驾驶公司越来越像芯片与系统公司,而不只是车辆公司。
如果交易属实,这将说明 Nvidia 不仅在卖算力,也在抢占模型构建工具、团队和工作流控制权。它进一步强化了一个趋势:AI 基础设施的价值正在向软件层和人才层延伸。
数字主权正在进入桌面操作系统层面。对政府和关键基础设施来说,国产 Linux 发行版正在成为降低外部依赖的现实选项。
如果观测准确,ChatGPT Search 的检索展开方式可能正在变化,进而影响 SEO 和生成式引擎优化。对内容发布者来说,这意味着“如何被 AI 找到”正在变成新规则。
这起调查把风投治理带入反垄断视野,可能迫使投资机构重新思考董事会席位配置。它也反映出,当初创公司彼此竞争时,传统 VC 治理惯例可能不再稳妥。
训练数据需求仍在快速放大,尤其是专家参与和合成数据相关业务。数据不再只是配角,而是 AI 竞争的核心供给侧。
Anthropic 正把高能力模型优先投入防御型安全工作流,这也显示企业 AI 的一个重要落点是“自动化审查与修复”,而不是纯聊天体验。
AI 供应链的全球化正在被地缘政治切开。半导体、关键矿产与基础设施的获取,越来越取决于阵营和联盟关系。
即便是平台级玩家,也依然在外部云和模型上投入巨资。AI 竞争正在形成一种悖论:竞争对手彼此既是客户,也是未来的对手。
企业收入和 API 支出数据显示,OpenAI 正在重新追赶 Anthropic。企业采用仍是判断模型公司真实商业势能的关键指标。
这是一则小而典型的生态新闻:核心库依赖变化足以让新安装失效。它再次说明 AI 工具链同样受制于 Python 生态的脆弱传递依赖。
Ramp 数据支持了“企业用户在模型之间切换”的判断。企业 AI 市场依旧高度动态,份额变化比叙事更重要。
ChatGPT 正向更深的个人与工作通信场景渗透,但权限、索引和消息控制也同步抬升了隐私风险。代理化助手开始接触真实沟通链路。
Anthropic 试图在安全审查与客户数据控制权之间重新找平衡。对受监管行业客户来说,这类政策比模型名称更影响采购决策。
OpenAI 继续把图像 API 做成更适合生产流程的工具,直接瞄准电商、演示和设计工作流。图像生成能力正在从“能生成”走向“能直接交付”。
智能体已经开始进入主流云采购渠道,市场从“展示”走向“部署”和“交易”。企业 AI 分发正成为云平台的新战场。
随着深伪越来越逼真,最可靠的防线反而是密码、回拨和流程控制这些低技术手段。对高价值交易而言,组织必须从“看起来像”转向“可验证”。
今天的 AI 新闻说明,真正的竞争焦点已经从单点模型能力转向系统、基础设施、数据和治理的全栈博弈。
Stories
TechCrunch AI

Nvidia发布的研究显示,针对长链路任务,定制化的代理支架并不只是配角,而是能显著提升表现。研究人员通过改造支架并加入一个“监督者”组件,让 Claude Opus 5 在 ARC-AGI-3 上达到 100%,而不使用该支架时只有 30%。
这一结果强化了一个越来越明显的判断:代理性能不仅取决于底层大模型,还高度依赖记忆、工具和监督等外部支架。对于构建生产级代理的团队来说,系统设计在真实长任务中的可靠性上,可能和模型选择同样重要。
Nvidia 在周五发布的新研究指出,对于长链路代理任务来说,包在 AI 模型外面的支架,可能比模型本身更重要。这里说的支架,是指让模型变成代理的那层软件脚手架,包括工具、记忆管理、规则、运行时行为和反馈回路。研究人员用 Claude Opus 5 测试了 ARC-AGI-3 这个交互式推理基准。ARC-AGI-3 由一组没有说明的 2D 游戏组成,要求模型像人类一样自己摸索规则并完成目标。通过一个针对记忆和监督能力进行调整的定制支架,研究团队让 Claude Opus 5 达到了 100% 的成绩,意味着它能像人类一样高效地通关所有游戏。
若不使用这套支架,同一个模型只得到 30%,但这仍然是测试中所有模型里的最高分。Nvidia AI 产品副总裁 Adel El Hallack 对 TechCrunch 表示,代理不应只被理解为模型 API,而应被看作模型加上周边脚手架、工具、运行时和库的整体。研究还加入了一个监督者组件,当代理走偏或陷入死胡同时,它可以把代理拉回正轨,Nvidia 将其类比为一个“CEO”来进行方向纠偏。OpenAI 上个月也有类似发现,只是通过调整支架里的两个设置,就把 ARC-AGI-3 分数提升了三倍,但仍未达到 Nvidia 这次的水平。Nvidia 也强调,这不是一款新产品发布,而是其 Nemo 生态中一系列开源和商业组件的一部分。
ARC-AGI-3 是一个由 2D 游戏组成的交互式推理基准,没有任何说明,100% 的分数意味着代理能像人类一样高效地赢下每个游戏。Nvidia 使用了自己增强版的支架,名为 Agentic Variation Operators(AVO),并表示其中的监督者组件像“CEO”一样,在代理走偏或陷入死胡同时进行纠正。
TechCrunch AI

Starcloud表示,公司在今年3月1.7亿美元A轮融资基础上又追加了2.5亿美元,使估值升至23亿美元。这笔资金将用于扩大制造能力,并推进其最大的轨道数据中心航天器 Starcloud-3,计划搭载 SpaceX 的 Starship 发射。
这轮融资表明,尽管发射安排越来越困难,投资者仍然看好太空AI基础设施的长期价值。它也凸显出轨道计算创业公司的一个关键战略瓶颈:能否按计划获得足够的火箭运力来部署和补充卫星。
Starcloud是一家开发可在轨道上执行AI推理的卫星创业公司,向TechCrunch表示,公司在今年3月1.7亿美元A轮融资之外又追加获得了2.5亿美元资金。新的融资扩展轮使公司估值达到23亿美元,并为其进一步扩张提供了更多现金。首席执行官Philip Johnston说,这笔钱将帮助Starcloud建设更大的制造工厂,并推进公司最大的轨道数据中心航天器 Starcloud-3。Starcloud-3 计划搭载 SpaceX 即将推出的 Starship 火箭发射。
Johnston表示,公司现在融资,是因为它预计未来的发射资源会越来越难以获得。她提到,Starcloud已经向FCC申请运营88,000个航天器的许可。她还指出,由于 SpaceX 计划在2028年结束 Falcon 9 的生产,而 Blue Origin 的 New Glenn、ULA 的 Vulcan 以及 Rocket Lab 的 Neutron 还没有形成稳定的发射节奏,因此发射能力正变得非常紧张。短期内,Starcloud计划在2027年通过拼车发射两颗 8 kW 的 Starcloud-2 计算卫星,其中部分轨道推理服务将面向美国政府客户。
Starcloud已经向FCC申请运营88,000个航天器的许可,Johnston表示,预订发射资源正成为公司最大的成本之一。公司计划在2027年通过拼车发射两颗 8 kW 的 Starcloud-2 卫星,同时也在考虑单独购买 Falcon 9 发射服务并接触其他发射方,以分散运力来源。
The Decoder

DeepSeek发布了V4-Flash-Vision-Exp,这是一款实验性的多模态模型,在DeepSeek-V4-Flash的基础上加入了图像理解能力,同时保留了原有的文本能力。公司称,这个模型在其内部多模态智能体基准测试中表现接近Opus 4.8。
这把DeepSeek的Flash系列扩展到了视觉智能体工作流,而这类工作流对需要读取截图、查看图表并调用工具的助手越来越重要。如果这些基准结果经得起验证,DeepSeek可能会在多模态AI和智能体应用领域更具竞争力。
DeepSeek推出了V4-Flash-Vision-Exp,这是一款实验性的多模态模型,在DeepSeek-V4-Flash的基础上增加了图像处理能力。公司表示,这个版本在保留基础文本模型推理能力和世界知识表现的同时,又加入了视觉理解。DeepSeek称,这个视觉版本在其内部多模态智能体基准测试中表现非常接近Opus 4.8。公司将这款模型定位为面向智能体场景,而不仅仅是通用聊天用途。它被设计为可配合不同的智能体框架使用,并能够描述图片、从截图中提取文字、分析图表。API文档说明它支持JPEG、PNG、GIF和WebP格式,而且会根据上传文件的真实内容识别格式,而不是依赖文件名或声明的MIME类型。
DeepSeek还表示,该模型兼容OpenAI的Chat Completions和Responses API,以及Anthropic的Messages端点,同时Harness框架0.1.1版本已开箱支持该模型。开发者可以通过Base64、最大32 MiB的公开URL,或者新的免费Files API上传图片,后者单文件上限为64 MiB。可选的detail参数可以把图片降到512×512以节省token,而模型会根据长宽比自动把图片归一化到大约800×800。公司称,单次请求最多可包含600张图片,但当请求中的图片数量达到15张或更多时,单边最长尺寸会从8192像素降到4096像素。图片只能放在用户消息中,计费则沿用V4-Flash的价格。
该模型支持JPEG、PNG、GIF和WebP等图片格式,并会根据文件实际内容而不是文件名或声明的MIME类型来识别格式。DeepSeek还表示,每张图片会被归一化到大约800×800像素,单张图片最多消耗384个token,且API单次请求最多可包含600张图片。
The Decoder

Waymo 已经为其机器人出租车开发出一款自研芯片,并且这款芯片已经装进公司最新一代车辆中。该芯片旨在更快处理传感器数据,并运行用于驾驶决策的 AI 模型,从而减少对 Nvidia 和 AMD 的依赖。
这标志着自动驾驶领域更进一步的垂直整合,因为定制芯片可以降低成本,并让 Waymo 更精确地为机器人出租车的工作负载优化算力。它也表明,随着规模扩大,主流自动驾驶玩家可能会越来越少依赖 Nvidia 这类通用现成芯片。
Waymo 是 Alphabet 旗下的自动驾驶出租车业务,据文中援引 Bloomberg 的报道,该公司已经为机器人出租车自研了一款定制芯片。文章指出,这款芯片已经在 Waymo 最新一代车辆中运行。Waymo 表示,这款芯片可以更快地处理传感器数据,并运行让车辆理解周围环境、做出反应的 AI 模型。此前,Waymo 一直依赖 Nvidia 和 AMD 的芯片。
公司称,这款自研芯片的算力超过 1,000 TOPS,并由 TSMC 采用 5 纳米工艺制造。这样的规格使它大致对标当前用于自动驾驶系统的 Nvidia 硬件。Waymo 推出这项方案的主要目的,是在降低成本的同时加强对整套硬件栈的控制。Waymo 还在把这款芯片装入其与 Zeekr 合作打造的新款机器人出租车中。
Waymo 表示,这款芯片的算力超过 1,000 TOPS,并由 TSMC 采用 5 纳米工艺制造。该芯片还将装入 Waymo 与中国制造商 Zeekr 合作打造的新款机器人出租车中。
The Decoder

据 Newcomer 首先报道,Nvidia 据称将支付 60 亿美元,以获得 Poolside 的“Model Factory”许可并吸纳 109 名员工加入团队。该交易还包括对 Poolside 追加 10 亿美元投资,投前估值为 120 亿美元,而且公司的三位创始人将继续留任。
这笔交易表明,Nvidia 正在更深入地布局 AI 模型构建基础设施,而不仅仅是芯片业务,并愿意重金获取基础模型开发所依赖的软件和人才。它也反映出大型科技公司越来越多地通过非传统交易方式获取战略资产,而不一定采取完整收购。
据报道,Nvidia 将支付 60 亿美元,获得 Poolside 的“Model Factory”许可,这套软件系统是这家初创公司用来构建 AI 模型的,同时还会吸纳 109 名员工加入。这个消息最初来自 Newcomer 报道的一封投资者信。被纳入的员工曾参与 Poolside 的 Laguna 模型开发,目前正在收到 Nvidia 的工作邀请。除了许可技术和招募员工之外,Nvidia 还将以 120 亿美元的投前估值,向 Poolside 再投资 10 亿美元。交易完成后,Poolside 的三位创始人将继续留任。
信中将这笔交易描述为“不是收购,也不是人才收购”。这种说法很重要,因为人才收购通常是为了获取团队和技术,同时尽量避免完整收购可能带来的监管审查。Nvidia 自身也在开发 Nemotron 系列开源 AI 模型,这意味着它在某种程度上也在与自己的部分客户竞争。报道还提到,Nvidia 以前也做过类似安排,包括与 Groq 和 Enfabrica 的交易。Poolside 预计会在明年年底前把这 60 亿美元分配给投资者。
据称,这封信写明这“不是收购,也不是人才收购”,尽管 Nvidia 正在许可 Poolside 用来训练模型的系统,并向参与 Laguna 模型的员工发出工作邀请。Poolside 表示,这 60 亿美元将于明年年底前分配给投资者,而 Nvidia 之前也与 Groq 和 Enfabrica 做过类似交易。
ZDNET AI

据彭博社报道,中国一些政府机构被要求用国产 Linux 发行版替换 Windows 10 中国政府版。ZDNET 指出,最可能的替代方案是麒麟操作系统或 UOS。
这表明在敏感政府环境中,数字主权正在直接影响操作系统采购决策。如果这一趋势扩大,可能会加速国产 Linux 生态的采用,并降低公共部门对 Microsoft 的依赖。
ZDNET 报道称,中国正在推动部分政府桌面从 Windows 转向国产 Linux 发行版。该消息援引的是彭博社的一篇报道,报道称这一要求来自中国国家安全部门,涉及一些机构放弃 Windows 10 中国政府版。报道认为,背后的核心原因是数字主权,中国官员对敏感系统中的外国技术表达了更广泛的不信任,并提到了数据安全顾虑。Microsoft 对彭博社表示,并不知晓影响该产品的安全事件,同时该产品仍在接收定期安全更新。
Windows 10 中国政府版由 CMIT 开发,CMIT 是 Microsoft 与中国电子科技集团在 2016 年成立的合资公司,目的是满足中国政府的特殊要求。这个版本包含本地化的激活和更新安排、移除部分消费级服务,并支持中国密码标准。原本该特殊版本的退役时间定在 2027 年 2 月,但现在据报道已提前到 2026 年晚些时候。ZDNET 还指出,最可能的替代者是麒麟操作系统和统信 UOS,这两者都已面向政府、企业和关键基础设施部署。
Windows 10 中国政府版由 CMIT 开发,这是 Microsoft 与中国电子科技集团的合资企业,包含本地化激活和更新安排、移除部分消费级服务,并支持中国密码标准。ZDNET 指出,迁移并不只是更换桌面界面,还需要验证应用、驱动、身份系统、文档格式以及依赖 Windows 的业务软件。
Simon Willison
Promptwatch 表示,其跟踪数据显示,ChatGPT 搜索对 site: 运算符的使用量突然大幅上升,过去数周仅约占 fanout 查询的 0.3% 到 0.5%,到 8 月 8 日则跃升至约 16% 到 17%。这一变化似乎与 OpenAI 本月早些时候的 GPT-5.6 发布同步出现。
如果这一观察准确,说明 ChatGPT 搜索正在改变其查询展开方式,这会直接影响 SEO 和生成式引擎优化策略。更容易被域名定向检索到的网站,可能会在 ChatGPT 的回答中获得更多可见度,而其他站点的流量和引用模式则可能发生变化。
Simon Willison 介绍了一份 Promptwatch 报告,称 ChatGPT 搜索对 site: 运算符的使用规模已经明显扩大。Promptwatch 处在新兴的 GEO,即“生成式引擎优化”市场,相关厂商试图帮助网站在 ChatGPT、Claude 和 Gemini 等聊天工具的回答中获得更多曝光。该公司使用自动化方式跟踪这些产品中的提示词,并以聚合报告的形式发布,作为自身内容营销的一部分。根据其跟踪结果,ChatGPT 搜索 fanout 查询中包含 site: 的比例在过去数周一直维持在 0.3% 到 0.5% 左右,8 月 3 日到 5 日短暂降至约 0.15%,随后在 8 月 8 日跃升到 16% 到 17%。Promptwatch 认为,这个短暂下滑可能对应分阶段发布或预发布实验。
Willison 强调,这些数据只覆盖了 Promptwatch 启用自动化监测的提示词,因此只能视为局部证据。随后他将这一时间点与 OpenAI 在 8 月 6 日的公告联系起来:GPT-5.6 Sol 在 Chat 中被更新,以便对 Plus 和 Pro 用户提供更可靠的事实和更聚焦的回答。Willison 还提到,由于 OpenAI 有意隐藏系统提示,外界很难确认内部搜索行为是否真的发生了变化,但他推测搜索工具更像是使用带域名范围的查询,而不是直接鼓励用户使用可见的 site: 语法。文章最后还引用了 Promptwatch 在 8 月 18 日的另一篇报告,称 ChatGPT 在搜索中引用 Reddit 的可能性似乎大幅下降。
文章强调,Promptwatch 的数据只覆盖其启用了自动化监测的提示词,因此这些数字更像是 संकेत性的,而不是全量统计。文中还指出,ChatGPT 的搜索行为看起来更像采用 search(query, recency, domains) 这样的形式,而不是在界面上直接鼓励用户使用可见的 site: 运算符。
TechCrunch AI

据报道,司法部已经就Andreessen Horowitz可能涉及的反垄断问题调查了近一年,焦点是其合伙人在相互竞争的公司担任董事会席位。调查重点包括Ben Horowitz在Databricks的董事席位,以及Martin Casado在Fivetran的董事席位。
如果监管机构把风投合伙人重叠董事会席位视为《克莱顿法》第8条问题,风投机构可能需要重新思考合伙人如何进入初创公司董事会。这将影响整个风险投资行业的治理惯例,尤其是在被投公司越来越多地进入彼此市场的情况下。
Andreessen Horowitz正因其董事会安排而面临美国司法部据报道的审视,焦点是这些安排是否带来了反垄断问题。争议在于,a16z有两位合伙人分别在如今彼此竞争的公司董事会任职:Ben Horowitz在Databricks,Martin Casado在Fivetran。表面上看,这种安排并不一定显得特别严重,文章也指出,a16z最初投资这些公司时,它们未必已经是直接竞争对手。问题在于,随着初创公司不断扩张,它们的业务边界可能逐渐重叠,原本不存在的冲突会在后来出现。报道称,司法部已经就此调查了近一年。
此次调查据称援引的是《克莱顿法》第8条,这是一项已有112年历史、但很少被用于风险投资领域的反垄断法律。由于监管机构几乎没有把这条规则真正用到风投身上,整个行业都在关注这是否会成为一个更广泛的治理测试案例。在TechCrunch的Equity播客中,Kirsten Korosec、Anthony Ha和Sean O’Kane讨论了这项调查及其对风投机构可能产生的影响。节目还提到了其他行业新闻,包括Stripe据报道以75亿美元收购AI模型路由器OpenRouter、Rivian分拆公司Also融资1.5亿美元、Uber与无人机公司Zipline的新配送合作,以及AI听写应用估值是否已经见顶。
此次被提及的是《克莱顿法》第8条,这是一项已有112年历史的反垄断条款,禁止个人或实体同时在竞争公司董事会任职。文章指出,a16z最初投资这些公司时,它们未必是直接竞争对手,这说明竞争关系可能在投资之后才形成,从而使董事会冲突管理变得更复杂。
TechCrunch AI

四年前成立的 AI 数据初创公司 Micro1 据称在过去八个月里将其年化总收入运行率从 1 亿美元提升到 5 亿美元。该公司在去年 9 月完成 5 亿美元估值的 A 轮融资后,似乎又以更高估值筹集了新一轮资金,不过 TechCrunch 表示这一点尚未得到公司确认。
这一增长表明,专业化 AI 训练数据的需求已经非常强劲,尤其是由医生、律师和科学家等领域专家完成的工作。它也说明,随着 AI 实验室和企业在训练数据基础设施上的投入增加,数据标注赛道有能力容纳多个大型玩家。
来自顶级实验室和大型企业对独特 AI 训练数据的需求,正在推动一批数据标注初创公司的繁荣。Micro1 是这一市场中增长最快的公司之一,据了解该公司情况的人士称,它在过去八个月里将年化总收入运行率从 1 亿美元提升到了 5 亿美元。由于 Micro1 只能保留约 60% 到 70% 的总收入,其净年化运行率大约在 1.5 亿到 2 亿美元之间。即便如此,它仍落后于竞争对手 Mercor 和 Handshake,前者据称今年夏天达到了 20 亿美元的年化总收入,后者则在今年早些时候达到 10 亿美元。文章指出,这一增长说明 AI 训练数据市场足以容纳多个大型玩家。还有研究者认为,未来 AI 在数据上的支出,甚至可能接近在算力上的支出。
Micro1 也在扩大合成数据生成业务,例如自动生成视频内容描述。部分现成数据集可以卖给多个客户,因此这类数据的毛利率据称可达 80% 到 90%。不过,向中国 AI 开发者出售同一批数据也引发了争议。创始人 Ali Ansari 近期在 X 上表示,Micro1 不会向中国模型制造商出售数据,并批评了这样做的竞争对手。Micro1 最初是一家 AI 招聘创业公司,后来 Ansari 发现数据标注客户也在用其平台筛选和招聘标注工程师,于是决定转向数据标注业务。他此前还表示,公司正在通过让数百名普通参与者在家中记录日常物体交互,构建用于机器人预训练的数据集。
Micro1 大约保留其总运行率的 60% 到 70%,这意味着其净年化运行率约为 1.5 亿到 2 亿美元。该公司正越来越多地使用合成数据,包括自动生成视频描述;而且由于部分现成数据集可以卖给多个客户,这类数据的毛利率据称可高达 80% 到 90%。
The Decoder

Anthropic 已将其 Claude Security 扫描器升级为运行在 Claude Mythos 5 上,并向企业客户开放公测。该系统会扫描代码库中的漏洞,给出 CWE 分类和严重程度评级,并提供修复建议,但每个补丁仍需人工批准。
这意味着企业安全流程中将进一步引入 AI 辅助审查,更快发现和修复漏洞有助于降低关键系统风险。它也表明 Anthropic 正把最强模型优先用于防御型网络安全场景,而不是面向大众开放。
Anthropic 正在把 Claude Mythos 5 这款被其称为最强、尤其适合网络安全任务的模型,投入到实际安全工具中。公司的 Claude Security 扫描器现在已经运行在 Mythos 5 上,可以检查代码库中的漏洞。对于发现的每一个问题,工具都会给出 CWE 分类、严重程度评级以及建议修复方案。Anthropic 还强调,所有补丁在真正应用之前都必须经过人工审核。
该扫描器目前以公测形式向企业客户开放,并且按正常的 token 使用量计费。Anthropic 同时也在把 Mythos 5 接入合作伙伴的安全产品,这些产品用于保护医院、公用事业和银行等机构。在这些合作部署中,终端用户不会直接与模型交互,只会看到安全结果,例如补丁建议。Anthropic 表示,一些此前使用 Claude Opus 做安全工具的合作伙伴预计会迁移到 Mythos 5,其他安全厂商也可以申请合作接入。
Anthropic 表示,扫描会按正常的 token 使用量计费,因此该功能像其他模型调用一样收费,而不是单独的安全产品。此次部署还会接入保护医院、公用事业和银行的合作伙伴安全工具,但终端用户只会看到补丁建议等结果,不会直接接触模型本身。
The Decoder

据路透社报道,美国正在起草一封致伙伴国家的信件,要求它们在华盛顿和北京之间就AI竞争选边站。该草案据称写道:“想要同时属于一切,最终就等于什么都不属于”,而加入中国AI倡议的国家可能会被排除在美国主导的 Pax Silica 联盟之外。
这表明AI供应链的地缘政治分裂正在加剧,半导体、关键矿产和AI基础设施的获取可能越来越取决于政治站队。与全球AI开发相关的国家和企业,未来在采购、合作和技术获取方面都可能面临新的限制。
据报道,美国正准备推动一项外交施压行动,要求伙伴国家在美国和中国的AI生态之间做出选择。路透社看到的一份美国国务院草案警告说,国家不可能真正同时站在两个阵营中,并用了“想要同时属于一切,最终就等于什么都不属于”这样的表述。按照这份草案,参与中国AI倡议的国家将无法同时加入美国主导的 Pax Silica 联盟。Pax Silica 是美国去年启动的合作框架,目标是加强AI模型、半导体和关键矿产的供应链安全。目前已有大约二十多个国家以及欧盟签署加入。
报道指出,哈萨克斯坦是目前已知唯一同时参与美国联盟和中国竞争性框架的国家。之所以重要,是因为哈萨克斯坦拥有大量对高科技和AI供应链至关重要的关键矿产储备。这一举动反映出华盛顿与北京正在围绕未来AI系统的标准、基础设施和资源获取展开更广泛的战略竞争。中国驻华盛顿大使馆则批评了美国的这一计划,称其会拖慢全球AI进展,对任何人都没有好处。
美国去年启动了 Pax Silica,旨在保障AI模型、半导体和关键矿产的供应链,目前已有大约二十多个国家以及欧盟加入。哈萨克斯坦似乎是目前唯一同时参与美国联盟和中国竞争性框架的国家,这可能与其重要的关键矿产储备有关。
The Decoder

据彭博社报道,Meta 每年通过微软的 Azure 平台在 AI 服务上花费数亿美元。该公司据称正在使用微软 Azure AI Foundry 市场中的 OpenAI 模型,同时也在构建自己的竞争性 API 服务。
这说明即使是 Meta 这样的 AI 平台公司,也仍然高度依赖外部云端 AI 基础设施,尤其是在模型评测和开发阶段。这也体现了云服务商如何在竞争对手身上获利,而这些竞争对手最终又可能推出与其正面竞争的产品。
据报道,Meta 已经成为微软最大的 AI 客户之一,每年在基于 Azure 的 AI 服务上花费数亿美元。彭博社称,Meta 通过微软的云服务访问 AI 模型,其中包括可在 Microsoft 的 Foundry 市场中使用的 OpenAI 模型。文章指出,Meta 在该平台上每周处理数万亿个 token,说明其模型调用量非常大。Meta 的工程师据称会用这些模型来对照评测自家模型的表现。
与此同时,Meta 也在构建自己的 API 服务,而这项服务未来可能会与微软的 Foundry 形成竞争。文章把这种情况类比为 Meta 过去依赖 Bing 的经历:先使用微软的搜索技术,后来再换成自己的方案。文中还提到,微软的其他大客户也多来自科技行业,包括 ByteDance、Adobe、Perplexity 和 Sierra。尽管如此,微软的 AI 收入仍主要来自 OpenAI,而 OpenAI 主要是通过 Azure 大规模购买算力。
据称,Meta 每周在 Azure 上消耗数万亿个 token,这表明其模型使用规模非常大。文章还指出,微软大部分 AI 收入仍来自 OpenAI,而 Foundry 只占整体业务的一小部分。
The Decoder

据CNBC报道,GPT-5.6 Sol于7月9日上线后,OpenAI本季度收入增长了35%,其中企业收入增幅超过50%。Ramp数据显示,OpenAI第三季度企业API支出增速也超过Anthropic,环比增长82%,而Anthropic为76%。
这些数据表明,在Anthropic一度在收入上领先之后,OpenAI正在企业和API市场重新夺回势头。这很重要,因为企业采用和API使用量是衡量模型厂商是否真正赢得商业工作负载的关键指标,而不仅仅是消费者关注度。
这篇文章描述了OpenAI与Anthropic之间仍在快速变化的竞争局面。随着GPT-5.6 Sol在7月9日发布,OpenAI似乎正在重新找回势头,CNBC报道称其本季度收入增长了35%,企业收入增长超过50%。Ramp数据进一步显示,OpenAI在第三季度的企业API支出增速达到环比82%,高于Anthropic的76%。文章还提到,OpenAI的下一款模型Astra预计将在未来几周内发布。
与此同时,传闻称Anthropic可能会用改进版Fable 5.1进行反击,但这一点尚未得到证实。报道补充说,在此之前Anthropic曾取得领先:Bloomberg称其年化收入运行率达到650亿美元,华尔街日报则报道Anthropic的收入为116亿美元,而OpenAI为67亿美元。尽管如此,文章认为OpenAI正在缩小差距,因为企业需求和API使用量再次加速增长。文章最后指出,随着开源权重模型逐渐获得市场认可,两家公司的增长此前都曾放缓。
文章称,OpenAI的下一代模型Astra预计将在未来几周发布,而传闻显示Anthropic可能会以改进版Fable 5.1应对。需要注意的是,随着开源权重模型逐渐获得市场份额,两家实验室的增长都曾放缓,竞争格局因此更复杂。
Simon Willison
·#llm
llm 0.32.1 是一个小版本更新,修复了由于 OpenAI Python 库依赖变化导致的新安装失效问题。当前的临时方案是将依赖固定为 openai<3,而计划中的 0.33 版本将从 httpx 迁移到 httpx2。
这很重要,因为 llm 是一个被广泛使用的 CLI/库,新安装失效会直接阻止新用户和自动化环境正常使用。这个修复也说明了 Python 项目里传递依赖的脆弱性,尤其当核心库调整自身依赖关系时更容易出问题。
Simon Willison 发布了 llm 0.32.1,这个版本主要是为了在依赖故障之后恢复安装可用性。此前,LLM 的全新安装已经停止工作,因为 OpenAI Python 库改变了它使用 httpx 的方式,而 LLM 只是通过 openai 这个间接依赖拿到 httpx。为了避免新用户继续被卡住,0.32.1 这个小版本先把 openai 固定到 3 版本以下。官方明确表示,这只是一个临时修复。
Willison 还提到,一个很快会发布的 0.33 版本将把 LLM 从 httpx 迁移到 httpx2。也就是说,这次更新的重点不是新功能,而是在依赖生态变化中保持项目可用。相关说明也表明,该项目正在密切跟踪 Python HTTP 客户端生态的演进。
故障之所以发生,是因为 llm 只是通过 openai 间接依赖 httpx,而 OpenAI Python 库停止使用 httpx 的方式暴露了这个隐藏依赖。发布说明称,llm 0.33 将通过切换到 httpx2 来处理根本性的兼容性变化,httpx2 是由 Pydantic 推进的后续项目。
TechCrunch AI

TechCrunch 报道称,Ramp 的最新支出数据表明,OpenAI 在本季度迄今的美国企业客户中增长速度快于 Anthropic。尽管如此,Anthropic 目前在 Ramp 平台上的总体份额仍然领先,只是 OpenAI 自 5 月以来一直在缩小差距。
这组数据表明,企业 AI 需求仍然很不稳定,随着新模型发布,商业用户会在不同供应商之间切换。这一点很重要,因为企业采用是两家公司营收的重要来源,也会影响它们在计划 IPO 之前的投资者预期。
TechCrunch 表示,在 OpenAI 和 Anthropic 接近各自计划中的 IPO 之前,外界只能依赖 Ramp 这样的第三方指标来观察它们的业务表现。Ramp 是一家提供企业卡和费用管理软件的公司,它发布的新数据表明,OpenAI 正在美国企业用户中追赶 Anthropic。OpenAI 过去曾在消费者和企业市场都处于领先,但在 5 月份,Anthropic 先在 Ramp 的付费企业用户中超越了它,当时 Anthropic 的市场份额为 41%,OpenAI 为 39%。到 7 月,Anthropic 已接近 44%,而 OpenAI 接近 40%。Ramp 经济学家 Ara Kharazian 表示,至少在本季度截至目前,OpenAI 的增长速度快于 Anthropic。
报道同时提醒,这一趋势仍可能在季度结束前改变,因为企业 AI 市场的变化速度很快。Ramp 的样本覆盖了超过 7 万家美国企业,这些公司通过 Ramp 的账单支付和企业卡产品支出了数十亿美元,但由于 Ramp 客户中科技公司占比较高,这个样本并不能代表整个市场。它也不包括使用 American Express 等其他支出管理工具的大型企业,因此只能说明市场信号,而不是全貌。尽管如此,数据仍显示企业 AI 的整体支出在增长,因为在这些 Ramp 客户中,付费使用 AI 的公司比例自 3 月以来持续上升,到 7 月已接近 56%。TechCrunch 认为,这说明企业在不同模型发布之间会来回切换,企业 AI 支出是否足够“粘性”仍值得投资者关注。
Ramp 表示,其数据覆盖了超过 7 万家美国企业,这些企业通过其账单支付和企业卡产品花费了数十亿美元,但这并不是完整市场,尤其不包括使用其他支出管理平台的大型企业。Ramp 只提供了百分比,没有披露具体金额,因此这些数字反映的是采用份额,而不是实际收入。
TechCrunch AI

OpenAI为ChatGPT推出了一个苹果信息插件,用户可以把自己的信息收件箱连接到聊天机器人。这个集成允许ChatGPT搜索、起草、发送、编辑和删除短信,并且也能用于Codex和ChatGPT Work。
这让ChatGPT从写作或编程工具进一步变成了更直接的沟通助手,可能提升个人和工作场景中的消息处理效率。与此同时,它也带来了新的隐私和权限问题,因为聊天机器人可以接触用户的对话历史,并代表用户发送消息。
OpenAI推出了一个苹果信息插件,让用户可以把自己的信息收件箱连接到ChatGPT。该公司表示,这个插件可以用来整理、分析、编辑、搜索、起草和发送消息,而且也能在ChatGPT Work和Codex中使用,方便工作场景。宣传演示展示了一个用户让ChatGPT根据前一天收到的信息,自动建议后续回复内容。除了发消息之外,用户还可以让ChatGPT删除消息,或者从很久以前的消息历史中搜索信息。
TechCrunch指出,这种访问方式立刻引发了隐私问题,尤其是数据保留框架并不完全清楚。对此,OpenAI回应称,ChatGPT不会为用户消息创建完整索引,而且该插件是在用户设备本地运行。OpenAI还表示,ChatGPT只有在用户提出明确请求时才会读取消息,而安装设置需要开启“完全磁盘访问”。在发送消息方面,OpenAI建议用户留意ChatGPT的操作,并不要启用持续批准,因为那会取消消息发送前的最后一次确认机会。
OpenAI表示,这个插件不会为用户的消息创建完整索引,只有在用户提出明确请求时才会读取消息。设置时据称需要在Mac上开启“完全磁盘访问”,而且OpenAI提醒用户不要启用持续批准,因为那会取消消息发送前的最后审查步骤。
The Decoder

Anthropic正在调整企业客户数据的处理方式,30天的安全审查窗口将继续保留,但数据今后会留在客户自己的云环境中,而不是Anthropic的服务器上。Anthropic开发者Boris Cherny已公开确认这一计划,预计将在今年秋季上线。
这对希望在不交出数据控制权的情况下获得安全监测的企业AI客户来说,是一个重要变化。它也表明,随着AI厂商进入受监管行业,如何在滥用检测、隐私要求和合规压力之间取得平衡,已经成为核心问题。
Anthropic正在在企业客户的压力下放宽一项有争议的数据存储政策。自6月以来,Anthropic一直将来自其强大的Mythos和Fable模型,以及未来旗舰模型的客户数据,保存在Anthropic自己的服务器上30天。Anthropic表示,这个时间窗口是为了帮助识别利用该技术发起的新型网络攻击。后来,公司承认这项政策并不受欢迎,而且可能带来商业风险。
根据新的方案,30天的安全审查窗口仍将保留,但数据将存放在客户自己的云环境中,而不是Anthropic的基础设施上。Bloomberg称,Anthropic花了数月时间与100多家受监管行业客户一起构建这一系统。此举显然是为了缓解企业对数据控制权和隐私的担忧,同时保留Anthropic对潜在滥用行为的监测能力。Anthropic开发者Boris Cherny也在X上公开确认了这一计划,新政策预计将在今年秋季推出。
Anthropic此前要求来自Mythos和Fable模型,以及未来旗舰模型的所有客户数据,在Anthropic管理的基础设施上保存30天,用于发现网络攻击。新方案下,留存时间不变,但存储位置改为客户自己的云环境;Bloomberg称该系统是Anthropic与100多家受监管行业客户共同打造的。
The Decoder

OpenAI 正在通过其 API 预览 GPT-Image-2 的透明背景生成功能。用户只需将 background=transparent 设置为参数,就可以生成带有 alpha 通道的 PNG 图片。
这让 GPT-Image-2 在商品图、流程图、图标、贴纸和周边设计等需要抠图的场景中更实用。它也减少了对后期去背景工具的依赖,因为这类工具在玻璃边缘或细小纤维等复杂细节上往往效果不佳。
OpenAI 现在在其 API 中以预览形式加入了 GPT-Image-2 的透明背景支持。这个新选项允许模型直接生成带有 alpha 通道的 PNG 图片,而不必先生成背景再在后期手动抠图。OpenAI 认为,这项功能适合四类常见工作流:电商商品图、PowerPoint 图表、图标和贴纸等设计素材,以及周边商品的图案设计。官方表示,直接在生成阶段处理透明度,通常比传统去背景更好,因为它能更自然地保留复杂边缘。OpenAI 特别举例说,透明玻璃、细小纤维之类的细节,往往是后期去背景工具最难处理的部分。
开发者可以在 API 请求中设置 background=transparent 来启用该功能。OpenAI 还建议在提示词里不要写背景描述,因为模型如果读到背景要求,仍然可能生成背景。对于包含精确数字的图表,官方建议在生成后人工核对数值。由于该模型输出的是栅格图像,它并不保证像素级的数值准确性。Cookbook 里给出的环境准备包括 Python、OpenAI 库、Pillow 以及 API 密钥。
OpenAI 表示,在生成阶段直接写入 alpha 通道,效果可能比传统去背景更好,尤其适合处理透明物体和复杂边缘。官方也提醒,涉及精确数字的图表需要人工核对,因为该模型输出的是栅格图像,不能保证像素级精确。
ZDNET AI

AWS Marketplace 的 AI 智能体目录正在快速扩张,过去一年里,“AI agents”在市场关键词搜索中的排名从第 64 位升至第 3 位。AWS Marketplace 和 Partner Services 副总裁 Matt Yanchyshyn 表示,平台去年的智能体供给约为 1,000 个,今年已超过 4,000 个,而整体应用数量接近 40,000 个。
这一增长表明,企业正在从试用 AI 智能体转向通过主流云渠道真正采购和部署它们。它也说明应用市场正在成为 AI 运营栈的一部分,不再只是应用目录,而是开始承担发现、尽职调查、采购和部署等流程。
AWS Marketplace 正在经历一波围绕 AI 智能体的明显增长,无论是搜索热度还是商品供给数量都在上升。AWS Marketplace 和 Partner Services 副总裁 Matt Yanchyshyn 表示,“AI agents”在过去一年里的关键词搜索排名从第 64 位跃升到第 3 位。与此同时,平台上的智能体供给也从去年的约 1,000 个增长到今年的 4,000 多个,整体应用数量接近 40,000 个。报道认为,这一变化不仅是目录扩张,更说明 AI 智能体正逐步嵌入软件采购与部署的全流程。文章提到,智能体驱动的市场可以帮助完成应用发现、供应商比较、许可证管理、权限管理、审计、续订,以及部分合同和采购工作。
West Monroe Partners 的 Bret Greenstein 认为,这类工具已经在减少大量 IT 管理开销。Yanchyshyn 还表示,AWS 不仅支持发现阶段,也在支持部署阶段,尤其是在尽职调查和客户成功场景中采用较多。他补充说,AWS Marketplace 里传统的“点击即买”自助模式仍然覆盖大部分场景,但智能体能力更偏向帮助客户更顺利地部署、获取私有定价,并支持更大的企业交易。文章同时引用了 Info-Tech Research Group 的 Shashi Bellamkonda 的提醒:自然语言搜索确实能帮助买家更快找到解决方案,但模型可能不会覆盖全部选项,因此用户需要反复追问并核验输出,不能把结果直接当成最终决策。
AWS 表示,智能体能力不仅用于发现,还用于部署、私有定价和更大的企业交易,但传统的点击即买流程仍覆盖市场的大部分内容。业内人士也提醒,基于模型的搜索可能无法覆盖全部目录,因此用户在决策前需要反复追问并核实结果。
ZDNET AI

ZDNET认为,随着AI深度伪造越来越难识别,密码和回拨验证等低技术手段正变成更可靠的防御方式。文章引用了2024年1月的Arup事件:一名员工参加了一个视频会议,会议中出现的是公司高管的AI生成克隆,随后导致约2500万美元的欺诈性电汇转账。
这篇文章强调,面对高价值业务决策时,依赖视觉和语音进行身份确认已经不够可靠,因为攻击者现在可以相当逼真地模仿高管。它之所以重要,是因为企业可能需要从“看起来像本人就相信”转向更难被伪造的流程性控制。
ZDNET报道,AI深度伪造和语音克隆已经逼真到传统的人工身份验证不再可靠。文章以2024年1月的Arup事件开头:一名员工参加了一个看似有公司CFO和其他高管在场的视频会议,但会议中的每一位参与者其实都是根据公开露面和财报电话会议拼接出来的AI生成克隆。最终,这起事件导致15笔电汇被转到第三方账户,总额约2500万美元。GrackerAI的Deepak Gupta指出,如今“看到和听到某个人”已经不能证明对方是真人,任何依赖面孔和声音识别的流程都已经失效。
S2i2的James Scobey补充说,视觉和语音中的细微破绽也许还能提供一点辅助信号,但不能再当作有效控制手段,因为这会让员工在攻击中依赖自己的直觉。文章还提到,深度伪造识别对研究人员来说也越来越难:一项研究发现听众只能约73%地识别出深伪,经过训练后提升也很有限,而后来汇总的研究则显示准确率接近随机猜测。文中还指出,美国国家安全局、联邦调查局和CISA联合发布的信息说明书,已经不再把依赖篡改痕迹的自动化检测方法视为可靠方案。文章的核心建议是,在敏感或高价值交易中,应回归密码和回拨验证等低技术安全流程,而不是只相信实时音视频。
文中引用的安全专家表示,随着合成音频和视频不断进步,人类识别深度伪造的能力并不强,而且还在变差,因此所谓“破绽”只能作为辅助信号。文章推荐的防御措施包括回拨验证和密码,同时指出自动化篡改检测工具也不足以应对,因为深度伪造未必会留下明显的统计痕迹。