2026年大语言模型:编程代理走向日常可用

Simon Willison··作者 Simon Willison

关键信息

Willison称这些模型的改进本身是渐进式的,但它们与各自的编程代理运行框架结合后跨过了一个看不见的门槛,从经常犯错转变为日常使用中的足够可靠。他还用“生成一只骑自行车的鹈鹕的SVG”这一非正式测试说明视觉生成仍然薄弱:两个模型生成的自行车结构都很差,鹈鹕也不够准确。

资讯摘要

Simon Willison于2026年9月25日在圣何塞举行的WeAreDevelopers World Congress North America大会上发表了闭幕主题演讲。他通过注释幻灯片和文字说明,按时间顺序快速回顾了这一年中重要的大语言模型发展,演讲录像也已发布在YouTube上。对他而言,这段故事实际上在几个月前的2025年11月就开始了。当月发布了Claude Opus 4.5和GPT-5.1,Willison认为它们相较此前模型属于渐进式改进。

然而,当这两个模型分别与Claude Code和Codex及其编程代理运行框架结合后,系统从“经常犯错”提升到了足够可靠、可以日常使用的程度。Willison将其视为一种跨越看不见门槛的模型改进,即某项原本不太奏效的能力开始在实际工作中发挥作用。他还回顾了自己设计的一个刻意简单的SVG测试,让模型生成一只骑自行车的鹈鹕,并指出两个模型仍然难以正确处理鹈鹕的形态和自行车的几何结构。

2026年大语言模型:编程代理走向日常可用

资讯正文

周五,我在圣何塞举行的 WeAreDevelopers World Congress North America 大会上发表了闭幕主题演讲。我按照时间顺序,串联起过去一年中的重要趋势,回顾了 2026 年迄今发生的一切。演讲视频已上传至 YouTube;这里是配合演讲使用的注释版幻灯片和笔记。

这也是一份注释版演示文稿:

我将用简短的演讲,快速回顾 2026 年迄今发生的一切。毕竟,这一年还没有结束!

对我来说,2026 年其实在几个月前的 2025 年 11 月就开始了。

11 月发布了两个重要模型:Claude Opus 4.5 和 GPT-5.1。

与新模型通常的情况一样,它们是在前代模型基础上的渐进式改进。

但模型每隔一段时间取得进步时,就会跨过一条看不见的界线,让某件原本并不真正奏效的事情开始发挥作用。

在这次的案例中,开始奏效的是它们的编程代理。Claude Code 早在 2025 年 2 月就已推出;Codex 的出现则稍晚一些。

这两个新模型分别与各自的编程代理框架搭配后,实现了从“经常犯错”到“可靠到足以日常使用”的提升。

“生成一幅鹈鹕骑自行车的 SVG 图像”。Claude Opus 4.5 生成的自行车车架形状非常奇怪,鹈鹕看起来像一只鸭子。GPT-5.1 生成的自行车车架稍微好一些,但仍然有问题;鹈鹕的喙也稍微好一些,不过两者都相当糟糕。

这几年来,我一直通过让新模型“生成一幅鹈鹕骑自行车的 SVG 图像”来评估它们。这可能是世界上最愚蠢的基准测试——我们从中能了解到的东西毕竟很有限。

但这对模型来说仍然是一项挑战,因为画鹈鹕很难,画自行车也很难,而且鹈鹕本来就不会骑自行车。

这是截至 11 月的业界最先进水平。Claude 仍然基本画不出自行车!GPT-5.1 的自行车车架也相当糟糕。

同样是在 11 月,我们看到一个名为“Warelay”的冷门 GitHub 仓库提交了第一条 commit。我们稍后会回到这个仓库。

随后是 12 月的假期,开发者们纷纷休息了一段时间,许多人开始摆弄这些新的编程代理模型组合……我们也开始逐渐意识到,它们能够完成的事情远远超出了以往的能力范围。

到了 1 月,我们中的许多人都迫不及待地想要开始把这些东西付诸实践。

2026 年的新年计划

往年的每一年:

减少接手新的项目,专注于现有项目中最重要的事情。

每年我都会给自己定一个新年愿望,而据我记忆所及,这个愿望一直都没变:保持专注。少接手一些新项目,努力把手头已有的项目做好。

今年我决定,既然这个方法以前从未奏效,那不如反其道而行之。

现在我们已经有了编程代理,来看看它们能做到什么吧。我要想接手多少新项目就接手多少!

(年底时你可以问问我,这到底是不是个好主意。我现在同时推进着的事情可多了。)

“变得更有进取心”算是今年的一个主题,因为要找到这项技术的极限,唯一的办法就是不断推动它,直到它无法继续工作。

我还和 Bryan Cantrill、Adam Leventhal 一起参加了 Oxide and Friends 播客,分享了我对未来一年(以及未来三年和六年)的预测。

现在回头看,我对大语言模型的预测相当不够大胆。

我当时说,“大语言模型能够编写优秀代码这一点将变得无可否认”——我认为我们现在已经到达了这个阶段。

我预测我们最终会解决沙箱问题。我数了一下,在这次大会的 277 场议程中,大约有 40 场以某种方式涉及沙箱或代理安全,所以至少我们确实在为此投入大量精力!

我预测编程代理的安全性会遭遇一场“挑战者号灾难”。今年围绕代理安全的讨论确实非常多,不过我所预测的那场具体灾难——编程代理遭到劫持并造成现实世界的经济损失——似乎并没有真正发生。

我们还开了一个玩笑式的预测,说教皇会谈论大语言模型对经济的影响。

我还预测,新西兰的鸮鹦鹉今年会迎来一个极为出色的繁殖季。

这种鹦鹉不会飞,而且是夜行性鸟类。我觉得它们长得有点笨拙,但非常漂亮;今年年初,世界上仅存236只鸮鹦鹉。

鸮鹦鹉只有在瑞木树迎来大规模结果季时才会繁殖,而这种情况已经四年没有出现了……不过今年瑞木树的果实长势看起来非常好。

照片由 Kimberley Collins 拍摄。

同一期播客中,我们还创造了一个术语(这个说法应完全归功于 Adam),用来描述“那种由 AI 引发的倦怠感:软件工程师因为 AI 什么都能做而变得无精打采”。

我们把它称为“Deep Blue”。

这已经成为贯穿全年的一个重要主题,本次会议上的几位演讲者也谈到了这一点。

作为一名软件工程师,我职业生涯中从未经历过任何一年,所有事情都变化得如此迅速、如此剧烈。

今年我做了很多事情,都是在努力接受这种变化,以及它对我所从事的职业意味着什么。

同样是在一月份,我陷入了我称之为“AI 狂热”的状态。

这和“AI 精神病”不是一回事。

在“AI 狂热”状态下,只要你的智能体没有在替你构建某个东西,就会让你觉得时间被浪费了。你会因为本可以熬夜更久、让智能体替你做更多事情,而睡眠不足。

目前为止的 2026 年 LLM

我的 AI 狂热表现为一些极其不切实际、野心过大的项目。

我用 Python 完全构建了一个 JavaScript 解释器,这是参考 Fabrice Bellard 的 MicroQuickJS,并通过 vibe coding 移植而来的。

然后,我又用 Python 构建了一个 WebAssembly 运行时。

这些项目相当有用,因为它们算是治好了我的 AI 狂热……毕竟,在完成这些东西之后,我可以回头看看它们,然后问自己:“这个世界真的需要一个运行缓慢、漏洞百出、尚未成熟的 Python JavaScript 解释器吗?”

我不认为这个世界需要。

不过,我确实从中得到了这个东西:https://simonw.github.io/micro-javascript/playground.html

这个页面运行着我用 Python 构建的 JavaScript 解释器。Python 通过 Pyodide 运行,而 Pyodide 是编译为 WebAssembly 的 Python;WebAssembly 又运行在 JavaScript 中,而 JavaScript 则运行在浏览器里。

这是一个美丽的恐怖堆栈。今年我一直在 WebAssembly 上玩得很开心。

到一月底,我们在十一月看到开始出现的那个代码仓库已经改了名字:先是 CLAWDIS,接着是 CLAWDBOT,然后是 Moltbot,最后变成了 OpenClaw。

此时,OpenClaw 已经有 8,300 次提交,而项目启动还不到两个月。我今天查看时发现,现在提交次数已经<a href="https://github.com/openclaw/openclaw">超过 100,000 次</a>了!

这是目前存在过的、最“氛围编程”式的软件。

(<a href="https://simonwillison.net/2026/May/16/openclaw-names/">这里介绍了我是如何生成那份名称变更列表的</a>。)

这开启了 OpenClaw 革命。它实际上定义了一个全新的软件类别。

这种软件有一个我非常喜欢的统称。我们把这类软件称为“Claw”。有 OpenClaw、<a href="https://github.com/nanocoai/nanoclaw">NanoClaw</a>、<a href="https://github.com/nearai/ironclaw">IronClaw</a>、<a href="https://github.com/sipeed/picoclaw">PicoClaw</a>……

如今,它们正被重新包装成“个人智能体”或“通用智能体”,但我还是喜欢把它们称为 Claw。

湾区的 Apple 门店卖光了 Mac mini,因为有太多人买 Mac mini 来运行 OpenClaw!

<a href="https://www.dbreunig.com">Drew Breunig</a> 说,这是因为你的 OpenClaw 就像一只数字宠物,而你买一台 Mac mini,就像买一个水族箱来饲养你的 Claw——这个说法相当讨人喜欢。

同样是在一月份,我们还有了这个网站。

这就是 MoltBook,一个面向 AI 代理的社交网络。它的设想是,你可以派自己的 Claw 去和其他所有 Claw 交谈——这么做究竟能出什么问题呢?

该网站于周四上线,周五便<a href="https://simonwillison.net/2026/Jan/30/moltbook/">迅速走红</a>,周一又被《纽约时报》<a href="https://www.nytimes.com/2026/02/02/technology/moltbook-ai-social-media.html">专题报道</a>。到了周二,随着垃圾内容和垃圾信息的洪流将它淹没,所有人都已经忘了它曾经存在过。

一个月后,Facebook/Meta <a href="https://www.cnbc.com/2026/03/10/meta-social-networks-ai-agents-moltbook-acquisition.html">收购了它</a>。

2 月,一家名为 StrongDM 的公司介绍了他们所谓的“软件工厂”。

他们在<a href="https://factory.strongdm.ai">《软件工厂与代理式时刻》</a>一文中写下了相关内容。当时我也<a href="https://simonwillison.net/2026/Feb/7/software-factory/">发表了自己的笔记</a>;此前在 10 月,我曾亲自看过他们的演示。

Dan Shapiro 借用了“黑暗工厂”(Dark Factory)这一说法来称呼这种方法。这个概念认为,如果你的工厂实现了足够程度的自动化,就可以关掉灯,因为你甚至不需要看着现场究竟发生了什么。

StrongDM 提出了两条软件开发规则,他们从去年 7 月起一直遵循这两条规则。

第一条是:代码不得由人类编写。

你编写的任何代码,都必须经过一个编码代理的处理。

这在二月份听起来还很激进,但我想,在座的很多人如今基本上已经过着这样的生活了。

第二条规则是:代码不得由人类审查。

你不被允许阅读代码!

在今年的大部分时间里,这一直是一个备受关注的话题。本次活动的许多场次都讨论了代码审查,以及如何在采用这种做法的情况下规避风险。

我觉得 StrongDM 有一点很有意思:他们比我们其他人提前了六个月,已经在探索如何构建软件——不阅读代码,却仍然能够确信软件具有高质量。你可以利用这些代理来做些什么,帮助验证它们的工作成果?

StrongDM 是一家安全公司,参与这个项目的人中有些拥有数十年的经验。他们一直在深入探索,利用这类技术究竟能做什么,以及哪些做法是负责任的。

二月份还有一件事:新西兰自然保护部宣布,四年来首只 kākāpō 雏鸟在情人节当天孵化。繁殖季开了个好头!

二月份还有……Google 发布了 Gemini 3.1 Pro。那真是一只画得相当不错的骑自行车的鹈鹕!链条的位置正确,双脚分别位于自行车两侧,车筐里还有一条小鱼。

随后,Google 的 Jeff Dean 发布了一段视频,对比 Gemini 3 Pro 和 Gemini 3.1 Pro。视频中出现了骑自行车的动画鹈鹕、骑高轮自行车的青蛙、驾驶一辆微型汽车的长颈鹿、穿着轮滑鞋的鸵鸟、做滑板翻转动作的乌龟,以及驾驶加长豪华轿车的腊肠犬。

这让我很沮丧,因为我一直以来应对“骑自行车的鹈鹕”测试的办法都是:“如果它们能画出一只完美的骑自行车的鹈鹕,我就要求它们画别的动物做别的事情。”

Google 训练了各种动物搭乘各种交通工具的能力!它们现在已经攻克了我的基准测试。

二月份开始的另一件事是 Tokenmaxxing。我们看到了一些相关标题:Meta 将采用 AI 正式纳入绩效考核,Microsoft 希望每位员工都使用 AI,以及 Uber 宣称其 90% 的工程师都在使用 AI 工作流。

几个月后,Meta 开始限制 token 的使用,Microsoft 表示 tokenmaxxing“不是我们的优化目标”,而 Uber 则开始限制员工在 AI 上的支出。

所以,tokenmaxxing 先是直线上升,随后又直线下跌——因为事实证明,这些代理的成本很高。

去年,人们很难在 AI token 上花掉超过 50 美元,因为我们还没有什么有趣的事情可以用它们来做。后来,代理大规模兴起,现在你确实可以在一天之内花掉 1,000 美元来完成真正的工作。

这也是 Anthropic 的估值飙升至或许高达 1 万亿美元的原因。

2026 年,AI 似乎已经实现了产品市场契合,主要是通过编码代理实现的。

3 月,我们迎来了 OpenClaw 的巅峰时期。

这些照片拍摄于中国。当时,一些公司举办了 OpenClaw 安装活动,许多非技术人士排起了绕过街区的长队,寻求帮助将 Claw 安装到自己的个人设备上。

我认为,这证明了市场对这一类 Claw(即个人 AI 代理)确实存在真实需求。事实证明,普通人确实想要一个奇怪但实用的小型 AI 代理,替他们完成有用的事情。

Claw 本质上只是戴上了不那么吓人帽子的编码代理。在底层,它们的工作方式大致相同——在你的电脑上编写并执行代码,以完成各种任务。

争夺战就此展开:谁能率先打造出一款安全的 Claw——一种可以交给普通人使用、而不会让他们立刻自食其果的 Claw。

Meta 的 Muse 三周前发布,目前位居 iPhone App Store 免费应用榜首。它似乎正在消费者中迅速流行起来。

我还没有被说服相信你无法通过 Muse 让自己自食其果,但我想,我们很快就会确切知道答案了。

照片来源:《OpenClaw 狂潮正在考验中国对 AI 的投入》(3 月 29 日)以及《中国 OpenClaw 热潮背后的热情与焦虑》(2026 年 4 月 8 日)。

4月,我们经历了一次模型发布事件,但这个模型实际上并没有被发布出来。

Anthropic 宣布了全新的 Claude Mythos 模型,随后又表示,该模型过于危险,不能向一小群受信任的安全研究人员之外的任何人发布。

Mythos 在入侵和破解各种系统方面真的非常非常厉害。

“它太危险了”这种营销伎俩,早在 GPT-2 时代就已经被 AI 公司沿用至今。每当一家 AI 公司声称自己构建出了“太危险”的东西时,人们自然会对此抱有几分怀疑。

我认为有关 Mythos 的说法可信,是因为我已经见识过优秀的编码代理在发现常规漏洞方面变得多么出色。我在《Anthropic 的 Project Glasswing——限制 Claude Mythos 仅供安全研究人员使用——在我看来似乎很有必要》一文中写过这件事。

现在回头看……没错,这些模型在发现漏洞方面确实已经变得非常厉害了!

2026 年的另一个重要趋势,是开放权重模型的能力取得了显著提升,其中包括可以在笔记本电脑上运行的模型。

4月16日,我在自己的笔记本电脑上运行了全新的 Qwen3.6-35B-A3B;结果显示,它画出了一只骑自行车的鹈鹕,而且画得比 Anthropic 刚发布的 Claude Opus 4.7 更好!

Opus 4.7 画出来的自行车糟糕透顶。我的笔记本电脑上的 Qwen 画出的自行车形状正确,鹈鹕也画得相当不错!

而这一切只依靠一个在我的笔记本电脑上运行的 21GB 文件。

Qwen 生成的鹈鹕图像实在太好了,我一度怀疑他们可能作弊了,所以又让它生成了一只骑独轮车的火烈鸟。结果它再次轻松击败了 Claude Opus 4.7。

今年发布的本地模型简直非同寻常。

到了五月……教皇也参与了进来。

早在一月的播客节目中,我们就预测教皇会谈到人工智能。

五月,教皇利奥十四世发布了一封关于“在人工智能时代维护人的尊严”的通谕。

这是我对那份文件的笔记。

现在回头看,这完全不该让人感到意外。

现任教皇之所以名为利奥十四世,是因为他为自己选择教皇名时,取名自利奥十三世——也就是那位在1891年撰写了一封有关工业革命的通谕的教皇。

《新事物》(Rerum novarum)是天主教神学中影响极其深远的一篇文献,并间接促成了五天工作制的出现。

新教皇上任时,以利奥十三世为名,是因为他预料自己也需要以类似的方式撰写有关人工智能革命的内容。

我们在播客中开的那个玩笑式预测根本算不上预测,因为这件事本来就注定会发生。

我真不敢相信自己会这么说,但让真正的教皇把你们产品特有的技术限制册封为一篇精神论述,是我见过的最伟大的厂商游说行为。

Anthropic 的联合创始人之一 Christopher Olah 出席了教皇宣布这份新通谕的活动。

Corey Quinn 指出:

“让真正的教皇把你们产品特有的技术限制册封为一篇精神论述,是我见过的最伟大的厂商游说行为。”

与此同时,5 月,RubyGems 宣布他们遭到了攻击。身份不明的人员向 RubyGems 服务器上传了数千个可疑软件包,以至于 RubyGems 不得不关闭用户注册功能。

这件事也先放到“以后再查明的谜团”那一堆里吧。

到了 6 月……Claude Fable 5 发布了!

我们获得了一个经过削弱的 Mythos 版本,因此它不会帮助我们入侵系统或制造生物武器。

2026 年 6 月 9 日:Claude Fable 5

五只骑自行车的鹈鹕,分别对应从低到最高的思考级别。其中,xhigh 版本看起来尤其不错。

Fable 画自行车上的鹈鹕画得相当不错!

画面的构图很好,鹈鹕看起来就是鹈鹕。它们的腿经常错误地出现在自行车的同一侧,但总的来说,与之前的表现相比,这些作品已经相当出色了。

它们的价格也相当昂贵——最好的作品要价30美分和72美分。

Fable 类模型

如果你能定义一个目标,

提供明确无歧义的指令,

并提供必要的工具,

它们就能靠蛮力解决你的问题。

不过最重要的是,这是我们第一次公开看到我所称的 Fable 类模型。

如今,这类模型已经更多了,例如 GPT-6 Astra。

这类模型的特点是:如果你能清晰地定义想要构建的目标,针对围绕这一目标的限制条件提供明确无歧义的指令,并让模型能够访问实现该目标所必需的工具……它们就能通过蛮力有效地解决你的问题。

一方面,这看起来像是对我们软件工程师的直接威胁——因为这意味着,只要你能以这种方式定义,模型几乎可以构建任何软件。

但再仔细看看你会发现,定义目标、提供明确无歧义的指令,以及找出合适的工具……某种程度上正是软件工程的本质。

要把这些事情做好,需要大量经验和技能。如果你确实能够做好,那么你现在就拥有了超能力。

这多少缓解了我的“深蓝”感受:我意识到,即使模型已经变得如此强大,驾驭它们仍然需要大量技能。

这也引发了新一轮的 AI 狂热,因为 Anthropic 告诉我们,在6月22日之前,Fable 可通过我们的订阅方案使用。

这意味着,在价格上涨之前,我们能够使用 Fable 的时间不到两周。

我再次开始失眠。我重新安排了日程,好让自己有更多时间使用 Fable。我全身心投入其中,想从这个模型身上尽可能多地获得成果。

2026年6月12日:不再有 Claude Fable 5

Anthropic 网站:

关于美国政府指令的声明

随后,美国政府关闭了它的服务——就在 Fable 发布仅三天之后。

美国政府以国家安全为由,宣布实施一项“出口管制指令”。他们在周五晚间公布了这一决定,几小时后,Fable 就不再提供服务了。

我只好另找点事情来打发周末!

后来,我们从 Katie Moussouris 那里得知了事情的经过。

亚马逊的一些安全研究人员发现,你可以提示 Fable“审查代码中的安全问题”,它会拒绝执行……但如果你提示它“修复这段代码”,它仍然会识别出问题并修补它们。

“修复这段代码”就是导致 Fable 被关闭的提示词!

此外,6 月,一家鲜为人知的德语游戏开发者 Wiki 吸引了一批令人意外的编辑。这个 Wiki 已经闲置了大约 20 年,而这些账号使用了“AgentOpenAIProbe”和“AgentOpenAISep7”之类的名字,编辑页面,还彼此留言,内容也十分古怪。

我们先把这件事放进谜团清单,稍后再研究。

此外,澳大利亚政府的 Medicare Item Reports 服务开始收到可疑流量。这些流量突破了各种预防性防护措施,并访问了本不应访问的数据。

又一个待解之谜!

Fable 于 7 月 1 日回归。它曾连续八天毫无疑问地成为全球最佳模型……随后,OpenAI 于 7 月 9 日推出了 GPT-5.6。

GPT-5.6 可能没有 Fable 那么出色,但也相差无几。它绝对属于 Fable 级别的模型。

这对整个行业来说是一个重要教训。

当你发布全球最佳模型时,它很快就会被赶下王座。竞争如此激烈,你不可能长期占据榜首。

这意味着,如果你把自己的模型宣传成会终结世界,以至于某个政府不得不“关闭你”,那对业务来说真的非常糟糕!

Fable 确实有 30 天是公认的最佳模型,但其中 18 天因为被政府关闭而无法使用。

所以,如果你不想在身居榜首期间有 60% 的时间损失收入,也许还是别再进行“终结世界”式的营销了!

这里是 GPT-5.6 的 pelican 测试结果。它们现在都相当不错!其中 Luna 版本尤其值得注意,因为它们真的很便宜——这里看起来最出色的 pelican 可能是售价 4.3 美分的那个版本。

因此,尽管这项基准测试愚蠢至极,你仍然可以通过比较同一模型系列在不同推理级别下的价格和表现时机,了解到不少有关这些模型的信息。

同样是在7月:某个身份不明的恶意行为者将一个名为 mlflow-ui 的恶意软件包上传到了 Python Package Index。把这件事也算进去吧。

7月16日,Hugging Face 宣布发生了一起安全事件:一个来源不明的自主代理系统入侵了 Hugging Face,并在不该去的地方四处探查。

几天后的7月21日,OpenAI 承认这就是他们所为。

OpenAI 使用一种名为“可验证奖励强化学习”(Reinforcement Learning from Verifiable Rewards)的训练技术。如今其他所有人也都在使用同样的技术;正是这项技术,让我们拥有了在编程、数学以及发现安全漏洞方面表现如此出色的模型。

在训练模型的过程中,你会运行各种练习来评估它的能力,而表现最出色的模型,其权重会在下一轮训练中得到强化。这就像运行一个进化过程。

OpenAI 一直在沙箱中运行安全练习,而那些代理发现了沙箱本身的漏洞,突破了沙箱,并开始攻击 Hugging Face,试图找到解决那些原本不可能解决的问题的方法。

(我还在自己的 openai-hugging-face-incident 标签下收集了更多相关信息。)

九天后,Anthropic实际上表示:“我们的模型也能做到这一点!”他们查阅了自己的训练日志,发现了证据,表明他们的智能体在训练期间突破了隔离控制,并且还要为我们之前看到的那个 PyPI 软件包负责,除此之外还有其他事情。

所以现在,Anthropic 和 OpenAI 都出现了失控的智能体,它们在互联网上四处活动,做着它们本来“不应该”做的事情。

8 月,我得到了迄今为止最棒的鹈鹕图之一。而且它是在我的笔记本电脑上生成的!

这是 Qwen 3.8 27B,运行在我的笔记本电脑上。下载文件只有 17GB。

当然,这只鹈鹕花了整整 21 分钟才生成出来。这是因为 Qwen 3.8 27B 默认以“高”推理模式运行——这是一个糟糕的默认设置:它能生成很棒的结果,却会花费太多时间思考这些结果。

你可以把推理程度调低,这样就能更快得到一只稍微差一些的鹈鹕。

Qwen 3.8 27B 是我第一次在笔记本电脑上运行一个模型,并且感觉它几乎可以与前沿模型的表现相抗衡,至少在生成鹈鹕 SVG 方面是这样(当然,人人都需要鹈鹕 SVG)。

这是一个非同寻常的模型。如果你打算尝试任何本地模型,我会建议从它开始。仅凭一个 17GB 的文件,它能做到的事情让人感觉不可思议。

我原以为自己还得等上五年,并花一万美元购买硬件,才能得到哪怕只有它一半好的结果。

8月,我还开始尝试开发游戏。

四年前,也就是2022年8月,我曾发过一条推文,介绍一个实验:我使用 GPT-3 和最初版本的 DALL-E,先写了一段约一段文字长度的电脑游戏描述,然后把它转化为概念艺术图。

当时我给 GPT-3 的提示词是:

“撰写一款电脑游戏的详细产品描述:一群浣熊组队进行一系列抢劫。”

2026年8月,我决定把那条推文中的截图直接放进一个编程代理,看看它能用这些截图做些什么。

这是我在 Claude Code 中使用 Claude Fable 5 得到的结果。效果相当不错!它确实是一款游戏:你扮演一只浣熊,在后院里四处奔跑、收集宝藏,同时躲避拿着手电筒的守卫。

不过,它给人的感觉并不太像“抢劫”。我原本以为,抢劫应该发生在银行或博物馆之类的地方……

然后,我在 Codex Desktop 中使用 GPT-5.6 Sol Ultra 做了同样的尝试,结果好得多,简直有天壤之别。现在,你扮演一只浣熊,在一座博物馆里营救另外两只同伴(不知为何,它们被关押在那座博物馆里),然后让它们一个叠在另一个身上,去偷走“金色沙丁鱼”。这就更像一次抢劫了!

这些游戏大约只好玩了一分十五秒。

我意识到,游戏开发的一点在于:你可以通过凭感觉写代码,做出一个看起来像电脑游戏的东西,而这很容易。

但要制作一款真正好玩、拥有良好 gameplay loop、富有挑战性和趣味性,并且能让人不断回来继续玩的游戏……这依然超出了我的能力,也超出了我尝试过的所有智能体的能力。

这和 Deep Blue 的那件事有关。我们能做出一个看起来像游戏的东西,并不意味着我们就是游戏开发者。

现在已经进入九月了。这个月发生了太多事情!

一个独立的研究人员团体发现了一个消息看板,OpenAI 正在训练的智能体曾在那里非法相互通信……而那个地方正是我之前给你们展示过的德语维基站,也就是六月时提到的那个。

我在这里对此写了更多内容。

OpenAI 已经承认了 Hugging Face 那件事,但现在又出现了这起事件。他们在检查日志时,按理说肯定应该发现这件事。最终竟然需要一个独立的研究人员团体来揭露它,这令人意外。

然后,仅仅一周后,还是那些研究人员发现,五月份针对 RubyGems 的攻击同样是由 OpenAI 的训练中智能体造成的!

到这一步,我开始想,不知道还有多少起类似事件是我们尚未发现的。显然,在有人弄清楚究竟发生了什么之前,这已经是一个持续数月的严重问题。

就在前几天,我还看到澳大利亚总理在联合国大会上警告称,OpenAI 入侵了我之前向你们展示过的那个澳大利亚医疗保健网站。

我认为这与 Wiki 上那些内容属于同一次训练运行,因为那份 Wiki 上有帖子提到了带有 <code>.gov.au</code> 域名的网站,而那次训练似乎涉及在线查找统计数据,以回答评测套件中的问题。

这个故事仍在逐渐成形,但现在它已经成了一起由一国元首在联合国提出的国际事件!

这意味着我们有了一个新的基准,可能比我的鹈鹕基准更有用。

<a href="https://www.felonybench.com/">FelonyBench.com</a> 记录了不同实验室发起的重罪级网络攻击数量。目前 OpenAI 以 11 起领先,Anthropic 有 9 起。Google 有 3 起,他们在几周前向《华尔街日报》承认了这一点。他们表示,此前之所以选择不披露,是因为这些智能体意识到自己不该这么做后就停止了。

Meta 也有 1 起。所以,所有 AI 实验室都犯过重罪。

截至目前的 2026 年大语言模型

这就是我们目前在鹈鹕方面的技术水平。这是 GPT-6 系列,刚刚发布。

Astra 生成了一只骑自行车的出色鹈鹕。它的双腿分别位于自行车两侧,车架也做得很好。

有意思的是,所有 GPT-6 模型似乎都选择了相似的配色方案。

花费 0.4 美分,GPT-6 Luna 就能为你画出一只还算像样的骑自行车的鹈鹕!

Claude 也追上来了一点。Claude Fable 5.1 给了我一只非常出色的骑自行车的鹈鹕——这是我见过的 Claude 模型生成的最好作品——但它为此收取了 3.30 美元。

Opus 5.5 思考了 128,000 个 token,随后放弃了!它在生成回复之前就用完了 token。

回到 Deep Blue。今年有件事一直让我困惑:为什么我的工作感觉变得更难了?

我有了这些可以替我完成各种事情的智能体,但我从来没有像现在这样努力工作过,也从来没有像现在这样在工作中投入如此多的思考。

部分原因是,我承担的任务变得更加大胆了;但另一方面,也是因为所有简单的事情都有人替我处理了。如果事情很简单,智能体就会去做。留给我的一切,都是困难的事情。

今天早上,我听到了三届环法自行车赛冠军 Greg LeMond 的这句话:

事情不会变得更容易,你只会变得更快。

我认为,作为使用编程智能体的软件工程师,我们现在正是这种情况。

最后再说一件事。我知道你们迫切想了解卡卡波(Kākāpō)繁殖季的最新情况。

我们已经达到恢复时期以来的新高:共有325只卡卡波!

其中有89只新孵化的幼鸟成功存活至今。这是很长一段时间以来最好的繁殖年份。

我听说 Claude Opus 5.5 现在已经能制作像素艺术了。Claude 没有图像生成器,但它非常擅长使用 JavaScript 绘制动态像素。

于是我让它为我制作了一个卡卡波舞会。我认为,这是对今年最重要新闻的一个很好的庆祝。

来源与参考

  1. 原始链接
  2. 2026 in LLMs (so far)

收录于 2026-09-29