AI agents have no sense of time and are not aware of it

The Decoder··作者 Maximilian Schreiner

资讯摘要

AI agents have no sense of time and are not aware of it A new study finds that popular coding assistants can't predict how long a task will take, and they can't reliably tell how long they've already been working. That's a problem for long-running jobs. When an AI assistant works on a task, it often has no idea how much time is passing. That's the takeaway from a study by two independent AI researchers, done as part of the MATS research program. The pair tested two widely used coding assistants, Anthropic's Claude Code and OpenAI's Codex, on their sense of time.

AI agents have no sense of time and are not aware of it

资讯正文

AI 代理没有时间感,也意识不到时间的流逝

一项新研究发现,流行的编码助手无法预测一项任务会花多长时间,它们也无法可靠地判断自己已经工作了多久。对于长时间运行的任务来说,这就是个问题。

当 AI 助手执行一项任务时,它往往根本不知道时间过了多久。这是两名独立 AI 研究人员在 MATS 研究项目中进行的一项研究得出的结论。两人测试了两款广泛使用的编码助手:Anthropic 的 Claude Code 和 OpenAI 的 Codex,看看它们是否具备时间感。

在每项编码任务开始前,代理都必须估计自己需要多长时间。随后,它们完成任务,并在回顾时报告已经过去了多少时间。测试材料来自 ProgramBench 数据集中 200 个任务,以及研究人员自建的 18 个基准测试套件。

在这些测试中,代理始终高估了自己需要的时间。在 ProgramBench 上,无论任务难度如何,这两个模型大多都猜测大约需要 90 分钟。在第二轮测试中,Claude 的估计平均偏差是实际的 3 倍,Codex 则偏差 6 到 10 倍。对于短任务,估计最不准确;只有在多小时级别的任务中,一些预测才开始接近现实。

同一个 AI 在不同设置下表现截然不同

结果会随着模型运行的软件设置而变化。Claude Code 会持续工作,直到它认为任务完成为止,中位数大约是 90 分钟。另一方面,Codex 大约半小时后就会停止,几乎不管任务是什么。根据这项研究,在 Claude Code 中,同一个语言模型平均会采取比在 Codex 中多 2.5 倍的步骤。因此,运行时长取决于模型,也在很大程度上取决于周围的软件,即所谓的 harness。

这些代理在判断自己工作质量方面同样不可靠。较老的模型 Opus 4.8 和 GPT-5.5 会将自己的结果平均高估 20 个百分点,即使在失败任务上也会给自己很高的分数。在一个案例中,这两个模型都认为自己的工作大约有 70% 成功,但实际得分分别只有 7% 和 14.5%。

研究人员表示,这种自我评估能力很重要。要让一个代理稳定地处理持续数小时的长任务,它必须能遵循诸如“把这个任务迭代两个小时”这样的指令。一个总是误判时间的代理很难控制。接下来,作者们想测试代理是否能坚持预设的工作时长。当代理获得一个可以报告已过去时间的工具后,它们几乎每次都能判断正确。

来源与参考

  1. 原始链接
  2. AI agents have no sense of time and are not aware of it

收录于 2026-08-31