搜索的结束,研究的开始
周末,一丝未来的曙光悄然降临。长期以来,我一直在讨论人工智能领域的两场并行革命:自主智能体的兴起,以及自 OpenAI 的 o1 发布以来,强大推理机的出现。这两条线索最终汇聚成了一种令人印象深刻的成果——能够以机器速度进行研究,并具备人类专家的深度和细致度的人工智能系统。OpenAI 的深度研究项目展示了这种融合,并让我们对未来有所展望。但要理解这一点为何重要,我们需要从其基本组成部分开始:推理机和智能体。
推理者
过去几年里,聊天机器人的工作方式很简单:你输入一些内容,它就会立即开始逐字逐句地(或者更专业地说,逐个词条地)回复。由于人工智能只能在生成这些词条时“思考”,因此研究人员开发了一些技巧来提升它的推理能力,比如让它“一步一步思考后再回答”。这种被称为“思维链提示”的方法显著提升了人工智能的性能。
推理机本质上实现了整个过程的自动化,在真正给出答案之前生成“思考标记”。这至少在两个重要方面取得了突破。首先,由于人工智能公司现在可以让人工智能基于真正优秀的问题解决者的例子来学习如何推理,因此人工智能可以更有效地“思考”。这种训练过程可以产生比我们通过提示更高质量的思维链。这意味着推理机能够解决更难的问题,尤其是在数学或逻辑等领域,而这些领域是旧式聊天机器人无法胜任的。
这一突破的第二个方面是,推理机“思考”的时间越长,他们的答案就越好(尽管改进的速度会随着思考时间的延长而减慢)。这意义重大,因为过去让人工智能表现更好的唯一方法是训练越来越大的模型,而这非常昂贵,并且需要大量数据。推理模型表明,只需让人工智能产生越来越多的思考标记,并在回答问题时使用计算能力(称为推理时计算),而不是在模型训练时,就能让人工智能变得更好。
研究生水平的谷歌验证问答测试 (GPQA) 是一系列多项选择题,互联网无法帮助博士们完成这项测试。能够上网的博士们在非专业领域中,正确率仅为 34%,而专业领域内则为 81%。这说明了推理模型如何加速了人工智能能力的提升。数据来源。

由于 Reasoner 尚处于萌芽阶段,其功能正在迅速扩展。短短几个月内,我们已经见证了 OpenAI 的 o1 系列到全新 o3 模型的显著改进。与此同时,中国的 DeepSeek r1 也找到了提升性能并降低成本的创新方法,谷歌也推出了首款 Reasoner。这仅仅是个开始——期待很快能看到更多如此强大的系统。
代理商
尽管专家们对人工智能代理的确切定义存在争议,但我们可以简单地将其理解为“被赋予目标并能够自主追求该目标的人工智能”。目前,人工智能实验室正在竞相构建通用代理——能够处理任何任务的系统。我曾撰写过一些早期的例子,例如 Devin 和Claude 的 Computer Use ,但 OpenAI 刚刚发布了 Operator,这可能是迄今为止最完善的通用代理。
下面的视频加速了 16 倍,捕捉到了通用智能体的潜力和陷阱。我给 Operator 一个任务:*阅读我在 OneUsefulThing 上最新的 substack 帖子,然后登录 Google ImageFX 制作一张合适的图片,下载下来,让我发布。*接下来发生的事情令人大开眼界。起初,Operator 的动作非常精准——找到我的网站、阅读帖子、导航到 ImageFX(短暂暂停让我输入登录信息)并创建图片。然后麻烦就开始了,而且是双重的:Operator 不仅被 OpenAI 的文件下载安全限制所阻止,而且它自己也开始难以完成任务。智能体有条不紊地尝试了所有可以想到的解决方法:复制到剪贴板、生成直接链接,甚至深入研究网站的源代码。每次尝试都失败了——有些是因为 OpenAI 的浏览器限制,有些是因为智能体自己不知道如何真正完成任务。观察这个坚定但最终失败的解决问题循环,既揭示了这些系统当前的局限性,也提出了关于代理在现实世界中遇到障碍时最终会如何表现的问题。
操作员的问题凸显了通用智能体目前的局限性,但这并不意味着智能体毫无用处。看来,专注于特定任务、具有经济价值的窄带智能体已经成为可能。这些专家型智能体在当前 LLM 技术的驱动下,能够在各自的领域取得显著成果。OpenAI 最新推出的“深度研究”就是一个很好的例子,它展示了专注型 AI 智能体的强大威力。
深入研究
OpenAI 的Deep Research (不要与 Google 的Deep Research混淆,稍后会详细介绍)本质上是一个狭义的研究代理,基于 OpenAI 尚未发布的 o3 Reasoner 构建,并可以使用特殊工具和功能。这是我最近见过的令人印象深刻的人工智能应用之一。为了理解原因,我们先来讨论一下。我将在我的研究领域中选择一个技术性很强且争议很大的问题:初创公司应该何时停止探索并开始扩大规模?我希望您研究一下这个主题的学术研究,重点关注高质量的论文和 RCT,包括处理有问题的定义以及常识和研究之间的冲突。展示研究结果以供研究生阶段讨论这个问题。

AI 会问一些聪明的问题,然后我明确我想要什么。现在,o3 开始工作了。你可以看到它的进度和“思考”过程。下面是几个这个过程的示例,值得你花点时间看看。你可以看到,AI 实际上就像一名研究员一样,探索发现,深入挖掘它“感兴趣”的事物,并解决问题(比如寻找其他方法来访问付费文章)。这个过程持续了五分钟。
认真花点时间看看它的“思考”过程的这三个部分

最后,我得到了一份13页、3778字的草稿,其中包含6条引文和一些补充参考文献。说实话,这份草稿写得非常好,尽管我本来希望多加一些参考文献。它巧妙地融合了晦涩难懂且相互矛盾的概念,发现了一些我意想不到的新颖联系,只引用了高质量的文献,并且引用了大量准确的信息。我无法保证所有内容都准确无误(尽管我没有发现任何错误),但如果一个博士生能写出这样的文章,我就很满足了。你可以在这里看到完整的成果,但下面的几段摘录足以说明我为何如此印象深刻。

引用质量也标志着一项真正的进步。这些并非常见的AI幻觉或错误引用的论文——而是真实的高质量学术资源,包括我的同事Saerom (Ronnie) Lee和Daniel Kim的开创性著作。当我点击链接时,它们不仅会引导我找到论文,还会直接带我到相关的突出显示的引用。虽然仍然存在一些限制——AI只能访问它在几分钟内找到并阅读的内容,而且付费文章仍然无法访问——但这代表着AI与学术文献互动方式的根本转变。AI首次不再只是总结研究成果,而是积极地参与其中,其水平实际上接近人类的学术工作。

值得将其与谷歌上个月推出的名为“深度研究”(叹气)的产品进行对比。谷歌提供的引用数量更多,但通常都是质量参差不齐的网站(无法访问付费墙信息和书籍,这对所有这些代理都造成了损害)。它似乎一次性收集所有文档,这与 OpenAI 研究员代理受好奇心驱动的探索不同。而且,由于(截至目前)它是由非推理的较旧的 Gemini 1.5 模型驱动,因此整体摘要更加肤浅,但仍然可靠且似乎没有错误。它就像一个非常优秀的本科生产品。我想,如果你读一下下面的内容,就会清楚地看到其中的区别。

从这个角度来看:这两种输出都代表了通常需要花费数小时人力才能完成的工作——OpenAI 的系统需要接近博士水平的分析,而 Google 的系统则需要扎实的本科生工作。OpenAI在他们的公告中做出了一些大胆的声明,并附有图表表明他们的代理可以处理 15% 的高经济价值研究项目和 9% 的非常高价值的研究项目。虽然这些数字值得怀疑——他们没有解释他们的方法——但我的实际测试表明他们并非完全没有根据。深度研究确实可以在几分钟而不是几小时内产生有价值、复杂的分析。鉴于快速的发展速度,我预计谷歌不会让这种能力差距持续很长时间。我们可能会在未来几个月看到研究代理的快速改进。
各个部分组合在一起
你可以开始看到,人工智能实验室正在构建的各个部分不仅仅是相互契合,它们还在相互影响。推理机提供智力马力,而代理系统则提供行动能力。目前,我们正处于像深度研究这样的狭义代理时代,因为即使是我们最好的推理机也还没有准备好实现通用自主性。但狭义并非限制——这些系统已经能够完成曾经需要高薪专家团队或专业咨询公司才能完成的工作。
这些专家和咨询机构不会消失——如果说有什么不同的话,那就是随着他们从实际工作发展到协调和验证人工智能系统的工作,他们的判断力将变得更加重要。但实验室相信这仅仅是个开始。他们坚信,更好的模型将破解通用智能体的密码,超越狭隘的任务,成为能够浏览网页、处理各种信息并在世界上采取有意义行动的自主数字工作者。Operator 表明我们尚未实现这一目标,但 Deep Research 表明我们可能正在朝着这个目标迈进。