一题一页 · 技术方法 · 也叫 智能体、agent

AI 智能体和只会聊天的 AI,到底差在哪?

能自己一步步完成任务的 AI 程序。它不只回答一句话,还会调用工具、看结果、再决定下一步。它由「模型」和「harness」两部分组成。

先看懂

技术方法
AI 智能体(Agent)
会自己一步步做事的 AI 程序
= 模型 + 循环程序,不是新模型

此刻在看:静态解释,这一页的 4 个部分都是这一种。

主张依据 2 类:原始论文、编辑解释。

核实状态:这一页没有需要核实的结论,所以这一维是空的。

三个维度分别看:演示方式、主张依据、核实状态

演示方式

表示此刻展示方式,不是准确性等级。

  • 顶部三秒卡 静态解释
  • 举例与能/不能三栏 静态解释
  • 别和这几个搞混 静态解释
  • 展开后的正文与关系说明 静态解释

主张依据

可多选,每种都有实际引用;「本站实验」需有记录。

  • 原始论文 ReAct: Synergizing Reasoning and Acting in Language Models
    「想一步、做一步、看结果」这条结构关系说明指的是这篇论文;本站的记录说不出读到了它的哪一层。
  • 编辑解释
    本站自己写的,没有外部引用。
    「会自己一步步做事的 AI 程序」与「模型加循环程序,不是新模型」是本站为三秒卡写的说法。
    订火车票那个例子与「它能」「它不能」六条,是本站按这个词的通行用法写的界定,没有引任何一份材料。
    与大模型的那条区别(模型只会写字,智能体是模型加上一个会执行的程序)是本站写的对照。
    两段正文(从「回答」到「完成」、它由两部分组成)是本站的解释。

核实状态

附范围、时间及必要原因,不等于全页绝对正确。

这一页没有需要核实的结论,所以这一维是空的——不会因为它挂着论文就替它标一个「已核对」。

举个例子

你说「帮我订下周去上海的火车票」。智能体先查车次,看到结果再挑一班,再去下单,中间每一步都要看上一步的结果。

它能
  • 把一个大任务拆成多步,每步根据上一步的结果决定
  • 使用工具:搜索、读文件、运行程序、调用其他服务
  • 在任务没完成时继续,完成或出错时停下
它不能 / 不是
  • 它不是一种新模型,模型还是那个模型
  • 每一步的判断都可能出错,错误会一步步累积
  • 能做的事由 harness 给它的工具和权限决定

别和这几个搞混

想看细节再点开

从「回答」到「完成」

普通的 AI 聊天是一问一答:你问,它答,结束。智能体的区别是,它答完之后不停,而是看看任务完成了没有,没完成就继续。这个「看一眼再决定」的循环,是它和一问一答的聊天框最主要的区别。

它由两部分组成

一半是模型,负责每一步的判断和写字。另一半是 harness,负责把判断变成动作,再把动作的结果送回模型。很多新闻里说的「某某智能体」,其实是在说后面那一半做得怎么样,模型可能是大家都在用的同一个。

它和其他概念的关系

谁指向了这个词

看它发生

这一场戏的规范阅读地址在别的题下 AI 为什么能操作软件?它到底是怎么「做事」的? 「会自己一步步做事」这句话在那个场景里是一回合一回合演出来的;规范阅读地址在 tool-use,这里嵌入复用,不另写一遍

查证据

它从哪来

档案目录

  1. 论文英文

    react-paper-2022

    ReAct: Synergizing Reasoning and Acting in Language Models

    出版方/保存方
    arXiv
    原页语言
    英文
    来源发布
    本站访问
    核对程度:没有记录,说不出读到哪一层没有记录具体读到哪一层,因此不能把这条记录当作全文核对。
    访问结果:正常取到

    把“想一步、做一步、看结果”写成一个循环的论文。

    打开原始来源