一题一页 · 能力目标 · 也叫 通用人工智能、Artificial General Intelligence

AGI 到底指什么?谁说了算「算不算达到」?

指能像人一样处理各种不同任务的 AI。它是一个目标和讨论话题,不是某个产品或模型,各家对「算不算达到」的定义并不一致。

先看懂

能力目标
AGI(通用人工智能)
「什么都能干的 AI」这个目标
不是产品,也没有公认的判定标准

此刻在看:静态解释,这一页的 5 个部分都是这一种。

主张依据 2 类:原始论文、编辑解释。

核实状态:这一页没有需要核实的结论,所以这一维是空的。

三个维度分别看:演示方式、主张依据、核实状态

演示方式

表示此刻展示方式,不是准确性等级。

  • 顶部三秒卡 静态解释
  • 举例与能/不能三栏 静态解释
  • 别和这几个搞混 静态解释
  • 主张与依据 静态解释
  • 展开后的正文 静态解释

主张依据

可多选,每种都有实际引用;「本站实验」需有记录。

  • 原始论文 Levels of AGI for Operationalizing Progress on the Path to AGI
    「它能」第一条那种按表现水平与任务广度分级的读法,来自这篇论文提出的框架。
    这一条转述这篇论文提出的分级框架;本站的记录说不出读到了它的哪一层。
    「从两个方向看」那一句用的是这篇论文的分级方向。
  • 编辑解释
    本站自己写的,没有外部引用。
    「什么都能干的 AI 这个目标」是本站为三秒卡写的说法,不是哪份材料里的定义。
    举例那段争论与「它不能」三条是本站写的界定。
    与 OpenClaw、大模型的两条区别是本站写的对照。
    三段正文的其余部分(它不是一个东西、为什么大家总在争、遇到这个词怎么判断)是本站的解释。这一页没有结构关系可显示。

核实状态

附范围、时间及必要原因,不等于全页绝对正确。

这一页没有需要核实的结论,所以这一维是空的——不会因为它挂着论文就替它标一个「已核对」。

举个例子

有人说「某模型已经达到 AGI」,另一人坚决不同意。两人往往不是在争模型的表现,而是各自对 AGI 的定义不同。

它能
  • 作为讨论框架,按「表现水平」和「任务广度」分级衡量进展
  • 提醒人区分「在一件事上很强」和「什么事都能做」
它不能 / 不是
  • 没有公认的判定标准,也没有一个公认的「达到」时刻
  • 它不是任何公司的产品,也不是某个软件的功能
  • 一个软件火了、一个模型分数高了,都不等于 AGI 到了

别和这几个搞混

想看细节再点开

它不是一个东西

前面两个词,OpenClaw 是能安装的软件,harness 是软件里的机制,它们都是「实物」。AGI 不是。它是一个关于「AI 要强到什么程度才算通用」的目标,像「登月」之于航天,而不是像「火箭」。

为什么大家总在争

因为「通用」没有公认的量法。一种常见的分法是从两个方向看:在单个任务上有多强,能覆盖多少种任务。一个模型可以在考试题上超过大多数人,同时在订一张机票时出错。它算不算通用,取决于你把哪一头看得更重。

遇到这个词时怎么判断

看到「AGI 来了」这类说法,先问三个问题:说话的人用的是哪个定义?证据是哪些任务上的表现?有没有把某个软件的热度当成了能力的证据?

谁指向了这个词

  • ← 容易和……混淆OpenClaw一个是软件,一个是能力目标。OpenClaw 火了不等于 AGI 来了

查证据

主张与依据

  • Google DeepMind 的研究者在 2023 年提出「Levels of AGI」框架,按表现水平和任务广度分级讨论进展,并说明这是一种研究框架。 [ levels-of-agi-2023 ]

档案目录

  1. 论文英文

    levels-of-agi-2023

    Levels of AGI for Operationalizing Progress on the Path to AGI

    出版方/保存方
    arXiv (Google DeepMind)
    原页语言
    英文
    来源发布
    本站访问
    核对程度:相关段落逐字核对

    摘要、第 3 节六项原则、第 4 节广度×表现分级,以及第 6 节能力与自治;没有逐条复核全部引用或把作者框架当成行业标准。
    访问结果:正常取到

    按表现水平和广度分级讨论 AGI,并把能力与自治区分开的研究框架;不是行业统一标准。

    打开原始来源