2026年4月首稿;2026年7月更新(METR v1.1、AI Futures Q1、tracker 对照、结构重写)。
圈内和预测市场都在说 2027–2028。只读 AI 2027 会以为是一个前 OpenAI 研究员在带节奏——其实不是:算力外推、METR 任务时长、R&D 自动化模型、专家调查、宏观物理极限、实验室负责人口径,多条独立路径都落在 2020 年代末 附近。
这个交点值得认真对待,也值得追问:几种方法可能在共享同一组未言明假设;而「身边人为什么不慌」往往是因为大家说的根本不是同一种 AGI。
「AGI」在预测里到底指什么
先对齐定义,再比数字。 不同调查量的是不同门槛:
| 术语 | 量的是什么 |
|---|---|
| HLMI(AI Impacts 调查) | 无辅助机器在所有任务上比人类更好更便宜 |
| METR time horizon | 50% 成功率下智能体能独立工作多久 |
| Automated Coder(AI Futures) | 公司宁愿裁掉所有人类软件工程师也不停用 AI 编程 |
| Weakly general AI(Metaculus) | 满足 4 条公开标准(含部分机器人能力) |
| Minimal AGI(Shane Legg) | 大多数典型人类认知任务 |
拿「2047」(专家 HLMI 中位)和「2028年4月」(Metaculus weak AGI)直接比,讨论就没有意义。
本文后文说的「AGI 很近」,默认更接近 METR / Automated Coder 口径: 能可靠地完成数小时到一周量级的真实工作(写代码、跑研究、用电脑办事),而不是电影里的全知全能、也不是「通过了某个考试」。普通人听到 AGI 往往想到后者;圈内收敛在 2027–28 时想的通常是前者。这是「预测很急、生活还很正常」的第一层原因。
AI 2027 是什么:近景预测(情景),不是水晶球
近景预测 / 情景 ≠ 「何时 AGI」
Karnofsky 的 Most Important Century 开创了一种写法:不问「哪年」,而问 「若 transformative AI 在类似今日的世界里出现,因果链会怎样?」——这叫 nearcasting / 情景。
AI 2027(Daniel Kokotajlo、Eli Lifland 等)是目前最细的一例:从 2025 到 2027 年底的逐月叙事——智能体从不靠谱到超人类程序员、中美算力博弈、对齐退化、人类是否失去控制;附两个结局(竞赛 vs 减速)、五个研究附录、53 条可追踪的具体预测(算力、智能体、经济、治理、地缘等)。
要点:
- 情景不是点预测。 研究附录里 ASI 中位 2028.4,80% 置信区间 2027.6 – >2100;叙事读起来像「2027年3月:算法突破」,容易忘记后面是个宽分布。
- 它仍然极有价值: 逼你把因果链写具体——若超人类程序员出现,然后开源 mini 版,然后百万副本跑研究,然后呢? 比「AI 可能很危险」难偷懒得多。
- 和本文关系: 下面六种方法是「外推何时」;AI 2027 是「若时间线长这样,世界长怎样」。两者互补,不能混为一谈。
现实对照:AI 2027 Tracker(2026 年 6 月)
Johannes Haus 独立追踪器 逐条打分这 53 条预测(与 AI Futures Project 无隶属关系):
| 指标 | 数值 |
|---|---|
| 速度比 | 0.70×(现实约为情景节奏的七成) |
| 已确认 | 16 / 53 |
| 超前于情景 | 3 |
| 落后 | 4 |
跑得快的一侧: 智能体形态(不靠谱但有用、贵、当助手卖)、METR 任务时长翻倍(情景假设 ~4 月翻倍,实测 Ahead)、编程智能体真实产值、Cybench 等安全基准、AI-for-AI-research 已成行业口号。
跑得慢或未验证的一侧: 10²⁸ FLOP 训练跑(前沿仍在 ~10²⁶·⁵–10²⁷)、R&D 乘数 3×+(1.5× on track,3×/4× 尚不可检验)、「超人类程序员」与 20 万并行 coding agent、股市 +30% / 3 万亿美元估值等量化目标 Behind。
方向大致对,时钟不均匀。恒定 0.70× 外推,情景里的「起飞」从 2027 末滑到 2029 中;Kokotajlo 在 AI Futures Model Q1 更新后的 Automated Coder 中位约 2028 中(若现实维持情景速度的 ~65%)。
读情景时我会保留的警觉(不必另开一篇批评)
AI 2027 对我最有用的部分:对齐失败的具体机制(Agent-2→4 的退化链)、中美博弈的可操作细节、一个决策点如何分叉结局。我会带着以下滤镜读,而不是照单全收:
- 叙事把条件句写成定论。 附录里「非预期目标」有概率;主文读起来像一定会欺骗、一定会失控。
- 经济与社会心理几乎缺席。 若 2027 年出现超人类程序员,白领劳动力与资产价格不会等到 2028 才动——Ghost GDP 类传导在正文里几乎没展开。
- 人类心理可能是更早的变量。 Pedersen 拟合五个指标:四个能力曲线近似线性,唯一双曲增长的是人类对 AI 的关注与恐慌——而企业已在按潜力而非表现裁员(HBR 2026)。
这些盲点不否定情景的价值;它们解释为什么「按 AI 2027 日历生活」和「按 METR 曲线生活」可以是两种日常体验。
六种量化路径(外推「何时」)
1. 算力 / 数量级外推
问:从 GPT-4 到 AGI 还要几个数量级的有效算力?
Aschenbrenner Situational Awareness(2024):原始算力、算法效率、解除束缚各 ~0.5 数量级/年 → 2027 前 AGI「惊人地可信」。
Cotra bio anchors(2020):社区中位从 ~2050 前移到 ~2035–37。
Epoch AI:前沿 ~10²⁶·⁵–10²⁷ FLOP;>2×10²⁸ 可能触顶(数据搬运瓶颈)。
分歧点: 2024–25 预训练放缓是暂时波动还是天花板?
2. 能力曲线外推(我最信的一条)
METR time horizon(v1.1, 2026-01)——50% 成功率下智能体能独立干多久:
| 窗口 | 翻倍时间 |
|---|---|
| 全历史 | ~196 天 |
| ≥2023 | ~131 天 |
| ≥2024 | ~89 天(约 3 月) |
朴素外推 → ~2028 年 AI 能独立完成约一周工作。不需要精确到月,已经足够改变就业与研发组织。
80,000 Hours AGI guide 是更易读版。
分歧点: 2024+ 加速是持久的 RL/智能体范式,还是一次性解除束缚?
3. R&D 自动化反馈环
不只外推算力或任务时长,而是 AI 自动化 AI 研究 → 复合加速(AI 2027 / AI Futures Model 的核心增量)。
AI Futures Q1 2026 更新:因 METR v1.1 + Opus 4.6 + Claude Code,Automated Coder 中位从 late 2029 拉回 mid 2028(Kokotajlo)。
METR 简化 8 参数模型 更保守:2032 底 >99% R&D 自动化。
分歧点: multiplier 真在复合,还是主要是并行编程、研究品味仍由人类把关?
4. 专家调查 + 预测市场
AI Impacts 2023 ESPAI(n=2,778):HLMI 50% @ 2047(正式调查里最保守);10% @ 2027。
Metaculus(2026-06):weak AGI 中位 2028 年 4 月;full AGI 中位 2032 年 10 月。
RAND AGI Forecasting Synthesis (2025):别押单一年份,准备多种情景。
分歧点: 圈内与预测市场 2023 以来大幅前移;专家 90 分位尾部(~2150)几乎不动。
5. 经济增长 / 物理极限
Karnofsky / Roodman:~2%/年 GDP 增长不能千年持续 → 21 世纪须停滞、爆发或崩溃。Karnofsky:>10% transformative AI by 2036;~50% by 2060。
论证路径不同,紧迫感方向与 AI 圈内类似。
6. 宏观怀疑论(对照组)
Acemoglu:十年约 5% 任务有利可图地自动化——「迫在眉睫的 AGI」可能是风投叙事,不是宏观现实。用来锚定慢尾,不是用来嘲笑 METR。
两种常被忽略的维度
7. 实验室负责人在说什么?
这不是第六种量化模型。 没有误差棒、不可证伪,但动资本、动招聘、动国家战略:
| 谁 | 公开口径(约) |
|---|---|
| Dario Amodei | 2026–27,「数据中心里的天才之国」 |
| Demis Hassabis | 2028–30 |
| Shane Legg | 2028 前 50% minimal AGI(2009 年以来一贯) |
| Elon Musk | 2026 底人类水平(离群值) |
FutureSearch tracker:这些日期随新闻来回摆——2025 推后,2026 Q1 智能体进展又拉前。读法:风向表,不是测量仪。
8. 「起飞速度」——AGI 之后多快?
这和「哪年 AGI」是正交问题:
- 到达: METR / Metaculus 讨论的是「何时出现能独立干一周活的系统」。
- 之后: 一旦出现能改自己代码、跑自己研究的系统,还要多久到超级智能?
Yudkowsky vs Hanson (2008) 经典对立:
| 立场 | 起飞想象 |
|---|---|
| Yudkowsky(foom) | 人类水平 → 远超人类,可能周–月级(若自我改进闭环闭合) |
| Hanson(慢多极) | 数十年渐进、多实验室、多利益方,像经济增长一样分散 |
| AI 2027 情景 | 超人类程序员出现后约 1 年到 ASI |
2027–28 收敛回答的是第一个问题;第二个问题决定你有多慌。 _tracker 显示:智能体与 METR 在快跑,10²⁸ FLOP 与 3× R&D 乘数未证实 → 「到达可能不远,起飞是否爆炸仍未知」。
收敛,还是共因?
2020 年代末交点可能只意味着大家都假设:scaling + unhobbling 继续、资本继续砸、能力可与单次预训练 FLOP 解耦。任一断裂,交点崩塌。
带走什么:为什么预测很急、身边人却不慌?
这是我写这篇最想留下的部分——不重复上面的方法清单。
1. 定义错位(最常见)
圈内 2028 常指 「能自主完成真实工作任务数天到一周」;大众 AGI 常指 「比人聪明、有意识、什么都行」。前者 METR 已在指数推进;后者根本还没 operationalize。同事觉得「ChatGPT 还是会胡说」——他们评的是聊天,你在读的是 task horizon。不是谁在撒谎,是名词没对齐。
2. 人脑不擅长指数(Tetlock / 超级预测者文献的老生常谈,但对 AI 特别致命)
METR 翻倍 ~3 月一次:从「1 小时任务」到「1 周任务」只需几次翻倍,日历上却跨好几年。直觉默认线性外推——「去年也差不多、今年也差不多」——直到某次跃迁突然显得像一夜之间。指数在纸面上合理,在生活中违反常识。
3. 渐进迭代 + 习惯化
科技发展几乎总是连续小步发布,不是电影式「审判日」。GPT-4 曾震惊,现在像自来水;Claude Code 三个月前像魔法,现在在团队里只是「又一个工具」。人脑擅长几天内适应新基线(hedonic adaptation 的文明版)。所以宏观曲线可以陡,主观体验仍平淡——直到失业、监管或事故把曲线砸到脸上(而 Pedersen 那套说法认为,恐慌曲线本身可能是唯一真正超指数的)。
4. 反应的是潜力,不是表现
企业裁员、股价叙事、政策口水,往往领先于 METR 实测——因为资本定价的是未来分布,不是本周 benchmark。这会造成分裂:研究者看曲线向上,打工人看「公司说 AI 很牛但我的工具还是半残」——两边可能同时成立。
5. 看分布,不押日期
RAND 式结论仍然成立:准备 Acemoglu 慢尾、METR 中位、AI 2027 快尾 三种世界。精确到月的日期是叙事道具;任务时长翻倍时间、tracker 速度比、R&D 乘数是否闭合 才是值得盯的仪表盘。
相关
- 我的 AI 未来预测 — 能力时间线之后:制度滞后与三种结局
- AI 2027 原文 · Tracker
- AI Futures Q1 2026 Update
- METR Time Horizon v1.1