行业头部对 AI 发展阶段的定义有三家代表性观点——OpenAI 看能力梯队、英伟达看技术形态、红杉看时间表。三家本质都在说 "Agent 是下一站",但视角不同。

OpenAI 的五阶段能力梯队

AI 等级 名称 交互能力 认知能力 泛化能力 自主能力
L1 聊天机器人 ChatBot 具备语言对话能力,简单一问一答 处理事务 局限于特定领域任务 依赖人类指令,按步骤执行
L2 推理者 Reasoner 上下文深入交流 链式推理,解决人类水平问题 — —
L3 智能体 Agent 在环境中动态交互 — 跨领域整合 设定目标后自主完成复杂任务
L4 创新者 Innovator — 创新性思考,帮助发明创新 — —
L5 组织者 Organization 在系统中协同运作 — 多领域泛化 能完成组织级工作

阶段递进逻辑

五个阶段体现了四个维度的渐进式突破:交互能力从一问一答到系统协同,认知能力从简单处理到创新思考,泛化能力从单领域到多领域,自主能力从依赖指令到自主完成组织目标。每一级并非完全替代前一级,而是在前一级基础上新增核心能力。

当前(2026)主流大模型处于 L1-L2 阶段,Agent 框架正在探索 L3 能力。

英伟达的技术形态四阶段

英伟达更关注"AI 能处理什么形式的输入输出",把发展路径拆成四种技术形态:

感知 AI    →    生成式 AI    →    代理式 AI    →    具身 AI
(Perception)  (Generative)   (Agentic)       (Embodied / Physical)
阶段 核心能力 代表产品
感知 AI 识别图像、语音、文本——把现实世界数字化 人脸识别、语音转文本、目标检测
生成式 AI 生成新内容——文本、图像、视频、代码 ChatGPT、Midjourney、Sora
代理式 AI 自主决策、调用工具、完成任务 Claude Code、Devin、Manus
具身 AI AI 与物理世界交互——机器人、自动驾驶 人形机器人、自动驾驶系统

英伟达的观点:"Agent 是人工智能发展的新浪潮,和具身智能一样,是未来的大趋势。"

红杉资本的时间表

红杉资本对 AI 节奏的判断更直接——给出时间节点:

年份 红杉的判断
2025 AI 代理开始工作(Agent 进入生产环境)
2026 AI 将发现新知识(Innovator 雏形)
2027 AI 将进入物理世界创造价值(Embodied AI 落地)

红杉的视角是投资节奏——告诉投资人和创业者"什么时候该押注什么方向"。

三家观点的映射关系

OpenAI 能力梯队 英伟达技术形态 红杉时间表
L1 ChatBot 生成式 AI(初级) 已发生(2022-2023)
L2 Reasoner 生成式 AI(成熟) 已发生(2024-2025)
L3 Agent 代理式 AI 2025-2026
L4 Innovator 代理式 AI(深度推理) 2026
L5 Organization (多 Agent 协同) 2027+
—— 具身 AI 2027+

三家视角并不冲突,OpenAI 看的是单模型能力的成熟度,英伟达看的是产业形态的演进,红杉看的是商业化的时间窗口。

L1-L2 为何是"通用模型上界"

L1-L2 的核心能力——对话与推理——可以由单次模型调用完成,只要把上下文和推理过程塞进 Prompt 就能跑。这意味着任何具备底座模型 + Prompt 工程的团队都能做到 L2,所以这两级很快就成为"基础设施",价格与能力都被通用大模型拉平。

L3 开始引入"环境交互"和"多步骤自主决策",单次模型调用无法承载,必须靠框架——这就是 Agent 框架(见 Agent五要素技术定义)存在的根本原因:用 LLM+Memory+Planning+Tools+Action 五要素把多次模型调用串成可控流程。

企业何时该准备 Agent

  • 场景仍能用一问一答覆盖 → 留在 L1-L2,把 Prompt 和 RAG 做扎实就够(见 提示词设计五要素、RAG)
  • 场景需要跨系统取数+执行+回写 → 必须上 L3 Agent,否则模型只能"建议"而不能"完成"
  • 场景需要原创发现/科研突破 → L4 暂未到位,不应押注
  • L5 是远期愿景,当前组织级协同仍靠人 + Agent 矩阵协同实现

判断关键:任务能不能用"一次提问 + 一次回答"完成。能 → L2 够用;不能 → 准备 L3。

相关页面

→ 互联网发展四阶段 → 六大成熟AI应用场景 → Agent五要素技术定义 → Agent vs Workflow → 提示词设计五要素 → RAG → AIPM课程 Day1 → AIPM课程 Day9