行业头部对 AI 发展阶段的定义有三家代表性观点——OpenAI 看能力梯队英伟达看技术形态红杉看时间表。三家本质都在说 "Agent 是下一站",但视角不同。

OpenAI 的五阶段能力梯队

AI 等级 名称 交互能力 认知能力 泛化能力 自主能力
L1 聊天机器人 ChatBot 具备语言对话能力,简单一问一答 处理事务 局限于特定领域任务 依赖人类指令,按步骤执行
L2 推理者 Reasoner 上下文深入交流 链式推理,解决人类水平问题
L3 智能体 Agent 在环境中动态交互 跨领域整合 设定目标后自主完成复杂任务
L4 创新者 Innovator 创新性思考,帮助发明创新
L5 组织者 Organization 在系统中协同运作 多领域泛化 能完成组织级工作

阶段递进逻辑

五个阶段体现了四个维度的渐进式突破:交互能力从一问一答到系统协同,认知能力从简单处理到创新思考,泛化能力从单领域到多领域,自主能力从依赖指令到自主完成组织目标。每一级并非完全替代前一级,而是在前一级基础上新增核心能力。

当前(2026)主流大模型处于 L1-L2 阶段,Agent 框架正在探索 L3 能力。

英伟达的技术形态四阶段

英伟达更关注"AI 能处理什么形式的输入输出",把发展路径拆成四种技术形态:

感知 AI    →    生成式 AI    →    代理式 AI    →    具身 AI
(Perception)  (Generative)   (Agentic)       (Embodied / Physical)
阶段 核心能力 代表产品
感知 AI 识别图像、语音、文本——把现实世界数字化 人脸识别、语音转文本、目标检测
生成式 AI 生成新内容——文本、图像、视频、代码 ChatGPT、Midjourney、Sora
代理式 AI 自主决策、调用工具、完成任务 Claude Code、Devin、Manus
具身 AI AI 与物理世界交互——机器人、自动驾驶 人形机器人、自动驾驶系统

英伟达的观点:"Agent 是人工智能发展的新浪潮,和具身智能一样,是未来的大趋势。"

红杉资本的时间表

红杉资本对 AI 节奏的判断更直接——给出时间节点:

年份 红杉的判断
2025 AI 代理开始工作(Agent 进入生产环境)
2026 AI 将发现新知识(Innovator 雏形)
2027 AI 将进入物理世界创造价值(Embodied AI 落地)

红杉的视角是投资节奏——告诉投资人和创业者"什么时候该押注什么方向"。

三家观点的映射关系

OpenAI 能力梯队 英伟达技术形态 红杉时间表
L1 ChatBot 生成式 AI(初级) 已发生(2022-2023)
L2 Reasoner 生成式 AI(成熟) 已发生(2024-2025)
L3 Agent 代理式 AI 2025-2026
L4 Innovator 代理式 AI(深度推理) 2026
L5 Organization (多 Agent 协同) 2027+
—— 具身 AI 2027+

三家视角并不冲突,OpenAI 看的是单模型能力的成熟度,英伟达看的是产业形态的演进,红杉看的是商业化的时间窗口。

L1-L2 为何是"通用模型上界"

L1-L2 的核心能力——对话与推理——可以由单次模型调用完成,只要把上下文和推理过程塞进 Prompt 就能跑。这意味着任何具备底座模型 + Prompt 工程的团队都能做到 L2,所以这两级很快就成为"基础设施",价格与能力都被通用大模型拉平。

L3 开始引入"环境交互"和"多步骤自主决策",单次模型调用无法承载,必须靠框架——这就是 Agent 框架(见 Agent五要素技术定义)存在的根本原因:用 LLM+Memory+Planning+Tools+Action 五要素把多次模型调用串成可控流程。

企业何时该准备 Agent

  • 场景仍能用一问一答覆盖 → 留在 L1-L2,把 Prompt 和 RAG 做扎实就够(见 提示词设计五要素RAG
  • 场景需要跨系统取数+执行+回写 → 必须上 L3 Agent,否则模型只能"建议"而不能"完成"
  • 场景需要原创发现/科研突破 → L4 暂未到位,不应押注
  • L5 是远期愿景,当前组织级协同仍靠人 + Agent 矩阵协同实现

判断关键:任务能不能用"一次提问 + 一次回答"完成。能 → L2 够用;不能 → 准备 L3。

相关页面

互联网发展四阶段六大成熟AI应用场景Agent五要素技术定义Agent vs Workflow提示词设计五要素RAGAIPM课程 Day1AIPM课程 Day9