行业头部对 AI 发展阶段的定义有三家代表性观点——OpenAI 看能力梯队、英伟达看技术形态、红杉看时间表。三家本质都在说 "Agent 是下一站",但视角不同。
OpenAI 的五阶段能力梯队
| AI 等级 | 名称 | 交互能力 | 认知能力 | 泛化能力 | 自主能力 |
|---|---|---|---|---|---|
| L1 聊天机器人 | ChatBot | 具备语言对话能力,简单一问一答 | 处理事务 | 局限于特定领域任务 | 依赖人类指令,按步骤执行 |
| L2 推理者 | Reasoner | 上下文深入交流 | 链式推理,解决人类水平问题 | — | — |
| L3 智能体 | Agent | 在环境中动态交互 | — | 跨领域整合 | 设定目标后自主完成复杂任务 |
| L4 创新者 | Innovator | — | 创新性思考,帮助发明创新 | — | — |
| L5 组织者 | Organization | 在系统中协同运作 | — | 多领域泛化 | 能完成组织级工作 |
阶段递进逻辑
五个阶段体现了四个维度的渐进式突破:交互能力从一问一答到系统协同,认知能力从简单处理到创新思考,泛化能力从单领域到多领域,自主能力从依赖指令到自主完成组织目标。每一级并非完全替代前一级,而是在前一级基础上新增核心能力。
当前(2026)主流大模型处于 L1-L2 阶段,Agent 框架正在探索 L3 能力。
英伟达的技术形态四阶段
英伟达更关注"AI 能处理什么形式的输入输出",把发展路径拆成四种技术形态:
感知 AI → 生成式 AI → 代理式 AI → 具身 AI
(Perception) (Generative) (Agentic) (Embodied / Physical)
| 阶段 | 核心能力 | 代表产品 |
|---|---|---|
| 感知 AI | 识别图像、语音、文本——把现实世界数字化 | 人脸识别、语音转文本、目标检测 |
| 生成式 AI | 生成新内容——文本、图像、视频、代码 | ChatGPT、Midjourney、Sora |
| 代理式 AI | 自主决策、调用工具、完成任务 | Claude Code、Devin、Manus |
| 具身 AI | AI 与物理世界交互——机器人、自动驾驶 | 人形机器人、自动驾驶系统 |
英伟达的观点:"Agent 是人工智能发展的新浪潮,和具身智能一样,是未来的大趋势。"
红杉资本的时间表
红杉资本对 AI 节奏的判断更直接——给出时间节点:
| 年份 | 红杉的判断 |
|---|---|
| 2025 | AI 代理开始工作(Agent 进入生产环境) |
| 2026 | AI 将发现新知识(Innovator 雏形) |
| 2027 | AI 将进入物理世界创造价值(Embodied AI 落地) |
红杉的视角是投资节奏——告诉投资人和创业者"什么时候该押注什么方向"。
三家观点的映射关系
| OpenAI 能力梯队 | 英伟达技术形态 | 红杉时间表 |
|---|---|---|
| L1 ChatBot | 生成式 AI(初级) | 已发生(2022-2023) |
| L2 Reasoner | 生成式 AI(成熟) | 已发生(2024-2025) |
| L3 Agent | 代理式 AI | 2025-2026 |
| L4 Innovator | 代理式 AI(深度推理) | 2026 |
| L5 Organization | (多 Agent 协同) | 2027+ |
| —— | 具身 AI | 2027+ |
三家视角并不冲突,OpenAI 看的是单模型能力的成熟度,英伟达看的是产业形态的演进,红杉看的是商业化的时间窗口。
L1-L2 为何是"通用模型上界"
L1-L2 的核心能力——对话与推理——可以由单次模型调用完成,只要把上下文和推理过程塞进 Prompt 就能跑。这意味着任何具备底座模型 + Prompt 工程的团队都能做到 L2,所以这两级很快就成为"基础设施",价格与能力都被通用大模型拉平。
L3 开始引入"环境交互"和"多步骤自主决策",单次模型调用无法承载,必须靠框架——这就是 Agent 框架(见 Agent五要素技术定义)存在的根本原因:用 LLM+Memory+Planning+Tools+Action 五要素把多次模型调用串成可控流程。
企业何时该准备 Agent
- 场景仍能用一问一答覆盖 → 留在 L1-L2,把 Prompt 和 RAG 做扎实就够(见 提示词设计五要素、RAG)
- 场景需要跨系统取数+执行+回写 → 必须上 L3 Agent,否则模型只能"建议"而不能"完成"
- 场景需要原创发现/科研突破 → L4 暂未到位,不应押注
- L5 是远期愿景,当前组织级协同仍靠人 + Agent 矩阵协同实现
判断关键:任务能不能用"一次提问 + 一次回答"完成。能 → L2 够用;不能 → 准备 L3。
相关页面
→ 互联网发展四阶段 → 六大成熟AI应用场景 → Agent五要素技术定义 → Agent vs Workflow → 提示词设计五要素 → RAG → AIPM课程 Day1 → AIPM课程 Day9