☆ 保存 情节型 vs. 序贯型——当前行动是否会影响未来
02/18/2026
Episodic vs. Sequential 用来区分:智能体此刻的动作会不会对之后的状态与结果留下影响,还是每一次决策彼此独立、互不“记账”。
**通俗理解:**像拍一张照片就结束、每次都是独立评估的,更接近情节型(Episodic);而像下棋那样“一步影响后续局面”,就属于序贯型(Sequential)。
核心差异:动作是否“连成一条链”,还是每次都像重新开局。
机制与特点(如何运作)
-
情节型环境(Episodic):
- 一次决策对应一个完整“回合/情节”,做完就结束。
- 之前动作的结果不会传递到下一次决策中。
- 更像把问题拆成一连串相互独立的判断任务。
-
序贯型环境(Sequential):
- 决策按时间顺序连续展开,动作之间存在因果链条。
- 当前选择会改变未来的状态转移与奖励分布。
- 必须把长期后果纳入考虑,而不仅仅盯着当下得失。
-
从决策视角看差异:
- 情节型:这一刻的判断几乎就是全部,不太需要“向后看”。
- 序贯型:需要“向前看”的规划与策略,常见于顺序决策问题。
- 短期奖励与长期奖励可能冲突,容易出现“眼前赚、长期亏”的情况。
-
\[ R = r_t \]
\[ \text{当每一步的回报彼此独立时(单步回报)} \]
-
\[ R = \sum_{t=0}^{T} r_t \]
\[ \text{当回报随时间累积时(累积回报/Return)} \]
-
与现实任务的对应:
- 很多分类/判别任务更接近情节型:一次输入一次输出,互不影响。
- 机器人控制、游戏对弈更典型地属于序贯型:每一步都会改变后续局面。
意义与局限
区分情节型与序贯型,本质上是在决定:把问题看作“瞬时判断”,还是看作“随时间展开的过程”。情节型环境结构更简单、训练更容易,但很难表达复杂的长期策略;序贯型环境更贴近真实世界,却会带来长期依赖、信用分配(credit assignment)更难、训练不稳定等挑战,整体学习难度显著上升。
建议先读 (3/5)
+2
接下来推荐阅读 (5/15)
+5
- 全知智能体——能够完全知晓未来结果并始终选择最优行动的理想基准
- 理性智能体——在给定信息下选择最合理行动的决策主体
- Internet Agents vs. Robot Agents —— 用Web工具行动的智能体与驱动物理世界的智能体之差异
- 在线搜索智能体(Online Search Agents)——在移动中采集信息并持续更新规划的智能体
- PEAS:定义智能体任务环境的标准框架
- 传感器与执行器——感知环境并转化为实际行动的关键纽带
- 简单反射式智能体(Simple Reflex Agents)——对眼前刺激立刻反应的最简单智能体
- 具身智能——通过“身体”在真实世界中边行动边学习的人工智能
- 基于搜索的智能体——在状态空间中搜索从当前状态到目标状态的动作序列的智能体
- 弱自主性(Weak Autonomy)——在受限规则与既定目标内进行部分自我决策的自主能力
- 类脑人工智能(Brain-Like AI)——融合感知·学习·记忆·行动并实现自适应的认知型AI
- 物理智能(Physical AI)——在现实世界中用“身体”学习与行动的AI
- 认知人工智能(Cognitive AI)——像人类思维流程一样去理解与推理的人工智能
- 认知系统(智能体/机器人)——在环境中思考并行动的AI
- 具身智能(3G)—— 具有“身体”的智能体通过与环境交互来学习智能的方法
同一主题文章 (0/0)
该单元暂时没有其他文章。
相关概念 (0/0)
暂时没有相关概念文章。
📍 这个概念在 AI 学习地图中的位置
查看这个概念在整个 AI Universe 中的位置。
📍 AI Universe 中的当前位置
☰
重置 显示已完成 · 需要登录 加载中…
🌌 AI Universe
‹
›
⭐ 概念
请选择一个节点。