非平稳性与MARL基础 — MARL通信笔记
多智能体强化学习通信机制的分章节学习地图。
非平稳性与MARL基础
多智能体强化学习的核心挑战不在于单一代理的复杂度,而在于代理之间动态交互产生的非平稳性。理解这一本质是掌握通信、协作与 CTDE 范式的必经之路。
多智能体强化学习 (MARL)
MARLMulti-Agent Reinforcement Learning,多个学习主体在共享环境中通过奖励机制进行演化的技术框架 是由多个独立的智能体在同一个共享环境中同时学习。这不仅仅是“多个单体强化学习”的简单堆叠,因为代理之间的行为相互耦合。每个代理的目标是最大化自己的累积回报,但在达成目标的过程中,它必须应对其他代理带来的不确定性。
部分可观测 (Partial Observability)
在现实的分布式系统中,每个代理通常只能获得部分可观测 (Partial Observability)个体由于感知范围或传感器限制,只能获取全局状态的一个子集信息。这意味着决策必须基于不完整的上下文,代理往往不知道全局状态,甚至不知道队友的具体动作和意图。
非平稳性 (Non-stationarity)
非平稳 (Non-stationarity)由于环境中其他学习者策略不断演进,导致个体观测到的环境转换概率和奖励分布随时间发生漂移 是 MARL 训练中最棘手的问题。在单智能体 RL 中,环境是静止的(Stationary);但在多智能体中,当 Agent A 在学习时,它的行为模式(策略 Policy从观测状态到执行动作的映射规则)在变。对于 Agent B 而言,这种变化导致即便它执行同样的动作,获得的回报 (Reward)环境反馈给个体的数值化评价指标也会随时间漂移。
核心结论: 非平稳性是 MARL 一切算法设计的起点。无论是引入中心化评价(Centralized Critic),还是通过显式通信共享观测,其本质都是为了在变动的环境中寻找一份“确定的参考系”。