MARL Tag: 3v3 Pursuit-Evasion
30 Million Timesteps. Relentless Self-Play.
Engineered a self-play multi-agent RL framework utilizing Proximal Policy Optimization (PPO) with Generalized Advantage Estimation (GAE). Designed a 102-dimensional raycast spatial awareness perception network and custom physics-reward engine.