# ppo-multiseeds **Repository Path**: fzzf7478/ppo-multiseeds ## Basic Information - **Project Name**: ppo-multiseeds - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-08-20 - **Last Updated**: 2026-09-17 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # MAPPO Traffic Signal Control - 多智能体交通信号控制 ## 项目概述 基于MAPPO(Multi-Agent Proximal Policy Optimization)的多智能体深度强化学习交通信号控制系统。在SUMO 7路口仿真环境中训练和评估四个模型变体。 ## 四个模型 | 模型 | 架构特点 | 最佳Reward | 关键创新 | |------|---------|-----------|---------| | **MAVACLite SOTA V2** | 轻量级注意力(16-dim) + Tanh | -87.5 | 轻量级自注意力机制 | | **Baseline V2** | 经典MAPPO + ReLU | -95.1 | 稳定训练基线 | | **MAPPO-LCE** | 约束优化 + Tanh | -195.9 | 内置约束机制 | | **MAVACLite SOTA** | 注意力 + ReLU (当前训练) | -226.5* | 当前训练中 | *当前训练中的模型数据为最新值,非最终收敛值 ## 目录结构 ``` marl_sigctrl/ ├── framework/ # DI-engine框架 (模型定义、策略等) │ └── ding/model/template/ │ └── mavac_lite.py # MAVACLite轻量级SOTA模型 ├── signal_control/ # 交通信号控制核心代码 │ ├── entry/ # 训练入口脚本 │ │ ├── sumo_train.py # 主训练脚本 │ │ └── sumo_config/ # 各模型训练配置 │ └── smartcross/envs/ # SUMO环境接口 │ ├── sumo_env.py # 环境封装 │ └── *.yaml # 环境配置 ├── research_project/ # 研究项目数据 (来自MAPPO_Research_Project) │ ├── configs/ # 所有模型的精确配置文件 │ ├── data/ # 训练数据CSV │ ├── models/ # 模型源代码 │ ├── results/ # 图表、报告、TensorBoard日志 │ ├── visualizations/ # 可视化对比图 │ └── docs/ # 技术文档 ├── current_training/ # 当前7路口训练日志 │ ├── baseline_v2/ # Baseline V2训练日志+TensorBoard │ ├── mavac_sota/ # MAVACLite SOTA训练日志+TensorBoard │ ├── mappo_lce/ # MAPPO-LCE训练日志 │ └── configs/ # 当前训练使用的配置文件 ├── mappo_lce_260219_215952/ # MAPPO-LCE完整实验目录 ├── mavac_lite_260219_215550/ # MAVACLite完整实验目录 └── requirements.txt # 依赖包 ``` ## 环境配置 - **仿真器**: SUMO (Simulation of Urban Mobility) - **路网**: 7路口网络 (sumo_7roads_multi_agent_config_complete.yaml) - **智能体数**: 7 - **观测维度**: 32 (每个智能体) - **全局观测**: 224 (7×32) - **动作空间**: 4 (每个路口的信号相位) - **奖励**: pressure权重=0.1 ## 框架依赖 - Python 3.8+ - DI-engine - SUMO - PyTorch - TensorBoard ## 训练命令 ```bash # Baseline V2 python signal_control/entry/sumo_train.py -d sumo_7roads_baseline_v2_windows_stable -e sumo_7roads_multi_agent_config_complete # MAVACLite SOTA python signal_control/entry/sumo_train.py -d sumo_7roads_mavac_sota_continuous_1hr -e sumo_7roads_multi_agent_config_complete ``` ## 查看TensorBoard ```bash tensorboard --logdir=current_training/ ```