0 Star 0 Fork 0

鬼&泣 / TD-tuple-net-for-2048

加入 Gitee
与超过 1200万 开发者一起发现、参与优秀开源项目,私有仓库也完全免费 :)
免费加入
克隆/下载
贡献代码
同步代码
取消
提示: 由于 Git 不支持空文件夾,创建文件夹后会生成空的 .keep 文件
Loading...
README
MIT

TD-tuple-net-for-2048

介绍

《Temporal Difference Learning of N-Tuple Networks for the Game 2048》是第一个使用Reinforcement Learning方法解决《2048》游戏的,本项目为对该论文python版本的实现。由于《2048》游戏的独特性因而这里使用比较少见的N-tuple网络,并且在游戏交互过程中不使用探索机制。

项目文件说明

environ文件夹下面为《2048》游戏的运行环境,其中,env_5bits_2048.py为单游戏环境版本,env_vec.py为多个游戏组成的向量环境(等同于强化学习中的多环境实体的加速训练法)。 tuple_17_4文件夹下面为N-Tuple网络的实现,这里使用的是numpy的array类型实现的。 q_learning.py为算法文件,实现了原论文《Temporal Difference Learning of N-Tuple Networks for the Game 2048》中的Q-learning方法。

不能运行的情况说明

准确的说这个项目是可以正常运行的,但是这个项目运行一段时间后(往往就是二十几分钟)就会出现N-Tuple网络的权重溢出的错误,于是将每次训练的误差值设置在[-10,10]区间内,运行一段时间后发现运行结果极为不好,准确的说这个项目所实现的算法其性能还不如随机选择的好。花费了大量时间后也没有找到合适的解决方法,于是决定将该项目废弃掉。

MIT License Copyright (c) 2022 鬼&泣 Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions: The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software. THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.

简介

《Temporal Difference Learning of N-Tuple Networks for the Game 2048》是第一个使用Reinforcement Learning方法解决《2048》游戏的,本项目为对该论文python版本的实现。由于《2048》游戏的独特性因而这里使用比较少见的N-tuple网络,并且在游戏交互过程中不使用探索机制。 展开 收起
取消

发行版

暂无发行版

贡献者

全部

近期动态

加载更多
不能加载更多了
Python
1
https://gitee.com/devilmaycry812839668/td-tuple-net-for-2048.git
git@gitee.com:devilmaycry812839668/td-tuple-net-for-2048.git
devilmaycry812839668
td-tuple-net-for-2048
TD-tuple-net-for-2048
master

搜索帮助