sunnyswag / StockRL

在A股(股票)市场上训练强化学习交易智能体
GNU General Public License v3.0
190 stars 81 forks source link

关于agents衰退区间相似的问题 #5

Closed scirocc closed 3 years ago

scirocc commented 3 years ago

您这里提出,多个agent的回撤区间都差不多,可不可以利用ma-ppo对多个智能体加一个惩罚项呢,就让多个智能体在相同state下输出的action相似时就给他们一个负的reward。我看过很多研报,基本都是在说要尽量训练多个不相似的agent,然后把他们的决策汇总作为最终输出(类似boosting)

sunnyswag commented 3 years ago

重复问题,见 #4