ランニングできず 英語できず DeepMindとOpenAIの人間の好みを反映した強化学習の論文を読む 「Deep reinforcement learning from human preferences」 [1706.03741] Deep reinforcement learning from human preferences 強化学習では報酬が明確でないと学…
引用をストックしました
引用するにはまずログインしてください
引用をストックできませんでした。再度お試しください
限定公開記事のため引用できません。