MuZero = 状態遷移モデル+AlphaZero を簡単に解説しつつ、atari環境のBreakout(ブロック崩し)向けにtensorflow2での実装例を紹介します MuZeroとは アルゴリズムの概要 モンテカルロ木探索 MuZero版モンテカルロ木探索 VAE系世界モデルとの比較 MuZero Reanalyze MuZeroの実装 メインループ Actorによるサンプル収集 MuZero版モンテカルロ木探索 ネットワーク構造 Learnerによるネットワーク更新 Breakoutの学習結果 次:EfficientZeroV2 Deepmind's MuZero (reimplem…