| { | |
| "experiment": "Offline return-conditioned key-door control", | |
| "offline_episodes": 4000, | |
| "results": { | |
| "decision_transformer": { | |
| "parameters": 18371, | |
| "near_target": { | |
| "desired_terminal": "near_reward", | |
| "desired_terminal_rate": 1.0, | |
| "mean_return": 0.37, | |
| "mean_steps": 3.0, | |
| "episodes": 300 | |
| }, | |
| "treasure_target": { | |
| "desired_terminal": "treasure", | |
| "desired_terminal_rate": 1.0, | |
| "mean_return": 0.89, | |
| "mean_steps": 11.0, | |
| "episodes": 300 | |
| } | |
| }, | |
| "behavior_cloning": { | |
| "parameters": 595, | |
| "near_target": { | |
| "desired_terminal": "near_reward", | |
| "desired_terminal_rate": 0.3333333333333333, | |
| "mean_return": 0.7233333333333334, | |
| "mean_steps": 7.666666666666667, | |
| "episodes": 300 | |
| }, | |
| "treasure_target": { | |
| "desired_terminal": "treasure", | |
| "desired_terminal_rate": 0.6666666666666666, | |
| "mean_return": 0.7233333333333334, | |
| "mean_steps": 7.666666666666667, | |
| "episodes": 300 | |
| } | |
| } | |
| } | |
| } |