This is a pre-trained model (TQC agent) for XArm6Push-v3 simulation task env, defined in here.
Hyperparameters:
OrderedDict([
('batch_size', 2048),
('buffer_size', 1000000),
('ent_coef', 'auto'),
('gamma', 0.95),
('learning_rate', 0.001),
('learning_starts', 100),
('policy', 'MultiInputPolicy'),
('policy_kwargs', dict(net_arch=[512, 512, 512], n_critics=2)),
('replay_buffer_class', HerReplayBuffer),
('replay_buffer_kwargs', dict( goal_selection_strategy='future', n_sampled_goal=4)),
('tau', 0.05)
])
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support