Zouzouw/act_fusion_ft2

Politique ACT pour le bras SO-101, entrainee par apprentissage par imitation.

Fine-tuning de Zouzouw/act_fusion sur Zouzouw/dataset_3cube3couleur.

Base Zouzouw/act_fusion — ACT entrainee sur Zouzouw/fusion (319 episodes)
Dataset de fine-tuning Zouzouw/dataset_3cube3couleur (96 episodes)
Learning rate 1e-06
Checkpoints 200 000 (racine) et 150 000 (sous-dossier 150000/)
Politique ACT

Variante a learning rate plus faible, conservee comme point de comparaison avec act_fusion_ft1.

La tache

Attraper trois cubes — vert, puis rouge, puis noir — et poser chacun sur la croix de sa couleur, dans cet ordre.

Le learning rate, et pourquoi il y a deux depots

act_fusion_ft1 et act_fusion_ft2 sont le meme fine-tuning a deux learning rates, pour trouver le bon equilibre :

Depot Learning rate
act_fusion_ft1 1e-05 le plus performant a ce jour
act_fusion_ft2 1e-06 plus prudent, se specialise moins

Le learning rate regle la vitesse a laquelle le modele revise ce qu'il sait. Trop eleve, il oublie la base et ne garde que la nouvelle tache. Trop faible, il ne se specialise pas et reste sur son comportement general. La recherche du bon reglage n'est pas terminee : d'autres valeurs restent a essayer, en repartant de la base, qui inclut l'etat de l'optimiseur.

Comparez sur le robot, pas seulement sur les courbes d'entrainement. Une courbe de perte qui descend bien ne garantit pas un meilleur geste.

Utilisation

lerobot-rollout --policy.path=Zouzouw/act_fusion_ft2 --robot.type=so101_follower ...

Contenu : les poids seuls, suffisants pour l'inference. Pour relancer un entrainement, partir de Zouzouw/act_fusion.

Downloads last month
-
Safetensors
Model size
51.7M params
Tensor type
F32
·
Video Preview
loading