SAE OthelloGPT — Modelos entrenados y datos de evaluación
Modelos de Sparse Autoencoder (SAE) entrenados sobre las activaciones del bloque decoder 6 de OthelloGPT, correspondientes al trabajo de integración curricular "Sparse Autoencoders aplicados a Othello."
Contenido
Modelos (layer_06/models/)
15 SAEs entrenados: 3 variantes (Estándar con p-annealing, BatchTopK, Matryoshka) × 5 tamaños de dataset de entrenamiento (5.000, 12.500, 25.000, 50.000, 100.000 partidas).
layer_06/models/
├── sae_standard/sae_p-annealing_standard/ # 5 tamaños de dataset
├── sae_topk/sae_batch-topk_topk/ # 5 tamaños de dataset
└── sae_matryoshkabatchtopk/... # 5 tamaños de dataset
Cada carpeta de experimento contiene:
*_best.pt: mejor checkpoint según pérdida de validación (solo BatchTopK y Matryoshka)*_final.pt: checkpoint al finalizar el entrenamiento (las tres variantes)extras.json: hiperparámetros relevantes de la ejecución
Datos de evaluación (data_evaluation)
Partidas sintéticas, activaciones del bloque 6, estados de tablero y ground truth de las 128 BSPs (perspectiva absoluta y del jugador), correspondientes a las 2.000 partidas usadas para calcular las métricas de Coverage y Board Reconstruction sobre los modelos entrenados:
games_2000.txt: partidas sintéticas (secuencias de movimientos)layer6_2000games.npy: activaciones del bloque 6board_states_2000games.npz: estados de tablero reconstruidosbsp_ground_truth_2000games.npy: ground truth (verdadero/falso) de las 128 BSPsbsp_ground_truth_2000games.names.npy: nombres correspondientes a cada BSP (p. ej.BSPA82)
Las activaciones utilizadas para el entrenamiento de los 15 SAEs no se incluyen aquí por su tamaño (~40 GB).
Métricas
Cada modelo fue evaluado con Coverage y Board Reconstruction, desde perspectiva absoluta y perspectiva del jugador. Ver el trabajo de integración curricular para la metodología completa y los resultados detallados.