training: epochs: 10 batch_size: 8 train_samples: 64 validation_samples: 16 learning_rate: 0.001 weight_decay: 0.000001 mask_fraction: 0.25 patience: 3 seed: 2026 num_workers: 0 device: cpu checkpoint_dir: weight/training