Launching training job: transformer_train_medium Nodes: 1, GPUs per node: 4 Resources per node: 32 CPUs, 128 GB memory MASTER_ADDR: dcc-core-55 MASTER_PORT: 29689 SLURM_NNODES: 1 SLURM_NTASKS_PER_NODE: SLURM_PROCID: 0 CUDA_VISIBLE_DEVICES: 0,1 slurmstepd: error: *** JOB 42254198 ON dcc-core-55 CANCELLED AT 2026-01-20T20:55:48 ***