91cd397d79fc9dd01b7b158224820016

This model is a fine-tuned version of google/mt5-small on the Helsinki-NLP/opus_books [es-fi] dataset. It achieves the following results on the evaluation set:

  • Loss: 3.2187
  • Data Size: 1.0
  • Epoch Runtime: 13.8113
  • Bleu: 1.6158

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 5e-05
  • train_batch_size: 8
  • eval_batch_size: 8
  • seed: 42
  • distributed_type: multi-GPU
  • num_devices: 4
  • total_train_batch_size: 32
  • total_eval_batch_size: 32
  • optimizer: Use adamw_torch with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: constant
  • num_epochs: 50

Training results

Training Loss Epoch Step Validation Loss Data Size Epoch Runtime Bleu
No log 0 0 27.2746 0 1.8161 0.0015
No log 1 83 27.1766 0.0078 1.8968 0.0014
No log 2 166 27.2891 0.0156 2.2723 0.0008
No log 3 249 26.8685 0.0312 2.9650 0.0008
0.7951 4 332 24.2712 0.0625 3.3803 0.0015
0.7951 5 415 20.1067 0.125 4.1026 0.0021
0.7951 6 498 16.3462 0.25 5.2247 0.0021
3.5672 7 581 12.2835 0.5 8.0506 0.0034
11.3735 8.0 664 7.0681 1.0 13.7821 0.0060
8.6391 9.0 747 5.0629 1.0 12.7269 0.0142
6.0938 10.0 830 4.2062 1.0 13.8398 0.0641
5.2694 11.0 913 3.9666 1.0 13.2515 0.2946
5.081 12.0 996 3.8471 1.0 13.4729 0.4175
4.8027 13.0 1079 3.7648 1.0 13.2391 0.5484
4.6622 14.0 1162 3.7027 1.0 13.1385 0.5798
4.5894 15.0 1245 3.6644 1.0 12.9530 0.6406
4.4537 16.0 1328 3.6289 1.0 13.8658 0.6754
4.3994 17.0 1411 3.5828 1.0 12.9598 0.7474
4.3299 18.0 1494 3.5628 1.0 13.2880 0.7859
4.2342 19.0 1577 3.5258 1.0 13.2278 0.8391
4.1848 20.0 1660 3.5074 1.0 13.1333 0.8469
4.1149 21.0 1743 3.4861 1.0 13.8052 0.8978
4.0798 22.0 1826 3.4677 1.0 14.3385 0.9568
4.0288 23.0 1909 3.4474 1.0 14.1256 1.0051
4.0162 24.0 1992 3.4280 1.0 12.8350 1.0470
3.96 25.0 2075 3.4157 1.0 13.0228 1.1022
3.9173 26.0 2158 3.3987 1.0 12.8699 1.1388
3.8811 27.0 2241 3.3852 1.0 13.3422 1.1356
3.8416 28.0 2324 3.3750 1.0 13.8469 1.1721
3.8165 29.0 2407 3.3596 1.0 14.1080 1.1948
3.7862 30.0 2490 3.3485 1.0 14.3882 1.2216
3.7645 31.0 2573 3.3389 1.0 14.6558 1.3029
3.7457 32.0 2656 3.3284 1.0 13.4624 1.3212
3.6619 33.0 2739 3.3179 1.0 13.9517 1.3264
3.6506 34.0 2822 3.3056 1.0 13.8116 1.3758
3.6494 35.0 2905 3.3010 1.0 13.9967 1.3931
3.6346 36.0 2988 3.2928 1.0 14.3535 1.3951
3.5929 37.0 3071 3.2905 1.0 14.0629 1.4419
3.5822 38.0 3154 3.2777 1.0 14.1572 1.4070
3.5353 39.0 3237 3.2721 1.0 14.3544 1.4220
3.5122 40.0 3320 3.2702 1.0 13.0288 1.4485
3.4808 41.0 3403 3.2638 1.0 13.3382 1.4391
3.4642 42.0 3486 3.2557 1.0 13.1424 1.4439
3.4377 43.0 3569 3.2478 1.0 13.2877 1.5041
3.4228 44.0 3652 3.2471 1.0 13.6846 1.5051
3.3832 45.0 3735 3.2394 1.0 14.1308 1.5161
3.3663 46.0 3818 3.2337 1.0 14.2943 1.5433
3.3804 47.0 3901 3.2342 1.0 14.6711 1.5757
3.3225 48.0 3984 3.2254 1.0 12.9744 1.5517
3.3143 49.0 4067 3.2257 1.0 13.9205 1.5577
3.3178 50.0 4150 3.2187 1.0 13.8113 1.6158

Framework versions

  • Transformers 4.57.0
  • Pytorch 2.8.0+cu128
  • Datasets 4.2.0
  • Tokenizers 0.22.1
Downloads last month
1
Safetensors
Model size
0.6B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for contemmcm/91cd397d79fc9dd01b7b158224820016

Base model

google/mt5-small
Finetuned
(754)
this model