ddc309f82089d0ddb1b7ac20342bb26b

This model is a fine-tuned version of google/mt5-base on the Helsinki-NLP/opus_books [en-pt] dataset. It achieves the following results on the evaluation set:

  • Loss: 1.2294
  • Data Size: 1.0
  • Epoch Runtime: 12.8357
  • Bleu: 12.6588

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 5e-05
  • train_batch_size: 8
  • eval_batch_size: 8
  • seed: 42
  • distributed_type: multi-GPU
  • num_devices: 4
  • total_train_batch_size: 32
  • total_eval_batch_size: 32
  • optimizer: Use adamw_torch with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: constant
  • num_epochs: 50

Training results

Training Loss Epoch Step Validation Loss Data Size Epoch Runtime Bleu
No log 0 0 17.7144 0 2.3173 0.0290
No log 1 35 17.5179 0.0078 2.4144 0.0269
No log 2 70 16.6155 0.0156 2.1030 0.0310
No log 3 105 14.8986 0.0312 3.0620 0.0402
No log 4 140 13.8295 0.0625 3.4856 0.0462
No log 5 175 12.6466 0.125 4.0377 0.0540
No log 6 210 11.3404 0.25 4.8257 0.0478
No log 7 245 9.5996 0.5 6.8137 0.0323
2.4972 8.0 280 7.4873 1.0 11.7508 0.0232
10.4601 9.0 315 6.9812 1.0 11.1159 0.0205
8.0928 10.0 350 5.1085 1.0 12.2190 0.0134
8.0928 11.0 385 3.5469 1.0 9.9811 0.4195
5.5166 12.0 420 2.2664 1.0 10.3937 3.8922
3.466 13.0 455 1.7359 1.0 11.4021 6.2499
3.466 14.0 490 1.5843 1.0 10.7715 7.9447
2.713 15.0 525 1.4818 1.0 10.8165 8.7921
2.3289 16.0 560 1.4245 1.0 11.1957 9.8322
2.3289 17.0 595 1.3659 1.0 12.0886 10.6717
2.0457 18.0 630 1.3351 1.0 10.0443 11.4403
1.8524 19.0 665 1.3033 1.0 9.8577 12.0174
1.748 20.0 700 1.2855 1.0 9.8277 11.9246
1.748 21.0 735 1.2733 1.0 10.4312 12.0354
1.6095 22.0 770 1.2555 1.0 11.2081 12.3019
1.5372 23.0 805 1.2470 1.0 11.7935 12.1520
1.5372 24.0 840 1.2412 1.0 12.4973 12.0524
1.4536 25.0 875 1.2403 1.0 10.3195 11.8488
1.3963 26.0 910 1.2322 1.0 10.5973 11.8377
1.3963 27.0 945 1.2298 1.0 11.0937 12.1627
1.3322 28.0 980 1.2258 1.0 11.9552 12.3770
1.2762 29.0 1015 1.2218 1.0 12.0660 12.2784
1.2329 30.0 1050 1.2256 1.0 12.6226 12.5182
1.2329 31.0 1085 1.2199 1.0 12.5873 12.4929
1.1652 32.0 1120 1.2150 1.0 10.1448 12.5183
1.1327 33.0 1155 1.2212 1.0 11.4643 12.6969
1.1327 34.0 1190 1.2190 1.0 11.8735 12.6848
1.0749 35.0 1225 1.2171 1.0 12.4821 12.9429
1.0425 36.0 1260 1.2294 1.0 12.8357 12.6588

Framework versions

  • Transformers 4.57.0
  • Pytorch 2.8.0+cu128
  • Datasets 4.2.0
  • Tokenizers 0.22.1
Downloads last month
2
Safetensors
Model size
1.0B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for contemmcm/ddc309f82089d0ddb1b7ac20342bb26b

Base model

google/mt5-base
Finetuned
(315)
this model