UTI2_L3_250steps_1e7rate_05beta_CSFTDPO

This model is a fine-tuned version of tsavage68/UTI_L3_1000steps_1e5rate_SFT on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 0.0989
  • Rewards/chosen: 1.2798
  • Rewards/rejected: -1.4194
  • Rewards/accuracies: 0.9800
  • Rewards/margins: 2.6992
  • Logps/rejected: -46.1084
  • Logps/chosen: -26.6654
  • Logits/rejected: -1.1438
  • Logits/chosen: -1.1371

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 1e-07
  • train_batch_size: 2
  • eval_batch_size: 1
  • seed: 42
  • gradient_accumulation_steps: 2
  • total_train_batch_size: 4
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_steps: 100
  • training_steps: 250

Training results

Training Loss Epoch Step Validation Loss Rewards/chosen Rewards/rejected Rewards/accuracies Rewards/margins Logps/rejected Logps/chosen Logits/rejected Logits/chosen
0.6994 0.3333 25 0.6838 0.0135 -0.0067 0.5900 0.0202 -43.2828 -29.1979 -1.1410 -1.1363
0.6558 0.6667 50 0.6397 0.0766 -0.0351 0.9300 0.1117 -43.3396 -29.0716 -1.1411 -1.1363
0.5544 1.0 75 0.5162 0.2530 -0.1459 0.9800 0.3989 -43.5613 -28.7188 -1.1416 -1.1366
0.3409 1.3333 100 0.3357 0.6037 -0.3562 0.9700 0.9598 -43.9818 -28.0176 -1.1423 -1.1368
0.1695 1.6667 125 0.1849 0.9168 -0.8294 0.9800 1.7462 -44.9283 -27.3913 -1.1428 -1.1368
0.1123 2.0 150 0.1254 1.1541 -1.1573 0.9800 2.3114 -45.5840 -26.9166 -1.1435 -1.1370
0.0637 2.3333 175 0.1054 1.2456 -1.3348 0.9800 2.5803 -45.9390 -26.7338 -1.1438 -1.1371
0.0559 2.6667 200 0.0973 1.2783 -1.4223 0.9800 2.7006 -46.1140 -26.6683 -1.1440 -1.1373
0.0511 3.0 225 0.0981 1.2853 -1.4144 0.9700 2.6997 -46.0982 -26.6542 -1.1440 -1.1373
0.0504 3.3333 250 0.0989 1.2798 -1.4194 0.9800 2.6992 -46.1084 -26.6654 -1.1438 -1.1371

Framework versions

  • Transformers 4.41.2
  • Pytorch 2.0.0+cu117
  • Datasets 2.19.2
  • Tokenizers 0.19.1
Downloads last month
6
Safetensors
Model size
8B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tsavage68/UTI2_L3_250steps_1e7rate_05beta_CSFTDPO