Transaminitis_L3_350steps_1e7rate_05beta_CSFTDPO

This model is a fine-tuned version of tsavage68/Transaminitis_L3_1000rate_1e7_SFT on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 0.5677
  • Rewards/chosen: 0.0947
  • Rewards/rejected: -0.2002
  • Rewards/accuracies: 0.8600
  • Rewards/margins: 0.2949
  • Logps/rejected: -18.9551
  • Logps/chosen: -18.3449
  • Logits/rejected: -1.0739
  • Logits/chosen: -1.0723

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 1e-07
  • train_batch_size: 2
  • eval_batch_size: 1
  • seed: 42
  • gradient_accumulation_steps: 2
  • total_train_batch_size: 4
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_steps: 100
  • training_steps: 350

Training results

Training Loss Epoch Step Validation Loss Rewards/chosen Rewards/rejected Rewards/accuracies Rewards/margins Logps/rejected Logps/chosen Logits/rejected Logits/chosen
0.6857 0.2 25 0.6895 -0.0206 -0.0288 0.5100 0.0082 -18.6123 -18.5753 -1.0653 -1.0641
0.6912 0.4 50 0.6888 -0.1407 -0.1512 0.5300 0.0106 -18.8572 -18.8156 -1.0675 -1.0663
0.6956 0.6 75 0.6978 -0.1002 -0.1011 0.4600 0.0008 -18.7568 -18.7347 -1.0682 -1.0669
0.6647 0.8 100 0.7297 -0.2211 -0.2283 0.4600 0.0071 -19.0112 -18.9765 -1.0701 -1.0690
0.7239 1.0 125 0.6908 -0.6506 -0.7800 0.5400 0.1293 -20.1146 -19.8355 -1.0728 -1.0716
0.6533 1.2 150 0.6792 0.0691 -0.0036 0.4700 0.0728 -18.5620 -18.3960 -1.0696 -1.0682
0.6223 1.4 175 0.6196 -0.1328 -0.2981 0.7800 0.1652 -19.1508 -18.7999 -1.0734 -1.0721
0.6026 1.6 200 0.5921 -0.1823 -0.4363 0.7300 0.2539 -19.4273 -18.8989 -1.0736 -1.0723
0.5946 1.8 225 0.5779 0.0165 -0.2513 0.8300 0.2678 -19.0573 -18.5012 -1.0748 -1.0732
0.5438 2.0 250 0.5756 0.0271 -0.2507 0.8200 0.2778 -19.0561 -18.4800 -1.0745 -1.0731
0.5717 2.2 275 0.5683 0.0778 -0.2143 0.8500 0.2921 -18.9833 -18.3785 -1.0744 -1.0730
0.5337 2.4 300 0.5698 0.0926 -0.1967 0.8600 0.2894 -18.9482 -18.3489 -1.0749 -1.0735
0.5534 2.6 325 0.5667 0.1026 -0.1939 0.8600 0.2965 -18.9425 -18.3291 -1.0738 -1.0723
0.5358 2.8 350 0.5677 0.0947 -0.2002 0.8600 0.2949 -18.9551 -18.3449 -1.0739 -1.0723

Framework versions

  • Transformers 4.40.2
  • Pytorch 2.0.0+cu117
  • Datasets 2.19.1
  • Tokenizers 0.19.1
Downloads last month
5
Safetensors
Model size
8B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tsavage68/Transaminitis_L3_350steps_1e7rate_05beta_CSFTDPO