chat_600_STEPS_05beta_5e7rate_CDPOSFT

This model is a fine-tuned version of tsavage68/chat_600STEPS_1e8rate_SFT on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 0.6669
  • Rewards/chosen: -0.0665
  • Rewards/rejected: -0.1611
  • Rewards/accuracies: 0.5275
  • Rewards/margins: 0.0946
  • Logps/rejected: -19.1242
  • Logps/chosen: -16.8876
  • Logits/rejected: -0.5967
  • Logits/chosen: -0.5966

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 5e-07
  • train_batch_size: 4
  • eval_batch_size: 1
  • seed: 42
  • gradient_accumulation_steps: 2
  • total_train_batch_size: 8
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_steps: 100
  • training_steps: 600

Training results

Training Loss Epoch Step Validation Loss Rewards/chosen Rewards/rejected Rewards/accuracies Rewards/margins Logps/rejected Logps/chosen Logits/rejected Logits/chosen
0.6903 0.0977 50 0.6936 0.0166 0.0155 0.4000 0.0011 -18.7710 -16.7214 -0.5983 -0.5982
0.6671 0.1953 100 0.6792 -0.0508 -0.0879 0.4835 0.0371 -18.9777 -16.8562 -0.6007 -0.6006
0.6942 0.2930 150 0.6855 -0.1406 -0.1792 0.4791 0.0386 -19.1604 -17.0359 -0.5997 -0.5996
0.6826 0.3906 200 0.6802 -0.0490 -0.1057 0.4835 0.0567 -19.0134 -16.8527 -0.5953 -0.5952
0.7074 0.4883 250 0.6747 -0.0391 -0.1111 0.4967 0.0721 -19.0242 -16.8328 -0.5930 -0.5929
0.6745 0.5859 300 0.6694 -0.0467 -0.1352 0.5011 0.0885 -19.0723 -16.8480 -0.5980 -0.5979
0.6636 0.6836 350 0.6685 -0.0796 -0.1700 0.5253 0.0905 -19.1420 -16.9137 -0.5947 -0.5945
0.6607 0.7812 400 0.6691 -0.0747 -0.1648 0.5209 0.0902 -19.1317 -16.9040 -0.5986 -0.5984
0.6758 0.8789 450 0.6693 -0.0676 -0.1582 0.5275 0.0906 -19.1183 -16.8898 -0.5967 -0.5965
0.6562 0.9766 500 0.6686 -0.0674 -0.1598 0.5187 0.0924 -19.1216 -16.8894 -0.5965 -0.5964
0.5185 1.0742 550 0.6689 -0.0681 -0.1596 0.5077 0.0915 -19.1213 -16.8909 -0.5971 -0.5970
0.5392 1.1719 600 0.6669 -0.0665 -0.1611 0.5275 0.0946 -19.1242 -16.8876 -0.5967 -0.5966

Framework versions

  • Transformers 4.40.1
  • Pytorch 2.0.0+cu117
  • Datasets 2.19.1
  • Tokenizers 0.19.1
Downloads last month
6
Safetensors
Model size
7B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tsavage68/chat_600_STEPS_05beta_5e7rate_CDPOSFT

Finetuned
(23)
this model