Instructions to use cragtmp/task05rd2-50 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/task05rd2-50 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/task05rd2-50") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.2882882882882883, | |
| "eval_steps": 300, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.005765765765765766, | |
| "grad_norm": 2.1474921703338623, | |
| "learning_rate": 7.692307692307694e-06, | |
| "logits/chosen": -0.4285973310470581, | |
| "logits/rejected": -0.721319854259491, | |
| "logps/chosen": -2.468954086303711, | |
| "logps/rejected": -59.87730407714844, | |
| "loss": 0.22946561872959137, | |
| "memory(GiB)": 30.65, | |
| "nll_loss": 0.13756254315376282, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.23724405467510223, | |
| "rewards/margins": 3.9806408882141113, | |
| "rewards/rejected": -3.743396759033203, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.01022 | |
| }, | |
| { | |
| "epoch": 0.011531531531531532, | |
| "grad_norm": 2.328110456466675, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "logits/chosen": -0.3982561528682709, | |
| "logits/rejected": -0.7214521169662476, | |
| "logps/chosen": -3.335645914077759, | |
| "logps/rejected": -60.79209899902344, | |
| "loss": 0.3770241439342499, | |
| "memory(GiB)": 30.65, | |
| "nll_loss": 0.23075783252716064, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.10687967389822006, | |
| "rewards/margins": 3.9392333030700684, | |
| "rewards/rejected": -3.832353353500366, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.010488 | |
| }, | |
| { | |
| "epoch": 0.017297297297297298, | |
| "grad_norm": 14.568985939025879, | |
| "learning_rate": 2.307692307692308e-05, | |
| "logits/chosen": -0.43175598978996277, | |
| "logits/rejected": -0.6921666264533997, | |
| "logps/chosen": -5.190546035766602, | |
| "logps/rejected": -51.33646011352539, | |
| "loss": 0.9886025786399841, | |
| "memory(GiB)": 34.1, | |
| "nll_loss": 0.6371194124221802, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.034887176007032394, | |
| "rewards/margins": 3.2021734714508057, | |
| "rewards/rejected": -3.237060785293579, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.010581 | |
| }, | |
| { | |
| "epoch": 0.023063063063063063, | |
| "grad_norm": 13.817249298095703, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "logits/chosen": -0.4616771340370178, | |
| "logits/rejected": -0.6264235973358154, | |
| "logps/chosen": -3.2552552223205566, | |
| "logps/rejected": -51.25586700439453, | |
| "loss": 0.5021163821220398, | |
| "memory(GiB)": 37.58, | |
| "nll_loss": 0.26375898718833923, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.06816040724515915, | |
| "rewards/margins": 3.5297036170959473, | |
| "rewards/rejected": -3.461543083190918, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.010625 | |
| }, | |
| { | |
| "epoch": 0.02882882882882883, | |
| "grad_norm": 2.363553524017334, | |
| "learning_rate": 3.846153846153846e-05, | |
| "logits/chosen": -0.48805952072143555, | |
| "logits/rejected": -0.7040677070617676, | |
| "logps/chosen": -6.89398717880249, | |
| "logps/rejected": -59.37879943847656, | |
| "loss": 0.39657193422317505, | |
| "memory(GiB)": 37.58, | |
| "nll_loss": 0.2818652391433716, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1999940723180771, | |
| "rewards/margins": 4.230030059814453, | |
| "rewards/rejected": -4.030035495758057, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.010659 | |
| }, | |
| { | |
| "epoch": 0.034594594594594595, | |
| "grad_norm": 4.551424026489258, | |
| "learning_rate": 4.615384615384616e-05, | |
| "logits/chosen": -0.39471542835235596, | |
| "logits/rejected": -0.6508359909057617, | |
| "logps/chosen": -6.633285999298096, | |
| "logps/rejected": -58.268653869628906, | |
| "loss": 0.5636770129203796, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.41472452878952026, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.1396198272705078, | |
| "rewards/margins": 3.7723348140716553, | |
| "rewards/rejected": -3.6327152252197266, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.010667 | |
| }, | |
| { | |
| "epoch": 0.04036036036036036, | |
| "grad_norm": 4.302145481109619, | |
| "learning_rate": 5.384615384615385e-05, | |
| "logits/chosen": -0.42404329776763916, | |
| "logits/rejected": -0.7084805369377136, | |
| "logps/chosen": -4.09792947769165, | |
| "logps/rejected": -69.69088745117188, | |
| "loss": 0.5202179551124573, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.3875095546245575, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.018997177481651306, | |
| "rewards/margins": 5.0437703132629395, | |
| "rewards/rejected": -5.062767505645752, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.010685 | |
| }, | |
| { | |
| "epoch": 0.04612612612612613, | |
| "grad_norm": 4.475785255432129, | |
| "learning_rate": 6.153846153846155e-05, | |
| "logits/chosen": -0.4411894977092743, | |
| "logits/rejected": -0.6594015955924988, | |
| "logps/chosen": -6.067828178405762, | |
| "logps/rejected": -52.161441802978516, | |
| "loss": 0.8079419136047363, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.5527109503746033, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.13843362033367157, | |
| "rewards/margins": 3.638244390487671, | |
| "rewards/rejected": -3.4998104572296143, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.010699 | |
| }, | |
| { | |
| "epoch": 0.05189189189189189, | |
| "grad_norm": 7.412286281585693, | |
| "learning_rate": 6.923076923076924e-05, | |
| "logits/chosen": -0.4308490753173828, | |
| "logits/rejected": -0.6868806481361389, | |
| "logps/chosen": -4.5601372718811035, | |
| "logps/rejected": -75.88018798828125, | |
| "loss": 0.3704576790332794, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.23506566882133484, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1938612163066864, | |
| "rewards/margins": 5.914104461669922, | |
| "rewards/rejected": -5.720243453979492, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.010708 | |
| }, | |
| { | |
| "epoch": 0.05765765765765766, | |
| "grad_norm": 2.0841763019561768, | |
| "learning_rate": 7.692307692307693e-05, | |
| "logits/chosen": -0.4546598792076111, | |
| "logits/rejected": -0.7517622113227844, | |
| "logps/chosen": -1.471292495727539, | |
| "logps/rejected": -70.88200378417969, | |
| "loss": 0.2737431526184082, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.14067727327346802, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.13278257846832275, | |
| "rewards/margins": 5.628582000732422, | |
| "rewards/rejected": -5.495799541473389, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.010721 | |
| }, | |
| { | |
| "epoch": 0.06342342342342343, | |
| "grad_norm": 5.912591457366943, | |
| "learning_rate": 8.461538461538461e-05, | |
| "logits/chosen": -0.4128813147544861, | |
| "logits/rejected": -0.5927000045776367, | |
| "logps/chosen": -7.319942474365234, | |
| "logps/rejected": -61.27806091308594, | |
| "loss": 0.5680095553398132, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.3753523826599121, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.07616602629423141, | |
| "rewards/margins": 4.830938816070557, | |
| "rewards/rejected": -4.754772663116455, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.010727 | |
| }, | |
| { | |
| "epoch": 0.06918918918918919, | |
| "grad_norm": 2.5374209880828857, | |
| "learning_rate": 9.230769230769232e-05, | |
| "logits/chosen": -0.349031925201416, | |
| "logits/rejected": -0.6373917460441589, | |
| "logps/chosen": -4.199922561645508, | |
| "logps/rejected": -72.83607482910156, | |
| "loss": 0.34027042984962463, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.22808796167373657, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.20608201622962952, | |
| "rewards/margins": 5.424815654754639, | |
| "rewards/rejected": -5.218733787536621, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.010728 | |
| }, | |
| { | |
| "epoch": 0.07495495495495495, | |
| "grad_norm": 2.7130517959594727, | |
| "learning_rate": 0.0001, | |
| "logits/chosen": -0.3631379306316376, | |
| "logits/rejected": -0.6601940989494324, | |
| "logps/chosen": -3.3938565254211426, | |
| "logps/rejected": -65.2313232421875, | |
| "loss": 0.4514213800430298, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.30333614349365234, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06806281208992004, | |
| "rewards/margins": 4.726724624633789, | |
| "rewards/rejected": -4.658661365509033, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.010733 | |
| }, | |
| { | |
| "epoch": 0.08072072072072072, | |
| "grad_norm": 1.5474798679351807, | |
| "learning_rate": 0.0001076923076923077, | |
| "logits/chosen": -0.4096493124961853, | |
| "logits/rejected": -0.6515597105026245, | |
| "logps/chosen": -2.300206184387207, | |
| "logps/rejected": -57.26811218261719, | |
| "loss": 0.3060320019721985, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.1727571338415146, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.08898697793483734, | |
| "rewards/margins": 4.1406354904174805, | |
| "rewards/rejected": -4.0516486167907715, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.010737 | |
| }, | |
| { | |
| "epoch": 0.08648648648648649, | |
| "grad_norm": 1.628075361251831, | |
| "learning_rate": 0.00011538461538461538, | |
| "logits/chosen": -0.4402551054954529, | |
| "logits/rejected": -0.6672070622444153, | |
| "logps/chosen": -2.9995224475860596, | |
| "logps/rejected": -53.87057113647461, | |
| "loss": 0.3575773239135742, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.2217392474412918, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.20550209283828735, | |
| "rewards/margins": 3.6874935626983643, | |
| "rewards/rejected": -3.4819912910461426, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.010742 | |
| }, | |
| { | |
| "epoch": 0.09225225225225225, | |
| "grad_norm": 1.838375449180603, | |
| "learning_rate": 0.0001230769230769231, | |
| "logits/chosen": -0.3547935485839844, | |
| "logits/rejected": -0.6626885533332825, | |
| "logps/chosen": -4.558413982391357, | |
| "logps/rejected": -64.36922454833984, | |
| "loss": 0.45015937089920044, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.3128659129142761, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.14241908490657806, | |
| "rewards/margins": 4.83186149597168, | |
| "rewards/rejected": -4.689442157745361, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.010745 | |
| }, | |
| { | |
| "epoch": 0.09801801801801802, | |
| "grad_norm": 3.119417667388916, | |
| "learning_rate": 0.00013076923076923077, | |
| "logits/chosen": -0.3334687352180481, | |
| "logits/rejected": -0.6293997168540955, | |
| "logps/chosen": -5.949204444885254, | |
| "logps/rejected": -74.25395965576172, | |
| "loss": 0.6850419044494629, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.5004001259803772, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.07516612857580185, | |
| "rewards/margins": 4.788809776306152, | |
| "rewards/rejected": -4.713644027709961, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.010741 | |
| }, | |
| { | |
| "epoch": 0.10378378378378378, | |
| "grad_norm": 1.6356091499328613, | |
| "learning_rate": 0.00013846153846153847, | |
| "logits/chosen": -0.3526935875415802, | |
| "logits/rejected": -0.6357190608978271, | |
| "logps/chosen": -2.911073923110962, | |
| "logps/rejected": -66.46131896972656, | |
| "loss": 0.32070592045783997, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.18397927284240723, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.09694083034992218, | |
| "rewards/margins": 5.153117656707764, | |
| "rewards/rejected": -5.056177139282227, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.010741 | |
| }, | |
| { | |
| "epoch": 0.10954954954954955, | |
| "grad_norm": 2.7403504848480225, | |
| "learning_rate": 0.00014615384615384615, | |
| "logits/chosen": -0.3763662278652191, | |
| "logits/rejected": -0.586420476436615, | |
| "logps/chosen": -4.417596340179443, | |
| "logps/rejected": -58.99639892578125, | |
| "loss": 0.4634058177471161, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.28715017437934875, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1435782015323639, | |
| "rewards/margins": 4.609218120574951, | |
| "rewards/rejected": -4.465640068054199, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.010743 | |
| }, | |
| { | |
| "epoch": 0.11531531531531532, | |
| "grad_norm": 1.982851266860962, | |
| "learning_rate": 0.00015384615384615385, | |
| "logits/chosen": -0.3701193332672119, | |
| "logits/rejected": -0.6088087558746338, | |
| "logps/chosen": -4.619842529296875, | |
| "logps/rejected": -68.1020278930664, | |
| "loss": 0.4344192445278168, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.26591166853904724, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.10610304027795792, | |
| "rewards/margins": 5.044137954711914, | |
| "rewards/rejected": -4.938034534454346, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.010745 | |
| }, | |
| { | |
| "epoch": 0.12108108108108108, | |
| "grad_norm": 3.175961494445801, | |
| "learning_rate": 0.00016153846153846155, | |
| "logits/chosen": -0.40009674429893494, | |
| "logits/rejected": -0.642030656337738, | |
| "logps/chosen": -3.357761859893799, | |
| "logps/rejected": -65.21231842041016, | |
| "loss": 0.40142354369163513, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.2889588177204132, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.1323939859867096, | |
| "rewards/margins": 5.234187602996826, | |
| "rewards/rejected": -5.1017937660217285, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.010748 | |
| }, | |
| { | |
| "epoch": 0.12684684684684686, | |
| "grad_norm": 1.9400721788406372, | |
| "learning_rate": 0.00016923076923076923, | |
| "logits/chosen": -0.3025435209274292, | |
| "logits/rejected": -0.6950021386146545, | |
| "logps/chosen": -2.492130994796753, | |
| "logps/rejected": -107.03312683105469, | |
| "loss": 0.2920421361923218, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.19772115349769592, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.19073158502578735, | |
| "rewards/margins": 8.599780082702637, | |
| "rewards/rejected": -8.409048080444336, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.010746 | |
| }, | |
| { | |
| "epoch": 0.13261261261261262, | |
| "grad_norm": 1.3099267482757568, | |
| "learning_rate": 0.00017692307692307693, | |
| "logits/chosen": -0.36498135328292847, | |
| "logits/rejected": -0.6359634399414062, | |
| "logps/chosen": -2.421377658843994, | |
| "logps/rejected": -74.05368041992188, | |
| "loss": 0.20869436860084534, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.11023169010877609, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.18500684201717377, | |
| "rewards/margins": 5.958514213562012, | |
| "rewards/rejected": -5.773507118225098, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.010747 | |
| }, | |
| { | |
| "epoch": 0.13837837837837838, | |
| "grad_norm": 1.9334064722061157, | |
| "learning_rate": 0.00018461538461538463, | |
| "logits/chosen": -0.45037421584129333, | |
| "logits/rejected": -0.7719848155975342, | |
| "logps/chosen": -2.6665430068969727, | |
| "logps/rejected": -94.5350570678711, | |
| "loss": 0.3057625889778137, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.2374470978975296, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.09573014080524445, | |
| "rewards/margins": 8.040020942687988, | |
| "rewards/rejected": -7.944291114807129, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.010749 | |
| }, | |
| { | |
| "epoch": 0.14414414414414414, | |
| "grad_norm": 7.789314270019531, | |
| "learning_rate": 0.00019230769230769233, | |
| "logits/chosen": -0.3473276197910309, | |
| "logits/rejected": -0.6793957352638245, | |
| "logps/chosen": -4.235269069671631, | |
| "logps/rejected": -109.01844024658203, | |
| "loss": 0.42337244749069214, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.21255403757095337, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.009569963440299034, | |
| "rewards/margins": 8.769816398620605, | |
| "rewards/rejected": -8.760246276855469, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.010747 | |
| }, | |
| { | |
| "epoch": 0.1499099099099099, | |
| "grad_norm": 1.970948338508606, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.40258127450942993, | |
| "logits/rejected": -0.7479668259620667, | |
| "logps/chosen": -2.0013341903686523, | |
| "logps/rejected": -85.51154327392578, | |
| "loss": 0.4197818636894226, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.2574591636657715, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.16396881639957428, | |
| "rewards/margins": 7.033238410949707, | |
| "rewards/rejected": -6.869269847869873, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.010746 | |
| }, | |
| { | |
| "epoch": 0.15567567567567567, | |
| "grad_norm": 11.3534574508667, | |
| "learning_rate": 0.00019999796963348897, | |
| "logits/chosen": -0.5246711373329163, | |
| "logits/rejected": -0.7294141054153442, | |
| "logps/chosen": -11.85606575012207, | |
| "logps/rejected": -76.03211975097656, | |
| "loss": 0.8875234127044678, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.575400710105896, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.2269383817911148, | |
| "rewards/margins": 5.498793125152588, | |
| "rewards/rejected": -5.725731372833252, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.010747 | |
| }, | |
| { | |
| "epoch": 0.16144144144144143, | |
| "grad_norm": 2.0314371585845947, | |
| "learning_rate": 0.00019999187861640362, | |
| "logits/chosen": -0.5284671187400818, | |
| "logits/rejected": -0.7846834063529968, | |
| "logps/chosen": -4.434022426605225, | |
| "logps/rejected": -87.89623260498047, | |
| "loss": 0.3868662416934967, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.30320096015930176, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.07812386751174927, | |
| "rewards/margins": 7.374299049377441, | |
| "rewards/rejected": -7.296175479888916, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.010748 | |
| }, | |
| { | |
| "epoch": 0.16720720720720722, | |
| "grad_norm": 6.089433193206787, | |
| "learning_rate": 0.0001999817271960839, | |
| "logits/chosen": -0.4792092442512512, | |
| "logits/rejected": -0.7371792793273926, | |
| "logps/chosen": -3.6791412830352783, | |
| "logps/rejected": -80.48262023925781, | |
| "loss": 0.34335166215896606, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.22308313846588135, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": -0.049518827348947525, | |
| "rewards/margins": 6.395692825317383, | |
| "rewards/rejected": -6.445211410522461, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.010751 | |
| }, | |
| { | |
| "epoch": 0.17297297297297298, | |
| "grad_norm": 1.8896535634994507, | |
| "learning_rate": 0.00019996751578475186, | |
| "logits/chosen": -0.44468259811401367, | |
| "logits/rejected": -0.7023504972457886, | |
| "logps/chosen": -3.048004388809204, | |
| "logps/rejected": -80.6348648071289, | |
| "loss": 0.30949145555496216, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.1800393909215927, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.15738406777381897, | |
| "rewards/margins": 5.8682780265808105, | |
| "rewards/rejected": -5.710893630981445, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.010749 | |
| }, | |
| { | |
| "epoch": 0.17873873873873874, | |
| "grad_norm": 2.7516067028045654, | |
| "learning_rate": 0.00019994924495949504, | |
| "logits/chosen": -0.4754641652107239, | |
| "logits/rejected": -0.7408227920532227, | |
| "logps/chosen": -5.943354606628418, | |
| "logps/rejected": -79.13115692138672, | |
| "loss": 0.6435320973396301, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.4586246609687805, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.0629303902387619, | |
| "rewards/margins": 6.110820293426514, | |
| "rewards/rejected": -6.0478901863098145, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.01075 | |
| }, | |
| { | |
| "epoch": 0.1845045045045045, | |
| "grad_norm": 5.854465007781982, | |
| "learning_rate": 0.00019992691546224278, | |
| "logits/chosen": -0.45127877593040466, | |
| "logits/rejected": -0.7568551898002625, | |
| "logps/chosen": -2.736678123474121, | |
| "logps/rejected": -66.9885025024414, | |
| "loss": 0.3652667701244354, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.16899552941322327, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.050895966589450836, | |
| "rewards/margins": 4.933393478393555, | |
| "rewards/rejected": -4.882497310638428, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.01075 | |
| }, | |
| { | |
| "epoch": 0.19027027027027027, | |
| "grad_norm": 1.3124663829803467, | |
| "learning_rate": 0.00019990052819973642, | |
| "logits/chosen": -0.3465266227722168, | |
| "logits/rejected": -0.6685288548469543, | |
| "logps/chosen": -3.301164388656616, | |
| "logps/rejected": -85.9378662109375, | |
| "loss": 0.3046538233757019, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.1670866757631302, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.17874348163604736, | |
| "rewards/margins": 6.709518909454346, | |
| "rewards/rejected": -6.530775547027588, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.010748 | |
| }, | |
| { | |
| "epoch": 0.19603603603603603, | |
| "grad_norm": 2.341381549835205, | |
| "learning_rate": 0.00019987008424349225, | |
| "logits/chosen": -0.38037875294685364, | |
| "logits/rejected": -0.699614405632019, | |
| "logps/chosen": -1.5970546007156372, | |
| "logps/rejected": -74.28025817871094, | |
| "loss": 0.20820346474647522, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.10679290443658829, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.11616384983062744, | |
| "rewards/margins": 5.825808048248291, | |
| "rewards/rejected": -5.709644794464111, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.010749 | |
| }, | |
| { | |
| "epoch": 0.2018018018018018, | |
| "grad_norm": 5.144662380218506, | |
| "learning_rate": 0.00019983558482975799, | |
| "logits/chosen": -0.46614986658096313, | |
| "logits/rejected": -0.6599275469779968, | |
| "logps/chosen": -5.982501983642578, | |
| "logps/rejected": -67.7139892578125, | |
| "loss": 0.5879941582679749, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.4303022027015686, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.16055577993392944, | |
| "rewards/margins": 5.052016258239746, | |
| "rewards/rejected": -4.89146089553833, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.010749 | |
| }, | |
| { | |
| "epoch": 0.20756756756756756, | |
| "grad_norm": 1.990370273590088, | |
| "learning_rate": 0.00019979703135946278, | |
| "logits/chosen": -0.4655105471611023, | |
| "logits/rejected": -0.6668959856033325, | |
| "logps/chosen": -4.062808036804199, | |
| "logps/rejected": -72.87210845947266, | |
| "loss": 0.4453062415122986, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.25426411628723145, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.09591292589902878, | |
| "rewards/margins": 5.528655052185059, | |
| "rewards/rejected": -5.432741641998291, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.010749 | |
| }, | |
| { | |
| "epoch": 0.21333333333333335, | |
| "grad_norm": 2.0748369693756104, | |
| "learning_rate": 0.00019975442539816012, | |
| "logits/chosen": -0.4139191210269928, | |
| "logits/rejected": -0.7536109685897827, | |
| "logps/chosen": -5.956673622131348, | |
| "logps/rejected": -66.99488830566406, | |
| "loss": 0.5514004826545715, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.3969358503818512, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.33245787024497986, | |
| "rewards/margins": 5.0754570960998535, | |
| "rewards/rejected": -4.742999076843262, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.01075 | |
| }, | |
| { | |
| "epoch": 0.2190990990990991, | |
| "grad_norm": 1.6668081283569336, | |
| "learning_rate": 0.0001997077686759643, | |
| "logits/chosen": -0.42306363582611084, | |
| "logits/rejected": -0.6915761232376099, | |
| "logps/chosen": -3.814265727996826, | |
| "logps/rejected": -82.30941772460938, | |
| "loss": 0.3710038363933563, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.22380009293556213, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.06087161600589752, | |
| "rewards/margins": 6.076653957366943, | |
| "rewards/rejected": -6.015782356262207, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.01075 | |
| }, | |
| { | |
| "epoch": 0.22486486486486487, | |
| "grad_norm": 13.827637672424316, | |
| "learning_rate": 0.00019965706308748028, | |
| "logits/chosen": -0.49769100546836853, | |
| "logits/rejected": -0.7370949983596802, | |
| "logps/chosen": -3.956310272216797, | |
| "logps/rejected": -79.41323852539062, | |
| "loss": 0.6633445620536804, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.3870386779308319, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": -0.13494591414928436, | |
| "rewards/margins": 6.147372722625732, | |
| "rewards/rejected": -6.282319068908691, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.010751 | |
| }, | |
| { | |
| "epoch": 0.23063063063063063, | |
| "grad_norm": 2.19854474067688, | |
| "learning_rate": 0.0001996023106917267, | |
| "logits/chosen": -0.44343504309654236, | |
| "logits/rejected": -0.6730125546455383, | |
| "logps/chosen": -2.9238576889038086, | |
| "logps/rejected": -77.40494537353516, | |
| "loss": 0.3453696668148041, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.19069285690784454, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.14595907926559448, | |
| "rewards/margins": 6.002254486083984, | |
| "rewards/rejected": -5.856295108795166, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.010752 | |
| }, | |
| { | |
| "epoch": 0.2363963963963964, | |
| "grad_norm": 6.0794596672058105, | |
| "learning_rate": 0.00019954351371205203, | |
| "logits/chosen": -0.47579658031463623, | |
| "logits/rejected": -0.6826990842819214, | |
| "logps/chosen": -5.335310935974121, | |
| "logps/rejected": -75.78384399414062, | |
| "loss": 0.575509250164032, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.4477939307689667, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.2103371024131775, | |
| "rewards/margins": 6.012211322784424, | |
| "rewards/rejected": -5.801875114440918, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.010754 | |
| }, | |
| { | |
| "epoch": 0.24216216216216216, | |
| "grad_norm": 1.4152264595031738, | |
| "learning_rate": 0.00019948067453604473, | |
| "logits/chosen": -0.49620914459228516, | |
| "logits/rejected": -0.7446714043617249, | |
| "logps/chosen": -3.284031867980957, | |
| "logps/rejected": -77.9183349609375, | |
| "loss": 0.29828324913978577, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.21160344779491425, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.18678154051303864, | |
| "rewards/margins": 6.247434616088867, | |
| "rewards/rejected": -6.060652732849121, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.010755 | |
| }, | |
| { | |
| "epoch": 0.24792792792792792, | |
| "grad_norm": 2.9591963291168213, | |
| "learning_rate": 0.00019941379571543596, | |
| "logits/chosen": -0.4777877628803253, | |
| "logits/rejected": -0.6974171996116638, | |
| "logps/chosen": -2.9466118812561035, | |
| "logps/rejected": -66.2719497680664, | |
| "loss": 0.35521066188812256, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.22793087363243103, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.27246373891830444, | |
| "rewards/margins": 5.403186798095703, | |
| "rewards/rejected": -5.130722999572754, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.010756 | |
| }, | |
| { | |
| "epoch": 0.2536936936936937, | |
| "grad_norm": 4.199843883514404, | |
| "learning_rate": 0.00019934287996599607, | |
| "logits/chosen": -0.4372207522392273, | |
| "logits/rejected": -0.700534462928772, | |
| "logps/chosen": -3.31451416015625, | |
| "logps/rejected": -70.0909194946289, | |
| "loss": 0.3793654143810272, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.20433279871940613, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.059201404452323914, | |
| "rewards/margins": 4.912087917327881, | |
| "rewards/rejected": -4.852885723114014, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.010756 | |
| }, | |
| { | |
| "epoch": 0.2594594594594595, | |
| "grad_norm": 0.7397028803825378, | |
| "learning_rate": 0.00019926793016742435, | |
| "logits/chosen": -0.42062634229660034, | |
| "logits/rejected": -0.7593384981155396, | |
| "logps/chosen": -1.404799222946167, | |
| "logps/rejected": -102.4892349243164, | |
| "loss": 0.1313902586698532, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.09521690011024475, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 0.12229674309492111, | |
| "rewards/margins": 8.041703224182129, | |
| "rewards/rejected": -7.919405937194824, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.010754 | |
| }, | |
| { | |
| "epoch": 0.26522522522522524, | |
| "grad_norm": 5.14201545715332, | |
| "learning_rate": 0.00019918894936323195, | |
| "logits/chosen": -0.3798273205757141, | |
| "logits/rejected": -0.5865642428398132, | |
| "logps/chosen": -6.911247730255127, | |
| "logps/rejected": -72.06941223144531, | |
| "loss": 0.49299517273902893, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.27924880385398865, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1307646483182907, | |
| "rewards/margins": 5.647462368011475, | |
| "rewards/rejected": -5.516696929931641, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.010753 | |
| }, | |
| { | |
| "epoch": 0.270990990990991, | |
| "grad_norm": 1.6439752578735352, | |
| "learning_rate": 0.00019910594076061853, | |
| "logits/chosen": -0.4431299567222595, | |
| "logits/rejected": -0.7268660664558411, | |
| "logps/chosen": -2.0275888442993164, | |
| "logps/rejected": -81.84529876708984, | |
| "loss": 0.23740296065807343, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.14832313358783722, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.06923090666532516, | |
| "rewards/margins": 6.1783928871154785, | |
| "rewards/rejected": -6.109161376953125, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.010753 | |
| }, | |
| { | |
| "epoch": 0.27675675675675676, | |
| "grad_norm": 6.499570846557617, | |
| "learning_rate": 0.0001990189077303418, | |
| "logits/chosen": -0.45142635703086853, | |
| "logits/rejected": -0.7249264121055603, | |
| "logps/chosen": -5.794652938842773, | |
| "logps/rejected": -78.53363800048828, | |
| "loss": 0.46158841252326965, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.3398270010948181, | |
| "rewards/accuracies": 0.96875, | |
| "rewards/chosen": 0.24555836617946625, | |
| "rewards/margins": 6.308343887329102, | |
| "rewards/rejected": -6.062786102294922, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.010753 | |
| }, | |
| { | |
| "epoch": 0.2825225225225225, | |
| "grad_norm": 5.58511209487915, | |
| "learning_rate": 0.00019892785380658078, | |
| "logits/chosen": -0.4099079370498657, | |
| "logits/rejected": -0.6898340582847595, | |
| "logps/chosen": -7.449429035186768, | |
| "logps/rejected": -92.18098449707031, | |
| "loss": 0.5815075039863586, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.41358357667922974, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": -0.053265977650880814, | |
| "rewards/margins": 7.150655269622803, | |
| "rewards/rejected": -7.203920841217041, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.010752 | |
| }, | |
| { | |
| "epoch": 0.2882882882882883, | |
| "grad_norm": 1.5411535501480103, | |
| "learning_rate": 0.00019883278268679216, | |
| "logits/chosen": -0.4670988917350769, | |
| "logits/rejected": -0.6586328148841858, | |
| "logps/chosen": -6.984646320343018, | |
| "logps/rejected": -89.9208755493164, | |
| "loss": 0.45735102891921997, | |
| "memory(GiB)": 41.24, | |
| "nll_loss": 0.28862154483795166, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.1682412177324295, | |
| "rewards/margins": 7.457679748535156, | |
| "rewards/rejected": -7.289438247680664, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.01075 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 519, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.7372458004709376e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |