Instructions to use cragtmp/3gt6-50 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/3gt6-50 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/3gt6-50") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.12982797792924375, | |
| "eval_steps": 300, | |
| "global_step": 50, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002596559558584875, | |
| "grad_norm": 4.769598007202148, | |
| "learning_rate": 5.128205128205128e-06, | |
| "logits/chosen": -0.5944205522537231, | |
| "logits/rejected": -0.5917393565177917, | |
| "logps/chosen": -11.821638107299805, | |
| "logps/rejected": -10.731678009033203, | |
| "loss": 1.193467140197754, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.50031977891922, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.004987 | |
| }, | |
| { | |
| "epoch": 0.00519311911716975, | |
| "grad_norm": 7.638933181762695, | |
| "learning_rate": 1.0256410256410256e-05, | |
| "logits/chosen": -0.6539207696914673, | |
| "logits/rejected": -0.6607442498207092, | |
| "logps/chosen": -9.628549575805664, | |
| "logps/rejected": -15.572840690612793, | |
| "loss": 1.1913397312164307, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4981924891471863, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.005274 | |
| }, | |
| { | |
| "epoch": 0.007789678675754625, | |
| "grad_norm": 8.172294616699219, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "logits/chosen": -0.6215255260467529, | |
| "logits/rejected": -0.6243188381195068, | |
| "logps/chosen": -10.225044250488281, | |
| "logps/rejected": -12.433060646057129, | |
| "loss": 1.3010810613632202, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.6032217741012573, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": -0.002520320238545537, | |
| "rewards/margins": -0.00917358510196209, | |
| "rewards/rejected": 0.006653264630585909, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.005242 | |
| }, | |
| { | |
| "epoch": 0.0103862382343395, | |
| "grad_norm": 7.314579010009766, | |
| "learning_rate": 2.0512820512820512e-05, | |
| "logits/chosen": -0.6062605381011963, | |
| "logits/rejected": -0.6072395443916321, | |
| "logps/chosen": -9.956047058105469, | |
| "logps/rejected": -11.640246391296387, | |
| "loss": 1.2542610168457031, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5589770674705505, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.007420660927891731, | |
| "rewards/margins": -0.004003261215984821, | |
| "rewards/rejected": 0.011423922143876553, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.005268 | |
| }, | |
| { | |
| "epoch": 0.012982797792924375, | |
| "grad_norm": 3.7953975200653076, | |
| "learning_rate": 2.564102564102564e-05, | |
| "logits/chosen": -0.5976298451423645, | |
| "logits/rejected": -0.5966740846633911, | |
| "logps/chosen": -13.070164680480957, | |
| "logps/rejected": -9.661067008972168, | |
| "loss": 1.215171456336975, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5106430649757385, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": 0.00016488437540829182, | |
| "rewards/margins": -0.020555444061756134, | |
| "rewards/rejected": 0.02072032354772091, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.00529 | |
| }, | |
| { | |
| "epoch": 0.01557935735150925, | |
| "grad_norm": 7.202587604522705, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "logits/chosen": -0.6029255390167236, | |
| "logits/rejected": -0.6082680225372314, | |
| "logps/chosen": -6.68419075012207, | |
| "logps/rejected": -14.836040496826172, | |
| "loss": 1.1022435426712036, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4213921129703522, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.05949082225561142, | |
| "rewards/margins": 0.03669985011219978, | |
| "rewards/rejected": 0.02279096469283104, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.00532 | |
| }, | |
| { | |
| "epoch": 0.018175916910094125, | |
| "grad_norm": 4.17504358291626, | |
| "learning_rate": 3.58974358974359e-05, | |
| "logits/chosen": -0.5737150311470032, | |
| "logits/rejected": -0.5751169919967651, | |
| "logps/chosen": -10.05550479888916, | |
| "logps/rejected": -10.229061126708984, | |
| "loss": 1.1968086957931519, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.451814740896225, | |
| "rewards/accuracies": 0.40625, | |
| "rewards/chosen": 0.018731240183115005, | |
| "rewards/margins": -0.06073049083352089, | |
| "rewards/rejected": 0.0794617310166359, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.005319 | |
| }, | |
| { | |
| "epoch": 0.020772476468679, | |
| "grad_norm": 4.966729164123535, | |
| "learning_rate": 4.1025641025641023e-05, | |
| "logits/chosen": -0.6149957180023193, | |
| "logits/rejected": -0.619285523891449, | |
| "logps/chosen": -10.129886627197266, | |
| "logps/rejected": -14.14559268951416, | |
| "loss": 1.1496262550354004, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.45597678422927856, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.048677604645490646, | |
| "rewards/margins": 0.07307372987270355, | |
| "rewards/rejected": -0.1217513307929039, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.005322 | |
| }, | |
| { | |
| "epoch": 0.023369036027263874, | |
| "grad_norm": 4.258759021759033, | |
| "learning_rate": 4.615384615384616e-05, | |
| "logits/chosen": -0.6464206576347351, | |
| "logits/rejected": -0.649814248085022, | |
| "logps/chosen": -6.2765960693359375, | |
| "logps/rejected": -14.259992599487305, | |
| "loss": 0.9683928489685059, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.27603328227996826, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.028385277837514877, | |
| "rewards/margins": 0.1275366246700287, | |
| "rewards/rejected": -0.15592190623283386, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.005346 | |
| }, | |
| { | |
| "epoch": 0.02596559558584875, | |
| "grad_norm": 3.5765655040740967, | |
| "learning_rate": 5.128205128205128e-05, | |
| "logits/chosen": -0.5905835628509521, | |
| "logits/rejected": -0.5969584584236145, | |
| "logps/chosen": -14.795049667358398, | |
| "logps/rejected": -15.656811714172363, | |
| "loss": 1.238275408744812, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5923190116882324, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.012541369535028934, | |
| "rewards/margins": 0.1883796602487564, | |
| "rewards/rejected": -0.20092105865478516, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.005347 | |
| }, | |
| { | |
| "epoch": 0.028562155144433627, | |
| "grad_norm": 5.3241682052612305, | |
| "learning_rate": 5.6410256410256414e-05, | |
| "logits/chosen": -0.5469571948051453, | |
| "logits/rejected": -0.5478999614715576, | |
| "logps/chosen": -11.43381118774414, | |
| "logps/rejected": -13.521588325500488, | |
| "loss": 1.2181414365768433, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4799095690250397, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.11080781370401382, | |
| "rewards/margins": -0.000970199704170227, | |
| "rewards/rejected": -0.109837606549263, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.0311587147030185, | |
| "grad_norm": 3.739349126815796, | |
| "learning_rate": 6.153846153846155e-05, | |
| "logits/chosen": -0.5663439631462097, | |
| "logits/rejected": -0.5685043931007385, | |
| "logps/chosen": -9.113786697387695, | |
| "logps/rejected": -12.898387908935547, | |
| "loss": 1.1865863800048828, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5080631971359253, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.07351399958133698, | |
| "rewards/margins": 0.09553620219230652, | |
| "rewards/rejected": -0.022022202610969543, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.03375527426160337, | |
| "grad_norm": 2.732536792755127, | |
| "learning_rate": 6.666666666666667e-05, | |
| "logits/chosen": -0.6258959770202637, | |
| "logits/rejected": -0.628243088722229, | |
| "logps/chosen": -11.908061027526855, | |
| "logps/rejected": -14.742002487182617, | |
| "loss": 1.0720946788787842, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44474831223487854, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0872192531824112, | |
| "rewards/margins": 0.16859112679958344, | |
| "rewards/rejected": -0.08137187361717224, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.03635183382018825, | |
| "grad_norm": 2.286402702331543, | |
| "learning_rate": 7.17948717948718e-05, | |
| "logits/chosen": -0.5518996119499207, | |
| "logits/rejected": -0.5536460280418396, | |
| "logps/chosen": -7.985256195068359, | |
| "logps/rejected": -9.997514724731445, | |
| "loss": 1.0465917587280273, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.37517642974853516, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.09782104939222336, | |
| "rewards/margins": 0.08964069932699203, | |
| "rewards/rejected": 0.008180351927876472, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.03894839337877313, | |
| "grad_norm": 2.8793153762817383, | |
| "learning_rate": 7.692307692307693e-05, | |
| "logits/chosen": -0.5976672172546387, | |
| "logits/rejected": -0.5990516543388367, | |
| "logps/chosen": -11.681562423706055, | |
| "logps/rejected": -15.269111633300781, | |
| "loss": 1.0413833856582642, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44159939885139465, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.18112002313137054, | |
| "rewards/margins": 0.246211975812912, | |
| "rewards/rejected": -0.06509192287921906, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.005369 | |
| }, | |
| { | |
| "epoch": 0.041544952937358, | |
| "grad_norm": 3.362415313720703, | |
| "learning_rate": 8.205128205128205e-05, | |
| "logits/chosen": -0.6091838479042053, | |
| "logits/rejected": -0.6097983717918396, | |
| "logps/chosen": -6.9782915115356445, | |
| "logps/rejected": -9.985608100891113, | |
| "loss": 1.0336495637893677, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3420756161212921, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.05590391904115677, | |
| "rewards/margins": 0.03598181903362274, | |
| "rewards/rejected": 0.019922103732824326, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.005368 | |
| }, | |
| { | |
| "epoch": 0.04414151249594288, | |
| "grad_norm": 2.314833641052246, | |
| "learning_rate": 8.717948717948718e-05, | |
| "logits/chosen": -0.6001038551330566, | |
| "logits/rejected": -0.6009984612464905, | |
| "logps/chosen": -8.711943626403809, | |
| "logps/rejected": -8.347241401672363, | |
| "loss": 1.0018643140792847, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3586280345916748, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.17141370475292206, | |
| "rewards/margins": 0.15122823417186737, | |
| "rewards/rejected": 0.020185478031635284, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.04673807205452775, | |
| "grad_norm": 2.6080470085144043, | |
| "learning_rate": 9.230769230769232e-05, | |
| "logits/chosen": -0.6079075932502747, | |
| "logits/rejected": -0.6091002225875854, | |
| "logps/chosen": -9.866250991821289, | |
| "logps/rejected": -9.885502815246582, | |
| "loss": 1.0599387884140015, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3953135013580322, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1653863787651062, | |
| "rewards/margins": 0.13114988803863525, | |
| "rewards/rejected": 0.03423647955060005, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.04933463161311263, | |
| "grad_norm": 2.5750620365142822, | |
| "learning_rate": 9.743589743589744e-05, | |
| "logits/chosen": -0.5754107236862183, | |
| "logits/rejected": -0.5755229592323303, | |
| "logps/chosen": -9.663117408752441, | |
| "logps/rejected": -14.233282089233398, | |
| "loss": 0.9537867307662964, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.35284289717674255, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.12623246014118195, | |
| "rewards/margins": 0.24378177523612976, | |
| "rewards/rejected": -0.11754930019378662, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.00537 | |
| }, | |
| { | |
| "epoch": 0.0519311911716975, | |
| "grad_norm": 4.289522171020508, | |
| "learning_rate": 0.00010256410256410256, | |
| "logits/chosen": -0.5981144905090332, | |
| "logits/rejected": -0.6002673506736755, | |
| "logps/chosen": -8.273541450500488, | |
| "logps/rejected": -12.811166763305664, | |
| "loss": 1.422603964805603, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.8183298707008362, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.21172407269477844, | |
| "rewards/margins": 0.2575765550136566, | |
| "rewards/rejected": -0.04585248976945877, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.005365 | |
| }, | |
| { | |
| "epoch": 0.054527750730282376, | |
| "grad_norm": 2.396873712539673, | |
| "learning_rate": 0.0001076923076923077, | |
| "logits/chosen": -0.5655781030654907, | |
| "logits/rejected": -0.5672769546508789, | |
| "logps/chosen": -7.642134189605713, | |
| "logps/rejected": -16.37198257446289, | |
| "loss": 0.8944156765937805, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.28976452350616455, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2191261202096939, | |
| "rewards/margins": 0.2641218602657318, | |
| "rewards/rejected": -0.04499572888016701, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.005364 | |
| }, | |
| { | |
| "epoch": 0.057124310288867254, | |
| "grad_norm": 3.0281121730804443, | |
| "learning_rate": 0.00011282051282051283, | |
| "logits/chosen": -0.5596702694892883, | |
| "logits/rejected": -0.5609368681907654, | |
| "logps/chosen": -7.446313381195068, | |
| "logps/rejected": -12.651912689208984, | |
| "loss": 0.9526722431182861, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.33721715211868286, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.15709233283996582, | |
| "rewards/margins": 0.2245473712682724, | |
| "rewards/rejected": -0.06745504587888718, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.059720869847452125, | |
| "grad_norm": 2.6955020427703857, | |
| "learning_rate": 0.00011794871794871796, | |
| "logits/chosen": -0.5400959849357605, | |
| "logits/rejected": -0.5422949194908142, | |
| "logps/chosen": -6.002541542053223, | |
| "logps/rejected": -12.28770637512207, | |
| "loss": 0.9044801592826843, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2814594805240631, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.11246027797460556, | |
| "rewards/margins": 0.21622154116630554, | |
| "rewards/rejected": -0.10376127809286118, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.062317429406037, | |
| "grad_norm": 3.1954290866851807, | |
| "learning_rate": 0.0001230769230769231, | |
| "logits/chosen": -0.5763551592826843, | |
| "logits/rejected": -0.5829795598983765, | |
| "logps/chosen": -8.22636890411377, | |
| "logps/rejected": -12.94092845916748, | |
| "loss": 0.9596253037452698, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3679075837135315, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.17844173312187195, | |
| "rewards/margins": 0.2646990418434143, | |
| "rewards/rejected": -0.08625732362270355, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.06491398896462187, | |
| "grad_norm": 3.440917730331421, | |
| "learning_rate": 0.00012820512820512823, | |
| "logits/chosen": -0.5423401594161987, | |
| "logits/rejected": -0.5454680919647217, | |
| "logps/chosen": -6.751742362976074, | |
| "logps/rejected": -14.677633285522461, | |
| "loss": 0.8222842216491699, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2530384063720703, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.20278047025203705, | |
| "rewards/margins": 0.37300848960876465, | |
| "rewards/rejected": -0.1702280342578888, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.005363 | |
| }, | |
| { | |
| "epoch": 0.06751054852320675, | |
| "grad_norm": 7.046718120574951, | |
| "learning_rate": 0.00013333333333333334, | |
| "logits/chosen": -0.531994640827179, | |
| "logits/rejected": -0.5324733257293701, | |
| "logps/chosen": -7.691443920135498, | |
| "logps/rejected": -12.912195205688477, | |
| "loss": 0.8851491212844849, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2668984532356262, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.03996456041932106, | |
| "rewards/margins": 0.30043962597846985, | |
| "rewards/rejected": -0.2604750692844391, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.005354 | |
| }, | |
| { | |
| "epoch": 0.07010710808179163, | |
| "grad_norm": 3.7837774753570557, | |
| "learning_rate": 0.00013846153846153847, | |
| "logits/chosen": -0.5356835722923279, | |
| "logits/rejected": -0.535167932510376, | |
| "logps/chosen": -7.836236476898193, | |
| "logps/rejected": -12.5257568359375, | |
| "loss": 0.9785585999488831, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.39958691596984863, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.11726226657629013, | |
| "rewards/margins": 0.30467987060546875, | |
| "rewards/rejected": -0.18741759657859802, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.005353 | |
| }, | |
| { | |
| "epoch": 0.0727036676403765, | |
| "grad_norm": 2.986128568649292, | |
| "learning_rate": 0.0001435897435897436, | |
| "logits/chosen": -0.5374022126197815, | |
| "logits/rejected": -0.5330510139465332, | |
| "logps/chosen": -10.774028778076172, | |
| "logps/rejected": -10.21718692779541, | |
| "loss": 1.0210673809051514, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44256913661956787, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.08123424649238586, | |
| "rewards/margins": 0.32150229811668396, | |
| "rewards/rejected": -0.2402680516242981, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.07530022719896137, | |
| "grad_norm": 8.227151870727539, | |
| "learning_rate": 0.00014871794871794872, | |
| "logits/chosen": -0.555951714515686, | |
| "logits/rejected": -0.5587239265441895, | |
| "logps/chosen": -7.656264781951904, | |
| "logps/rejected": -16.2135066986084, | |
| "loss": 1.024498701095581, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.467337429523468, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1679726243019104, | |
| "rewards/margins": 0.43920189142227173, | |
| "rewards/rejected": -0.2712292969226837, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.07789678675754626, | |
| "grad_norm": 3.866678476333618, | |
| "learning_rate": 0.00015384615384615385, | |
| "logits/chosen": -0.5329037308692932, | |
| "logits/rejected": -0.5308660864830017, | |
| "logps/chosen": -13.327455520629883, | |
| "logps/rejected": -12.309192657470703, | |
| "loss": 1.1753352880477905, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5743139386177063, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.10232796519994736, | |
| "rewards/margins": 0.27346518635749817, | |
| "rewards/rejected": -0.1711372286081314, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.00537 | |
| }, | |
| { | |
| "epoch": 0.08049334631613113, | |
| "grad_norm": 2.7835240364074707, | |
| "learning_rate": 0.00015897435897435896, | |
| "logits/chosen": -0.5286478996276855, | |
| "logits/rejected": -0.5297562479972839, | |
| "logps/chosen": -8.105016708374023, | |
| "logps/rejected": -18.577655792236328, | |
| "loss": 0.8083048462867737, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3598409593105316, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3429361879825592, | |
| "rewards/margins": 0.6762320399284363, | |
| "rewards/rejected": -0.3332958221435547, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.005368 | |
| }, | |
| { | |
| "epoch": 0.083089905874716, | |
| "grad_norm": 2.621320962905884, | |
| "learning_rate": 0.0001641025641025641, | |
| "logits/chosen": -0.5535257458686829, | |
| "logits/rejected": -0.5577558279037476, | |
| "logps/chosen": -7.381773948669434, | |
| "logps/rejected": -20.8293514251709, | |
| "loss": 0.7857053279876709, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3121376037597656, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.11771110445261002, | |
| "rewards/margins": 0.6395547389984131, | |
| "rewards/rejected": -0.5218436121940613, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.005373 | |
| }, | |
| { | |
| "epoch": 0.08568646543330087, | |
| "grad_norm": 5.273679256439209, | |
| "learning_rate": 0.00016923076923076923, | |
| "logits/chosen": -0.5348193645477295, | |
| "logits/rejected": -0.5335426330566406, | |
| "logps/chosen": -16.012008666992188, | |
| "logps/rejected": -16.090946197509766, | |
| "loss": 1.150058388710022, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5311561822891235, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09080329537391663, | |
| "rewards/margins": 0.3698381185531616, | |
| "rewards/rejected": -0.46064135432243347, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.005375 | |
| }, | |
| { | |
| "epoch": 0.08828302499188576, | |
| "grad_norm": 3.7380588054656982, | |
| "learning_rate": 0.00017435897435897436, | |
| "logits/chosen": -0.526316225528717, | |
| "logits/rejected": -0.5241590738296509, | |
| "logps/chosen": -13.188718795776367, | |
| "logps/rejected": -18.877933502197266, | |
| "loss": 0.8901183009147644, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4010193347930908, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.13551224768161774, | |
| "rewards/margins": 0.7849555015563965, | |
| "rewards/rejected": -0.6494433283805847, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.005376 | |
| }, | |
| { | |
| "epoch": 0.09087958455047063, | |
| "grad_norm": 3.2903590202331543, | |
| "learning_rate": 0.0001794871794871795, | |
| "logits/chosen": -0.5694751739501953, | |
| "logits/rejected": -0.5714199542999268, | |
| "logps/chosen": -13.836735725402832, | |
| "logps/rejected": -17.397571563720703, | |
| "loss": 0.9489783644676208, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4817684292793274, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.17933052778244019, | |
| "rewards/margins": 0.7199034690856934, | |
| "rewards/rejected": -0.5405729413032532, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.005374 | |
| }, | |
| { | |
| "epoch": 0.0934761441090555, | |
| "grad_norm": 7.443658351898193, | |
| "learning_rate": 0.00018461538461538463, | |
| "logits/chosen": -0.5579850077629089, | |
| "logits/rejected": -0.5598161220550537, | |
| "logps/chosen": -9.724953651428223, | |
| "logps/rejected": -19.001192092895508, | |
| "loss": 1.025741696357727, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4933169484138489, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.09439410269260406, | |
| "rewards/margins": 0.531223714351654, | |
| "rewards/rejected": -0.4368295967578888, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.005367 | |
| }, | |
| { | |
| "epoch": 0.09607270366764038, | |
| "grad_norm": 4.221776962280273, | |
| "learning_rate": 0.00018974358974358974, | |
| "logits/chosen": -0.5673465728759766, | |
| "logits/rejected": -0.568681001663208, | |
| "logps/chosen": -7.996758937835693, | |
| "logps/rejected": -16.828737258911133, | |
| "loss": 0.768932044506073, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3632465600967407, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.20153376460075378, | |
| "rewards/margins": 0.8081123232841492, | |
| "rewards/rejected": -0.6065785884857178, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.09866926322622525, | |
| "grad_norm": 4.438755989074707, | |
| "learning_rate": 0.00019487179487179487, | |
| "logits/chosen": -0.5432108640670776, | |
| "logits/rejected": -0.5440645217895508, | |
| "logps/chosen": -11.19113826751709, | |
| "logps/rejected": -16.801233291625977, | |
| "loss": 0.9643179178237915, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5330875515937805, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.212477445602417, | |
| "rewards/margins": 0.7622401714324951, | |
| "rewards/rejected": -0.5497627258300781, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.005362 | |
| }, | |
| { | |
| "epoch": 0.10126582278481013, | |
| "grad_norm": 3.844766855239868, | |
| "learning_rate": 0.0002, | |
| "logits/chosen": -0.5104550719261169, | |
| "logits/rejected": -0.5119606852531433, | |
| "logps/chosen": -11.040297508239746, | |
| "logps/rejected": -18.91219711303711, | |
| "loss": 0.9704711437225342, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5230136513710022, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.14157143235206604, | |
| "rewards/margins": 0.7000695466995239, | |
| "rewards/rejected": -0.5584981441497803, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.103862382343395, | |
| "grad_norm": 5.2911272048950195, | |
| "learning_rate": 0.00019999907650547008, | |
| "logits/chosen": -0.563255250453949, | |
| "logits/rejected": -0.5627263784408569, | |
| "logps/chosen": -8.962218284606934, | |
| "logps/rejected": -20.214658737182617, | |
| "loss": 0.9730861783027649, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4494069516658783, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.03735905885696411, | |
| "rewards/margins": 0.7039426565170288, | |
| "rewards/rejected": -0.6665836572647095, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.10645894190197988, | |
| "grad_norm": 3.2932822704315186, | |
| "learning_rate": 0.0001999963060389371, | |
| "logits/chosen": -0.49407708644866943, | |
| "logits/rejected": -0.4951040744781494, | |
| "logps/chosen": -4.336781978607178, | |
| "logps/rejected": -23.352622985839844, | |
| "loss": 0.5769761800765991, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.21373578906059265, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2602457106113434, | |
| "rewards/margins": 1.0540037155151367, | |
| "rewards/rejected": -0.7937580347061157, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.10905550146056475, | |
| "grad_norm": 3.550082206726074, | |
| "learning_rate": 0.00019999168865157137, | |
| "logits/chosen": -0.5316025018692017, | |
| "logits/rejected": -0.5340486764907837, | |
| "logps/chosen": -8.441543579101562, | |
| "logps/rejected": -18.124588012695312, | |
| "loss": 0.9663518071174622, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.47912853956222534, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.14834752678871155, | |
| "rewards/margins": 0.7632903456687927, | |
| "rewards/rejected": -0.6149427890777588, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.005356 | |
| }, | |
| { | |
| "epoch": 0.11165206101914962, | |
| "grad_norm": 3.8798763751983643, | |
| "learning_rate": 0.0001999852244286554, | |
| "logits/chosen": -0.5125827193260193, | |
| "logits/rejected": -0.5118388533592224, | |
| "logps/chosen": -8.259347915649414, | |
| "logps/rejected": -18.246912002563477, | |
| "loss": 0.8706857562065125, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.3688449263572693, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1189112439751625, | |
| "rewards/margins": 0.5402826070785522, | |
| "rewards/rejected": -0.4213714003562927, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.005355 | |
| }, | |
| { | |
| "epoch": 0.11424862057773451, | |
| "grad_norm": 5.702610015869141, | |
| "learning_rate": 0.0001999769134895828, | |
| "logits/chosen": -0.5676945447921753, | |
| "logits/rejected": -0.5712423324584961, | |
| "logps/chosen": -7.507511138916016, | |
| "logps/rejected": -17.306344985961914, | |
| "loss": 0.9447178840637207, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5068771839141846, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1572760045528412, | |
| "rewards/margins": 0.8183934688568115, | |
| "rewards/rejected": -0.6611174941062927, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.11684518013631938, | |
| "grad_norm": 5.846091270446777, | |
| "learning_rate": 0.0001999667559878556, | |
| "logits/chosen": -0.5530126094818115, | |
| "logits/rejected": -0.5544271469116211, | |
| "logps/chosen": -9.34422779083252, | |
| "logps/rejected": -21.99274444580078, | |
| "loss": 1.0033745765686035, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.5510709285736084, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.06781984120607376, | |
| "rewards/margins": 0.8660807609558105, | |
| "rewards/rejected": -0.7982609868049622, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.11944173969490425, | |
| "grad_norm": 3.4377248287200928, | |
| "learning_rate": 0.00019995475211108185, | |
| "logits/chosen": -0.5516988039016724, | |
| "logits/rejected": -0.5513719916343689, | |
| "logps/chosen": -9.321004867553711, | |
| "logps/rejected": -18.94799041748047, | |
| "loss": 0.838591992855072, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.44976377487182617, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.15304125845432281, | |
| "rewards/margins": 0.9354310631752014, | |
| "rewards/rejected": -0.782389760017395, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.00536 | |
| }, | |
| { | |
| "epoch": 0.12203829925348912, | |
| "grad_norm": 3.021584987640381, | |
| "learning_rate": 0.00019994090208097176, | |
| "logits/chosen": -0.5453197956085205, | |
| "logits/rejected": -0.5457130670547485, | |
| "logps/chosen": -7.513545036315918, | |
| "logps/rejected": -19.929990768432617, | |
| "loss": 0.7878033518791199, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.2906043827533722, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.04635176807641983, | |
| "rewards/margins": 0.8055768609046936, | |
| "rewards/rejected": -0.759225070476532, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.005359 | |
| }, | |
| { | |
| "epoch": 0.124634858812074, | |
| "grad_norm": 2.4632484912872314, | |
| "learning_rate": 0.00019992520615333393, | |
| "logits/chosen": -0.5288453102111816, | |
| "logits/rejected": -0.5294773578643799, | |
| "logps/chosen": -4.316083908081055, | |
| "logps/rejected": -16.75088119506836, | |
| "loss": 0.6369743347167969, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.19174346327781677, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1844159960746765, | |
| "rewards/margins": 0.7728991508483887, | |
| "rewards/rejected": -0.5884830951690674, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.005357 | |
| }, | |
| { | |
| "epoch": 0.12723141837065888, | |
| "grad_norm": 2.225041627883911, | |
| "learning_rate": 0.00019990766461807039, | |
| "logits/chosen": -0.5786827802658081, | |
| "logits/rejected": -0.5775803923606873, | |
| "logps/chosen": -7.1691179275512695, | |
| "logps/rejected": -19.747949600219727, | |
| "loss": 0.611931562423706, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.26027703285217285, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.32533061504364014, | |
| "rewards/margins": 1.0796949863433838, | |
| "rewards/rejected": -0.7543643712997437, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.005358 | |
| }, | |
| { | |
| "epoch": 0.12982797792924375, | |
| "grad_norm": 3.631110429763794, | |
| "learning_rate": 0.00019988827779917137, | |
| "logits/chosen": -0.5347975492477417, | |
| "logits/rejected": -0.5404946804046631, | |
| "logps/chosen": -8.115504264831543, | |
| "logps/rejected": -22.913742065429688, | |
| "loss": 0.8714032769203186, | |
| "memory(GiB)": 46.82, | |
| "nll_loss": 0.4530017375946045, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.22861376404762268, | |
| "rewards/margins": 0.9870915412902832, | |
| "rewards/rejected": -0.7584777474403381, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.00536 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 770, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.5719756566337946e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |