Text Generation
Transformers
Safetensors
qwen3
Generated from Trainer
trl
dpo
conversational
text-generation-inference
Instructions to use jciardo/DPO_scratch with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use jciardo/DPO_scratch with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="jciardo/DPO_scratch", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("jciardo/DPO_scratch") model = AutoModelForCausalLM.from_pretrained("jciardo/DPO_scratch", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use jciardo/DPO_scratch with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "jciardo/DPO_scratch" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "jciardo/DPO_scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/jciardo/DPO_scratch
- SGLang
How to use jciardo/DPO_scratch with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "jciardo/DPO_scratch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "jciardo/DPO_scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "jciardo/DPO_scratch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "jciardo/DPO_scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use jciardo/DPO_scratch with Docker Model Runner:
docker model run hf.co/jciardo/DPO_scratch
Invalid JSON:Unexpected token 'I', ..."ad_norm": Infinity,
"... is not valid JSON
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.686698295554384, | |
| "eval_steps": 200, | |
| "global_step": 2400, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.035143208574942894, | |
| "grad_norm": Infinity, | |
| "learning_rate": 3.066666666666666e-07, | |
| "logits/chosen": -0.9749129414558411, | |
| "logits/rejected": -0.5760761499404907, | |
| "logps/chosen": -377.1766357421875, | |
| "logps/rejected": -303.9364929199219, | |
| "loss": 0.6863, | |
| "rewards/accuracies": 0.5674999952316284, | |
| "rewards/chosen": 0.004484061151742935, | |
| "rewards/margins": 0.014561166986823082, | |
| "rewards/rejected": -0.010077104903757572, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.07028641714988579, | |
| "grad_norm": 118.19742584228516, | |
| "learning_rate": 6.333333333333332e-07, | |
| "logits/chosen": -0.7770336270332336, | |
| "logits/rejected": -0.5940005779266357, | |
| "logps/chosen": -369.6046447753906, | |
| "logps/rejected": -307.9879455566406, | |
| "loss": 0.64, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.05502090975642204, | |
| "rewards/margins": 0.13479986786842346, | |
| "rewards/rejected": -0.07977895438671112, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.10542962572482868, | |
| "grad_norm": 95.5091552734375, | |
| "learning_rate": 9.666666666666666e-07, | |
| "logits/chosen": -0.7478348612785339, | |
| "logits/rejected": -0.3990992307662964, | |
| "logps/chosen": -372.7549133300781, | |
| "logps/rejected": -293.626708984375, | |
| "loss": 0.6121, | |
| "rewards/accuracies": 0.675000011920929, | |
| "rewards/chosen": 0.017337413504719734, | |
| "rewards/margins": 0.2657831609249115, | |
| "rewards/rejected": -0.2484457641839981, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.14057283429977158, | |
| "grad_norm": 129.95443725585938, | |
| "learning_rate": 9.997055316896116e-07, | |
| "logits/chosen": -0.8806526064872742, | |
| "logits/rejected": -0.6725770831108093, | |
| "logps/chosen": -357.8478088378906, | |
| "logps/rejected": -275.65130615234375, | |
| "loss": 0.5845, | |
| "rewards/accuracies": 0.6924999952316284, | |
| "rewards/chosen": 0.028637664392590523, | |
| "rewards/margins": 0.37213996052742004, | |
| "rewards/rejected": -0.34350234270095825, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.14057283429977158, | |
| "eval_logits/chosen": -0.849940836429596, | |
| "eval_logits/rejected": -0.8586259484291077, | |
| "eval_logps/chosen": -126.63912963867188, | |
| "eval_logps/rejected": -153.3675079345703, | |
| "eval_loss": 0.6478162407875061, | |
| "eval_rewards/accuracies": 0.8101449012756348, | |
| "eval_rewards/chosen": -0.11397092789411545, | |
| "eval_rewards/margins": 0.11266002058982849, | |
| "eval_rewards/rejected": -0.22663094103336334, | |
| "eval_runtime": 44.6372, | |
| "eval_samples_per_second": 15.458, | |
| "eval_steps_per_second": 7.729, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.17571604287471446, | |
| "grad_norm": 106.08065032958984, | |
| "learning_rate": 9.986880618329365e-07, | |
| "logits/chosen": -0.9304916858673096, | |
| "logits/rejected": -0.6669905185699463, | |
| "logps/chosen": -366.1148681640625, | |
| "logps/rejected": -284.8680725097656, | |
| "loss": 0.5127, | |
| "rewards/accuracies": 0.7699999809265137, | |
| "rewards/chosen": 0.07616949081420898, | |
| "rewards/margins": 0.6659303307533264, | |
| "rewards/rejected": -0.5897608399391174, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.21085925144965736, | |
| "grad_norm": 124.82818603515625, | |
| "learning_rate": 9.96945434200719e-07, | |
| "logits/chosen": -0.853944718837738, | |
| "logits/rejected": -0.5244762301445007, | |
| "logps/chosen": -367.5785827636719, | |
| "logps/rejected": -304.6045837402344, | |
| "loss": 0.5569, | |
| "rewards/accuracies": 0.7124999761581421, | |
| "rewards/chosen": -0.10503432899713516, | |
| "rewards/margins": 0.5734320282936096, | |
| "rewards/rejected": -0.6784663200378418, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.24600246002460024, | |
| "grad_norm": 66.96507263183594, | |
| "learning_rate": 9.944801828018398e-07, | |
| "logits/chosen": -0.8821534514427185, | |
| "logits/rejected": -0.5591131448745728, | |
| "logps/chosen": -389.2870178222656, | |
| "logps/rejected": -304.467041015625, | |
| "loss": 0.5473, | |
| "rewards/accuracies": 0.7225000262260437, | |
| "rewards/chosen": -0.15399029850959778, | |
| "rewards/margins": 0.7008799910545349, | |
| "rewards/rejected": -0.8548702001571655, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.28114566859954315, | |
| "grad_norm": 129.39100646972656, | |
| "learning_rate": 9.912958924348081e-07, | |
| "logits/chosen": -1.1357834339141846, | |
| "logits/rejected": -0.7058276534080505, | |
| "logps/chosen": -364.6184387207031, | |
| "logps/rejected": -316.7001037597656, | |
| "loss": 0.4865, | |
| "rewards/accuracies": 0.7649999856948853, | |
| "rewards/chosen": -0.28908756375312805, | |
| "rewards/margins": 0.9275381565093994, | |
| "rewards/rejected": -1.216625690460205, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.28114566859954315, | |
| "eval_logits/chosen": -1.0553535223007202, | |
| "eval_logits/rejected": -1.0848628282546997, | |
| "eval_logps/chosen": -130.27931213378906, | |
| "eval_logps/rejected": -157.7180633544922, | |
| "eval_loss": 0.6393592953681946, | |
| "eval_rewards/accuracies": 0.7942029237747192, | |
| "eval_rewards/chosen": -0.4779890775680542, | |
| "eval_rewards/margins": 0.18369804322719574, | |
| "eval_rewards/rejected": -0.6616871356964111, | |
| "eval_runtime": 44.5728, | |
| "eval_samples_per_second": 15.48, | |
| "eval_steps_per_second": 7.74, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.316288877174486, | |
| "grad_norm": 106.56148529052734, | |
| "learning_rate": 9.873971934749946e-07, | |
| "logits/chosen": -1.1408377885818481, | |
| "logits/rejected": -0.8068557977676392, | |
| "logps/chosen": -359.27313232421875, | |
| "logps/rejected": -309.91424560546875, | |
| "loss": 0.5123, | |
| "rewards/accuracies": 0.7325000166893005, | |
| "rewards/chosen": -0.2605482041835785, | |
| "rewards/margins": 0.8376699686050415, | |
| "rewards/rejected": -1.0982180833816528, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.3514320857494289, | |
| "grad_norm": 111.91079711914062, | |
| "learning_rate": 9.827897551414597e-07, | |
| "logits/chosen": -1.0800330638885498, | |
| "logits/rejected": -0.7713271379470825, | |
| "logps/chosen": -383.8734130859375, | |
| "logps/rejected": -310.9490661621094, | |
| "loss": 0.5023, | |
| "rewards/accuracies": 0.7425000071525574, | |
| "rewards/chosen": -0.2419007271528244, | |
| "rewards/margins": 0.945677638053894, | |
| "rewards/rejected": -1.1875784397125244, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.3865752943243718, | |
| "grad_norm": 165.75318908691406, | |
| "learning_rate": 9.77593298534426e-07, | |
| "logits/chosen": -1.2925091981887817, | |
| "logits/rejected": -1.0452824831008911, | |
| "logps/chosen": -394.8578796386719, | |
| "logps/rejected": -325.94842529296875, | |
| "loss": 0.4754, | |
| "rewards/accuracies": 0.7400000095367432, | |
| "rewards/chosen": -0.2650391459465027, | |
| "rewards/margins": 1.0042325258255005, | |
| "rewards/rejected": -1.269271731376648, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.42171850289931473, | |
| "grad_norm": 93.74369812011719, | |
| "learning_rate": 9.71603305932502e-07, | |
| "logits/chosen": -1.145042896270752, | |
| "logits/rejected": -0.9232679009437561, | |
| "logps/chosen": -358.3184509277344, | |
| "logps/rejected": -306.0023498535156, | |
| "loss": 0.4767, | |
| "rewards/accuracies": 0.7825000286102295, | |
| "rewards/chosen": -0.32229503989219666, | |
| "rewards/margins": 1.0345232486724854, | |
| "rewards/rejected": -1.3568181991577148, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.42171850289931473, | |
| "eval_logits/chosen": -1.2382392883300781, | |
| "eval_logits/rejected": -1.2902898788452148, | |
| "eval_logps/chosen": -133.6689910888672, | |
| "eval_logps/rejected": -161.33534240722656, | |
| "eval_loss": 0.6566920876502991, | |
| "eval_rewards/accuracies": 0.7739130258560181, | |
| "eval_rewards/chosen": -0.8169569969177246, | |
| "eval_rewards/margins": 0.2064574807882309, | |
| "eval_rewards/rejected": -1.0234146118164062, | |
| "eval_runtime": 44.7437, | |
| "eval_samples_per_second": 15.421, | |
| "eval_steps_per_second": 7.711, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.4568617114742576, | |
| "grad_norm": 174.93446350097656, | |
| "learning_rate": 9.64927540338517e-07, | |
| "logits/chosen": -1.0424299240112305, | |
| "logits/rejected": -0.7404126524925232, | |
| "logps/chosen": -419.05157470703125, | |
| "logps/rejected": -319.6670227050781, | |
| "loss": 0.4469, | |
| "rewards/accuracies": 0.7724999785423279, | |
| "rewards/chosen": -0.3416347801685333, | |
| "rewards/margins": 1.252581238746643, | |
| "rewards/rejected": -1.5942161083221436, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.4920049200492005, | |
| "grad_norm": 96.59870147705078, | |
| "learning_rate": 9.57575709190243e-07, | |
| "logits/chosen": -1.128604531288147, | |
| "logits/rejected": -0.8932415246963501, | |
| "logps/chosen": -401.80511474609375, | |
| "logps/rejected": -310.9868469238281, | |
| "loss": 0.4501, | |
| "rewards/accuracies": 0.7925000190734863, | |
| "rewards/chosen": -0.5053700804710388, | |
| "rewards/margins": 1.3491663932800293, | |
| "rewards/rejected": -1.854536533355713, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.5271481286241434, | |
| "grad_norm": 107.97344207763672, | |
| "learning_rate": 9.49558503013341e-07, | |
| "logits/chosen": -1.060742974281311, | |
| "logits/rejected": -0.7900027632713318, | |
| "logps/chosen": -363.7101135253906, | |
| "logps/rejected": -296.1370849609375, | |
| "loss": 0.4578, | |
| "rewards/accuracies": 0.7774999737739563, | |
| "rewards/chosen": -0.41928350925445557, | |
| "rewards/margins": 1.2345094680786133, | |
| "rewards/rejected": -1.6537928581237793, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.5622913371990863, | |
| "grad_norm": 115.42318725585938, | |
| "learning_rate": 9.408875798759345e-07, | |
| "logits/chosen": -1.1210286617279053, | |
| "logits/rejected": -0.8719848394393921, | |
| "logps/chosen": -383.5552673339844, | |
| "logps/rejected": -314.79168701171875, | |
| "loss": 0.5061, | |
| "rewards/accuracies": 0.7425000071525574, | |
| "rewards/chosen": -0.5828273892402649, | |
| "rewards/margins": 1.1859365701675415, | |
| "rewards/rejected": -1.7687640190124512, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.5622913371990863, | |
| "eval_logits/chosen": -1.3269339799880981, | |
| "eval_logits/rejected": -1.360857605934143, | |
| "eval_logps/chosen": -136.08132934570312, | |
| "eval_logps/rejected": -163.81300354003906, | |
| "eval_loss": 0.6693784594535828, | |
| "eval_rewards/accuracies": 0.7550724744796753, | |
| "eval_rewards/chosen": -1.0581910610198975, | |
| "eval_rewards/margins": 0.21298907697200775, | |
| "eval_rewards/rejected": -1.271180272102356, | |
| "eval_runtime": 44.723, | |
| "eval_samples_per_second": 15.428, | |
| "eval_steps_per_second": 7.714, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.5974345457740292, | |
| "grad_norm": 126.08724975585938, | |
| "learning_rate": 9.315755484362518e-07, | |
| "logits/chosen": -1.0859259366989136, | |
| "logits/rejected": -0.7706220149993896, | |
| "logps/chosen": -381.0041809082031, | |
| "logps/rejected": -318.6121826171875, | |
| "loss": 0.4827, | |
| "rewards/accuracies": 0.8025000095367432, | |
| "rewards/chosen": -0.5592462420463562, | |
| "rewards/margins": 1.1655195951461792, | |
| "rewards/rejected": -1.7247658967971802, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.632577754348972, | |
| "grad_norm": 77.59442901611328, | |
| "learning_rate": 9.216359496079851e-07, | |
| "logits/chosen": -1.0959984064102173, | |
| "logits/rejected": -0.7341098189353943, | |
| "logps/chosen": -379.558837890625, | |
| "logps/rejected": -315.5170593261719, | |
| "loss": 0.4108, | |
| "rewards/accuracies": 0.8100000023841858, | |
| "rewards/chosen": -0.43343108892440796, | |
| "rewards/margins": 1.471386432647705, | |
| "rewards/rejected": -1.9048174619674683, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.6677209629239149, | |
| "grad_norm": 93.53849792480469, | |
| "learning_rate": 9.110832368700279e-07, | |
| "logits/chosen": -1.11549711227417, | |
| "logits/rejected": -0.8405827283859253, | |
| "logps/chosen": -380.1915588378906, | |
| "logps/rejected": -323.5362548828125, | |
| "loss": 0.4607, | |
| "rewards/accuracies": 0.8100000023841858, | |
| "rewards/chosen": -0.6118125319480896, | |
| "rewards/margins": 1.3506970405578613, | |
| "rewards/rejected": -1.9625096321105957, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.7028641714988578, | |
| "grad_norm": 69.78710174560547, | |
| "learning_rate": 8.999327552492229e-07, | |
| "logits/chosen": -1.0321812629699707, | |
| "logits/rejected": -0.8490170836448669, | |
| "logps/chosen": -370.0117492675781, | |
| "logps/rejected": -320.3147888183594, | |
| "loss": 0.518, | |
| "rewards/accuracies": 0.7400000095367432, | |
| "rewards/chosen": -0.527043342590332, | |
| "rewards/margins": 1.2954468727111816, | |
| "rewards/rejected": -1.8224902153015137, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.7028641714988578, | |
| "eval_logits/chosen": -1.3353734016418457, | |
| "eval_logits/rejected": -1.3637131452560425, | |
| "eval_logps/chosen": -137.6568603515625, | |
| "eval_logps/rejected": -165.5953369140625, | |
| "eval_loss": 0.6648596525192261, | |
| "eval_rewards/accuracies": 0.760869562625885, | |
| "eval_rewards/chosen": -1.2157429456710815, | |
| "eval_rewards/margins": 0.23366999626159668, | |
| "eval_rewards/rejected": -1.4494129419326782, | |
| "eval_runtime": 44.7345, | |
| "eval_samples_per_second": 15.424, | |
| "eval_steps_per_second": 7.712, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.7380073800738007, | |
| "grad_norm": 73.34844970703125, | |
| "learning_rate": 8.882007190066827e-07, | |
| "logits/chosen": -1.0483229160308838, | |
| "logits/rejected": -0.716176450252533, | |
| "logps/chosen": -356.2257080078125, | |
| "logps/rejected": -316.9234619140625, | |
| "loss": 0.4831, | |
| "rewards/accuracies": 0.762499988079071, | |
| "rewards/chosen": -0.5482863187789917, | |
| "rewards/margins": 1.286440134048462, | |
| "rewards/rejected": -1.8347265720367432, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.7731505886487436, | |
| "grad_norm": 179.53550720214844, | |
| "learning_rate": 8.759041880601303e-07, | |
| "logits/chosen": -1.1389548778533936, | |
| "logits/rejected": -0.8437424302101135, | |
| "logps/chosen": -360.9399719238281, | |
| "logps/rejected": -327.319580078125, | |
| "loss": 0.4644, | |
| "rewards/accuracies": 0.7799999713897705, | |
| "rewards/chosen": -0.5854690074920654, | |
| "rewards/margins": 1.4202189445495605, | |
| "rewards/rejected": -2.005687952041626, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.8082937972236865, | |
| "grad_norm": 144.1688232421875, | |
| "learning_rate": 8.630610431765432e-07, | |
| "logits/chosen": -1.1540454626083374, | |
| "logits/rejected": -0.8791725635528564, | |
| "logps/chosen": -358.11578369140625, | |
| "logps/rejected": -325.086669921875, | |
| "loss": 0.4801, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.61565762758255, | |
| "rewards/margins": 1.2607437372207642, | |
| "rewards/rejected": -1.876401662826538, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.8434370057986295, | |
| "grad_norm": 87.58560943603516, | |
| "learning_rate": 8.496899599711758e-07, | |
| "logits/chosen": -1.1453388929367065, | |
| "logits/rejected": -0.8830125331878662, | |
| "logps/chosen": -380.4150390625, | |
| "logps/rejected": -328.78448486328125, | |
| "loss": 0.4577, | |
| "rewards/accuracies": 0.7950000166893005, | |
| "rewards/chosen": -0.6934986114501953, | |
| "rewards/margins": 1.3581026792526245, | |
| "rewards/rejected": -2.0516011714935303, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.8434370057986295, | |
| "eval_logits/chosen": -1.4031161069869995, | |
| "eval_logits/rejected": -1.433149814605713, | |
| "eval_logps/chosen": -138.8860321044922, | |
| "eval_logps/rejected": -167.08187866210938, | |
| "eval_loss": 0.6591169834136963, | |
| "eval_rewards/accuracies": 0.769565224647522, | |
| "eval_rewards/chosen": -1.3386619091033936, | |
| "eval_rewards/margins": 0.259408563375473, | |
| "eval_rewards/rejected": -1.5980706214904785, | |
| "eval_runtime": 44.7054, | |
| "eval_samples_per_second": 15.434, | |
| "eval_steps_per_second": 7.717, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.8785802143735723, | |
| "grad_norm": 62.81058883666992, | |
| "learning_rate": 8.358103817507679e-07, | |
| "logits/chosen": -1.0958822965621948, | |
| "logits/rejected": -0.7899726629257202, | |
| "logps/chosen": -380.1678161621094, | |
| "logps/rejected": -310.56219482421875, | |
| "loss": 0.4387, | |
| "rewards/accuracies": 0.762499988079071, | |
| "rewards/chosen": -0.7097710371017456, | |
| "rewards/margins": 1.4620877504348755, | |
| "rewards/rejected": -2.171858787536621, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.9137234229485152, | |
| "grad_norm": 163.62998962402344, | |
| "learning_rate": 8.214424912404299e-07, | |
| "logits/chosen": -1.0615484714508057, | |
| "logits/rejected": -0.8271848559379578, | |
| "logps/chosen": -365.4388732910156, | |
| "logps/rejected": -329.86773681640625, | |
| "loss": 0.466, | |
| "rewards/accuracies": 0.7649999856948853, | |
| "rewards/chosen": -0.8122978210449219, | |
| "rewards/margins": 1.3591680526733398, | |
| "rewards/rejected": -2.1714658737182617, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.9488666315234581, | |
| "grad_norm": 123.21900939941406, | |
| "learning_rate": 8.066071812353162e-07, | |
| "logits/chosen": -1.2160460948944092, | |
| "logits/rejected": -0.9520894885063171, | |
| "logps/chosen": -378.2143249511719, | |
| "logps/rejected": -321.5575256347656, | |
| "loss": 0.4541, | |
| "rewards/accuracies": 0.7875000238418579, | |
| "rewards/chosen": -0.6522579789161682, | |
| "rewards/margins": 1.3640750646591187, | |
| "rewards/rejected": -2.0163331031799316, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.984009840098401, | |
| "grad_norm": 111.00737762451172, | |
| "learning_rate": 7.913260242197632e-07, | |
| "logits/chosen": -1.2698862552642822, | |
| "logits/rejected": -1.0099891424179077, | |
| "logps/chosen": -360.263427734375, | |
| "logps/rejected": -302.4189147949219, | |
| "loss": 0.4738, | |
| "rewards/accuracies": 0.7599999904632568, | |
| "rewards/chosen": -0.7399062514305115, | |
| "rewards/margins": 1.3410731554031372, | |
| "rewards/rejected": -2.080979347229004, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.984009840098401, | |
| "eval_logits/chosen": -1.3625684976577759, | |
| "eval_logits/rejected": -1.3784757852554321, | |
| "eval_logps/chosen": -138.63931274414062, | |
| "eval_logps/rejected": -166.5675506591797, | |
| "eval_loss": 0.6629493236541748, | |
| "eval_rewards/accuracies": 0.7579709887504578, | |
| "eval_rewards/chosen": -1.3139899969100952, | |
| "eval_rewards/margins": 0.23264573514461517, | |
| "eval_rewards/rejected": -1.5466355085372925, | |
| "eval_runtime": 44.7686, | |
| "eval_samples_per_second": 15.413, | |
| "eval_steps_per_second": 7.706, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.0189773326304692, | |
| "grad_norm": 25.185258865356445, | |
| "learning_rate": 7.756212409980718e-07, | |
| "logits/chosen": -1.2253597974777222, | |
| "logits/rejected": -0.9460395574569702, | |
| "logps/chosen": -358.0578308105469, | |
| "logps/rejected": -312.42144775390625, | |
| "loss": 0.2854, | |
| "rewards/accuracies": 0.8718593120574951, | |
| "rewards/chosen": -0.2665604054927826, | |
| "rewards/margins": 2.4454708099365234, | |
| "rewards/rejected": -2.712031126022339, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 1.054120541205412, | |
| "grad_norm": 47.889488220214844, | |
| "learning_rate": 7.595156683825462e-07, | |
| "logits/chosen": -1.3037954568862915, | |
| "logits/rejected": -1.0524487495422363, | |
| "logps/chosen": -385.7896728515625, | |
| "logps/rejected": -340.14324951171875, | |
| "loss": 0.1089, | |
| "rewards/accuracies": 0.9725000262260437, | |
| "rewards/chosen": 0.14200635254383087, | |
| "rewards/margins": 3.677000045776367, | |
| "rewards/rejected": -3.5349936485290527, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.089263749780355, | |
| "grad_norm": 7.548559665679932, | |
| "learning_rate": 7.430327259857772e-07, | |
| "logits/chosen": -1.3957204818725586, | |
| "logits/rejected": -1.155929446220398, | |
| "logps/chosen": -379.749267578125, | |
| "logps/rejected": -325.2372741699219, | |
| "loss": 0.1278, | |
| "rewards/accuracies": 0.9674999713897705, | |
| "rewards/chosen": 0.007118640001863241, | |
| "rewards/margins": 3.5875449180603027, | |
| "rewards/rejected": -3.5804266929626465, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 1.1244069583552978, | |
| "grad_norm": 10.904348373413086, | |
| "learning_rate": 7.261963821654566e-07, | |
| "logits/chosen": -1.4134939908981323, | |
| "logits/rejected": -1.1053929328918457, | |
| "logps/chosen": -354.8056335449219, | |
| "logps/rejected": -326.7030029296875, | |
| "loss": 0.1133, | |
| "rewards/accuracies": 0.9750000238418579, | |
| "rewards/chosen": -0.18568024039268494, | |
| "rewards/margins": 3.7941460609436035, | |
| "rewards/rejected": -3.9798266887664795, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.1244069583552978, | |
| "eval_logits/chosen": -1.8039968013763428, | |
| "eval_logits/rejected": -1.8495479822158813, | |
| "eval_logps/chosen": -146.17001342773438, | |
| "eval_logps/rejected": -175.72039794921875, | |
| "eval_loss": 0.6601921319961548, | |
| "eval_rewards/accuracies": 0.7811594009399414, | |
| "eval_rewards/chosen": -2.0670576095581055, | |
| "eval_rewards/margins": 0.3948650062084198, | |
| "eval_rewards/rejected": -2.4619228839874268, | |
| "eval_runtime": 45.1384, | |
| "eval_samples_per_second": 15.286, | |
| "eval_steps_per_second": 7.643, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.1595501669302408, | |
| "grad_norm": 20.5295352935791, | |
| "learning_rate": 7.090311191712463e-07, | |
| "logits/chosen": -1.632176399230957, | |
| "logits/rejected": -1.37174654006958, | |
| "logps/chosen": -380.2718505859375, | |
| "logps/rejected": -352.9892578125, | |
| "loss": 0.0908, | |
| "rewards/accuracies": 0.9800000190734863, | |
| "rewards/chosen": -0.38161003589630127, | |
| "rewards/margins": 4.1729817390441895, | |
| "rewards/rejected": -4.554591655731201, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 1.1946933755051836, | |
| "grad_norm": 21.824186325073242, | |
| "learning_rate": 6.915618975443784e-07, | |
| "logits/chosen": -1.6156671047210693, | |
| "logits/rejected": -1.4324374198913574, | |
| "logps/chosen": -387.204345703125, | |
| "logps/rejected": -339.71954345703125, | |
| "loss": 0.1449, | |
| "rewards/accuracies": 0.9449999928474426, | |
| "rewards/chosen": -0.5762972235679626, | |
| "rewards/margins": 4.003431797027588, | |
| "rewards/rejected": -4.579729080200195, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.2298365840801266, | |
| "grad_norm": 66.74718475341797, | |
| "learning_rate": 6.738141198217591e-07, | |
| "logits/chosen": -1.6413328647613525, | |
| "logits/rejected": -1.3644522428512573, | |
| "logps/chosen": -363.44366455078125, | |
| "logps/rejected": -322.4190368652344, | |
| "loss": 0.1191, | |
| "rewards/accuracies": 0.9599999785423279, | |
| "rewards/chosen": -0.37116390466690063, | |
| "rewards/margins": 3.9141128063201904, | |
| "rewards/rejected": -4.285276889801025, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 1.2649797926550694, | |
| "grad_norm": 19.022262573242188, | |
| "learning_rate": 6.558135935973521e-07, | |
| "logits/chosen": -1.715476632118225, | |
| "logits/rejected": -1.4770665168762207, | |
| "logps/chosen": -366.1575012207031, | |
| "logps/rejected": -329.7523193359375, | |
| "loss": 0.1085, | |
| "rewards/accuracies": 0.9725000262260437, | |
| "rewards/chosen": -0.46892687678337097, | |
| "rewards/margins": 4.068582534790039, | |
| "rewards/rejected": -4.537509918212891, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.2649797926550694, | |
| "eval_logits/chosen": -1.8528786897659302, | |
| "eval_logits/rejected": -1.8930330276489258, | |
| "eval_logps/chosen": -147.26092529296875, | |
| "eval_logps/rejected": -177.1022491455078, | |
| "eval_loss": 0.6557580232620239, | |
| "eval_rewards/accuracies": 0.7840579748153687, | |
| "eval_rewards/chosen": -2.1761505603790283, | |
| "eval_rewards/margins": 0.4239543676376343, | |
| "eval_rewards/rejected": -2.600104808807373, | |
| "eval_runtime": 44.8492, | |
| "eval_samples_per_second": 15.385, | |
| "eval_steps_per_second": 7.692, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.3001230012300122, | |
| "grad_norm": 27.70209503173828, | |
| "learning_rate": 6.375864939945548e-07, | |
| "logits/chosen": -1.5819531679153442, | |
| "logits/rejected": -1.3250428438186646, | |
| "logps/chosen": -358.1719665527344, | |
| "logps/rejected": -327.7480773925781, | |
| "loss": 0.101, | |
| "rewards/accuracies": 0.9775000214576721, | |
| "rewards/chosen": -0.38992682099342346, | |
| "rewards/margins": 4.033656597137451, | |
| "rewards/rejected": -4.423582553863525, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 1.3352662098049553, | |
| "grad_norm": 17.87761878967285, | |
| "learning_rate": 6.191593256041411e-07, | |
| "logits/chosen": -1.6258714199066162, | |
| "logits/rejected": -1.3926899433135986, | |
| "logps/chosen": -362.2528381347656, | |
| "logps/rejected": -326.35888671875, | |
| "loss": 0.1036, | |
| "rewards/accuracies": 0.9750000238418579, | |
| "rewards/chosen": -0.3824487626552582, | |
| "rewards/margins": 4.142745494842529, | |
| "rewards/rejected": -4.52519416809082, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.370409418379898, | |
| "grad_norm": 6.942252159118652, | |
| "learning_rate": 6.005588839431128e-07, | |
| "logits/chosen": -1.7623356580734253, | |
| "logits/rejected": -1.4591953754425049, | |
| "logps/chosen": -347.2608947753906, | |
| "logps/rejected": -348.46173095703125, | |
| "loss": 0.1031, | |
| "rewards/accuracies": 0.9674999713897705, | |
| "rewards/chosen": -0.635872483253479, | |
| "rewards/margins": 4.266874313354492, | |
| "rewards/rejected": -4.902746677398682, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 1.405552626954841, | |
| "grad_norm": 18.128665924072266, | |
| "learning_rate": 5.81812216490508e-07, | |
| "logits/chosen": -1.6600449085235596, | |
| "logits/rejected": -1.6073315143585205, | |
| "logps/chosen": -392.4981384277344, | |
| "logps/rejected": -345.29913330078125, | |
| "loss": 0.1079, | |
| "rewards/accuracies": 0.9750000238418579, | |
| "rewards/chosen": -0.8337967395782471, | |
| "rewards/margins": 4.29391622543335, | |
| "rewards/rejected": -5.127712249755859, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.405552626954841, | |
| "eval_logits/chosen": -2.016140937805176, | |
| "eval_logits/rejected": -2.087994337081909, | |
| "eval_logps/chosen": -151.57797241210938, | |
| "eval_logps/rejected": -181.83580017089844, | |
| "eval_loss": 0.6645065546035767, | |
| "eval_rewards/accuracies": 0.7840579748153687, | |
| "eval_rewards/chosen": -2.607856035232544, | |
| "eval_rewards/margins": 0.4656042158603668, | |
| "eval_rewards/rejected": -3.073460102081299, | |
| "eval_runtime": 45.2045, | |
| "eval_samples_per_second": 15.264, | |
| "eval_steps_per_second": 7.632, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.4406958355297839, | |
| "grad_norm": 132.83291625976562, | |
| "learning_rate": 5.629465833568234e-07, | |
| "logits/chosen": -1.6978211402893066, | |
| "logits/rejected": -1.537874698638916, | |
| "logps/chosen": -382.0157165527344, | |
| "logps/rejected": -358.0167541503906, | |
| "loss": 0.1307, | |
| "rewards/accuracies": 0.9599999785423279, | |
| "rewards/chosen": -0.7373409271240234, | |
| "rewards/margins": 4.2708845138549805, | |
| "rewards/rejected": -5.008224964141846, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 1.4758390441047267, | |
| "grad_norm": 5.127355575561523, | |
| "learning_rate": 5.439894176442409e-07, | |
| "logits/chosen": -1.7916449308395386, | |
| "logits/rejected": -1.5541598796844482, | |
| "logps/chosen": -390.88214111328125, | |
| "logps/rejected": -364.38250732421875, | |
| "loss": 0.0953, | |
| "rewards/accuracies": 0.9700000286102295, | |
| "rewards/chosen": -0.5856018662452698, | |
| "rewards/margins": 4.4867262840271, | |
| "rewards/rejected": -5.072328090667725, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.5109822526796697, | |
| "grad_norm": 11.737075805664062, | |
| "learning_rate": 5.24968285555305e-07, | |
| "logits/chosen": -1.7472648620605469, | |
| "logits/rejected": -1.5027780532836914, | |
| "logps/chosen": -390.71307373046875, | |
| "logps/rejected": -361.4422607421875, | |
| "loss": 0.1223, | |
| "rewards/accuracies": 0.949999988079071, | |
| "rewards/chosen": -0.861807644367218, | |
| "rewards/margins": 4.3698410987854, | |
| "rewards/rejected": -5.2316484451293945, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 1.5461254612546127, | |
| "grad_norm": 36.32992172241211, | |
| "learning_rate": 5.059108463080506e-07, | |
| "logits/chosen": -1.7441960573196411, | |
| "logits/rejected": -1.5256434679031372, | |
| "logps/chosen": -400.3003845214844, | |
| "logps/rejected": -368.2380065917969, | |
| "loss": 0.136, | |
| "rewards/accuracies": 0.9549999833106995, | |
| "rewards/chosen": -0.8741735816001892, | |
| "rewards/margins": 4.250377178192139, | |
| "rewards/rejected": -5.124550819396973, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.5461254612546127, | |
| "eval_logits/chosen": -2.029924154281616, | |
| "eval_logits/rejected": -2.0764176845550537, | |
| "eval_logps/chosen": -152.37820434570312, | |
| "eval_logps/rejected": -182.8094940185547, | |
| "eval_loss": 0.6600757837295532, | |
| "eval_rewards/accuracies": 0.7898550629615784, | |
| "eval_rewards/chosen": -2.6878771781921387, | |
| "eval_rewards/margins": 0.48295170068740845, | |
| "eval_rewards/rejected": -3.1708288192749023, | |
| "eval_runtime": 44.7936, | |
| "eval_samples_per_second": 15.404, | |
| "eval_steps_per_second": 7.702, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.5812686698295555, | |
| "grad_norm": 15.144909858703613, | |
| "learning_rate": 4.868448119158783e-07, | |
| "logits/chosen": -1.6984503269195557, | |
| "logits/rejected": -1.5325889587402344, | |
| "logps/chosen": -387.57586669921875, | |
| "logps/rejected": -374.7725830078125, | |
| "loss": 0.114, | |
| "rewards/accuracies": 0.9549999833106995, | |
| "rewards/chosen": -0.7923544049263, | |
| "rewards/margins": 4.450418949127197, | |
| "rewards/rejected": -5.242773532867432, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 1.6164118784044983, | |
| "grad_norm": 9.436891555786133, | |
| "learning_rate": 4.6779790689065506e-07, | |
| "logits/chosen": -1.8316223621368408, | |
| "logits/rejected": -1.594365119934082, | |
| "logps/chosen": -364.552978515625, | |
| "logps/rejected": -339.114013671875, | |
| "loss": 0.1108, | |
| "rewards/accuracies": 0.9674999713897705, | |
| "rewards/chosen": -0.9853540658950806, | |
| "rewards/margins": 4.360680103302002, | |
| "rewards/rejected": -5.346034049987793, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.651555086979441, | |
| "grad_norm": 6.352813243865967, | |
| "learning_rate": 4.487978279276421e-07, | |
| "logits/chosen": -1.6773854494094849, | |
| "logits/rejected": -1.5818564891815186, | |
| "logps/chosen": -388.2464599609375, | |
| "logps/rejected": -352.1225891113281, | |
| "loss": 0.1065, | |
| "rewards/accuracies": 0.9700000286102295, | |
| "rewards/chosen": -0.989799976348877, | |
| "rewards/margins": 4.535504341125488, | |
| "rewards/rejected": -5.525304794311523, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 1.686698295554384, | |
| "grad_norm": 21.942838668823242, | |
| "learning_rate": 4.2987220363087207e-07, | |
| "logits/chosen": -1.911537528038025, | |
| "logits/rejected": -1.6945948600769043, | |
| "logps/chosen": -389.4797668457031, | |
| "logps/rejected": -358.8553161621094, | |
| "loss": 0.1128, | |
| "rewards/accuracies": 0.9549999833106995, | |
| "rewards/chosen": -0.8928723335266113, | |
| "rewards/margins": 4.473836898803711, | |
| "rewards/rejected": -5.366708278656006, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.686698295554384, | |
| "eval_logits/chosen": -2.15362811088562, | |
| "eval_logits/rejected": -2.2070846557617188, | |
| "eval_logps/chosen": -154.57290649414062, | |
| "eval_logps/rejected": -185.60618591308594, | |
| "eval_loss": 0.6540037989616394, | |
| "eval_rewards/accuracies": 0.7898550629615784, | |
| "eval_rewards/chosen": -2.9073493480682373, | |
| "eval_rewards/margins": 0.5431488156318665, | |
| "eval_rewards/rejected": -3.450498104095459, | |
| "eval_runtime": 44.9193, | |
| "eval_samples_per_second": 15.361, | |
| "eval_steps_per_second": 7.68, | |
| "step": 2400 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 4269, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 300, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |