Instructions to use radariscs/finetuned-model3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use radariscs/finetuned-model3 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("THUDM/chatglm3-6b") model = PeftModel.from_pretrained(base_model, "radariscs/finetuned-model3") - Transformers
How to use radariscs/finetuned-model3 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="radariscs/finetuned-model3") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("radariscs/finetuned-model3", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use radariscs/finetuned-model3 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "radariscs/finetuned-model3" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "radariscs/finetuned-model3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/radariscs/finetuned-model3
- SGLang
How to use radariscs/finetuned-model3 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "radariscs/finetuned-model3" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "radariscs/finetuned-model3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "radariscs/finetuned-model3" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "radariscs/finetuned-model3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use radariscs/finetuned-model3 with Docker Model Runner:
docker model run hf.co/radariscs/finetuned-model3
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 100.0, | |
| "eval_steps": 500, | |
| "global_step": 3000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 1.296412467956543, | |
| "learning_rate": 4.9833333333333336e-05, | |
| "loss": 6.3035, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 1.853837013244629, | |
| "learning_rate": 4.966666666666667e-05, | |
| "loss": 6.2895, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 2.636350631713867, | |
| "learning_rate": 4.9500000000000004e-05, | |
| "loss": 5.8852, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 1.3333333333333333, | |
| "grad_norm": 2.0860021114349365, | |
| "learning_rate": 4.933333333333334e-05, | |
| "loss": 5.6215, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 1.6666666666666665, | |
| "grad_norm": 2.122767686843872, | |
| "learning_rate": 4.9166666666666665e-05, | |
| "loss": 5.4156, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 2.524211883544922, | |
| "learning_rate": 4.9e-05, | |
| "loss": 5.1418, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 2.3333333333333335, | |
| "grad_norm": 1.559091567993164, | |
| "learning_rate": 4.883333333333334e-05, | |
| "loss": 4.9602, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 2.6666666666666665, | |
| "grad_norm": 1.53307044506073, | |
| "learning_rate": 4.866666666666667e-05, | |
| "loss": 4.8883, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 1.9714123010635376, | |
| "learning_rate": 4.85e-05, | |
| "loss": 4.8449, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 3.3333333333333335, | |
| "grad_norm": 2.3005592823028564, | |
| "learning_rate": 4.8333333333333334e-05, | |
| "loss": 4.777, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 3.6666666666666665, | |
| "grad_norm": 1.7655234336853027, | |
| "learning_rate": 4.8166666666666674e-05, | |
| "loss": 4.6199, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 2.406660318374634, | |
| "learning_rate": 4.8e-05, | |
| "loss": 4.5809, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 4.333333333333333, | |
| "grad_norm": 1.3763134479522705, | |
| "learning_rate": 4.7833333333333335e-05, | |
| "loss": 4.6002, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 4.666666666666667, | |
| "grad_norm": 1.689234972000122, | |
| "learning_rate": 4.766666666666667e-05, | |
| "loss": 4.3469, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 2.056262969970703, | |
| "learning_rate": 4.75e-05, | |
| "loss": 4.5309, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 5.333333333333333, | |
| "grad_norm": 2.2575061321258545, | |
| "learning_rate": 4.7333333333333336e-05, | |
| "loss": 4.427, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 5.666666666666667, | |
| "grad_norm": 2.107414960861206, | |
| "learning_rate": 4.716666666666667e-05, | |
| "loss": 4.4258, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "grad_norm": 3.0947515964508057, | |
| "learning_rate": 4.7e-05, | |
| "loss": 4.3211, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 6.333333333333333, | |
| "grad_norm": 2.5526816844940186, | |
| "learning_rate": 4.683333333333334e-05, | |
| "loss": 4.2285, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 6.666666666666667, | |
| "grad_norm": 3.0083701610565186, | |
| "learning_rate": 4.666666666666667e-05, | |
| "loss": 4.1818, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "grad_norm": 3.7907357215881348, | |
| "learning_rate": 4.6500000000000005e-05, | |
| "loss": 4.4094, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 7.333333333333333, | |
| "grad_norm": 3.009291648864746, | |
| "learning_rate": 4.633333333333333e-05, | |
| "loss": 4.2939, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 7.666666666666667, | |
| "grad_norm": 2.22172212600708, | |
| "learning_rate": 4.6166666666666666e-05, | |
| "loss": 4.1094, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "grad_norm": 3.069664478302002, | |
| "learning_rate": 4.600000000000001e-05, | |
| "loss": 4.107, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 8.333333333333334, | |
| "grad_norm": 4.088261127471924, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 4.0039, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 8.666666666666666, | |
| "grad_norm": 3.010359764099121, | |
| "learning_rate": 4.566666666666667e-05, | |
| "loss": 4.0322, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "grad_norm": 4.609780788421631, | |
| "learning_rate": 4.55e-05, | |
| "loss": 4.0264, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 9.333333333333334, | |
| "grad_norm": 3.1056251525878906, | |
| "learning_rate": 4.5333333333333335e-05, | |
| "loss": 3.9238, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 9.666666666666666, | |
| "grad_norm": 4.258275508880615, | |
| "learning_rate": 4.516666666666667e-05, | |
| "loss": 3.8287, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 8.313392639160156, | |
| "learning_rate": 4.5e-05, | |
| "loss": 4.0289, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 10.333333333333334, | |
| "grad_norm": 3.298173666000366, | |
| "learning_rate": 4.483333333333333e-05, | |
| "loss": 3.875, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 10.666666666666666, | |
| "grad_norm": 3.938568592071533, | |
| "learning_rate": 4.466666666666667e-05, | |
| "loss": 3.8219, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "grad_norm": 5.611134052276611, | |
| "learning_rate": 4.4500000000000004e-05, | |
| "loss": 3.783, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 11.333333333333334, | |
| "grad_norm": 4.997491836547852, | |
| "learning_rate": 4.433333333333334e-05, | |
| "loss": 3.635, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 11.666666666666666, | |
| "grad_norm": 4.451102256774902, | |
| "learning_rate": 4.4166666666666665e-05, | |
| "loss": 3.777, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "grad_norm": 6.150670528411865, | |
| "learning_rate": 4.4000000000000006e-05, | |
| "loss": 3.6357, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 12.333333333333334, | |
| "grad_norm": 3.217057943344116, | |
| "learning_rate": 4.383333333333334e-05, | |
| "loss": 3.5604, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 12.666666666666666, | |
| "grad_norm": 4.268857955932617, | |
| "learning_rate": 4.3666666666666666e-05, | |
| "loss": 3.558, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "grad_norm": 6.234621047973633, | |
| "learning_rate": 4.35e-05, | |
| "loss": 3.5879, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 13.333333333333334, | |
| "grad_norm": 5.6421122550964355, | |
| "learning_rate": 4.3333333333333334e-05, | |
| "loss": 3.4586, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 13.666666666666666, | |
| "grad_norm": 5.6103291511535645, | |
| "learning_rate": 4.316666666666667e-05, | |
| "loss": 3.5637, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "grad_norm": 11.445439338684082, | |
| "learning_rate": 4.3e-05, | |
| "loss": 3.408, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 14.333333333333334, | |
| "grad_norm": 4.542460918426514, | |
| "learning_rate": 4.2833333333333335e-05, | |
| "loss": 3.2928, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 14.666666666666666, | |
| "grad_norm": 6.412069797515869, | |
| "learning_rate": 4.266666666666667e-05, | |
| "loss": 3.401, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "grad_norm": 7.808368682861328, | |
| "learning_rate": 4.25e-05, | |
| "loss": 3.2502, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 15.333333333333334, | |
| "grad_norm": 4.630376815795898, | |
| "learning_rate": 4.233333333333334e-05, | |
| "loss": 3.0604, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 15.666666666666666, | |
| "grad_norm": 6.1057634353637695, | |
| "learning_rate": 4.216666666666667e-05, | |
| "loss": 3.2697, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "grad_norm": 8.030632972717285, | |
| "learning_rate": 4.2e-05, | |
| "loss": 3.2746, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 16.333333333333332, | |
| "grad_norm": 7.106510162353516, | |
| "learning_rate": 4.183333333333334e-05, | |
| "loss": 2.8727, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 16.666666666666668, | |
| "grad_norm": 7.738669395446777, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 3.2443, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 16.666666666666668, | |
| "eval_bleu-4": 0.01133573170458091, | |
| "eval_rouge-1": 9.791088, | |
| "eval_rouge-2": 1.206828, | |
| "eval_rouge-l": 7.68188, | |
| "eval_runtime": 54.3608, | |
| "eval_samples_per_second": 0.92, | |
| "eval_steps_per_second": 0.074, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "grad_norm": 7.665599822998047, | |
| "learning_rate": 4.15e-05, | |
| "loss": 3.0627, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 17.333333333333332, | |
| "grad_norm": 7.315736293792725, | |
| "learning_rate": 4.133333333333333e-05, | |
| "loss": 3.0016, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 17.666666666666668, | |
| "grad_norm": 7.991681098937988, | |
| "learning_rate": 4.116666666666667e-05, | |
| "loss": 2.825, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "grad_norm": 12.494170188903809, | |
| "learning_rate": 4.1e-05, | |
| "loss": 3.0629, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 18.333333333333332, | |
| "grad_norm": 6.745121002197266, | |
| "learning_rate": 4.0833333333333334e-05, | |
| "loss": 2.8336, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 18.666666666666668, | |
| "grad_norm": 9.98978328704834, | |
| "learning_rate": 4.066666666666667e-05, | |
| "loss": 2.7949, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "grad_norm": 12.781525611877441, | |
| "learning_rate": 4.05e-05, | |
| "loss": 2.7709, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 19.333333333333332, | |
| "grad_norm": 8.222882270812988, | |
| "learning_rate": 4.0333333333333336e-05, | |
| "loss": 2.5885, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 19.666666666666668, | |
| "grad_norm": 7.343435764312744, | |
| "learning_rate": 4.016666666666667e-05, | |
| "loss": 2.7123, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 11.403239250183105, | |
| "learning_rate": 4e-05, | |
| "loss": 2.725, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 20.333333333333332, | |
| "grad_norm": 8.446388244628906, | |
| "learning_rate": 3.983333333333333e-05, | |
| "loss": 2.6447, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 20.666666666666668, | |
| "grad_norm": 10.366560935974121, | |
| "learning_rate": 3.966666666666667e-05, | |
| "loss": 2.5099, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 21.0, | |
| "grad_norm": 9.75031566619873, | |
| "learning_rate": 3.9500000000000005e-05, | |
| "loss": 2.6195, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 21.333333333333332, | |
| "grad_norm": 9.118058204650879, | |
| "learning_rate": 3.933333333333333e-05, | |
| "loss": 2.5158, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 21.666666666666668, | |
| "grad_norm": 8.835354804992676, | |
| "learning_rate": 3.9166666666666665e-05, | |
| "loss": 2.4281, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "grad_norm": 8.594809532165527, | |
| "learning_rate": 3.9000000000000006e-05, | |
| "loss": 2.5107, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 22.333333333333332, | |
| "grad_norm": 10.926968574523926, | |
| "learning_rate": 3.883333333333333e-05, | |
| "loss": 2.2081, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 22.666666666666668, | |
| "grad_norm": 14.033845901489258, | |
| "learning_rate": 3.866666666666667e-05, | |
| "loss": 2.3031, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 23.0, | |
| "grad_norm": 12.142280578613281, | |
| "learning_rate": 3.85e-05, | |
| "loss": 2.49, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 23.333333333333332, | |
| "grad_norm": 14.76121711730957, | |
| "learning_rate": 3.8333333333333334e-05, | |
| "loss": 2.1979, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 23.666666666666668, | |
| "grad_norm": 11.207549095153809, | |
| "learning_rate": 3.816666666666667e-05, | |
| "loss": 2.2727, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 24.0, | |
| "grad_norm": 16.1492977142334, | |
| "learning_rate": 3.8e-05, | |
| "loss": 2.2255, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 24.333333333333332, | |
| "grad_norm": 11.34145736694336, | |
| "learning_rate": 3.7833333333333336e-05, | |
| "loss": 2.089, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 24.666666666666668, | |
| "grad_norm": 13.052652359008789, | |
| "learning_rate": 3.766666666666667e-05, | |
| "loss": 2.0937, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 25.0, | |
| "grad_norm": 11.856340408325195, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 2.2869, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 25.333333333333332, | |
| "grad_norm": 12.312126159667969, | |
| "learning_rate": 3.733333333333334e-05, | |
| "loss": 2.0178, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 25.666666666666668, | |
| "grad_norm": 11.829080581665039, | |
| "learning_rate": 3.7166666666666664e-05, | |
| "loss": 2.0743, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 26.0, | |
| "grad_norm": 14.165120124816895, | |
| "learning_rate": 3.7e-05, | |
| "loss": 2.0939, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 26.333333333333332, | |
| "grad_norm": 12.025735855102539, | |
| "learning_rate": 3.683333333333334e-05, | |
| "loss": 1.7576, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 26.666666666666668, | |
| "grad_norm": 11.29304313659668, | |
| "learning_rate": 3.6666666666666666e-05, | |
| "loss": 1.9957, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 27.0, | |
| "grad_norm": 23.28523063659668, | |
| "learning_rate": 3.65e-05, | |
| "loss": 1.9514, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 27.333333333333332, | |
| "grad_norm": 12.726652145385742, | |
| "learning_rate": 3.633333333333333e-05, | |
| "loss": 1.7189, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 27.666666666666668, | |
| "grad_norm": 8.378824234008789, | |
| "learning_rate": 3.6166666666666674e-05, | |
| "loss": 1.9704, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 28.0, | |
| "grad_norm": 14.736586570739746, | |
| "learning_rate": 3.6e-05, | |
| "loss": 1.8096, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 28.333333333333332, | |
| "grad_norm": 15.176434516906738, | |
| "learning_rate": 3.5833333333333335e-05, | |
| "loss": 1.6465, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 28.666666666666668, | |
| "grad_norm": 11.34609603881836, | |
| "learning_rate": 3.566666666666667e-05, | |
| "loss": 1.9515, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 29.0, | |
| "grad_norm": 18.423521041870117, | |
| "learning_rate": 3.55e-05, | |
| "loss": 1.6075, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 29.333333333333332, | |
| "grad_norm": 11.311395645141602, | |
| "learning_rate": 3.5333333333333336e-05, | |
| "loss": 1.7424, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 29.666666666666668, | |
| "grad_norm": 10.5912504196167, | |
| "learning_rate": 3.516666666666667e-05, | |
| "loss": 1.7851, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "grad_norm": 20.963228225708008, | |
| "learning_rate": 3.5e-05, | |
| "loss": 1.6634, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 30.333333333333332, | |
| "grad_norm": 15.30588150024414, | |
| "learning_rate": 3.483333333333334e-05, | |
| "loss": 1.4269, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 30.666666666666668, | |
| "grad_norm": 13.06655502319336, | |
| "learning_rate": 3.466666666666667e-05, | |
| "loss": 1.6633, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 31.0, | |
| "grad_norm": 17.544469833374023, | |
| "learning_rate": 3.45e-05, | |
| "loss": 1.7136, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 31.333333333333332, | |
| "grad_norm": 11.275141716003418, | |
| "learning_rate": 3.433333333333333e-05, | |
| "loss": 1.593, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 31.666666666666668, | |
| "grad_norm": 15.212080955505371, | |
| "learning_rate": 3.4166666666666666e-05, | |
| "loss": 1.4715, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 32.0, | |
| "grad_norm": 13.32464599609375, | |
| "learning_rate": 3.4000000000000007e-05, | |
| "loss": 1.6348, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 32.333333333333336, | |
| "grad_norm": 10.605897903442383, | |
| "learning_rate": 3.3833333333333334e-05, | |
| "loss": 1.5543, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 32.666666666666664, | |
| "grad_norm": 22.348203659057617, | |
| "learning_rate": 3.366666666666667e-05, | |
| "loss": 1.3891, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 33.0, | |
| "grad_norm": 18.254573822021484, | |
| "learning_rate": 3.35e-05, | |
| "loss": 1.4061, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 33.333333333333336, | |
| "grad_norm": 10.57913875579834, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.4156, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 33.333333333333336, | |
| "eval_bleu-4": 0.014293846394009189, | |
| "eval_rouge-1": 10.354572000000001, | |
| "eval_rouge-2": 1.318692, | |
| "eval_rouge-l": 8.727196, | |
| "eval_runtime": 23.2643, | |
| "eval_samples_per_second": 2.149, | |
| "eval_steps_per_second": 0.172, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 33.666666666666664, | |
| "grad_norm": 11.20750617980957, | |
| "learning_rate": 3.316666666666667e-05, | |
| "loss": 1.5993, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 34.0, | |
| "grad_norm": 19.528348922729492, | |
| "learning_rate": 3.3e-05, | |
| "loss": 1.2265, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 34.333333333333336, | |
| "grad_norm": 12.231386184692383, | |
| "learning_rate": 3.283333333333333e-05, | |
| "loss": 1.3711, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 34.666666666666664, | |
| "grad_norm": 11.137870788574219, | |
| "learning_rate": 3.266666666666667e-05, | |
| "loss": 1.3075, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 35.0, | |
| "grad_norm": 22.426225662231445, | |
| "learning_rate": 3.2500000000000004e-05, | |
| "loss": 1.3265, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 35.333333333333336, | |
| "grad_norm": 12.947052001953125, | |
| "learning_rate": 3.233333333333333e-05, | |
| "loss": 1.1363, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 35.666666666666664, | |
| "grad_norm": 14.686188697814941, | |
| "learning_rate": 3.2166666666666665e-05, | |
| "loss": 1.2345, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 36.0, | |
| "grad_norm": 20.91434097290039, | |
| "learning_rate": 3.2000000000000005e-05, | |
| "loss": 1.4613, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 36.333333333333336, | |
| "grad_norm": 11.309625625610352, | |
| "learning_rate": 3.183333333333334e-05, | |
| "loss": 1.2383, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 36.666666666666664, | |
| "grad_norm": 15.00285816192627, | |
| "learning_rate": 3.1666666666666666e-05, | |
| "loss": 1.2223, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 37.0, | |
| "grad_norm": 18.317081451416016, | |
| "learning_rate": 3.15e-05, | |
| "loss": 1.208, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 37.333333333333336, | |
| "grad_norm": 13.254210472106934, | |
| "learning_rate": 3.1333333333333334e-05, | |
| "loss": 1.1627, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 37.666666666666664, | |
| "grad_norm": 15.431941986083984, | |
| "learning_rate": 3.116666666666667e-05, | |
| "loss": 1.1247, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 38.0, | |
| "grad_norm": 22.179794311523438, | |
| "learning_rate": 3.1e-05, | |
| "loss": 1.3267, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 38.333333333333336, | |
| "grad_norm": 18.577585220336914, | |
| "learning_rate": 3.0833333333333335e-05, | |
| "loss": 0.9686, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 38.666666666666664, | |
| "grad_norm": 13.184283256530762, | |
| "learning_rate": 3.066666666666667e-05, | |
| "loss": 1.304, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 39.0, | |
| "grad_norm": 20.871301651000977, | |
| "learning_rate": 3.05e-05, | |
| "loss": 1.2183, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 39.333333333333336, | |
| "grad_norm": 17.64194107055664, | |
| "learning_rate": 3.0333333333333337e-05, | |
| "loss": 1.2249, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 39.666666666666664, | |
| "grad_norm": 14.231794357299805, | |
| "learning_rate": 3.016666666666667e-05, | |
| "loss": 1.0167, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 40.0, | |
| "grad_norm": 18.015666961669922, | |
| "learning_rate": 3e-05, | |
| "loss": 1.1119, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 40.333333333333336, | |
| "grad_norm": 11.309633255004883, | |
| "learning_rate": 2.9833333333333335e-05, | |
| "loss": 1.168, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 40.666666666666664, | |
| "grad_norm": 16.065601348876953, | |
| "learning_rate": 2.9666666666666672e-05, | |
| "loss": 1.0424, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 41.0, | |
| "grad_norm": 18.812591552734375, | |
| "learning_rate": 2.95e-05, | |
| "loss": 0.9784, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 41.333333333333336, | |
| "grad_norm": 15.690333366394043, | |
| "learning_rate": 2.9333333333333336e-05, | |
| "loss": 1.0022, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 41.666666666666664, | |
| "grad_norm": 16.351472854614258, | |
| "learning_rate": 2.916666666666667e-05, | |
| "loss": 0.8356, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 42.0, | |
| "grad_norm": 18.615581512451172, | |
| "learning_rate": 2.9e-05, | |
| "loss": 1.1577, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 42.333333333333336, | |
| "grad_norm": 15.407186508178711, | |
| "learning_rate": 2.8833333333333334e-05, | |
| "loss": 0.9961, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 42.666666666666664, | |
| "grad_norm": 12.86505126953125, | |
| "learning_rate": 2.8666666666666668e-05, | |
| "loss": 0.9899, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 43.0, | |
| "grad_norm": 21.449777603149414, | |
| "learning_rate": 2.8499999999999998e-05, | |
| "loss": 1.0459, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 43.333333333333336, | |
| "grad_norm": 13.588737487792969, | |
| "learning_rate": 2.8333333333333335e-05, | |
| "loss": 1.0986, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 43.666666666666664, | |
| "grad_norm": 12.909753799438477, | |
| "learning_rate": 2.816666666666667e-05, | |
| "loss": 0.8959, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 44.0, | |
| "grad_norm": 24.045804977416992, | |
| "learning_rate": 2.8000000000000003e-05, | |
| "loss": 0.9674, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 44.333333333333336, | |
| "grad_norm": 12.158957481384277, | |
| "learning_rate": 2.7833333333333333e-05, | |
| "loss": 0.9009, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 44.666666666666664, | |
| "grad_norm": 14.975495338439941, | |
| "learning_rate": 2.7666666666666667e-05, | |
| "loss": 1.0196, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 45.0, | |
| "grad_norm": 20.36781120300293, | |
| "learning_rate": 2.7500000000000004e-05, | |
| "loss": 0.8604, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 45.333333333333336, | |
| "grad_norm": 17.56258201599121, | |
| "learning_rate": 2.733333333333333e-05, | |
| "loss": 0.8594, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 45.666666666666664, | |
| "grad_norm": 14.30294132232666, | |
| "learning_rate": 2.716666666666667e-05, | |
| "loss": 0.8928, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 46.0, | |
| "grad_norm": 16.952926635742188, | |
| "learning_rate": 2.7000000000000002e-05, | |
| "loss": 0.9676, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 46.333333333333336, | |
| "grad_norm": 16.32552719116211, | |
| "learning_rate": 2.6833333333333333e-05, | |
| "loss": 0.9048, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 46.666666666666664, | |
| "grad_norm": 13.696422576904297, | |
| "learning_rate": 2.6666666666666667e-05, | |
| "loss": 0.7759, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 47.0, | |
| "grad_norm": 21.999780654907227, | |
| "learning_rate": 2.6500000000000004e-05, | |
| "loss": 0.9095, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 47.333333333333336, | |
| "grad_norm": 10.440277099609375, | |
| "learning_rate": 2.633333333333333e-05, | |
| "loss": 0.834, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 47.666666666666664, | |
| "grad_norm": 15.309690475463867, | |
| "learning_rate": 2.6166666666666668e-05, | |
| "loss": 0.8083, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 48.0, | |
| "grad_norm": 16.505258560180664, | |
| "learning_rate": 2.6000000000000002e-05, | |
| "loss": 0.8847, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 48.333333333333336, | |
| "grad_norm": 14.78299617767334, | |
| "learning_rate": 2.5833333333333336e-05, | |
| "loss": 0.7282, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 48.666666666666664, | |
| "grad_norm": 12.571621894836426, | |
| "learning_rate": 2.5666666666666666e-05, | |
| "loss": 0.8186, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 49.0, | |
| "grad_norm": 21.80209732055664, | |
| "learning_rate": 2.5500000000000003e-05, | |
| "loss": 0.8353, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 49.333333333333336, | |
| "grad_norm": 14.109270095825195, | |
| "learning_rate": 2.5333333333333337e-05, | |
| "loss": 0.7452, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 49.666666666666664, | |
| "grad_norm": 11.620147705078125, | |
| "learning_rate": 2.5166666666666667e-05, | |
| "loss": 0.7496, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "grad_norm": 16.205835342407227, | |
| "learning_rate": 2.5e-05, | |
| "loss": 0.8757, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "eval_bleu-4": 0.0153966616336688, | |
| "eval_rouge-1": 10.389682, | |
| "eval_rouge-2": 1.070496, | |
| "eval_rouge-l": 9.091686, | |
| "eval_runtime": 8.1028, | |
| "eval_samples_per_second": 6.171, | |
| "eval_steps_per_second": 0.494, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 50.333333333333336, | |
| "grad_norm": 10.946474075317383, | |
| "learning_rate": 2.4833333333333335e-05, | |
| "loss": 0.5948, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 50.666666666666664, | |
| "grad_norm": 16.069765090942383, | |
| "learning_rate": 2.466666666666667e-05, | |
| "loss": 0.7476, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 51.0, | |
| "grad_norm": 11.211699485778809, | |
| "learning_rate": 2.45e-05, | |
| "loss": 0.8379, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 51.333333333333336, | |
| "grad_norm": 10.832846641540527, | |
| "learning_rate": 2.4333333333333336e-05, | |
| "loss": 0.7383, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 51.666666666666664, | |
| "grad_norm": 12.67294979095459, | |
| "learning_rate": 2.4166666666666667e-05, | |
| "loss": 0.6594, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 52.0, | |
| "grad_norm": 21.701597213745117, | |
| "learning_rate": 2.4e-05, | |
| "loss": 0.7467, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 52.333333333333336, | |
| "grad_norm": 11.632275581359863, | |
| "learning_rate": 2.3833333333333334e-05, | |
| "loss": 0.6757, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 52.666666666666664, | |
| "grad_norm": 10.639052391052246, | |
| "learning_rate": 2.3666666666666668e-05, | |
| "loss": 0.7041, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 53.0, | |
| "grad_norm": 13.643338203430176, | |
| "learning_rate": 2.35e-05, | |
| "loss": 0.7479, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 53.333333333333336, | |
| "grad_norm": 14.121153831481934, | |
| "learning_rate": 2.3333333333333336e-05, | |
| "loss": 0.6201, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 53.666666666666664, | |
| "grad_norm": 15.447195053100586, | |
| "learning_rate": 2.3166666666666666e-05, | |
| "loss": 0.7298, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 54.0, | |
| "grad_norm": 16.367645263671875, | |
| "learning_rate": 2.3000000000000003e-05, | |
| "loss": 0.6647, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 54.333333333333336, | |
| "grad_norm": 10.839701652526855, | |
| "learning_rate": 2.2833333333333334e-05, | |
| "loss": 0.6861, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 54.666666666666664, | |
| "grad_norm": 12.888773918151855, | |
| "learning_rate": 2.2666666666666668e-05, | |
| "loss": 0.6263, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 55.0, | |
| "grad_norm": 22.603803634643555, | |
| "learning_rate": 2.25e-05, | |
| "loss": 0.6741, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 55.333333333333336, | |
| "grad_norm": 13.354137420654297, | |
| "learning_rate": 2.2333333333333335e-05, | |
| "loss": 0.5048, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 55.666666666666664, | |
| "grad_norm": 13.713080406188965, | |
| "learning_rate": 2.216666666666667e-05, | |
| "loss": 0.8006, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 56.0, | |
| "grad_norm": 20.906147003173828, | |
| "learning_rate": 2.2000000000000003e-05, | |
| "loss": 0.655, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 56.333333333333336, | |
| "grad_norm": 11.521559715270996, | |
| "learning_rate": 2.1833333333333333e-05, | |
| "loss": 0.6171, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 56.666666666666664, | |
| "grad_norm": 10.769247055053711, | |
| "learning_rate": 2.1666666666666667e-05, | |
| "loss": 0.5979, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 57.0, | |
| "grad_norm": 26.526697158813477, | |
| "learning_rate": 2.15e-05, | |
| "loss": 0.6082, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 57.333333333333336, | |
| "grad_norm": 13.495370864868164, | |
| "learning_rate": 2.1333333333333335e-05, | |
| "loss": 0.6085, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 57.666666666666664, | |
| "grad_norm": 11.95383071899414, | |
| "learning_rate": 2.116666666666667e-05, | |
| "loss": 0.5275, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 58.0, | |
| "grad_norm": 15.479166030883789, | |
| "learning_rate": 2.1e-05, | |
| "loss": 0.6352, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 58.333333333333336, | |
| "grad_norm": 8.971344947814941, | |
| "learning_rate": 2.0833333333333336e-05, | |
| "loss": 0.503, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 58.666666666666664, | |
| "grad_norm": 13.198577880859375, | |
| "learning_rate": 2.0666666666666666e-05, | |
| "loss": 0.6592, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 59.0, | |
| "grad_norm": 16.427032470703125, | |
| "learning_rate": 2.05e-05, | |
| "loss": 0.5499, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 59.333333333333336, | |
| "grad_norm": 10.2465181350708, | |
| "learning_rate": 2.0333333333333334e-05, | |
| "loss": 0.4354, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 59.666666666666664, | |
| "grad_norm": 10.29074478149414, | |
| "learning_rate": 2.0166666666666668e-05, | |
| "loss": 0.6661, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 60.0, | |
| "grad_norm": 19.600507736206055, | |
| "learning_rate": 2e-05, | |
| "loss": 0.5882, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 60.333333333333336, | |
| "grad_norm": 11.511474609375, | |
| "learning_rate": 1.9833333333333335e-05, | |
| "loss": 0.5307, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 60.666666666666664, | |
| "grad_norm": 11.523903846740723, | |
| "learning_rate": 1.9666666666666666e-05, | |
| "loss": 0.5082, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 61.0, | |
| "grad_norm": 12.876562118530273, | |
| "learning_rate": 1.9500000000000003e-05, | |
| "loss": 0.5776, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 61.333333333333336, | |
| "grad_norm": 11.742588996887207, | |
| "learning_rate": 1.9333333333333333e-05, | |
| "loss": 0.5513, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 61.666666666666664, | |
| "grad_norm": 12.635966300964355, | |
| "learning_rate": 1.9166666666666667e-05, | |
| "loss": 0.5571, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 62.0, | |
| "grad_norm": 23.118587493896484, | |
| "learning_rate": 1.9e-05, | |
| "loss": 0.4347, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 62.333333333333336, | |
| "grad_norm": 11.541242599487305, | |
| "learning_rate": 1.8833333333333335e-05, | |
| "loss": 0.5444, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 62.666666666666664, | |
| "grad_norm": 9.640432357788086, | |
| "learning_rate": 1.866666666666667e-05, | |
| "loss": 0.4833, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 63.0, | |
| "grad_norm": 12.937820434570312, | |
| "learning_rate": 1.85e-05, | |
| "loss": 0.5459, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 63.333333333333336, | |
| "grad_norm": 10.67056655883789, | |
| "learning_rate": 1.8333333333333333e-05, | |
| "loss": 0.4312, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 63.666666666666664, | |
| "grad_norm": 15.334728240966797, | |
| "learning_rate": 1.8166666666666667e-05, | |
| "loss": 0.4813, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 64.0, | |
| "grad_norm": 13.186193466186523, | |
| "learning_rate": 1.8e-05, | |
| "loss": 0.626, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 64.33333333333333, | |
| "grad_norm": 11.930886268615723, | |
| "learning_rate": 1.7833333333333334e-05, | |
| "loss": 0.4798, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 64.66666666666667, | |
| "grad_norm": 10.844964027404785, | |
| "learning_rate": 1.7666666666666668e-05, | |
| "loss": 0.486, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 65.0, | |
| "grad_norm": 19.77939796447754, | |
| "learning_rate": 1.75e-05, | |
| "loss": 0.5195, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 65.33333333333333, | |
| "grad_norm": 9.993623733520508, | |
| "learning_rate": 1.7333333333333336e-05, | |
| "loss": 0.5222, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 65.66666666666667, | |
| "grad_norm": 13.50290298461914, | |
| "learning_rate": 1.7166666666666666e-05, | |
| "loss": 0.498, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 66.0, | |
| "grad_norm": 10.404702186584473, | |
| "learning_rate": 1.7000000000000003e-05, | |
| "loss": 0.4574, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 66.33333333333333, | |
| "grad_norm": 10.153060913085938, | |
| "learning_rate": 1.6833333333333334e-05, | |
| "loss": 0.3823, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 66.66666666666667, | |
| "grad_norm": 8.43280029296875, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 0.4269, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 66.66666666666667, | |
| "eval_bleu-4": 0.010931873444869867, | |
| "eval_rouge-1": 8.505866, | |
| "eval_rouge-2": 0.941556, | |
| "eval_rouge-l": 7.10177, | |
| "eval_runtime": 22.2042, | |
| "eval_samples_per_second": 2.252, | |
| "eval_steps_per_second": 0.18, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 67.0, | |
| "grad_norm": 27.903717041015625, | |
| "learning_rate": 1.65e-05, | |
| "loss": 0.4982, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 67.33333333333333, | |
| "grad_norm": 7.979705333709717, | |
| "learning_rate": 1.6333333333333335e-05, | |
| "loss": 0.4806, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 67.66666666666667, | |
| "grad_norm": 8.341840744018555, | |
| "learning_rate": 1.6166666666666665e-05, | |
| "loss": 0.4446, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 68.0, | |
| "grad_norm": 11.943408012390137, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 0.4332, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 68.33333333333333, | |
| "grad_norm": 10.981311798095703, | |
| "learning_rate": 1.5833333333333333e-05, | |
| "loss": 0.4519, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 68.66666666666667, | |
| "grad_norm": 9.797242164611816, | |
| "learning_rate": 1.5666666666666667e-05, | |
| "loss": 0.3967, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 69.0, | |
| "grad_norm": 10.010104179382324, | |
| "learning_rate": 1.55e-05, | |
| "loss": 0.4371, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 69.33333333333333, | |
| "grad_norm": 10.318022727966309, | |
| "learning_rate": 1.5333333333333334e-05, | |
| "loss": 0.4139, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 69.66666666666667, | |
| "grad_norm": 8.449889183044434, | |
| "learning_rate": 1.5166666666666668e-05, | |
| "loss": 0.3752, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 70.0, | |
| "grad_norm": 19.749420166015625, | |
| "learning_rate": 1.5e-05, | |
| "loss": 0.4723, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 70.33333333333333, | |
| "grad_norm": 12.495814323425293, | |
| "learning_rate": 1.4833333333333336e-05, | |
| "loss": 0.4045, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 70.66666666666667, | |
| "grad_norm": 17.12432861328125, | |
| "learning_rate": 1.4666666666666668e-05, | |
| "loss": 0.4675, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 71.0, | |
| "grad_norm": 15.15657901763916, | |
| "learning_rate": 1.45e-05, | |
| "loss": 0.4038, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 71.33333333333333, | |
| "grad_norm": 10.29133415222168, | |
| "learning_rate": 1.4333333333333334e-05, | |
| "loss": 0.3929, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 71.66666666666667, | |
| "grad_norm": 12.336430549621582, | |
| "learning_rate": 1.4166666666666668e-05, | |
| "loss": 0.424, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 72.0, | |
| "grad_norm": 13.467966079711914, | |
| "learning_rate": 1.4000000000000001e-05, | |
| "loss": 0.3505, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 72.33333333333333, | |
| "grad_norm": 10.161850929260254, | |
| "learning_rate": 1.3833333333333334e-05, | |
| "loss": 0.3545, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 72.66666666666667, | |
| "grad_norm": 19.775575637817383, | |
| "learning_rate": 1.3666666666666666e-05, | |
| "loss": 0.3934, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 73.0, | |
| "grad_norm": 16.04716682434082, | |
| "learning_rate": 1.3500000000000001e-05, | |
| "loss": 0.4372, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 73.33333333333333, | |
| "grad_norm": 12.792352676391602, | |
| "learning_rate": 1.3333333333333333e-05, | |
| "loss": 0.3064, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 73.66666666666667, | |
| "grad_norm": 7.55044412612915, | |
| "learning_rate": 1.3166666666666665e-05, | |
| "loss": 0.436, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 74.0, | |
| "grad_norm": 11.396376609802246, | |
| "learning_rate": 1.3000000000000001e-05, | |
| "loss": 0.3665, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 74.33333333333333, | |
| "grad_norm": 9.666080474853516, | |
| "learning_rate": 1.2833333333333333e-05, | |
| "loss": 0.4175, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 74.66666666666667, | |
| "grad_norm": 11.43410587310791, | |
| "learning_rate": 1.2666666666666668e-05, | |
| "loss": 0.338, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 75.0, | |
| "grad_norm": 17.017831802368164, | |
| "learning_rate": 1.25e-05, | |
| "loss": 0.3171, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 75.33333333333333, | |
| "grad_norm": 8.438940048217773, | |
| "learning_rate": 1.2333333333333334e-05, | |
| "loss": 0.3611, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 75.66666666666667, | |
| "grad_norm": 7.017251014709473, | |
| "learning_rate": 1.2166666666666668e-05, | |
| "loss": 0.2615, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 76.0, | |
| "grad_norm": 10.80943775177002, | |
| "learning_rate": 1.2e-05, | |
| "loss": 0.4691, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 76.33333333333333, | |
| "grad_norm": 8.568986892700195, | |
| "learning_rate": 1.1833333333333334e-05, | |
| "loss": 0.401, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 76.66666666666667, | |
| "grad_norm": 7.107341766357422, | |
| "learning_rate": 1.1666666666666668e-05, | |
| "loss": 0.3515, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 77.0, | |
| "grad_norm": 22.53632926940918, | |
| "learning_rate": 1.1500000000000002e-05, | |
| "loss": 0.3561, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 77.33333333333333, | |
| "grad_norm": 8.650052070617676, | |
| "learning_rate": 1.1333333333333334e-05, | |
| "loss": 0.3037, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 77.66666666666667, | |
| "grad_norm": 7.743197917938232, | |
| "learning_rate": 1.1166666666666668e-05, | |
| "loss": 0.3487, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 78.0, | |
| "grad_norm": 24.068574905395508, | |
| "learning_rate": 1.1000000000000001e-05, | |
| "loss": 0.4291, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 78.33333333333333, | |
| "grad_norm": 7.151337623596191, | |
| "learning_rate": 1.0833333333333334e-05, | |
| "loss": 0.2987, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 78.66666666666667, | |
| "grad_norm": 12.052452087402344, | |
| "learning_rate": 1.0666666666666667e-05, | |
| "loss": 0.3087, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 79.0, | |
| "grad_norm": 8.194114685058594, | |
| "learning_rate": 1.05e-05, | |
| "loss": 0.4149, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 79.33333333333333, | |
| "grad_norm": 18.546804428100586, | |
| "learning_rate": 1.0333333333333333e-05, | |
| "loss": 0.2924, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 79.66666666666667, | |
| "grad_norm": 11.837069511413574, | |
| "learning_rate": 1.0166666666666667e-05, | |
| "loss": 0.3248, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 80.0, | |
| "grad_norm": 13.373893737792969, | |
| "learning_rate": 1e-05, | |
| "loss": 0.3667, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 80.33333333333333, | |
| "grad_norm": 11.519779205322266, | |
| "learning_rate": 9.833333333333333e-06, | |
| "loss": 0.2864, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 80.66666666666667, | |
| "grad_norm": 11.079133987426758, | |
| "learning_rate": 9.666666666666667e-06, | |
| "loss": 0.3473, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 81.0, | |
| "grad_norm": 9.95921516418457, | |
| "learning_rate": 9.5e-06, | |
| "loss": 0.3564, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 81.33333333333333, | |
| "grad_norm": 9.30492115020752, | |
| "learning_rate": 9.333333333333334e-06, | |
| "loss": 0.35, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 81.66666666666667, | |
| "grad_norm": 9.720450401306152, | |
| "learning_rate": 9.166666666666666e-06, | |
| "loss": 0.3057, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 82.0, | |
| "grad_norm": 9.247599601745605, | |
| "learning_rate": 9e-06, | |
| "loss": 0.366, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 82.33333333333333, | |
| "grad_norm": 11.79086685180664, | |
| "learning_rate": 8.833333333333334e-06, | |
| "loss": 0.2688, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 82.66666666666667, | |
| "grad_norm": 8.981142044067383, | |
| "learning_rate": 8.666666666666668e-06, | |
| "loss": 0.3495, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 83.0, | |
| "grad_norm": 13.78653335571289, | |
| "learning_rate": 8.500000000000002e-06, | |
| "loss": 0.3382, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 83.33333333333333, | |
| "grad_norm": 7.866267681121826, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 0.3641, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 83.33333333333333, | |
| "eval_bleu-4": 0.01314399071090922, | |
| "eval_rouge-1": 7.1617239999999995, | |
| "eval_rouge-2": 0.930638, | |
| "eval_rouge-l": 6.505934, | |
| "eval_runtime": 39.2347, | |
| "eval_samples_per_second": 1.274, | |
| "eval_steps_per_second": 0.102, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 83.66666666666667, | |
| "grad_norm": 7.449645519256592, | |
| "learning_rate": 8.166666666666668e-06, | |
| "loss": 0.2645, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 84.0, | |
| "grad_norm": 11.910466194152832, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 0.333, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 84.33333333333333, | |
| "grad_norm": 6.2439703941345215, | |
| "learning_rate": 7.833333333333333e-06, | |
| "loss": 0.2807, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 84.66666666666667, | |
| "grad_norm": 8.088899612426758, | |
| "learning_rate": 7.666666666666667e-06, | |
| "loss": 0.286, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 85.0, | |
| "grad_norm": 10.872489929199219, | |
| "learning_rate": 7.5e-06, | |
| "loss": 0.3658, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 85.33333333333333, | |
| "grad_norm": 11.764698028564453, | |
| "learning_rate": 7.333333333333334e-06, | |
| "loss": 0.3449, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 85.66666666666667, | |
| "grad_norm": 8.526141166687012, | |
| "learning_rate": 7.166666666666667e-06, | |
| "loss": 0.2942, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 86.0, | |
| "grad_norm": 11.86618423461914, | |
| "learning_rate": 7.000000000000001e-06, | |
| "loss": 0.2606, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 86.33333333333333, | |
| "grad_norm": 7.137043476104736, | |
| "learning_rate": 6.833333333333333e-06, | |
| "loss": 0.2115, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 86.66666666666667, | |
| "grad_norm": 9.997518539428711, | |
| "learning_rate": 6.666666666666667e-06, | |
| "loss": 0.3622, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 87.0, | |
| "grad_norm": 13.952556610107422, | |
| "learning_rate": 6.5000000000000004e-06, | |
| "loss": 0.3301, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 87.33333333333333, | |
| "grad_norm": 6.8706817626953125, | |
| "learning_rate": 6.333333333333334e-06, | |
| "loss": 0.2917, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 87.66666666666667, | |
| "grad_norm": 8.849396705627441, | |
| "learning_rate": 6.166666666666667e-06, | |
| "loss": 0.3132, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 88.0, | |
| "grad_norm": 7.808640480041504, | |
| "learning_rate": 6e-06, | |
| "loss": 0.2899, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 88.33333333333333, | |
| "grad_norm": 9.02828598022461, | |
| "learning_rate": 5.833333333333334e-06, | |
| "loss": 0.3192, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 88.66666666666667, | |
| "grad_norm": 9.939105987548828, | |
| "learning_rate": 5.666666666666667e-06, | |
| "loss": 0.327, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 89.0, | |
| "grad_norm": 8.936799049377441, | |
| "learning_rate": 5.500000000000001e-06, | |
| "loss": 0.2575, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 89.33333333333333, | |
| "grad_norm": 5.900319576263428, | |
| "learning_rate": 5.333333333333334e-06, | |
| "loss": 0.2195, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 89.66666666666667, | |
| "grad_norm": 8.064023971557617, | |
| "learning_rate": 5.166666666666667e-06, | |
| "loss": 0.3371, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 90.0, | |
| "grad_norm": 8.969693183898926, | |
| "learning_rate": 5e-06, | |
| "loss": 0.3244, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 90.33333333333333, | |
| "grad_norm": 12.219197273254395, | |
| "learning_rate": 4.833333333333333e-06, | |
| "loss": 0.3229, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 90.66666666666667, | |
| "grad_norm": 10.305124282836914, | |
| "learning_rate": 4.666666666666667e-06, | |
| "loss": 0.2122, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 91.0, | |
| "grad_norm": 10.632628440856934, | |
| "learning_rate": 4.5e-06, | |
| "loss": 0.2918, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 91.33333333333333, | |
| "grad_norm": 8.889334678649902, | |
| "learning_rate": 4.333333333333334e-06, | |
| "loss": 0.2593, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 91.66666666666667, | |
| "grad_norm": 9.257316589355469, | |
| "learning_rate": 4.166666666666667e-06, | |
| "loss": 0.2675, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 92.0, | |
| "grad_norm": 10.825838088989258, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 0.2762, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 92.33333333333333, | |
| "grad_norm": 5.7504754066467285, | |
| "learning_rate": 3.833333333333334e-06, | |
| "loss": 0.3151, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 92.66666666666667, | |
| "grad_norm": 8.958855628967285, | |
| "learning_rate": 3.666666666666667e-06, | |
| "loss": 0.2449, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 93.0, | |
| "grad_norm": 9.874862670898438, | |
| "learning_rate": 3.5000000000000004e-06, | |
| "loss": 0.2532, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 93.33333333333333, | |
| "grad_norm": 5.7694292068481445, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "loss": 0.2592, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 93.66666666666667, | |
| "grad_norm": 5.510223388671875, | |
| "learning_rate": 3.166666666666667e-06, | |
| "loss": 0.2479, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 94.0, | |
| "grad_norm": 10.510735511779785, | |
| "learning_rate": 3e-06, | |
| "loss": 0.2776, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 94.33333333333333, | |
| "grad_norm": 6.0051727294921875, | |
| "learning_rate": 2.8333333333333335e-06, | |
| "loss": 0.2901, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 94.66666666666667, | |
| "grad_norm": 10.390340805053711, | |
| "learning_rate": 2.666666666666667e-06, | |
| "loss": 0.3112, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 95.0, | |
| "grad_norm": 8.017951965332031, | |
| "learning_rate": 2.5e-06, | |
| "loss": 0.2174, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 95.33333333333333, | |
| "grad_norm": 9.050470352172852, | |
| "learning_rate": 2.3333333333333336e-06, | |
| "loss": 0.3037, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 95.66666666666667, | |
| "grad_norm": 8.468791961669922, | |
| "learning_rate": 2.166666666666667e-06, | |
| "loss": 0.2548, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 96.0, | |
| "grad_norm": 11.255516052246094, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 0.2687, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 96.33333333333333, | |
| "grad_norm": 6.47818660736084, | |
| "learning_rate": 1.8333333333333335e-06, | |
| "loss": 0.3126, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 96.66666666666667, | |
| "grad_norm": 6.778964042663574, | |
| "learning_rate": 1.6666666666666667e-06, | |
| "loss": 0.2431, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 97.0, | |
| "grad_norm": 10.976977348327637, | |
| "learning_rate": 1.5e-06, | |
| "loss": 0.2336, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 97.33333333333333, | |
| "grad_norm": 6.298826217651367, | |
| "learning_rate": 1.3333333333333334e-06, | |
| "loss": 0.2597, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 97.66666666666667, | |
| "grad_norm": 8.400247573852539, | |
| "learning_rate": 1.1666666666666668e-06, | |
| "loss": 0.2529, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 98.0, | |
| "grad_norm": 9.291470527648926, | |
| "learning_rate": 1.0000000000000002e-06, | |
| "loss": 0.2943, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 98.33333333333333, | |
| "grad_norm": 9.299525260925293, | |
| "learning_rate": 8.333333333333333e-07, | |
| "loss": 0.3338, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 98.66666666666667, | |
| "grad_norm": 6.78817892074585, | |
| "learning_rate": 6.666666666666667e-07, | |
| "loss": 0.2141, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 99.0, | |
| "grad_norm": 10.563423156738281, | |
| "learning_rate": 5.000000000000001e-07, | |
| "loss": 0.2535, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 99.33333333333333, | |
| "grad_norm": 10.254816055297852, | |
| "learning_rate": 3.3333333333333335e-07, | |
| "loss": 0.2927, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 99.66666666666667, | |
| "grad_norm": 8.011021614074707, | |
| "learning_rate": 1.6666666666666668e-07, | |
| "loss": 0.2578, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 100.0, | |
| "grad_norm": 5.230125427246094, | |
| "learning_rate": 0.0, | |
| "loss": 0.2457, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 100.0, | |
| "eval_bleu-4": 0.01294575668988747, | |
| "eval_rouge-1": 8.254532000000001, | |
| "eval_rouge-2": 0.9729860000000001, | |
| "eval_rouge-l": 7.301322, | |
| "eval_runtime": 24.8219, | |
| "eval_samples_per_second": 2.014, | |
| "eval_steps_per_second": 0.161, | |
| "step": 3000 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 3000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 100, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.7896219056156672e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |