Instructions to use noweshere/song-chatbot-v2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use noweshere/song-chatbot-v2 with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use noweshere/song-chatbot-v2 with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf noweshere/song-chatbot-v2:F16 # Run inference directly in the terminal: llama cli -hf noweshere/song-chatbot-v2:F16
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf noweshere/song-chatbot-v2:F16 # Run inference directly in the terminal: llama cli -hf noweshere/song-chatbot-v2:F16
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf noweshere/song-chatbot-v2:F16 # Run inference directly in the terminal: ./llama-cli -hf noweshere/song-chatbot-v2:F16
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf noweshere/song-chatbot-v2:F16 # Run inference directly in the terminal: ./build/bin/llama-cli -hf noweshere/song-chatbot-v2:F16
Use Docker
docker model run hf.co/noweshere/song-chatbot-v2:F16
- LM Studio
- Jan
- Ollama
How to use noweshere/song-chatbot-v2 with Ollama:
ollama run hf.co/noweshere/song-chatbot-v2:F16
- Unsloth Studio
How to use noweshere/song-chatbot-v2 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for noweshere/song-chatbot-v2 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for noweshere/song-chatbot-v2 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for noweshere/song-chatbot-v2 to start chatting
- Atomic Chat new
- Docker Model Runner
How to use noweshere/song-chatbot-v2 with Docker Model Runner:
docker model run hf.co/noweshere/song-chatbot-v2:F16
- Lemonade
How to use noweshere/song-chatbot-v2 with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull noweshere/song-chatbot-v2:F16
Run and chat with the model
lemonade run user.song-chatbot-v2-F16
List all available models
lemonade list
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_metric": 2.6534903049468994, | |
| "best_model_checkpoint": "finetuned_output/checkpoint-26800", | |
| "epoch": 1.9944967682363806, | |
| "eval_steps": 200, | |
| "global_step": 27000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0, | |
| "loss": 6.359, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.862629246676516e-07, | |
| "loss": 6.4896, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": 12.363865852355957, | |
| "learning_rate": 2.2156573116691286e-06, | |
| "loss": 6.7819, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": 17.94967269897461, | |
| "learning_rate": 3.6927621861152146e-06, | |
| "loss": 6.243, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": 19.398380279541016, | |
| "learning_rate": 5.1698670605613006e-06, | |
| "loss": 6.8645, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": 18.63751792907715, | |
| "learning_rate": 6.646971935007386e-06, | |
| "loss": 6.3908, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0, | |
| "grad_norm": 18.712358474731445, | |
| "learning_rate": 8.124076809453472e-06, | |
| "loss": 5.4173, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 16.64569664001465, | |
| "learning_rate": 9.601181683899557e-06, | |
| "loss": 6.0525, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 14.164616584777832, | |
| "learning_rate": 1.1078286558345644e-05, | |
| "loss": 5.7338, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 18.707992553710938, | |
| "learning_rate": 1.255539143279173e-05, | |
| "loss": 5.1387, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 27.919492721557617, | |
| "learning_rate": 1.4032496307237814e-05, | |
| "loss": 5.0792, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 12.875962257385254, | |
| "learning_rate": 1.55096011816839e-05, | |
| "loss": 4.8748, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 13.589888572692871, | |
| "learning_rate": 1.6986706056129988e-05, | |
| "loss": 4.3393, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 14.79183578491211, | |
| "learning_rate": 1.8463810930576073e-05, | |
| "loss": 4.5417, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 15.221105575561523, | |
| "learning_rate": 1.9940915805022155e-05, | |
| "loss": 4.7915, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 13.27481746673584, | |
| "learning_rate": 2.1418020679468243e-05, | |
| "loss": 4.433, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 14.454379081726074, | |
| "learning_rate": 2.2895125553914328e-05, | |
| "loss": 4.4096, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 18.132295608520508, | |
| "learning_rate": 2.4372230428360417e-05, | |
| "loss": 4.2882, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 12.889933586120605, | |
| "learning_rate": 2.58493353028065e-05, | |
| "loss": 4.5541, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 11.339323997497559, | |
| "learning_rate": 2.7326440177252587e-05, | |
| "loss": 4.2746, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 15.804581642150879, | |
| "learning_rate": 2.8803545051698672e-05, | |
| "loss": 4.1199, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "eval_loss": 4.2089715003967285, | |
| "eval_runtime": 1148.912, | |
| "eval_samples_per_second": 4.961, | |
| "eval_steps_per_second": 4.961, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 15.684308052062988, | |
| "learning_rate": 3.0280649926144754e-05, | |
| "loss": 4.5603, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 15.939892768859863, | |
| "learning_rate": 3.1757754800590846e-05, | |
| "loss": 4.2042, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 11.890963554382324, | |
| "learning_rate": 3.323485967503693e-05, | |
| "loss": 3.8026, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 13.109417915344238, | |
| "learning_rate": 3.4711964549483016e-05, | |
| "loss": 4.464, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 12.069670677185059, | |
| "learning_rate": 3.61890694239291e-05, | |
| "loss": 3.9818, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 12.528508186340332, | |
| "learning_rate": 3.7666174298375187e-05, | |
| "loss": 4.1944, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 16.27909278869629, | |
| "learning_rate": 3.9143279172821275e-05, | |
| "loss": 4.1983, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 16.70147132873535, | |
| "learning_rate": 4.062038404726736e-05, | |
| "loss": 4.1177, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 17.577062606811523, | |
| "learning_rate": 4.2097488921713445e-05, | |
| "loss": 4.0985, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 15.422350883483887, | |
| "learning_rate": 4.357459379615953e-05, | |
| "loss": 3.7929, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 25.00748634338379, | |
| "learning_rate": 4.5051698670605616e-05, | |
| "loss": 4.0118, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 14.866429328918457, | |
| "learning_rate": 4.6528803545051704e-05, | |
| "loss": 4.3715, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 16.465192794799805, | |
| "learning_rate": 4.8005908419497786e-05, | |
| "loss": 4.3538, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 12.310616493225098, | |
| "learning_rate": 4.9483013293943874e-05, | |
| "loss": 4.0751, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 11.21264362335205, | |
| "learning_rate": 5.0960118168389956e-05, | |
| "loss": 3.7735, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 20.764062881469727, | |
| "learning_rate": 5.2437223042836045e-05, | |
| "loss": 3.87, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 14.75299072265625, | |
| "learning_rate": 5.3914327917282127e-05, | |
| "loss": 4.0889, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 14.28115177154541, | |
| "learning_rate": 5.5391432791728215e-05, | |
| "loss": 3.63, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 10.375629425048828, | |
| "learning_rate": 5.6868537666174304e-05, | |
| "loss": 4.2333, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 12.934395790100098, | |
| "learning_rate": 5.8345642540620385e-05, | |
| "loss": 3.637, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "eval_loss": 4.002247333526611, | |
| "eval_runtime": 1149.4819, | |
| "eval_samples_per_second": 4.959, | |
| "eval_steps_per_second": 4.959, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 14.344521522521973, | |
| "learning_rate": 5.937961595273265e-05, | |
| "loss": 3.9191, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 16.335979461669922, | |
| "learning_rate": 6.0856720827178737e-05, | |
| "loss": 3.712, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 12.617454528808594, | |
| "learning_rate": 6.233382570162482e-05, | |
| "loss": 3.696, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 11.171549797058105, | |
| "learning_rate": 6.38109305760709e-05, | |
| "loss": 4.317, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 10.807971954345703, | |
| "learning_rate": 6.5288035450517e-05, | |
| "loss": 4.0245, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 14.287726402282715, | |
| "learning_rate": 6.661742983751846e-05, | |
| "loss": 4.11, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 12.783670425415039, | |
| "learning_rate": 6.809453471196455e-05, | |
| "loss": 4.3735, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 14.521145820617676, | |
| "learning_rate": 6.957163958641064e-05, | |
| "loss": 3.8375, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 17.16818618774414, | |
| "learning_rate": 7.104874446085672e-05, | |
| "loss": 4.2095, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 14.1270170211792, | |
| "learning_rate": 7.252584933530281e-05, | |
| "loss": 3.8374, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 10.878564834594727, | |
| "learning_rate": 7.40029542097489e-05, | |
| "loss": 3.8449, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 15.475001335144043, | |
| "learning_rate": 7.548005908419498e-05, | |
| "loss": 3.8567, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 10.29078483581543, | |
| "learning_rate": 7.695716395864106e-05, | |
| "loss": 4.0472, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 11.84984016418457, | |
| "learning_rate": 7.843426883308715e-05, | |
| "loss": 4.0074, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 11.358631134033203, | |
| "learning_rate": 7.991137370753325e-05, | |
| "loss": 4.26, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 9.24376392364502, | |
| "learning_rate": 8.138847858197932e-05, | |
| "loss": 4.1398, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 12.005671501159668, | |
| "learning_rate": 8.286558345642541e-05, | |
| "loss": 3.948, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 16.197847366333008, | |
| "learning_rate": 8.43426883308715e-05, | |
| "loss": 4.252, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 11.188523292541504, | |
| "learning_rate": 8.581979320531758e-05, | |
| "loss": 4.1579, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 10.116312980651855, | |
| "learning_rate": 8.729689807976367e-05, | |
| "loss": 3.7998, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "eval_loss": 3.877913236618042, | |
| "eval_runtime": 1135.4542, | |
| "eval_samples_per_second": 5.02, | |
| "eval_steps_per_second": 5.02, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 11.187545776367188, | |
| "learning_rate": 8.877400295420975e-05, | |
| "loss": 3.5609, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 11.974798202514648, | |
| "learning_rate": 9.025110782865584e-05, | |
| "loss": 4.2729, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 9.664997100830078, | |
| "learning_rate": 9.172821270310192e-05, | |
| "loss": 4.0576, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 8.53403091430664, | |
| "learning_rate": 9.320531757754801e-05, | |
| "loss": 3.7363, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 11.338556289672852, | |
| "learning_rate": 9.468242245199411e-05, | |
| "loss": 4.3457, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 11.836936950683594, | |
| "learning_rate": 9.615952732644018e-05, | |
| "loss": 4.3066, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 7.8482890129089355, | |
| "learning_rate": 9.763663220088627e-05, | |
| "loss": 3.4205, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 9.069377899169922, | |
| "learning_rate": 9.911373707533235e-05, | |
| "loss": 3.992, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 10.200207710266113, | |
| "learning_rate": 0.00010059084194977843, | |
| "loss": 3.7709, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 7.830392360687256, | |
| "learning_rate": 0.00010206794682422452, | |
| "loss": 3.3458, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 9.707051277160645, | |
| "learning_rate": 0.00010354505169867061, | |
| "loss": 3.591, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 7.163864612579346, | |
| "learning_rate": 0.0001050221565731167, | |
| "loss": 3.7154, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 5.52028751373291, | |
| "learning_rate": 0.00010649926144756279, | |
| "loss": 3.4662, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 9.911632537841797, | |
| "learning_rate": 0.00010797636632200887, | |
| "loss": 3.6873, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 9.579071998596191, | |
| "learning_rate": 0.00010945347119645495, | |
| "loss": 3.7212, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 8.60621166229248, | |
| "learning_rate": 0.00011093057607090105, | |
| "loss": 3.8167, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 9.796650886535645, | |
| "learning_rate": 0.00011240768094534713, | |
| "loss": 3.9552, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 10.821413040161133, | |
| "learning_rate": 0.00011388478581979321, | |
| "loss": 3.9494, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 6.736440181732178, | |
| "learning_rate": 0.0001153618906942393, | |
| "loss": 3.6909, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 8.424497604370117, | |
| "learning_rate": 0.00011683899556868539, | |
| "loss": 4.0993, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "eval_loss": 3.8091275691986084, | |
| "eval_runtime": 1134.5045, | |
| "eval_samples_per_second": 5.024, | |
| "eval_steps_per_second": 5.024, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 7.850163459777832, | |
| "learning_rate": 0.00011831610044313146, | |
| "loss": 3.6776, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 10.378649711608887, | |
| "learning_rate": 0.00011979320531757757, | |
| "loss": 3.8521, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 8.155631065368652, | |
| "learning_rate": 0.00012127031019202363, | |
| "loss": 3.5103, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 7.763760089874268, | |
| "learning_rate": 0.00012274741506646973, | |
| "loss": 3.975, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 8.467230796813965, | |
| "learning_rate": 0.00012422451994091582, | |
| "loss": 3.7825, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 9.121253967285156, | |
| "learning_rate": 0.0001257016248153619, | |
| "loss": 3.801, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 9.41889762878418, | |
| "learning_rate": 0.00012717872968980796, | |
| "loss": 3.7899, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.1193108558654785, | |
| "learning_rate": 0.00012865583456425408, | |
| "loss": 3.6037, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.241006851196289, | |
| "learning_rate": 0.00013013293943870015, | |
| "loss": 3.7016, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.67100191116333, | |
| "learning_rate": 0.00013161004431314622, | |
| "loss": 4.0709, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 8.182023048400879, | |
| "learning_rate": 0.00013308714918759234, | |
| "loss": 3.8902, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 6.974468231201172, | |
| "learning_rate": 0.0001345642540620384, | |
| "loss": 3.5811, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 8.211260795593262, | |
| "learning_rate": 0.00013604135893648448, | |
| "loss": 3.7973, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.410445690155029, | |
| "learning_rate": 0.00013751846381093057, | |
| "loss": 3.4891, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.951589584350586, | |
| "learning_rate": 0.00013899556868537667, | |
| "loss": 3.755, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.486601829528809, | |
| "learning_rate": 0.00014047267355982276, | |
| "loss": 3.6841, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 6.828805923461914, | |
| "learning_rate": 0.00014194977843426883, | |
| "loss": 3.8212, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 6.689596176147461, | |
| "learning_rate": 0.00014342688330871493, | |
| "loss": 3.7554, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 9.896605491638184, | |
| "learning_rate": 0.00014490398818316102, | |
| "loss": 3.7252, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.683341026306152, | |
| "learning_rate": 0.0001463810930576071, | |
| "loss": 3.8645, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "eval_loss": 3.7340312004089355, | |
| "eval_runtime": 1137.3342, | |
| "eval_samples_per_second": 5.012, | |
| "eval_steps_per_second": 5.012, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 7.333156108856201, | |
| "learning_rate": 0.0001478581979320532, | |
| "loss": 3.701, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 6.860635757446289, | |
| "learning_rate": 0.00014933530280649928, | |
| "loss": 3.8575, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 8.277637481689453, | |
| "learning_rate": 0.00015081240768094535, | |
| "loss": 3.5714, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 6.834525108337402, | |
| "learning_rate": 0.00015228951255539145, | |
| "loss": 3.7444, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 7.9503679275512695, | |
| "learning_rate": 0.00015376661742983754, | |
| "loss": 4.1119, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 6.239004135131836, | |
| "learning_rate": 0.0001552437223042836, | |
| "loss": 3.9033, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 8.255178451538086, | |
| "learning_rate": 0.00015672082717872968, | |
| "loss": 3.9257, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 5.259088039398193, | |
| "learning_rate": 0.0001581979320531758, | |
| "loss": 3.8068, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 7.921567916870117, | |
| "learning_rate": 0.00015967503692762187, | |
| "loss": 3.9009, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 5.800931930541992, | |
| "learning_rate": 0.00016115214180206794, | |
| "loss": 3.4145, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 5.795458793640137, | |
| "learning_rate": 0.00016262924667651406, | |
| "loss": 3.8581, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 6.043853282928467, | |
| "learning_rate": 0.00016410635155096013, | |
| "loss": 3.6541, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 9.615581512451172, | |
| "learning_rate": 0.0001655834564254062, | |
| "loss": 3.7231, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 7.142824172973633, | |
| "learning_rate": 0.0001670605612998523, | |
| "loss": 3.9728, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 8.246708869934082, | |
| "learning_rate": 0.00016853766617429839, | |
| "loss": 3.7804, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 7.163732528686523, | |
| "learning_rate": 0.00017001477104874445, | |
| "loss": 3.5747, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 7.906023979187012, | |
| "learning_rate": 0.00017149187592319055, | |
| "loss": 3.8617, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 7.039794445037842, | |
| "learning_rate": 0.00017296898079763664, | |
| "loss": 3.57, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 4.418554782867432, | |
| "learning_rate": 0.0001744460856720827, | |
| "loss": 3.5283, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 4.833454608917236, | |
| "learning_rate": 0.0001759231905465288, | |
| "loss": 3.707, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "eval_loss": 3.6806743144989014, | |
| "eval_runtime": 1137.1006, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 7.413050174713135, | |
| "learning_rate": 0.0001774002954209749, | |
| "loss": 3.6721, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 7.842188358306885, | |
| "learning_rate": 0.000178877400295421, | |
| "loss": 3.4724, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 6.357587814331055, | |
| "learning_rate": 0.00018035450516986707, | |
| "loss": 3.56, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 6.298316478729248, | |
| "learning_rate": 0.00018183161004431316, | |
| "loss": 3.6209, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 5.822552680969238, | |
| "learning_rate": 0.00018330871491875926, | |
| "loss": 3.4501, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 5.943758487701416, | |
| "learning_rate": 0.00018478581979320533, | |
| "loss": 3.6772, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 5.048367977142334, | |
| "learning_rate": 0.0001862629246676514, | |
| "loss": 3.5117, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 6.460511684417725, | |
| "learning_rate": 0.00018774002954209752, | |
| "loss": 3.7063, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 5.242683410644531, | |
| "learning_rate": 0.00018921713441654358, | |
| "loss": 3.636, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 7.642856597900391, | |
| "learning_rate": 0.00019069423929098965, | |
| "loss": 3.9246, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 8.507002830505371, | |
| "learning_rate": 0.00019217134416543577, | |
| "loss": 3.7781, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 7.879441261291504, | |
| "learning_rate": 0.00019364844903988184, | |
| "loss": 3.7177, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 7.368891716003418, | |
| "learning_rate": 0.0001951255539143279, | |
| "loss": 3.8024, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 7.859127044677734, | |
| "learning_rate": 0.000196602658788774, | |
| "loss": 3.9274, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 6.2005743980407715, | |
| "learning_rate": 0.0001980797636632201, | |
| "loss": 3.2389, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 7.01071310043335, | |
| "learning_rate": 0.00019955686853766617, | |
| "loss": 3.947, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 6.5373759269714355, | |
| "learning_rate": 0.0001999999634469286, | |
| "loss": 3.6943, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 5.488951206207275, | |
| "learning_rate": 0.00019999978441154117, | |
| "loss": 4.0045, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 6.409852504730225, | |
| "learning_rate": 0.00019999945618027503, | |
| "loss": 3.8439, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 9.671121597290039, | |
| "learning_rate": 0.0001999989787536199, | |
| "loss": 3.4072, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "eval_loss": 3.6475000381469727, | |
| "eval_runtime": 1136.9069, | |
| "eval_samples_per_second": 5.014, | |
| "eval_steps_per_second": 5.014, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 6.519821643829346, | |
| "learning_rate": 0.00019999835213228807, | |
| "loss": 3.5066, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 7.092315196990967, | |
| "learning_rate": 0.00019999757631721448, | |
| "loss": 3.4159, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 5.200545310974121, | |
| "learning_rate": 0.00019999665130955658, | |
| "loss": 3.6435, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 9.300562858581543, | |
| "learning_rate": 0.00019999557711069445, | |
| "loss": 3.4732, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 6.44257926940918, | |
| "learning_rate": 0.00019999435372223073, | |
| "loss": 3.2643, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 5.217918872833252, | |
| "learning_rate": 0.00019999298114599073, | |
| "loss": 3.4528, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 5.9047465324401855, | |
| "learning_rate": 0.00019999145938402223, | |
| "loss": 3.615, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 6.925083160400391, | |
| "learning_rate": 0.00019998978843859563, | |
| "loss": 3.5132, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 5.6990885734558105, | |
| "learning_rate": 0.000199987968312204, | |
| "loss": 3.5586, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 6.031268119812012, | |
| "learning_rate": 0.00019998599900756278, | |
| "loss": 3.4244, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 6.2754807472229, | |
| "learning_rate": 0.0001999838805276102, | |
| "loss": 3.6738, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 7.507335662841797, | |
| "learning_rate": 0.0001999816128755069, | |
| "loss": 3.5759, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 5.121018886566162, | |
| "learning_rate": 0.00019997919605463615, | |
| "loss": 3.4038, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 6.7317585945129395, | |
| "learning_rate": 0.00019997663006860377, | |
| "loss": 3.4423, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 8.375152587890625, | |
| "learning_rate": 0.00019997391492123805, | |
| "loss": 3.4604, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 8.493053436279297, | |
| "learning_rate": 0.00019997105061658993, | |
| "loss": 3.7444, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.297514915466309, | |
| "learning_rate": 0.00019996803715893288, | |
| "loss": 3.5108, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.771124362945557, | |
| "learning_rate": 0.0001999648745527628, | |
| "loss": 3.4314, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 6.717478275299072, | |
| "learning_rate": 0.0001999615628027982, | |
| "loss": 3.4074, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 6.69790506362915, | |
| "learning_rate": 0.00019995810191398013, | |
| "loss": 3.6088, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "eval_loss": 3.577223777770996, | |
| "eval_runtime": 1137.2761, | |
| "eval_samples_per_second": 5.012, | |
| "eval_steps_per_second": 5.012, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 6.6742353439331055, | |
| "learning_rate": 0.00019995449189147202, | |
| "loss": 3.8424, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.415431499481201, | |
| "learning_rate": 0.00019995073274065996, | |
| "loss": 3.5783, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 6.665797233581543, | |
| "learning_rate": 0.00019994682446715243, | |
| "loss": 3.7045, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.37005090713501, | |
| "learning_rate": 0.00019994276707678042, | |
| "loss": 3.6974, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.891625881195068, | |
| "learning_rate": 0.0001999385605755974, | |
| "loss": 3.7608, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.512894153594971, | |
| "learning_rate": 0.0001999342049698793, | |
| "loss": 3.431, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 6.875561714172363, | |
| "learning_rate": 0.00019992970026612458, | |
| "loss": 3.3929, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 8.319578170776367, | |
| "learning_rate": 0.00019992504647105402, | |
| "loss": 4.0538, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 7.310130596160889, | |
| "learning_rate": 0.00019992024359161094, | |
| "loss": 3.4099, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 8.529996871948242, | |
| "learning_rate": 0.00019991529163496105, | |
| "loss": 3.8976, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 7.030924320220947, | |
| "learning_rate": 0.00019991019060849245, | |
| "loss": 3.308, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 7.881046772003174, | |
| "learning_rate": 0.00019990494051981572, | |
| "loss": 3.6736, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 6.200523376464844, | |
| "learning_rate": 0.00019989954137676378, | |
| "loss": 3.5267, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 7.548309326171875, | |
| "learning_rate": 0.00019989399318739195, | |
| "loss": 3.5834, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 4.992281436920166, | |
| "learning_rate": 0.0001998882959599779, | |
| "loss": 3.5305, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 4.387537002563477, | |
| "learning_rate": 0.00019988244970302167, | |
| "loss": 3.6708, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 7.442427158355713, | |
| "learning_rate": 0.00019987645442524565, | |
| "loss": 3.3423, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 8.170509338378906, | |
| "learning_rate": 0.00019987031013559464, | |
| "loss": 3.3772, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 7.7752156257629395, | |
| "learning_rate": 0.00019986401684323558, | |
| "loss": 3.3992, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 7.013359546661377, | |
| "learning_rate": 0.00019985757455755792, | |
| "loss": 3.5566, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "eval_loss": 3.54105806350708, | |
| "eval_runtime": 1135.1448, | |
| "eval_samples_per_second": 5.021, | |
| "eval_steps_per_second": 5.021, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 6.861136436462402, | |
| "learning_rate": 0.00019985098328817325, | |
| "loss": 3.9438, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 6.609218120574951, | |
| "learning_rate": 0.00019984424304491548, | |
| "loss": 3.666, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 4.466552257537842, | |
| "learning_rate": 0.00019983735383784083, | |
| "loss": 3.8464, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 7.376965522766113, | |
| "learning_rate": 0.00019983031567722776, | |
| "loss": 3.6616, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 7.786184310913086, | |
| "learning_rate": 0.00019982312857357685, | |
| "loss": 3.7319, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 8.764631271362305, | |
| "learning_rate": 0.00019981579253761108, | |
| "loss": 3.6593, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 5.396511077880859, | |
| "learning_rate": 0.00019980830758027545, | |
| "loss": 3.441, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 8.925567626953125, | |
| "learning_rate": 0.00019980067371273735, | |
| "loss": 3.4468, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 8.163759231567383, | |
| "learning_rate": 0.00019979289094638613, | |
| "loss": 3.245, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 8.861410140991211, | |
| "learning_rate": 0.00019978495929283337, | |
| "loss": 3.5554, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 7.900471210479736, | |
| "learning_rate": 0.00019977687876391285, | |
| "loss": 3.2615, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 5.780396461486816, | |
| "learning_rate": 0.00019976864937168036, | |
| "loss": 3.3208, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 5.2572407722473145, | |
| "learning_rate": 0.00019976027112841388, | |
| "loss": 3.352, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 5.782130241394043, | |
| "learning_rate": 0.00019975174404661346, | |
| "loss": 3.5688, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 6.212008953094482, | |
| "learning_rate": 0.0001997430681390011, | |
| "loss": 3.5783, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 6.492382049560547, | |
| "learning_rate": 0.00019973424341852099, | |
| "loss": 3.5022, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 8.884483337402344, | |
| "learning_rate": 0.0001997252698983392, | |
| "loss": 3.7064, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 5.934466361999512, | |
| "learning_rate": 0.000199716147591844, | |
| "loss": 3.2841, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 7.51339054107666, | |
| "learning_rate": 0.00019970687651264544, | |
| "loss": 3.5057, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.577907562255859, | |
| "learning_rate": 0.00019969745667457563, | |
| "loss": 3.732, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "eval_loss": 3.5348992347717285, | |
| "eval_runtime": 1138.0424, | |
| "eval_samples_per_second": 5.009, | |
| "eval_steps_per_second": 5.009, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 7.850986957550049, | |
| "learning_rate": 0.00019968788809168864, | |
| "loss": 3.6663, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.481893539428711, | |
| "learning_rate": 0.00019967817077826038, | |
| "loss": 3.6468, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 4.882330417633057, | |
| "learning_rate": 0.00019966830474878874, | |
| "loss": 3.2107, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.80741548538208, | |
| "learning_rate": 0.0001996582900179935, | |
| "loss": 3.4008, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.9632062911987305, | |
| "learning_rate": 0.0001996481266008162, | |
| "loss": 3.7073, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.361908435821533, | |
| "learning_rate": 0.0001996378145124203, | |
| "loss": 3.766, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.315945625305176, | |
| "learning_rate": 0.00019962735376819103, | |
| "loss": 3.2956, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.583601474761963, | |
| "learning_rate": 0.00019961674438373543, | |
| "loss": 3.5508, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 4.8111443519592285, | |
| "learning_rate": 0.00019960598637488232, | |
| "loss": 3.2411, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 4.75316858291626, | |
| "learning_rate": 0.0001995950797576822, | |
| "loss": 3.5754, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 10.522501945495605, | |
| "learning_rate": 0.00019958402454840735, | |
| "loss": 3.4347, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 4.327103137969971, | |
| "learning_rate": 0.00019957282076355176, | |
| "loss": 3.1955, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 6.88126802444458, | |
| "learning_rate": 0.00019956146841983095, | |
| "loss": 3.7632, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 7.087936878204346, | |
| "learning_rate": 0.00019954996753418226, | |
| "loss": 3.6128, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 7.831874847412109, | |
| "learning_rate": 0.00019953831812376458, | |
| "loss": 3.3576, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 8.72523307800293, | |
| "learning_rate": 0.00019952652020595836, | |
| "loss": 3.7325, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 4.645705223083496, | |
| "learning_rate": 0.0001995145737983657, | |
| "loss": 3.1901, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 4.229705810546875, | |
| "learning_rate": 0.00019950247891881007, | |
| "loss": 3.4187, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 6.123934745788574, | |
| "learning_rate": 0.00019949023558533667, | |
| "loss": 3.4375, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 5.184828758239746, | |
| "learning_rate": 0.00019947784381621207, | |
| "loss": 3.439, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "eval_loss": 3.48419451713562, | |
| "eval_runtime": 1136.5822, | |
| "eval_samples_per_second": 5.015, | |
| "eval_steps_per_second": 5.015, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 8.93528938293457, | |
| "learning_rate": 0.0001994653036299243, | |
| "loss": 3.3408, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 6.074134349822998, | |
| "learning_rate": 0.00019945261504518283, | |
| "loss": 3.2553, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 6.840206623077393, | |
| "learning_rate": 0.0001994397780809186, | |
| "loss": 3.7404, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 5.7097015380859375, | |
| "learning_rate": 0.00019942679275628385, | |
| "loss": 3.5795, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 9.260488510131836, | |
| "learning_rate": 0.00019941365909065213, | |
| "loss": 3.3823, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 5.96670389175415, | |
| "learning_rate": 0.00019940037710361845, | |
| "loss": 3.5781, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 6.096765041351318, | |
| "learning_rate": 0.000199386946814999, | |
| "loss": 3.318, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 8.807679176330566, | |
| "learning_rate": 0.00019937336824483125, | |
| "loss": 3.899, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 8.762829780578613, | |
| "learning_rate": 0.00019935964141337397, | |
| "loss": 3.6643, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 6.245787143707275, | |
| "learning_rate": 0.00019934576634110694, | |
| "loss": 3.3506, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 7.598389148712158, | |
| "learning_rate": 0.00019933174304873137, | |
| "loss": 3.6882, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 5.335952281951904, | |
| "learning_rate": 0.00019931757155716945, | |
| "loss": 3.2894, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 9.133307456970215, | |
| "learning_rate": 0.00019930325188756445, | |
| "loss": 3.7499, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 4.007411003112793, | |
| "learning_rate": 0.00019928878406128082, | |
| "loss": 3.5422, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 5.258805274963379, | |
| "learning_rate": 0.000199274168099904, | |
| "loss": 3.2147, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 7.238628387451172, | |
| "learning_rate": 0.00019925940402524045, | |
| "loss": 3.6826, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 9.149068832397461, | |
| "learning_rate": 0.0001992444918593176, | |
| "loss": 3.3555, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 4.866962432861328, | |
| "learning_rate": 0.00019922943162438387, | |
| "loss": 3.4047, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 5.280197620391846, | |
| "learning_rate": 0.00019921422334290853, | |
| "loss": 3.3403, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 7.82426643371582, | |
| "learning_rate": 0.00019919886703758172, | |
| "loss": 3.3946, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "eval_loss": 3.453319549560547, | |
| "eval_runtime": 1136.6416, | |
| "eval_samples_per_second": 5.015, | |
| "eval_steps_per_second": 5.015, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 5.7295026779174805, | |
| "learning_rate": 0.00019918336273131452, | |
| "loss": 3.5742, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 8.926092147827148, | |
| "learning_rate": 0.00019916771044723876, | |
| "loss": 3.2468, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 7.297746181488037, | |
| "learning_rate": 0.00019915191020870702, | |
| "loss": 3.3415, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 9.079599380493164, | |
| "learning_rate": 0.0001991359620392927, | |
| "loss": 3.3625, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 5.494599342346191, | |
| "learning_rate": 0.00019911986596278985, | |
| "loss": 3.6401, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 6.640133380889893, | |
| "learning_rate": 0.00019910362200321316, | |
| "loss": 3.4156, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 6.4240899085998535, | |
| "learning_rate": 0.00019908723018479803, | |
| "loss": 3.5701, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 8.585311889648438, | |
| "learning_rate": 0.00019907069053200048, | |
| "loss": 3.7639, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 5.190982341766357, | |
| "learning_rate": 0.00019905400306949696, | |
| "loss": 3.33, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 11.753495216369629, | |
| "learning_rate": 0.0001990371678221846, | |
| "loss": 3.4348, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 6.850786209106445, | |
| "learning_rate": 0.00019902018481518087, | |
| "loss": 3.3675, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 6.522672653198242, | |
| "learning_rate": 0.00019900305407382385, | |
| "loss": 3.8967, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 5.153144836425781, | |
| "learning_rate": 0.00019898577562367192, | |
| "loss": 3.5849, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 5.392364978790283, | |
| "learning_rate": 0.00019896834949050386, | |
| "loss": 3.4041, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 4.904518127441406, | |
| "learning_rate": 0.00019895077570031885, | |
| "loss": 3.1431, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 8.451141357421875, | |
| "learning_rate": 0.00019893305427933625, | |
| "loss": 3.5762, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 4.73913049697876, | |
| "learning_rate": 0.00019891518525399577, | |
| "loss": 3.385, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 7.964975357055664, | |
| "learning_rate": 0.00019889716865095737, | |
| "loss": 3.5396, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 5.87448787689209, | |
| "learning_rate": 0.00019887900449710105, | |
| "loss": 3.3033, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 7.167208671569824, | |
| "learning_rate": 0.0001988606928195271, | |
| "loss": 3.2439, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "eval_loss": 3.4154865741729736, | |
| "eval_runtime": 1136.1752, | |
| "eval_samples_per_second": 5.017, | |
| "eval_steps_per_second": 5.017, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 8.291434288024902, | |
| "learning_rate": 0.00019884223364555577, | |
| "loss": 3.5985, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 13.045690536499023, | |
| "learning_rate": 0.00019882362700272756, | |
| "loss": 3.6016, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 4.1934638023376465, | |
| "learning_rate": 0.0001988048729188028, | |
| "loss": 3.3421, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 6.0803022384643555, | |
| "learning_rate": 0.0001987859714217619, | |
| "loss": 3.3617, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 5.752238750457764, | |
| "learning_rate": 0.00019876692253980514, | |
| "loss": 3.2002, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 7.0404229164123535, | |
| "learning_rate": 0.00019874772630135276, | |
| "loss": 3.6474, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 6.9117231369018555, | |
| "learning_rate": 0.00019872838273504484, | |
| "loss": 3.4813, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 4.626667022705078, | |
| "learning_rate": 0.00019870889186974114, | |
| "loss": 3.4797, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 7.123105049133301, | |
| "learning_rate": 0.00019868925373452143, | |
| "loss": 3.3551, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 5.760848045349121, | |
| "learning_rate": 0.00019866946835868498, | |
| "loss": 3.449, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 8.604194641113281, | |
| "learning_rate": 0.00019864953577175082, | |
| "loss": 3.5442, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 6.785797595977783, | |
| "learning_rate": 0.00019862945600345765, | |
| "loss": 3.2603, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 5.647066593170166, | |
| "learning_rate": 0.00019860922908376369, | |
| "loss": 2.6124, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 7.947900295257568, | |
| "learning_rate": 0.00019858885504284678, | |
| "loss": 3.4572, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 8.052631378173828, | |
| "learning_rate": 0.00019856833391110413, | |
| "loss": 3.5738, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 8.352448463439941, | |
| "learning_rate": 0.00019854766571915256, | |
| "loss": 3.6006, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 7.586352825164795, | |
| "learning_rate": 0.0001985268504978282, | |
| "loss": 3.2241, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 7.188523292541504, | |
| "learning_rate": 0.00019850588827818657, | |
| "loss": 3.6322, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 5.39801025390625, | |
| "learning_rate": 0.0001984847790915025, | |
| "loss": 3.4845, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 7.282923221588135, | |
| "learning_rate": 0.00019846352296927014, | |
| "loss": 3.4464, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "eval_loss": 3.367934465408325, | |
| "eval_runtime": 1136.0262, | |
| "eval_samples_per_second": 5.017, | |
| "eval_steps_per_second": 5.017, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 4.772936820983887, | |
| "learning_rate": 0.00019844211994320276, | |
| "loss": 3.4074, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 4.3813557624816895, | |
| "learning_rate": 0.0001984205700452329, | |
| "loss": 3.3233, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 6.158441066741943, | |
| "learning_rate": 0.00019839887330751216, | |
| "loss": 3.3386, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 6.600301742553711, | |
| "learning_rate": 0.00019837702976241125, | |
| "loss": 3.6874, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 4.815470218658447, | |
| "learning_rate": 0.0001983550394425199, | |
| "loss": 3.3827, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 5.964359283447266, | |
| "learning_rate": 0.0001983329023806469, | |
| "loss": 3.2807, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 8.458023071289062, | |
| "learning_rate": 0.00019831061860981983, | |
| "loss": 3.632, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 5.9718451499938965, | |
| "learning_rate": 0.00019828818816328524, | |
| "loss": 3.5007, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 5.465640068054199, | |
| "learning_rate": 0.00019826561107450855, | |
| "loss": 3.4227, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 7.5957932472229, | |
| "learning_rate": 0.0001982428873771739, | |
| "loss": 3.276, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 6.594062805175781, | |
| "learning_rate": 0.00019822001710518414, | |
| "loss": 3.5748, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 7.030744552612305, | |
| "learning_rate": 0.0001981970002926609, | |
| "loss": 3.52, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 4.242162227630615, | |
| "learning_rate": 0.00019817383697394436, | |
| "loss": 3.1708, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 5.48106575012207, | |
| "learning_rate": 0.00019815052718359332, | |
| "loss": 3.3604, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 5.874629020690918, | |
| "learning_rate": 0.0001981270709563851, | |
| "loss": 3.6508, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 8.531209945678711, | |
| "learning_rate": 0.00019810346832731547, | |
| "loss": 3.6164, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 5.588098526000977, | |
| "learning_rate": 0.00019807971933159872, | |
| "loss": 3.2622, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 6.22597599029541, | |
| "learning_rate": 0.00019805582400466744, | |
| "loss": 3.4031, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 6.695744514465332, | |
| "learning_rate": 0.0001980317823821725, | |
| "loss": 3.5455, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 4.2548041343688965, | |
| "learning_rate": 0.00019800759449998309, | |
| "loss": 3.0615, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "eval_loss": 3.3597333431243896, | |
| "eval_runtime": 1134.8816, | |
| "eval_samples_per_second": 5.023, | |
| "eval_steps_per_second": 5.023, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 8.229665756225586, | |
| "learning_rate": 0.00019798326039418667, | |
| "loss": 3.3148, | |
| "step": 3010 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 5.809466361999512, | |
| "learning_rate": 0.00019795878010108874, | |
| "loss": 3.4232, | |
| "step": 3020 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 6.6790452003479, | |
| "learning_rate": 0.00019793415365721302, | |
| "loss": 3.4493, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 5.497518539428711, | |
| "learning_rate": 0.00019790938109930117, | |
| "loss": 3.5587, | |
| "step": 3040 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 6.745602607727051, | |
| "learning_rate": 0.00019788446246431294, | |
| "loss": 3.1202, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 5.6326751708984375, | |
| "learning_rate": 0.00019785939778942598, | |
| "loss": 3.3952, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 9.828627586364746, | |
| "learning_rate": 0.00019783418711203586, | |
| "loss": 3.515, | |
| "step": 3070 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 6.52869987487793, | |
| "learning_rate": 0.00019780883046975593, | |
| "loss": 3.0494, | |
| "step": 3080 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 5.64887809753418, | |
| "learning_rate": 0.0001977833279004173, | |
| "loss": 3.25, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 8.327272415161133, | |
| "learning_rate": 0.0001977576794420689, | |
| "loss": 3.0999, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 6.6515960693359375, | |
| "learning_rate": 0.0001977318851329772, | |
| "loss": 3.4192, | |
| "step": 3110 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 5.670393943786621, | |
| "learning_rate": 0.00019770594501162636, | |
| "loss": 3.5086, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 4.622827529907227, | |
| "learning_rate": 0.00019767985911671806, | |
| "loss": 3.4726, | |
| "step": 3130 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 8.66515827178955, | |
| "learning_rate": 0.00019765362748717146, | |
| "loss": 3.4205, | |
| "step": 3140 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 8.402259826660156, | |
| "learning_rate": 0.0001976272501621231, | |
| "loss": 3.4137, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 5.634212017059326, | |
| "learning_rate": 0.00019760072718092705, | |
| "loss": 3.1628, | |
| "step": 3160 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 4.353554725646973, | |
| "learning_rate": 0.00019757405858315452, | |
| "loss": 3.276, | |
| "step": 3170 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 5.939391613006592, | |
| "learning_rate": 0.00019754724440859404, | |
| "loss": 3.5853, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 8.367985725402832, | |
| "learning_rate": 0.0001975202846972514, | |
| "loss": 3.4567, | |
| "step": 3190 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 7.315502166748047, | |
| "learning_rate": 0.00019749317948934938, | |
| "loss": 3.4765, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "eval_loss": 3.343524217605591, | |
| "eval_runtime": 1140.2904, | |
| "eval_samples_per_second": 4.999, | |
| "eval_steps_per_second": 4.999, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 8.31916332244873, | |
| "learning_rate": 0.000197465928825328, | |
| "loss": 3.3034, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 8.205561637878418, | |
| "learning_rate": 0.00019743853274584413, | |
| "loss": 3.5482, | |
| "step": 3220 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 5.829329967498779, | |
| "learning_rate": 0.00019741099129177175, | |
| "loss": 2.9163, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 7.337162494659424, | |
| "learning_rate": 0.00019738330450420167, | |
| "loss": 3.8382, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 3.8535377979278564, | |
| "learning_rate": 0.00019735547242444147, | |
| "loss": 3.3907, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 8.694036483764648, | |
| "learning_rate": 0.0001973274950940156, | |
| "loss": 3.3614, | |
| "step": 3260 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 6.478395938873291, | |
| "learning_rate": 0.00019729937255466516, | |
| "loss": 3.5151, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 5.95184850692749, | |
| "learning_rate": 0.00019727110484834786, | |
| "loss": 3.6187, | |
| "step": 3280 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 7.137448787689209, | |
| "learning_rate": 0.00019724269201723812, | |
| "loss": 3.1106, | |
| "step": 3290 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 11.196949005126953, | |
| "learning_rate": 0.0001972141341037268, | |
| "loss": 3.5204, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 6.896291732788086, | |
| "learning_rate": 0.00019718543115042114, | |
| "loss": 3.0704, | |
| "step": 3310 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 6.517507076263428, | |
| "learning_rate": 0.00019715658320014495, | |
| "loss": 2.7999, | |
| "step": 3320 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 5.880134582519531, | |
| "learning_rate": 0.00019712759029593823, | |
| "loss": 3.1512, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 5.887697696685791, | |
| "learning_rate": 0.0001970984524810573, | |
| "loss": 3.2726, | |
| "step": 3340 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 7.048807144165039, | |
| "learning_rate": 0.0001970691697989747, | |
| "loss": 3.2771, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 7.299494743347168, | |
| "learning_rate": 0.000197039742293379, | |
| "loss": 3.5471, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 5.468966007232666, | |
| "learning_rate": 0.000197010170008175, | |
| "loss": 3.255, | |
| "step": 3370 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 5.875086307525635, | |
| "learning_rate": 0.0001969804529874834, | |
| "loss": 3.4126, | |
| "step": 3380 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 7.930294513702393, | |
| "learning_rate": 0.00019695059127564085, | |
| "loss": 3.075, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 7.626434803009033, | |
| "learning_rate": 0.0001969205849171999, | |
| "loss": 3.4761, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "eval_loss": 3.3232839107513428, | |
| "eval_runtime": 1137.5832, | |
| "eval_samples_per_second": 5.011, | |
| "eval_steps_per_second": 5.011, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 5.242149829864502, | |
| "learning_rate": 0.00019689043395692892, | |
| "loss": 3.0588, | |
| "step": 3410 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 7.011462688446045, | |
| "learning_rate": 0.00019686013843981198, | |
| "loss": 3.2723, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 4.377874374389648, | |
| "learning_rate": 0.00019682969841104878, | |
| "loss": 3.1512, | |
| "step": 3430 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 6.708550930023193, | |
| "learning_rate": 0.0001967991139160548, | |
| "loss": 3.1751, | |
| "step": 3440 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 4.417352199554443, | |
| "learning_rate": 0.00019676838500046087, | |
| "loss": 3.3083, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 7.341493129730225, | |
| "learning_rate": 0.00019673751171011338, | |
| "loss": 3.2975, | |
| "step": 3460 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 8.692483901977539, | |
| "learning_rate": 0.00019670649409107412, | |
| "loss": 3.8891, | |
| "step": 3470 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 6.154200077056885, | |
| "learning_rate": 0.00019667533218962018, | |
| "loss": 3.6839, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 4.297388553619385, | |
| "learning_rate": 0.00019664402605224394, | |
| "loss": 3.1778, | |
| "step": 3490 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 7.2736992835998535, | |
| "learning_rate": 0.00019661257572565295, | |
| "loss": 3.469, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 7.676090717315674, | |
| "learning_rate": 0.00019658098125676992, | |
| "loss": 3.4535, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 6.6982421875, | |
| "learning_rate": 0.00019654924269273263, | |
| "loss": 3.3746, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 6.276124954223633, | |
| "learning_rate": 0.00019651736008089373, | |
| "loss": 2.9256, | |
| "step": 3530 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 5.375932693481445, | |
| "learning_rate": 0.00019648533346882093, | |
| "loss": 3.3528, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 4.612643718719482, | |
| "learning_rate": 0.00019645316290429674, | |
| "loss": 3.5446, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 6.172947406768799, | |
| "learning_rate": 0.00019642084843531836, | |
| "loss": 3.1953, | |
| "step": 3560 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 7.488225936889648, | |
| "learning_rate": 0.00019638839011009774, | |
| "loss": 3.6664, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 7.576664924621582, | |
| "learning_rate": 0.00019635578797706153, | |
| "loss": 3.3036, | |
| "step": 3580 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 5.035768508911133, | |
| "learning_rate": 0.00019632304208485083, | |
| "loss": 3.0142, | |
| "step": 3590 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 9.324599266052246, | |
| "learning_rate": 0.0001962901524823213, | |
| "loss": 3.3434, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "eval_loss": 3.311063289642334, | |
| "eval_runtime": 1137.219, | |
| "eval_samples_per_second": 5.012, | |
| "eval_steps_per_second": 5.012, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 10.588373184204102, | |
| "learning_rate": 0.00019625711921854294, | |
| "loss": 3.2817, | |
| "step": 3610 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 6.402177333831787, | |
| "learning_rate": 0.00019622394234280015, | |
| "loss": 3.5977, | |
| "step": 3620 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 5.769714832305908, | |
| "learning_rate": 0.00019619062190459158, | |
| "loss": 3.4483, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 7.45050573348999, | |
| "learning_rate": 0.00019615715795363002, | |
| "loss": 3.1609, | |
| "step": 3640 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 7.920661926269531, | |
| "learning_rate": 0.0001961235505398424, | |
| "loss": 3.6847, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 5.056427478790283, | |
| "learning_rate": 0.00019608979971336976, | |
| "loss": 3.2006, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 4.104165554046631, | |
| "learning_rate": 0.00019605590552456702, | |
| "loss": 3.3135, | |
| "step": 3670 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 7.370213985443115, | |
| "learning_rate": 0.00019602186802400304, | |
| "loss": 3.2463, | |
| "step": 3680 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 8.189712524414062, | |
| "learning_rate": 0.00019598768726246046, | |
| "loss": 3.3439, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 7.025254249572754, | |
| "learning_rate": 0.0001959533632909357, | |
| "loss": 3.377, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 8.040080070495605, | |
| "learning_rate": 0.00019591889616063876, | |
| "loss": 2.955, | |
| "step": 3710 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 10.804893493652344, | |
| "learning_rate": 0.00019588428592299338, | |
| "loss": 3.1838, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 5.024282455444336, | |
| "learning_rate": 0.00019584953262963666, | |
| "loss": 3.6454, | |
| "step": 3730 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 8.655365943908691, | |
| "learning_rate": 0.00019581463633241918, | |
| "loss": 3.1139, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 6.94295597076416, | |
| "learning_rate": 0.00019577959708340497, | |
| "loss": 3.2513, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 7.816835880279541, | |
| "learning_rate": 0.00019574441493487113, | |
| "loss": 3.2964, | |
| "step": 3760 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 6.934699058532715, | |
| "learning_rate": 0.00019570908993930825, | |
| "loss": 3.4247, | |
| "step": 3770 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 5.775935649871826, | |
| "learning_rate": 0.0001956736221494197, | |
| "loss": 3.2132, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 10.476348876953125, | |
| "learning_rate": 0.00019563801161812222, | |
| "loss": 3.3441, | |
| "step": 3790 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 6.069675445556641, | |
| "learning_rate": 0.0001956022583985453, | |
| "loss": 3.5925, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "eval_loss": 3.297185182571411, | |
| "eval_runtime": 1137.6657, | |
| "eval_samples_per_second": 5.01, | |
| "eval_steps_per_second": 5.01, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 7.1156134605407715, | |
| "learning_rate": 0.00019556636254403143, | |
| "loss": 3.3711, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 6.738784313201904, | |
| "learning_rate": 0.0001955303241081358, | |
| "loss": 3.6561, | |
| "step": 3820 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 6.976244926452637, | |
| "learning_rate": 0.00019549414314462644, | |
| "loss": 3.3276, | |
| "step": 3830 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 6.545201301574707, | |
| "learning_rate": 0.00019545781970748395, | |
| "loss": 3.6572, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 2.9633677005767822, | |
| "learning_rate": 0.00019542135385090155, | |
| "loss": 3.0714, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 8.194368362426758, | |
| "learning_rate": 0.00019538474562928485, | |
| "loss": 3.3449, | |
| "step": 3860 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 8.38609790802002, | |
| "learning_rate": 0.00019534799509725198, | |
| "loss": 3.1067, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 7.127841472625732, | |
| "learning_rate": 0.00019531110230963327, | |
| "loss": 3.4038, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 6.696997165679932, | |
| "learning_rate": 0.00019527406732147145, | |
| "loss": 3.286, | |
| "step": 3890 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 6.132751941680908, | |
| "learning_rate": 0.00019523689018802125, | |
| "loss": 3.4134, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 4.486321449279785, | |
| "learning_rate": 0.00019519957096474956, | |
| "loss": 3.6381, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 5.290067195892334, | |
| "learning_rate": 0.00019516210970733526, | |
| "loss": 3.661, | |
| "step": 3920 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 8.747777938842773, | |
| "learning_rate": 0.0001951245064716691, | |
| "loss": 3.4642, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 7.958836555480957, | |
| "learning_rate": 0.00019508676131385367, | |
| "loss": 3.0258, | |
| "step": 3940 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 6.06564998626709, | |
| "learning_rate": 0.00019504887429020335, | |
| "loss": 3.666, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 5.823673248291016, | |
| "learning_rate": 0.0001950108454572441, | |
| "loss": 2.9987, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 9.578413009643555, | |
| "learning_rate": 0.00019497267487171352, | |
| "loss": 3.2817, | |
| "step": 3970 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 6.610091686248779, | |
| "learning_rate": 0.00019493436259056067, | |
| "loss": 3.1193, | |
| "step": 3980 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 6.841573238372803, | |
| "learning_rate": 0.000194895908670946, | |
| "loss": 3.2473, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 7.869802474975586, | |
| "learning_rate": 0.0001948573131702413, | |
| "loss": 3.2627, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "eval_loss": 3.2718520164489746, | |
| "eval_runtime": 1137.1006, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 5.743564605712891, | |
| "learning_rate": 0.0001948185761460296, | |
| "loss": 3.4821, | |
| "step": 4010 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 5.584972858428955, | |
| "learning_rate": 0.00019477969765610507, | |
| "loss": 3.0976, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 6.404329299926758, | |
| "learning_rate": 0.00019474067775847296, | |
| "loss": 3.165, | |
| "step": 4030 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 4.988752841949463, | |
| "learning_rate": 0.0001947015165113494, | |
| "loss": 3.5626, | |
| "step": 4040 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 7.516745090484619, | |
| "learning_rate": 0.00019466221397316158, | |
| "loss": 3.2796, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 5.895244121551514, | |
| "learning_rate": 0.00019462277020254734, | |
| "loss": 3.2945, | |
| "step": 4060 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 6.884443283081055, | |
| "learning_rate": 0.00019458318525835525, | |
| "loss": 3.449, | |
| "step": 4070 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 6.1220245361328125, | |
| "learning_rate": 0.00019454345919964463, | |
| "loss": 3.4166, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 6.293818950653076, | |
| "learning_rate": 0.0001945035920856852, | |
| "loss": 3.2527, | |
| "step": 4090 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 7.266450881958008, | |
| "learning_rate": 0.0001944635839759572, | |
| "loss": 2.9923, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 12.944222450256348, | |
| "learning_rate": 0.00019442343493015116, | |
| "loss": 3.5396, | |
| "step": 4110 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 6.282738208770752, | |
| "learning_rate": 0.000194383145008168, | |
| "loss": 3.4869, | |
| "step": 4120 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 5.127700328826904, | |
| "learning_rate": 0.00019434271427011868, | |
| "loss": 3.0043, | |
| "step": 4130 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 5.7289838790893555, | |
| "learning_rate": 0.00019430214277632438, | |
| "loss": 3.269, | |
| "step": 4140 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 7.922645092010498, | |
| "learning_rate": 0.00019426143058731623, | |
| "loss": 3.1655, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 6.550185680389404, | |
| "learning_rate": 0.00019422057776383525, | |
| "loss": 3.2869, | |
| "step": 4160 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 4.6260480880737305, | |
| "learning_rate": 0.00019417958436683227, | |
| "loss": 3.2263, | |
| "step": 4170 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 8.116255760192871, | |
| "learning_rate": 0.00019413845045746796, | |
| "loss": 3.2272, | |
| "step": 4180 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 9.626754760742188, | |
| "learning_rate": 0.00019409717609711246, | |
| "loss": 3.2186, | |
| "step": 4190 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 6.456797122955322, | |
| "learning_rate": 0.00019405576134734563, | |
| "loss": 3.4864, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "eval_loss": 3.2689456939697266, | |
| "eval_runtime": 1134.8632, | |
| "eval_samples_per_second": 5.023, | |
| "eval_steps_per_second": 5.023, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 7.205773830413818, | |
| "learning_rate": 0.0001940142062699566, | |
| "loss": 2.9953, | |
| "step": 4210 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 5.470200538635254, | |
| "learning_rate": 0.00019397251092694408, | |
| "loss": 3.1267, | |
| "step": 4220 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 6.280062198638916, | |
| "learning_rate": 0.00019393067538051587, | |
| "loss": 3.1818, | |
| "step": 4230 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 5.139229774475098, | |
| "learning_rate": 0.00019388869969308903, | |
| "loss": 3.214, | |
| "step": 4240 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 4.247889041900635, | |
| "learning_rate": 0.0001938465839272897, | |
| "loss": 2.9846, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 8.27074146270752, | |
| "learning_rate": 0.00019380432814595299, | |
| "loss": 3.2215, | |
| "step": 4260 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 5.101616859436035, | |
| "learning_rate": 0.00019376193241212294, | |
| "loss": 3.532, | |
| "step": 4270 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 4.839563369750977, | |
| "learning_rate": 0.00019371939678905232, | |
| "loss": 3.0666, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 5.436496257781982, | |
| "learning_rate": 0.0001936767213402027, | |
| "loss": 3.2893, | |
| "step": 4290 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 3.8287880420684814, | |
| "learning_rate": 0.00019363390612924425, | |
| "loss": 3.1401, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 6.251564025878906, | |
| "learning_rate": 0.00019359095122005563, | |
| "loss": 3.3396, | |
| "step": 4310 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 5.008293151855469, | |
| "learning_rate": 0.00019354785667672394, | |
| "loss": 3.6161, | |
| "step": 4320 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 5.853148937225342, | |
| "learning_rate": 0.00019350462256354452, | |
| "loss": 3.4238, | |
| "step": 4330 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 10.029765129089355, | |
| "learning_rate": 0.00019346124894502114, | |
| "loss": 2.9422, | |
| "step": 4340 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 8.551016807556152, | |
| "learning_rate": 0.0001934177358858655, | |
| "loss": 3.0181, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 8.455645561218262, | |
| "learning_rate": 0.00019337845496453685, | |
| "loss": 3.554, | |
| "step": 4360 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 6.219696044921875, | |
| "learning_rate": 0.00019333467714720599, | |
| "loss": 3.2154, | |
| "step": 4370 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 5.962626934051514, | |
| "learning_rate": 0.00019329076007808325, | |
| "loss": 3.2577, | |
| "step": 4380 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 4.884113311767578, | |
| "learning_rate": 0.00019324670382269115, | |
| "loss": 3.4911, | |
| "step": 4390 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 9.073639869689941, | |
| "learning_rate": 0.00019320250844676005, | |
| "loss": 3.2337, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "eval_loss": 3.2600619792938232, | |
| "eval_runtime": 1136.7951, | |
| "eval_samples_per_second": 5.014, | |
| "eval_steps_per_second": 5.014, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 6.009994983673096, | |
| "learning_rate": 0.0001931581740162277, | |
| "loss": 3.1117, | |
| "step": 4410 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 5.953939914703369, | |
| "learning_rate": 0.0001931137005972394, | |
| "loss": 3.5592, | |
| "step": 4420 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 6.099554061889648, | |
| "learning_rate": 0.0001930690882561478, | |
| "loss": 3.024, | |
| "step": 4430 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 6.600510120391846, | |
| "learning_rate": 0.00019302433705951284, | |
| "loss": 3.3492, | |
| "step": 4440 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 7.4830322265625, | |
| "learning_rate": 0.00019297944707410159, | |
| "loss": 3.1173, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 7.494085311889648, | |
| "learning_rate": 0.00019293441836688816, | |
| "loss": 3.3076, | |
| "step": 4460 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 6.360881805419922, | |
| "learning_rate": 0.00019288925100505375, | |
| "loss": 3.3496, | |
| "step": 4470 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 5.511220932006836, | |
| "learning_rate": 0.0001928439450559863, | |
| "loss": 3.321, | |
| "step": 4480 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 5.7247514724731445, | |
| "learning_rate": 0.00019279850058728058, | |
| "loss": 3.3129, | |
| "step": 4490 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 7.3512349128723145, | |
| "learning_rate": 0.000192752917666738, | |
| "loss": 3.3597, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 7.68686056137085, | |
| "learning_rate": 0.00019270719636236655, | |
| "loss": 3.1758, | |
| "step": 4510 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 6.120543956756592, | |
| "learning_rate": 0.00019266133674238067, | |
| "loss": 3.3944, | |
| "step": 4520 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 3.884521007537842, | |
| "learning_rate": 0.0001926153388752012, | |
| "loss": 3.0115, | |
| "step": 4530 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 5.13805627822876, | |
| "learning_rate": 0.00019256920282945516, | |
| "loss": 3.5171, | |
| "step": 4540 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 4.273939609527588, | |
| "learning_rate": 0.00019252292867397584, | |
| "loss": 3.2311, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 4.657829284667969, | |
| "learning_rate": 0.00019247651647780244, | |
| "loss": 2.8801, | |
| "step": 4560 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 7.604819297790527, | |
| "learning_rate": 0.0001924299663101803, | |
| "loss": 3.0956, | |
| "step": 4570 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 5.1106390953063965, | |
| "learning_rate": 0.00019238327824056038, | |
| "loss": 2.8648, | |
| "step": 4580 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 5.146661758422852, | |
| "learning_rate": 0.00019233645233859964, | |
| "loss": 3.1102, | |
| "step": 4590 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 5.23886251449585, | |
| "learning_rate": 0.0001922894886741604, | |
| "loss": 2.9659, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "eval_loss": 3.243014097213745, | |
| "eval_runtime": 1137.1324, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 7.990192890167236, | |
| "learning_rate": 0.00019224238731731079, | |
| "loss": 3.1794, | |
| "step": 4610 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 6.751334190368652, | |
| "learning_rate": 0.0001921951483383242, | |
| "loss": 3.2815, | |
| "step": 4620 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 6.687454700469971, | |
| "learning_rate": 0.00019214777180767936, | |
| "loss": 3.1559, | |
| "step": 4630 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 4.849421977996826, | |
| "learning_rate": 0.00019210025779606028, | |
| "loss": 3.0585, | |
| "step": 4640 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 7.930562496185303, | |
| "learning_rate": 0.00019205260637435604, | |
| "loss": 2.8349, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 7.275119781494141, | |
| "learning_rate": 0.00019200481761366082, | |
| "loss": 3.2115, | |
| "step": 4660 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 5.657308578491211, | |
| "learning_rate": 0.00019195689158527354, | |
| "loss": 2.9877, | |
| "step": 4670 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 7.506052017211914, | |
| "learning_rate": 0.00019190882836069806, | |
| "loss": 3.3649, | |
| "step": 4680 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.52008581161499, | |
| "learning_rate": 0.00019186062801164288, | |
| "loss": 3.308, | |
| "step": 4690 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.489314556121826, | |
| "learning_rate": 0.00019181229061002113, | |
| "loss": 3.2823, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.584408760070801, | |
| "learning_rate": 0.0001917638162279503, | |
| "loss": 3.2338, | |
| "step": 4710 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 7.005248069763184, | |
| "learning_rate": 0.00019171520493775236, | |
| "loss": 3.1882, | |
| "step": 4720 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.1764397621154785, | |
| "learning_rate": 0.00019166645681195353, | |
| "loss": 3.3283, | |
| "step": 4730 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 7.389091491699219, | |
| "learning_rate": 0.00019161757192328414, | |
| "loss": 3.1865, | |
| "step": 4740 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.51524019241333, | |
| "learning_rate": 0.0001915685503446786, | |
| "loss": 3.2328, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 9.388795852661133, | |
| "learning_rate": 0.0001915193921492752, | |
| "loss": 3.567, | |
| "step": 4760 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 8.696200370788574, | |
| "learning_rate": 0.00019147009741041617, | |
| "loss": 3.1716, | |
| "step": 4770 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.319981575012207, | |
| "learning_rate": 0.00019142066620164735, | |
| "loss": 3.367, | |
| "step": 4780 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 6.704361438751221, | |
| "learning_rate": 0.0001913710985967182, | |
| "loss": 3.1016, | |
| "step": 4790 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 7.778378486633301, | |
| "learning_rate": 0.00019132139466958173, | |
| "loss": 3.1036, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "eval_loss": 3.2003843784332275, | |
| "eval_runtime": 1138.607, | |
| "eval_samples_per_second": 5.006, | |
| "eval_steps_per_second": 5.006, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 5.96036958694458, | |
| "learning_rate": 0.00019127155449439432, | |
| "loss": 3.1986, | |
| "step": 4810 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 4.976071834564209, | |
| "learning_rate": 0.0001912215781455156, | |
| "loss": 3.1981, | |
| "step": 4820 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 3.7487850189208984, | |
| "learning_rate": 0.00019117146569750838, | |
| "loss": 3.1252, | |
| "step": 4830 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 6.183620929718018, | |
| "learning_rate": 0.00019112121722513855, | |
| "loss": 3.0109, | |
| "step": 4840 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 6.189425468444824, | |
| "learning_rate": 0.0001910708328033749, | |
| "loss": 3.2106, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 8.113247871398926, | |
| "learning_rate": 0.0001910203125073891, | |
| "loss": 3.1525, | |
| "step": 4860 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 6.9849653244018555, | |
| "learning_rate": 0.00019096965641255548, | |
| "loss": 3.5768, | |
| "step": 4870 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 6.2269978523254395, | |
| "learning_rate": 0.00019091886459445104, | |
| "loss": 3.09, | |
| "step": 4880 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 4.787795543670654, | |
| "learning_rate": 0.0001908679371288552, | |
| "loss": 3.3626, | |
| "step": 4890 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 4.196493625640869, | |
| "learning_rate": 0.00019081687409174984, | |
| "loss": 3.0434, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 6.388833999633789, | |
| "learning_rate": 0.00019076567555931906, | |
| "loss": 3.3835, | |
| "step": 4910 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 8.204059600830078, | |
| "learning_rate": 0.00019071434160794915, | |
| "loss": 3.4197, | |
| "step": 4920 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 8.208364486694336, | |
| "learning_rate": 0.00019066287231422834, | |
| "loss": 3.4219, | |
| "step": 4930 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 6.949147701263428, | |
| "learning_rate": 0.00019061126775494697, | |
| "loss": 3.1267, | |
| "step": 4940 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 8.652156829833984, | |
| "learning_rate": 0.000190559528007097, | |
| "loss": 3.4893, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 5.506767749786377, | |
| "learning_rate": 0.00019050765314787218, | |
| "loss": 3.0858, | |
| "step": 4960 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 7.854613780975342, | |
| "learning_rate": 0.00019045564325466784, | |
| "loss": 3.2453, | |
| "step": 4970 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 4.6655073165893555, | |
| "learning_rate": 0.00019040349840508076, | |
| "loss": 3.1197, | |
| "step": 4980 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 6.948372840881348, | |
| "learning_rate": 0.00019035121867690908, | |
| "loss": 3.2466, | |
| "step": 4990 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 8.339057922363281, | |
| "learning_rate": 0.0001902988041481522, | |
| "loss": 3.3991, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "eval_loss": 3.216885566711426, | |
| "eval_runtime": 1136.0117, | |
| "eval_samples_per_second": 5.018, | |
| "eval_steps_per_second": 5.018, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 6.042678356170654, | |
| "learning_rate": 0.00019024625489701054, | |
| "loss": 3.3492, | |
| "step": 5010 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 4.894794464111328, | |
| "learning_rate": 0.00019019357100188563, | |
| "loss": 3.0045, | |
| "step": 5020 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 4.939303398132324, | |
| "learning_rate": 0.0001901407525413798, | |
| "loss": 3.1535, | |
| "step": 5030 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 8.999835014343262, | |
| "learning_rate": 0.00019008779959429624, | |
| "loss": 3.3011, | |
| "step": 5040 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 5.480611801147461, | |
| "learning_rate": 0.0001900347122396387, | |
| "loss": 3.0302, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 4.675875186920166, | |
| "learning_rate": 0.0001899814905566115, | |
| "loss": 2.8846, | |
| "step": 5060 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 6.680566787719727, | |
| "learning_rate": 0.00018992813462461938, | |
| "loss": 3.672, | |
| "step": 5070 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 3.9609920978546143, | |
| "learning_rate": 0.00018987464452326736, | |
| "loss": 2.8783, | |
| "step": 5080 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 8.886730194091797, | |
| "learning_rate": 0.00018982102033236062, | |
| "loss": 3.3141, | |
| "step": 5090 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 5.5499186515808105, | |
| "learning_rate": 0.00018976726213190445, | |
| "loss": 3.4179, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 4.3828654289245605, | |
| "learning_rate": 0.000189713370002104, | |
| "loss": 3.4815, | |
| "step": 5110 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 10.297881126403809, | |
| "learning_rate": 0.00018965934402336433, | |
| "loss": 3.3344, | |
| "step": 5120 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 9.131120681762695, | |
| "learning_rate": 0.00018960518427629013, | |
| "loss": 3.0974, | |
| "step": 5130 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 8.753045082092285, | |
| "learning_rate": 0.00018955089084168566, | |
| "loss": 3.3982, | |
| "step": 5140 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 7.8969316482543945, | |
| "learning_rate": 0.00018949646380055465, | |
| "loss": 3.0704, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 9.234929084777832, | |
| "learning_rate": 0.00018944190323410024, | |
| "loss": 3.2858, | |
| "step": 5160 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 7.354836940765381, | |
| "learning_rate": 0.00018938720922372467, | |
| "loss": 3.1516, | |
| "step": 5170 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 4.409235000610352, | |
| "learning_rate": 0.00018933238185102935, | |
| "loss": 2.9736, | |
| "step": 5180 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 7.718225479125977, | |
| "learning_rate": 0.0001892774211978146, | |
| "loss": 3.3702, | |
| "step": 5190 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 7.247618198394775, | |
| "learning_rate": 0.00018922232734607967, | |
| "loss": 3.2514, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "eval_loss": 3.20190167427063, | |
| "eval_runtime": 1137.1433, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 6.2430644035339355, | |
| "learning_rate": 0.00018916710037802253, | |
| "loss": 3.244, | |
| "step": 5210 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 6.088860034942627, | |
| "learning_rate": 0.00018911174037603958, | |
| "loss": 3.309, | |
| "step": 5220 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 6.1977739334106445, | |
| "learning_rate": 0.000189056247422726, | |
| "loss": 3.1773, | |
| "step": 5230 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 7.018752574920654, | |
| "learning_rate": 0.00018900062160087503, | |
| "loss": 3.1125, | |
| "step": 5240 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 11.884779930114746, | |
| "learning_rate": 0.00018894486299347838, | |
| "loss": 3.1848, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 5.222365379333496, | |
| "learning_rate": 0.00018888897168372573, | |
| "loss": 3.2378, | |
| "step": 5260 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 7.695111274719238, | |
| "learning_rate": 0.00018883294775500482, | |
| "loss": 3.2287, | |
| "step": 5270 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 5.415168285369873, | |
| "learning_rate": 0.00018877679129090117, | |
| "loss": 3.254, | |
| "step": 5280 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 7.421213150024414, | |
| "learning_rate": 0.00018872050237519816, | |
| "loss": 3.3848, | |
| "step": 5290 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 7.068855285644531, | |
| "learning_rate": 0.00018866408109187663, | |
| "loss": 3.4544, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 5.558896541595459, | |
| "learning_rate": 0.00018860752752511507, | |
| "loss": 3.4343, | |
| "step": 5310 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 5.823142051696777, | |
| "learning_rate": 0.00018855084175928923, | |
| "loss": 3.1807, | |
| "step": 5320 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 7.187647342681885, | |
| "learning_rate": 0.00018849402387897208, | |
| "loss": 2.9435, | |
| "step": 5330 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 9.714073181152344, | |
| "learning_rate": 0.0001884370739689338, | |
| "loss": 3.4785, | |
| "step": 5340 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 5.349802017211914, | |
| "learning_rate": 0.00018837999211414146, | |
| "loss": 3.0782, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 6.526556968688965, | |
| "learning_rate": 0.00018832277839975897, | |
| "loss": 3.2347, | |
| "step": 5360 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 5.845700263977051, | |
| "learning_rate": 0.0001882654329111471, | |
| "loss": 3.0192, | |
| "step": 5370 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 5.289205074310303, | |
| "learning_rate": 0.0001882079557338631, | |
| "loss": 3.3813, | |
| "step": 5380 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 3.3808743953704834, | |
| "learning_rate": 0.00018815034695366075, | |
| "loss": 3.319, | |
| "step": 5390 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 4.758996963500977, | |
| "learning_rate": 0.00018809260665649015, | |
| "loss": 3.3189, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_loss": 3.1736836433410645, | |
| "eval_runtime": 1136.1695, | |
| "eval_samples_per_second": 5.017, | |
| "eval_steps_per_second": 5.017, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 4.7935309410095215, | |
| "learning_rate": 0.00018803473492849763, | |
| "loss": 3.1906, | |
| "step": 5410 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 6.932259559631348, | |
| "learning_rate": 0.00018797673185602562, | |
| "loss": 2.996, | |
| "step": 5420 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 6.560030937194824, | |
| "learning_rate": 0.00018791859752561248, | |
| "loss": 2.9432, | |
| "step": 5430 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 9.305426597595215, | |
| "learning_rate": 0.00018786033202399243, | |
| "loss": 3.2491, | |
| "step": 5440 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 7.172638893127441, | |
| "learning_rate": 0.0001878019354380954, | |
| "loss": 3.1311, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 7.696325778961182, | |
| "learning_rate": 0.00018774340785504684, | |
| "loss": 3.1054, | |
| "step": 5460 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 7.473097801208496, | |
| "learning_rate": 0.00018768474936216772, | |
| "loss": 3.2003, | |
| "step": 5470 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 8.726866722106934, | |
| "learning_rate": 0.00018762596004697426, | |
| "loss": 3.2119, | |
| "step": 5480 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 9.802130699157715, | |
| "learning_rate": 0.0001875670399971779, | |
| "loss": 2.9675, | |
| "step": 5490 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 7.459918975830078, | |
| "learning_rate": 0.0001875079893006851, | |
| "loss": 3.2299, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 6.798010349273682, | |
| "learning_rate": 0.00018744880804559728, | |
| "loss": 3.1507, | |
| "step": 5510 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 8.681066513061523, | |
| "learning_rate": 0.0001873894963202106, | |
| "loss": 3.1474, | |
| "step": 5520 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 7.05427885055542, | |
| "learning_rate": 0.0001873300542130159, | |
| "loss": 3.1704, | |
| "step": 5530 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 8.765000343322754, | |
| "learning_rate": 0.00018727048181269856, | |
| "loss": 3.0459, | |
| "step": 5540 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 6.171086311340332, | |
| "learning_rate": 0.00018721077920813833, | |
| "loss": 3.4174, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 11.81342887878418, | |
| "learning_rate": 0.0001871509464884092, | |
| "loss": 3.0682, | |
| "step": 5560 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 4.2086286544799805, | |
| "learning_rate": 0.00018709098374277937, | |
| "loss": 2.9207, | |
| "step": 5570 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 8.466970443725586, | |
| "learning_rate": 0.00018703089106071095, | |
| "loss": 3.4195, | |
| "step": 5580 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 3.9653847217559814, | |
| "learning_rate": 0.00018697066853185995, | |
| "loss": 3.3978, | |
| "step": 5590 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 6.923947334289551, | |
| "learning_rate": 0.00018691031624607605, | |
| "loss": 3.4599, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "eval_loss": 3.163978099822998, | |
| "eval_runtime": 1137.4991, | |
| "eval_samples_per_second": 5.011, | |
| "eval_steps_per_second": 5.011, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 4.512587547302246, | |
| "learning_rate": 0.00018684983429340265, | |
| "loss": 2.9866, | |
| "step": 5610 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.818958759307861, | |
| "learning_rate": 0.00018678922276407642, | |
| "loss": 3.2473, | |
| "step": 5620 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.915249347686768, | |
| "learning_rate": 0.00018672848174852756, | |
| "loss": 3.2113, | |
| "step": 5630 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 5.651949882507324, | |
| "learning_rate": 0.00018666761133737927, | |
| "loss": 3.0937, | |
| "step": 5640 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.507778644561768, | |
| "learning_rate": 0.00018660661162144798, | |
| "loss": 2.9943, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.6092095375061035, | |
| "learning_rate": 0.00018654548269174287, | |
| "loss": 2.9204, | |
| "step": 5660 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.253643035888672, | |
| "learning_rate": 0.00018648422463946602, | |
| "loss": 3.3986, | |
| "step": 5670 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.839259624481201, | |
| "learning_rate": 0.0001864228375560121, | |
| "loss": 3.0319, | |
| "step": 5680 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.3006181716918945, | |
| "learning_rate": 0.00018636132153296831, | |
| "loss": 2.9178, | |
| "step": 5690 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 5.2430219650268555, | |
| "learning_rate": 0.00018629967666211427, | |
| "loss": 2.833, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 8.878287315368652, | |
| "learning_rate": 0.00018623790303542168, | |
| "loss": 3.3581, | |
| "step": 5710 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 6.703078746795654, | |
| "learning_rate": 0.0001861760007450545, | |
| "loss": 3.2832, | |
| "step": 5720 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 4.616283416748047, | |
| "learning_rate": 0.00018611396988336862, | |
| "loss": 3.211, | |
| "step": 5730 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 5.617763996124268, | |
| "learning_rate": 0.0001860518105429117, | |
| "loss": 3.0924, | |
| "step": 5740 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 5.632263660430908, | |
| "learning_rate": 0.00018598952281642314, | |
| "loss": 3.1122, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 5.472113132476807, | |
| "learning_rate": 0.00018592710679683384, | |
| "loss": 3.1495, | |
| "step": 5760 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 4.280898094177246, | |
| "learning_rate": 0.0001858645625772661, | |
| "loss": 3.1842, | |
| "step": 5770 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 6.199119567871094, | |
| "learning_rate": 0.00018580189025103357, | |
| "loss": 3.0955, | |
| "step": 5780 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 5.373068809509277, | |
| "learning_rate": 0.00018573908991164096, | |
| "loss": 2.6837, | |
| "step": 5790 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 2.7935683727264404, | |
| "learning_rate": 0.00018567616165278398, | |
| "loss": 3.1536, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "eval_loss": 3.1541407108306885, | |
| "eval_runtime": 1137.3308, | |
| "eval_samples_per_second": 5.012, | |
| "eval_steps_per_second": 5.012, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 6.602904319763184, | |
| "learning_rate": 0.0001856131055683492, | |
| "loss": 3.1246, | |
| "step": 5810 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 5.87777042388916, | |
| "learning_rate": 0.00018554992175241392, | |
| "loss": 3.2625, | |
| "step": 5820 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 5.858922481536865, | |
| "learning_rate": 0.00018548661029924601, | |
| "loss": 3.3251, | |
| "step": 5830 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 6.421278476715088, | |
| "learning_rate": 0.0001854231713033037, | |
| "loss": 2.9533, | |
| "step": 5840 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 7.115844249725342, | |
| "learning_rate": 0.0001853596048592356, | |
| "loss": 3.3951, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 5.380497932434082, | |
| "learning_rate": 0.00018529591106188043, | |
| "loss": 3.1816, | |
| "step": 5860 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 5.796582221984863, | |
| "learning_rate": 0.00018523209000626686, | |
| "loss": 2.9288, | |
| "step": 5870 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 6.43263053894043, | |
| "learning_rate": 0.00018516814178761356, | |
| "loss": 3.1933, | |
| "step": 5880 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 4.534740447998047, | |
| "learning_rate": 0.00018510406650132884, | |
| "loss": 2.7832, | |
| "step": 5890 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 6.020338535308838, | |
| "learning_rate": 0.0001850398642430105, | |
| "loss": 3.2289, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 7.014430999755859, | |
| "learning_rate": 0.00018497553510844595, | |
| "loss": 3.4209, | |
| "step": 5910 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 6.1231369972229, | |
| "learning_rate": 0.0001849110791936118, | |
| "loss": 3.0681, | |
| "step": 5920 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 7.167814254760742, | |
| "learning_rate": 0.0001848464965946738, | |
| "loss": 3.1848, | |
| "step": 5930 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 5.2950005531311035, | |
| "learning_rate": 0.00018478178740798676, | |
| "loss": 3.2838, | |
| "step": 5940 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 4.44722843170166, | |
| "learning_rate": 0.0001847169517300943, | |
| "loss": 3.2951, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 5.411314964294434, | |
| "learning_rate": 0.00018465198965772887, | |
| "loss": 3.0394, | |
| "step": 5960 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 5.1140923500061035, | |
| "learning_rate": 0.0001845869012878113, | |
| "loss": 3.0466, | |
| "step": 5970 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 7.282729148864746, | |
| "learning_rate": 0.00018452168671745102, | |
| "loss": 3.2923, | |
| "step": 5980 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 6.504138946533203, | |
| "learning_rate": 0.00018445634604394572, | |
| "loss": 3.1633, | |
| "step": 5990 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 4.982309818267822, | |
| "learning_rate": 0.00018439087936478115, | |
| "loss": 3.3825, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "eval_loss": 3.144286632537842, | |
| "eval_runtime": 1137.5221, | |
| "eval_samples_per_second": 5.011, | |
| "eval_steps_per_second": 5.011, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 9.198885917663574, | |
| "learning_rate": 0.0001843252867776311, | |
| "loss": 3.178, | |
| "step": 6010 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 5.505146503448486, | |
| "learning_rate": 0.0001842595683803573, | |
| "loss": 2.9734, | |
| "step": 6020 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 9.131953239440918, | |
| "learning_rate": 0.000184193724271009, | |
| "loss": 3.4452, | |
| "step": 6030 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 3.000302314758301, | |
| "learning_rate": 0.0001841277545478232, | |
| "loss": 3.1034, | |
| "step": 6040 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 8.891810417175293, | |
| "learning_rate": 0.00018406165930922414, | |
| "loss": 3.4236, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 4.17402982711792, | |
| "learning_rate": 0.00018399543865382345, | |
| "loss": 3.001, | |
| "step": 6060 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 5.869381904602051, | |
| "learning_rate": 0.00018392909268041984, | |
| "loss": 2.9168, | |
| "step": 6070 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 6.271331787109375, | |
| "learning_rate": 0.00018386262148799895, | |
| "loss": 3.2482, | |
| "step": 6080 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 5.643693923950195, | |
| "learning_rate": 0.00018379602517573328, | |
| "loss": 2.9908, | |
| "step": 6090 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 6.856283664703369, | |
| "learning_rate": 0.000183729303842982, | |
| "loss": 3.084, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 4.403018951416016, | |
| "learning_rate": 0.00018366245758929086, | |
| "loss": 2.9356, | |
| "step": 6110 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 4.758050441741943, | |
| "learning_rate": 0.00018359548651439184, | |
| "loss": 3.3273, | |
| "step": 6120 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 8.164340019226074, | |
| "learning_rate": 0.00018352839071820326, | |
| "loss": 3.0777, | |
| "step": 6130 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 9.588719367980957, | |
| "learning_rate": 0.00018346117030082953, | |
| "loss": 3.051, | |
| "step": 6140 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 7.1701273918151855, | |
| "learning_rate": 0.00018339382536256097, | |
| "loss": 3.0665, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 6.325179576873779, | |
| "learning_rate": 0.00018332635600387364, | |
| "loss": 3.3382, | |
| "step": 6160 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 8.45527172088623, | |
| "learning_rate": 0.00018325876232542924, | |
| "loss": 3.0616, | |
| "step": 6170 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 7.3909502029418945, | |
| "learning_rate": 0.00018319104442807502, | |
| "loss": 3.122, | |
| "step": 6180 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 6.6926374435424805, | |
| "learning_rate": 0.00018312320241284347, | |
| "loss": 3.271, | |
| "step": 6190 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 6.650495529174805, | |
| "learning_rate": 0.00018305523638095233, | |
| "loss": 3.401, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "eval_loss": 3.1480228900909424, | |
| "eval_runtime": 1136.9357, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 5.135234832763672, | |
| "learning_rate": 0.0001829871464338043, | |
| "loss": 3.1063, | |
| "step": 6210 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 6.894030570983887, | |
| "learning_rate": 0.000182918932672987, | |
| "loss": 3.3267, | |
| "step": 6220 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 10.895586967468262, | |
| "learning_rate": 0.0001828505952002728, | |
| "loss": 3.2664, | |
| "step": 6230 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 7.774397373199463, | |
| "learning_rate": 0.0001827821341176186, | |
| "loss": 3.0503, | |
| "step": 6240 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 5.991896152496338, | |
| "learning_rate": 0.00018271354952716573, | |
| "loss": 2.8635, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 10.050676345825195, | |
| "learning_rate": 0.0001826448415312398, | |
| "loss": 3.0997, | |
| "step": 6260 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 4.294887542724609, | |
| "learning_rate": 0.00018257601023235052, | |
| "loss": 3.1495, | |
| "step": 6270 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 4.689005374908447, | |
| "learning_rate": 0.00018250705573319155, | |
| "loss": 2.9893, | |
| "step": 6280 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 4.834038257598877, | |
| "learning_rate": 0.00018243797813664042, | |
| "loss": 2.8042, | |
| "step": 6290 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 6.34830904006958, | |
| "learning_rate": 0.00018236877754575827, | |
| "loss": 3.1042, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 4.145033836364746, | |
| "learning_rate": 0.00018229945406378977, | |
| "loss": 3.1158, | |
| "step": 6310 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 6.606880187988281, | |
| "learning_rate": 0.00018223000779416285, | |
| "loss": 3.1161, | |
| "step": 6320 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 8.302144050598145, | |
| "learning_rate": 0.0001821604388404888, | |
| "loss": 2.8363, | |
| "step": 6330 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 5.119319915771484, | |
| "learning_rate": 0.0001820907473065618, | |
| "loss": 3.0148, | |
| "step": 6340 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 7.135417461395264, | |
| "learning_rate": 0.00018202093329635897, | |
| "loss": 3.1195, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 5.360604286193848, | |
| "learning_rate": 0.00018195099691404017, | |
| "loss": 2.9308, | |
| "step": 6360 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 11.024898529052734, | |
| "learning_rate": 0.0001818809382639479, | |
| "loss": 3.3839, | |
| "step": 6370 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 10.323607444763184, | |
| "learning_rate": 0.00018181075745060684, | |
| "loss": 3.4607, | |
| "step": 6380 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 5.803746223449707, | |
| "learning_rate": 0.00018174045457872422, | |
| "loss": 3.2707, | |
| "step": 6390 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 6.415554523468018, | |
| "learning_rate": 0.0001816700297531892, | |
| "loss": 3.2877, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "eval_loss": 3.116978406906128, | |
| "eval_runtime": 1138.0492, | |
| "eval_samples_per_second": 5.009, | |
| "eval_steps_per_second": 5.009, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 9.01855182647705, | |
| "learning_rate": 0.000181599483079073, | |
| "loss": 3.1119, | |
| "step": 6410 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 6.799642086029053, | |
| "learning_rate": 0.00018152881466162852, | |
| "loss": 3.0316, | |
| "step": 6420 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 8.301816940307617, | |
| "learning_rate": 0.00018145802460629038, | |
| "loss": 3.1189, | |
| "step": 6430 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 4.256124019622803, | |
| "learning_rate": 0.00018138711301867466, | |
| "loss": 3.0403, | |
| "step": 6440 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 5.179169654846191, | |
| "learning_rate": 0.00018131608000457872, | |
| "loss": 3.2503, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 6.934343338012695, | |
| "learning_rate": 0.00018124492566998118, | |
| "loss": 3.0684, | |
| "step": 6460 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 8.213187217712402, | |
| "learning_rate": 0.00018117365012104152, | |
| "loss": 3.1016, | |
| "step": 6470 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 9.77891731262207, | |
| "learning_rate": 0.00018110225346410026, | |
| "loss": 3.1766, | |
| "step": 6480 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 5.665271759033203, | |
| "learning_rate": 0.00018103073580567837, | |
| "loss": 2.8177, | |
| "step": 6490 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 5.387053966522217, | |
| "learning_rate": 0.0001809590972524776, | |
| "loss": 3.0647, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 6.457382678985596, | |
| "learning_rate": 0.00018088733791137983, | |
| "loss": 3.1087, | |
| "step": 6510 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 4.992802143096924, | |
| "learning_rate": 0.00018081545788944738, | |
| "loss": 3.3095, | |
| "step": 6520 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 6.124748229980469, | |
| "learning_rate": 0.00018074345729392243, | |
| "loss": 3.2727, | |
| "step": 6530 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 8.606759071350098, | |
| "learning_rate": 0.0001806713362322272, | |
| "loss": 2.7637, | |
| "step": 6540 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 4.487072944641113, | |
| "learning_rate": 0.00018059909481196352, | |
| "loss": 3.0667, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 4.0933003425598145, | |
| "learning_rate": 0.00018052673314091291, | |
| "loss": 2.9759, | |
| "step": 6560 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 7.057580947875977, | |
| "learning_rate": 0.00018045425132703615, | |
| "loss": 3.0746, | |
| "step": 6570 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 7.039517879486084, | |
| "learning_rate": 0.0001803816494784734, | |
| "loss": 3.3283, | |
| "step": 6580 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 6.682270050048828, | |
| "learning_rate": 0.00018030892770354385, | |
| "loss": 2.8775, | |
| "step": 6590 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 5.233624458312988, | |
| "learning_rate": 0.00018023608611074564, | |
| "loss": 3.2119, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "eval_loss": 3.1197338104248047, | |
| "eval_runtime": 1135.3428, | |
| "eval_samples_per_second": 5.021, | |
| "eval_steps_per_second": 5.021, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 7.95053768157959, | |
| "learning_rate": 0.00018016312480875565, | |
| "loss": 3.385, | |
| "step": 6610 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 5.972837448120117, | |
| "learning_rate": 0.00018009004390642935, | |
| "loss": 3.1906, | |
| "step": 6620 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 6.372288227081299, | |
| "learning_rate": 0.00018001684351280067, | |
| "loss": 3.2157, | |
| "step": 6630 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 6.065051555633545, | |
| "learning_rate": 0.00017994352373708184, | |
| "loss": 3.2601, | |
| "step": 6640 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 8.61384391784668, | |
| "learning_rate": 0.00017987008468866317, | |
| "loss": 3.3174, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 5.757634162902832, | |
| "learning_rate": 0.00017979652647711293, | |
| "loss": 3.2527, | |
| "step": 6660 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 6.122255802154541, | |
| "learning_rate": 0.0001797228492121772, | |
| "loss": 3.2824, | |
| "step": 6670 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 6.160879135131836, | |
| "learning_rate": 0.00017964905300377958, | |
| "loss": 3.3164, | |
| "step": 6680 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 5.023545265197754, | |
| "learning_rate": 0.00017957513796202132, | |
| "loss": 2.7596, | |
| "step": 6690 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 6.02267599105835, | |
| "learning_rate": 0.0001795011041971808, | |
| "loss": 2.9532, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 6.672699928283691, | |
| "learning_rate": 0.00017942695181971357, | |
| "loss": 2.9572, | |
| "step": 6710 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 9.895316123962402, | |
| "learning_rate": 0.00017935268094025216, | |
| "loss": 2.9637, | |
| "step": 6720 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 3.4045603275299072, | |
| "learning_rate": 0.00017927829166960592, | |
| "loss": 3.1477, | |
| "step": 6730 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 5.545341491699219, | |
| "learning_rate": 0.00017920378411876082, | |
| "loss": 2.9996, | |
| "step": 6740 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 6.233349323272705, | |
| "learning_rate": 0.00017912915839887926, | |
| "loss": 3.1531, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 5.089627265930176, | |
| "learning_rate": 0.00017905441462130002, | |
| "loss": 3.0789, | |
| "step": 6760 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 4.95676851272583, | |
| "learning_rate": 0.00017897955289753796, | |
| "loss": 3.173, | |
| "step": 6770 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 7.904139518737793, | |
| "learning_rate": 0.00017890457333928392, | |
| "loss": 3.3228, | |
| "step": 6780 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 5.2170915603637695, | |
| "learning_rate": 0.00017882947605840456, | |
| "loss": 3.0489, | |
| "step": 6790 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 7.633049011230469, | |
| "learning_rate": 0.00017875426116694215, | |
| "loss": 3.056, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_loss": 3.1002590656280518, | |
| "eval_runtime": 1137.3982, | |
| "eval_samples_per_second": 5.011, | |
| "eval_steps_per_second": 5.011, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 5.702763557434082, | |
| "learning_rate": 0.0001786789287771145, | |
| "loss": 2.8698, | |
| "step": 6810 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 8.918027877807617, | |
| "learning_rate": 0.00017860347900131463, | |
| "loss": 2.9931, | |
| "step": 6820 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 5.658896446228027, | |
| "learning_rate": 0.00017852791195211074, | |
| "loss": 2.8901, | |
| "step": 6830 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 7.5781378746032715, | |
| "learning_rate": 0.000178452227742246, | |
| "loss": 3.4028, | |
| "step": 6840 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 5.097570896148682, | |
| "learning_rate": 0.00017837642648463838, | |
| "loss": 3.1365, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 4.289078712463379, | |
| "learning_rate": 0.00017830050829238049, | |
| "loss": 3.1823, | |
| "step": 6860 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 6.053905487060547, | |
| "learning_rate": 0.00017822447327873938, | |
| "loss": 2.8224, | |
| "step": 6870 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 5.861936092376709, | |
| "learning_rate": 0.00017814832155715635, | |
| "loss": 2.7414, | |
| "step": 6880 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 10.660014152526855, | |
| "learning_rate": 0.00017807205324124698, | |
| "loss": 3.1545, | |
| "step": 6890 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 9.52756118774414, | |
| "learning_rate": 0.00017799566844480062, | |
| "loss": 3.1248, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 6.511455059051514, | |
| "learning_rate": 0.0001779191672817805, | |
| "loss": 3.1991, | |
| "step": 6910 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 6.9415669441223145, | |
| "learning_rate": 0.00017784254986632345, | |
| "loss": 2.9941, | |
| "step": 6920 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 4.175106048583984, | |
| "learning_rate": 0.00017776581631273974, | |
| "loss": 3.1579, | |
| "step": 6930 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 5.956933498382568, | |
| "learning_rate": 0.00017768896673551294, | |
| "loss": 2.8536, | |
| "step": 6940 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 6.128865718841553, | |
| "learning_rate": 0.00017761200124929966, | |
| "loss": 3.3484, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 7.494982719421387, | |
| "learning_rate": 0.0001775349199689295, | |
| "loss": 3.186, | |
| "step": 6960 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 7.484640121459961, | |
| "learning_rate": 0.00017745772300940485, | |
| "loss": 3.1214, | |
| "step": 6970 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 8.72867488861084, | |
| "learning_rate": 0.00017738041048590057, | |
| "loss": 2.9991, | |
| "step": 6980 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 5.649702072143555, | |
| "learning_rate": 0.00017730298251376404, | |
| "loss": 3.0823, | |
| "step": 6990 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 6.184506893157959, | |
| "learning_rate": 0.0001772254392085148, | |
| "loss": 3.0852, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "eval_loss": 3.0923123359680176, | |
| "eval_runtime": 1136.1904, | |
| "eval_samples_per_second": 5.017, | |
| "eval_steps_per_second": 5.017, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 6.7169880867004395, | |
| "learning_rate": 0.0001771477806858446, | |
| "loss": 3.1608, | |
| "step": 7010 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 5.178481578826904, | |
| "learning_rate": 0.00017707000706161695, | |
| "loss": 3.283, | |
| "step": 7020 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 5.29659366607666, | |
| "learning_rate": 0.00017699211845186716, | |
| "loss": 3.2108, | |
| "step": 7030 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 7.533651351928711, | |
| "learning_rate": 0.00017691411497280208, | |
| "loss": 3.2544, | |
| "step": 7040 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 4.470998764038086, | |
| "learning_rate": 0.00017683599674079992, | |
| "loss": 3.1424, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 4.548938751220703, | |
| "learning_rate": 0.0001767577638724101, | |
| "loss": 3.189, | |
| "step": 7060 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 5.8620405197143555, | |
| "learning_rate": 0.00017667941648435317, | |
| "loss": 3.0072, | |
| "step": 7070 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 9.185796737670898, | |
| "learning_rate": 0.00017660095469352035, | |
| "loss": 3.1691, | |
| "step": 7080 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 4.8303728103637695, | |
| "learning_rate": 0.0001765223786169737, | |
| "loss": 2.8953, | |
| "step": 7090 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 6.9875078201293945, | |
| "learning_rate": 0.00017644368837194577, | |
| "loss": 2.9854, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 4.392673015594482, | |
| "learning_rate": 0.00017636488407583934, | |
| "loss": 3.1433, | |
| "step": 7110 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 4.60288143157959, | |
| "learning_rate": 0.00017628596584622752, | |
| "loss": 2.9387, | |
| "step": 7120 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 8.164209365844727, | |
| "learning_rate": 0.00017620693380085322, | |
| "loss": 3.1131, | |
| "step": 7130 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 3.8639328479766846, | |
| "learning_rate": 0.00017612778805762931, | |
| "loss": 3.0315, | |
| "step": 7140 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 9.054656028747559, | |
| "learning_rate": 0.0001760485287346382, | |
| "loss": 3.3817, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 5.484858512878418, | |
| "learning_rate": 0.00017596915595013176, | |
| "loss": 3.1232, | |
| "step": 7160 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 10.846295356750488, | |
| "learning_rate": 0.00017588966982253124, | |
| "loss": 2.9237, | |
| "step": 7170 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 8.18273639678955, | |
| "learning_rate": 0.0001758100704704269, | |
| "loss": 2.7913, | |
| "step": 7180 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 6.365214824676514, | |
| "learning_rate": 0.00017573035801257794, | |
| "loss": 3.2157, | |
| "step": 7190 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 4.8987627029418945, | |
| "learning_rate": 0.0001756505325679123, | |
| "loss": 2.9277, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "eval_loss": 3.0856003761291504, | |
| "eval_runtime": 1138.1785, | |
| "eval_samples_per_second": 5.008, | |
| "eval_steps_per_second": 5.008, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 5.561722755432129, | |
| "learning_rate": 0.00017557059425552654, | |
| "loss": 2.6905, | |
| "step": 7210 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 5.034555435180664, | |
| "learning_rate": 0.00017549054319468554, | |
| "loss": 3.087, | |
| "step": 7220 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 6.637314796447754, | |
| "learning_rate": 0.00017541037950482248, | |
| "loss": 2.8424, | |
| "step": 7230 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 5.636795997619629, | |
| "learning_rate": 0.00017533010330553857, | |
| "loss": 3.2438, | |
| "step": 7240 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 7.967324256896973, | |
| "learning_rate": 0.00017524971471660276, | |
| "loss": 3.0933, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 4.078129291534424, | |
| "learning_rate": 0.00017516921385795183, | |
| "loss": 3.3142, | |
| "step": 7260 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.510000705718994, | |
| "learning_rate": 0.00017508860084969004, | |
| "loss": 3.3133, | |
| "step": 7270 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 5.694852352142334, | |
| "learning_rate": 0.00017500787581208884, | |
| "loss": 2.8118, | |
| "step": 7280 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.753634929656982, | |
| "learning_rate": 0.00017492703886558698, | |
| "loss": 3.0533, | |
| "step": 7290 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.030417442321777, | |
| "learning_rate": 0.0001748460901307901, | |
| "loss": 2.7696, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.480371475219727, | |
| "learning_rate": 0.00017476502972847065, | |
| "loss": 3.3933, | |
| "step": 7310 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.749428749084473, | |
| "learning_rate": 0.0001746838577795676, | |
| "loss": 2.9271, | |
| "step": 7320 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.193231582641602, | |
| "learning_rate": 0.00017460257440518655, | |
| "loss": 2.9716, | |
| "step": 7330 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.23006010055542, | |
| "learning_rate": 0.00017452117972659907, | |
| "loss": 2.846, | |
| "step": 7340 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 9.593443870544434, | |
| "learning_rate": 0.000174439673865243, | |
| "loss": 3.2238, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 7.841164588928223, | |
| "learning_rate": 0.00017435805694272197, | |
| "loss": 3.231, | |
| "step": 7360 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 6.105316638946533, | |
| "learning_rate": 0.00017427632908080537, | |
| "loss": 2.9946, | |
| "step": 7370 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 5.265261173248291, | |
| "learning_rate": 0.00017419449040142795, | |
| "loss": 2.8048, | |
| "step": 7380 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 5.074249267578125, | |
| "learning_rate": 0.00017411254102669003, | |
| "loss": 3.6117, | |
| "step": 7390 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 7.331019401550293, | |
| "learning_rate": 0.00017403048107885694, | |
| "loss": 3.0561, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "eval_loss": 3.077350378036499, | |
| "eval_runtime": 1138.274, | |
| "eval_samples_per_second": 5.008, | |
| "eval_steps_per_second": 5.008, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 4.099388599395752, | |
| "learning_rate": 0.00017394831068035893, | |
| "loss": 3.2471, | |
| "step": 7410 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 7.908533573150635, | |
| "learning_rate": 0.0001738660299537912, | |
| "loss": 3.4178, | |
| "step": 7420 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 5.370948791503906, | |
| "learning_rate": 0.0001737836390219134, | |
| "loss": 3.108, | |
| "step": 7430 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 12.10229206085205, | |
| "learning_rate": 0.00017370113800764972, | |
| "loss": 2.8955, | |
| "step": 7440 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 6.406788349151611, | |
| "learning_rate": 0.00017361852703408852, | |
| "loss": 2.9021, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 10.103180885314941, | |
| "learning_rate": 0.0001735358062244822, | |
| "loss": 2.9578, | |
| "step": 7460 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 7.811886787414551, | |
| "learning_rate": 0.00017345297570224712, | |
| "loss": 3.2403, | |
| "step": 7470 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 8.512283325195312, | |
| "learning_rate": 0.00017337003559096328, | |
| "loss": 3.1895, | |
| "step": 7480 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 9.635491371154785, | |
| "learning_rate": 0.0001732869860143741, | |
| "loss": 3.0036, | |
| "step": 7490 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 5.56748104095459, | |
| "learning_rate": 0.00017320382709638647, | |
| "loss": 3.1748, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 4.9890265464782715, | |
| "learning_rate": 0.00017312055896107032, | |
| "loss": 3.1185, | |
| "step": 7510 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 5.688922882080078, | |
| "learning_rate": 0.00017303718173265848, | |
| "loss": 2.9293, | |
| "step": 7520 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 7.263044834136963, | |
| "learning_rate": 0.0001729536955355467, | |
| "loss": 3.1688, | |
| "step": 7530 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 9.175032615661621, | |
| "learning_rate": 0.0001728701004942931, | |
| "loss": 3.0364, | |
| "step": 7540 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 8.44921588897705, | |
| "learning_rate": 0.00017278639673361842, | |
| "loss": 3.2652, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 7.016599178314209, | |
| "learning_rate": 0.00017270258437840545, | |
| "loss": 3.0066, | |
| "step": 7560 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 7.336106300354004, | |
| "learning_rate": 0.00017261866355369903, | |
| "loss": 2.8191, | |
| "step": 7570 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 8.093605041503906, | |
| "learning_rate": 0.0001725346343847058, | |
| "loss": 3.0282, | |
| "step": 7580 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 5.580060005187988, | |
| "learning_rate": 0.0001724504969967942, | |
| "loss": 2.8839, | |
| "step": 7590 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 5.478754997253418, | |
| "learning_rate": 0.0001723662515154939, | |
| "loss": 3.3122, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "eval_loss": 3.061328172683716, | |
| "eval_runtime": 1139.392, | |
| "eval_samples_per_second": 5.003, | |
| "eval_steps_per_second": 5.003, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 6.29701566696167, | |
| "learning_rate": 0.00017228189806649602, | |
| "loss": 3.3338, | |
| "step": 7610 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 7.164097785949707, | |
| "learning_rate": 0.0001721974367756527, | |
| "loss": 2.924, | |
| "step": 7620 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 7.159896373748779, | |
| "learning_rate": 0.00017211286776897694, | |
| "loss": 3.2111, | |
| "step": 7630 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 9.791536331176758, | |
| "learning_rate": 0.0001720281911726425, | |
| "loss": 3.201, | |
| "step": 7640 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 6.786426067352295, | |
| "learning_rate": 0.00017194340711298368, | |
| "loss": 2.8274, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 8.007925033569336, | |
| "learning_rate": 0.00017185851571649506, | |
| "loss": 3.176, | |
| "step": 7660 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 8.49763011932373, | |
| "learning_rate": 0.0001717735171098313, | |
| "loss": 3.2994, | |
| "step": 7670 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 5.434768199920654, | |
| "learning_rate": 0.0001716884114198072, | |
| "loss": 2.8618, | |
| "step": 7680 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 4.9746012687683105, | |
| "learning_rate": 0.00017160319877339717, | |
| "loss": 2.9885, | |
| "step": 7690 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 4.094747543334961, | |
| "learning_rate": 0.00017151787929773525, | |
| "loss": 2.7888, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 9.222213745117188, | |
| "learning_rate": 0.00017143245312011484, | |
| "loss": 3.0399, | |
| "step": 7710 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 8.820667266845703, | |
| "learning_rate": 0.00017134692036798854, | |
| "loss": 3.1198, | |
| "step": 7720 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 6.44861364364624, | |
| "learning_rate": 0.000171261281168968, | |
| "loss": 3.3128, | |
| "step": 7730 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 5.5747270584106445, | |
| "learning_rate": 0.00017117553565082364, | |
| "loss": 3.1565, | |
| "step": 7740 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 5.769834041595459, | |
| "learning_rate": 0.00017108968394148453, | |
| "loss": 3.1719, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 3.5767252445220947, | |
| "learning_rate": 0.00017100372616903813, | |
| "loss": 2.8726, | |
| "step": 7760 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 6.374331951141357, | |
| "learning_rate": 0.00017091766246173017, | |
| "loss": 2.8511, | |
| "step": 7770 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 10.399380683898926, | |
| "learning_rate": 0.00017083149294796446, | |
| "loss": 2.9068, | |
| "step": 7780 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 6.99971342086792, | |
| "learning_rate": 0.00017074521775630258, | |
| "loss": 2.7705, | |
| "step": 7790 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 7.660416603088379, | |
| "learning_rate": 0.0001706588370154639, | |
| "loss": 2.8446, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "eval_loss": 3.0599443912506104, | |
| "eval_runtime": 1134.9351, | |
| "eval_samples_per_second": 5.022, | |
| "eval_steps_per_second": 5.022, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 8.767396926879883, | |
| "learning_rate": 0.00017057235085432519, | |
| "loss": 3.17, | |
| "step": 7810 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 6.4136223793029785, | |
| "learning_rate": 0.00017048575940192053, | |
| "loss": 3.1791, | |
| "step": 7820 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 7.993081092834473, | |
| "learning_rate": 0.00017039906278744105, | |
| "loss": 3.0694, | |
| "step": 7830 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 4.835598945617676, | |
| "learning_rate": 0.0001703122611402348, | |
| "loss": 3.0197, | |
| "step": 7840 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 7.789417743682861, | |
| "learning_rate": 0.00017022535458980652, | |
| "loss": 3.2511, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 6.523293495178223, | |
| "learning_rate": 0.00017013834326581753, | |
| "loss": 3.2971, | |
| "step": 7860 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 4.12329626083374, | |
| "learning_rate": 0.0001700512272980854, | |
| "loss": 3.4024, | |
| "step": 7870 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 4.0998945236206055, | |
| "learning_rate": 0.00016996400681658388, | |
| "loss": 2.91, | |
| "step": 7880 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 4.825921058654785, | |
| "learning_rate": 0.00016987668195144254, | |
| "loss": 3.0696, | |
| "step": 7890 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 4.836582183837891, | |
| "learning_rate": 0.00016978925283294682, | |
| "loss": 3.1299, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 5.9830217361450195, | |
| "learning_rate": 0.0001697017195915376, | |
| "loss": 2.8505, | |
| "step": 7910 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 5.919245719909668, | |
| "learning_rate": 0.0001696140823578112, | |
| "loss": 3.129, | |
| "step": 7920 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 7.34597635269165, | |
| "learning_rate": 0.00016952634126251903, | |
| "loss": 3.0404, | |
| "step": 7930 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 6.159910678863525, | |
| "learning_rate": 0.0001694384964365674, | |
| "loss": 2.9518, | |
| "step": 7940 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 5.33622932434082, | |
| "learning_rate": 0.00016935054801101753, | |
| "loss": 3.0204, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 4.061224460601807, | |
| "learning_rate": 0.00016926249611708512, | |
| "loss": 3.1284, | |
| "step": 7960 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 4.315130233764648, | |
| "learning_rate": 0.00016917434088614024, | |
| "loss": 2.9494, | |
| "step": 7970 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 8.222806930541992, | |
| "learning_rate": 0.00016908608244970715, | |
| "loss": 3.1193, | |
| "step": 7980 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 10.138331413269043, | |
| "learning_rate": 0.00016899772093946405, | |
| "loss": 2.9443, | |
| "step": 7990 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 9.246224403381348, | |
| "learning_rate": 0.00016890925648724298, | |
| "loss": 2.8743, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "eval_loss": 3.0430643558502197, | |
| "eval_runtime": 1136.7077, | |
| "eval_samples_per_second": 5.014, | |
| "eval_steps_per_second": 5.014, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 5.0878586769104, | |
| "learning_rate": 0.00016882068922502956, | |
| "loss": 3.028, | |
| "step": 8010 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 4.8212666511535645, | |
| "learning_rate": 0.00016873201928496276, | |
| "loss": 2.8606, | |
| "step": 8020 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 4.808487415313721, | |
| "learning_rate": 0.00016864324679933477, | |
| "loss": 2.7987, | |
| "step": 8030 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 7.51768159866333, | |
| "learning_rate": 0.00016855437190059074, | |
| "loss": 3.1772, | |
| "step": 8040 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 6.17442512512207, | |
| "learning_rate": 0.00016846539472132867, | |
| "loss": 3.517, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 4.601199626922607, | |
| "learning_rate": 0.0001683763153942991, | |
| "loss": 2.8995, | |
| "step": 8060 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 8.681718826293945, | |
| "learning_rate": 0.0001682871340524051, | |
| "loss": 2.9769, | |
| "step": 8070 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 8.995853424072266, | |
| "learning_rate": 0.00016819785082870168, | |
| "loss": 3.3334, | |
| "step": 8080 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 4.729511260986328, | |
| "learning_rate": 0.00016810846585639614, | |
| "loss": 2.9659, | |
| "step": 8090 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 8.431835174560547, | |
| "learning_rate": 0.00016801897926884747, | |
| "loss": 3.1703, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 6.615757942199707, | |
| "learning_rate": 0.00016792939119956616, | |
| "loss": 3.2366, | |
| "step": 8110 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 7.626440048217773, | |
| "learning_rate": 0.0001678397017822143, | |
| "loss": 3.2195, | |
| "step": 8120 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 6.6842241287231445, | |
| "learning_rate": 0.00016774991115060502, | |
| "loss": 3.1806, | |
| "step": 8130 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 6.602607250213623, | |
| "learning_rate": 0.00016766001943870258, | |
| "loss": 2.8451, | |
| "step": 8140 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 6.661900997161865, | |
| "learning_rate": 0.000167570026780622, | |
| "loss": 2.9985, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 5.912670135498047, | |
| "learning_rate": 0.00016747993331062884, | |
| "loss": 2.9751, | |
| "step": 8160 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 9.231598854064941, | |
| "learning_rate": 0.0001673897391631392, | |
| "loss": 3.1625, | |
| "step": 8170 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 3.841637372970581, | |
| "learning_rate": 0.00016729944447271933, | |
| "loss": 3.2863, | |
| "step": 8180 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 4.234511852264404, | |
| "learning_rate": 0.00016720904937408545, | |
| "loss": 3.1483, | |
| "step": 8190 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 8.182954788208008, | |
| "learning_rate": 0.00016711855400210359, | |
| "loss": 3.176, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "eval_loss": 3.0353262424468994, | |
| "eval_runtime": 1138.7137, | |
| "eval_samples_per_second": 5.006, | |
| "eval_steps_per_second": 5.006, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 5.439648628234863, | |
| "learning_rate": 0.00016702795849178945, | |
| "loss": 2.9075, | |
| "step": 8210 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 6.0995192527771, | |
| "learning_rate": 0.00016693726297830805, | |
| "loss": 2.9992, | |
| "step": 8220 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 5.458889484405518, | |
| "learning_rate": 0.00016684646759697368, | |
| "loss": 2.9326, | |
| "step": 8230 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 4.805375576019287, | |
| "learning_rate": 0.0001667555724832496, | |
| "loss": 2.8286, | |
| "step": 8240 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 6.176124572753906, | |
| "learning_rate": 0.00016666457777274785, | |
| "loss": 2.9266, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 9.262208938598633, | |
| "learning_rate": 0.00016657348360122907, | |
| "loss": 2.8841, | |
| "step": 8260 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 5.791190147399902, | |
| "learning_rate": 0.00016648229010460234, | |
| "loss": 2.8039, | |
| "step": 8270 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 5.125844955444336, | |
| "learning_rate": 0.00016639099741892486, | |
| "loss": 3.2558, | |
| "step": 8280 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 4.081056118011475, | |
| "learning_rate": 0.00016629960568040187, | |
| "loss": 3.2467, | |
| "step": 8290 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 6.962846279144287, | |
| "learning_rate": 0.00016620811502538634, | |
| "loss": 3.1461, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 4.538918495178223, | |
| "learning_rate": 0.00016611652559037884, | |
| "loss": 3.2418, | |
| "step": 8310 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 3.3968560695648193, | |
| "learning_rate": 0.00016602483751202742, | |
| "loss": 2.8624, | |
| "step": 8320 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 7.998313903808594, | |
| "learning_rate": 0.00016593305092712712, | |
| "loss": 3.0516, | |
| "step": 8330 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 9.397892951965332, | |
| "learning_rate": 0.00016584116597262007, | |
| "loss": 3.2749, | |
| "step": 8340 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 6.359921932220459, | |
| "learning_rate": 0.00016574918278559512, | |
| "loss": 2.9715, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 12.321609497070312, | |
| "learning_rate": 0.0001656571015032877, | |
| "loss": 3.1384, | |
| "step": 8360 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001655741445912875, | |
| "loss": 3.0863, | |
| "step": 8370 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 4.111155033111572, | |
| "learning_rate": 0.00016548187730655096, | |
| "loss": 2.7541, | |
| "step": 8380 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 6.458191394805908, | |
| "learning_rate": 0.00016538951232534155, | |
| "loss": 3.1002, | |
| "step": 8390 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 6.862247943878174, | |
| "learning_rate": 0.0001652970497854643, | |
| "loss": 3.3266, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "eval_loss": 3.0325841903686523, | |
| "eval_runtime": 1139.1009, | |
| "eval_samples_per_second": 5.004, | |
| "eval_steps_per_second": 5.004, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 4.755209922790527, | |
| "learning_rate": 0.00016520448982486991, | |
| "loss": 3.6499, | |
| "step": 8410 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 6.747128963470459, | |
| "learning_rate": 0.00016511183258165419, | |
| "loss": 2.8711, | |
| "step": 8420 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 10.228262901306152, | |
| "learning_rate": 0.0001650190781940583, | |
| "loss": 2.8253, | |
| "step": 8430 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 10.171624183654785, | |
| "learning_rate": 0.00016492622680046824, | |
| "loss": 2.8922, | |
| "step": 8440 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 7.286989688873291, | |
| "learning_rate": 0.00016483327853941476, | |
| "loss": 2.8137, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 7.342117786407471, | |
| "learning_rate": 0.00016474023354957313, | |
| "loss": 2.8627, | |
| "step": 8460 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 6.907195091247559, | |
| "learning_rate": 0.00016464709196976294, | |
| "loss": 3.1057, | |
| "step": 8470 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 4.412569522857666, | |
| "learning_rate": 0.0001645538539389479, | |
| "loss": 3.1517, | |
| "step": 8480 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 9.296083450317383, | |
| "learning_rate": 0.00016446051959623562, | |
| "loss": 3.0493, | |
| "step": 8490 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 4.984066009521484, | |
| "learning_rate": 0.00016436708908087737, | |
| "loss": 3.37, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 6.971232891082764, | |
| "learning_rate": 0.00016427356253226796, | |
| "loss": 2.9304, | |
| "step": 8510 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 6.060530662536621, | |
| "learning_rate": 0.0001641799400899454, | |
| "loss": 3.1361, | |
| "step": 8520 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 7.630738735198975, | |
| "learning_rate": 0.00016408622189359085, | |
| "loss": 2.9571, | |
| "step": 8530 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 7.277754783630371, | |
| "learning_rate": 0.00016399240808302826, | |
| "loss": 3.0568, | |
| "step": 8540 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 6.79268217086792, | |
| "learning_rate": 0.00016389849879822434, | |
| "loss": 2.8103, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 6.705874919891357, | |
| "learning_rate": 0.0001638044941792881, | |
| "loss": 2.7768, | |
| "step": 8560 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 4.756038188934326, | |
| "learning_rate": 0.00016371039436647092, | |
| "loss": 3.1237, | |
| "step": 8570 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 5.9619317054748535, | |
| "learning_rate": 0.00016361619950016612, | |
| "loss": 3.0635, | |
| "step": 8580 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 7.578229904174805, | |
| "learning_rate": 0.00016352190972090884, | |
| "loss": 2.955, | |
| "step": 8590 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 9.273209571838379, | |
| "learning_rate": 0.0001634275251693759, | |
| "loss": 3.2253, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "eval_loss": 3.0166234970092773, | |
| "eval_runtime": 1138.7152, | |
| "eval_samples_per_second": 5.006, | |
| "eval_steps_per_second": 5.006, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 6.731431007385254, | |
| "learning_rate": 0.00016333304598638537, | |
| "loss": 2.8567, | |
| "step": 8610 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 7.561667442321777, | |
| "learning_rate": 0.0001632384723128967, | |
| "loss": 2.8719, | |
| "step": 8620 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 5.603372097015381, | |
| "learning_rate": 0.0001631438042900102, | |
| "loss": 2.8939, | |
| "step": 8630 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 6.9654436111450195, | |
| "learning_rate": 0.00016304904205896695, | |
| "loss": 2.9811, | |
| "step": 8640 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 5.97416877746582, | |
| "learning_rate": 0.00016295418576114855, | |
| "loss": 3.0695, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 12.01034927368164, | |
| "learning_rate": 0.00016285923553807706, | |
| "loss": 2.979, | |
| "step": 8660 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 10.122462272644043, | |
| "learning_rate": 0.0001627641915314146, | |
| "loss": 3.3434, | |
| "step": 8670 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 4.262747287750244, | |
| "learning_rate": 0.00016266905388296317, | |
| "loss": 2.8383, | |
| "step": 8680 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 7.6208953857421875, | |
| "learning_rate": 0.00016257382273466455, | |
| "loss": 3.2615, | |
| "step": 8690 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 4.870731353759766, | |
| "learning_rate": 0.0001624784982286, | |
| "loss": 3.0911, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 4.434355735778809, | |
| "learning_rate": 0.00016238308050699004, | |
| "loss": 3.0843, | |
| "step": 8710 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 5.287969589233398, | |
| "learning_rate": 0.00016228756971219433, | |
| "loss": 2.9681, | |
| "step": 8720 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 5.047779083251953, | |
| "learning_rate": 0.0001621919659867113, | |
| "loss": 3.1289, | |
| "step": 8730 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 6.657232761383057, | |
| "learning_rate": 0.00016209626947317815, | |
| "loss": 3.0631, | |
| "step": 8740 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 4.935356140136719, | |
| "learning_rate": 0.00016200048031437034, | |
| "loss": 2.8295, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 10.847895622253418, | |
| "learning_rate": 0.00016190459865320173, | |
| "loss": 3.1355, | |
| "step": 8760 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 5.847652435302734, | |
| "learning_rate": 0.00016180862463272406, | |
| "loss": 2.6263, | |
| "step": 8770 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 5.575468063354492, | |
| "learning_rate": 0.00016171255839612694, | |
| "loss": 2.9246, | |
| "step": 8780 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 11.922440528869629, | |
| "learning_rate": 0.0001616164000867376, | |
| "loss": 3.236, | |
| "step": 8790 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 6.166906356811523, | |
| "learning_rate": 0.0001615201498480205, | |
| "loss": 2.9586, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "eval_loss": 3.0125856399536133, | |
| "eval_runtime": 1137.092, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 5.383087158203125, | |
| "learning_rate": 0.00016142380782357743, | |
| "loss": 2.7651, | |
| "step": 8810 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 4.864884853363037, | |
| "learning_rate": 0.00016132737415714692, | |
| "loss": 2.8964, | |
| "step": 8820 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 13.638253211975098, | |
| "learning_rate": 0.00016123084899260444, | |
| "loss": 3.0387, | |
| "step": 8830 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 5.7503204345703125, | |
| "learning_rate": 0.0001611342324739618, | |
| "loss": 2.6854, | |
| "step": 8840 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 6.744014739990234, | |
| "learning_rate": 0.0001610375247453672, | |
| "loss": 2.961, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 9.730425834655762, | |
| "learning_rate": 0.0001609407259511049, | |
| "loss": 3.2752, | |
| "step": 8860 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 5.120224952697754, | |
| "learning_rate": 0.00016084383623559502, | |
| "loss": 2.8938, | |
| "step": 8870 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 7.75462007522583, | |
| "learning_rate": 0.00016074685574339332, | |
| "loss": 3.184, | |
| "step": 8880 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 4.399641990661621, | |
| "learning_rate": 0.000160649784619191, | |
| "loss": 2.8226, | |
| "step": 8890 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 5.9601898193359375, | |
| "learning_rate": 0.00016055262300781453, | |
| "loss": 2.8385, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 5.693487167358398, | |
| "learning_rate": 0.00016045537105422534, | |
| "loss": 3.2339, | |
| "step": 8910 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 6.121466636657715, | |
| "learning_rate": 0.00016035802890351962, | |
| "loss": 3.0847, | |
| "step": 8920 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 6.453389644622803, | |
| "learning_rate": 0.00016026059670092816, | |
| "loss": 3.3022, | |
| "step": 8930 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 4.665291786193848, | |
| "learning_rate": 0.00016016307459181613, | |
| "loss": 3.0313, | |
| "step": 8940 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 7.089426517486572, | |
| "learning_rate": 0.00016006546272168278, | |
| "loss": 3.2097, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 6.783688068389893, | |
| "learning_rate": 0.00015996776123616133, | |
| "loss": 2.842, | |
| "step": 8960 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 4.681889533996582, | |
| "learning_rate": 0.00015986997028101868, | |
| "loss": 2.7781, | |
| "step": 8970 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 10.384384155273438, | |
| "learning_rate": 0.00015977209000215525, | |
| "loss": 3.0, | |
| "step": 8980 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 10.24274730682373, | |
| "learning_rate": 0.00015967412054560464, | |
| "loss": 2.9689, | |
| "step": 8990 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 4.38585090637207, | |
| "learning_rate": 0.0001595760620575336, | |
| "loss": 2.786, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "eval_loss": 3.0171055793762207, | |
| "eval_runtime": 1137.1019, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 5.604382038116455, | |
| "learning_rate": 0.00015947791468424164, | |
| "loss": 3.2516, | |
| "step": 9010 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 5.53500509262085, | |
| "learning_rate": 0.00015937967857216094, | |
| "loss": 3.1364, | |
| "step": 9020 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 7.274658679962158, | |
| "learning_rate": 0.00015928135386785602, | |
| "loss": 3.1856, | |
| "step": 9030 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 6.1844353675842285, | |
| "learning_rate": 0.00015918294071802362, | |
| "loss": 2.8782, | |
| "step": 9040 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 5.413163185119629, | |
| "learning_rate": 0.0001590844392694924, | |
| "loss": 3.1712, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 5.227255344390869, | |
| "learning_rate": 0.00015898584966922283, | |
| "loss": 3.0771, | |
| "step": 9060 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 10.300729751586914, | |
| "learning_rate": 0.00015888717206430678, | |
| "loss": 3.0506, | |
| "step": 9070 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 5.3075456619262695, | |
| "learning_rate": 0.00015878840660196752, | |
| "loss": 2.7935, | |
| "step": 9080 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 4.687715530395508, | |
| "learning_rate": 0.00015868955342955937, | |
| "loss": 2.966, | |
| "step": 9090 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 12.141742706298828, | |
| "learning_rate": 0.0001585906126945675, | |
| "loss": 2.9231, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 9.727426528930664, | |
| "learning_rate": 0.00015849158454460773, | |
| "loss": 2.8196, | |
| "step": 9110 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 6.129993915557861, | |
| "learning_rate": 0.0001583924691274263, | |
| "loss": 2.8332, | |
| "step": 9120 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 4.653347969055176, | |
| "learning_rate": 0.00015829326659089963, | |
| "loss": 3.2322, | |
| "step": 9130 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 7.963883876800537, | |
| "learning_rate": 0.00015819397708303416, | |
| "loss": 3.0491, | |
| "step": 9140 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 4.15736722946167, | |
| "learning_rate": 0.00015809460075196606, | |
| "loss": 2.7982, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 4.2904133796691895, | |
| "learning_rate": 0.000157995137745961, | |
| "loss": 2.9823, | |
| "step": 9160 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 7.554558753967285, | |
| "learning_rate": 0.00015789558821341408, | |
| "loss": 2.9495, | |
| "step": 9170 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 8.047385215759277, | |
| "learning_rate": 0.00015779595230284933, | |
| "loss": 2.9106, | |
| "step": 9180 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 9.017010688781738, | |
| "learning_rate": 0.00015769623016291987, | |
| "loss": 2.5535, | |
| "step": 9190 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 4.758884906768799, | |
| "learning_rate": 0.00015759642194240718, | |
| "loss": 2.5587, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "eval_loss": 2.9998974800109863, | |
| "eval_runtime": 1139.1877, | |
| "eval_samples_per_second": 5.004, | |
| "eval_steps_per_second": 5.004, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 5.704859733581543, | |
| "learning_rate": 0.00015749652779022144, | |
| "loss": 2.9386, | |
| "step": 9210 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 3.6972222328186035, | |
| "learning_rate": 0.0001573965478554009, | |
| "loss": 2.9757, | |
| "step": 9220 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 4.977140426635742, | |
| "learning_rate": 0.00015729648228711182, | |
| "loss": 2.9307, | |
| "step": 9230 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 4.237871170043945, | |
| "learning_rate": 0.0001571963312346483, | |
| "loss": 2.7724, | |
| "step": 9240 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 5.418900012969971, | |
| "learning_rate": 0.00015709609484743176, | |
| "loss": 2.767, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 5.639104843139648, | |
| "learning_rate": 0.0001569957732750112, | |
| "loss": 2.9483, | |
| "step": 9260 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 8.407296180725098, | |
| "learning_rate": 0.00015689536666706254, | |
| "loss": 3.1998, | |
| "step": 9270 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 4.8399128913879395, | |
| "learning_rate": 0.00015679487517338865, | |
| "loss": 2.8589, | |
| "step": 9280 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 5.254055023193359, | |
| "learning_rate": 0.000156694298943919, | |
| "loss": 3.0868, | |
| "step": 9290 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 6.7703094482421875, | |
| "learning_rate": 0.0001565936381287095, | |
| "loss": 3.1148, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 4.5534186363220215, | |
| "learning_rate": 0.0001564928928779423, | |
| "loss": 2.8424, | |
| "step": 9310 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 5.026829242706299, | |
| "learning_rate": 0.00015639206334192544, | |
| "loss": 2.9863, | |
| "step": 9320 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 5.98419713973999, | |
| "learning_rate": 0.0001562911496710928, | |
| "loss": 3.0387, | |
| "step": 9330 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 5.446651935577393, | |
| "learning_rate": 0.00015619015201600371, | |
| "loss": 3.0489, | |
| "step": 9340 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 3.870856761932373, | |
| "learning_rate": 0.00015608907052734283, | |
| "loss": 2.6993, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 9.323542594909668, | |
| "learning_rate": 0.00015598790535591994, | |
| "loss": 3.4028, | |
| "step": 9360 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 5.4584431648254395, | |
| "learning_rate": 0.00015588665665266957, | |
| "loss": 3.2105, | |
| "step": 9370 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 4.321359634399414, | |
| "learning_rate": 0.000155785324568651, | |
| "loss": 2.7321, | |
| "step": 9380 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 6.849380970001221, | |
| "learning_rate": 0.00015568390925504782, | |
| "loss": 2.9796, | |
| "step": 9390 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 5.754255294799805, | |
| "learning_rate": 0.0001555824108631678, | |
| "loss": 2.7112, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "eval_loss": 2.999478578567505, | |
| "eval_runtime": 1136.8232, | |
| "eval_samples_per_second": 5.014, | |
| "eval_steps_per_second": 5.014, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 7.1536173820495605, | |
| "learning_rate": 0.0001554808295444427, | |
| "loss": 2.9848, | |
| "step": 9410 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 7.908527851104736, | |
| "learning_rate": 0.00015537916545042805, | |
| "loss": 2.9802, | |
| "step": 9420 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 10.420408248901367, | |
| "learning_rate": 0.00015527741873280274, | |
| "loss": 2.8162, | |
| "step": 9430 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 5.7388763427734375, | |
| "learning_rate": 0.00015517558954336903, | |
| "loss": 3.2836, | |
| "step": 9440 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 5.738020420074463, | |
| "learning_rate": 0.0001550736780340522, | |
| "loss": 2.9862, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 5.188188076019287, | |
| "learning_rate": 0.00015497168435690036, | |
| "loss": 2.913, | |
| "step": 9460 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 3.969451427459717, | |
| "learning_rate": 0.00015486960866408417, | |
| "loss": 2.9761, | |
| "step": 9470 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 6.392033100128174, | |
| "learning_rate": 0.00015476745110789674, | |
| "loss": 2.8509, | |
| "step": 9480 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 5.61599063873291, | |
| "learning_rate": 0.00015466521184075323, | |
| "loss": 3.1069, | |
| "step": 9490 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 7.307232856750488, | |
| "learning_rate": 0.0001545628910151907, | |
| "loss": 3.0924, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 6.591823101043701, | |
| "learning_rate": 0.00015446048878386802, | |
| "loss": 2.9399, | |
| "step": 9510 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 5.432168483734131, | |
| "learning_rate": 0.00015435800529956534, | |
| "loss": 3.0241, | |
| "step": 9520 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 4.527278423309326, | |
| "learning_rate": 0.00015425544071518422, | |
| "loss": 3.2915, | |
| "step": 9530 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 4.801354885101318, | |
| "learning_rate": 0.000154152795183747, | |
| "loss": 2.9509, | |
| "step": 9540 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 8.737408638000488, | |
| "learning_rate": 0.00015405006885839707, | |
| "loss": 2.9119, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 5.51857852935791, | |
| "learning_rate": 0.00015394726189239805, | |
| "loss": 3.2417, | |
| "step": 9560 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 4.063334941864014, | |
| "learning_rate": 0.00015384437443913414, | |
| "loss": 2.8913, | |
| "step": 9570 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 7.9327287673950195, | |
| "learning_rate": 0.00015374140665210946, | |
| "loss": 2.913, | |
| "step": 9580 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 6.562859058380127, | |
| "learning_rate": 0.000153638358684948, | |
| "loss": 3.0012, | |
| "step": 9590 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 9.443960189819336, | |
| "learning_rate": 0.00015353523069139348, | |
| "loss": 2.9245, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "eval_loss": 2.9986822605133057, | |
| "eval_runtime": 1138.3167, | |
| "eval_samples_per_second": 5.007, | |
| "eval_steps_per_second": 5.007, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 5.080326080322266, | |
| "learning_rate": 0.00015343202282530892, | |
| "loss": 2.5978, | |
| "step": 9610 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 4.626572608947754, | |
| "learning_rate": 0.00015332873524067658, | |
| "loss": 2.8308, | |
| "step": 9620 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 14.406761169433594, | |
| "learning_rate": 0.0001532253680915975, | |
| "loss": 3.2131, | |
| "step": 9630 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 8.314620971679688, | |
| "learning_rate": 0.00015312192153229162, | |
| "loss": 2.8485, | |
| "step": 9640 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 9.021672248840332, | |
| "learning_rate": 0.0001530183957170973, | |
| "loss": 3.1707, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 6.305810451507568, | |
| "learning_rate": 0.00015291479080047104, | |
| "loss": 2.8943, | |
| "step": 9660 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 4.459597587585449, | |
| "learning_rate": 0.00015281110693698752, | |
| "loss": 2.8154, | |
| "step": 9670 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 6.650838375091553, | |
| "learning_rate": 0.00015270734428133906, | |
| "loss": 2.9857, | |
| "step": 9680 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 7.86285924911499, | |
| "learning_rate": 0.00015260350298833565, | |
| "loss": 2.8424, | |
| "step": 9690 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 8.555646896362305, | |
| "learning_rate": 0.0001524995832129045, | |
| "loss": 3.1926, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 7.865792751312256, | |
| "learning_rate": 0.00015239558511009004, | |
| "loss": 3.1938, | |
| "step": 9710 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 8.588205337524414, | |
| "learning_rate": 0.00015229150883505342, | |
| "loss": 2.9822, | |
| "step": 9720 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 7.853447437286377, | |
| "learning_rate": 0.0001521873545430725, | |
| "loss": 2.9926, | |
| "step": 9730 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 6.028032302856445, | |
| "learning_rate": 0.00015208312238954158, | |
| "loss": 3.1323, | |
| "step": 9740 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 4.851654529571533, | |
| "learning_rate": 0.000151978812529971, | |
| "loss": 2.892, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 4.319963455200195, | |
| "learning_rate": 0.00015187442511998715, | |
| "loss": 2.5974, | |
| "step": 9760 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 6.1562628746032715, | |
| "learning_rate": 0.0001517699603153321, | |
| "loss": 2.9623, | |
| "step": 9770 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 5.6080193519592285, | |
| "learning_rate": 0.00015166541827186326, | |
| "loss": 2.8689, | |
| "step": 9780 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 9.012639045715332, | |
| "learning_rate": 0.00015156079914555354, | |
| "loss": 3.1591, | |
| "step": 9790 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 4.5083746910095215, | |
| "learning_rate": 0.00015145610309249058, | |
| "loss": 2.8816, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "eval_loss": 2.9825246334075928, | |
| "eval_runtime": 1137.641, | |
| "eval_samples_per_second": 5.01, | |
| "eval_steps_per_second": 5.01, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 8.24355697631836, | |
| "learning_rate": 0.00015135133026887698, | |
| "loss": 2.7468, | |
| "step": 9810 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 6.146825790405273, | |
| "learning_rate": 0.00015124648083102979, | |
| "loss": 3.1624, | |
| "step": 9820 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 5.946303844451904, | |
| "learning_rate": 0.00015114155493538037, | |
| "loss": 2.9932, | |
| "step": 9830 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 7.62037992477417, | |
| "learning_rate": 0.00015103655273847422, | |
| "loss": 2.8597, | |
| "step": 9840 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 8.6740083694458, | |
| "learning_rate": 0.00015093147439697058, | |
| "loss": 3.2558, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 4.523014545440674, | |
| "learning_rate": 0.00015082632006764238, | |
| "loss": 2.9356, | |
| "step": 9860 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 6.251735210418701, | |
| "learning_rate": 0.00015072108990737582, | |
| "loss": 2.7333, | |
| "step": 9870 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 6.199810028076172, | |
| "learning_rate": 0.0001506157840731704, | |
| "loss": 2.8651, | |
| "step": 9880 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 5.6429972648620605, | |
| "learning_rate": 0.0001505104027221383, | |
| "loss": 3.0208, | |
| "step": 9890 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 6.78240966796875, | |
| "learning_rate": 0.0001504049460115046, | |
| "loss": 3.4201, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 5.331435203552246, | |
| "learning_rate": 0.00015029941409860667, | |
| "loss": 3.0285, | |
| "step": 9910 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 7.6099324226379395, | |
| "learning_rate": 0.0001501938071408941, | |
| "loss": 2.9424, | |
| "step": 9920 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 5.696933269500732, | |
| "learning_rate": 0.00015008812529592843, | |
| "loss": 2.9491, | |
| "step": 9930 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 4.624625205993652, | |
| "learning_rate": 0.00014998236872138302, | |
| "loss": 2.9854, | |
| "step": 9940 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 7.571484088897705, | |
| "learning_rate": 0.00014987653757504263, | |
| "loss": 3.0587, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 4.712878227233887, | |
| "learning_rate": 0.00014977063201480334, | |
| "loss": 3.0112, | |
| "step": 9960 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 4.909578323364258, | |
| "learning_rate": 0.00014966465219867217, | |
| "loss": 2.9227, | |
| "step": 9970 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 4.633456707000732, | |
| "learning_rate": 0.00014955859828476702, | |
| "loss": 3.1489, | |
| "step": 9980 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 4.861935615539551, | |
| "learning_rate": 0.00014945247043131622, | |
| "loss": 2.984, | |
| "step": 9990 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 10.554461479187012, | |
| "learning_rate": 0.00014934626879665864, | |
| "loss": 3.0501, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "eval_loss": 2.9680299758911133, | |
| "eval_runtime": 1137.4461, | |
| "eval_samples_per_second": 5.011, | |
| "eval_steps_per_second": 5.011, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 4.56096887588501, | |
| "learning_rate": 0.00014923999353924297, | |
| "loss": 2.7057, | |
| "step": 10010 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 7.319655418395996, | |
| "learning_rate": 0.0001491336448176279, | |
| "loss": 3.1668, | |
| "step": 10020 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 6.589526653289795, | |
| "learning_rate": 0.00014902722279048166, | |
| "loss": 3.1742, | |
| "step": 10030 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 7.270175457000732, | |
| "learning_rate": 0.00014892072761658187, | |
| "loss": 3.0247, | |
| "step": 10040 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 6.527873992919922, | |
| "learning_rate": 0.0001488141594548153, | |
| "loss": 2.9606, | |
| "step": 10050 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 5.78521728515625, | |
| "learning_rate": 0.00014870751846417758, | |
| "loss": 3.3098, | |
| "step": 10060 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 7.620880126953125, | |
| "learning_rate": 0.00014860080480377306, | |
| "loss": 2.9146, | |
| "step": 10070 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 5.929685115814209, | |
| "learning_rate": 0.0001484940186328144, | |
| "loss": 3.0891, | |
| "step": 10080 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 10.600454330444336, | |
| "learning_rate": 0.00014838716011062258, | |
| "loss": 2.7763, | |
| "step": 10090 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 5.074846267700195, | |
| "learning_rate": 0.00014828022939662638, | |
| "loss": 2.9147, | |
| "step": 10100 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 6.829638957977295, | |
| "learning_rate": 0.00014817322665036244, | |
| "loss": 3.0132, | |
| "step": 10110 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 5.505454063415527, | |
| "learning_rate": 0.00014806615203147473, | |
| "loss": 3.0183, | |
| "step": 10120 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 5.461676597595215, | |
| "learning_rate": 0.00014795900569971454, | |
| "loss": 3.1014, | |
| "step": 10130 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 4.047961711883545, | |
| "learning_rate": 0.0001478517878149401, | |
| "loss": 3.1134, | |
| "step": 10140 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 4.537815570831299, | |
| "learning_rate": 0.00014774449853711648, | |
| "loss": 2.9786, | |
| "step": 10150 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 8.680290222167969, | |
| "learning_rate": 0.00014763713802631515, | |
| "loss": 2.8598, | |
| "step": 10160 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 5.524952411651611, | |
| "learning_rate": 0.00014752970644271393, | |
| "loss": 2.8898, | |
| "step": 10170 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 4.378311634063721, | |
| "learning_rate": 0.00014742220394659667, | |
| "loss": 3.1406, | |
| "step": 10180 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 4.671150207519531, | |
| "learning_rate": 0.000147314630698353, | |
| "loss": 2.9889, | |
| "step": 10190 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 6.330467700958252, | |
| "learning_rate": 0.0001472069868584781, | |
| "loss": 3.1183, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "eval_loss": 2.969615936279297, | |
| "eval_runtime": 1135.1327, | |
| "eval_samples_per_second": 5.021, | |
| "eval_steps_per_second": 5.021, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 7.620838642120361, | |
| "learning_rate": 0.00014709927258757253, | |
| "loss": 2.9721, | |
| "step": 10210 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 6.69796895980835, | |
| "learning_rate": 0.00014699148804634185, | |
| "loss": 2.9581, | |
| "step": 10220 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 6.295568943023682, | |
| "learning_rate": 0.00014688363339559652, | |
| "loss": 3.0132, | |
| "step": 10230 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 5.181854248046875, | |
| "learning_rate": 0.0001467757087962516, | |
| "loss": 2.9179, | |
| "step": 10240 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 4.249350547790527, | |
| "learning_rate": 0.00014666771440932644, | |
| "loss": 2.8028, | |
| "step": 10250 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 7.280447959899902, | |
| "learning_rate": 0.0001465596503959446, | |
| "loss": 2.9399, | |
| "step": 10260 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 5.414987087249756, | |
| "learning_rate": 0.0001464515169173335, | |
| "loss": 2.8953, | |
| "step": 10270 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 7.337689399719238, | |
| "learning_rate": 0.00014634331413482414, | |
| "loss": 2.8618, | |
| "step": 10280 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 9.888291358947754, | |
| "learning_rate": 0.00014623504220985097, | |
| "loss": 3.2855, | |
| "step": 10290 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 4.2359299659729, | |
| "learning_rate": 0.0001461267013039516, | |
| "loss": 3.011, | |
| "step": 10300 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 5.158446788787842, | |
| "learning_rate": 0.00014601829157876654, | |
| "loss": 2.7949, | |
| "step": 10310 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 4.1677680015563965, | |
| "learning_rate": 0.000145909813196039, | |
| "loss": 3.2265, | |
| "step": 10320 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 6.444026470184326, | |
| "learning_rate": 0.00014580126631761454, | |
| "loss": 3.0472, | |
| "step": 10330 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 5.472976207733154, | |
| "learning_rate": 0.00014569265110544105, | |
| "loss": 2.8335, | |
| "step": 10340 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 4.650349140167236, | |
| "learning_rate": 0.00014558396772156826, | |
| "loss": 2.9379, | |
| "step": 10350 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 4.644428253173828, | |
| "learning_rate": 0.00014547521632814767, | |
| "loss": 2.8781, | |
| "step": 10360 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 4.317287921905518, | |
| "learning_rate": 0.0001453663970874322, | |
| "loss": 2.867, | |
| "step": 10370 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 6.050807952880859, | |
| "learning_rate": 0.0001452575101617761, | |
| "loss": 3.0715, | |
| "step": 10380 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 4.716285705566406, | |
| "learning_rate": 0.0001451485557136344, | |
| "loss": 2.6545, | |
| "step": 10390 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 5.954706192016602, | |
| "learning_rate": 0.0001450395339055631, | |
| "loss": 3.1563, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "eval_loss": 2.9598331451416016, | |
| "eval_runtime": 1137.1539, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 5.110961437225342, | |
| "learning_rate": 0.0001449304449002185, | |
| "loss": 3.0793, | |
| "step": 10410 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 4.516371250152588, | |
| "learning_rate": 0.0001448212888603574, | |
| "loss": 3.0189, | |
| "step": 10420 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 7.248453617095947, | |
| "learning_rate": 0.00014471206594883634, | |
| "loss": 3.0615, | |
| "step": 10430 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 4.003082752227783, | |
| "learning_rate": 0.00014460277632861174, | |
| "loss": 3.2798, | |
| "step": 10440 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 6.659687519073486, | |
| "learning_rate": 0.00014449342016273966, | |
| "loss": 2.9107, | |
| "step": 10450 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 7.421617031097412, | |
| "learning_rate": 0.00014438399761437527, | |
| "loss": 3.1504, | |
| "step": 10460 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 4.268542289733887, | |
| "learning_rate": 0.00014427450884677289, | |
| "loss": 2.9658, | |
| "step": 10470 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 5.025989532470703, | |
| "learning_rate": 0.0001441649540232856, | |
| "loss": 3.2243, | |
| "step": 10480 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 5.317170143127441, | |
| "learning_rate": 0.00014405533330736497, | |
| "loss": 2.8027, | |
| "step": 10490 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 8.103606224060059, | |
| "learning_rate": 0.00014394564686256108, | |
| "loss": 2.8796, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 6.020264148712158, | |
| "learning_rate": 0.0001438358948525218, | |
| "loss": 2.6636, | |
| "step": 10510 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 5.222537517547607, | |
| "learning_rate": 0.000143726077440993, | |
| "loss": 3.1448, | |
| "step": 10520 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 5.023114204406738, | |
| "learning_rate": 0.00014361619479181812, | |
| "loss": 2.9364, | |
| "step": 10530 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 5.129509925842285, | |
| "learning_rate": 0.00014350624706893785, | |
| "loss": 2.8327, | |
| "step": 10540 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 3.634791135787964, | |
| "learning_rate": 0.00014339623443639004, | |
| "loss": 2.8565, | |
| "step": 10550 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 5.827573299407959, | |
| "learning_rate": 0.0001432861570583094, | |
| "loss": 2.8492, | |
| "step": 10560 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 4.608321189880371, | |
| "learning_rate": 0.0001431760150989271, | |
| "loss": 2.7838, | |
| "step": 10570 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 5.711697578430176, | |
| "learning_rate": 0.00014306580872257084, | |
| "loss": 2.7076, | |
| "step": 10580 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 4.423154830932617, | |
| "learning_rate": 0.0001429555380936643, | |
| "loss": 2.8312, | |
| "step": 10590 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 6.354341983795166, | |
| "learning_rate": 0.0001428452033767271, | |
| "loss": 2.8778, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "eval_loss": 2.959249973297119, | |
| "eval_runtime": 1138.9728, | |
| "eval_samples_per_second": 5.005, | |
| "eval_steps_per_second": 5.005, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 7.5264763832092285, | |
| "learning_rate": 0.00014273480473637443, | |
| "loss": 3.1428, | |
| "step": 10610 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 6.143415451049805, | |
| "learning_rate": 0.0001426243423373169, | |
| "loss": 3.0073, | |
| "step": 10620 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 4.933542251586914, | |
| "learning_rate": 0.00014251381634436015, | |
| "loss": 2.7708, | |
| "step": 10630 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 5.974007606506348, | |
| "learning_rate": 0.00014240322692240476, | |
| "loss": 2.5688, | |
| "step": 10640 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 4.774169445037842, | |
| "learning_rate": 0.000142292574236446, | |
| "loss": 3.0229, | |
| "step": 10650 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 7.627336502075195, | |
| "learning_rate": 0.00014218185845157346, | |
| "loss": 2.779, | |
| "step": 10660 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 4.425614833831787, | |
| "learning_rate": 0.00014207107973297087, | |
| "loss": 2.8371, | |
| "step": 10670 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 5.521327495574951, | |
| "learning_rate": 0.0001419602382459159, | |
| "loss": 2.9034, | |
| "step": 10680 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 6.049530982971191, | |
| "learning_rate": 0.00014184933415577978, | |
| "loss": 2.8192, | |
| "step": 10690 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 4.450803756713867, | |
| "learning_rate": 0.0001417383676280272, | |
| "loss": 3.0164, | |
| "step": 10700 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 6.391834735870361, | |
| "learning_rate": 0.00014162733882821607, | |
| "loss": 2.7078, | |
| "step": 10710 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014152735980268438, | |
| "loss": 3.3182, | |
| "step": 10720 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 5.099579811096191, | |
| "learning_rate": 0.00014141621314240634, | |
| "loss": 2.8339, | |
| "step": 10730 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 4.9488067626953125, | |
| "learning_rate": 0.00014130500469071195, | |
| "loss": 2.9437, | |
| "step": 10740 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 6.22238302230835, | |
| "learning_rate": 0.00014119373461352001, | |
| "loss": 2.9827, | |
| "step": 10750 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 5.493013858795166, | |
| "learning_rate": 0.00014108240307684127, | |
| "loss": 3.0163, | |
| "step": 10760 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 5.54683780670166, | |
| "learning_rate": 0.00014097101024677808, | |
| "loss": 3.0077, | |
| "step": 10770 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 6.295912742614746, | |
| "learning_rate": 0.00014085955628952441, | |
| "loss": 2.8018, | |
| "step": 10780 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 3.9085795879364014, | |
| "learning_rate": 0.00014074804137136524, | |
| "loss": 2.9818, | |
| "step": 10790 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 5.808225631713867, | |
| "learning_rate": 0.00014063646565867663, | |
| "loss": 3.159, | |
| "step": 10800 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_loss": 2.9464659690856934, | |
| "eval_runtime": 1139.1096, | |
| "eval_samples_per_second": 5.004, | |
| "eval_steps_per_second": 5.004, | |
| "step": 10800 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 6.944069862365723, | |
| "learning_rate": 0.0001405248293179253, | |
| "loss": 3.1757, | |
| "step": 10810 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 7.533534526824951, | |
| "learning_rate": 0.00014041313251566845, | |
| "loss": 2.9995, | |
| "step": 10820 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 6.755417346954346, | |
| "learning_rate": 0.00014030137541855346, | |
| "loss": 3.1326, | |
| "step": 10830 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 8.288308143615723, | |
| "learning_rate": 0.00014018955819331764, | |
| "loss": 2.7772, | |
| "step": 10840 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 3.5482583045959473, | |
| "learning_rate": 0.00014007768100678805, | |
| "loss": 2.8674, | |
| "step": 10850 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 4.020620346069336, | |
| "learning_rate": 0.0001399657440258812, | |
| "loss": 3.028, | |
| "step": 10860 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 7.0991315841674805, | |
| "learning_rate": 0.00013985374741760283, | |
| "loss": 3.1083, | |
| "step": 10870 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 7.445100784301758, | |
| "learning_rate": 0.00013974169134904765, | |
| "loss": 2.6173, | |
| "step": 10880 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 4.649611949920654, | |
| "learning_rate": 0.000139629575987399, | |
| "loss": 2.9081, | |
| "step": 10890 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 6.424789905548096, | |
| "learning_rate": 0.00013951740149992876, | |
| "loss": 3.134, | |
| "step": 10900 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 7.624310493469238, | |
| "learning_rate": 0.00013940516805399699, | |
| "loss": 3.1254, | |
| "step": 10910 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 8.405814170837402, | |
| "learning_rate": 0.00013929287581705176, | |
| "loss": 3.1216, | |
| "step": 10920 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 5.037896156311035, | |
| "learning_rate": 0.00013918052495662882, | |
| "loss": 2.7543, | |
| "step": 10930 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 5.659261703491211, | |
| "learning_rate": 0.00013906811564035133, | |
| "loss": 3.0607, | |
| "step": 10940 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 7.80034065246582, | |
| "learning_rate": 0.0001389556480359298, | |
| "loss": 2.9075, | |
| "step": 10950 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 4.6370038986206055, | |
| "learning_rate": 0.00013884312231116156, | |
| "loss": 2.6178, | |
| "step": 10960 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 5.196686744689941, | |
| "learning_rate": 0.00013873053863393072, | |
| "loss": 2.7758, | |
| "step": 10970 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 6.2154083251953125, | |
| "learning_rate": 0.00013861789717220787, | |
| "loss": 3.1309, | |
| "step": 10980 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 6.0769124031066895, | |
| "learning_rate": 0.0001385051980940498, | |
| "loss": 2.9105, | |
| "step": 10990 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 16.503326416015625, | |
| "learning_rate": 0.00013839244156759923, | |
| "loss": 2.8583, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "eval_loss": 2.930485963821411, | |
| "eval_runtime": 1135.5048, | |
| "eval_samples_per_second": 5.02, | |
| "eval_steps_per_second": 5.02, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 6.584379196166992, | |
| "learning_rate": 0.00013827962776108462, | |
| "loss": 2.7119, | |
| "step": 11010 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 6.973694324493408, | |
| "learning_rate": 0.0001381667568428199, | |
| "loss": 2.7612, | |
| "step": 11020 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 6.25327205657959, | |
| "learning_rate": 0.00013805382898120414, | |
| "loss": 3.2764, | |
| "step": 11030 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 6.84330415725708, | |
| "learning_rate": 0.00013794084434472147, | |
| "loss": 2.8709, | |
| "step": 11040 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 6.320117950439453, | |
| "learning_rate": 0.00013782780310194067, | |
| "loss": 3.0335, | |
| "step": 11050 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 4.778736114501953, | |
| "learning_rate": 0.00013771470542151497, | |
| "loss": 2.9884, | |
| "step": 11060 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 6.087406635284424, | |
| "learning_rate": 0.00013760155147218178, | |
| "loss": 2.9923, | |
| "step": 11070 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 4.868623733520508, | |
| "learning_rate": 0.00013748834142276252, | |
| "loss": 2.829, | |
| "step": 11080 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 5.565182209014893, | |
| "learning_rate": 0.00013737507544216233, | |
| "loss": 2.728, | |
| "step": 11090 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 5.934764862060547, | |
| "learning_rate": 0.00013726175369936967, | |
| "loss": 2.8737, | |
| "step": 11100 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 6.818757057189941, | |
| "learning_rate": 0.0001371483763634563, | |
| "loss": 2.6239, | |
| "step": 11110 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 4.30825662612915, | |
| "learning_rate": 0.00013703494360357694, | |
| "loss": 2.8212, | |
| "step": 11120 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 6.317237377166748, | |
| "learning_rate": 0.00013692145558896887, | |
| "loss": 2.7839, | |
| "step": 11130 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 5.52744197845459, | |
| "learning_rate": 0.00013680791248895199, | |
| "loss": 3.1383, | |
| "step": 11140 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 6.30517053604126, | |
| "learning_rate": 0.00013669431447292825, | |
| "loss": 2.7455, | |
| "step": 11150 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 7.219874858856201, | |
| "learning_rate": 0.00013658066171038153, | |
| "loss": 2.8031, | |
| "step": 11160 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 3.8619625568389893, | |
| "learning_rate": 0.00013646695437087754, | |
| "loss": 3.0624, | |
| "step": 11170 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 9.413076400756836, | |
| "learning_rate": 0.00013635319262406318, | |
| "loss": 2.9665, | |
| "step": 11180 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 9.219383239746094, | |
| "learning_rate": 0.00013623937663966677, | |
| "loss": 2.7616, | |
| "step": 11190 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 5.262277126312256, | |
| "learning_rate": 0.00013612550658749736, | |
| "loss": 2.9674, | |
| "step": 11200 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "eval_loss": 2.9270477294921875, | |
| "eval_runtime": 1134.3819, | |
| "eval_samples_per_second": 5.025, | |
| "eval_steps_per_second": 5.025, | |
| "step": 11200 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 4.998508453369141, | |
| "learning_rate": 0.00013601158263744478, | |
| "loss": 2.9739, | |
| "step": 11210 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 6.7563300132751465, | |
| "learning_rate": 0.00013589760495947922, | |
| "loss": 3.0721, | |
| "step": 11220 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 7.818253040313721, | |
| "learning_rate": 0.00013578357372365102, | |
| "loss": 2.9322, | |
| "step": 11230 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 3.3956222534179688, | |
| "learning_rate": 0.0001356694891000905, | |
| "loss": 3.0327, | |
| "step": 11240 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 3.3983898162841797, | |
| "learning_rate": 0.00013555535125900757, | |
| "loss": 2.5789, | |
| "step": 11250 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 6.465611457824707, | |
| "learning_rate": 0.0001354411603706915, | |
| "loss": 3.0299, | |
| "step": 11260 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 5.23297119140625, | |
| "learning_rate": 0.0001353269166055108, | |
| "loss": 2.8151, | |
| "step": 11270 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 4.9944586753845215, | |
| "learning_rate": 0.00013521262013391287, | |
| "loss": 2.9416, | |
| "step": 11280 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 3.9770894050598145, | |
| "learning_rate": 0.0001350982711264236, | |
| "loss": 2.7994, | |
| "step": 11290 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 9.537381172180176, | |
| "learning_rate": 0.0001349838697536475, | |
| "loss": 2.87, | |
| "step": 11300 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 5.436434745788574, | |
| "learning_rate": 0.00013486941618626693, | |
| "loss": 3.2234, | |
| "step": 11310 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 6.111148834228516, | |
| "learning_rate": 0.00013475491059504233, | |
| "loss": 2.8924, | |
| "step": 11320 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 12.326899528503418, | |
| "learning_rate": 0.0001346403531508117, | |
| "loss": 2.9485, | |
| "step": 11330 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 9.468557357788086, | |
| "learning_rate": 0.00013452574402449038, | |
| "loss": 3.0239, | |
| "step": 11340 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 8.779520988464355, | |
| "learning_rate": 0.00013441108338707087, | |
| "loss": 2.8417, | |
| "step": 11350 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 5.909932613372803, | |
| "learning_rate": 0.0001342963714096224, | |
| "loss": 2.7175, | |
| "step": 11360 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 5.584993362426758, | |
| "learning_rate": 0.00013418160826329093, | |
| "loss": 3.0146, | |
| "step": 11370 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 6.520732402801514, | |
| "learning_rate": 0.00013406679411929873, | |
| "loss": 3.1017, | |
| "step": 11380 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 4.61958122253418, | |
| "learning_rate": 0.0001339519291489441, | |
| "loss": 3.0017, | |
| "step": 11390 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 4.826852321624756, | |
| "learning_rate": 0.0001338370135236013, | |
| "loss": 2.827, | |
| "step": 11400 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "eval_loss": 2.912285566329956, | |
| "eval_runtime": 1137.7963, | |
| "eval_samples_per_second": 5.01, | |
| "eval_steps_per_second": 5.01, | |
| "step": 11400 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 7.968265533447266, | |
| "learning_rate": 0.00013372204741471996, | |
| "loss": 2.993, | |
| "step": 11410 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 4.151234149932861, | |
| "learning_rate": 0.00013360703099382518, | |
| "loss": 3.0601, | |
| "step": 11420 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 4.17539119720459, | |
| "learning_rate": 0.00013349196443251718, | |
| "loss": 2.9077, | |
| "step": 11430 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 6.504483222961426, | |
| "learning_rate": 0.00013337684790247075, | |
| "loss": 2.9594, | |
| "step": 11440 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 5.325105667114258, | |
| "learning_rate": 0.0001332616815754355, | |
| "loss": 2.8264, | |
| "step": 11450 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 7.66379976272583, | |
| "learning_rate": 0.00013314646562323517, | |
| "loss": 2.8312, | |
| "step": 11460 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 6.964573383331299, | |
| "learning_rate": 0.0001330312002177675, | |
| "loss": 2.6644, | |
| "step": 11470 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 7.418605327606201, | |
| "learning_rate": 0.00013291588553100426, | |
| "loss": 2.848, | |
| "step": 11480 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 12.711461067199707, | |
| "learning_rate": 0.0001328005217349905, | |
| "loss": 3.0142, | |
| "step": 11490 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 4.92010498046875, | |
| "learning_rate": 0.00013268510900184459, | |
| "loss": 2.8017, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 5.789633274078369, | |
| "learning_rate": 0.00013256964750375797, | |
| "loss": 3.1904, | |
| "step": 11510 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 11.26569652557373, | |
| "learning_rate": 0.0001324541374129948, | |
| "loss": 2.9227, | |
| "step": 11520 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 4.300714492797852, | |
| "learning_rate": 0.00013233857890189177, | |
| "loss": 2.738, | |
| "step": 11530 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 8.24052619934082, | |
| "learning_rate": 0.00013222297214285776, | |
| "loss": 3.1162, | |
| "step": 11540 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 6.717054843902588, | |
| "learning_rate": 0.00013210731730837368, | |
| "loss": 3.1639, | |
| "step": 11550 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 9.139569282531738, | |
| "learning_rate": 0.0001319916145709921, | |
| "loss": 2.9694, | |
| "step": 11560 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 4.700305461883545, | |
| "learning_rate": 0.00013187586410333724, | |
| "loss": 2.674, | |
| "step": 11570 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 6.384634971618652, | |
| "learning_rate": 0.00013176006607810425, | |
| "loss": 3.0417, | |
| "step": 11580 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 7.221315860748291, | |
| "learning_rate": 0.00013164422066805947, | |
| "loss": 3.3196, | |
| "step": 11590 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 6.894277095794678, | |
| "learning_rate": 0.0001315283280460398, | |
| "loss": 2.7332, | |
| "step": 11600 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "eval_loss": 2.915705919265747, | |
| "eval_runtime": 1137.3676, | |
| "eval_samples_per_second": 5.012, | |
| "eval_steps_per_second": 5.012, | |
| "step": 11600 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 6.271778583526611, | |
| "learning_rate": 0.00013141238838495264, | |
| "loss": 3.0482, | |
| "step": 11610 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 7.282876014709473, | |
| "learning_rate": 0.00013129640185777564, | |
| "loss": 2.7195, | |
| "step": 11620 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 8.754749298095703, | |
| "learning_rate": 0.00013118036863755614, | |
| "loss": 3.1873, | |
| "step": 11630 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 6.130650520324707, | |
| "learning_rate": 0.00013106428889741144, | |
| "loss": 3.0263, | |
| "step": 11640 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 7.188558101654053, | |
| "learning_rate": 0.000130948162810528, | |
| "loss": 2.8634, | |
| "step": 11650 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 9.350152969360352, | |
| "learning_rate": 0.00013083199055016154, | |
| "loss": 3.2323, | |
| "step": 11660 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 7.754179954528809, | |
| "learning_rate": 0.00013071577228963678, | |
| "loss": 3.0035, | |
| "step": 11670 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 8.125720024108887, | |
| "learning_rate": 0.00013059950820234678, | |
| "loss": 3.264, | |
| "step": 11680 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 4.942266941070557, | |
| "learning_rate": 0.00013048319846175325, | |
| "loss": 2.7955, | |
| "step": 11690 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 6.1011505126953125, | |
| "learning_rate": 0.00013036684324138587, | |
| "loss": 2.6444, | |
| "step": 11700 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.939935207366943, | |
| "learning_rate": 0.0001302504427148422, | |
| "loss": 2.8813, | |
| "step": 11710 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 8.676549911499023, | |
| "learning_rate": 0.0001301339970557874, | |
| "loss": 2.7569, | |
| "step": 11720 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 8.003786087036133, | |
| "learning_rate": 0.000130017506437954, | |
| "loss": 2.7625, | |
| "step": 11730 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 4.292322635650635, | |
| "learning_rate": 0.00012990097103514155, | |
| "loss": 2.9883, | |
| "step": 11740 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.578572750091553, | |
| "learning_rate": 0.00012978439102121647, | |
| "loss": 3.4115, | |
| "step": 11750 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.9065093994140625, | |
| "learning_rate": 0.00012966776657011167, | |
| "loss": 3.057, | |
| "step": 11760 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 4.266748428344727, | |
| "learning_rate": 0.0001295510978558264, | |
| "loss": 2.9653, | |
| "step": 11770 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.894644737243652, | |
| "learning_rate": 0.000129434385052426, | |
| "loss": 2.9065, | |
| "step": 11780 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.477922439575195, | |
| "learning_rate": 0.00012931762833404148, | |
| "loss": 2.9249, | |
| "step": 11790 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 4.732699871063232, | |
| "learning_rate": 0.00012920082787486948, | |
| "loss": 2.8734, | |
| "step": 11800 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "eval_loss": 2.905906915664673, | |
| "eval_runtime": 1138.8177, | |
| "eval_samples_per_second": 5.005, | |
| "eval_steps_per_second": 5.005, | |
| "step": 11800 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.697981834411621, | |
| "learning_rate": 0.0001290839838491718, | |
| "loss": 2.843, | |
| "step": 11810 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.219038009643555, | |
| "learning_rate": 0.00012896709643127528, | |
| "loss": 3.123, | |
| "step": 11820 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 5.130221843719482, | |
| "learning_rate": 0.00012885016579557162, | |
| "loss": 2.8452, | |
| "step": 11830 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 10.45068645477295, | |
| "learning_rate": 0.00012873319211651672, | |
| "loss": 3.0178, | |
| "step": 11840 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 6.096733570098877, | |
| "learning_rate": 0.000128616175568631, | |
| "loss": 2.8138, | |
| "step": 11850 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 5.896446228027344, | |
| "learning_rate": 0.0001284991163264986, | |
| "loss": 3.3727, | |
| "step": 11860 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 10.954285621643066, | |
| "learning_rate": 0.00012838201456476752, | |
| "loss": 2.6517, | |
| "step": 11870 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 8.56272029876709, | |
| "learning_rate": 0.00012826487045814914, | |
| "loss": 3.3007, | |
| "step": 11880 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 4.866158485412598, | |
| "learning_rate": 0.000128147684181418, | |
| "loss": 2.8063, | |
| "step": 11890 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 4.69535493850708, | |
| "learning_rate": 0.00012803045590941157, | |
| "loss": 2.5951, | |
| "step": 11900 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 5.791335582733154, | |
| "learning_rate": 0.00012791318581702998, | |
| "loss": 2.9769, | |
| "step": 11910 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 10.670564651489258, | |
| "learning_rate": 0.0001277958740792357, | |
| "loss": 2.9634, | |
| "step": 11920 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 9.301645278930664, | |
| "learning_rate": 0.00012767852087105353, | |
| "loss": 2.6926, | |
| "step": 11930 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 5.858110427856445, | |
| "learning_rate": 0.00012756112636756989, | |
| "loss": 2.7778, | |
| "step": 11940 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 5.246842384338379, | |
| "learning_rate": 0.00012744369074393292, | |
| "loss": 2.693, | |
| "step": 11950 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 7.218985557556152, | |
| "learning_rate": 0.00012732621417535213, | |
| "loss": 2.9016, | |
| "step": 11960 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 5.314725399017334, | |
| "learning_rate": 0.00012720869683709808, | |
| "loss": 2.3808, | |
| "step": 11970 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 10.086341857910156, | |
| "learning_rate": 0.0001270911389045022, | |
| "loss": 2.9053, | |
| "step": 11980 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 4.592552661895752, | |
| "learning_rate": 0.00012697354055295646, | |
| "loss": 2.8766, | |
| "step": 11990 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 5.684471130371094, | |
| "learning_rate": 0.00012685590195791308, | |
| "loss": 3.0623, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "eval_loss": 2.904792308807373, | |
| "eval_runtime": 1137.2933, | |
| "eval_samples_per_second": 5.012, | |
| "eval_steps_per_second": 5.012, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 8.804437637329102, | |
| "learning_rate": 0.00012673822329488442, | |
| "loss": 3.2498, | |
| "step": 12010 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 8.336959838867188, | |
| "learning_rate": 0.00012662050473944257, | |
| "loss": 3.0255, | |
| "step": 12020 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 6.271881103515625, | |
| "learning_rate": 0.00012650274646721914, | |
| "loss": 2.5491, | |
| "step": 12030 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 5.716142654418945, | |
| "learning_rate": 0.00012638494865390497, | |
| "loss": 2.6117, | |
| "step": 12040 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 4.2103800773620605, | |
| "learning_rate": 0.00012626711147524996, | |
| "loss": 2.7738, | |
| "step": 12050 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 5.132654666900635, | |
| "learning_rate": 0.00012614923510706269, | |
| "loss": 2.7955, | |
| "step": 12060 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 6.06005859375, | |
| "learning_rate": 0.00012603131972521023, | |
| "loss": 3.0637, | |
| "step": 12070 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 5.199472427368164, | |
| "learning_rate": 0.00012591336550561784, | |
| "loss": 2.6771, | |
| "step": 12080 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 9.783750534057617, | |
| "learning_rate": 0.0001257953726242687, | |
| "loss": 3.0937, | |
| "step": 12090 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 7.431953430175781, | |
| "learning_rate": 0.0001256773412572038, | |
| "loss": 3.0264, | |
| "step": 12100 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 4.1111979484558105, | |
| "learning_rate": 0.00012555927158052133, | |
| "loss": 2.7148, | |
| "step": 12110 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 8.789063453674316, | |
| "learning_rate": 0.00012544116377037688, | |
| "loss": 3.0186, | |
| "step": 12120 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 6.812503337860107, | |
| "learning_rate": 0.0001253230180029827, | |
| "loss": 3.1154, | |
| "step": 12130 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 5.980816841125488, | |
| "learning_rate": 0.00012520483445460786, | |
| "loss": 2.864, | |
| "step": 12140 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 4.336915493011475, | |
| "learning_rate": 0.00012508661330157774, | |
| "loss": 2.7639, | |
| "step": 12150 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 4.914273738861084, | |
| "learning_rate": 0.00012496835472027376, | |
| "loss": 3.1715, | |
| "step": 12160 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 6.842685699462891, | |
| "learning_rate": 0.0001248500588871333, | |
| "loss": 3.0072, | |
| "step": 12170 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 9.586161613464355, | |
| "learning_rate": 0.0001247317259786491, | |
| "loss": 2.7299, | |
| "step": 12180 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 4.659690856933594, | |
| "learning_rate": 0.0001246133561713695, | |
| "loss": 2.7587, | |
| "step": 12190 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 5.354196548461914, | |
| "learning_rate": 0.00012449494964189773, | |
| "loss": 2.8163, | |
| "step": 12200 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "eval_loss": 2.8869693279266357, | |
| "eval_runtime": 1135.7184, | |
| "eval_samples_per_second": 5.019, | |
| "eval_steps_per_second": 5.019, | |
| "step": 12200 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 5.862390041351318, | |
| "learning_rate": 0.00012437650656689183, | |
| "loss": 3.0432, | |
| "step": 12210 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 6.009708404541016, | |
| "learning_rate": 0.00012425802712306432, | |
| "loss": 2.726, | |
| "step": 12220 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 7.788062572479248, | |
| "learning_rate": 0.0001241395114871821, | |
| "loss": 2.4635, | |
| "step": 12230 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 7.147851467132568, | |
| "learning_rate": 0.00012402095983606593, | |
| "loss": 2.8183, | |
| "step": 12240 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 4.320078372955322, | |
| "learning_rate": 0.00012390237234659042, | |
| "loss": 2.8154, | |
| "step": 12250 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.1208062171936035, | |
| "learning_rate": 0.00012378374919568355, | |
| "loss": 2.8344, | |
| "step": 12260 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 7.409857273101807, | |
| "learning_rate": 0.0001236650905603266, | |
| "loss": 2.8191, | |
| "step": 12270 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 4.807343006134033, | |
| "learning_rate": 0.0001235463966175537, | |
| "loss": 3.158, | |
| "step": 12280 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 7.55764627456665, | |
| "learning_rate": 0.00012342766754445175, | |
| "loss": 2.8936, | |
| "step": 12290 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 4.045491695404053, | |
| "learning_rate": 0.00012330890351815998, | |
| "loss": 2.925, | |
| "step": 12300 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.34037446975708, | |
| "learning_rate": 0.00012319010471586984, | |
| "loss": 3.0233, | |
| "step": 12310 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.470011234283447, | |
| "learning_rate": 0.00012307127131482457, | |
| "loss": 3.0561, | |
| "step": 12320 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 3.815101146697998, | |
| "learning_rate": 0.00012295240349231918, | |
| "loss": 2.4855, | |
| "step": 12330 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.214379787445068, | |
| "learning_rate": 0.00012283350142569982, | |
| "loss": 2.8585, | |
| "step": 12340 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.9461541175842285, | |
| "learning_rate": 0.00012271456529236398, | |
| "loss": 2.9515, | |
| "step": 12350 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 7.110766410827637, | |
| "learning_rate": 0.00012259559526975978, | |
| "loss": 3.0395, | |
| "step": 12360 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.845677375793457, | |
| "learning_rate": 0.000122476591535386, | |
| "loss": 2.7167, | |
| "step": 12370 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 5.942660808563232, | |
| "learning_rate": 0.00012235755426679166, | |
| "loss": 2.7902, | |
| "step": 12380 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 8.613824844360352, | |
| "learning_rate": 0.00012223848364157592, | |
| "loss": 2.8209, | |
| "step": 12390 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 9.6761474609375, | |
| "learning_rate": 0.00012211937983738752, | |
| "loss": 2.9448, | |
| "step": 12400 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "eval_loss": 2.8819024562835693, | |
| "eval_runtime": 1137.1197, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 12400 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 6.138139247894287, | |
| "learning_rate": 0.00012200024303192488, | |
| "loss": 2.7694, | |
| "step": 12410 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 5.604335308074951, | |
| "learning_rate": 0.00012188107340293555, | |
| "loss": 2.7826, | |
| "step": 12420 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 6.146926403045654, | |
| "learning_rate": 0.00012176187112821611, | |
| "loss": 2.725, | |
| "step": 12430 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 6.235223770141602, | |
| "learning_rate": 0.00012164263638561184, | |
| "loss": 3.0731, | |
| "step": 12440 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 8.349669456481934, | |
| "learning_rate": 0.00012152336935301644, | |
| "loss": 2.9744, | |
| "step": 12450 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 4.022830486297607, | |
| "learning_rate": 0.00012140407020837177, | |
| "loss": 2.8294, | |
| "step": 12460 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 4.709907054901123, | |
| "learning_rate": 0.0001212847391296676, | |
| "loss": 3.1276, | |
| "step": 12470 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 5.7833404541015625, | |
| "learning_rate": 0.0001211653762949414, | |
| "loss": 2.728, | |
| "step": 12480 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 5.090959072113037, | |
| "learning_rate": 0.000121045981882278, | |
| "loss": 2.7932, | |
| "step": 12490 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 6.4102654457092285, | |
| "learning_rate": 0.00012092655606980931, | |
| "loss": 3.067, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 3.2918288707733154, | |
| "learning_rate": 0.0001208070990357141, | |
| "loss": 2.7084, | |
| "step": 12510 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 4.93757963180542, | |
| "learning_rate": 0.00012068761095821772, | |
| "loss": 2.7426, | |
| "step": 12520 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 4.599313259124756, | |
| "learning_rate": 0.00012056809201559183, | |
| "loss": 2.8432, | |
| "step": 12530 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 5.336906433105469, | |
| "learning_rate": 0.00012044854238615417, | |
| "loss": 2.6692, | |
| "step": 12540 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 6.711155891418457, | |
| "learning_rate": 0.00012032896224826827, | |
| "loss": 2.888, | |
| "step": 12550 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 4.558686256408691, | |
| "learning_rate": 0.0001202093517803431, | |
| "loss": 2.5864, | |
| "step": 12560 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 11.784100532531738, | |
| "learning_rate": 0.00012008971116083299, | |
| "loss": 2.9601, | |
| "step": 12570 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 6.828344345092773, | |
| "learning_rate": 0.00011997004056823713, | |
| "loss": 2.7396, | |
| "step": 12580 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 7.140361309051514, | |
| "learning_rate": 0.00011985034018109956, | |
| "loss": 2.654, | |
| "step": 12590 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 4.436099529266357, | |
| "learning_rate": 0.00011973061017800866, | |
| "loss": 2.6084, | |
| "step": 12600 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "eval_loss": 2.8805291652679443, | |
| "eval_runtime": 1136.5894, | |
| "eval_samples_per_second": 5.015, | |
| "eval_steps_per_second": 5.015, | |
| "step": 12600 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 7.968447208404541, | |
| "learning_rate": 0.00011961085073759708, | |
| "loss": 2.8732, | |
| "step": 12610 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 7.53559684753418, | |
| "learning_rate": 0.00011949106203854136, | |
| "loss": 2.8639, | |
| "step": 12620 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 5.95030403137207, | |
| "learning_rate": 0.00011937124425956165, | |
| "loss": 2.6471, | |
| "step": 12630 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 8.227439880371094, | |
| "learning_rate": 0.00011925139757942156, | |
| "loss": 3.1835, | |
| "step": 12640 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 3.934840679168701, | |
| "learning_rate": 0.00011913152217692775, | |
| "loss": 2.8887, | |
| "step": 12650 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 6.063136100769043, | |
| "learning_rate": 0.00011901161823092979, | |
| "loss": 3.0296, | |
| "step": 12660 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 9.32559871673584, | |
| "learning_rate": 0.00011889168592031983, | |
| "loss": 2.9871, | |
| "step": 12670 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 8.128053665161133, | |
| "learning_rate": 0.00011877172542403228, | |
| "loss": 2.8351, | |
| "step": 12680 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 9.050593376159668, | |
| "learning_rate": 0.00011865173692104364, | |
| "loss": 3.134, | |
| "step": 12690 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 4.40614128112793, | |
| "learning_rate": 0.00011853172059037224, | |
| "loss": 2.743, | |
| "step": 12700 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 4.777544975280762, | |
| "learning_rate": 0.00011841167661107784, | |
| "loss": 2.7829, | |
| "step": 12710 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 5.10864782333374, | |
| "learning_rate": 0.00011829160516226153, | |
| "loss": 2.8182, | |
| "step": 12720 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 3.8802578449249268, | |
| "learning_rate": 0.00011817150642306531, | |
| "loss": 2.7498, | |
| "step": 12730 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 9.293874740600586, | |
| "learning_rate": 0.000118051380572672, | |
| "loss": 3.1483, | |
| "step": 12740 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 6.355398654937744, | |
| "learning_rate": 0.00011793122779030475, | |
| "loss": 2.9183, | |
| "step": 12750 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 5.404056549072266, | |
| "learning_rate": 0.00011781104825522695, | |
| "loss": 2.761, | |
| "step": 12760 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 5.423532009124756, | |
| "learning_rate": 0.00011769084214674189, | |
| "loss": 3.0413, | |
| "step": 12770 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 5.6372199058532715, | |
| "learning_rate": 0.00011757060964419258, | |
| "loss": 2.9426, | |
| "step": 12780 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 8.241491317749023, | |
| "learning_rate": 0.00011745035092696129, | |
| "loss": 2.6652, | |
| "step": 12790 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 4.501625061035156, | |
| "learning_rate": 0.00011733006617446947, | |
| "loss": 2.7831, | |
| "step": 12800 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "eval_loss": 2.8682727813720703, | |
| "eval_runtime": 1135.344, | |
| "eval_samples_per_second": 5.021, | |
| "eval_steps_per_second": 5.021, | |
| "step": 12800 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 4.504491329193115, | |
| "learning_rate": 0.0001172097555661774, | |
| "loss": 2.839, | |
| "step": 12810 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 6.712375640869141, | |
| "learning_rate": 0.00011708941928158393, | |
| "loss": 2.8777, | |
| "step": 12820 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 5.017134189605713, | |
| "learning_rate": 0.00011696905750022624, | |
| "loss": 2.9566, | |
| "step": 12830 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 5.9697747230529785, | |
| "learning_rate": 0.0001168486704016795, | |
| "loss": 2.7984, | |
| "step": 12840 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 6.94989013671875, | |
| "learning_rate": 0.00011672825816555672, | |
| "loss": 2.8068, | |
| "step": 12850 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 4.509193420410156, | |
| "learning_rate": 0.00011660782097150842, | |
| "loss": 2.7397, | |
| "step": 12860 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 4.793773651123047, | |
| "learning_rate": 0.00011648735899922221, | |
| "loss": 3.0144, | |
| "step": 12870 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 5.6054792404174805, | |
| "learning_rate": 0.00011636687242842286, | |
| "loss": 2.7915, | |
| "step": 12880 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 3.980593204498291, | |
| "learning_rate": 0.00011624636143887174, | |
| "loss": 2.6483, | |
| "step": 12890 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 3.5728085041046143, | |
| "learning_rate": 0.00011612582621036665, | |
| "loss": 2.685, | |
| "step": 12900 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 10.15241527557373, | |
| "learning_rate": 0.00011600526692274158, | |
| "loss": 3.0063, | |
| "step": 12910 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 8.541998863220215, | |
| "learning_rate": 0.00011588468375586638, | |
| "loss": 3.0572, | |
| "step": 12920 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 7.413809299468994, | |
| "learning_rate": 0.00011576407688964661, | |
| "loss": 2.5417, | |
| "step": 12930 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 4.749917984008789, | |
| "learning_rate": 0.0001156434465040231, | |
| "loss": 2.694, | |
| "step": 12940 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 7.283080101013184, | |
| "learning_rate": 0.0001155227927789718, | |
| "loss": 2.8336, | |
| "step": 12950 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 4.781662464141846, | |
| "learning_rate": 0.0001154021158945035, | |
| "loss": 2.6173, | |
| "step": 12960 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 6.650935173034668, | |
| "learning_rate": 0.00011528141603066347, | |
| "loss": 2.8605, | |
| "step": 12970 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 6.372498035430908, | |
| "learning_rate": 0.00011516069336753137, | |
| "loss": 2.9947, | |
| "step": 12980 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 4.832932949066162, | |
| "learning_rate": 0.00011505202362618099, | |
| "loss": 2.7986, | |
| "step": 12990 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 6.009823799133301, | |
| "learning_rate": 0.00011493125814063493, | |
| "loss": 2.9087, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "eval_loss": 2.854703664779663, | |
| "eval_runtime": 1138.6761, | |
| "eval_samples_per_second": 5.006, | |
| "eval_steps_per_second": 5.006, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 7.64834451675415, | |
| "learning_rate": 0.000114810470378219, | |
| "loss": 2.7787, | |
| "step": 13010 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 6.409843921661377, | |
| "learning_rate": 0.00011468966051914405, | |
| "loss": 3.1866, | |
| "step": 13020 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 10.589412689208984, | |
| "learning_rate": 0.00011456882874365376, | |
| "loss": 2.9176, | |
| "step": 13030 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 5.453351974487305, | |
| "learning_rate": 0.00011444797523202453, | |
| "loss": 2.7734, | |
| "step": 13040 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 7.665455341339111, | |
| "learning_rate": 0.00011432710016456525, | |
| "loss": 3.082, | |
| "step": 13050 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 6.119209289550781, | |
| "learning_rate": 0.00011420620372161688, | |
| "loss": 2.931, | |
| "step": 13060 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 3.2885162830352783, | |
| "learning_rate": 0.00011408528608355236, | |
| "loss": 2.4232, | |
| "step": 13070 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 6.569406986236572, | |
| "learning_rate": 0.0001139643474307762, | |
| "loss": 2.7764, | |
| "step": 13080 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 6.823148727416992, | |
| "learning_rate": 0.00011384338794372426, | |
| "loss": 2.9104, | |
| "step": 13090 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 13.69426155090332, | |
| "learning_rate": 0.00011372240780286349, | |
| "loss": 2.8509, | |
| "step": 13100 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 5.851162433624268, | |
| "learning_rate": 0.0001136014071886917, | |
| "loss": 3.2161, | |
| "step": 13110 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 10.145004272460938, | |
| "learning_rate": 0.0001134803862817372, | |
| "loss": 2.968, | |
| "step": 13120 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 6.563608646392822, | |
| "learning_rate": 0.00011335934526255858, | |
| "loss": 2.7827, | |
| "step": 13130 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 4.670830726623535, | |
| "learning_rate": 0.00011323828431174441, | |
| "loss": 2.9768, | |
| "step": 13140 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 9.791251182556152, | |
| "learning_rate": 0.00011311720360991306, | |
| "loss": 3.0329, | |
| "step": 13150 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 4.974820137023926, | |
| "learning_rate": 0.00011299610333771238, | |
| "loss": 3.0875, | |
| "step": 13160 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 6.610928058624268, | |
| "learning_rate": 0.00011287498367581928, | |
| "loss": 2.8692, | |
| "step": 13170 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 6.3965911865234375, | |
| "learning_rate": 0.00011275384480493976, | |
| "loss": 3.0095, | |
| "step": 13180 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 7.755321979522705, | |
| "learning_rate": 0.00011263268690580837, | |
| "loss": 2.8522, | |
| "step": 13190 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 6.5569539070129395, | |
| "learning_rate": 0.00011251151015918811, | |
| "loss": 3.2111, | |
| "step": 13200 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "eval_loss": 2.845184087753296, | |
| "eval_runtime": 1136.0132, | |
| "eval_samples_per_second": 5.018, | |
| "eval_steps_per_second": 5.018, | |
| "step": 13200 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 5.710137367248535, | |
| "learning_rate": 0.00011239031474587014, | |
| "loss": 3.0802, | |
| "step": 13210 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 8.29128646850586, | |
| "learning_rate": 0.0001122691008466733, | |
| "loss": 3.2867, | |
| "step": 13220 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 5.905947208404541, | |
| "learning_rate": 0.0001121478686424442, | |
| "loss": 2.9385, | |
| "step": 13230 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 5.681633472442627, | |
| "learning_rate": 0.00011202661831405668, | |
| "loss": 2.8288, | |
| "step": 13240 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 6.492409706115723, | |
| "learning_rate": 0.00011190535004241157, | |
| "loss": 3.067, | |
| "step": 13250 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 9.93946647644043, | |
| "learning_rate": 0.00011178406400843657, | |
| "loss": 3.045, | |
| "step": 13260 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 8.157313346862793, | |
| "learning_rate": 0.00011166276039308585, | |
| "loss": 2.7287, | |
| "step": 13270 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 7.452297687530518, | |
| "learning_rate": 0.00011154143937733974, | |
| "loss": 2.6611, | |
| "step": 13280 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 4.351617336273193, | |
| "learning_rate": 0.00011142010114220462, | |
| "loss": 2.6843, | |
| "step": 13290 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 6.279202938079834, | |
| "learning_rate": 0.00011129874586871251, | |
| "loss": 2.8017, | |
| "step": 13300 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 6.140538215637207, | |
| "learning_rate": 0.0001111773737379209, | |
| "loss": 3.0927, | |
| "step": 13310 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 6.171574115753174, | |
| "learning_rate": 0.00011105598493091235, | |
| "loss": 2.8466, | |
| "step": 13320 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 6.33689022064209, | |
| "learning_rate": 0.00011093457962879442, | |
| "loss": 3.0005, | |
| "step": 13330 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 5.905701160430908, | |
| "learning_rate": 0.00011081315801269911, | |
| "loss": 2.6632, | |
| "step": 13340 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 4.605526924133301, | |
| "learning_rate": 0.00011069172026378294, | |
| "loss": 2.8175, | |
| "step": 13350 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 4.614380836486816, | |
| "learning_rate": 0.00011057026656322636, | |
| "loss": 2.9349, | |
| "step": 13360 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 4.65227746963501, | |
| "learning_rate": 0.0001104487970922337, | |
| "loss": 2.6209, | |
| "step": 13370 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 3.7751355171203613, | |
| "learning_rate": 0.00011032731203203281, | |
| "loss": 2.8983, | |
| "step": 13380 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 6.04954719543457, | |
| "learning_rate": 0.00011020581156387474, | |
| "loss": 2.9577, | |
| "step": 13390 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 7.594507217407227, | |
| "learning_rate": 0.00011008429586903366, | |
| "loss": 3.0118, | |
| "step": 13400 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "eval_loss": 2.8346240520477295, | |
| "eval_runtime": 1137.8991, | |
| "eval_samples_per_second": 5.009, | |
| "eval_steps_per_second": 5.009, | |
| "step": 13400 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 4.153735637664795, | |
| "learning_rate": 0.00010996276512880626, | |
| "loss": 2.5844, | |
| "step": 13410 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 9.582086563110352, | |
| "learning_rate": 0.00010984121952451187, | |
| "loss": 2.7306, | |
| "step": 13420 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 7.080514907836914, | |
| "learning_rate": 0.00010971965923749188, | |
| "loss": 3.1918, | |
| "step": 13430 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 6.384931564331055, | |
| "learning_rate": 0.00010959808444910957, | |
| "loss": 2.8799, | |
| "step": 13440 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 8.869901657104492, | |
| "learning_rate": 0.00010947649534075005, | |
| "loss": 2.9436, | |
| "step": 13450 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 6.180183410644531, | |
| "learning_rate": 0.00010935489209381947, | |
| "loss": 2.6373, | |
| "step": 13460 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 5.366621017456055, | |
| "learning_rate": 0.00010923327488974537, | |
| "loss": 2.9848, | |
| "step": 13470 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 10.306673049926758, | |
| "learning_rate": 0.00010911164390997596, | |
| "loss": 3.0342, | |
| "step": 13480 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 8.145923614501953, | |
| "learning_rate": 0.00010898999933598004, | |
| "loss": 2.708, | |
| "step": 13490 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 7.033836364746094, | |
| "learning_rate": 0.00010886834134924675, | |
| "loss": 2.7688, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 5.030039310455322, | |
| "learning_rate": 0.00010874667013128508, | |
| "loss": 2.508, | |
| "step": 13510 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 6.092257022857666, | |
| "learning_rate": 0.00010862498586362395, | |
| "loss": 2.7908, | |
| "step": 13520 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 8.369385719299316, | |
| "learning_rate": 0.00010850328872781161, | |
| "loss": 2.6625, | |
| "step": 13530 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 6.076193332672119, | |
| "learning_rate": 0.00010838157890541558, | |
| "loss": 3.0781, | |
| "step": 13540 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 5.35760498046875, | |
| "learning_rate": 0.0001082598565780223, | |
| "loss": 2.7686, | |
| "step": 13550 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 6.823988437652588, | |
| "learning_rate": 0.00010813812192723686, | |
| "loss": 2.7569, | |
| "step": 13560 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 4.118238925933838, | |
| "learning_rate": 0.00010801637513468272, | |
| "loss": 2.7056, | |
| "step": 13570 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 6.218942165374756, | |
| "learning_rate": 0.00010789461638200146, | |
| "loss": 2.8498, | |
| "step": 13580 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 4.8708086013793945, | |
| "learning_rate": 0.00010777284585085256, | |
| "loss": 2.5863, | |
| "step": 13590 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 6.01025915145874, | |
| "learning_rate": 0.00010765106372291296, | |
| "loss": 2.6526, | |
| "step": 13600 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 2.845993757247925, | |
| "eval_runtime": 1136.2008, | |
| "eval_samples_per_second": 5.017, | |
| "eval_steps_per_second": 5.017, | |
| "step": 13600 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.704145431518555, | |
| "learning_rate": 0.000107529270179877, | |
| "loss": 2.4644, | |
| "step": 13610 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 6.328924655914307, | |
| "learning_rate": 0.00010740746540345603, | |
| "loss": 2.6654, | |
| "step": 13620 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.664566516876221, | |
| "learning_rate": 0.00010728564957537815, | |
| "loss": 2.9038, | |
| "step": 13630 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.666599273681641, | |
| "learning_rate": 0.00010716382287738791, | |
| "loss": 2.5435, | |
| "step": 13640 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.4863176345825195, | |
| "learning_rate": 0.00010704198549124614, | |
| "loss": 2.5579, | |
| "step": 13650 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 6.503231048583984, | |
| "learning_rate": 0.00010692013759872961, | |
| "loss": 2.7717, | |
| "step": 13660 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 6.730213642120361, | |
| "learning_rate": 0.0001067982793816307, | |
| "loss": 2.8792, | |
| "step": 13670 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.679954528808594, | |
| "learning_rate": 0.00010667641102175724, | |
| "loss": 2.6506, | |
| "step": 13680 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 7.457332611083984, | |
| "learning_rate": 0.00010655453270093227, | |
| "loss": 2.8192, | |
| "step": 13690 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 6.174564361572266, | |
| "learning_rate": 0.00010643264460099351, | |
| "loss": 2.859, | |
| "step": 13700 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.672980785369873, | |
| "learning_rate": 0.00010631074690379348, | |
| "loss": 2.8721, | |
| "step": 13710 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 4.928731441497803, | |
| "learning_rate": 0.0001061888397911988, | |
| "loss": 2.537, | |
| "step": 13720 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 3.9560954570770264, | |
| "learning_rate": 0.00010606692344509034, | |
| "loss": 2.4611, | |
| "step": 13730 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 5.649095058441162, | |
| "learning_rate": 0.00010594499804736262, | |
| "loss": 2.6976, | |
| "step": 13740 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 8.706733703613281, | |
| "learning_rate": 0.00010582306377992368, | |
| "loss": 2.4591, | |
| "step": 13750 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 5.894099235534668, | |
| "learning_rate": 0.00010570112082469485, | |
| "loss": 2.6545, | |
| "step": 13760 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 6.439949035644531, | |
| "learning_rate": 0.00010557916936361039, | |
| "loss": 2.6755, | |
| "step": 13770 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 6.489779949188232, | |
| "learning_rate": 0.0001054572095786172, | |
| "loss": 2.4617, | |
| "step": 13780 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 7.473913669586182, | |
| "learning_rate": 0.0001053352416516747, | |
| "loss": 2.6437, | |
| "step": 13790 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 4.835104942321777, | |
| "learning_rate": 0.00010521326576475434, | |
| "loss": 2.6816, | |
| "step": 13800 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "eval_loss": 2.8399221897125244, | |
| "eval_runtime": 1134.199, | |
| "eval_samples_per_second": 5.026, | |
| "eval_steps_per_second": 5.026, | |
| "step": 13800 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 10.159151077270508, | |
| "learning_rate": 0.00010509128209983956, | |
| "loss": 2.7679, | |
| "step": 13810 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 5.414875507354736, | |
| "learning_rate": 0.00010496929083892535, | |
| "loss": 2.8924, | |
| "step": 13820 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 7.980355262756348, | |
| "learning_rate": 0.00010484729216401803, | |
| "loss": 2.6418, | |
| "step": 13830 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 5.9121413230896, | |
| "learning_rate": 0.00010472528625713498, | |
| "loss": 2.4819, | |
| "step": 13840 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 3.6737613677978516, | |
| "learning_rate": 0.00010460327330030437, | |
| "loss": 2.557, | |
| "step": 13850 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 6.475584506988525, | |
| "learning_rate": 0.00010448125347556488, | |
| "loss": 2.7248, | |
| "step": 13860 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 3.3596487045288086, | |
| "learning_rate": 0.00010435922696496552, | |
| "loss": 2.5047, | |
| "step": 13870 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 5.599161624908447, | |
| "learning_rate": 0.00010423719395056515, | |
| "loss": 2.61, | |
| "step": 13880 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 6.242649555206299, | |
| "learning_rate": 0.00010411515461443237, | |
| "loss": 2.6723, | |
| "step": 13890 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 7.319644927978516, | |
| "learning_rate": 0.00010399310913864532, | |
| "loss": 2.7631, | |
| "step": 13900 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 5.141343116760254, | |
| "learning_rate": 0.00010387105770529113, | |
| "loss": 2.7829, | |
| "step": 13910 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 5.021617889404297, | |
| "learning_rate": 0.00010374900049646592, | |
| "loss": 2.5408, | |
| "step": 13920 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 7.208983421325684, | |
| "learning_rate": 0.00010362693769427446, | |
| "loss": 2.8004, | |
| "step": 13930 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 5.373823642730713, | |
| "learning_rate": 0.00010350486948082972, | |
| "loss": 2.5771, | |
| "step": 13940 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 5.2942118644714355, | |
| "learning_rate": 0.00010338279603825294, | |
| "loss": 2.62, | |
| "step": 13950 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 6.039937496185303, | |
| "learning_rate": 0.00010326071754867294, | |
| "loss": 2.6654, | |
| "step": 13960 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 4.724233627319336, | |
| "learning_rate": 0.00010313863419422631, | |
| "loss": 2.5275, | |
| "step": 13970 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 6.356924533843994, | |
| "learning_rate": 0.00010301654615705669, | |
| "loss": 2.7036, | |
| "step": 13980 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 6.196333408355713, | |
| "learning_rate": 0.00010289445361931482, | |
| "loss": 2.5768, | |
| "step": 13990 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 8.118714332580566, | |
| "learning_rate": 0.00010277235676315817, | |
| "loss": 2.3845, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "eval_loss": 2.846597909927368, | |
| "eval_runtime": 1140.6527, | |
| "eval_samples_per_second": 4.997, | |
| "eval_steps_per_second": 4.997, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 5.258535861968994, | |
| "learning_rate": 0.00010265025577075054, | |
| "loss": 2.8392, | |
| "step": 14010 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 5.9286885261535645, | |
| "learning_rate": 0.00010252815082426199, | |
| "loss": 2.7799, | |
| "step": 14020 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 5.152517318725586, | |
| "learning_rate": 0.00010240604210586848, | |
| "loss": 2.4615, | |
| "step": 14030 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 4.207879543304443, | |
| "learning_rate": 0.00010228392979775159, | |
| "loss": 2.777, | |
| "step": 14040 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 6.9504475593566895, | |
| "learning_rate": 0.00010216181408209817, | |
| "loss": 2.6854, | |
| "step": 14050 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 6.830455780029297, | |
| "learning_rate": 0.00010203969514110033, | |
| "loss": 2.6638, | |
| "step": 14060 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 3.3591535091400146, | |
| "learning_rate": 0.00010191757315695482, | |
| "loss": 2.6079, | |
| "step": 14070 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 7.07043981552124, | |
| "learning_rate": 0.00010179544831186305, | |
| "loss": 2.7527, | |
| "step": 14080 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 3.6287598609924316, | |
| "learning_rate": 0.0001016733207880306, | |
| "loss": 2.733, | |
| "step": 14090 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 6.620267868041992, | |
| "learning_rate": 0.00010155119076766708, | |
| "loss": 2.6319, | |
| "step": 14100 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 5.5068793296813965, | |
| "learning_rate": 0.00010142905843298592, | |
| "loss": 2.7411, | |
| "step": 14110 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 5.742343902587891, | |
| "learning_rate": 0.00010130692396620388, | |
| "loss": 2.6599, | |
| "step": 14120 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 3.2871851921081543, | |
| "learning_rate": 0.00010118478754954091, | |
| "loss": 2.4312, | |
| "step": 14130 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 4.894622802734375, | |
| "learning_rate": 0.00010106264936521996, | |
| "loss": 2.749, | |
| "step": 14140 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 6.887192249298096, | |
| "learning_rate": 0.0001009405095954665, | |
| "loss": 2.5452, | |
| "step": 14150 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 7.4985175132751465, | |
| "learning_rate": 0.00010081836842250851, | |
| "loss": 2.9491, | |
| "step": 14160 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 7.017559051513672, | |
| "learning_rate": 0.00010069622602857589, | |
| "loss": 2.6417, | |
| "step": 14170 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 6.0003437995910645, | |
| "learning_rate": 0.00010057408259590049, | |
| "loss": 2.4899, | |
| "step": 14180 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 4.769591808319092, | |
| "learning_rate": 0.00010045193830671568, | |
| "loss": 2.5924, | |
| "step": 14190 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 4.747857093811035, | |
| "learning_rate": 0.00010032979334325607, | |
| "loss": 2.5493, | |
| "step": 14200 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "eval_loss": 2.8418214321136475, | |
| "eval_runtime": 1136.8707, | |
| "eval_samples_per_second": 5.014, | |
| "eval_steps_per_second": 5.014, | |
| "step": 14200 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 5.269603729248047, | |
| "learning_rate": 0.00010020764788775736, | |
| "loss": 2.6107, | |
| "step": 14210 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 5.822869777679443, | |
| "learning_rate": 0.00010008550212245587, | |
| "loss": 2.7305, | |
| "step": 14220 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 4.800507545471191, | |
| "learning_rate": 9.996335622958848e-05, | |
| "loss": 2.6997, | |
| "step": 14230 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 4.758016586303711, | |
| "learning_rate": 9.984121039139218e-05, | |
| "loss": 2.6385, | |
| "step": 14240 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 4.214052200317383, | |
| "learning_rate": 9.971906479010394e-05, | |
| "loss": 2.7877, | |
| "step": 14250 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 5.076603889465332, | |
| "learning_rate": 9.959691960796036e-05, | |
| "loss": 2.5551, | |
| "step": 14260 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 6.1883416175842285, | |
| "learning_rate": 9.947477502719745e-05, | |
| "loss": 2.7586, | |
| "step": 14270 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 3.745725154876709, | |
| "learning_rate": 9.93526312300502e-05, | |
| "loss": 2.6555, | |
| "step": 14280 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 4.745731830596924, | |
| "learning_rate": 9.923048839875258e-05, | |
| "loss": 2.7364, | |
| "step": 14290 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 4.47914981842041, | |
| "learning_rate": 9.910834671553699e-05, | |
| "loss": 2.6527, | |
| "step": 14300 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 6.2111897468566895, | |
| "learning_rate": 9.898620636263426e-05, | |
| "loss": 2.8341, | |
| "step": 14310 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 14.119166374206543, | |
| "learning_rate": 9.886406752227313e-05, | |
| "loss": 2.578, | |
| "step": 14320 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 5.5367889404296875, | |
| "learning_rate": 9.874193037668006e-05, | |
| "loss": 2.779, | |
| "step": 14330 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 4.672638416290283, | |
| "learning_rate": 9.861979510807907e-05, | |
| "loss": 2.8918, | |
| "step": 14340 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 6.862904071807861, | |
| "learning_rate": 9.849766189869134e-05, | |
| "loss": 2.6632, | |
| "step": 14350 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 3.7714316844940186, | |
| "learning_rate": 9.837553093073494e-05, | |
| "loss": 2.5183, | |
| "step": 14360 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 7.480538845062256, | |
| "learning_rate": 9.825340238642473e-05, | |
| "loss": 2.6456, | |
| "step": 14370 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 5.1482834815979, | |
| "learning_rate": 9.813127644797177e-05, | |
| "loss": 2.4604, | |
| "step": 14380 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 5.069243431091309, | |
| "learning_rate": 9.800915329758333e-05, | |
| "loss": 2.6392, | |
| "step": 14390 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 6.216825485229492, | |
| "learning_rate": 9.788703311746254e-05, | |
| "loss": 2.6742, | |
| "step": 14400 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "eval_loss": 2.8299241065979004, | |
| "eval_runtime": 1135.6729, | |
| "eval_samples_per_second": 5.019, | |
| "eval_steps_per_second": 5.019, | |
| "step": 14400 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 7.684316635131836, | |
| "learning_rate": 9.776491608980808e-05, | |
| "loss": 2.8018, | |
| "step": 14410 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 4.665287971496582, | |
| "learning_rate": 9.764280239681385e-05, | |
| "loss": 2.7907, | |
| "step": 14420 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 4.080597877502441, | |
| "learning_rate": 9.752069222066889e-05, | |
| "loss": 2.6134, | |
| "step": 14430 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 4.095142841339111, | |
| "learning_rate": 9.739858574355691e-05, | |
| "loss": 2.6614, | |
| "step": 14440 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 6.944389820098877, | |
| "learning_rate": 9.727648314765617e-05, | |
| "loss": 2.7235, | |
| "step": 14450 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 10.006865501403809, | |
| "learning_rate": 9.715438461513912e-05, | |
| "loss": 2.7576, | |
| "step": 14460 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 5.380651473999023, | |
| "learning_rate": 9.703229032817207e-05, | |
| "loss": 2.6551, | |
| "step": 14470 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 4.433184623718262, | |
| "learning_rate": 9.691020046891509e-05, | |
| "loss": 2.5386, | |
| "step": 14480 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 5.731329441070557, | |
| "learning_rate": 9.678811521952161e-05, | |
| "loss": 2.6239, | |
| "step": 14490 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 4.7876458168029785, | |
| "learning_rate": 9.666603476213818e-05, | |
| "loss": 2.5553, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 15.640872955322266, | |
| "learning_rate": 9.654395927890422e-05, | |
| "loss": 2.6181, | |
| "step": 14510 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 8.363943099975586, | |
| "learning_rate": 9.642188895195167e-05, | |
| "loss": 2.7827, | |
| "step": 14520 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 11.327077865600586, | |
| "learning_rate": 9.629982396340488e-05, | |
| "loss": 2.5366, | |
| "step": 14530 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 6.818722248077393, | |
| "learning_rate": 9.617776449538011e-05, | |
| "loss": 2.7139, | |
| "step": 14540 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 5.882566928863525, | |
| "learning_rate": 9.60557107299855e-05, | |
| "loss": 2.5054, | |
| "step": 14550 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 7.939090251922607, | |
| "learning_rate": 9.593366284932064e-05, | |
| "loss": 2.7289, | |
| "step": 14560 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 11.2249755859375, | |
| "learning_rate": 9.581162103547627e-05, | |
| "loss": 2.8788, | |
| "step": 14570 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 4.7646002769470215, | |
| "learning_rate": 9.568958547053417e-05, | |
| "loss": 2.604, | |
| "step": 14580 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 6.1333513259887695, | |
| "learning_rate": 9.556755633656676e-05, | |
| "loss": 2.6, | |
| "step": 14590 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 5.915955543518066, | |
| "learning_rate": 9.544553381563691e-05, | |
| "loss": 2.6433, | |
| "step": 14600 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "eval_loss": 2.822645902633667, | |
| "eval_runtime": 1137.1119, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 14600 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 9.068519592285156, | |
| "learning_rate": 9.532351808979754e-05, | |
| "loss": 2.8102, | |
| "step": 14610 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 6.155020713806152, | |
| "learning_rate": 9.520150934109146e-05, | |
| "loss": 2.5665, | |
| "step": 14620 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 7.280089378356934, | |
| "learning_rate": 9.507950775155116e-05, | |
| "loss": 2.7537, | |
| "step": 14630 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 5.696301460266113, | |
| "learning_rate": 9.495751350319829e-05, | |
| "loss": 2.8477, | |
| "step": 14640 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 6.453228950500488, | |
| "learning_rate": 9.483552677804372e-05, | |
| "loss": 2.7048, | |
| "step": 14650 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 4.739017009735107, | |
| "learning_rate": 9.471354775808695e-05, | |
| "loss": 2.7032, | |
| "step": 14660 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 9.007843017578125, | |
| "learning_rate": 9.459157662531603e-05, | |
| "loss": 2.8116, | |
| "step": 14670 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 5.5827131271362305, | |
| "learning_rate": 9.446961356170731e-05, | |
| "loss": 2.8541, | |
| "step": 14680 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 4.878897190093994, | |
| "learning_rate": 9.4347658749225e-05, | |
| "loss": 2.739, | |
| "step": 14690 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 5.005230903625488, | |
| "learning_rate": 9.422571236982113e-05, | |
| "loss": 2.5947, | |
| "step": 14700 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 5.4663591384887695, | |
| "learning_rate": 9.410377460543493e-05, | |
| "loss": 2.5272, | |
| "step": 14710 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 4.379180908203125, | |
| "learning_rate": 9.398184563799301e-05, | |
| "loss": 2.4606, | |
| "step": 14720 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 5.044705390930176, | |
| "learning_rate": 9.385992564940871e-05, | |
| "loss": 2.5472, | |
| "step": 14730 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 2.9766154289245605, | |
| "learning_rate": 9.373801482158206e-05, | |
| "loss": 2.559, | |
| "step": 14740 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 6.4899396896362305, | |
| "learning_rate": 9.36161133363994e-05, | |
| "loss": 2.7749, | |
| "step": 14750 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 5.2543439865112305, | |
| "learning_rate": 9.349422137573302e-05, | |
| "loss": 2.5608, | |
| "step": 14760 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 4.9640703201293945, | |
| "learning_rate": 9.337233912144116e-05, | |
| "loss": 2.6551, | |
| "step": 14770 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 4.78398323059082, | |
| "learning_rate": 9.32504667553675e-05, | |
| "loss": 2.5717, | |
| "step": 14780 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 12.001642227172852, | |
| "learning_rate": 9.312860445934101e-05, | |
| "loss": 2.4541, | |
| "step": 14790 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 7.847120761871338, | |
| "learning_rate": 9.300675241517557e-05, | |
| "loss": 2.6015, | |
| "step": 14800 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "eval_loss": 2.8366076946258545, | |
| "eval_runtime": 1134.7417, | |
| "eval_samples_per_second": 5.023, | |
| "eval_steps_per_second": 5.023, | |
| "step": 14800 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 6.1443986892700195, | |
| "learning_rate": 9.288491080466978e-05, | |
| "loss": 2.5734, | |
| "step": 14810 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 8.345760345458984, | |
| "learning_rate": 9.276307980960674e-05, | |
| "loss": 2.7371, | |
| "step": 14820 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.313103199005127, | |
| "learning_rate": 9.264125961175363e-05, | |
| "loss": 2.9526, | |
| "step": 14830 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.4391350746154785, | |
| "learning_rate": 9.251945039286161e-05, | |
| "loss": 2.5819, | |
| "step": 14840 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 4.635354042053223, | |
| "learning_rate": 9.239765233466535e-05, | |
| "loss": 2.8905, | |
| "step": 14850 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 4.282767295837402, | |
| "learning_rate": 9.227586561888292e-05, | |
| "loss": 2.4121, | |
| "step": 14860 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 5.246340274810791, | |
| "learning_rate": 9.215409042721552e-05, | |
| "loss": 2.8323, | |
| "step": 14870 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.242234230041504, | |
| "learning_rate": 9.203232694134706e-05, | |
| "loss": 2.7003, | |
| "step": 14880 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.143115997314453, | |
| "learning_rate": 9.191057534294411e-05, | |
| "loss": 2.3707, | |
| "step": 14890 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.330958366394043, | |
| "learning_rate": 9.178883581365534e-05, | |
| "loss": 2.4944, | |
| "step": 14900 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.2139482498168945, | |
| "learning_rate": 9.166710853511155e-05, | |
| "loss": 2.6611, | |
| "step": 14910 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 4.927261829376221, | |
| "learning_rate": 9.15453936889252e-05, | |
| "loss": 2.8179, | |
| "step": 14920 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 4.508125305175781, | |
| "learning_rate": 9.142369145669021e-05, | |
| "loss": 2.6895, | |
| "step": 14930 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 7.7817230224609375, | |
| "learning_rate": 9.130200201998173e-05, | |
| "loss": 2.6323, | |
| "step": 14940 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 6.731665134429932, | |
| "learning_rate": 9.118032556035572e-05, | |
| "loss": 2.6161, | |
| "step": 14950 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 4.72010612487793, | |
| "learning_rate": 9.105866225934885e-05, | |
| "loss": 2.825, | |
| "step": 14960 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 6.487375736236572, | |
| "learning_rate": 9.093701229847817e-05, | |
| "loss": 2.3883, | |
| "step": 14970 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 5.321608066558838, | |
| "learning_rate": 9.081537585924079e-05, | |
| "loss": 2.7388, | |
| "step": 14980 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 5.753255367279053, | |
| "learning_rate": 9.069375312311362e-05, | |
| "loss": 2.7161, | |
| "step": 14990 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 5.2197265625, | |
| "learning_rate": 9.057214427155319e-05, | |
| "loss": 2.6866, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "eval_loss": 2.821988344192505, | |
| "eval_runtime": 1135.7076, | |
| "eval_samples_per_second": 5.019, | |
| "eval_steps_per_second": 5.019, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 4.719414710998535, | |
| "learning_rate": 9.045054948599525e-05, | |
| "loss": 2.5983, | |
| "step": 15010 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 6.498874664306641, | |
| "learning_rate": 9.032896894785464e-05, | |
| "loss": 2.8949, | |
| "step": 15020 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 5.581775188446045, | |
| "learning_rate": 9.020740283852495e-05, | |
| "loss": 2.5969, | |
| "step": 15030 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 6.098051071166992, | |
| "learning_rate": 9.00858513393781e-05, | |
| "loss": 2.5028, | |
| "step": 15040 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 7.322878837585449, | |
| "learning_rate": 8.996431463176434e-05, | |
| "loss": 2.5779, | |
| "step": 15050 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 5.357008934020996, | |
| "learning_rate": 8.984279289701184e-05, | |
| "loss": 2.6543, | |
| "step": 15060 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 3.7159807682037354, | |
| "learning_rate": 8.97212863164264e-05, | |
| "loss": 2.6203, | |
| "step": 15070 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 5.603279113769531, | |
| "learning_rate": 8.959979507129124e-05, | |
| "loss": 2.5972, | |
| "step": 15080 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 6.878233432769775, | |
| "learning_rate": 8.947831934286664e-05, | |
| "loss": 2.7696, | |
| "step": 15090 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 6.096282958984375, | |
| "learning_rate": 8.935685931238979e-05, | |
| "loss": 2.6345, | |
| "step": 15100 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 7.228655815124512, | |
| "learning_rate": 8.923541516107445e-05, | |
| "loss": 2.7248, | |
| "step": 15110 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 3.705758810043335, | |
| "learning_rate": 8.911398707011065e-05, | |
| "loss": 2.6374, | |
| "step": 15120 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 4.940635681152344, | |
| "learning_rate": 8.899257522066455e-05, | |
| "loss": 2.6978, | |
| "step": 15130 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 6.699410438537598, | |
| "learning_rate": 8.887117979387797e-05, | |
| "loss": 2.9187, | |
| "step": 15140 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 5.017121315002441, | |
| "learning_rate": 8.874980097086826e-05, | |
| "loss": 2.6659, | |
| "step": 15150 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 9.299418449401855, | |
| "learning_rate": 8.862843893272805e-05, | |
| "loss": 2.4321, | |
| "step": 15160 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 3.4937360286712646, | |
| "learning_rate": 8.850709386052485e-05, | |
| "loss": 2.6002, | |
| "step": 15170 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 5.106987476348877, | |
| "learning_rate": 8.838576593530096e-05, | |
| "loss": 2.9664, | |
| "step": 15180 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 5.51921272277832, | |
| "learning_rate": 8.826445533807297e-05, | |
| "loss": 2.6186, | |
| "step": 15190 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 8.393594741821289, | |
| "learning_rate": 8.814316224983169e-05, | |
| "loss": 2.7938, | |
| "step": 15200 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "eval_loss": 2.81386661529541, | |
| "eval_runtime": 1134.4546, | |
| "eval_samples_per_second": 5.024, | |
| "eval_steps_per_second": 5.024, | |
| "step": 15200 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 6.8599371910095215, | |
| "learning_rate": 8.802188685154183e-05, | |
| "loss": 2.7784, | |
| "step": 15210 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 6.077823162078857, | |
| "learning_rate": 8.790062932414169e-05, | |
| "loss": 2.9943, | |
| "step": 15220 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 6.662342071533203, | |
| "learning_rate": 8.777938984854281e-05, | |
| "loss": 2.432, | |
| "step": 15230 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 3.6993889808654785, | |
| "learning_rate": 8.765816860562998e-05, | |
| "loss": 2.4492, | |
| "step": 15240 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 8.877721786499023, | |
| "learning_rate": 8.753696577626061e-05, | |
| "loss": 2.5662, | |
| "step": 15250 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 4.209753513336182, | |
| "learning_rate": 8.741578154126476e-05, | |
| "loss": 2.5471, | |
| "step": 15260 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 4.297937870025635, | |
| "learning_rate": 8.729461608144472e-05, | |
| "loss": 2.5248, | |
| "step": 15270 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 4.832234859466553, | |
| "learning_rate": 8.717346957757469e-05, | |
| "loss": 2.5218, | |
| "step": 15280 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 4.7769999504089355, | |
| "learning_rate": 8.70523422104007e-05, | |
| "loss": 2.8345, | |
| "step": 15290 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 6.273793697357178, | |
| "learning_rate": 8.693123416064015e-05, | |
| "loss": 2.842, | |
| "step": 15300 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 7.538787364959717, | |
| "learning_rate": 8.681014560898168e-05, | |
| "loss": 2.6492, | |
| "step": 15310 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 5.364718914031982, | |
| "learning_rate": 8.668907673608484e-05, | |
| "loss": 2.6824, | |
| "step": 15320 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 9.456381797790527, | |
| "learning_rate": 8.656802772257967e-05, | |
| "loss": 2.5481, | |
| "step": 15330 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 5.099219799041748, | |
| "learning_rate": 8.644699874906677e-05, | |
| "loss": 2.6301, | |
| "step": 15340 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 10.843995094299316, | |
| "learning_rate": 8.632598999611681e-05, | |
| "loss": 2.8424, | |
| "step": 15350 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 5.564281940460205, | |
| "learning_rate": 8.620500164427017e-05, | |
| "loss": 2.6204, | |
| "step": 15360 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 5.3823628425598145, | |
| "learning_rate": 8.608403387403697e-05, | |
| "loss": 2.746, | |
| "step": 15370 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 3.44514799118042, | |
| "learning_rate": 8.596308686589645e-05, | |
| "loss": 2.7036, | |
| "step": 15380 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 6.357730865478516, | |
| "learning_rate": 8.584216080029694e-05, | |
| "loss": 2.3706, | |
| "step": 15390 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 7.127414226531982, | |
| "learning_rate": 8.57212558576556e-05, | |
| "loss": 2.3574, | |
| "step": 15400 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "eval_loss": 2.8107047080993652, | |
| "eval_runtime": 1137.0718, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 15400 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 6.099443435668945, | |
| "learning_rate": 8.560037221835799e-05, | |
| "loss": 2.7923, | |
| "step": 15410 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 8.16304874420166, | |
| "learning_rate": 8.547951006275786e-05, | |
| "loss": 2.6381, | |
| "step": 15420 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 4.368096828460693, | |
| "learning_rate": 8.5358669571177e-05, | |
| "loss": 2.5908, | |
| "step": 15430 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 6.323507785797119, | |
| "learning_rate": 8.523785092390482e-05, | |
| "loss": 2.7558, | |
| "step": 15440 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 8.191755294799805, | |
| "learning_rate": 8.511705430119815e-05, | |
| "loss": 2.6878, | |
| "step": 15450 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 4.996376037597656, | |
| "learning_rate": 8.499627988328099e-05, | |
| "loss": 2.3164, | |
| "step": 15460 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 6.701737880706787, | |
| "learning_rate": 8.487552785034411e-05, | |
| "loss": 2.5691, | |
| "step": 15470 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 4.932399749755859, | |
| "learning_rate": 8.475479838254503e-05, | |
| "loss": 2.4854, | |
| "step": 15480 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 6.256311893463135, | |
| "learning_rate": 8.463409166000747e-05, | |
| "loss": 2.2988, | |
| "step": 15490 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 5.213491439819336, | |
| "learning_rate": 8.451340786282133e-05, | |
| "loss": 2.5542, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 4.382655620574951, | |
| "learning_rate": 8.439274717104224e-05, | |
| "loss": 2.9418, | |
| "step": 15510 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 4.432163715362549, | |
| "learning_rate": 8.42721097646913e-05, | |
| "loss": 2.5682, | |
| "step": 15520 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 6.079984664916992, | |
| "learning_rate": 8.4151495823755e-05, | |
| "loss": 2.7749, | |
| "step": 15530 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 4.57197380065918, | |
| "learning_rate": 8.403090552818475e-05, | |
| "loss": 2.6964, | |
| "step": 15540 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 5.710402965545654, | |
| "learning_rate": 8.391033905789668e-05, | |
| "loss": 2.7295, | |
| "step": 15550 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 5.570113658905029, | |
| "learning_rate": 8.378979659277142e-05, | |
| "loss": 2.4635, | |
| "step": 15560 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 4.270289421081543, | |
| "learning_rate": 8.366927831265366e-05, | |
| "loss": 2.4542, | |
| "step": 15570 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 7.5061845779418945, | |
| "learning_rate": 8.354878439735216e-05, | |
| "loss": 2.8317, | |
| "step": 15580 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 5.209946155548096, | |
| "learning_rate": 8.342831502663924e-05, | |
| "loss": 2.8297, | |
| "step": 15590 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 5.211167335510254, | |
| "learning_rate": 8.330787038025068e-05, | |
| "loss": 2.4852, | |
| "step": 15600 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "eval_loss": 2.801150321960449, | |
| "eval_runtime": 1135.7445, | |
| "eval_samples_per_second": 5.019, | |
| "eval_steps_per_second": 5.019, | |
| "step": 15600 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 4.61747407913208, | |
| "learning_rate": 8.318745063788524e-05, | |
| "loss": 2.7651, | |
| "step": 15610 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 7.793847560882568, | |
| "learning_rate": 8.306705597920463e-05, | |
| "loss": 2.6381, | |
| "step": 15620 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 7.500510215759277, | |
| "learning_rate": 8.294668658383311e-05, | |
| "loss": 2.7704, | |
| "step": 15630 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 4.450290203094482, | |
| "learning_rate": 8.282634263135722e-05, | |
| "loss": 2.4493, | |
| "step": 15640 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 7.9324750900268555, | |
| "learning_rate": 8.270602430132562e-05, | |
| "loss": 2.6112, | |
| "step": 15650 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 4.876689434051514, | |
| "learning_rate": 8.258573177324861e-05, | |
| "loss": 2.5688, | |
| "step": 15660 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 7.13979434967041, | |
| "learning_rate": 8.247749070698486e-05, | |
| "loss": 2.5836, | |
| "step": 15670 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 7.261677265167236, | |
| "learning_rate": 8.235724769703466e-05, | |
| "loss": 2.3577, | |
| "step": 15680 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 4.691134452819824, | |
| "learning_rate": 8.223703100940052e-05, | |
| "loss": 2.7229, | |
| "step": 15690 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 6.986545085906982, | |
| "learning_rate": 8.211684082344125e-05, | |
| "loss": 2.554, | |
| "step": 15700 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 5.607544422149658, | |
| "learning_rate": 8.199667731847593e-05, | |
| "loss": 2.403, | |
| "step": 15710 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 5.985232830047607, | |
| "learning_rate": 8.187654067378397e-05, | |
| "loss": 2.4481, | |
| "step": 15720 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 13.418354988098145, | |
| "learning_rate": 8.175643106860472e-05, | |
| "loss": 2.7237, | |
| "step": 15730 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 4.863924980163574, | |
| "learning_rate": 8.163634868213715e-05, | |
| "loss": 2.5766, | |
| "step": 15740 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 5.624682903289795, | |
| "learning_rate": 8.151629369353952e-05, | |
| "loss": 2.7085, | |
| "step": 15750 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 4.593716621398926, | |
| "learning_rate": 8.139626628192944e-05, | |
| "loss": 3.056, | |
| "step": 15760 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 5.1518025398254395, | |
| "learning_rate": 8.127626662638315e-05, | |
| "loss": 2.9041, | |
| "step": 15770 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 6.224874973297119, | |
| "learning_rate": 8.115629490593564e-05, | |
| "loss": 2.574, | |
| "step": 15780 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 7.418553352355957, | |
| "learning_rate": 8.103635129958017e-05, | |
| "loss": 2.7397, | |
| "step": 15790 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 15.142317771911621, | |
| "learning_rate": 8.091643598626794e-05, | |
| "loss": 2.845, | |
| "step": 15800 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "eval_loss": 2.8001558780670166, | |
| "eval_runtime": 1137.7655, | |
| "eval_samples_per_second": 5.01, | |
| "eval_steps_per_second": 5.01, | |
| "step": 15800 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 6.888623237609863, | |
| "learning_rate": 8.079654914490815e-05, | |
| "loss": 2.8391, | |
| "step": 15810 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 6.754673957824707, | |
| "learning_rate": 8.067669095436736e-05, | |
| "loss": 2.537, | |
| "step": 15820 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 7.226851940155029, | |
| "learning_rate": 8.055686159346944e-05, | |
| "loss": 2.5829, | |
| "step": 15830 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 6.088146209716797, | |
| "learning_rate": 8.04370612409953e-05, | |
| "loss": 2.6574, | |
| "step": 15840 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 5.43487024307251, | |
| "learning_rate": 8.031729007568241e-05, | |
| "loss": 2.8225, | |
| "step": 15850 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 5.83208703994751, | |
| "learning_rate": 8.019754827622487e-05, | |
| "loss": 2.4902, | |
| "step": 15860 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 5.5839738845825195, | |
| "learning_rate": 8.007783602127285e-05, | |
| "loss": 2.7953, | |
| "step": 15870 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 9.091108322143555, | |
| "learning_rate": 7.995815348943256e-05, | |
| "loss": 2.6682, | |
| "step": 15880 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 5.6139445304870605, | |
| "learning_rate": 7.983850085926574e-05, | |
| "loss": 2.4715, | |
| "step": 15890 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 11.105509757995605, | |
| "learning_rate": 7.971887830928954e-05, | |
| "loss": 2.4542, | |
| "step": 15900 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 5.053381443023682, | |
| "learning_rate": 7.95992860179763e-05, | |
| "loss": 2.5608, | |
| "step": 15910 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 6.730508327484131, | |
| "learning_rate": 7.947972416375315e-05, | |
| "loss": 2.6179, | |
| "step": 15920 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 4.9856276512146, | |
| "learning_rate": 7.936019292500191e-05, | |
| "loss": 2.9111, | |
| "step": 15930 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 6.622928142547607, | |
| "learning_rate": 7.924069248005855e-05, | |
| "loss": 2.9524, | |
| "step": 15940 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 5.014869213104248, | |
| "learning_rate": 7.912122300721319e-05, | |
| "loss": 2.7441, | |
| "step": 15950 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 6.20679235458374, | |
| "learning_rate": 7.900178468470983e-05, | |
| "loss": 2.488, | |
| "step": 15960 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 5.172658443450928, | |
| "learning_rate": 7.888237769074582e-05, | |
| "loss": 2.5992, | |
| "step": 15970 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 4.712294101715088, | |
| "learning_rate": 7.876300220347195e-05, | |
| "loss": 2.7378, | |
| "step": 15980 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 5.688995838165283, | |
| "learning_rate": 7.864365840099183e-05, | |
| "loss": 2.7758, | |
| "step": 15990 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 4.735537052154541, | |
| "learning_rate": 7.852434646136191e-05, | |
| "loss": 2.6825, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "eval_loss": 2.7963438034057617, | |
| "eval_runtime": 1138.098, | |
| "eval_samples_per_second": 5.008, | |
| "eval_steps_per_second": 5.008, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 5.686548233032227, | |
| "learning_rate": 7.840506656259108e-05, | |
| "loss": 2.6941, | |
| "step": 16010 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 4.687047004699707, | |
| "learning_rate": 7.828581888264037e-05, | |
| "loss": 2.3713, | |
| "step": 16020 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 5.9541850090026855, | |
| "learning_rate": 7.816660359942288e-05, | |
| "loss": 2.8516, | |
| "step": 16030 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 6.282932758331299, | |
| "learning_rate": 7.804742089080319e-05, | |
| "loss": 2.4472, | |
| "step": 16040 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 6.3287858963012695, | |
| "learning_rate": 7.792827093459742e-05, | |
| "loss": 2.5265, | |
| "step": 16050 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 7.00472354888916, | |
| "learning_rate": 7.780915390857275e-05, | |
| "loss": 2.8147, | |
| "step": 16060 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 5.5554399490356445, | |
| "learning_rate": 7.769006999044729e-05, | |
| "loss": 2.5742, | |
| "step": 16070 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 4.063988208770752, | |
| "learning_rate": 7.757101935788973e-05, | |
| "loss": 2.5979, | |
| "step": 16080 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 8.165379524230957, | |
| "learning_rate": 7.745200218851901e-05, | |
| "loss": 2.7628, | |
| "step": 16090 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 5.317456245422363, | |
| "learning_rate": 7.733301865990432e-05, | |
| "loss": 2.8025, | |
| "step": 16100 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 11.654034614562988, | |
| "learning_rate": 7.721406894956449e-05, | |
| "loss": 2.6235, | |
| "step": 16110 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 9.989720344543457, | |
| "learning_rate": 7.709515323496804e-05, | |
| "loss": 2.5045, | |
| "step": 16120 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 4.502736568450928, | |
| "learning_rate": 7.697627169353265e-05, | |
| "loss": 2.4192, | |
| "step": 16130 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 4.556110858917236, | |
| "learning_rate": 7.685742450262504e-05, | |
| "loss": 2.5847, | |
| "step": 16140 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 4.872483730316162, | |
| "learning_rate": 7.673861183956077e-05, | |
| "loss": 2.5115, | |
| "step": 16150 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 7.733802318572998, | |
| "learning_rate": 7.661983388160375e-05, | |
| "loss": 2.4647, | |
| "step": 16160 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 4.661727428436279, | |
| "learning_rate": 7.650109080596625e-05, | |
| "loss": 2.4705, | |
| "step": 16170 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 5.2123541831970215, | |
| "learning_rate": 7.638238278980838e-05, | |
| "loss": 2.5191, | |
| "step": 16180 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 5.72269868850708, | |
| "learning_rate": 7.626371001023798e-05, | |
| "loss": 2.6785, | |
| "step": 16190 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 12.739094734191895, | |
| "learning_rate": 7.614507264431036e-05, | |
| "loss": 2.8185, | |
| "step": 16200 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "eval_loss": 2.794032335281372, | |
| "eval_runtime": 1136.7877, | |
| "eval_samples_per_second": 5.014, | |
| "eval_steps_per_second": 5.014, | |
| "step": 16200 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 6.045168399810791, | |
| "learning_rate": 7.602647086902794e-05, | |
| "loss": 2.5196, | |
| "step": 16210 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 4.591131210327148, | |
| "learning_rate": 7.59079048613401e-05, | |
| "loss": 2.3241, | |
| "step": 16220 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 6.3532395362854, | |
| "learning_rate": 7.578937479814279e-05, | |
| "loss": 2.4889, | |
| "step": 16230 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 6.245053291320801, | |
| "learning_rate": 7.567088085627834e-05, | |
| "loss": 2.5951, | |
| "step": 16240 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 8.003286361694336, | |
| "learning_rate": 7.555242321253525e-05, | |
| "loss": 2.6774, | |
| "step": 16250 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 5.010828018188477, | |
| "learning_rate": 7.543400204364776e-05, | |
| "loss": 2.3974, | |
| "step": 16260 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 4.4079155921936035, | |
| "learning_rate": 7.531561752629585e-05, | |
| "loss": 2.4707, | |
| "step": 16270 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 5.175243377685547, | |
| "learning_rate": 7.519726983710465e-05, | |
| "loss": 2.7921, | |
| "step": 16280 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 4.758031368255615, | |
| "learning_rate": 7.507895915264442e-05, | |
| "loss": 2.6729, | |
| "step": 16290 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 5.974156379699707, | |
| "learning_rate": 7.496068564943024e-05, | |
| "loss": 2.4163, | |
| "step": 16300 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 5.608770370483398, | |
| "learning_rate": 7.48424495039217e-05, | |
| "loss": 2.8602, | |
| "step": 16310 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 5.631148815155029, | |
| "learning_rate": 7.472425089252254e-05, | |
| "loss": 2.5714, | |
| "step": 16320 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 4.781109809875488, | |
| "learning_rate": 7.460608999158067e-05, | |
| "loss": 2.6068, | |
| "step": 16330 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 7.0405449867248535, | |
| "learning_rate": 7.448796697738765e-05, | |
| "loss": 2.6175, | |
| "step": 16340 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 4.027560710906982, | |
| "learning_rate": 7.436988202617854e-05, | |
| "loss": 2.6064, | |
| "step": 16350 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 6.559507369995117, | |
| "learning_rate": 7.425183531413163e-05, | |
| "loss": 3.0446, | |
| "step": 16360 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 6.1287031173706055, | |
| "learning_rate": 7.413382701736804e-05, | |
| "loss": 2.5806, | |
| "step": 16370 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 7.039647102355957, | |
| "learning_rate": 7.401585731195171e-05, | |
| "loss": 2.5544, | |
| "step": 16380 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 3.893784999847412, | |
| "learning_rate": 7.389792637388899e-05, | |
| "loss": 2.6337, | |
| "step": 16390 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 9.116436958312988, | |
| "learning_rate": 7.37800343791283e-05, | |
| "loss": 2.5752, | |
| "step": 16400 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "eval_loss": 2.7846195697784424, | |
| "eval_runtime": 1137.5768, | |
| "eval_samples_per_second": 5.011, | |
| "eval_steps_per_second": 5.011, | |
| "step": 16400 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 5.62230110168457, | |
| "learning_rate": 7.366218150356011e-05, | |
| "loss": 2.4447, | |
| "step": 16410 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 5.021866798400879, | |
| "learning_rate": 7.354436792301634e-05, | |
| "loss": 2.5048, | |
| "step": 16420 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 4.596590995788574, | |
| "learning_rate": 7.342659381327039e-05, | |
| "loss": 2.4309, | |
| "step": 16430 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 4.406472206115723, | |
| "learning_rate": 7.330885935003679e-05, | |
| "loss": 2.458, | |
| "step": 16440 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 4.427298069000244, | |
| "learning_rate": 7.319116470897085e-05, | |
| "loss": 2.5887, | |
| "step": 16450 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 6.47908353805542, | |
| "learning_rate": 7.307351006566856e-05, | |
| "loss": 2.9025, | |
| "step": 16460 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 4.693458557128906, | |
| "learning_rate": 7.295589559566612e-05, | |
| "loss": 2.5394, | |
| "step": 16470 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 5.163450241088867, | |
| "learning_rate": 7.283832147443985e-05, | |
| "loss": 2.6656, | |
| "step": 16480 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 6.559133052825928, | |
| "learning_rate": 7.27207878774059e-05, | |
| "loss": 2.4291, | |
| "step": 16490 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 6.849522590637207, | |
| "learning_rate": 7.260329497991996e-05, | |
| "loss": 2.7398, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 5.400025844573975, | |
| "learning_rate": 7.248584295727688e-05, | |
| "loss": 2.8048, | |
| "step": 16510 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 5.159172058105469, | |
| "learning_rate": 7.236843198471068e-05, | |
| "loss": 2.3586, | |
| "step": 16520 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 7.74296760559082, | |
| "learning_rate": 7.225106223739405e-05, | |
| "loss": 2.7643, | |
| "step": 16530 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 5.079954624176025, | |
| "learning_rate": 7.213373389043822e-05, | |
| "loss": 2.7399, | |
| "step": 16540 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 7.623778343200684, | |
| "learning_rate": 7.201644711889262e-05, | |
| "loss": 2.3221, | |
| "step": 16550 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 3.996065855026245, | |
| "learning_rate": 7.189920209774458e-05, | |
| "loss": 2.2776, | |
| "step": 16560 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 10.919685363769531, | |
| "learning_rate": 7.178199900191932e-05, | |
| "loss": 2.5631, | |
| "step": 16570 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 4.869669437408447, | |
| "learning_rate": 7.166483800627934e-05, | |
| "loss": 2.5653, | |
| "step": 16580 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 3.3495869636535645, | |
| "learning_rate": 7.154771928562443e-05, | |
| "loss": 2.4802, | |
| "step": 16590 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 4.56265926361084, | |
| "learning_rate": 7.14306430146913e-05, | |
| "loss": 2.9435, | |
| "step": 16600 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "eval_loss": 2.779052734375, | |
| "eval_runtime": 1138.9612, | |
| "eval_samples_per_second": 5.005, | |
| "eval_steps_per_second": 5.005, | |
| "step": 16600 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 6.799938201904297, | |
| "learning_rate": 7.131360936815319e-05, | |
| "loss": 2.7358, | |
| "step": 16610 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 4.682605266571045, | |
| "learning_rate": 7.119661852061994e-05, | |
| "loss": 2.6705, | |
| "step": 16620 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 5.452235221862793, | |
| "learning_rate": 7.107967064663741e-05, | |
| "loss": 2.5686, | |
| "step": 16630 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 5.695895195007324, | |
| "learning_rate": 7.096276592068743e-05, | |
| "loss": 2.8169, | |
| "step": 16640 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 5.076992034912109, | |
| "learning_rate": 7.08459045171874e-05, | |
| "loss": 2.4833, | |
| "step": 16650 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 5.666923999786377, | |
| "learning_rate": 7.072908661049005e-05, | |
| "loss": 2.5815, | |
| "step": 16660 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 4.95028829574585, | |
| "learning_rate": 7.061231237488326e-05, | |
| "loss": 2.4393, | |
| "step": 16670 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 5.579570293426514, | |
| "learning_rate": 7.049558198458981e-05, | |
| "loss": 2.7396, | |
| "step": 16680 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 6.172384262084961, | |
| "learning_rate": 7.037889561376696e-05, | |
| "loss": 2.5335, | |
| "step": 16690 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 4.954216480255127, | |
| "learning_rate": 7.026225343650639e-05, | |
| "loss": 2.6123, | |
| "step": 16700 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 6.319690227508545, | |
| "learning_rate": 7.014565562683373e-05, | |
| "loss": 2.6801, | |
| "step": 16710 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 4.945847034454346, | |
| "learning_rate": 7.002910235870851e-05, | |
| "loss": 2.42, | |
| "step": 16720 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 7.983598709106445, | |
| "learning_rate": 6.991259380602379e-05, | |
| "loss": 2.5028, | |
| "step": 16730 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 9.160069465637207, | |
| "learning_rate": 6.979613014260591e-05, | |
| "loss": 2.4809, | |
| "step": 16740 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 5.566466808319092, | |
| "learning_rate": 6.96797115422142e-05, | |
| "loss": 2.3794, | |
| "step": 16750 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 5.244190216064453, | |
| "learning_rate": 6.956333817854079e-05, | |
| "loss": 2.8169, | |
| "step": 16760 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 3.622380256652832, | |
| "learning_rate": 6.944701022521034e-05, | |
| "loss": 2.3658, | |
| "step": 16770 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 5.913341522216797, | |
| "learning_rate": 6.933072785577973e-05, | |
| "loss": 2.7368, | |
| "step": 16780 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 6.090620994567871, | |
| "learning_rate": 6.921449124373787e-05, | |
| "loss": 2.6396, | |
| "step": 16790 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 7.094319820404053, | |
| "learning_rate": 6.909830056250527e-05, | |
| "loss": 2.6005, | |
| "step": 16800 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "eval_loss": 2.7737345695495605, | |
| "eval_runtime": 1137.0285, | |
| "eval_samples_per_second": 5.013, | |
| "eval_steps_per_second": 5.013, | |
| "step": 16800 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 4.8968353271484375, | |
| "learning_rate": 6.900538120419681e-05, | |
| "loss": 2.5549, | |
| "step": 16810 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 5.737145900726318, | |
| "learning_rate": 6.888927363522204e-05, | |
| "loss": 2.6856, | |
| "step": 16820 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 3.957963466644287, | |
| "learning_rate": 6.877321248226894e-05, | |
| "loss": 2.5952, | |
| "step": 16830 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 4.489877223968506, | |
| "learning_rate": 6.865719791849628e-05, | |
| "loss": 2.7842, | |
| "step": 16840 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 4.478295803070068, | |
| "learning_rate": 6.854123011699339e-05, | |
| "loss": 2.8712, | |
| "step": 16850 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 5.02951717376709, | |
| "learning_rate": 6.842530925077986e-05, | |
| "loss": 2.4217, | |
| "step": 16860 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 5.9152631759643555, | |
| "learning_rate": 6.830943549280519e-05, | |
| "loss": 2.743, | |
| "step": 16870 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 4.8398637771606445, | |
| "learning_rate": 6.819360901594866e-05, | |
| "loss": 2.5406, | |
| "step": 16880 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 6.63694429397583, | |
| "learning_rate": 6.807782999301893e-05, | |
| "loss": 2.6179, | |
| "step": 16890 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 6.521999835968018, | |
| "learning_rate": 6.796209859675391e-05, | |
| "loss": 2.596, | |
| "step": 16900 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 4.723524570465088, | |
| "learning_rate": 6.784641499982045e-05, | |
| "loss": 2.5729, | |
| "step": 16910 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 4.5919880867004395, | |
| "learning_rate": 6.773077937481409e-05, | |
| "loss": 2.6229, | |
| "step": 16920 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 5.574059963226318, | |
| "learning_rate": 6.76151918942588e-05, | |
| "loss": 2.7673, | |
| "step": 16930 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 6.148488521575928, | |
| "learning_rate": 6.751120446779786e-05, | |
| "loss": 2.7547, | |
| "step": 16940 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 6.633347988128662, | |
| "learning_rate": 6.73957089367456e-05, | |
| "loss": 2.473, | |
| "step": 16950 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 7.267597198486328, | |
| "learning_rate": 6.728026205005675e-05, | |
| "loss": 2.7067, | |
| "step": 16960 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 7.949811935424805, | |
| "learning_rate": 6.716486397997373e-05, | |
| "loss": 2.6054, | |
| "step": 16970 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 4.672689914703369, | |
| "learning_rate": 6.7049514898666e-05, | |
| "loss": 2.3211, | |
| "step": 16980 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 5.937682628631592, | |
| "learning_rate": 6.693421497823001e-05, | |
| "loss": 2.7239, | |
| "step": 16990 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 7.0608086585998535, | |
| "learning_rate": 6.681896439068893e-05, | |
| "loss": 2.4637, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "eval_loss": 2.7728655338287354, | |
| "eval_runtime": 1091.9813, | |
| "eval_samples_per_second": 5.22, | |
| "eval_steps_per_second": 5.22, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 5.499873638153076, | |
| "learning_rate": 6.670376330799217e-05, | |
| "loss": 2.6289, | |
| "step": 17010 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 4.307833194732666, | |
| "learning_rate": 6.658861190201547e-05, | |
| "loss": 2.392, | |
| "step": 17020 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 5.94236421585083, | |
| "learning_rate": 6.647351034456027e-05, | |
| "loss": 2.5595, | |
| "step": 17030 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 4.513247489929199, | |
| "learning_rate": 6.635845880735373e-05, | |
| "loss": 2.3705, | |
| "step": 17040 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 4.779393672943115, | |
| "learning_rate": 6.624345746204841e-05, | |
| "loss": 2.4923, | |
| "step": 17050 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 4.398991107940674, | |
| "learning_rate": 6.612850648022189e-05, | |
| "loss": 2.4459, | |
| "step": 17060 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 5.860241889953613, | |
| "learning_rate": 6.601360603337677e-05, | |
| "loss": 2.5656, | |
| "step": 17070 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 5.763365268707275, | |
| "learning_rate": 6.589875629294003e-05, | |
| "loss": 2.419, | |
| "step": 17080 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 4.705411434173584, | |
| "learning_rate": 6.578395743026318e-05, | |
| "loss": 2.6694, | |
| "step": 17090 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 8.145054817199707, | |
| "learning_rate": 6.566920961662175e-05, | |
| "loss": 2.5453, | |
| "step": 17100 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 6.116779804229736, | |
| "learning_rate": 6.555451302321515e-05, | |
| "loss": 2.5598, | |
| "step": 17110 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 9.881659507751465, | |
| "learning_rate": 6.543986782116628e-05, | |
| "loss": 2.4526, | |
| "step": 17120 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 5.976058006286621, | |
| "learning_rate": 6.532527418152147e-05, | |
| "loss": 2.5674, | |
| "step": 17130 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 4.460546493530273, | |
| "learning_rate": 6.521073227525003e-05, | |
| "loss": 2.3611, | |
| "step": 17140 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 6.480743885040283, | |
| "learning_rate": 6.50962422732442e-05, | |
| "loss": 2.6928, | |
| "step": 17150 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 5.8814473152160645, | |
| "learning_rate": 6.498180434631868e-05, | |
| "loss": 2.5817, | |
| "step": 17160 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 4.516665935516357, | |
| "learning_rate": 6.486741866521049e-05, | |
| "loss": 2.9759, | |
| "step": 17170 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 5.590062618255615, | |
| "learning_rate": 6.475308540057873e-05, | |
| "loss": 2.3737, | |
| "step": 17180 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 5.345756530761719, | |
| "learning_rate": 6.46388047230043e-05, | |
| "loss": 2.6671, | |
| "step": 17190 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 6.258466720581055, | |
| "learning_rate": 6.45245768029896e-05, | |
| "loss": 2.5461, | |
| "step": 17200 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "eval_loss": 2.767456531524658, | |
| "eval_runtime": 1089.0078, | |
| "eval_samples_per_second": 5.234, | |
| "eval_steps_per_second": 5.234, | |
| "step": 17200 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 6.09370231628418, | |
| "learning_rate": 6.441040181095841e-05, | |
| "loss": 2.6281, | |
| "step": 17210 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 5.456587314605713, | |
| "learning_rate": 6.429627991725541e-05, | |
| "loss": 2.5189, | |
| "step": 17220 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 7.850766658782959, | |
| "learning_rate": 6.418221129214616e-05, | |
| "loss": 2.7745, | |
| "step": 17230 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 7.215473651885986, | |
| "learning_rate": 6.406819610581671e-05, | |
| "loss": 2.4249, | |
| "step": 17240 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 5.151793479919434, | |
| "learning_rate": 6.39542345283734e-05, | |
| "loss": 2.5455, | |
| "step": 17250 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 4.555073261260986, | |
| "learning_rate": 6.384032672984256e-05, | |
| "loss": 2.849, | |
| "step": 17260 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.082034587860107, | |
| "learning_rate": 6.372647288017029e-05, | |
| "loss": 2.7734, | |
| "step": 17270 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.69696569442749, | |
| "learning_rate": 6.36126731492222e-05, | |
| "loss": 2.5211, | |
| "step": 17280 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 4.185813903808594, | |
| "learning_rate": 6.349892770678319e-05, | |
| "loss": 2.601, | |
| "step": 17290 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 4.5403594970703125, | |
| "learning_rate": 6.338523672255716e-05, | |
| "loss": 2.6715, | |
| "step": 17300 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 7.941657066345215, | |
| "learning_rate": 6.327160036616665e-05, | |
| "loss": 2.4868, | |
| "step": 17310 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 4.206854820251465, | |
| "learning_rate": 6.315801880715286e-05, | |
| "loss": 2.4604, | |
| "step": 17320 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.025691032409668, | |
| "learning_rate": 6.304449221497515e-05, | |
| "loss": 2.2965, | |
| "step": 17330 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 4.888176918029785, | |
| "learning_rate": 6.293102075901087e-05, | |
| "loss": 2.5464, | |
| "step": 17340 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.918951988220215, | |
| "learning_rate": 6.281760460855515e-05, | |
| "loss": 2.5731, | |
| "step": 17350 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.8334431648254395, | |
| "learning_rate": 6.270424393282052e-05, | |
| "loss": 2.6812, | |
| "step": 17360 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.946429252624512, | |
| "learning_rate": 6.259093890093685e-05, | |
| "loss": 2.4973, | |
| "step": 17370 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 8.533334732055664, | |
| "learning_rate": 6.247768968195089e-05, | |
| "loss": 2.4206, | |
| "step": 17380 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 5.1779656410217285, | |
| "learning_rate": 6.236449644482625e-05, | |
| "loss": 2.6378, | |
| "step": 17390 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 5.802103519439697, | |
| "learning_rate": 6.22513593584429e-05, | |
| "loss": 2.3879, | |
| "step": 17400 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "eval_loss": 2.7677671909332275, | |
| "eval_runtime": 1093.1356, | |
| "eval_samples_per_second": 5.214, | |
| "eval_steps_per_second": 5.214, | |
| "step": 17400 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 4.996272563934326, | |
| "learning_rate": 6.213827859159704e-05, | |
| "loss": 2.467, | |
| "step": 17410 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 7.919410705566406, | |
| "learning_rate": 6.202525431300092e-05, | |
| "loss": 2.4002, | |
| "step": 17420 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 6.724912166595459, | |
| "learning_rate": 6.191228669128243e-05, | |
| "loss": 2.5839, | |
| "step": 17430 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 5.3846821784973145, | |
| "learning_rate": 6.179937589498504e-05, | |
| "loss": 2.5401, | |
| "step": 17440 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 5.267107963562012, | |
| "learning_rate": 6.168652209256733e-05, | |
| "loss": 2.511, | |
| "step": 17450 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 5.296595573425293, | |
| "learning_rate": 6.157372545240284e-05, | |
| "loss": 2.7247, | |
| "step": 17460 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 6.33009147644043, | |
| "learning_rate": 6.146098614277993e-05, | |
| "loss": 2.6327, | |
| "step": 17470 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 4.728981018066406, | |
| "learning_rate": 6.134830433190132e-05, | |
| "loss": 2.412, | |
| "step": 17480 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 5.756034851074219, | |
| "learning_rate": 6.123568018788406e-05, | |
| "loss": 2.6223, | |
| "step": 17490 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 4.870009422302246, | |
| "learning_rate": 6.112311387875905e-05, | |
| "loss": 2.6898, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 6.132648944854736, | |
| "learning_rate": 6.1010605572470906e-05, | |
| "loss": 2.7397, | |
| "step": 17510 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 4.839498996734619, | |
| "learning_rate": 6.089815543687778e-05, | |
| "loss": 2.585, | |
| "step": 17520 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 4.22407865524292, | |
| "learning_rate": 6.0785763639751045e-05, | |
| "loss": 2.4158, | |
| "step": 17530 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 4.960424900054932, | |
| "learning_rate": 6.0673430348774974e-05, | |
| "loss": 2.4941, | |
| "step": 17540 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 4.620213031768799, | |
| "learning_rate": 6.0561155731546506e-05, | |
| "loss": 2.6422, | |
| "step": 17550 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 4.822215557098389, | |
| "learning_rate": 6.0448939955575154e-05, | |
| "loss": 2.7949, | |
| "step": 17560 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 7.760210990905762, | |
| "learning_rate": 6.033678318828258e-05, | |
| "loss": 2.5389, | |
| "step": 17570 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 5.080504417419434, | |
| "learning_rate": 6.022468559700244e-05, | |
| "loss": 2.6633, | |
| "step": 17580 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 4.475546360015869, | |
| "learning_rate": 6.011264734898008e-05, | |
| "loss": 2.5215, | |
| "step": 17590 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 4.916598320007324, | |
| "learning_rate": 6.000066861137227e-05, | |
| "loss": 2.5776, | |
| "step": 17600 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "eval_loss": 2.7586658000946045, | |
| "eval_runtime": 1090.7682, | |
| "eval_samples_per_second": 5.226, | |
| "eval_steps_per_second": 5.226, | |
| "step": 17600 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 5.858465194702148, | |
| "learning_rate": 5.988874955124706e-05, | |
| "loss": 2.5892, | |
| "step": 17610 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 6.47125768661499, | |
| "learning_rate": 5.977689033558342e-05, | |
| "loss": 2.626, | |
| "step": 17620 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 6.5208868980407715, | |
| "learning_rate": 5.966509113127108e-05, | |
| "loss": 2.6554, | |
| "step": 17630 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 3.4920830726623535, | |
| "learning_rate": 5.95533521051102e-05, | |
| "loss": 2.3402, | |
| "step": 17640 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 4.840210914611816, | |
| "learning_rate": 5.9441673423811116e-05, | |
| "loss": 2.8223, | |
| "step": 17650 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 5.344911098480225, | |
| "learning_rate": 5.933005525399422e-05, | |
| "loss": 2.6713, | |
| "step": 17660 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 5.766901969909668, | |
| "learning_rate": 5.921849776218956e-05, | |
| "loss": 2.6337, | |
| "step": 17670 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 7.614682674407959, | |
| "learning_rate": 5.910700111483671e-05, | |
| "loss": 2.7618, | |
| "step": 17680 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 4.827087879180908, | |
| "learning_rate": 5.8995565478284396e-05, | |
| "loss": 2.5264, | |
| "step": 17690 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 5.416106700897217, | |
| "learning_rate": 5.8884191018790345e-05, | |
| "loss": 2.578, | |
| "step": 17700 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 6.153903961181641, | |
| "learning_rate": 5.877287790252104e-05, | |
| "loss": 2.7986, | |
| "step": 17710 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 5.478076934814453, | |
| "learning_rate": 5.866162629555141e-05, | |
| "loss": 2.4586, | |
| "step": 17720 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 4.835690975189209, | |
| "learning_rate": 5.855043636386467e-05, | |
| "loss": 2.7115, | |
| "step": 17730 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 5.365401268005371, | |
| "learning_rate": 5.8439308273351915e-05, | |
| "loss": 2.4824, | |
| "step": 17740 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 4.931309700012207, | |
| "learning_rate": 5.832824218981206e-05, | |
| "loss": 2.8054, | |
| "step": 17750 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 5.70919942855835, | |
| "learning_rate": 5.821723827895145e-05, | |
| "loss": 2.4396, | |
| "step": 17760 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 4.619261741638184, | |
| "learning_rate": 5.810629670638372e-05, | |
| "loss": 2.6127, | |
| "step": 17770 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 7.530084133148193, | |
| "learning_rate": 5.7995417637629533e-05, | |
| "loss": 2.3805, | |
| "step": 17780 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 7.491077899932861, | |
| "learning_rate": 5.788460123811617e-05, | |
| "loss": 2.5465, | |
| "step": 17790 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 5.97875452041626, | |
| "learning_rate": 5.777384767317755e-05, | |
| "loss": 2.9236, | |
| "step": 17800 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "eval_loss": 2.7564563751220703, | |
| "eval_runtime": 1093.0048, | |
| "eval_samples_per_second": 5.215, | |
| "eval_steps_per_second": 5.215, | |
| "step": 17800 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 4.824826717376709, | |
| "learning_rate": 5.7663157108053726e-05, | |
| "loss": 2.7555, | |
| "step": 17810 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 7.008066654205322, | |
| "learning_rate": 5.7552529707890846e-05, | |
| "loss": 2.7833, | |
| "step": 17820 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 7.4979119300842285, | |
| "learning_rate": 5.744196563774081e-05, | |
| "loss": 2.7585, | |
| "step": 17830 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 10.446072578430176, | |
| "learning_rate": 5.7331465062560955e-05, | |
| "loss": 2.4665, | |
| "step": 17840 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 7.174097537994385, | |
| "learning_rate": 5.722102814721397e-05, | |
| "loss": 2.7389, | |
| "step": 17850 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 4.553163528442383, | |
| "learning_rate": 5.711065505646758e-05, | |
| "loss": 2.3752, | |
| "step": 17860 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 7.095092296600342, | |
| "learning_rate": 5.7000345954994195e-05, | |
| "loss": 2.6126, | |
| "step": 17870 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 4.0461225509643555, | |
| "learning_rate": 5.6890101007370774e-05, | |
| "loss": 2.6694, | |
| "step": 17880 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 4.112511157989502, | |
| "learning_rate": 5.677992037807862e-05, | |
| "loss": 2.5869, | |
| "step": 17890 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 4.1515936851501465, | |
| "learning_rate": 5.6669804231503044e-05, | |
| "loss": 2.605, | |
| "step": 17900 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 5.27680778503418, | |
| "learning_rate": 5.65597527319332e-05, | |
| "loss": 2.6241, | |
| "step": 17910 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 5.956172943115234, | |
| "learning_rate": 5.64497660435617e-05, | |
| "loss": 2.5378, | |
| "step": 17920 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 4.933371543884277, | |
| "learning_rate": 5.633984433048447e-05, | |
| "loss": 2.5712, | |
| "step": 17930 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 4.546905040740967, | |
| "learning_rate": 5.622998775670056e-05, | |
| "loss": 2.5774, | |
| "step": 17940 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 6.605489730834961, | |
| "learning_rate": 5.612019648611182e-05, | |
| "loss": 2.5219, | |
| "step": 17950 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 4.056662559509277, | |
| "learning_rate": 5.6010470682522676e-05, | |
| "loss": 2.5671, | |
| "step": 17960 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 5.21044397354126, | |
| "learning_rate": 5.590081050963982e-05, | |
| "loss": 2.2072, | |
| "step": 17970 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 4.24269437789917, | |
| "learning_rate": 5.579121613107203e-05, | |
| "loss": 2.529, | |
| "step": 17980 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 8.877058982849121, | |
| "learning_rate": 5.568168771033e-05, | |
| "loss": 2.728, | |
| "step": 17990 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 5.2844719886779785, | |
| "learning_rate": 5.557222541082595e-05, | |
| "loss": 2.5198, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "eval_loss": 2.754932403564453, | |
| "eval_runtime": 1090.3866, | |
| "eval_samples_per_second": 5.228, | |
| "eval_steps_per_second": 5.228, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 5.77738618850708, | |
| "learning_rate": 5.546282939587354e-05, | |
| "loss": 2.4213, | |
| "step": 18010 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 8.9447660446167, | |
| "learning_rate": 5.535349982868741e-05, | |
| "loss": 2.6623, | |
| "step": 18020 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 4.4816203117370605, | |
| "learning_rate": 5.524423687238307e-05, | |
| "loss": 2.6124, | |
| "step": 18030 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 6.370791912078857, | |
| "learning_rate": 5.513504068997677e-05, | |
| "loss": 2.705, | |
| "step": 18040 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 7.344057083129883, | |
| "learning_rate": 5.502591144438505e-05, | |
| "loss": 2.5722, | |
| "step": 18050 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 3.716496706008911, | |
| "learning_rate": 5.4916849298424625e-05, | |
| "loss": 2.6213, | |
| "step": 18060 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 4.81427001953125, | |
| "learning_rate": 5.4807854414812046e-05, | |
| "loss": 2.5988, | |
| "step": 18070 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 4.7489824295043945, | |
| "learning_rate": 5.46989269561635e-05, | |
| "loss": 2.578, | |
| "step": 18080 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 4.938182353973389, | |
| "learning_rate": 5.4590067084994634e-05, | |
| "loss": 2.3349, | |
| "step": 18090 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 5.349028587341309, | |
| "learning_rate": 5.4481274963720286e-05, | |
| "loss": 2.4367, | |
| "step": 18100 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 3.091707468032837, | |
| "learning_rate": 5.437255075465415e-05, | |
| "loss": 2.5173, | |
| "step": 18110 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 3.6265087127685547, | |
| "learning_rate": 5.4263894620008626e-05, | |
| "loss": 2.5161, | |
| "step": 18120 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 4.735933780670166, | |
| "learning_rate": 5.4155306721894464e-05, | |
| "loss": 2.6293, | |
| "step": 18130 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 9.483357429504395, | |
| "learning_rate": 5.404678722232075e-05, | |
| "loss": 2.3463, | |
| "step": 18140 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 2.9575343132019043, | |
| "learning_rate": 5.3938336283194424e-05, | |
| "loss": 2.522, | |
| "step": 18150 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 5.901381969451904, | |
| "learning_rate": 5.382995406632021e-05, | |
| "loss": 2.6077, | |
| "step": 18160 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 5.906281471252441, | |
| "learning_rate": 5.3721640733400205e-05, | |
| "loss": 2.6513, | |
| "step": 18170 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 6.043822288513184, | |
| "learning_rate": 5.361339644603385e-05, | |
| "loss": 2.707, | |
| "step": 18180 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 7.317911148071289, | |
| "learning_rate": 5.350522136571742e-05, | |
| "loss": 2.7309, | |
| "step": 18190 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 3.808610439300537, | |
| "learning_rate": 5.339711565384408e-05, | |
| "loss": 2.7111, | |
| "step": 18200 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "eval_loss": 2.749652624130249, | |
| "eval_runtime": 1093.3945, | |
| "eval_samples_per_second": 5.213, | |
| "eval_steps_per_second": 5.213, | |
| "step": 18200 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 6.145906925201416, | |
| "learning_rate": 5.328907947170346e-05, | |
| "loss": 2.5983, | |
| "step": 18210 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 6.049194812774658, | |
| "learning_rate": 5.3181112980481386e-05, | |
| "loss": 3.05, | |
| "step": 18220 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 8.137819290161133, | |
| "learning_rate": 5.307321634125983e-05, | |
| "loss": 2.5698, | |
| "step": 18230 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 5.600856781005859, | |
| "learning_rate": 5.2965389715016414e-05, | |
| "loss": 2.4588, | |
| "step": 18240 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 4.875741481781006, | |
| "learning_rate": 5.2857633262624365e-05, | |
| "loss": 2.7632, | |
| "step": 18250 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 6.16823673248291, | |
| "learning_rate": 5.274994714485229e-05, | |
| "loss": 2.6179, | |
| "step": 18260 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 6.03982400894165, | |
| "learning_rate": 5.264233152236371e-05, | |
| "loss": 2.676, | |
| "step": 18270 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 6.995283603668213, | |
| "learning_rate": 5.2534786555717106e-05, | |
| "loss": 2.6739, | |
| "step": 18280 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 5.1484270095825195, | |
| "learning_rate": 5.24273124053654e-05, | |
| "loss": 2.5794, | |
| "step": 18290 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 4.117734432220459, | |
| "learning_rate": 5.231990923165604e-05, | |
| "loss": 2.5715, | |
| "step": 18300 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 4.1332268714904785, | |
| "learning_rate": 5.221257719483037e-05, | |
| "loss": 2.5544, | |
| "step": 18310 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 5.754079341888428, | |
| "learning_rate": 5.210531645502379e-05, | |
| "loss": 2.5192, | |
| "step": 18320 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 4.778247833251953, | |
| "learning_rate": 5.199812717226525e-05, | |
| "loss": 2.4673, | |
| "step": 18330 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 4.264052391052246, | |
| "learning_rate": 5.189100950647703e-05, | |
| "loss": 2.7163, | |
| "step": 18340 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 6.049769401550293, | |
| "learning_rate": 5.178396361747471e-05, | |
| "loss": 2.4899, | |
| "step": 18350 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 4.8760762214660645, | |
| "learning_rate": 5.1676989664966566e-05, | |
| "loss": 2.6234, | |
| "step": 18360 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 4.067619323730469, | |
| "learning_rate": 5.1570087808553745e-05, | |
| "loss": 2.6173, | |
| "step": 18370 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 5.356283187866211, | |
| "learning_rate": 5.146325820772979e-05, | |
| "loss": 2.5618, | |
| "step": 18380 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 5.027037143707275, | |
| "learning_rate": 5.135650102188032e-05, | |
| "loss": 2.3784, | |
| "step": 18390 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 7.661667823791504, | |
| "learning_rate": 5.124981641028307e-05, | |
| "loss": 2.4899, | |
| "step": 18400 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "eval_loss": 2.7469968795776367, | |
| "eval_runtime": 1090.5801, | |
| "eval_samples_per_second": 5.227, | |
| "eval_steps_per_second": 5.227, | |
| "step": 18400 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 5.477719306945801, | |
| "learning_rate": 5.114320453210737e-05, | |
| "loss": 2.6192, | |
| "step": 18410 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 4.8712077140808105, | |
| "learning_rate": 5.1036665546414107e-05, | |
| "loss": 2.6542, | |
| "step": 18420 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 4.96636438369751, | |
| "learning_rate": 5.0930199612155474e-05, | |
| "loss": 2.7382, | |
| "step": 18430 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 5.233584880828857, | |
| "learning_rate": 5.082380688817447e-05, | |
| "loss": 2.812, | |
| "step": 18440 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 6.871877193450928, | |
| "learning_rate": 5.0717487533205134e-05, | |
| "loss": 2.5341, | |
| "step": 18450 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 8.461257934570312, | |
| "learning_rate": 5.061124170587177e-05, | |
| "loss": 2.4915, | |
| "step": 18460 | |
| }, | |
| { | |
| "epoch": 1.36, | |
| "grad_norm": 7.310083866119385, | |
| "learning_rate": 5.05050695646892e-05, | |
| "loss": 2.6074, | |
| "step": 18470 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 4.759759426116943, | |
| "learning_rate": 5.039897126806219e-05, | |
| "loss": 2.7039, | |
| "step": 18480 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 6.0547661781311035, | |
| "learning_rate": 5.029294697428546e-05, | |
| "loss": 2.512, | |
| "step": 18490 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 7.052810192108154, | |
| "learning_rate": 5.018699684154309e-05, | |
| "loss": 2.5677, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 5.241086959838867, | |
| "learning_rate": 5.0081121027908694e-05, | |
| "loss": 2.5115, | |
| "step": 18510 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 6.727292537689209, | |
| "learning_rate": 4.997531969134498e-05, | |
| "loss": 2.563, | |
| "step": 18520 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 4.072869777679443, | |
| "learning_rate": 4.986959298970352e-05, | |
| "loss": 2.3717, | |
| "step": 18530 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 5.985363006591797, | |
| "learning_rate": 4.976394108072458e-05, | |
| "loss": 2.6702, | |
| "step": 18540 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 8.397250175476074, | |
| "learning_rate": 4.965836412203676e-05, | |
| "loss": 2.3954, | |
| "step": 18550 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 6.862022876739502, | |
| "learning_rate": 4.9552862271156816e-05, | |
| "loss": 2.8558, | |
| "step": 18560 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 6.360130310058594, | |
| "learning_rate": 4.9447435685489554e-05, | |
| "loss": 2.6074, | |
| "step": 18570 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 7.378839492797852, | |
| "learning_rate": 4.934208452232743e-05, | |
| "loss": 2.566, | |
| "step": 18580 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 5.3151445388793945, | |
| "learning_rate": 4.92368089388504e-05, | |
| "loss": 2.6158, | |
| "step": 18590 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 5.593037128448486, | |
| "learning_rate": 4.913160909212561e-05, | |
| "loss": 2.4031, | |
| "step": 18600 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "eval_loss": 2.7402687072753906, | |
| "eval_runtime": 1093.0065, | |
| "eval_samples_per_second": 5.215, | |
| "eval_steps_per_second": 5.215, | |
| "step": 18600 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 5.234645843505859, | |
| "learning_rate": 4.9026485139107206e-05, | |
| "loss": 2.4703, | |
| "step": 18610 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 4.557468414306641, | |
| "learning_rate": 4.892143723663615e-05, | |
| "loss": 2.6366, | |
| "step": 18620 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 5.67350435256958, | |
| "learning_rate": 4.8816465541439926e-05, | |
| "loss": 2.5127, | |
| "step": 18630 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 4.1222357749938965, | |
| "learning_rate": 4.8711570210132355e-05, | |
| "loss": 2.7097, | |
| "step": 18640 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 8.09947681427002, | |
| "learning_rate": 4.860675139921326e-05, | |
| "loss": 2.5276, | |
| "step": 18650 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 5.646274566650391, | |
| "learning_rate": 4.850200926506826e-05, | |
| "loss": 2.5764, | |
| "step": 18660 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 5.521486759185791, | |
| "learning_rate": 4.83973439639687e-05, | |
| "loss": 2.6867, | |
| "step": 18670 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 7.946648120880127, | |
| "learning_rate": 4.829275565207126e-05, | |
| "loss": 2.6472, | |
| "step": 18680 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 5.645473480224609, | |
| "learning_rate": 4.8188244485417656e-05, | |
| "loss": 2.8183, | |
| "step": 18690 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 4.875026226043701, | |
| "learning_rate": 4.8083810619934655e-05, | |
| "loss": 2.6745, | |
| "step": 18700 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 6.1913838386535645, | |
| "learning_rate": 4.797945421143353e-05, | |
| "loss": 2.5512, | |
| "step": 18710 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 4.89860725402832, | |
| "learning_rate": 4.7875175415610116e-05, | |
| "loss": 2.6048, | |
| "step": 18720 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 6.097682476043701, | |
| "learning_rate": 4.7770974388044465e-05, | |
| "loss": 2.4741, | |
| "step": 18730 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 11.050512313842773, | |
| "learning_rate": 4.7666851284200474e-05, | |
| "loss": 2.9075, | |
| "step": 18740 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 3.9821629524230957, | |
| "learning_rate": 4.756280625942592e-05, | |
| "loss": 2.4667, | |
| "step": 18750 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 5.043511390686035, | |
| "learning_rate": 4.745883946895195e-05, | |
| "loss": 2.622, | |
| "step": 18760 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 5.638186931610107, | |
| "learning_rate": 4.735495106789313e-05, | |
| "loss": 2.5786, | |
| "step": 18770 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 4.257643699645996, | |
| "learning_rate": 4.7251141211247006e-05, | |
| "loss": 2.6245, | |
| "step": 18780 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 4.530847549438477, | |
| "learning_rate": 4.714741005389389e-05, | |
| "loss": 2.6005, | |
| "step": 18790 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 6.788181781768799, | |
| "learning_rate": 4.704375775059676e-05, | |
| "loss": 2.5644, | |
| "step": 18800 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "eval_loss": 2.730058193206787, | |
| "eval_runtime": 1092.4553, | |
| "eval_samples_per_second": 5.218, | |
| "eval_steps_per_second": 5.218, | |
| "step": 18800 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 6.159169673919678, | |
| "learning_rate": 4.694018445600096e-05, | |
| "loss": 2.6734, | |
| "step": 18810 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 4.513409614562988, | |
| "learning_rate": 4.683669032463381e-05, | |
| "loss": 2.3646, | |
| "step": 18820 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 4.685541152954102, | |
| "learning_rate": 4.673327551090473e-05, | |
| "loss": 2.7987, | |
| "step": 18830 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 6.203521251678467, | |
| "learning_rate": 4.662994016910458e-05, | |
| "loss": 3.0138, | |
| "step": 18840 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 7.593812465667725, | |
| "learning_rate": 4.652668445340583e-05, | |
| "loss": 2.5891, | |
| "step": 18850 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 7.254190921783447, | |
| "learning_rate": 4.642350851786212e-05, | |
| "loss": 2.6145, | |
| "step": 18860 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 5.389431953430176, | |
| "learning_rate": 4.632041251640794e-05, | |
| "loss": 2.5423, | |
| "step": 18870 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 4.145481109619141, | |
| "learning_rate": 4.6217396602858676e-05, | |
| "loss": 2.3867, | |
| "step": 18880 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 3.993748426437378, | |
| "learning_rate": 4.61144609309101e-05, | |
| "loss": 2.5064, | |
| "step": 18890 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 3.0699574947357178, | |
| "learning_rate": 4.601160565413834e-05, | |
| "loss": 2.6125, | |
| "step": 18900 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 4.14170503616333, | |
| "learning_rate": 4.5908830925999625e-05, | |
| "loss": 2.3033, | |
| "step": 18910 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 5.7811689376831055, | |
| "learning_rate": 4.580613689982989e-05, | |
| "loss": 2.5909, | |
| "step": 18920 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 4.923642158508301, | |
| "learning_rate": 4.5703523728844675e-05, | |
| "loss": 2.7412, | |
| "step": 18930 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 5.698610782623291, | |
| "learning_rate": 4.560099156613898e-05, | |
| "loss": 2.553, | |
| "step": 18940 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 7.011173248291016, | |
| "learning_rate": 4.549854056468691e-05, | |
| "loss": 2.6452, | |
| "step": 18950 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 4.988110542297363, | |
| "learning_rate": 4.539617087734148e-05, | |
| "loss": 2.5394, | |
| "step": 18960 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 7.155890941619873, | |
| "learning_rate": 4.529388265683434e-05, | |
| "loss": 2.4347, | |
| "step": 18970 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 5.443312644958496, | |
| "learning_rate": 4.51916760557756e-05, | |
| "loss": 2.6015, | |
| "step": 18980 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 4.91843318939209, | |
| "learning_rate": 4.508955122665366e-05, | |
| "loss": 2.5659, | |
| "step": 18990 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 4.711748123168945, | |
| "learning_rate": 4.498750832183488e-05, | |
| "loss": 2.4967, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "eval_loss": 2.7299466133117676, | |
| "eval_runtime": 1091.1855, | |
| "eval_samples_per_second": 5.224, | |
| "eval_steps_per_second": 5.224, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 7.943491458892822, | |
| "learning_rate": 4.488554749356344e-05, | |
| "loss": 2.3547, | |
| "step": 19010 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 3.8169167041778564, | |
| "learning_rate": 4.478366889396099e-05, | |
| "loss": 2.7277, | |
| "step": 19020 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 6.11760950088501, | |
| "learning_rate": 4.468187267502647e-05, | |
| "loss": 2.7133, | |
| "step": 19030 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 6.223377227783203, | |
| "learning_rate": 4.4580158988636035e-05, | |
| "loss": 2.5129, | |
| "step": 19040 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 4.303272724151611, | |
| "learning_rate": 4.447852798654262e-05, | |
| "loss": 2.3198, | |
| "step": 19050 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 8.338922500610352, | |
| "learning_rate": 4.4376979820375866e-05, | |
| "loss": 2.4968, | |
| "step": 19060 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 10.990848541259766, | |
| "learning_rate": 4.427551464164173e-05, | |
| "loss": 2.785, | |
| "step": 19070 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 6.105620861053467, | |
| "learning_rate": 4.4184267060155825e-05, | |
| "loss": 2.5712, | |
| "step": 19080 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 4.769411087036133, | |
| "learning_rate": 4.408295997449907e-05, | |
| "loss": 2.5135, | |
| "step": 19090 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 5.428181171417236, | |
| "learning_rate": 4.398173631494139e-05, | |
| "loss": 2.6994, | |
| "step": 19100 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 3.8140740394592285, | |
| "learning_rate": 4.388059623250466e-05, | |
| "loss": 2.7718, | |
| "step": 19110 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 4.616511821746826, | |
| "learning_rate": 4.3779539878085964e-05, | |
| "loss": 2.5677, | |
| "step": 19120 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 5.239737033843994, | |
| "learning_rate": 4.367856740245764e-05, | |
| "loss": 2.7527, | |
| "step": 19130 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 5.1812286376953125, | |
| "learning_rate": 4.3577678956266676e-05, | |
| "loss": 2.586, | |
| "step": 19140 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 4.772936820983887, | |
| "learning_rate": 4.3476874690034875e-05, | |
| "loss": 2.4089, | |
| "step": 19150 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 9.186141014099121, | |
| "learning_rate": 4.337615475415838e-05, | |
| "loss": 2.5755, | |
| "step": 19160 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 4.864750385284424, | |
| "learning_rate": 4.327551929890745e-05, | |
| "loss": 2.6029, | |
| "step": 19170 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 6.291383266448975, | |
| "learning_rate": 4.317496847442639e-05, | |
| "loss": 2.5028, | |
| "step": 19180 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 4.985967636108398, | |
| "learning_rate": 4.3074502430733256e-05, | |
| "loss": 2.574, | |
| "step": 19190 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 4.993092060089111, | |
| "learning_rate": 4.297412131771952e-05, | |
| "loss": 2.5018, | |
| "step": 19200 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "eval_loss": 2.727829694747925, | |
| "eval_runtime": 1092.1951, | |
| "eval_samples_per_second": 5.219, | |
| "eval_steps_per_second": 5.219, | |
| "step": 19200 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 4.054487228393555, | |
| "learning_rate": 4.287382528514996e-05, | |
| "loss": 2.4302, | |
| "step": 19210 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 12.623319625854492, | |
| "learning_rate": 4.277361448266247e-05, | |
| "loss": 2.575, | |
| "step": 19220 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 5.172916889190674, | |
| "learning_rate": 4.267348905976777e-05, | |
| "loss": 2.7427, | |
| "step": 19230 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 7.442451477050781, | |
| "learning_rate": 4.257344916584922e-05, | |
| "loss": 2.7931, | |
| "step": 19240 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 5.107058525085449, | |
| "learning_rate": 4.247349495016252e-05, | |
| "loss": 2.4842, | |
| "step": 19250 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 7.573449611663818, | |
| "learning_rate": 4.23736265618355e-05, | |
| "loss": 2.8292, | |
| "step": 19260 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 5.7733917236328125, | |
| "learning_rate": 4.227384414986805e-05, | |
| "loss": 2.4985, | |
| "step": 19270 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 4.382335662841797, | |
| "learning_rate": 4.217414786313173e-05, | |
| "loss": 2.4164, | |
| "step": 19280 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 6.469529628753662, | |
| "learning_rate": 4.2074537850369654e-05, | |
| "loss": 2.5815, | |
| "step": 19290 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 3.817382335662842, | |
| "learning_rate": 4.197501426019614e-05, | |
| "loss": 2.3491, | |
| "step": 19300 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 5.766961097717285, | |
| "learning_rate": 4.1875577241096564e-05, | |
| "loss": 2.457, | |
| "step": 19310 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 4.1226019859313965, | |
| "learning_rate": 4.177622694142722e-05, | |
| "loss": 2.443, | |
| "step": 19320 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 4.610818862915039, | |
| "learning_rate": 4.167696350941498e-05, | |
| "loss": 2.6016, | |
| "step": 19330 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 4.487005710601807, | |
| "learning_rate": 4.157778709315715e-05, | |
| "loss": 2.5832, | |
| "step": 19340 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 4.705280303955078, | |
| "learning_rate": 4.147869784062113e-05, | |
| "loss": 2.553, | |
| "step": 19350 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 5.880077838897705, | |
| "learning_rate": 4.137969589964429e-05, | |
| "loss": 2.4362, | |
| "step": 19360 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 3.722841262817383, | |
| "learning_rate": 4.12807814179338e-05, | |
| "loss": 2.5962, | |
| "step": 19370 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 5.202775955200195, | |
| "learning_rate": 4.118195454306631e-05, | |
| "loss": 2.4903, | |
| "step": 19380 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 4.760529518127441, | |
| "learning_rate": 4.108321542248781e-05, | |
| "loss": 2.3325, | |
| "step": 19390 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 6.372382164001465, | |
| "learning_rate": 4.098456420351324e-05, | |
| "loss": 2.6689, | |
| "step": 19400 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "eval_loss": 2.723548412322998, | |
| "eval_runtime": 1094.6965, | |
| "eval_samples_per_second": 5.207, | |
| "eval_steps_per_second": 5.207, | |
| "step": 19400 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 5.136544704437256, | |
| "learning_rate": 4.088600103332648e-05, | |
| "loss": 2.8788, | |
| "step": 19410 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 5.261312961578369, | |
| "learning_rate": 4.078752605898005e-05, | |
| "loss": 2.5705, | |
| "step": 19420 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 5.200085163116455, | |
| "learning_rate": 4.0689139427394864e-05, | |
| "loss": 2.6097, | |
| "step": 19430 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 4.0969977378845215, | |
| "learning_rate": 4.0590841285360084e-05, | |
| "loss": 2.3152, | |
| "step": 19440 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 4.328812599182129, | |
| "learning_rate": 4.049263177953277e-05, | |
| "loss": 2.598, | |
| "step": 19450 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 5.58969259262085, | |
| "learning_rate": 4.039451105643772e-05, | |
| "loss": 2.4586, | |
| "step": 19460 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 8.861074447631836, | |
| "learning_rate": 4.029647926246739e-05, | |
| "loss": 2.4843, | |
| "step": 19470 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 5.041561126708984, | |
| "learning_rate": 4.019853654388146e-05, | |
| "loss": 2.4352, | |
| "step": 19480 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 5.229025840759277, | |
| "learning_rate": 4.01006830468068e-05, | |
| "loss": 2.9516, | |
| "step": 19490 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 6.096444129943848, | |
| "learning_rate": 4.000291891723706e-05, | |
| "loss": 2.6971, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 3.951528549194336, | |
| "learning_rate": 3.9905244301032595e-05, | |
| "loss": 2.5596, | |
| "step": 19510 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 7.2364325523376465, | |
| "learning_rate": 3.9807659343920235e-05, | |
| "loss": 2.5888, | |
| "step": 19520 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 6.946869373321533, | |
| "learning_rate": 3.971016419149303e-05, | |
| "loss": 2.5522, | |
| "step": 19530 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 7.022960662841797, | |
| "learning_rate": 3.9612758989210083e-05, | |
| "loss": 2.6643, | |
| "step": 19540 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 4.149036884307861, | |
| "learning_rate": 3.951544388239619e-05, | |
| "loss": 2.4732, | |
| "step": 19550 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 7.235793113708496, | |
| "learning_rate": 3.941821901624185e-05, | |
| "loss": 2.5966, | |
| "step": 19560 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 5.136077404022217, | |
| "learning_rate": 3.932108453580281e-05, | |
| "loss": 2.6064, | |
| "step": 19570 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 5.46553373336792, | |
| "learning_rate": 3.9224040586000045e-05, | |
| "loss": 2.6474, | |
| "step": 19580 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 4.688199043273926, | |
| "learning_rate": 3.9127087311619496e-05, | |
| "loss": 2.5544, | |
| "step": 19590 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 6.985490322113037, | |
| "learning_rate": 3.903022485731168e-05, | |
| "loss": 2.6272, | |
| "step": 19600 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "eval_loss": 2.7148196697235107, | |
| "eval_runtime": 1096.5876, | |
| "eval_samples_per_second": 5.198, | |
| "eval_steps_per_second": 5.198, | |
| "step": 19600 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 5.419033050537109, | |
| "learning_rate": 3.8933453367591774e-05, | |
| "loss": 2.3508, | |
| "step": 19610 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 4.328287601470947, | |
| "learning_rate": 3.883677298683909e-05, | |
| "loss": 2.4653, | |
| "step": 19620 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 6.014868259429932, | |
| "learning_rate": 3.874018385929715e-05, | |
| "loss": 2.6006, | |
| "step": 19630 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 4.715216159820557, | |
| "learning_rate": 3.864368612907321e-05, | |
| "loss": 2.8378, | |
| "step": 19640 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 5.374291896820068, | |
| "learning_rate": 3.8547279940138225e-05, | |
| "loss": 2.834, | |
| "step": 19650 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 4.934390068054199, | |
| "learning_rate": 3.8450965436326626e-05, | |
| "loss": 2.5945, | |
| "step": 19660 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 5.506863594055176, | |
| "learning_rate": 3.83547427613359e-05, | |
| "loss": 2.5895, | |
| "step": 19670 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 4.630877494812012, | |
| "learning_rate": 3.825861205872672e-05, | |
| "loss": 2.6303, | |
| "step": 19680 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 4.430076599121094, | |
| "learning_rate": 3.816257347192234e-05, | |
| "loss": 2.3571, | |
| "step": 19690 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.289999008178711, | |
| "learning_rate": 3.8066627144208734e-05, | |
| "loss": 2.4513, | |
| "step": 19700 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.023924350738525, | |
| "learning_rate": 3.7970773218734216e-05, | |
| "loss": 2.4787, | |
| "step": 19710 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.857785701751709, | |
| "learning_rate": 3.787501183850912e-05, | |
| "loss": 2.4347, | |
| "step": 19720 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.032500267028809, | |
| "learning_rate": 3.777934314640587e-05, | |
| "loss": 2.5699, | |
| "step": 19730 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 6.004321575164795, | |
| "learning_rate": 3.768376728515844e-05, | |
| "loss": 2.6813, | |
| "step": 19740 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.519407749176025, | |
| "learning_rate": 3.758828439736242e-05, | |
| "loss": 2.4588, | |
| "step": 19750 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.536065578460693, | |
| "learning_rate": 3.749289462547469e-05, | |
| "loss": 2.5396, | |
| "step": 19760 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 6.415857315063477, | |
| "learning_rate": 3.739759811181308e-05, | |
| "loss": 2.5567, | |
| "step": 19770 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 5.36800479888916, | |
| "learning_rate": 3.7302394998556456e-05, | |
| "loss": 2.5154, | |
| "step": 19780 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 3.876528024673462, | |
| "learning_rate": 3.720728542774417e-05, | |
| "loss": 2.4376, | |
| "step": 19790 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 7.150769233703613, | |
| "learning_rate": 3.711226954127611e-05, | |
| "loss": 2.5285, | |
| "step": 19800 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "eval_loss": 2.7195167541503906, | |
| "eval_runtime": 1090.5668, | |
| "eval_samples_per_second": 5.227, | |
| "eval_steps_per_second": 5.227, | |
| "step": 19800 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 6.845495700836182, | |
| "learning_rate": 3.7017347480912426e-05, | |
| "loss": 2.5522, | |
| "step": 19810 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 4.888938903808594, | |
| "learning_rate": 3.692251938827317e-05, | |
| "loss": 2.6649, | |
| "step": 19820 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 6.482171535491943, | |
| "learning_rate": 3.6827785404838224e-05, | |
| "loss": 2.539, | |
| "step": 19830 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 6.012960433959961, | |
| "learning_rate": 3.6733145671947136e-05, | |
| "loss": 2.465, | |
| "step": 19840 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 5.3928656578063965, | |
| "learning_rate": 3.663860033079879e-05, | |
| "loss": 2.4433, | |
| "step": 19850 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 7.735469818115234, | |
| "learning_rate": 3.654414952245123e-05, | |
| "loss": 2.6487, | |
| "step": 19860 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 4.888444900512695, | |
| "learning_rate": 3.644979338782152e-05, | |
| "loss": 2.4914, | |
| "step": 19870 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 6.5980424880981445, | |
| "learning_rate": 3.635553206768538e-05, | |
| "loss": 2.5173, | |
| "step": 19880 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 5.8707475662231445, | |
| "learning_rate": 3.6261365702677095e-05, | |
| "loss": 2.7204, | |
| "step": 19890 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 5.8201093673706055, | |
| "learning_rate": 3.616729443328934e-05, | |
| "loss": 2.409, | |
| "step": 19900 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 7.474509239196777, | |
| "learning_rate": 3.607331839987287e-05, | |
| "loss": 2.7956, | |
| "step": 19910 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 3.6222445964813232, | |
| "learning_rate": 3.597943774263639e-05, | |
| "loss": 2.7459, | |
| "step": 19920 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 7.91470193862915, | |
| "learning_rate": 3.588565260164624e-05, | |
| "loss": 2.654, | |
| "step": 19930 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 7.238543510437012, | |
| "learning_rate": 3.5791963116826244e-05, | |
| "loss": 2.909, | |
| "step": 19940 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 2.490121603012085, | |
| "learning_rate": 3.56983694279576e-05, | |
| "loss": 2.634, | |
| "step": 19950 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 7.118973731994629, | |
| "learning_rate": 3.560487167467853e-05, | |
| "loss": 2.5066, | |
| "step": 19960 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 4.224281311035156, | |
| "learning_rate": 3.551146999648417e-05, | |
| "loss": 2.555, | |
| "step": 19970 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 5.849978923797607, | |
| "learning_rate": 3.541816453272623e-05, | |
| "loss": 2.8908, | |
| "step": 19980 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 4.005553245544434, | |
| "learning_rate": 3.532495542261288e-05, | |
| "loss": 2.3425, | |
| "step": 19990 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 5.376830577850342, | |
| "learning_rate": 3.523184280520863e-05, | |
| "loss": 2.5874, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "eval_loss": 2.714773416519165, | |
| "eval_runtime": 1096.8675, | |
| "eval_samples_per_second": 5.197, | |
| "eval_steps_per_second": 5.197, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 7.455637454986572, | |
| "learning_rate": 3.5138826819433965e-05, | |
| "loss": 2.2953, | |
| "step": 20010 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 6.0181965827941895, | |
| "learning_rate": 3.504590760406517e-05, | |
| "loss": 2.642, | |
| "step": 20020 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 7.365159034729004, | |
| "learning_rate": 3.4953085297734224e-05, | |
| "loss": 2.7916, | |
| "step": 20030 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 5.694006443023682, | |
| "learning_rate": 3.486036003892842e-05, | |
| "loss": 2.4513, | |
| "step": 20040 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 4.591248512268066, | |
| "learning_rate": 3.476773196599037e-05, | |
| "loss": 2.4705, | |
| "step": 20050 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 8.414265632629395, | |
| "learning_rate": 3.467520121711765e-05, | |
| "loss": 2.7573, | |
| "step": 20060 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 5.675021171569824, | |
| "learning_rate": 3.458276793036257e-05, | |
| "loss": 2.5484, | |
| "step": 20070 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 4.582470417022705, | |
| "learning_rate": 3.449043224363214e-05, | |
| "loss": 2.5106, | |
| "step": 20080 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 5.4494309425354, | |
| "learning_rate": 3.439819429468764e-05, | |
| "loss": 2.6096, | |
| "step": 20090 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 9.734436988830566, | |
| "learning_rate": 3.430605422114461e-05, | |
| "loss": 2.5521, | |
| "step": 20100 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.490894317626953, | |
| "learning_rate": 3.421401216047256e-05, | |
| "loss": 2.6084, | |
| "step": 20110 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 4.981866359710693, | |
| "learning_rate": 3.412206824999471e-05, | |
| "loss": 2.6881, | |
| "step": 20120 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.633049964904785, | |
| "learning_rate": 3.403022262688793e-05, | |
| "loss": 2.569, | |
| "step": 20130 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.05472469329834, | |
| "learning_rate": 3.3938475428182336e-05, | |
| "loss": 2.4273, | |
| "step": 20140 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 7.141064167022705, | |
| "learning_rate": 3.384682679076129e-05, | |
| "loss": 2.4215, | |
| "step": 20150 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.378678798675537, | |
| "learning_rate": 3.3755276851361116e-05, | |
| "loss": 2.3028, | |
| "step": 20160 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.042534828186035, | |
| "learning_rate": 3.366382574657078e-05, | |
| "loss": 2.6589, | |
| "step": 20170 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 7.929354667663574, | |
| "learning_rate": 3.357247361283189e-05, | |
| "loss": 2.6183, | |
| "step": 20180 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 4.1936140060424805, | |
| "learning_rate": 3.348122058643838e-05, | |
| "loss": 2.4308, | |
| "step": 20190 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.097403049468994, | |
| "learning_rate": 3.339006680353627e-05, | |
| "loss": 2.3012, | |
| "step": 20200 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "eval_loss": 2.7094500064849854, | |
| "eval_runtime": 1096.4703, | |
| "eval_samples_per_second": 5.198, | |
| "eval_steps_per_second": 5.198, | |
| "step": 20200 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 5.574031829833984, | |
| "learning_rate": 3.329901240012352e-05, | |
| "loss": 2.8104, | |
| "step": 20210 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 4.519078254699707, | |
| "learning_rate": 3.320805751204985e-05, | |
| "loss": 2.7359, | |
| "step": 20220 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 6.293169975280762, | |
| "learning_rate": 3.311720227501652e-05, | |
| "loss": 2.6634, | |
| "step": 20230 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 4.480935573577881, | |
| "learning_rate": 3.302644682457612e-05, | |
| "loss": 2.3742, | |
| "step": 20240 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 4.8552446365356445, | |
| "learning_rate": 3.293579129613228e-05, | |
| "loss": 2.708, | |
| "step": 20250 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.601837158203125, | |
| "learning_rate": 3.28452358249396e-05, | |
| "loss": 2.3895, | |
| "step": 20260 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 4.053748607635498, | |
| "learning_rate": 3.275478054610342e-05, | |
| "loss": 2.2767, | |
| "step": 20270 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 4.6459550857543945, | |
| "learning_rate": 3.2664425594579575e-05, | |
| "loss": 2.427, | |
| "step": 20280 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.87542724609375, | |
| "learning_rate": 3.2574171105174256e-05, | |
| "loss": 2.6417, | |
| "step": 20290 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 6.246367931365967, | |
| "learning_rate": 3.24840172125437e-05, | |
| "loss": 2.5537, | |
| "step": 20300 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 4.897169589996338, | |
| "learning_rate": 3.239396405119407e-05, | |
| "loss": 2.7603, | |
| "step": 20310 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.356862545013428, | |
| "learning_rate": 3.230401175548127e-05, | |
| "loss": 2.3876, | |
| "step": 20320 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.569219589233398, | |
| "learning_rate": 3.221416045961072e-05, | |
| "loss": 2.577, | |
| "step": 20330 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.912481307983398, | |
| "learning_rate": 3.2124410297637174e-05, | |
| "loss": 2.5768, | |
| "step": 20340 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.4451494216918945, | |
| "learning_rate": 3.203476140346443e-05, | |
| "loss": 2.689, | |
| "step": 20350 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 3.8255879878997803, | |
| "learning_rate": 3.1945213910845193e-05, | |
| "loss": 2.4786, | |
| "step": 20360 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 5.024571418762207, | |
| "learning_rate": 3.185576795338095e-05, | |
| "loss": 2.3988, | |
| "step": 20370 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 5.674569606781006, | |
| "learning_rate": 3.1766423664521685e-05, | |
| "loss": 2.6459, | |
| "step": 20380 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 5.376116752624512, | |
| "learning_rate": 3.167718117756571e-05, | |
| "loss": 2.5263, | |
| "step": 20390 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 4.720499038696289, | |
| "learning_rate": 3.1588040625659375e-05, | |
| "loss": 2.8163, | |
| "step": 20400 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "eval_loss": 2.702810525894165, | |
| "eval_runtime": 1093.5293, | |
| "eval_samples_per_second": 5.212, | |
| "eval_steps_per_second": 5.212, | |
| "step": 20400 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 4.117152690887451, | |
| "learning_rate": 3.1499002141796985e-05, | |
| "loss": 2.403, | |
| "step": 20410 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 8.465569496154785, | |
| "learning_rate": 3.1410065858820593e-05, | |
| "loss": 2.4733, | |
| "step": 20420 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 5.661840438842773, | |
| "learning_rate": 3.132123190941977e-05, | |
| "loss": 2.4563, | |
| "step": 20430 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 4.873353958129883, | |
| "learning_rate": 3.1232500426131416e-05, | |
| "loss": 2.286, | |
| "step": 20440 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 5.124981880187988, | |
| "learning_rate": 3.11438715413395e-05, | |
| "loss": 2.5421, | |
| "step": 20450 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 5.187690734863281, | |
| "learning_rate": 3.1055345387274906e-05, | |
| "loss": 2.4144, | |
| "step": 20460 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 3.4242801666259766, | |
| "learning_rate": 3.096692209601535e-05, | |
| "loss": 2.6162, | |
| "step": 20470 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 4.927826404571533, | |
| "learning_rate": 3.0878601799485006e-05, | |
| "loss": 2.5308, | |
| "step": 20480 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 7.429085731506348, | |
| "learning_rate": 3.079038462945444e-05, | |
| "loss": 2.4955, | |
| "step": 20490 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 6.658217430114746, | |
| "learning_rate": 3.070227071754024e-05, | |
| "loss": 2.6021, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 4.40215539932251, | |
| "learning_rate": 3.061426019520509e-05, | |
| "loss": 2.547, | |
| "step": 20510 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 4.97898530960083, | |
| "learning_rate": 3.052635319375729e-05, | |
| "loss": 2.8336, | |
| "step": 20520 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 7.03468132019043, | |
| "learning_rate": 3.043854984435076e-05, | |
| "loss": 2.7139, | |
| "step": 20530 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 5.653247833251953, | |
| "learning_rate": 3.03508502779848e-05, | |
| "loss": 2.4009, | |
| "step": 20540 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 8.55075454711914, | |
| "learning_rate": 3.026325462550378e-05, | |
| "loss": 2.4069, | |
| "step": 20550 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 4.287876605987549, | |
| "learning_rate": 3.0175763017597125e-05, | |
| "loss": 2.6115, | |
| "step": 20560 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 5.143221855163574, | |
| "learning_rate": 3.0088375584798933e-05, | |
| "loss": 2.3582, | |
| "step": 20570 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 6.826074123382568, | |
| "learning_rate": 3.0001092457487978e-05, | |
| "loss": 2.6807, | |
| "step": 20580 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 6.902110576629639, | |
| "learning_rate": 2.991391376588739e-05, | |
| "loss": 2.5424, | |
| "step": 20590 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 6.487607955932617, | |
| "learning_rate": 2.9826839640064408e-05, | |
| "loss": 2.3803, | |
| "step": 20600 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "eval_loss": 2.6999261379241943, | |
| "eval_runtime": 1093.9515, | |
| "eval_samples_per_second": 5.21, | |
| "eval_steps_per_second": 5.21, | |
| "step": 20600 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 5.772730350494385, | |
| "learning_rate": 2.9739870209930375e-05, | |
| "loss": 2.5028, | |
| "step": 20610 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 7.393251419067383, | |
| "learning_rate": 2.9653005605240324e-05, | |
| "loss": 2.536, | |
| "step": 20620 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 6.139245510101318, | |
| "learning_rate": 2.9566245955592987e-05, | |
| "loss": 2.4364, | |
| "step": 20630 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 5.206151962280273, | |
| "learning_rate": 2.947959139043043e-05, | |
| "loss": 2.1824, | |
| "step": 20640 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 5.136007308959961, | |
| "learning_rate": 2.9393042039037976e-05, | |
| "loss": 2.4632, | |
| "step": 20650 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 7.334249496459961, | |
| "learning_rate": 2.9306598030544008e-05, | |
| "loss": 2.8071, | |
| "step": 20660 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 5.497274398803711, | |
| "learning_rate": 2.9220259493919657e-05, | |
| "loss": 2.7154, | |
| "step": 20670 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 5.575246334075928, | |
| "learning_rate": 2.9134026557978777e-05, | |
| "loss": 2.5416, | |
| "step": 20680 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 4.933965682983398, | |
| "learning_rate": 2.9047899351377595e-05, | |
| "loss": 2.5452, | |
| "step": 20690 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 6.082450866699219, | |
| "learning_rate": 2.896187800261464e-05, | |
| "loss": 2.5025, | |
| "step": 20700 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 4.525998115539551, | |
| "learning_rate": 2.8875962640030528e-05, | |
| "loss": 2.3187, | |
| "step": 20710 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 4.0856099128723145, | |
| "learning_rate": 2.8790153391807662e-05, | |
| "loss": 2.2128, | |
| "step": 20720 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 5.021278381347656, | |
| "learning_rate": 2.870445038597025e-05, | |
| "loss": 2.5521, | |
| "step": 20730 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 6.382571697235107, | |
| "learning_rate": 2.8618853750383835e-05, | |
| "loss": 2.4939, | |
| "step": 20740 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 10.189557075500488, | |
| "learning_rate": 2.8533363612755393e-05, | |
| "loss": 2.7418, | |
| "step": 20750 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 8.443877220153809, | |
| "learning_rate": 2.8447980100632987e-05, | |
| "loss": 2.7598, | |
| "step": 20760 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 4.629593372344971, | |
| "learning_rate": 2.8362703341405517e-05, | |
| "loss": 2.4299, | |
| "step": 20770 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 4.1399617195129395, | |
| "learning_rate": 2.827753346230273e-05, | |
| "loss": 2.5201, | |
| "step": 20780 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 4.630882263183594, | |
| "learning_rate": 2.819247059039477e-05, | |
| "loss": 2.7113, | |
| "step": 20790 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 5.218183994293213, | |
| "learning_rate": 2.8107514852592255e-05, | |
| "loss": 2.6152, | |
| "step": 20800 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "eval_loss": 2.699847936630249, | |
| "eval_runtime": 1093.3276, | |
| "eval_samples_per_second": 5.213, | |
| "eval_steps_per_second": 5.213, | |
| "step": 20800 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 5.238626956939697, | |
| "learning_rate": 2.802266637564591e-05, | |
| "loss": 2.4939, | |
| "step": 20810 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 6.299570083618164, | |
| "learning_rate": 2.7937925286146484e-05, | |
| "loss": 2.5987, | |
| "step": 20820 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 6.078366756439209, | |
| "learning_rate": 2.785329171052442e-05, | |
| "loss": 2.5886, | |
| "step": 20830 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 4.5963521003723145, | |
| "learning_rate": 2.7768765775049775e-05, | |
| "loss": 2.2237, | |
| "step": 20840 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 7.452169895172119, | |
| "learning_rate": 2.768434760583205e-05, | |
| "loss": 2.3485, | |
| "step": 20850 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 6.703926086425781, | |
| "learning_rate": 2.760003732881995e-05, | |
| "loss": 2.9375, | |
| "step": 20860 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 4.925634860992432, | |
| "learning_rate": 2.7515835069801255e-05, | |
| "loss": 2.5594, | |
| "step": 20870 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 5.643716812133789, | |
| "learning_rate": 2.7431740954402474e-05, | |
| "loss": 2.3271, | |
| "step": 20880 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 5.306772232055664, | |
| "learning_rate": 2.7347755108088824e-05, | |
| "loss": 2.6106, | |
| "step": 20890 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 6.240164279937744, | |
| "learning_rate": 2.7263877656164015e-05, | |
| "loss": 2.3511, | |
| "step": 20900 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 7.3478474617004395, | |
| "learning_rate": 2.7180108723770025e-05, | |
| "loss": 2.602, | |
| "step": 20910 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 7.65614652633667, | |
| "learning_rate": 2.7096448435886944e-05, | |
| "loss": 2.3937, | |
| "step": 20920 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 7.315620422363281, | |
| "learning_rate": 2.701289691733272e-05, | |
| "loss": 2.5605, | |
| "step": 20930 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 4.321962833404541, | |
| "learning_rate": 2.692945429276301e-05, | |
| "loss": 2.5002, | |
| "step": 20940 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 3.468332052230835, | |
| "learning_rate": 2.6846120686671072e-05, | |
| "loss": 2.5641, | |
| "step": 20950 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 6.9545183181762695, | |
| "learning_rate": 2.6762896223387467e-05, | |
| "loss": 2.5489, | |
| "step": 20960 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 4.801777362823486, | |
| "learning_rate": 2.6679781027079975e-05, | |
| "loss": 2.4346, | |
| "step": 20970 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 5.563615322113037, | |
| "learning_rate": 2.6596775221753277e-05, | |
| "loss": 2.7003, | |
| "step": 20980 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 4.222386837005615, | |
| "learning_rate": 2.651387893124885e-05, | |
| "loss": 2.7923, | |
| "step": 20990 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 4.765193939208984, | |
| "learning_rate": 2.643109227924484e-05, | |
| "loss": 2.7056, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "eval_loss": 2.69392466545105, | |
| "eval_runtime": 1095.952, | |
| "eval_samples_per_second": 5.201, | |
| "eval_steps_per_second": 5.201, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 6.603006839752197, | |
| "learning_rate": 2.634841538925582e-05, | |
| "loss": 2.7542, | |
| "step": 21010 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 4.909721851348877, | |
| "learning_rate": 2.6265848384632498e-05, | |
| "loss": 2.5161, | |
| "step": 21020 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 5.59537935256958, | |
| "learning_rate": 2.6183391388561785e-05, | |
| "loss": 2.4003, | |
| "step": 21030 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 4.364444255828857, | |
| "learning_rate": 2.6101044524066308e-05, | |
| "loss": 2.3831, | |
| "step": 21040 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 3.9003069400787354, | |
| "learning_rate": 2.6018807914004496e-05, | |
| "loss": 2.4646, | |
| "step": 21050 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 3.842813491821289, | |
| "learning_rate": 2.5936681681070285e-05, | |
| "loss": 2.5775, | |
| "step": 21060 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 6.952861309051514, | |
| "learning_rate": 2.585466594779282e-05, | |
| "loss": 2.7062, | |
| "step": 21070 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 7.845983028411865, | |
| "learning_rate": 2.5772760836536534e-05, | |
| "loss": 2.4487, | |
| "step": 21080 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 3.9339027404785156, | |
| "learning_rate": 2.5690966469500665e-05, | |
| "loss": 2.5145, | |
| "step": 21090 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 7.971899032592773, | |
| "learning_rate": 2.560928296871934e-05, | |
| "loss": 2.5572, | |
| "step": 21100 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 5.591660976409912, | |
| "learning_rate": 2.5527710456061272e-05, | |
| "loss": 2.5267, | |
| "step": 21110 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 6.092624187469482, | |
| "learning_rate": 2.5446249053229486e-05, | |
| "loss": 2.6155, | |
| "step": 21120 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 6.59454870223999, | |
| "learning_rate": 2.5364898881761325e-05, | |
| "loss": 2.3968, | |
| "step": 21130 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 5.123286247253418, | |
| "learning_rate": 2.5283660063028193e-05, | |
| "loss": 2.8023, | |
| "step": 21140 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 6.058019638061523, | |
| "learning_rate": 2.520253271823525e-05, | |
| "loss": 2.4902, | |
| "step": 21150 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 4.217723369598389, | |
| "learning_rate": 2.5121516968421476e-05, | |
| "loss": 2.4366, | |
| "step": 21160 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 7.757789134979248, | |
| "learning_rate": 2.5040612934459228e-05, | |
| "loss": 2.6324, | |
| "step": 21170 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 4.6392388343811035, | |
| "learning_rate": 2.4959820737054297e-05, | |
| "loss": 2.6145, | |
| "step": 21180 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 4.291707992553711, | |
| "learning_rate": 2.487914049674559e-05, | |
| "loss": 2.5307, | |
| "step": 21190 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 4.865896701812744, | |
| "learning_rate": 2.47985723339049e-05, | |
| "loss": 2.408, | |
| "step": 21200 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "eval_loss": 2.69248366355896, | |
| "eval_runtime": 1095.3132, | |
| "eval_samples_per_second": 5.204, | |
| "eval_steps_per_second": 5.204, | |
| "step": 21200 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 4.253567218780518, | |
| "learning_rate": 2.4718116368736922e-05, | |
| "loss": 2.622, | |
| "step": 21210 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 3.9619877338409424, | |
| "learning_rate": 2.463777272127884e-05, | |
| "loss": 2.472, | |
| "step": 21220 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 6.162944793701172, | |
| "learning_rate": 2.4557541511400352e-05, | |
| "loss": 2.5967, | |
| "step": 21230 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 7.676807880401611, | |
| "learning_rate": 2.4477422858803413e-05, | |
| "loss": 2.5567, | |
| "step": 21240 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 4.426161766052246, | |
| "learning_rate": 2.4397416883021973e-05, | |
| "loss": 2.5195, | |
| "step": 21250 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 4.014848709106445, | |
| "learning_rate": 2.4317523703421884e-05, | |
| "loss": 2.4935, | |
| "step": 21260 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 4.517611503601074, | |
| "learning_rate": 2.4237743439200757e-05, | |
| "loss": 2.7503, | |
| "step": 21270 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 5.451789855957031, | |
| "learning_rate": 2.4158076209387703e-05, | |
| "loss": 2.6794, | |
| "step": 21280 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 5.650362968444824, | |
| "learning_rate": 2.407852213284325e-05, | |
| "loss": 2.6837, | |
| "step": 21290 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 5.634609699249268, | |
| "learning_rate": 2.3999081328259033e-05, | |
| "loss": 2.1458, | |
| "step": 21300 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 7.945886135101318, | |
| "learning_rate": 2.391975391415766e-05, | |
| "loss": 2.588, | |
| "step": 21310 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 5.702952861785889, | |
| "learning_rate": 2.3840540008892676e-05, | |
| "loss": 2.5176, | |
| "step": 21320 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 4.617548942565918, | |
| "learning_rate": 2.3761439730648194e-05, | |
| "loss": 2.5231, | |
| "step": 21330 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 9.549835205078125, | |
| "learning_rate": 2.368245319743887e-05, | |
| "loss": 2.5527, | |
| "step": 21340 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 3.8928442001342773, | |
| "learning_rate": 2.360358052710957e-05, | |
| "loss": 2.52, | |
| "step": 21350 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 7.256139755249023, | |
| "learning_rate": 2.3524821837335297e-05, | |
| "loss": 2.8356, | |
| "step": 21360 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 6.023710250854492, | |
| "learning_rate": 2.344617724562105e-05, | |
| "loss": 2.7982, | |
| "step": 21370 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 7.712351322174072, | |
| "learning_rate": 2.3367646869301574e-05, | |
| "loss": 2.535, | |
| "step": 21380 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 5.238154888153076, | |
| "learning_rate": 2.328923082554123e-05, | |
| "loss": 2.4871, | |
| "step": 21390 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 6.418647289276123, | |
| "learning_rate": 2.3210929231333755e-05, | |
| "loss": 2.4464, | |
| "step": 21400 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "eval_loss": 2.6876254081726074, | |
| "eval_runtime": 1093.9145, | |
| "eval_samples_per_second": 5.211, | |
| "eval_steps_per_second": 5.211, | |
| "step": 21400 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 4.497880458831787, | |
| "learning_rate": 2.3132742203502123e-05, | |
| "loss": 2.7903, | |
| "step": 21410 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 5.7589898109436035, | |
| "learning_rate": 2.305466985869844e-05, | |
| "loss": 2.6637, | |
| "step": 21420 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 5.456647872924805, | |
| "learning_rate": 2.297671231340367e-05, | |
| "loss": 2.5943, | |
| "step": 21430 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 5.261030673980713, | |
| "learning_rate": 2.2898869683927528e-05, | |
| "loss": 2.5029, | |
| "step": 21440 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 4.238167762756348, | |
| "learning_rate": 2.2821142086408222e-05, | |
| "loss": 2.6113, | |
| "step": 21450 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 9.860156059265137, | |
| "learning_rate": 2.274352963681242e-05, | |
| "loss": 2.9236, | |
| "step": 21460 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 5.734950542449951, | |
| "learning_rate": 2.2666032450934903e-05, | |
| "loss": 2.2808, | |
| "step": 21470 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 3.944988250732422, | |
| "learning_rate": 2.2588650644398545e-05, | |
| "loss": 2.5142, | |
| "step": 21480 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 6.458616256713867, | |
| "learning_rate": 2.2511384332654083e-05, | |
| "loss": 2.7614, | |
| "step": 21490 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 9.047236442565918, | |
| "learning_rate": 2.2434233630979884e-05, | |
| "loss": 2.5371, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 12.842032432556152, | |
| "learning_rate": 2.2357198654481892e-05, | |
| "loss": 2.7668, | |
| "step": 21510 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 5.303598880767822, | |
| "learning_rate": 2.2280279518093326e-05, | |
| "loss": 2.6603, | |
| "step": 21520 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 6.416645526885986, | |
| "learning_rate": 2.2203476336574646e-05, | |
| "loss": 2.5208, | |
| "step": 21530 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 4.682002544403076, | |
| "learning_rate": 2.21267892245133e-05, | |
| "loss": 2.7197, | |
| "step": 21540 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 6.208341121673584, | |
| "learning_rate": 2.205021829632349e-05, | |
| "loss": 2.5291, | |
| "step": 21550 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 5.015642166137695, | |
| "learning_rate": 2.1973763666246194e-05, | |
| "loss": 2.5605, | |
| "step": 21560 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 4.047297477722168, | |
| "learning_rate": 2.1897425448348742e-05, | |
| "loss": 2.4668, | |
| "step": 21570 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 6.200460433959961, | |
| "learning_rate": 2.182120375652491e-05, | |
| "loss": 2.5086, | |
| "step": 21580 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 6.616320610046387, | |
| "learning_rate": 2.1745098704494572e-05, | |
| "loss": 2.4152, | |
| "step": 21590 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 5.158884048461914, | |
| "learning_rate": 2.1669110405803517e-05, | |
| "loss": 2.6802, | |
| "step": 21600 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "eval_loss": 2.684189796447754, | |
| "eval_runtime": 1097.2459, | |
| "eval_samples_per_second": 5.195, | |
| "eval_steps_per_second": 5.195, | |
| "step": 21600 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 6.151003837585449, | |
| "learning_rate": 2.1593238973823472e-05, | |
| "loss": 2.5556, | |
| "step": 21610 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 5.922985553741455, | |
| "learning_rate": 2.1517484521751663e-05, | |
| "loss": 2.6471, | |
| "step": 21620 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 3.364727735519409, | |
| "learning_rate": 2.1441847162610916e-05, | |
| "loss": 2.3658, | |
| "step": 21630 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 5.081273078918457, | |
| "learning_rate": 2.1366327009249233e-05, | |
| "loss": 2.5731, | |
| "step": 21640 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 7.894616603851318, | |
| "learning_rate": 2.1290924174339844e-05, | |
| "loss": 2.6044, | |
| "step": 21650 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 4.1407012939453125, | |
| "learning_rate": 2.1215638770380953e-05, | |
| "loss": 2.3113, | |
| "step": 21660 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 7.667937278747559, | |
| "learning_rate": 2.114047090969544e-05, | |
| "loss": 2.615, | |
| "step": 21670 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 5.139069557189941, | |
| "learning_rate": 2.106542070443098e-05, | |
| "loss": 2.7862, | |
| "step": 21680 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 8.500158309936523, | |
| "learning_rate": 2.099048826655957e-05, | |
| "loss": 2.5791, | |
| "step": 21690 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 3.9246647357940674, | |
| "learning_rate": 2.091567370787757e-05, | |
| "loss": 2.627, | |
| "step": 21700 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 4.196277618408203, | |
| "learning_rate": 2.0840977140005503e-05, | |
| "loss": 2.6593, | |
| "step": 21710 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 5.34571647644043, | |
| "learning_rate": 2.0766398674387744e-05, | |
| "loss": 2.6297, | |
| "step": 21720 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 9.215928077697754, | |
| "learning_rate": 2.0691938422292577e-05, | |
| "loss": 2.5687, | |
| "step": 21730 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 7.45725679397583, | |
| "learning_rate": 2.0617596494811843e-05, | |
| "loss": 2.5245, | |
| "step": 21740 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 5.027177810668945, | |
| "learning_rate": 2.0543373002860877e-05, | |
| "loss": 2.611, | |
| "step": 21750 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 5.864018440246582, | |
| "learning_rate": 2.0469268057178315e-05, | |
| "loss": 2.426, | |
| "step": 21760 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 5.623456954956055, | |
| "learning_rate": 2.0395281768325947e-05, | |
| "loss": 2.6679, | |
| "step": 21770 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 8.044170379638672, | |
| "learning_rate": 2.0321414246688476e-05, | |
| "loss": 2.5729, | |
| "step": 21780 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 7.187014102935791, | |
| "learning_rate": 2.024766560247341e-05, | |
| "loss": 2.6013, | |
| "step": 21790 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 4.8793158531188965, | |
| "learning_rate": 2.0174035945710957e-05, | |
| "loss": 2.377, | |
| "step": 21800 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "eval_loss": 2.6814467906951904, | |
| "eval_runtime": 1095.2107, | |
| "eval_samples_per_second": 5.204, | |
| "eval_steps_per_second": 5.204, | |
| "step": 21800 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 8.16999626159668, | |
| "learning_rate": 2.0100525386253766e-05, | |
| "loss": 2.6537, | |
| "step": 21810 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 5.531657695770264, | |
| "learning_rate": 2.0027134033776828e-05, | |
| "loss": 2.7857, | |
| "step": 21820 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 5.026412487030029, | |
| "learning_rate": 1.995386199777721e-05, | |
| "loss": 2.6778, | |
| "step": 21830 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 6.896015167236328, | |
| "learning_rate": 1.988070938757399e-05, | |
| "loss": 2.5839, | |
| "step": 21840 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 7.109387397766113, | |
| "learning_rate": 1.980767631230812e-05, | |
| "loss": 2.8903, | |
| "step": 21850 | |
| }, | |
| { | |
| "epoch": 1.61, | |
| "grad_norm": 6.354283809661865, | |
| "learning_rate": 1.973476288094216e-05, | |
| "loss": 2.3177, | |
| "step": 21860 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 7.274041652679443, | |
| "learning_rate": 1.96619692022602e-05, | |
| "loss": 2.5199, | |
| "step": 21870 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 6.3600664138793945, | |
| "learning_rate": 1.9596557369757285e-05, | |
| "loss": 2.5857, | |
| "step": 21880 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 5.527103424072266, | |
| "learning_rate": 1.9523991520234975e-05, | |
| "loss": 2.7053, | |
| "step": 21890 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 4.095846176147461, | |
| "learning_rate": 1.945154573785949e-05, | |
| "loss": 2.4275, | |
| "step": 21900 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 4.542167663574219, | |
| "learning_rate": 1.93792201307172e-05, | |
| "loss": 2.354, | |
| "step": 21910 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 5.139354705810547, | |
| "learning_rate": 1.9307014806715183e-05, | |
| "loss": 2.3141, | |
| "step": 21920 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 7.073459625244141, | |
| "learning_rate": 1.923492987358101e-05, | |
| "loss": 2.5897, | |
| "step": 21930 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 5.215823650360107, | |
| "learning_rate": 1.916296543886269e-05, | |
| "loss": 2.4426, | |
| "step": 21940 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 4.4041361808776855, | |
| "learning_rate": 1.9091121609928386e-05, | |
| "loss": 2.477, | |
| "step": 21950 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 7.190915584564209, | |
| "learning_rate": 1.901939849396641e-05, | |
| "loss": 2.7217, | |
| "step": 21960 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 5.785027980804443, | |
| "learning_rate": 1.894779619798488e-05, | |
| "loss": 2.3363, | |
| "step": 21970 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 5.730170726776123, | |
| "learning_rate": 1.8876314828811713e-05, | |
| "loss": 2.4102, | |
| "step": 21980 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 6.119355201721191, | |
| "learning_rate": 1.8804954493094428e-05, | |
| "loss": 2.5663, | |
| "step": 21990 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 6.51188325881958, | |
| "learning_rate": 1.8733715297299892e-05, | |
| "loss": 2.5035, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "eval_loss": 2.6791791915893555, | |
| "eval_runtime": 1093.3935, | |
| "eval_samples_per_second": 5.213, | |
| "eval_steps_per_second": 5.213, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 5.506747722625732, | |
| "learning_rate": 1.8662597347714318e-05, | |
| "loss": 2.6332, | |
| "step": 22010 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 7.371239185333252, | |
| "learning_rate": 1.8591600750442927e-05, | |
| "loss": 2.4252, | |
| "step": 22020 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 5.349908351898193, | |
| "learning_rate": 1.8520725611409996e-05, | |
| "loss": 2.5931, | |
| "step": 22030 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 5.594857215881348, | |
| "learning_rate": 1.844997203635853e-05, | |
| "loss": 2.3067, | |
| "step": 22040 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 4.631478786468506, | |
| "learning_rate": 1.8379340130850166e-05, | |
| "loss": 2.5666, | |
| "step": 22050 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 5.589487552642822, | |
| "learning_rate": 1.8308830000265032e-05, | |
| "loss": 2.4052, | |
| "step": 22060 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 10.57905387878418, | |
| "learning_rate": 1.8238441749801537e-05, | |
| "loss": 2.5351, | |
| "step": 22070 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 3.848583459854126, | |
| "learning_rate": 1.81681754844763e-05, | |
| "loss": 2.4262, | |
| "step": 22080 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 4.930076599121094, | |
| "learning_rate": 1.8098031309123942e-05, | |
| "loss": 2.4726, | |
| "step": 22090 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 5.635489463806152, | |
| "learning_rate": 1.8028009328396844e-05, | |
| "loss": 2.7213, | |
| "step": 22100 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 5.582231521606445, | |
| "learning_rate": 1.795810964676521e-05, | |
| "loss": 2.3556, | |
| "step": 22110 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 7.522580146789551, | |
| "learning_rate": 1.788833236851666e-05, | |
| "loss": 2.577, | |
| "step": 22120 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 6.316006183624268, | |
| "learning_rate": 1.781867759775624e-05, | |
| "loss": 2.4932, | |
| "step": 22130 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 4.130107879638672, | |
| "learning_rate": 1.7749145438406255e-05, | |
| "loss": 2.3233, | |
| "step": 22140 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 3.4111945629119873, | |
| "learning_rate": 1.767973599420607e-05, | |
| "loss": 2.4543, | |
| "step": 22150 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 3.7794103622436523, | |
| "learning_rate": 1.7610449368711857e-05, | |
| "loss": 2.2836, | |
| "step": 22160 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 5.900721073150635, | |
| "learning_rate": 1.7541285665296658e-05, | |
| "loss": 2.3802, | |
| "step": 22170 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 8.760246276855469, | |
| "learning_rate": 1.7472244987150112e-05, | |
| "loss": 2.3997, | |
| "step": 22180 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 5.007622718811035, | |
| "learning_rate": 1.7403327437278273e-05, | |
| "loss": 2.5783, | |
| "step": 22190 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 4.590503215789795, | |
| "learning_rate": 1.7334533118503526e-05, | |
| "loss": 2.4172, | |
| "step": 22200 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "eval_loss": 2.676037549972534, | |
| "eval_runtime": 1096.8129, | |
| "eval_samples_per_second": 5.197, | |
| "eval_steps_per_second": 5.197, | |
| "step": 22200 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 5.619079113006592, | |
| "learning_rate": 1.7265862133464382e-05, | |
| "loss": 2.67, | |
| "step": 22210 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 5.27069616317749, | |
| "learning_rate": 1.7197314584615286e-05, | |
| "loss": 2.4192, | |
| "step": 22220 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 5.923769950866699, | |
| "learning_rate": 1.712889057422663e-05, | |
| "loss": 2.585, | |
| "step": 22230 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 6.051741600036621, | |
| "learning_rate": 1.706059020438442e-05, | |
| "loss": 2.6307, | |
| "step": 22240 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 7.821314334869385, | |
| "learning_rate": 1.699241357699023e-05, | |
| "loss": 2.6883, | |
| "step": 22250 | |
| }, | |
| { | |
| "epoch": 1.64, | |
| "grad_norm": 4.7659912109375, | |
| "learning_rate": 1.6924360793760996e-05, | |
| "loss": 2.7255, | |
| "step": 22260 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 5.253278732299805, | |
| "learning_rate": 1.6856431956228835e-05, | |
| "loss": 2.8009, | |
| "step": 22270 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 5.987473487854004, | |
| "learning_rate": 1.678862716574103e-05, | |
| "loss": 2.5018, | |
| "step": 22280 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 5.667232990264893, | |
| "learning_rate": 1.672094652345977e-05, | |
| "loss": 2.6063, | |
| "step": 22290 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 6.441999435424805, | |
| "learning_rate": 1.665339013036199e-05, | |
| "loss": 2.5247, | |
| "step": 22300 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 4.456752777099609, | |
| "learning_rate": 1.6585958087239252e-05, | |
| "loss": 2.5529, | |
| "step": 22310 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 4.149497032165527, | |
| "learning_rate": 1.6518650494697583e-05, | |
| "loss": 2.3672, | |
| "step": 22320 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 6.830989360809326, | |
| "learning_rate": 1.6451467453157375e-05, | |
| "loss": 2.5149, | |
| "step": 22330 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 6.6800312995910645, | |
| "learning_rate": 1.6384409062853202e-05, | |
| "loss": 2.6433, | |
| "step": 22340 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 8.957132339477539, | |
| "learning_rate": 1.6317475423833585e-05, | |
| "loss": 2.3203, | |
| "step": 22350 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 5.662652015686035, | |
| "learning_rate": 1.6250666635960997e-05, | |
| "loss": 2.6583, | |
| "step": 22360 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 5.9897541999816895, | |
| "learning_rate": 1.61839827989116e-05, | |
| "loss": 2.6049, | |
| "step": 22370 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 5.011838436126709, | |
| "learning_rate": 1.611742401217514e-05, | |
| "loss": 2.7471, | |
| "step": 22380 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 8.517313957214355, | |
| "learning_rate": 1.605099037505483e-05, | |
| "loss": 2.7046, | |
| "step": 22390 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 6.329367160797119, | |
| "learning_rate": 1.5984681986667095e-05, | |
| "loss": 2.6179, | |
| "step": 22400 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "eval_loss": 2.6726911067962646, | |
| "eval_runtime": 1087.5084, | |
| "eval_samples_per_second": 5.241, | |
| "eval_steps_per_second": 5.241, | |
| "step": 22400 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 5.475883960723877, | |
| "learning_rate": 1.591849894594155e-05, | |
| "loss": 2.1697, | |
| "step": 22410 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 8.58638858795166, | |
| "learning_rate": 1.5852441351620774e-05, | |
| "loss": 2.6007, | |
| "step": 22420 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 7.628760814666748, | |
| "learning_rate": 1.5786509302260167e-05, | |
| "loss": 2.5558, | |
| "step": 22430 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 8.970362663269043, | |
| "learning_rate": 1.572070289622789e-05, | |
| "loss": 2.3498, | |
| "step": 22440 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 5.100218772888184, | |
| "learning_rate": 1.5655022231704553e-05, | |
| "loss": 2.2767, | |
| "step": 22450 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 6.442392349243164, | |
| "learning_rate": 1.5589467406683256e-05, | |
| "loss": 3.0826, | |
| "step": 22460 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 5.430817604064941, | |
| "learning_rate": 1.5524038518969253e-05, | |
| "loss": 2.4834, | |
| "step": 22470 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 4.273621559143066, | |
| "learning_rate": 1.545873566617998e-05, | |
| "loss": 2.2524, | |
| "step": 22480 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 4.311804294586182, | |
| "learning_rate": 1.539355894574486e-05, | |
| "loss": 2.5281, | |
| "step": 22490 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 7.450249195098877, | |
| "learning_rate": 1.5328508454905e-05, | |
| "loss": 2.3898, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 4.738997936248779, | |
| "learning_rate": 1.5263584290713305e-05, | |
| "loss": 2.4634, | |
| "step": 22510 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 4.49940824508667, | |
| "learning_rate": 1.5198786550034194e-05, | |
| "loss": 2.4394, | |
| "step": 22520 | |
| }, | |
| { | |
| "epoch": 1.66, | |
| "grad_norm": 4.811766624450684, | |
| "learning_rate": 1.5134115329543363e-05, | |
| "loss": 2.5136, | |
| "step": 22530 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 5.51740026473999, | |
| "learning_rate": 1.5069570725727889e-05, | |
| "loss": 2.3364, | |
| "step": 22540 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 6.221955299377441, | |
| "learning_rate": 1.5005152834885794e-05, | |
| "loss": 2.5954, | |
| "step": 22550 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 5.981647968292236, | |
| "learning_rate": 1.4940861753126168e-05, | |
| "loss": 2.3089, | |
| "step": 22560 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 7.435852527618408, | |
| "learning_rate": 1.4876697576368881e-05, | |
| "loss": 2.3998, | |
| "step": 22570 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 5.436887741088867, | |
| "learning_rate": 1.4812660400344414e-05, | |
| "loss": 2.4571, | |
| "step": 22580 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 5.0897722244262695, | |
| "learning_rate": 1.4748750320593785e-05, | |
| "loss": 2.439, | |
| "step": 22590 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 4.938666820526123, | |
| "learning_rate": 1.4684967432468433e-05, | |
| "loss": 2.1966, | |
| "step": 22600 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "eval_loss": 2.67244553565979, | |
| "eval_runtime": 1092.4378, | |
| "eval_samples_per_second": 5.218, | |
| "eval_steps_per_second": 5.218, | |
| "step": 22600 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 4.76402473449707, | |
| "learning_rate": 1.4621311831129992e-05, | |
| "loss": 2.7715, | |
| "step": 22610 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 5.895535945892334, | |
| "learning_rate": 1.4557783611550224e-05, | |
| "loss": 2.8179, | |
| "step": 22620 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 4.383255481719971, | |
| "learning_rate": 1.4494382868510803e-05, | |
| "loss": 2.6572, | |
| "step": 22630 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 6.317339897155762, | |
| "learning_rate": 1.4431109696603207e-05, | |
| "loss": 2.6832, | |
| "step": 22640 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 3.1432700157165527, | |
| "learning_rate": 1.4367964190228623e-05, | |
| "loss": 2.132, | |
| "step": 22650 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 4.70470666885376, | |
| "learning_rate": 1.4304946443597744e-05, | |
| "loss": 2.5938, | |
| "step": 22660 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 5.619884014129639, | |
| "learning_rate": 1.4242056550730677e-05, | |
| "loss": 2.6072, | |
| "step": 22670 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.059271335601807, | |
| "learning_rate": 1.4179294605456739e-05, | |
| "loss": 2.5668, | |
| "step": 22680 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.467549800872803, | |
| "learning_rate": 1.411666070141433e-05, | |
| "loss": 2.2774, | |
| "step": 22690 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.390707015991211, | |
| "learning_rate": 1.40541549320509e-05, | |
| "loss": 2.7621, | |
| "step": 22700 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.357089042663574, | |
| "learning_rate": 1.3991777390622651e-05, | |
| "loss": 2.3953, | |
| "step": 22710 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 4.777021408081055, | |
| "learning_rate": 1.3929528170194561e-05, | |
| "loss": 2.6179, | |
| "step": 22720 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.3577070236206055, | |
| "learning_rate": 1.386740736364005e-05, | |
| "loss": 2.5467, | |
| "step": 22730 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 7.2683634757995605, | |
| "learning_rate": 1.3805415063641003e-05, | |
| "loss": 2.5984, | |
| "step": 22740 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 7.257079124450684, | |
| "learning_rate": 1.3743551362687568e-05, | |
| "loss": 2.5944, | |
| "step": 22750 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.176877021789551, | |
| "learning_rate": 1.368181635307807e-05, | |
| "loss": 2.6696, | |
| "step": 22760 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.036998271942139, | |
| "learning_rate": 1.3620210126918798e-05, | |
| "loss": 2.3, | |
| "step": 22770 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 4.959908962249756, | |
| "learning_rate": 1.3558732776123884e-05, | |
| "loss": 2.8348, | |
| "step": 22780 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 6.45090389251709, | |
| "learning_rate": 1.349738439241518e-05, | |
| "loss": 2.3633, | |
| "step": 22790 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 4.981467247009277, | |
| "learning_rate": 1.3436165067322171e-05, | |
| "loss": 2.4786, | |
| "step": 22800 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "eval_loss": 2.670815944671631, | |
| "eval_runtime": 1095.8123, | |
| "eval_samples_per_second": 5.202, | |
| "eval_steps_per_second": 5.202, | |
| "step": 22800 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 4.602180004119873, | |
| "learning_rate": 1.3375074892181749e-05, | |
| "loss": 2.4742, | |
| "step": 22810 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 5.091914653778076, | |
| "learning_rate": 1.3314113958138163e-05, | |
| "loss": 2.6046, | |
| "step": 22820 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 5.247584342956543, | |
| "learning_rate": 1.3253282356142771e-05, | |
| "loss": 2.6917, | |
| "step": 22830 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 5.7452192306518555, | |
| "learning_rate": 1.319258017695405e-05, | |
| "loss": 2.4501, | |
| "step": 22840 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 5.045823574066162, | |
| "learning_rate": 1.31320075111373e-05, | |
| "loss": 2.2214, | |
| "step": 22850 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 4.422451019287109, | |
| "learning_rate": 1.3071564449064666e-05, | |
| "loss": 2.2831, | |
| "step": 22860 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 5.13774299621582, | |
| "learning_rate": 1.301125108091492e-05, | |
| "loss": 2.3201, | |
| "step": 22870 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 6.320522308349609, | |
| "learning_rate": 1.2951067496673264e-05, | |
| "loss": 2.534, | |
| "step": 22880 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 6.9759674072265625, | |
| "learning_rate": 1.2891013786131368e-05, | |
| "loss": 2.6257, | |
| "step": 22890 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 5.557161808013916, | |
| "learning_rate": 1.283109003888704e-05, | |
| "loss": 2.6524, | |
| "step": 22900 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 6.528628826141357, | |
| "learning_rate": 1.2771296344344263e-05, | |
| "loss": 2.4845, | |
| "step": 22910 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 4.082712650299072, | |
| "learning_rate": 1.271163279171297e-05, | |
| "loss": 2.4187, | |
| "step": 22920 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 3.7587528228759766, | |
| "learning_rate": 1.2652099470008883e-05, | |
| "loss": 2.6183, | |
| "step": 22930 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 6.589033126831055, | |
| "learning_rate": 1.259269646805349e-05, | |
| "loss": 2.574, | |
| "step": 22940 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 5.249916076660156, | |
| "learning_rate": 1.2533423874473771e-05, | |
| "loss": 2.5617, | |
| "step": 22950 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 3.8693699836730957, | |
| "learning_rate": 1.2474281777702223e-05, | |
| "loss": 2.5963, | |
| "step": 22960 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 5.250299453735352, | |
| "learning_rate": 1.2415270265976564e-05, | |
| "loss": 2.5467, | |
| "step": 22970 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 4.729397296905518, | |
| "learning_rate": 1.2356389427339766e-05, | |
| "loss": 2.8142, | |
| "step": 22980 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 3.2217938899993896, | |
| "learning_rate": 1.22976393496398e-05, | |
| "loss": 2.1877, | |
| "step": 22990 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 3.8777239322662354, | |
| "learning_rate": 1.2239020120529521e-05, | |
| "loss": 2.2498, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "eval_loss": 2.6680080890655518, | |
| "eval_runtime": 1095.4556, | |
| "eval_samples_per_second": 5.203, | |
| "eval_steps_per_second": 5.203, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 5.530909061431885, | |
| "learning_rate": 1.2180531827466635e-05, | |
| "loss": 2.6204, | |
| "step": 23010 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 4.088710308074951, | |
| "learning_rate": 1.2122174557713406e-05, | |
| "loss": 2.7187, | |
| "step": 23020 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 7.151991367340088, | |
| "learning_rate": 1.2063948398336677e-05, | |
| "loss": 2.4525, | |
| "step": 23030 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 3.7773518562316895, | |
| "learning_rate": 1.2005853436207703e-05, | |
| "loss": 2.3775, | |
| "step": 23040 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 5.765316486358643, | |
| "learning_rate": 1.1947889758001907e-05, | |
| "loss": 2.6697, | |
| "step": 23050 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 6.313945770263672, | |
| "learning_rate": 1.1890057450198932e-05, | |
| "loss": 2.3878, | |
| "step": 23060 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 3.7643887996673584, | |
| "learning_rate": 1.1832356599082361e-05, | |
| "loss": 2.6022, | |
| "step": 23070 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 5.528670787811279, | |
| "learning_rate": 1.1774787290739676e-05, | |
| "loss": 2.3164, | |
| "step": 23080 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.8710432052612305, | |
| "learning_rate": 1.1717349611062122e-05, | |
| "loss": 2.4571, | |
| "step": 23090 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.853476047515869, | |
| "learning_rate": 1.166004364574449e-05, | |
| "loss": 2.1946, | |
| "step": 23100 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 6.066964149475098, | |
| "learning_rate": 1.160286948028515e-05, | |
| "loss": 2.6727, | |
| "step": 23110 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 6.807967185974121, | |
| "learning_rate": 1.1545827199985737e-05, | |
| "loss": 2.5211, | |
| "step": 23120 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.183149814605713, | |
| "learning_rate": 1.1488916889951195e-05, | |
| "loss": 2.3858, | |
| "step": 23130 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.625608921051025, | |
| "learning_rate": 1.143213863508954e-05, | |
| "loss": 2.5197, | |
| "step": 23140 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.2954020500183105, | |
| "learning_rate": 1.1375492520111797e-05, | |
| "loss": 2.5251, | |
| "step": 23150 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.281711578369141, | |
| "learning_rate": 1.1318978629531784e-05, | |
| "loss": 2.3084, | |
| "step": 23160 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 4.606409549713135, | |
| "learning_rate": 1.1262597047666067e-05, | |
| "loss": 2.5242, | |
| "step": 23170 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 11.543262481689453, | |
| "learning_rate": 1.1206347858633836e-05, | |
| "loss": 2.7468, | |
| "step": 23180 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 4.565051555633545, | |
| "learning_rate": 1.115023114635676e-05, | |
| "loss": 2.8361, | |
| "step": 23190 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 5.548258304595947, | |
| "learning_rate": 1.1094246994558843e-05, | |
| "loss": 2.3842, | |
| "step": 23200 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "eval_loss": 2.6673765182495117, | |
| "eval_runtime": 1095.5672, | |
| "eval_samples_per_second": 5.203, | |
| "eval_steps_per_second": 5.203, | |
| "step": 23200 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 3.919635772705078, | |
| "learning_rate": 1.1038395486766306e-05, | |
| "loss": 2.519, | |
| "step": 23210 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.431865692138672, | |
| "learning_rate": 1.0982676706307449e-05, | |
| "loss": 2.2447, | |
| "step": 23220 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.190866947174072, | |
| "learning_rate": 1.0927090736312595e-05, | |
| "loss": 2.4587, | |
| "step": 23230 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.054731369018555, | |
| "learning_rate": 1.0871637659713895e-05, | |
| "loss": 2.49, | |
| "step": 23240 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 7.007957458496094, | |
| "learning_rate": 1.081631755924527e-05, | |
| "loss": 2.7029, | |
| "step": 23250 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 7.057101726531982, | |
| "learning_rate": 1.0761130517442175e-05, | |
| "loss": 2.756, | |
| "step": 23260 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 5.599599838256836, | |
| "learning_rate": 1.0706076616641558e-05, | |
| "loss": 2.5836, | |
| "step": 23270 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.555930137634277, | |
| "learning_rate": 1.0651155938981771e-05, | |
| "loss": 2.5641, | |
| "step": 23280 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 5.608716011047363, | |
| "learning_rate": 1.0596368566402382e-05, | |
| "loss": 2.8093, | |
| "step": 23290 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.5203375816345215, | |
| "learning_rate": 1.054171458064408e-05, | |
| "loss": 2.5123, | |
| "step": 23300 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 5.284296035766602, | |
| "learning_rate": 1.0487194063248518e-05, | |
| "loss": 2.5149, | |
| "step": 23310 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.907776355743408, | |
| "learning_rate": 1.0432807095558217e-05, | |
| "loss": 2.4423, | |
| "step": 23320 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 4.86950159072876, | |
| "learning_rate": 1.0378553758716492e-05, | |
| "loss": 2.5835, | |
| "step": 23330 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 3.8427376747131348, | |
| "learning_rate": 1.0324434133667271e-05, | |
| "loss": 2.4697, | |
| "step": 23340 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 5.208629131317139, | |
| "learning_rate": 1.0270448301154955e-05, | |
| "loss": 2.399, | |
| "step": 23350 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 6.390563011169434, | |
| "learning_rate": 1.0216596341724372e-05, | |
| "loss": 2.6222, | |
| "step": 23360 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 3.514446496963501, | |
| "learning_rate": 1.0162878335720572e-05, | |
| "loss": 2.4631, | |
| "step": 23370 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 4.729079723358154, | |
| "learning_rate": 1.010929436328879e-05, | |
| "loss": 2.6457, | |
| "step": 23380 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 7.517897129058838, | |
| "learning_rate": 1.0055844504374311e-05, | |
| "loss": 2.5569, | |
| "step": 23390 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 7.293701648712158, | |
| "learning_rate": 1.0002528838722247e-05, | |
| "loss": 2.3308, | |
| "step": 23400 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "eval_loss": 2.6646196842193604, | |
| "eval_runtime": 1099.3168, | |
| "eval_samples_per_second": 5.185, | |
| "eval_steps_per_second": 5.185, | |
| "step": 23400 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 3.726698160171509, | |
| "learning_rate": 9.949347445877578e-06, | |
| "loss": 2.577, | |
| "step": 23410 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 5.210052967071533, | |
| "learning_rate": 9.896300405184899e-06, | |
| "loss": 2.4381, | |
| "step": 23420 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 5.623903274536133, | |
| "learning_rate": 9.843387795788383e-06, | |
| "loss": 2.4011, | |
| "step": 23430 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 8.071617126464844, | |
| "learning_rate": 9.790609696631648e-06, | |
| "loss": 2.5279, | |
| "step": 23440 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 7.771283149719238, | |
| "learning_rate": 9.737966186457592e-06, | |
| "loss": 2.6137, | |
| "step": 23450 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 7.911716938018799, | |
| "learning_rate": 9.685457343808347e-06, | |
| "loss": 2.4973, | |
| "step": 23460 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 7.803577423095703, | |
| "learning_rate": 9.63308324702512e-06, | |
| "loss": 2.7497, | |
| "step": 23470 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 5.311838626861572, | |
| "learning_rate": 9.580843974248032e-06, | |
| "loss": 2.5562, | |
| "step": 23480 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 4.150722980499268, | |
| "learning_rate": 9.528739603416159e-06, | |
| "loss": 2.3497, | |
| "step": 23490 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 7.9773430824279785, | |
| "learning_rate": 9.476770212267172e-06, | |
| "loss": 2.6774, | |
| "step": 23500 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 4.366696357727051, | |
| "learning_rate": 9.42493587833746e-06, | |
| "loss": 2.2838, | |
| "step": 23510 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 7.453878402709961, | |
| "learning_rate": 9.373236678961906e-06, | |
| "loss": 2.4536, | |
| "step": 23520 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 6.814056396484375, | |
| "learning_rate": 9.321672691273698e-06, | |
| "loss": 2.4654, | |
| "step": 23530 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 7.097417831420898, | |
| "learning_rate": 9.270243992204397e-06, | |
| "loss": 2.2456, | |
| "step": 23540 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 5.335800647735596, | |
| "learning_rate": 9.218950658483616e-06, | |
| "loss": 2.4628, | |
| "step": 23550 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 5.825280666351318, | |
| "learning_rate": 9.167792766639106e-06, | |
| "loss": 2.4608, | |
| "step": 23560 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 6.578549385070801, | |
| "learning_rate": 9.116770392996488e-06, | |
| "loss": 2.586, | |
| "step": 23570 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 6.099307537078857, | |
| "learning_rate": 9.065883613679193e-06, | |
| "loss": 2.4974, | |
| "step": 23580 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 6.494635581970215, | |
| "learning_rate": 9.015132504608347e-06, | |
| "loss": 2.3944, | |
| "step": 23590 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 4.195499897003174, | |
| "learning_rate": 8.964517141502704e-06, | |
| "loss": 2.6393, | |
| "step": 23600 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "eval_loss": 2.663755416870117, | |
| "eval_runtime": 1093.6584, | |
| "eval_samples_per_second": 5.212, | |
| "eval_steps_per_second": 5.212, | |
| "step": 23600 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 8.729719161987305, | |
| "learning_rate": 8.914037599878455e-06, | |
| "loss": 2.7616, | |
| "step": 23610 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 4.2735724449157715, | |
| "learning_rate": 8.863693955049167e-06, | |
| "loss": 2.6174, | |
| "step": 23620 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 6.545641899108887, | |
| "learning_rate": 8.813486282125637e-06, | |
| "loss": 2.3377, | |
| "step": 23630 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 4.61662483215332, | |
| "learning_rate": 8.76341465601579e-06, | |
| "loss": 2.3364, | |
| "step": 23640 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 4.983887672424316, | |
| "learning_rate": 8.713479151424598e-06, | |
| "loss": 2.3039, | |
| "step": 23650 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 5.541987419128418, | |
| "learning_rate": 8.663679842853945e-06, | |
| "loss": 2.8135, | |
| "step": 23660 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 6.296572685241699, | |
| "learning_rate": 8.61401680460252e-06, | |
| "loss": 2.4277, | |
| "step": 23670 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 3.8996143341064453, | |
| "learning_rate": 8.564490110765677e-06, | |
| "loss": 2.5462, | |
| "step": 23680 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 6.054901123046875, | |
| "learning_rate": 8.51509983523533e-06, | |
| "loss": 2.6507, | |
| "step": 23690 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 6.450567722320557, | |
| "learning_rate": 8.465846051699932e-06, | |
| "loss": 2.5863, | |
| "step": 23700 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 6.507874488830566, | |
| "learning_rate": 8.416728833644238e-06, | |
| "loss": 2.5511, | |
| "step": 23710 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 6.341745853424072, | |
| "learning_rate": 8.367748254349295e-06, | |
| "loss": 2.5089, | |
| "step": 23720 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 5.820411205291748, | |
| "learning_rate": 8.318904386892257e-06, | |
| "loss": 2.4623, | |
| "step": 23730 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 5.08252477645874, | |
| "learning_rate": 8.270197304146288e-06, | |
| "loss": 2.5348, | |
| "step": 23740 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 4.101901531219482, | |
| "learning_rate": 8.221627078780525e-06, | |
| "loss": 2.5865, | |
| "step": 23750 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 6.394351482391357, | |
| "learning_rate": 8.173193783259902e-06, | |
| "loss": 2.3589, | |
| "step": 23760 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 7.091293811798096, | |
| "learning_rate": 8.124897489845073e-06, | |
| "loss": 2.8034, | |
| "step": 23770 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 6.968698024749756, | |
| "learning_rate": 8.076738270592243e-06, | |
| "loss": 2.2993, | |
| "step": 23780 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 5.620391368865967, | |
| "learning_rate": 8.02871619735316e-06, | |
| "loss": 2.4773, | |
| "step": 23790 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 6.991843223571777, | |
| "learning_rate": 7.980831341774909e-06, | |
| "loss": 2.4585, | |
| "step": 23800 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "eval_loss": 2.662553548812866, | |
| "eval_runtime": 1095.3908, | |
| "eval_samples_per_second": 5.204, | |
| "eval_steps_per_second": 5.204, | |
| "step": 23800 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 4.3224921226501465, | |
| "learning_rate": 7.933083775299877e-06, | |
| "loss": 2.3389, | |
| "step": 23810 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 4.530595302581787, | |
| "learning_rate": 7.885473569165658e-06, | |
| "loss": 2.2855, | |
| "step": 23820 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 4.67950439453125, | |
| "learning_rate": 7.83800079440482e-06, | |
| "loss": 2.4611, | |
| "step": 23830 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 4.393266201019287, | |
| "learning_rate": 7.790665521844975e-06, | |
| "loss": 2.4187, | |
| "step": 23840 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 5.820330619812012, | |
| "learning_rate": 7.74346782210853e-06, | |
| "loss": 2.5358, | |
| "step": 23850 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 5.662726879119873, | |
| "learning_rate": 7.696407765612656e-06, | |
| "loss": 2.5325, | |
| "step": 23860 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 4.868063449859619, | |
| "learning_rate": 7.649485422569202e-06, | |
| "loss": 2.5334, | |
| "step": 23870 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 5.6850714683532715, | |
| "learning_rate": 7.60270086298448e-06, | |
| "loss": 2.4373, | |
| "step": 23880 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 4.139278411865234, | |
| "learning_rate": 7.556054156659309e-06, | |
| "loss": 2.5888, | |
| "step": 23890 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 3.901987314224243, | |
| "learning_rate": 7.509545373188776e-06, | |
| "loss": 2.5425, | |
| "step": 23900 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 5.1275129318237305, | |
| "learning_rate": 7.4631745819622286e-06, | |
| "loss": 2.2698, | |
| "step": 23910 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 5.235576152801514, | |
| "learning_rate": 7.41694185216315e-06, | |
| "loss": 2.8522, | |
| "step": 23920 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 7.4979248046875, | |
| "learning_rate": 7.370847252768964e-06, | |
| "loss": 2.4142, | |
| "step": 23930 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 4.67307710647583, | |
| "learning_rate": 7.324890852551114e-06, | |
| "loss": 2.4082, | |
| "step": 23940 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 5.2745137214660645, | |
| "learning_rate": 7.279072720074765e-06, | |
| "loss": 2.6957, | |
| "step": 23950 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 5.682844638824463, | |
| "learning_rate": 7.233392923698867e-06, | |
| "loss": 2.4437, | |
| "step": 23960 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 5.371147155761719, | |
| "learning_rate": 7.187851531575895e-06, | |
| "loss": 2.4106, | |
| "step": 23970 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 3.5821807384490967, | |
| "learning_rate": 7.1424486116518976e-06, | |
| "loss": 2.3772, | |
| "step": 23980 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 7.6203789710998535, | |
| "learning_rate": 7.097184231666321e-06, | |
| "loss": 2.5593, | |
| "step": 23990 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 6.033676624298096, | |
| "learning_rate": 7.052058459151878e-06, | |
| "loss": 2.4586, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "eval_loss": 2.660005569458008, | |
| "eval_runtime": 1097.5123, | |
| "eval_samples_per_second": 5.194, | |
| "eval_steps_per_second": 5.194, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 10.172308921813965, | |
| "learning_rate": 7.007071361434525e-06, | |
| "loss": 2.4257, | |
| "step": 24010 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 7.140941619873047, | |
| "learning_rate": 6.962223005633284e-06, | |
| "loss": 2.4525, | |
| "step": 24020 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 6.787766933441162, | |
| "learning_rate": 6.917513458660197e-06, | |
| "loss": 2.7918, | |
| "step": 24030 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 4.571247577667236, | |
| "learning_rate": 6.872942787220238e-06, | |
| "loss": 2.4082, | |
| "step": 24040 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 5.534272193908691, | |
| "learning_rate": 6.828511057811127e-06, | |
| "loss": 2.5778, | |
| "step": 24050 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 5.400485992431641, | |
| "learning_rate": 6.7842183367233354e-06, | |
| "loss": 2.7021, | |
| "step": 24060 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 6.089663982391357, | |
| "learning_rate": 6.740064690039893e-06, | |
| "loss": 2.6363, | |
| "step": 24070 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 7.160126209259033, | |
| "learning_rate": 6.696050183636371e-06, | |
| "loss": 2.6046, | |
| "step": 24080 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 6.594214916229248, | |
| "learning_rate": 6.652174883180762e-06, | |
| "loss": 2.5559, | |
| "step": 24090 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 5.203665256500244, | |
| "learning_rate": 6.608438854133347e-06, | |
| "loss": 2.4476, | |
| "step": 24100 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 5.592020034790039, | |
| "learning_rate": 6.56484216174661e-06, | |
| "loss": 2.3035, | |
| "step": 24110 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 6.901062488555908, | |
| "learning_rate": 6.521384871065139e-06, | |
| "loss": 2.5734, | |
| "step": 24120 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 6.117889404296875, | |
| "learning_rate": 6.478067046925573e-06, | |
| "loss": 2.6569, | |
| "step": 24130 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 3.797450304031372, | |
| "learning_rate": 6.439200302513093e-06, | |
| "loss": 2.4993, | |
| "step": 24140 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 5.903318405151367, | |
| "learning_rate": 6.396147642682771e-06, | |
| "loss": 2.6547, | |
| "step": 24150 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 4.873409271240234, | |
| "learning_rate": 6.3532346362435324e-06, | |
| "loss": 2.3683, | |
| "step": 24160 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 5.629471302032471, | |
| "learning_rate": 6.310461347219976e-06, | |
| "loss": 2.9563, | |
| "step": 24170 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 3.3840177059173584, | |
| "learning_rate": 6.267827839428186e-06, | |
| "loss": 2.4681, | |
| "step": 24180 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 11.257518768310547, | |
| "learning_rate": 6.2295772479447625e-06, | |
| "loss": 2.4174, | |
| "step": 24190 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 4.495081901550293, | |
| "learning_rate": 6.18720949955981e-06, | |
| "loss": 2.6949, | |
| "step": 24200 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "eval_loss": 2.6588234901428223, | |
| "eval_runtime": 1093.4241, | |
| "eval_samples_per_second": 5.213, | |
| "eval_steps_per_second": 5.213, | |
| "step": 24200 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 4.914842128753662, | |
| "learning_rate": 6.14498171629373e-06, | |
| "loss": 2.7292, | |
| "step": 24210 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 10.351119041442871, | |
| "learning_rate": 6.102893961148759e-06, | |
| "loss": 2.4258, | |
| "step": 24220 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 5.2781982421875, | |
| "learning_rate": 6.0609462969182575e-06, | |
| "loss": 2.7965, | |
| "step": 24230 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 7.596676826477051, | |
| "learning_rate": 6.019138786186518e-06, | |
| "loss": 2.3767, | |
| "step": 24240 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 5.272423267364502, | |
| "learning_rate": 5.977471491328745e-06, | |
| "loss": 2.6428, | |
| "step": 24250 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 6.982003211975098, | |
| "learning_rate": 5.935944474510991e-06, | |
| "loss": 2.6295, | |
| "step": 24260 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 4.492363452911377, | |
| "learning_rate": 5.894557797689959e-06, | |
| "loss": 2.4975, | |
| "step": 24270 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 3.5356361865997314, | |
| "learning_rate": 5.853311522613036e-06, | |
| "loss": 2.6458, | |
| "step": 24280 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 4.993523597717285, | |
| "learning_rate": 5.812205710818075e-06, | |
| "loss": 2.3961, | |
| "step": 24290 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 6.376553058624268, | |
| "learning_rate": 5.771240423633362e-06, | |
| "loss": 2.4275, | |
| "step": 24300 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 5.525853157043457, | |
| "learning_rate": 5.730415722177573e-06, | |
| "loss": 2.3282, | |
| "step": 24310 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 6.546508312225342, | |
| "learning_rate": 5.689731667359621e-06, | |
| "loss": 2.5095, | |
| "step": 24320 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 5.087640285491943, | |
| "learning_rate": 5.649188319878563e-06, | |
| "loss": 2.4921, | |
| "step": 24330 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 5.294022083282471, | |
| "learning_rate": 5.608785740223532e-06, | |
| "loss": 2.5036, | |
| "step": 24340 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 6.46054220199585, | |
| "learning_rate": 5.568523988673624e-06, | |
| "loss": 2.7374, | |
| "step": 24350 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 7.733225345611572, | |
| "learning_rate": 5.528403125297854e-06, | |
| "loss": 2.5931, | |
| "step": 24360 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 5.521718978881836, | |
| "learning_rate": 5.48842320995504e-06, | |
| "loss": 2.324, | |
| "step": 24370 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 4.55715274810791, | |
| "learning_rate": 5.448584302293691e-06, | |
| "loss": 2.3213, | |
| "step": 24380 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 3.7885773181915283, | |
| "learning_rate": 5.408886461751938e-06, | |
| "loss": 2.2618, | |
| "step": 24390 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 4.088833808898926, | |
| "learning_rate": 5.369329747557439e-06, | |
| "loss": 2.4464, | |
| "step": 24400 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "eval_loss": 2.658057928085327, | |
| "eval_runtime": 1096.7974, | |
| "eval_samples_per_second": 5.197, | |
| "eval_steps_per_second": 5.197, | |
| "step": 24400 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 5.293616771697998, | |
| "learning_rate": 5.329914218727317e-06, | |
| "loss": 2.3675, | |
| "step": 24410 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 5.487192630767822, | |
| "learning_rate": 5.290639934068042e-06, | |
| "loss": 2.4274, | |
| "step": 24420 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 6.877601146697998, | |
| "learning_rate": 5.251506952175378e-06, | |
| "loss": 2.5587, | |
| "step": 24430 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 4.651222229003906, | |
| "learning_rate": 5.212515331434231e-06, | |
| "loss": 2.6733, | |
| "step": 24440 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 5.562499046325684, | |
| "learning_rate": 5.17366513001859e-06, | |
| "loss": 2.407, | |
| "step": 24450 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 5.536728858947754, | |
| "learning_rate": 5.134956405891511e-06, | |
| "loss": 2.7379, | |
| "step": 24460 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 7.043944358825684, | |
| "learning_rate": 5.096389216804942e-06, | |
| "loss": 2.6023, | |
| "step": 24470 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 4.266600608825684, | |
| "learning_rate": 5.057963620299655e-06, | |
| "loss": 2.5775, | |
| "step": 24480 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 5.975000858306885, | |
| "learning_rate": 5.01967967370518e-06, | |
| "loss": 2.6187, | |
| "step": 24490 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 6.738065719604492, | |
| "learning_rate": 4.981537434139705e-06, | |
| "loss": 2.3506, | |
| "step": 24500 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 5.501399040222168, | |
| "learning_rate": 4.9435369585099975e-06, | |
| "loss": 2.5722, | |
| "step": 24510 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 4.655872344970703, | |
| "learning_rate": 4.90567830351134e-06, | |
| "loss": 2.1844, | |
| "step": 24520 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 5.472281455993652, | |
| "learning_rate": 4.8679615256274065e-06, | |
| "loss": 2.6819, | |
| "step": 24530 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 4.1918253898620605, | |
| "learning_rate": 4.830386681130184e-06, | |
| "loss": 2.3479, | |
| "step": 24540 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 6.187207221984863, | |
| "learning_rate": 4.7929538260799266e-06, | |
| "loss": 2.3477, | |
| "step": 24550 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 6.957455635070801, | |
| "learning_rate": 4.755663016325007e-06, | |
| "loss": 2.4508, | |
| "step": 24560 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 5.570684909820557, | |
| "learning_rate": 4.71851430750192e-06, | |
| "loss": 2.3361, | |
| "step": 24570 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 7.463441848754883, | |
| "learning_rate": 4.68150775503513e-06, | |
| "loss": 2.5163, | |
| "step": 24580 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 6.18106746673584, | |
| "learning_rate": 4.644643414136984e-06, | |
| "loss": 2.7362, | |
| "step": 24590 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 6.137258052825928, | |
| "learning_rate": 4.607921339807708e-06, | |
| "loss": 2.5392, | |
| "step": 24600 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "eval_loss": 2.6575379371643066, | |
| "eval_runtime": 1097.6214, | |
| "eval_samples_per_second": 5.193, | |
| "eval_steps_per_second": 5.193, | |
| "step": 24600 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 4.705349922180176, | |
| "learning_rate": 4.57134158683521e-06, | |
| "loss": 2.3636, | |
| "step": 24610 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 13.131735801696777, | |
| "learning_rate": 4.534904209795133e-06, | |
| "loss": 2.7459, | |
| "step": 24620 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 5.176623344421387, | |
| "learning_rate": 4.498609263050602e-06, | |
| "loss": 2.5748, | |
| "step": 24630 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 4.853312015533447, | |
| "learning_rate": 4.462456800752335e-06, | |
| "loss": 2.5707, | |
| "step": 24640 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 7.627806663513184, | |
| "learning_rate": 4.426446876838441e-06, | |
| "loss": 2.7449, | |
| "step": 24650 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 5.656932353973389, | |
| "learning_rate": 4.390579545034334e-06, | |
| "loss": 2.4417, | |
| "step": 24660 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 3.796220541000366, | |
| "learning_rate": 4.354854858852731e-06, | |
| "loss": 2.3381, | |
| "step": 24670 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 5.063661575317383, | |
| "learning_rate": 4.319272871593483e-06, | |
| "loss": 2.2168, | |
| "step": 24680 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 7.319814682006836, | |
| "learning_rate": 4.283833636343582e-06, | |
| "loss": 2.6516, | |
| "step": 24690 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 4.529714107513428, | |
| "learning_rate": 4.24853720597701e-06, | |
| "loss": 2.5271, | |
| "step": 24700 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 3.921539783477783, | |
| "learning_rate": 4.21338363315471e-06, | |
| "loss": 2.4202, | |
| "step": 24710 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 6.239911079406738, | |
| "learning_rate": 4.178372970324473e-06, | |
| "loss": 2.3875, | |
| "step": 24720 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 6.639339447021484, | |
| "learning_rate": 4.1435052697208595e-06, | |
| "loss": 2.4489, | |
| "step": 24730 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 3.866710662841797, | |
| "learning_rate": 4.1087805833651795e-06, | |
| "loss": 2.6613, | |
| "step": 24740 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 5.444427490234375, | |
| "learning_rate": 4.074198963065346e-06, | |
| "loss": 2.6155, | |
| "step": 24750 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 4.5667195320129395, | |
| "learning_rate": 4.039760460415798e-06, | |
| "loss": 2.427, | |
| "step": 24760 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 5.31951904296875, | |
| "learning_rate": 4.005465126797492e-06, | |
| "loss": 2.696, | |
| "step": 24770 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 5.098918914794922, | |
| "learning_rate": 3.971313013377753e-06, | |
| "loss": 2.5229, | |
| "step": 24780 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 5.757137298583984, | |
| "learning_rate": 3.937304171110245e-06, | |
| "loss": 2.4862, | |
| "step": 24790 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 6.163649082183838, | |
| "learning_rate": 3.903438650734881e-06, | |
| "loss": 2.5195, | |
| "step": 24800 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "eval_loss": 2.6563258171081543, | |
| "eval_runtime": 1094.2795, | |
| "eval_samples_per_second": 5.209, | |
| "eval_steps_per_second": 5.209, | |
| "step": 24800 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 6.653298377990723, | |
| "learning_rate": 3.8697165027776986e-06, | |
| "loss": 2.5233, | |
| "step": 24810 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 4.475333213806152, | |
| "learning_rate": 3.836137777550874e-06, | |
| "loss": 2.4716, | |
| "step": 24820 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 5.567105293273926, | |
| "learning_rate": 3.8027025251526016e-06, | |
| "loss": 2.6092, | |
| "step": 24830 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 4.831381320953369, | |
| "learning_rate": 3.7694107954669876e-06, | |
| "loss": 2.4514, | |
| "step": 24840 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 3.961242198944092, | |
| "learning_rate": 3.736262638164045e-06, | |
| "loss": 2.6679, | |
| "step": 24850 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 4.817134380340576, | |
| "learning_rate": 3.7032581026995806e-06, | |
| "loss": 2.7695, | |
| "step": 24860 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 4.958139419555664, | |
| "learning_rate": 3.67039723831506e-06, | |
| "loss": 2.6389, | |
| "step": 24870 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 7.7273125648498535, | |
| "learning_rate": 3.6376800940376654e-06, | |
| "loss": 2.4678, | |
| "step": 24880 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 5.275628566741943, | |
| "learning_rate": 3.60510671868014e-06, | |
| "loss": 2.4368, | |
| "step": 24890 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 5.690983295440674, | |
| "learning_rate": 3.5726771608407317e-06, | |
| "loss": 2.1657, | |
| "step": 24900 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 6.044635772705078, | |
| "learning_rate": 3.5403914689030925e-06, | |
| "loss": 2.6097, | |
| "step": 24910 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 7.05141544342041, | |
| "learning_rate": 3.508249691036258e-06, | |
| "loss": 2.2663, | |
| "step": 24920 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 4.508877754211426, | |
| "learning_rate": 3.476251875194525e-06, | |
| "loss": 2.5327, | |
| "step": 24930 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 5.018611907958984, | |
| "learning_rate": 3.4443980691174162e-06, | |
| "loss": 2.3549, | |
| "step": 24940 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 5.333502292633057, | |
| "learning_rate": 3.4126883203296266e-06, | |
| "loss": 2.179, | |
| "step": 24950 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 6.344839096069336, | |
| "learning_rate": 3.38112267614088e-06, | |
| "loss": 2.6844, | |
| "step": 24960 | |
| }, | |
| { | |
| "epoch": 1.84, | |
| "grad_norm": 4.554666519165039, | |
| "learning_rate": 3.3497011836459258e-06, | |
| "loss": 2.5045, | |
| "step": 24970 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 7.463393688201904, | |
| "learning_rate": 3.3184238897244093e-06, | |
| "loss": 2.6915, | |
| "step": 24980 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 5.385898590087891, | |
| "learning_rate": 3.287290841040902e-06, | |
| "loss": 2.5424, | |
| "step": 24990 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 4.146659851074219, | |
| "learning_rate": 3.2563020840447157e-06, | |
| "loss": 2.1064, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "eval_loss": 2.6555445194244385, | |
| "eval_runtime": 1094.8064, | |
| "eval_samples_per_second": 5.206, | |
| "eval_steps_per_second": 5.206, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 4.334985733032227, | |
| "learning_rate": 3.2254576649698777e-06, | |
| "loss": 2.5139, | |
| "step": 25010 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 9.473915100097656, | |
| "learning_rate": 3.1947576298351214e-06, | |
| "loss": 2.3403, | |
| "step": 25020 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 6.397850036621094, | |
| "learning_rate": 3.164202024443719e-06, | |
| "loss": 2.2274, | |
| "step": 25030 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 6.480834007263184, | |
| "learning_rate": 3.133790894383459e-06, | |
| "loss": 2.3635, | |
| "step": 25040 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 4.56965446472168, | |
| "learning_rate": 3.1035242850266154e-06, | |
| "loss": 2.3934, | |
| "step": 25050 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 5.493187427520752, | |
| "learning_rate": 3.0734022415298103e-06, | |
| "loss": 2.4646, | |
| "step": 25060 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 3.9670233726501465, | |
| "learning_rate": 3.0434248088339943e-06, | |
| "loss": 2.6645, | |
| "step": 25070 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 5.613986492156982, | |
| "learning_rate": 3.0135920316643362e-06, | |
| "loss": 2.7214, | |
| "step": 25080 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 3.3827364444732666, | |
| "learning_rate": 2.9839039545302207e-06, | |
| "loss": 2.4379, | |
| "step": 25090 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 6.201570987701416, | |
| "learning_rate": 2.9543606217251384e-06, | |
| "loss": 2.6216, | |
| "step": 25100 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 6.150888919830322, | |
| "learning_rate": 2.9249620773266095e-06, | |
| "loss": 2.4708, | |
| "step": 25110 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 5.124236583709717, | |
| "learning_rate": 2.895708365196148e-06, | |
| "loss": 2.3435, | |
| "step": 25120 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 4.904949188232422, | |
| "learning_rate": 2.8665995289791745e-06, | |
| "loss": 2.2964, | |
| "step": 25130 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 3.3704028129577637, | |
| "learning_rate": 2.8376356121049717e-06, | |
| "loss": 2.3127, | |
| "step": 25140 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 5.626865386962891, | |
| "learning_rate": 2.808816657786617e-06, | |
| "loss": 2.2965, | |
| "step": 25150 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 6.694971084594727, | |
| "learning_rate": 2.780142709020861e-06, | |
| "loss": 2.5454, | |
| "step": 25160 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 5.319484233856201, | |
| "learning_rate": 2.751613808588183e-06, | |
| "loss": 2.5326, | |
| "step": 25170 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 6.219109058380127, | |
| "learning_rate": 2.7232299990526013e-06, | |
| "loss": 2.5755, | |
| "step": 25180 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 7.463380336761475, | |
| "learning_rate": 2.694991322761675e-06, | |
| "loss": 2.4964, | |
| "step": 25190 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 4.71378231048584, | |
| "learning_rate": 2.666897821846448e-06, | |
| "loss": 2.4468, | |
| "step": 25200 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "eval_loss": 2.655106782913208, | |
| "eval_runtime": 1097.6812, | |
| "eval_samples_per_second": 5.193, | |
| "eval_steps_per_second": 5.193, | |
| "step": 25200 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 4.85548734664917, | |
| "learning_rate": 2.638949538221347e-06, | |
| "loss": 2.112, | |
| "step": 25210 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 6.407068729400635, | |
| "learning_rate": 2.6111465135841507e-06, | |
| "loss": 2.7188, | |
| "step": 25220 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 4.663290500640869, | |
| "learning_rate": 2.583488789415922e-06, | |
| "loss": 2.5207, | |
| "step": 25230 | |
| }, | |
| { | |
| "epoch": 1.86, | |
| "grad_norm": 5.210723876953125, | |
| "learning_rate": 2.555976406980942e-06, | |
| "loss": 2.6299, | |
| "step": 25240 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 3.8297393321990967, | |
| "learning_rate": 2.5286094073266097e-06, | |
| "loss": 2.2596, | |
| "step": 25250 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 3.5863406658172607, | |
| "learning_rate": 2.5013878312834747e-06, | |
| "loss": 2.4618, | |
| "step": 25260 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 5.100343227386475, | |
| "learning_rate": 2.4743117194650834e-06, | |
| "loss": 2.4822, | |
| "step": 25270 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 5.481692314147949, | |
| "learning_rate": 2.447381112267977e-06, | |
| "loss": 2.683, | |
| "step": 25280 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 6.0729851722717285, | |
| "learning_rate": 2.420596049871593e-06, | |
| "loss": 2.4862, | |
| "step": 25290 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 9.472423553466797, | |
| "learning_rate": 2.3939565722382207e-06, | |
| "loss": 2.43, | |
| "step": 25300 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 5.9718523025512695, | |
| "learning_rate": 2.3674627191129452e-06, | |
| "loss": 2.2668, | |
| "step": 25310 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 6.822712421417236, | |
| "learning_rate": 2.3411145300235915e-06, | |
| "loss": 2.4001, | |
| "step": 25320 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 6.996267318725586, | |
| "learning_rate": 2.3149120442806814e-06, | |
| "loss": 2.6037, | |
| "step": 25330 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 6.17630672454834, | |
| "learning_rate": 2.2888553009772997e-06, | |
| "loss": 2.6959, | |
| "step": 25340 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 6.863979339599609, | |
| "learning_rate": 2.2629443389891148e-06, | |
| "loss": 2.6952, | |
| "step": 25350 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 8.45169734954834, | |
| "learning_rate": 2.237179196974315e-06, | |
| "loss": 2.7508, | |
| "step": 25360 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 5.637682914733887, | |
| "learning_rate": 2.2115599133734952e-06, | |
| "loss": 2.6583, | |
| "step": 25370 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 5.1772918701171875, | |
| "learning_rate": 2.1860865264096808e-06, | |
| "loss": 2.499, | |
| "step": 25380 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 6.219912052154541, | |
| "learning_rate": 2.1607590740881813e-06, | |
| "loss": 2.5316, | |
| "step": 25390 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 5.400609970092773, | |
| "learning_rate": 2.1355775941965804e-06, | |
| "loss": 2.4839, | |
| "step": 25400 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "eval_loss": 2.655069589614868, | |
| "eval_runtime": 1097.8052, | |
| "eval_samples_per_second": 5.192, | |
| "eval_steps_per_second": 5.192, | |
| "step": 25400 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 5.726144313812256, | |
| "learning_rate": 2.1105421243047043e-06, | |
| "loss": 2.7813, | |
| "step": 25410 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 6.688289642333984, | |
| "learning_rate": 2.0856527017645176e-06, | |
| "loss": 2.5251, | |
| "step": 25420 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 6.891797065734863, | |
| "learning_rate": 2.060909363710106e-06, | |
| "loss": 2.6199, | |
| "step": 25430 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 6.396704196929932, | |
| "learning_rate": 2.036312147057573e-06, | |
| "loss": 2.3888, | |
| "step": 25440 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 3.867151975631714, | |
| "learning_rate": 2.0118610885050295e-06, | |
| "loss": 2.291, | |
| "step": 25450 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 6.082787036895752, | |
| "learning_rate": 1.9875562245325384e-06, | |
| "loss": 2.5563, | |
| "step": 25460 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 5.629850387573242, | |
| "learning_rate": 1.963397591402016e-06, | |
| "loss": 2.4667, | |
| "step": 25470 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 6.9120774269104, | |
| "learning_rate": 1.939385225157253e-06, | |
| "loss": 2.5586, | |
| "step": 25480 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 5.51324462890625, | |
| "learning_rate": 1.91551916162378e-06, | |
| "loss": 2.625, | |
| "step": 25490 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 4.947356224060059, | |
| "learning_rate": 1.8917994364088254e-06, | |
| "loss": 2.6076, | |
| "step": 25500 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 4.116830825805664, | |
| "learning_rate": 1.8682260849013478e-06, | |
| "loss": 2.2131, | |
| "step": 25510 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 4.880571365356445, | |
| "learning_rate": 1.8447991422718914e-06, | |
| "loss": 2.5583, | |
| "step": 25520 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 7.822117805480957, | |
| "learning_rate": 1.821518643472564e-06, | |
| "loss": 2.684, | |
| "step": 25530 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 6.742255210876465, | |
| "learning_rate": 1.7983846232369594e-06, | |
| "loss": 2.4451, | |
| "step": 25540 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 8.71749496459961, | |
| "learning_rate": 1.7753971160802018e-06, | |
| "loss": 2.603, | |
| "step": 25550 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 5.900051593780518, | |
| "learning_rate": 1.7525561562987347e-06, | |
| "loss": 2.7087, | |
| "step": 25560 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 6.159276485443115, | |
| "learning_rate": 1.7298617779704208e-06, | |
| "loss": 2.5132, | |
| "step": 25570 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 5.493851661682129, | |
| "learning_rate": 1.7073140149544197e-06, | |
| "loss": 2.4985, | |
| "step": 25580 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 4.474180221557617, | |
| "learning_rate": 1.6849129008911224e-06, | |
| "loss": 2.3737, | |
| "step": 25590 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 9.486087799072266, | |
| "learning_rate": 1.6626584692021497e-06, | |
| "loss": 2.4829, | |
| "step": 25600 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "eval_loss": 2.6546285152435303, | |
| "eval_runtime": 1096.3114, | |
| "eval_samples_per_second": 5.199, | |
| "eval_steps_per_second": 5.199, | |
| "step": 25600 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 5.633112907409668, | |
| "learning_rate": 1.6405507530902643e-06, | |
| "loss": 2.6532, | |
| "step": 25610 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 6.957579135894775, | |
| "learning_rate": 1.6185897855393372e-06, | |
| "loss": 2.4989, | |
| "step": 25620 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 6.723416805267334, | |
| "learning_rate": 1.596775599314293e-06, | |
| "loss": 2.5217, | |
| "step": 25630 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 8.012822151184082, | |
| "learning_rate": 1.575108226961075e-06, | |
| "loss": 2.7455, | |
| "step": 25640 | |
| }, | |
| { | |
| "epoch": 1.89, | |
| "grad_norm": 4.816512107849121, | |
| "learning_rate": 1.5535877008065802e-06, | |
| "loss": 2.3831, | |
| "step": 25650 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 4.9410881996154785, | |
| "learning_rate": 1.5322140529586137e-06, | |
| "loss": 2.8791, | |
| "step": 25660 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 7.129745960235596, | |
| "learning_rate": 1.5109873153058562e-06, | |
| "loss": 2.6591, | |
| "step": 25670 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 6.4482526779174805, | |
| "learning_rate": 1.4899075195177747e-06, | |
| "loss": 2.5458, | |
| "step": 25680 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 7.3847856521606445, | |
| "learning_rate": 1.4689746970446228e-06, | |
| "loss": 2.6046, | |
| "step": 25690 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 7.786729335784912, | |
| "learning_rate": 1.448188879117407e-06, | |
| "loss": 2.6478, | |
| "step": 25700 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 4.2452592849731445, | |
| "learning_rate": 1.4275500967477428e-06, | |
| "loss": 2.2543, | |
| "step": 25710 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 8.031307220458984, | |
| "learning_rate": 1.4070583807279325e-06, | |
| "loss": 2.6764, | |
| "step": 25720 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 7.834446907043457, | |
| "learning_rate": 1.3867137616308312e-06, | |
| "loss": 2.1737, | |
| "step": 25730 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 5.337544918060303, | |
| "learning_rate": 1.3665162698098255e-06, | |
| "loss": 2.4626, | |
| "step": 25740 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 6.047445774078369, | |
| "learning_rate": 1.3464659353988218e-06, | |
| "loss": 2.5175, | |
| "step": 25750 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 6.275997638702393, | |
| "learning_rate": 1.3265627883121467e-06, | |
| "loss": 2.547, | |
| "step": 25760 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 7.569523811340332, | |
| "learning_rate": 1.306806858244547e-06, | |
| "loss": 2.2549, | |
| "step": 25770 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 5.868937969207764, | |
| "learning_rate": 1.2871981746711115e-06, | |
| "loss": 2.445, | |
| "step": 25780 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 6.172995567321777, | |
| "learning_rate": 1.2677367668472607e-06, | |
| "loss": 2.4238, | |
| "step": 25790 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.2079949378967285, | |
| "learning_rate": 1.2484226638086682e-06, | |
| "loss": 2.4737, | |
| "step": 25800 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "eval_loss": 2.6542229652404785, | |
| "eval_runtime": 1089.7943, | |
| "eval_samples_per_second": 5.23, | |
| "eval_steps_per_second": 5.23, | |
| "step": 25800 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 4.673678874969482, | |
| "learning_rate": 1.2292558943712619e-06, | |
| "loss": 2.4163, | |
| "step": 25810 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.8100481033325195, | |
| "learning_rate": 1.210236487131089e-06, | |
| "loss": 2.7093, | |
| "step": 25820 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 6.0081610679626465, | |
| "learning_rate": 1.1913644704644288e-06, | |
| "loss": 2.7016, | |
| "step": 25830 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 4.318962574005127, | |
| "learning_rate": 1.172639872527581e-06, | |
| "loss": 2.2921, | |
| "step": 25840 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 6.901121616363525, | |
| "learning_rate": 1.1540627212569433e-06, | |
| "loss": 2.6351, | |
| "step": 25850 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.046151161193848, | |
| "learning_rate": 1.1356330443689445e-06, | |
| "loss": 2.7171, | |
| "step": 25860 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.555967330932617, | |
| "learning_rate": 1.1173508693599344e-06, | |
| "loss": 2.46, | |
| "step": 25870 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 4.512118816375732, | |
| "learning_rate": 1.0992162235062164e-06, | |
| "loss": 2.4003, | |
| "step": 25880 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.666736602783203, | |
| "learning_rate": 1.0812291338640145e-06, | |
| "loss": 2.6762, | |
| "step": 25890 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 6.129502296447754, | |
| "learning_rate": 1.0633896272693732e-06, | |
| "loss": 2.5756, | |
| "step": 25900 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.501920223236084, | |
| "learning_rate": 1.0456977303381688e-06, | |
| "loss": 2.3172, | |
| "step": 25910 | |
| }, | |
| { | |
| "epoch": 1.91, | |
| "grad_norm": 5.519867420196533, | |
| "learning_rate": 1.028153469466031e-06, | |
| "loss": 2.538, | |
| "step": 25920 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 6.417172431945801, | |
| "learning_rate": 1.0107568708283222e-06, | |
| "loss": 2.5725, | |
| "step": 25930 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.723873615264893, | |
| "learning_rate": 9.935079603801244e-07, | |
| "loss": 2.5679, | |
| "step": 25940 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.8061065673828125, | |
| "learning_rate": 9.764067638561415e-07, | |
| "loss": 2.603, | |
| "step": 25950 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 7.154747009277344, | |
| "learning_rate": 9.59453306770719e-07, | |
| "loss": 2.2465, | |
| "step": 25960 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.935358047485352, | |
| "learning_rate": 9.426476144177576e-07, | |
| "loss": 2.7148, | |
| "step": 25970 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 6.310463905334473, | |
| "learning_rate": 9.259897118707228e-07, | |
| "loss": 2.5083, | |
| "step": 25980 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.4176926612854, | |
| "learning_rate": 9.094796239825787e-07, | |
| "loss": 2.7756, | |
| "step": 25990 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 6.910298824310303, | |
| "learning_rate": 8.931173753857325e-07, | |
| "loss": 2.6436, | |
| "step": 26000 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "eval_loss": 2.6540627479553223, | |
| "eval_runtime": 1093.6164, | |
| "eval_samples_per_second": 5.212, | |
| "eval_steps_per_second": 5.212, | |
| "step": 26000 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.972805500030518, | |
| "learning_rate": 8.769029904920456e-07, | |
| "loss": 2.5209, | |
| "step": 26010 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.985231876373291, | |
| "learning_rate": 8.60836493492767e-07, | |
| "loss": 2.5231, | |
| "step": 26020 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 7.196133136749268, | |
| "learning_rate": 8.44917908358489e-07, | |
| "loss": 2.7249, | |
| "step": 26030 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 5.080741882324219, | |
| "learning_rate": 8.291472588391469e-07, | |
| "loss": 2.4597, | |
| "step": 26040 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 4.692221164703369, | |
| "learning_rate": 8.135245684639526e-07, | |
| "loss": 2.5251, | |
| "step": 26050 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 4.760748386383057, | |
| "learning_rate": 7.9804986054135e-07, | |
| "loss": 2.5533, | |
| "step": 26060 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 5.430874347686768, | |
| "learning_rate": 7.827231581590377e-07, | |
| "loss": 2.7045, | |
| "step": 26070 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 3.716386079788208, | |
| "learning_rate": 7.675444841838575e-07, | |
| "loss": 2.2073, | |
| "step": 26080 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 7.227940082550049, | |
| "learning_rate": 7.525138612618166e-07, | |
| "loss": 2.7283, | |
| "step": 26090 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 5.73671817779541, | |
| "learning_rate": 7.376313118180322e-07, | |
| "loss": 2.3235, | |
| "step": 26100 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 4.938995361328125, | |
| "learning_rate": 7.228968580567097e-07, | |
| "loss": 2.3111, | |
| "step": 26110 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 4.570291042327881, | |
| "learning_rate": 7.083105219610975e-07, | |
| "loss": 2.4974, | |
| "step": 26120 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 6.675302505493164, | |
| "learning_rate": 6.93872325293432e-07, | |
| "loss": 2.4026, | |
| "step": 26130 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 3.6706745624542236, | |
| "learning_rate": 6.79582289594971e-07, | |
| "loss": 2.6083, | |
| "step": 26140 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 6.997994899749756, | |
| "learning_rate": 6.654404361859156e-07, | |
| "loss": 2.636, | |
| "step": 26150 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 3.7949180603027344, | |
| "learning_rate": 6.51446786165355e-07, | |
| "loss": 2.6478, | |
| "step": 26160 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 6.412059307098389, | |
| "learning_rate": 6.376013604112885e-07, | |
| "loss": 2.4066, | |
| "step": 26170 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 7.183565616607666, | |
| "learning_rate": 6.2390417958057e-07, | |
| "loss": 2.6993, | |
| "step": 26180 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 6.4794020652771, | |
| "learning_rate": 6.103552641088639e-07, | |
| "loss": 2.3288, | |
| "step": 26190 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 7.5243611335754395, | |
| "learning_rate": 5.969546342106558e-07, | |
| "loss": 2.5551, | |
| "step": 26200 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "eval_loss": 2.6537866592407227, | |
| "eval_runtime": 1093.9884, | |
| "eval_samples_per_second": 5.21, | |
| "eval_steps_per_second": 5.21, | |
| "step": 26200 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 5.41322660446167, | |
| "learning_rate": 5.837023098791417e-07, | |
| "loss": 2.472, | |
| "step": 26210 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 3.8366689682006836, | |
| "learning_rate": 5.705983108863278e-07, | |
| "loss": 2.5584, | |
| "step": 26220 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 6.729165077209473, | |
| "learning_rate": 5.57642656782853e-07, | |
| "loss": 2.5014, | |
| "step": 26230 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 7.120552062988281, | |
| "learning_rate": 5.448353668980666e-07, | |
| "loss": 2.9143, | |
| "step": 26240 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 6.512486457824707, | |
| "learning_rate": 5.321764603399726e-07, | |
| "loss": 2.5403, | |
| "step": 26250 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 5.751278400421143, | |
| "learning_rate": 5.196659559951633e-07, | |
| "loss": 2.5884, | |
| "step": 26260 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 6.711959362030029, | |
| "learning_rate": 5.073038725288304e-07, | |
| "loss": 2.5595, | |
| "step": 26270 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 7.284610748291016, | |
| "learning_rate": 4.950902283847537e-07, | |
| "loss": 2.2269, | |
| "step": 26280 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 4.604262828826904, | |
| "learning_rate": 4.830250417852233e-07, | |
| "loss": 2.5721, | |
| "step": 26290 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 6.925443649291992, | |
| "learning_rate": 4.7110833073101825e-07, | |
| "loss": 2.502, | |
| "step": 26300 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 3.369199752807617, | |
| "learning_rate": 4.5934011300142743e-07, | |
| "loss": 2.5734, | |
| "step": 26310 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 7.462447166442871, | |
| "learning_rate": 4.477204061542062e-07, | |
| "loss": 2.5041, | |
| "step": 26320 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 5.244159698486328, | |
| "learning_rate": 4.36249227525487e-07, | |
| "loss": 2.3157, | |
| "step": 26330 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 4.864575386047363, | |
| "learning_rate": 4.249265942298464e-07, | |
| "loss": 2.5586, | |
| "step": 26340 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 8.591397285461426, | |
| "learning_rate": 4.1375252316021576e-07, | |
| "loss": 2.6211, | |
| "step": 26350 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 5.036678791046143, | |
| "learning_rate": 4.0272703098789276e-07, | |
| "loss": 2.1728, | |
| "step": 26360 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 4.213713645935059, | |
| "learning_rate": 3.9185013416249693e-07, | |
| "loss": 2.5173, | |
| "step": 26370 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 9.083184242248535, | |
| "learning_rate": 3.8112184891192504e-07, | |
| "loss": 2.5333, | |
| "step": 26380 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 11.7958345413208, | |
| "learning_rate": 3.705421912423956e-07, | |
| "loss": 2.5472, | |
| "step": 26390 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 4.839986801147461, | |
| "learning_rate": 3.6011117693833806e-07, | |
| "loss": 2.5423, | |
| "step": 26400 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "eval_loss": 2.6536054611206055, | |
| "eval_runtime": 1094.3772, | |
| "eval_samples_per_second": 5.208, | |
| "eval_steps_per_second": 5.208, | |
| "step": 26400 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 5.843730926513672, | |
| "learning_rate": 3.498288215624257e-07, | |
| "loss": 2.537, | |
| "step": 26410 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 7.053458213806152, | |
| "learning_rate": 3.396951404555648e-07, | |
| "loss": 2.5372, | |
| "step": 26420 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 4.698965072631836, | |
| "learning_rate": 3.2971014873680597e-07, | |
| "loss": 2.2936, | |
| "step": 26430 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 5.811645984649658, | |
| "learning_rate": 3.198738613033769e-07, | |
| "loss": 2.7739, | |
| "step": 26440 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 6.532294750213623, | |
| "learning_rate": 3.101862928306498e-07, | |
| "loss": 2.5593, | |
| "step": 26450 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 5.7458367347717285, | |
| "learning_rate": 3.0064745777210745e-07, | |
| "loss": 2.4244, | |
| "step": 26460 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 4.933990478515625, | |
| "learning_rate": 2.912573703593324e-07, | |
| "loss": 2.4246, | |
| "step": 26470 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 5.212098598480225, | |
| "learning_rate": 2.8201604460197375e-07, | |
| "loss": 2.666, | |
| "step": 26480 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 7.725255489349365, | |
| "learning_rate": 2.7292349428773567e-07, | |
| "loss": 2.2872, | |
| "step": 26490 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 6.296080112457275, | |
| "learning_rate": 2.639797329823668e-07, | |
| "loss": 2.4227, | |
| "step": 26500 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 5.026681423187256, | |
| "learning_rate": 2.551847740296154e-07, | |
| "loss": 2.5354, | |
| "step": 26510 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 5.291750907897949, | |
| "learning_rate": 2.465386305512185e-07, | |
| "loss": 2.3962, | |
| "step": 26520 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 3.936063766479492, | |
| "learning_rate": 2.380413154469019e-07, | |
| "loss": 2.5252, | |
| "step": 26530 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 8.992650985717773, | |
| "learning_rate": 2.2969284139433555e-07, | |
| "loss": 2.4413, | |
| "step": 26540 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 7.641388893127441, | |
| "learning_rate": 2.2149322084913381e-07, | |
| "loss": 2.6156, | |
| "step": 26550 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 4.50031042098999, | |
| "learning_rate": 2.134424660447998e-07, | |
| "loss": 2.5348, | |
| "step": 26560 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 6.620706558227539, | |
| "learning_rate": 2.0554058899275863e-07, | |
| "loss": 2.2697, | |
| "step": 26570 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 5.6808085441589355, | |
| "learning_rate": 1.9778760148232434e-07, | |
| "loss": 2.6806, | |
| "step": 26580 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 5.3663506507873535, | |
| "learning_rate": 1.9018351508065524e-07, | |
| "loss": 2.5661, | |
| "step": 26590 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 6.384164333343506, | |
| "learning_rate": 1.8272834113275406e-07, | |
| "loss": 2.4298, | |
| "step": 26600 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "eval_loss": 2.6534934043884277, | |
| "eval_runtime": 1096.2312, | |
| "eval_samples_per_second": 5.2, | |
| "eval_steps_per_second": 5.2, | |
| "step": 26600 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 6.136931896209717, | |
| "learning_rate": 1.7542209076144567e-07, | |
| "loss": 2.4511, | |
| "step": 26610 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 7.29750919342041, | |
| "learning_rate": 1.6826477486741045e-07, | |
| "loss": 2.5982, | |
| "step": 26620 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 4.461855411529541, | |
| "learning_rate": 1.6125640412906207e-07, | |
| "loss": 2.3932, | |
| "step": 26630 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 4.770211219787598, | |
| "learning_rate": 1.5439698900262534e-07, | |
| "loss": 2.4409, | |
| "step": 26640 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 3.745713710784912, | |
| "learning_rate": 1.4768653972210277e-07, | |
| "loss": 2.433, | |
| "step": 26650 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 5.597508907318115, | |
| "learning_rate": 1.4112506629923029e-07, | |
| "loss": 2.5078, | |
| "step": 26660 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 4.793899059295654, | |
| "learning_rate": 1.3471257852345487e-07, | |
| "loss": 2.1771, | |
| "step": 26670 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 10.311989784240723, | |
| "learning_rate": 1.2844908596199023e-07, | |
| "loss": 2.6082, | |
| "step": 26680 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 4.9989118576049805, | |
| "learning_rate": 1.223345979597057e-07, | |
| "loss": 2.551, | |
| "step": 26690 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 5.613187789916992, | |
| "learning_rate": 1.1636912363920393e-07, | |
| "loss": 2.4562, | |
| "step": 26700 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 5.113211631774902, | |
| "learning_rate": 1.1055267190074325e-07, | |
| "loss": 2.3301, | |
| "step": 26710 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 7.665001392364502, | |
| "learning_rate": 1.048852514222376e-07, | |
| "loss": 2.4143, | |
| "step": 26720 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 5.974045276641846, | |
| "learning_rate": 9.936687065926764e-08, | |
| "loss": 2.7031, | |
| "step": 26730 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 4.682978630065918, | |
| "learning_rate": 9.39975378450586e-08, | |
| "loss": 2.4894, | |
| "step": 26740 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 6.042008399963379, | |
| "learning_rate": 8.877726099043582e-08, | |
| "loss": 2.5057, | |
| "step": 26750 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 5.749847888946533, | |
| "learning_rate": 8.370604788385806e-08, | |
| "loss": 2.3572, | |
| "step": 26760 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 3.9606752395629883, | |
| "learning_rate": 7.87839060913953e-08, | |
| "loss": 2.414, | |
| "step": 26770 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 7.164281845092773, | |
| "learning_rate": 7.401084295667327e-08, | |
| "loss": 2.2284, | |
| "step": 26780 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 5.0891547203063965, | |
| "learning_rate": 6.938686560093999e-08, | |
| "loss": 2.3254, | |
| "step": 26790 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 5.734001159667969, | |
| "learning_rate": 6.491198092298811e-08, | |
| "loss": 2.5871, | |
| "step": 26800 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "eval_loss": 2.6534903049468994, | |
| "eval_runtime": 1095.7983, | |
| "eval_samples_per_second": 5.202, | |
| "eval_steps_per_second": 5.202, | |
| "step": 26800 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 7.397612571716309, | |
| "learning_rate": 6.058619559917711e-08, | |
| "loss": 2.6794, | |
| "step": 26810 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 4.204326629638672, | |
| "learning_rate": 5.640951608339995e-08, | |
| "loss": 2.5394, | |
| "step": 26820 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 8.067238807678223, | |
| "learning_rate": 5.238194860712753e-08, | |
| "loss": 2.5528, | |
| "step": 26830 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 3.9365627765655518, | |
| "learning_rate": 4.8503499179319844e-08, | |
| "loss": 2.5808, | |
| "step": 26840 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 5.15150785446167, | |
| "learning_rate": 4.47741735864815e-08, | |
| "loss": 2.3032, | |
| "step": 26850 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 7.398310661315918, | |
| "learning_rate": 4.1193977392628425e-08, | |
| "loss": 2.4599, | |
| "step": 26860 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 5.485527515411377, | |
| "learning_rate": 3.776291593927672e-08, | |
| "loss": 2.6419, | |
| "step": 26870 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 6.389936447143555, | |
| "learning_rate": 3.448099434543162e-08, | |
| "loss": 2.4881, | |
| "step": 26880 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 4.455927848815918, | |
| "learning_rate": 3.134821750759853e-08, | |
| "loss": 2.4383, | |
| "step": 26890 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 3.46675968170166, | |
| "learning_rate": 2.8364590099771992e-08, | |
| "loss": 2.3959, | |
| "step": 26900 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 5.440370559692383, | |
| "learning_rate": 2.5530116573391216e-08, | |
| "loss": 2.4442, | |
| "step": 26910 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 6.947876453399658, | |
| "learning_rate": 2.2844801157406726e-08, | |
| "loss": 2.407, | |
| "step": 26920 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 4.38772439956665, | |
| "learning_rate": 2.030864785818043e-08, | |
| "loss": 2.5157, | |
| "step": 26930 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 7.698976993560791, | |
| "learning_rate": 1.7921660459574442e-08, | |
| "loss": 2.5359, | |
| "step": 26940 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 4.17779016494751, | |
| "learning_rate": 1.5683842522884462e-08, | |
| "loss": 2.3679, | |
| "step": 26950 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 5.525791645050049, | |
| "learning_rate": 1.359519738685089e-08, | |
| "loss": 2.6091, | |
| "step": 26960 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 5.552348613739014, | |
| "learning_rate": 1.1655728167636603e-08, | |
| "loss": 2.4131, | |
| "step": 26970 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 8.300748825073242, | |
| "learning_rate": 9.865437758871387e-09, | |
| "loss": 2.5513, | |
| "step": 26980 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 5.163261890411377, | |
| "learning_rate": 8.224328831596405e-09, | |
| "loss": 2.6024, | |
| "step": 26990 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 7.43178129196167, | |
| "learning_rate": 6.732403834275314e-09, | |
| "loss": 2.5353, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "eval_loss": 2.6534905433654785, | |
| "eval_runtime": 1093.314, | |
| "eval_samples_per_second": 5.214, | |
| "eval_steps_per_second": 5.214, | |
| "step": 27000 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 27074, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 200, | |
| "total_flos": 1.1035098369036288e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |