Instructions to use alexiaassis/Modelo-Treinado-Gemma3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use alexiaassis/Modelo-Treinado-Gemma3 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/gemma-3-12b-it-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "alexiaassis/Modelo-Treinado-Gemma3") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use alexiaassis/Modelo-Treinado-Gemma3 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for alexiaassis/Modelo-Treinado-Gemma3 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for alexiaassis/Modelo-Treinado-Gemma3 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for alexiaassis/Modelo-Treinado-Gemma3 to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="alexiaassis/Modelo-Treinado-Gemma3", max_seq_length=2048, )
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 1395, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.021528525296017224, | |
| "grad_norm": 16.47992515563965, | |
| "learning_rate": 9.998973021172564e-06, | |
| "loss": 1.7834, | |
| "num_input_tokens_seen": 43648, | |
| "step": 10, | |
| "train_runtime": 64.3878, | |
| "train_tokens_per_second": 677.892 | |
| }, | |
| { | |
| "epoch": 0.04305705059203445, | |
| "grad_norm": 16.372161865234375, | |
| "learning_rate": 9.995423512524277e-06, | |
| "loss": 0.7676, | |
| "num_input_tokens_seen": 87072, | |
| "step": 20, | |
| "train_runtime": 95.1979, | |
| "train_tokens_per_second": 914.642 | |
| }, | |
| { | |
| "epoch": 0.06458557588805167, | |
| "grad_norm": 11.686817169189453, | |
| "learning_rate": 9.98934059499448e-06, | |
| "loss": 0.5817, | |
| "num_input_tokens_seen": 131520, | |
| "step": 30, | |
| "train_runtime": 126.5065, | |
| "train_tokens_per_second": 1039.63 | |
| }, | |
| { | |
| "epoch": 0.0861141011840689, | |
| "grad_norm": 3.2975926399230957, | |
| "learning_rate": 9.980727353510257e-06, | |
| "loss": 0.3531, | |
| "num_input_tokens_seen": 175680, | |
| "step": 40, | |
| "train_runtime": 157.6702, | |
| "train_tokens_per_second": 1114.225 | |
| }, | |
| { | |
| "epoch": 0.10764262648008611, | |
| "grad_norm": 3.4886627197265625, | |
| "learning_rate": 9.969588156242282e-06, | |
| "loss": 0.3352, | |
| "num_input_tokens_seen": 219584, | |
| "step": 50, | |
| "train_runtime": 188.7104, | |
| "train_tokens_per_second": 1163.603 | |
| }, | |
| { | |
| "epoch": 0.12917115177610333, | |
| "grad_norm": 3.484487295150757, | |
| "learning_rate": 9.95592865238951e-06, | |
| "loss": 0.2298, | |
| "num_input_tokens_seen": 263392, | |
| "step": 60, | |
| "train_runtime": 219.7077, | |
| "train_tokens_per_second": 1198.829 | |
| }, | |
| { | |
| "epoch": 0.15069967707212056, | |
| "grad_norm": 4.422971725463867, | |
| "learning_rate": 9.939755769314215e-06, | |
| "loss": 0.1981, | |
| "num_input_tokens_seen": 306912, | |
| "step": 70, | |
| "train_runtime": 250.6069, | |
| "train_tokens_per_second": 1224.675 | |
| }, | |
| { | |
| "epoch": 0.1722282023681378, | |
| "grad_norm": 1.4185198545455933, | |
| "learning_rate": 9.9210777090288e-06, | |
| "loss": 0.1755, | |
| "num_input_tokens_seen": 349824, | |
| "step": 80, | |
| "train_runtime": 281.2405, | |
| "train_tokens_per_second": 1243.86 | |
| }, | |
| { | |
| "epoch": 0.193756727664155, | |
| "grad_norm": 1.1935056447982788, | |
| "learning_rate": 9.899903944036185e-06, | |
| "loss": 0.1791, | |
| "num_input_tokens_seen": 393664, | |
| "step": 90, | |
| "train_runtime": 312.2075, | |
| "train_tokens_per_second": 1260.905 | |
| }, | |
| { | |
| "epoch": 0.21528525296017223, | |
| "grad_norm": 2.463397741317749, | |
| "learning_rate": 9.87624521252587e-06, | |
| "loss": 0.2051, | |
| "num_input_tokens_seen": 437952, | |
| "step": 100, | |
| "train_runtime": 343.3508, | |
| "train_tokens_per_second": 1275.523 | |
| }, | |
| { | |
| "epoch": 0.23681377825618946, | |
| "grad_norm": 3.8650355339050293, | |
| "learning_rate": 9.850113512928094e-06, | |
| "loss": 0.1912, | |
| "num_input_tokens_seen": 481472, | |
| "step": 110, | |
| "train_runtime": 374.2539, | |
| "train_tokens_per_second": 1286.485 | |
| }, | |
| { | |
| "epoch": 0.25834230355220666, | |
| "grad_norm": 4.704444885253906, | |
| "learning_rate": 9.821522097828884e-06, | |
| "loss": 0.1637, | |
| "num_input_tokens_seen": 525472, | |
| "step": 120, | |
| "train_runtime": 405.4374, | |
| "train_tokens_per_second": 1296.062 | |
| }, | |
| { | |
| "epoch": 0.2798708288482239, | |
| "grad_norm": 2.7267754077911377, | |
| "learning_rate": 9.790485467249065e-06, | |
| "loss": 0.1537, | |
| "num_input_tokens_seen": 569696, | |
| "step": 130, | |
| "train_runtime": 436.4834, | |
| "train_tokens_per_second": 1305.195 | |
| }, | |
| { | |
| "epoch": 0.3013993541442411, | |
| "grad_norm": 3.512826681137085, | |
| "learning_rate": 9.757019361290621e-06, | |
| "loss": 0.1846, | |
| "num_input_tokens_seen": 613760, | |
| "step": 140, | |
| "train_runtime": 467.5968, | |
| "train_tokens_per_second": 1312.584 | |
| }, | |
| { | |
| "epoch": 0.32292787944025836, | |
| "grad_norm": 2.484517812728882, | |
| "learning_rate": 9.721140752154182e-06, | |
| "loss": 0.1872, | |
| "num_input_tokens_seen": 657824, | |
| "step": 150, | |
| "train_runtime": 498.6389, | |
| "train_tokens_per_second": 1319.239 | |
| }, | |
| { | |
| "epoch": 0.3444564047362756, | |
| "grad_norm": 2.296607255935669, | |
| "learning_rate": 9.682867835531624e-06, | |
| "loss": 0.1372, | |
| "num_input_tokens_seen": 701760, | |
| "step": 160, | |
| "train_runtime": 529.7256, | |
| "train_tokens_per_second": 1324.761 | |
| }, | |
| { | |
| "epoch": 0.36598493003229277, | |
| "grad_norm": 3.887946128845215, | |
| "learning_rate": 9.642220021378212e-06, | |
| "loss": 0.2028, | |
| "num_input_tokens_seen": 745184, | |
| "step": 170, | |
| "train_runtime": 560.5239, | |
| "train_tokens_per_second": 1329.442 | |
| }, | |
| { | |
| "epoch": 0.38751345532831, | |
| "grad_norm": 2.1227307319641113, | |
| "learning_rate": 9.59921792406891e-06, | |
| "loss": 0.1765, | |
| "num_input_tokens_seen": 789216, | |
| "step": 180, | |
| "train_runtime": 591.5958, | |
| "train_tokens_per_second": 1334.046 | |
| }, | |
| { | |
| "epoch": 0.40904198062432723, | |
| "grad_norm": 3.007882595062256, | |
| "learning_rate": 9.553883351943882e-06, | |
| "loss": 0.1882, | |
| "num_input_tokens_seen": 832960, | |
| "step": 190, | |
| "train_runtime": 622.6094, | |
| "train_tokens_per_second": 1337.853 | |
| }, | |
| { | |
| "epoch": 0.43057050592034446, | |
| "grad_norm": 1.8637208938598633, | |
| "learning_rate": 9.506239296248497e-06, | |
| "loss": 0.1336, | |
| "num_input_tokens_seen": 877664, | |
| "step": 200, | |
| "train_runtime": 654.0867, | |
| "train_tokens_per_second": 1341.816 | |
| }, | |
| { | |
| "epoch": 0.4520990312163617, | |
| "grad_norm": 1.1324244737625122, | |
| "learning_rate": 9.456309919473384e-06, | |
| "loss": 0.1521, | |
| "num_input_tokens_seen": 921536, | |
| "step": 210, | |
| "train_runtime": 685.133, | |
| "train_tokens_per_second": 1345.047 | |
| }, | |
| { | |
| "epoch": 0.4736275565123789, | |
| "grad_norm": 3.536208391189575, | |
| "learning_rate": 9.404120543100553e-06, | |
| "loss": 0.1864, | |
| "num_input_tokens_seen": 965344, | |
| "step": 220, | |
| "train_runtime": 716.7323, | |
| "train_tokens_per_second": 1346.868 | |
| }, | |
| { | |
| "epoch": 0.4951560818083961, | |
| "grad_norm": 1.73074209690094, | |
| "learning_rate": 9.34969763476168e-06, | |
| "loss": 0.1625, | |
| "num_input_tokens_seen": 1008672, | |
| "step": 230, | |
| "train_runtime": 747.5266, | |
| "train_tokens_per_second": 1349.346 | |
| }, | |
| { | |
| "epoch": 0.5166846071044133, | |
| "grad_norm": 1.4830386638641357, | |
| "learning_rate": 9.293068794815175e-06, | |
| "loss": 0.1456, | |
| "num_input_tokens_seen": 1051936, | |
| "step": 240, | |
| "train_runtime": 778.3038, | |
| "train_tokens_per_second": 1351.575 | |
| }, | |
| { | |
| "epoch": 0.5382131324004306, | |
| "grad_norm": 2.7361512184143066, | |
| "learning_rate": 9.234262742348764e-06, | |
| "loss": 0.165, | |
| "num_input_tokens_seen": 1095904, | |
| "step": 250, | |
| "train_runtime": 809.3485, | |
| "train_tokens_per_second": 1354.057 | |
| }, | |
| { | |
| "epoch": 0.5597416576964478, | |
| "grad_norm": 1.9473741054534912, | |
| "learning_rate": 9.17330930061471e-06, | |
| "loss": 0.1487, | |
| "num_input_tokens_seen": 1140064, | |
| "step": 260, | |
| "train_runtime": 840.5464, | |
| "train_tokens_per_second": 1356.337 | |
| }, | |
| { | |
| "epoch": 0.581270182992465, | |
| "grad_norm": 2.0610098838806152, | |
| "learning_rate": 9.11023938190509e-06, | |
| "loss": 0.1687, | |
| "num_input_tokens_seen": 1183872, | |
| "step": 270, | |
| "train_runtime": 871.5774, | |
| "train_tokens_per_second": 1358.31 | |
| }, | |
| { | |
| "epoch": 0.6027987082884823, | |
| "grad_norm": 3.2189598083496094, | |
| "learning_rate": 9.045084971874738e-06, | |
| "loss": 0.1511, | |
| "num_input_tokens_seen": 1228544, | |
| "step": 280, | |
| "train_runtime": 903.1191, | |
| "train_tokens_per_second": 1360.334 | |
| }, | |
| { | |
| "epoch": 0.6243272335844995, | |
| "grad_norm": 3.902757406234741, | |
| "learning_rate": 8.977879113319847e-06, | |
| "loss": 0.184, | |
| "num_input_tokens_seen": 1271968, | |
| "step": 290, | |
| "train_runtime": 934.0522, | |
| "train_tokens_per_second": 1361.774 | |
| }, | |
| { | |
| "epoch": 0.6458557588805167, | |
| "grad_norm": 4.2983012199401855, | |
| "learning_rate": 8.90865588942046e-06, | |
| "loss": 0.1305, | |
| "num_input_tokens_seen": 1316096, | |
| "step": 300, | |
| "train_runtime": 965.1778, | |
| "train_tokens_per_second": 1363.579 | |
| }, | |
| { | |
| "epoch": 0.667384284176534, | |
| "grad_norm": 2.6156394481658936, | |
| "learning_rate": 8.83745040645531e-06, | |
| "loss": 0.1405, | |
| "num_input_tokens_seen": 1360256, | |
| "step": 310, | |
| "train_runtime": 996.4077, | |
| "train_tokens_per_second": 1365.16 | |
| }, | |
| { | |
| "epoch": 0.6889128094725512, | |
| "grad_norm": 1.3506444692611694, | |
| "learning_rate": 8.764298775997823e-06, | |
| "loss": 0.1651, | |
| "num_input_tokens_seen": 1404064, | |
| "step": 320, | |
| "train_runtime": 1027.5151, | |
| "train_tokens_per_second": 1366.466 | |
| }, | |
| { | |
| "epoch": 0.7104413347685683, | |
| "grad_norm": 1.5117799043655396, | |
| "learning_rate": 8.68923809660227e-06, | |
| "loss": 0.1519, | |
| "num_input_tokens_seen": 1448256, | |
| "step": 330, | |
| "train_runtime": 1058.74, | |
| "train_tokens_per_second": 1367.905 | |
| }, | |
| { | |
| "epoch": 0.7319698600645855, | |
| "grad_norm": 1.2659231424331665, | |
| "learning_rate": 8.612306434989395e-06, | |
| "loss": 0.1574, | |
| "num_input_tokens_seen": 1492448, | |
| "step": 340, | |
| "train_runtime": 1090.0052, | |
| "train_tokens_per_second": 1369.212 | |
| }, | |
| { | |
| "epoch": 0.7534983853606028, | |
| "grad_norm": 2.6010894775390625, | |
| "learning_rate": 8.53354280674102e-06, | |
| "loss": 0.1587, | |
| "num_input_tokens_seen": 1537440, | |
| "step": 350, | |
| "train_runtime": 1121.55, | |
| "train_tokens_per_second": 1370.817 | |
| }, | |
| { | |
| "epoch": 0.77502691065662, | |
| "grad_norm": 1.6968097686767578, | |
| "learning_rate": 8.452987156513457e-06, | |
| "loss": 0.1513, | |
| "num_input_tokens_seen": 1581280, | |
| "step": 360, | |
| "train_runtime": 1152.6858, | |
| "train_tokens_per_second": 1371.822 | |
| }, | |
| { | |
| "epoch": 0.7965554359526372, | |
| "grad_norm": 2.0298380851745605, | |
| "learning_rate": 8.370680337779737e-06, | |
| "loss": 0.1401, | |
| "num_input_tokens_seen": 1625824, | |
| "step": 370, | |
| "train_runtime": 1184.3507, | |
| "train_tokens_per_second": 1372.756 | |
| }, | |
| { | |
| "epoch": 0.8180839612486545, | |
| "grad_norm": 2.7614028453826904, | |
| "learning_rate": 8.286664092110935e-06, | |
| "loss": 0.1135, | |
| "num_input_tokens_seen": 1669472, | |
| "step": 380, | |
| "train_runtime": 1215.2935, | |
| "train_tokens_per_second": 1373.719 | |
| }, | |
| { | |
| "epoch": 0.8396124865446717, | |
| "grad_norm": 1.6297581195831299, | |
| "learning_rate": 8.200981028007095e-06, | |
| "loss": 0.1645, | |
| "num_input_tokens_seen": 1713312, | |
| "step": 390, | |
| "train_runtime": 1246.1254, | |
| "train_tokens_per_second": 1374.911 | |
| }, | |
| { | |
| "epoch": 0.8611410118406889, | |
| "grad_norm": 2.32612943649292, | |
| "learning_rate": 8.11367459928851e-06, | |
| "loss": 0.1129, | |
| "num_input_tokens_seen": 1757056, | |
| "step": 400, | |
| "train_runtime": 1277.0951, | |
| "train_tokens_per_second": 1375.822 | |
| }, | |
| { | |
| "epoch": 0.8826695371367062, | |
| "grad_norm": 1.5576270818710327, | |
| "learning_rate": 8.024789083058289e-06, | |
| "loss": 0.1333, | |
| "num_input_tokens_seen": 1801632, | |
| "step": 410, | |
| "train_runtime": 1308.5556, | |
| "train_tokens_per_second": 1376.81 | |
| }, | |
| { | |
| "epoch": 0.9041980624327234, | |
| "grad_norm": 8.420344352722168, | |
| "learning_rate": 7.934369557247397e-06, | |
| "loss": 0.1311, | |
| "num_input_tokens_seen": 1845280, | |
| "step": 420, | |
| "train_runtime": 1339.4668, | |
| "train_tokens_per_second": 1377.623 | |
| }, | |
| { | |
| "epoch": 0.9257265877287406, | |
| "grad_norm": 1.7291479110717773, | |
| "learning_rate": 7.842461877753575e-06, | |
| "loss": 0.1395, | |
| "num_input_tokens_seen": 1889472, | |
| "step": 430, | |
| "train_runtime": 1370.6369, | |
| "train_tokens_per_second": 1378.536 | |
| }, | |
| { | |
| "epoch": 0.9472551130247578, | |
| "grad_norm": 2.441693067550659, | |
| "learning_rate": 7.7491126551857e-06, | |
| "loss": 0.1175, | |
| "num_input_tokens_seen": 1932832, | |
| "step": 440, | |
| "train_runtime": 1401.3047, | |
| "train_tokens_per_second": 1379.309 | |
| }, | |
| { | |
| "epoch": 0.9687836383207751, | |
| "grad_norm": 1.3606727123260498, | |
| "learning_rate": 7.654369231225398e-06, | |
| "loss": 0.1154, | |
| "num_input_tokens_seen": 1976000, | |
| "step": 450, | |
| "train_runtime": 1431.9402, | |
| "train_tokens_per_second": 1379.946 | |
| }, | |
| { | |
| "epoch": 0.9903121636167922, | |
| "grad_norm": 2.911600351333618, | |
| "learning_rate": 7.5582796546179125e-06, | |
| "loss": 0.1408, | |
| "num_input_tokens_seen": 2019968, | |
| "step": 460, | |
| "train_runtime": 1463.035, | |
| "train_tokens_per_second": 1380.67 | |
| }, | |
| { | |
| "epoch": 1.0107642626480087, | |
| "grad_norm": 2.967047929763794, | |
| "learning_rate": 7.460892656804366e-06, | |
| "loss": 0.1126, | |
| "num_input_tokens_seen": 2061440, | |
| "step": 470, | |
| "train_runtime": 1492.4083, | |
| "train_tokens_per_second": 1381.284 | |
| }, | |
| { | |
| "epoch": 1.0322927879440258, | |
| "grad_norm": 1.90776789188385, | |
| "learning_rate": 7.362257627207818e-06, | |
| "loss": 0.1329, | |
| "num_input_tokens_seen": 2105216, | |
| "step": 480, | |
| "train_runtime": 1523.2979, | |
| "train_tokens_per_second": 1382.012 | |
| }, | |
| { | |
| "epoch": 1.0538213132400431, | |
| "grad_norm": 2.7770872116088867, | |
| "learning_rate": 7.2624245881856094e-06, | |
| "loss": 0.111, | |
| "num_input_tokens_seen": 2149888, | |
| "step": 490, | |
| "train_runtime": 1554.9287, | |
| "train_tokens_per_second": 1382.628 | |
| }, | |
| { | |
| "epoch": 1.0753498385360603, | |
| "grad_norm": 1.9737987518310547, | |
| "learning_rate": 7.161444169660723e-06, | |
| "loss": 0.113, | |
| "num_input_tokens_seen": 2194304, | |
| "step": 500, | |
| "train_runtime": 1586.2216, | |
| "train_tokens_per_second": 1383.353 | |
| }, | |
| { | |
| "epoch": 1.0968783638320776, | |
| "grad_norm": 1.2335457801818848, | |
| "learning_rate": 7.059367583445034e-06, | |
| "loss": 0.1303, | |
| "num_input_tokens_seen": 2238080, | |
| "step": 510, | |
| "train_runtime": 1617.0801, | |
| "train_tokens_per_second": 1384.025 | |
| }, | |
| { | |
| "epoch": 1.1184068891280947, | |
| "grad_norm": 2.525258779525757, | |
| "learning_rate": 6.956246597267438e-06, | |
| "loss": 0.1404, | |
| "num_input_tokens_seen": 2282368, | |
| "step": 520, | |
| "train_runtime": 1648.4109, | |
| "train_tokens_per_second": 1384.587 | |
| }, | |
| { | |
| "epoch": 1.1399354144241118, | |
| "grad_norm": 4.016520977020264, | |
| "learning_rate": 6.852133508520057e-06, | |
| "loss": 0.0972, | |
| "num_input_tokens_seen": 2325984, | |
| "step": 530, | |
| "train_runtime": 1679.3164, | |
| "train_tokens_per_second": 1385.078 | |
| }, | |
| { | |
| "epoch": 1.1614639397201292, | |
| "grad_norm": 1.405586838722229, | |
| "learning_rate": 6.747081117735829e-06, | |
| "loss": 0.1092, | |
| "num_input_tokens_seen": 2369664, | |
| "step": 540, | |
| "train_runtime": 1710.2475, | |
| "train_tokens_per_second": 1385.568 | |
| }, | |
| { | |
| "epoch": 1.1829924650161463, | |
| "grad_norm": 2.151442766189575, | |
| "learning_rate": 6.641142701810932e-06, | |
| "loss": 0.1186, | |
| "num_input_tokens_seen": 2413312, | |
| "step": 550, | |
| "train_runtime": 1741.213, | |
| "train_tokens_per_second": 1385.995 | |
| }, | |
| { | |
| "epoch": 1.2045209903121636, | |
| "grad_norm": 1.9706578254699707, | |
| "learning_rate": 6.534371986985618e-06, | |
| "loss": 0.1332, | |
| "num_input_tokens_seen": 2457120, | |
| "step": 560, | |
| "train_runtime": 1772.1204, | |
| "train_tokens_per_second": 1386.542 | |
| }, | |
| { | |
| "epoch": 1.2260495156081808, | |
| "grad_norm": 2.3035449981689453, | |
| "learning_rate": 6.426823121597169e-06, | |
| "loss": 0.1481, | |
| "num_input_tokens_seen": 2500736, | |
| "step": 570, | |
| "train_runtime": 1803.0834, | |
| "train_tokens_per_second": 1386.922 | |
| }, | |
| { | |
| "epoch": 1.247578040904198, | |
| "grad_norm": 3.713632106781006, | |
| "learning_rate": 6.318550648618785e-06, | |
| "loss": 0.1332, | |
| "num_input_tokens_seen": 2545056, | |
| "step": 580, | |
| "train_runtime": 1834.1935, | |
| "train_tokens_per_second": 1387.561 | |
| }, | |
| { | |
| "epoch": 1.2691065662002152, | |
| "grad_norm": 1.8667478561401367, | |
| "learning_rate": 6.209609477998339e-06, | |
| "loss": 0.0978, | |
| "num_input_tokens_seen": 2588416, | |
| "step": 590, | |
| "train_runtime": 1864.9784, | |
| "train_tokens_per_second": 1387.907 | |
| }, | |
| { | |
| "epoch": 1.2906350914962326, | |
| "grad_norm": 2.295342445373535, | |
| "learning_rate": 6.100054858811012e-06, | |
| "loss": 0.1176, | |
| "num_input_tokens_seen": 2632352, | |
| "step": 600, | |
| "train_runtime": 1896.108, | |
| "train_tokens_per_second": 1388.292 | |
| }, | |
| { | |
| "epoch": 1.3121636167922497, | |
| "grad_norm": 2.2867720127105713, | |
| "learning_rate": 5.989942351239954e-06, | |
| "loss": 0.1279, | |
| "num_input_tokens_seen": 2676640, | |
| "step": 610, | |
| "train_runtime": 1927.5126, | |
| "train_tokens_per_second": 1388.65 | |
| }, | |
| { | |
| "epoch": 1.333692142088267, | |
| "grad_norm": 2.1158223152160645, | |
| "learning_rate": 5.879327798399155e-06, | |
| "loss": 0.1407, | |
| "num_input_tokens_seen": 2719968, | |
| "step": 620, | |
| "train_runtime": 1958.2576, | |
| "train_tokens_per_second": 1388.974 | |
| }, | |
| { | |
| "epoch": 1.3552206673842842, | |
| "grad_norm": 4.076441287994385, | |
| "learning_rate": 5.768267298012841e-06, | |
| "loss": 0.1168, | |
| "num_input_tokens_seen": 2764352, | |
| "step": 630, | |
| "train_runtime": 1989.6781, | |
| "train_tokens_per_second": 1389.346 | |
| }, | |
| { | |
| "epoch": 1.3767491926803013, | |
| "grad_norm": 4.354236602783203, | |
| "learning_rate": 5.656817173965733e-06, | |
| "loss": 0.1188, | |
| "num_input_tokens_seen": 2808832, | |
| "step": 640, | |
| "train_runtime": 2021.0224, | |
| "train_tokens_per_second": 1389.807 | |
| }, | |
| { | |
| "epoch": 1.3982777179763186, | |
| "grad_norm": 4.40167236328125, | |
| "learning_rate": 5.545033947738624e-06, | |
| "loss": 0.1326, | |
| "num_input_tokens_seen": 2852192, | |
| "step": 650, | |
| "train_runtime": 2051.72, | |
| "train_tokens_per_second": 1390.147 | |
| }, | |
| { | |
| "epoch": 1.419806243272336, | |
| "grad_norm": 2.4845104217529297, | |
| "learning_rate": 5.4329743097437316e-06, | |
| "loss": 0.1331, | |
| "num_input_tokens_seen": 2896256, | |
| "step": 660, | |
| "train_runtime": 2082.7361, | |
| "train_tokens_per_second": 1390.602 | |
| }, | |
| { | |
| "epoch": 1.441334768568353, | |
| "grad_norm": 2.7233705520629883, | |
| "learning_rate": 5.320695090574386e-06, | |
| "loss": 0.1082, | |
| "num_input_tokens_seen": 2939552, | |
| "step": 670, | |
| "train_runtime": 2113.5367, | |
| "train_tokens_per_second": 1390.821 | |
| }, | |
| { | |
| "epoch": 1.4628632938643702, | |
| "grad_norm": 3.289949893951416, | |
| "learning_rate": 5.208253232183625e-06, | |
| "loss": 0.1184, | |
| "num_input_tokens_seen": 2984000, | |
| "step": 680, | |
| "train_runtime": 2144.7931, | |
| "train_tokens_per_second": 1391.276 | |
| }, | |
| { | |
| "epoch": 1.4843918191603875, | |
| "grad_norm": 4.015010833740234, | |
| "learning_rate": 5.095705759006311e-06, | |
| "loss": 0.0942, | |
| "num_input_tokens_seen": 3028192, | |
| "step": 690, | |
| "train_runtime": 2176.0229, | |
| "train_tokens_per_second": 1391.618 | |
| }, | |
| { | |
| "epoch": 1.5059203444564049, | |
| "grad_norm": 5.474874973297119, | |
| "learning_rate": 4.9831097490394195e-06, | |
| "loss": 0.1204, | |
| "num_input_tokens_seen": 3071392, | |
| "step": 700, | |
| "train_runtime": 2206.8218, | |
| "train_tokens_per_second": 1391.772 | |
| }, | |
| { | |
| "epoch": 1.527448869752422, | |
| "grad_norm": 2.4211018085479736, | |
| "learning_rate": 4.870522304895164e-06, | |
| "loss": 0.1358, | |
| "num_input_tokens_seen": 3114496, | |
| "step": 710, | |
| "train_runtime": 2237.5127, | |
| "train_tokens_per_second": 1391.946 | |
| }, | |
| { | |
| "epoch": 1.5489773950484391, | |
| "grad_norm": 2.5446665287017822, | |
| "learning_rate": 4.758000524841632e-06, | |
| "loss": 0.1313, | |
| "num_input_tokens_seen": 3158432, | |
| "step": 720, | |
| "train_runtime": 2268.6496, | |
| "train_tokens_per_second": 1392.208 | |
| }, | |
| { | |
| "epoch": 1.5705059203444565, | |
| "grad_norm": 5.643487453460693, | |
| "learning_rate": 4.645601473845636e-06, | |
| "loss": 0.0879, | |
| "num_input_tokens_seen": 3201888, | |
| "step": 730, | |
| "train_runtime": 2299.4823, | |
| "train_tokens_per_second": 1392.439 | |
| }, | |
| { | |
| "epoch": 1.5920344456404736, | |
| "grad_norm": 1.8654100894927979, | |
| "learning_rate": 4.533382154632442e-06, | |
| "loss": 0.0977, | |
| "num_input_tokens_seen": 3245856, | |
| "step": 740, | |
| "train_runtime": 2330.5679, | |
| "train_tokens_per_second": 1392.732 | |
| }, | |
| { | |
| "epoch": 1.6135629709364907, | |
| "grad_norm": 2.2264926433563232, | |
| "learning_rate": 4.421399478777064e-06, | |
| "loss": 0.1483, | |
| "num_input_tokens_seen": 3290208, | |
| "step": 750, | |
| "train_runtime": 2361.9169, | |
| "train_tokens_per_second": 1393.024 | |
| }, | |
| { | |
| "epoch": 1.635091496232508, | |
| "grad_norm": 2.8280999660491943, | |
| "learning_rate": 4.3097102378417985e-06, | |
| "loss": 0.1285, | |
| "num_input_tokens_seen": 3333152, | |
| "step": 760, | |
| "train_runtime": 2392.5926, | |
| "train_tokens_per_second": 1393.113 | |
| }, | |
| { | |
| "epoch": 1.6566200215285254, | |
| "grad_norm": 3.5213840007781982, | |
| "learning_rate": 4.198371074574597e-06, | |
| "loss": 0.1475, | |
| "num_input_tokens_seen": 3377664, | |
| "step": 770, | |
| "train_runtime": 2423.9491, | |
| "train_tokens_per_second": 1393.455 | |
| }, | |
| { | |
| "epoch": 1.6781485468245425, | |
| "grad_norm": 3.323622226715088, | |
| "learning_rate": 4.087438454182942e-06, | |
| "loss": 0.0904, | |
| "num_input_tokens_seen": 3422400, | |
| "step": 780, | |
| "train_runtime": 2455.5818, | |
| "train_tokens_per_second": 1393.723 | |
| }, | |
| { | |
| "epoch": 1.6996770721205596, | |
| "grad_norm": 4.368185997009277, | |
| "learning_rate": 3.976968635697732e-06, | |
| "loss": 0.1199, | |
| "num_input_tokens_seen": 3465760, | |
| "step": 790, | |
| "train_runtime": 2486.3362, | |
| "train_tokens_per_second": 1393.922 | |
| }, | |
| { | |
| "epoch": 1.721205597416577, | |
| "grad_norm": 3.0081822872161865, | |
| "learning_rate": 3.867017643441746e-06, | |
| "loss": 0.102, | |
| "num_input_tokens_seen": 3509760, | |
| "step": 800, | |
| "train_runtime": 2517.434, | |
| "train_tokens_per_second": 1394.182 | |
| }, | |
| { | |
| "epoch": 1.7427341227125943, | |
| "grad_norm": 3.7257721424102783, | |
| "learning_rate": 3.757641238617137e-06, | |
| "loss": 0.1194, | |
| "num_input_tokens_seen": 3554560, | |
| "step": 810, | |
| "train_runtime": 2549.4732, | |
| "train_tokens_per_second": 1394.233 | |
| }, | |
| { | |
| "epoch": 1.7642626480086114, | |
| "grad_norm": 3.8365535736083984, | |
| "learning_rate": 3.648894891026358e-06, | |
| "loss": 0.1507, | |
| "num_input_tokens_seen": 3599488, | |
| "step": 820, | |
| "train_runtime": 2581.0241, | |
| "train_tokens_per_second": 1394.597 | |
| }, | |
| { | |
| "epoch": 1.7857911733046286, | |
| "grad_norm": 2.1309561729431152, | |
| "learning_rate": 3.5408337509408764e-06, | |
| "loss": 0.1015, | |
| "num_input_tokens_seen": 3643680, | |
| "step": 830, | |
| "train_runtime": 2612.3216, | |
| "train_tokens_per_second": 1394.805 | |
| }, | |
| { | |
| "epoch": 1.807319698600646, | |
| "grad_norm": 2.5082457065582275, | |
| "learning_rate": 3.4335126211319412e-06, | |
| "loss": 0.1165, | |
| "num_input_tokens_seen": 3688160, | |
| "step": 840, | |
| "train_runtime": 2643.6717, | |
| "train_tokens_per_second": 1395.09 | |
| }, | |
| { | |
| "epoch": 1.8288482238966632, | |
| "grad_norm": 1.4419660568237305, | |
| "learning_rate": 3.32698592907757e-06, | |
| "loss": 0.0958, | |
| "num_input_tokens_seen": 3731392, | |
| "step": 850, | |
| "train_runtime": 2674.4286, | |
| "train_tokens_per_second": 1395.211 | |
| }, | |
| { | |
| "epoch": 1.8503767491926801, | |
| "grad_norm": 2.402513027191162, | |
| "learning_rate": 3.2213076993598857e-06, | |
| "loss": 0.1505, | |
| "num_input_tokens_seen": 3776128, | |
| "step": 860, | |
| "train_runtime": 2706.116, | |
| "train_tokens_per_second": 1395.405 | |
| }, | |
| { | |
| "epoch": 1.8719052744886975, | |
| "grad_norm": 0.9779609441757202, | |
| "learning_rate": 3.1165315262667535e-06, | |
| "loss": 0.1003, | |
| "num_input_tokens_seen": 3820896, | |
| "step": 870, | |
| "train_runtime": 2737.6181, | |
| "train_tokens_per_second": 1395.701 | |
| }, | |
| { | |
| "epoch": 1.8934337997847148, | |
| "grad_norm": 3.727255344390869, | |
| "learning_rate": 3.012710546611659e-06, | |
| "loss": 0.1483, | |
| "num_input_tokens_seen": 3864704, | |
| "step": 880, | |
| "train_runtime": 2768.6885, | |
| "train_tokens_per_second": 1395.861 | |
| }, | |
| { | |
| "epoch": 1.914962325080732, | |
| "grad_norm": 1.5679094791412354, | |
| "learning_rate": 2.9098974127856e-06, | |
| "loss": 0.117, | |
| "num_input_tokens_seen": 3908544, | |
| "step": 890, | |
| "train_runtime": 2799.6713, | |
| "train_tokens_per_second": 1396.072 | |
| }, | |
| { | |
| "epoch": 1.936490850376749, | |
| "grad_norm": 2.775408983230591, | |
| "learning_rate": 2.8081442660546126e-06, | |
| "loss": 0.1303, | |
| "num_input_tokens_seen": 3952576, | |
| "step": 900, | |
| "train_runtime": 2830.9247, | |
| "train_tokens_per_second": 1396.214 | |
| }, | |
| { | |
| "epoch": 1.9580193756727664, | |
| "grad_norm": 1.0387197732925415, | |
| "learning_rate": 2.7075027101165706e-06, | |
| "loss": 0.0971, | |
| "num_input_tokens_seen": 3996416, | |
| "step": 910, | |
| "train_runtime": 2862.0695, | |
| "train_tokens_per_second": 1396.338 | |
| }, | |
| { | |
| "epoch": 1.9795479009687837, | |
| "grad_norm": 3.794166326522827, | |
| "learning_rate": 2.6080237849305467e-06, | |
| "loss": 0.132, | |
| "num_input_tokens_seen": 4040736, | |
| "step": 920, | |
| "train_runtime": 2893.2903, | |
| "train_tokens_per_second": 1396.589 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 1.547866702079773, | |
| "learning_rate": 2.5097579408321264e-06, | |
| "loss": 0.093, | |
| "num_input_tokens_seen": 4083200, | |
| "step": 930, | |
| "train_runtime": 2923.2158, | |
| "train_tokens_per_second": 1396.818 | |
| }, | |
| { | |
| "epoch": 2.0215285252960173, | |
| "grad_norm": 3.5177085399627686, | |
| "learning_rate": 2.4127550129477145e-06, | |
| "loss": 0.1324, | |
| "num_input_tokens_seen": 4127040, | |
| "step": 940, | |
| "train_runtime": 2954.2784, | |
| "train_tokens_per_second": 1396.971 | |
| }, | |
| { | |
| "epoch": 2.0430570505920342, | |
| "grad_norm": 1.8717275857925415, | |
| "learning_rate": 2.317064195920852e-06, | |
| "loss": 0.0841, | |
| "num_input_tokens_seen": 4170816, | |
| "step": 950, | |
| "train_runtime": 2985.3333, | |
| "train_tokens_per_second": 1397.102 | |
| }, | |
| { | |
| "epoch": 2.0645855758880516, | |
| "grad_norm": 1.233929991722107, | |
| "learning_rate": 2.2227340189633508e-06, | |
| "loss": 0.1138, | |
| "num_input_tokens_seen": 4214272, | |
| "step": 960, | |
| "train_runtime": 3016.1559, | |
| "train_tokens_per_second": 1397.233 | |
| }, | |
| { | |
| "epoch": 2.086114101184069, | |
| "grad_norm": 1.6053682565689087, | |
| "learning_rate": 2.1298123212439028e-06, | |
| "loss": 0.0892, | |
| "num_input_tokens_seen": 4258592, | |
| "step": 970, | |
| "train_runtime": 3047.3824, | |
| "train_tokens_per_second": 1397.459 | |
| }, | |
| { | |
| "epoch": 2.1076426264800863, | |
| "grad_norm": 2.4293172359466553, | |
| "learning_rate": 2.0383462276266347e-06, | |
| "loss": 0.1277, | |
| "num_input_tokens_seen": 4302656, | |
| "step": 980, | |
| "train_runtime": 3078.5923, | |
| "train_tokens_per_second": 1397.605 | |
| }, | |
| { | |
| "epoch": 2.129171151776103, | |
| "grad_norm": 2.0637197494506836, | |
| "learning_rate": 1.948382124771927e-06, | |
| "loss": 0.0968, | |
| "num_input_tokens_seen": 4345888, | |
| "step": 990, | |
| "train_runtime": 3109.3083, | |
| "train_tokens_per_second": 1397.703 | |
| }, | |
| { | |
| "epoch": 2.1506996770721205, | |
| "grad_norm": 3.5659446716308594, | |
| "learning_rate": 1.8599656376116026e-06, | |
| "loss": 0.1226, | |
| "num_input_tokens_seen": 4390528, | |
| "step": 1000, | |
| "train_runtime": 3140.7259, | |
| "train_tokens_per_second": 1397.934 | |
| }, | |
| { | |
| "epoch": 2.172228202368138, | |
| "grad_norm": 3.0801503658294678, | |
| "learning_rate": 1.773141606210431e-06, | |
| "loss": 0.1201, | |
| "num_input_tokens_seen": 4434784, | |
| "step": 1010, | |
| "train_runtime": 3178.3674, | |
| "train_tokens_per_second": 1395.303 | |
| }, | |
| { | |
| "epoch": 2.193756727664155, | |
| "grad_norm": 2.0641636848449707, | |
| "learning_rate": 1.687954063025663e-06, | |
| "loss": 0.0966, | |
| "num_input_tokens_seen": 4478976, | |
| "step": 1020, | |
| "train_runtime": 3209.6721, | |
| "train_tokens_per_second": 1395.462 | |
| }, | |
| { | |
| "epoch": 2.215285252960172, | |
| "grad_norm": 2.951422929763794, | |
| "learning_rate": 1.604446210576157e-06, | |
| "loss": 0.1143, | |
| "num_input_tokens_seen": 4523616, | |
| "step": 1030, | |
| "train_runtime": 3241.2178, | |
| "train_tokens_per_second": 1395.653 | |
| }, | |
| { | |
| "epoch": 2.2368137782561894, | |
| "grad_norm": 5.046944618225098, | |
| "learning_rate": 1.5226603995323897e-06, | |
| "loss": 0.1114, | |
| "num_input_tokens_seen": 4567264, | |
| "step": 1040, | |
| "train_runtime": 3272.1686, | |
| "train_tokens_per_second": 1395.791 | |
| }, | |
| { | |
| "epoch": 2.2583423035522068, | |
| "grad_norm": 1.3710857629776, | |
| "learning_rate": 1.4426381072384866e-06, | |
| "loss": 0.0981, | |
| "num_input_tokens_seen": 4611104, | |
| "step": 1050, | |
| "train_runtime": 3303.3652, | |
| "train_tokens_per_second": 1395.881 | |
| }, | |
| { | |
| "epoch": 2.2798708288482237, | |
| "grad_norm": 2.5878543853759766, | |
| "learning_rate": 1.3644199166771531e-06, | |
| "loss": 0.1135, | |
| "num_input_tokens_seen": 4655040, | |
| "step": 1060, | |
| "train_runtime": 3334.5323, | |
| "train_tokens_per_second": 1396.01 | |
| }, | |
| { | |
| "epoch": 2.301399354144241, | |
| "grad_norm": 2.481158494949341, | |
| "learning_rate": 1.2880454958881794e-06, | |
| "loss": 0.1081, | |
| "num_input_tokens_seen": 4698432, | |
| "step": 1070, | |
| "train_runtime": 3365.4557, | |
| "train_tokens_per_second": 1396.076 | |
| }, | |
| { | |
| "epoch": 2.3229278794402584, | |
| "grad_norm": 1.2142502069473267, | |
| "learning_rate": 1.2135535778509545e-06, | |
| "loss": 0.0685, | |
| "num_input_tokens_seen": 4742848, | |
| "step": 1080, | |
| "train_runtime": 3396.7938, | |
| "train_tokens_per_second": 1396.272 | |
| }, | |
| { | |
| "epoch": 2.3444564047362757, | |
| "grad_norm": 3.040208339691162, | |
| "learning_rate": 1.1409819408411898e-06, | |
| "loss": 0.0857, | |
| "num_input_tokens_seen": 4786944, | |
| "step": 1090, | |
| "train_runtime": 3427.8943, | |
| "train_tokens_per_second": 1396.468 | |
| }, | |
| { | |
| "epoch": 2.3659849300322926, | |
| "grad_norm": 1.4514607191085815, | |
| "learning_rate": 1.070367389271823e-06, | |
| "loss": 0.1008, | |
| "num_input_tokens_seen": 4830624, | |
| "step": 1100, | |
| "train_runtime": 3458.8433, | |
| "train_tokens_per_second": 1396.601 | |
| }, | |
| { | |
| "epoch": 2.38751345532831, | |
| "grad_norm": 3.533973455429077, | |
| "learning_rate": 1.001745735027801e-06, | |
| "loss": 0.1137, | |
| "num_input_tokens_seen": 4874944, | |
| "step": 1110, | |
| "train_runtime": 3490.3116, | |
| "train_tokens_per_second": 1396.707 | |
| }, | |
| { | |
| "epoch": 2.4090419806243273, | |
| "grad_norm": 4.195890426635742, | |
| "learning_rate": 9.351517793042408e-07, | |
| "loss": 0.1038, | |
| "num_input_tokens_seen": 4918496, | |
| "step": 1120, | |
| "train_runtime": 3521.354, | |
| "train_tokens_per_second": 1396.763 | |
| }, | |
| { | |
| "epoch": 2.4305705059203446, | |
| "grad_norm": 4.139116287231445, | |
| "learning_rate": 8.706192949571262e-07, | |
| "loss": 0.1194, | |
| "num_input_tokens_seen": 4961920, | |
| "step": 1130, | |
| "train_runtime": 3552.2441, | |
| "train_tokens_per_second": 1396.841 | |
| }, | |
| { | |
| "epoch": 2.4520990312163615, | |
| "grad_norm": 3.0998311042785645, | |
| "learning_rate": 8.081810093755537e-07, | |
| "loss": 0.1161, | |
| "num_input_tokens_seen": 5005440, | |
| "step": 1140, | |
| "train_runtime": 3583.1755, | |
| "train_tokens_per_second": 1396.928 | |
| }, | |
| { | |
| "epoch": 2.473627556512379, | |
| "grad_norm": 2.2539584636688232, | |
| "learning_rate": 7.478685878841629e-07, | |
| "loss": 0.1, | |
| "num_input_tokens_seen": 5049344, | |
| "step": 1150, | |
| "train_runtime": 3614.3079, | |
| "train_tokens_per_second": 1397.043 | |
| }, | |
| { | |
| "epoch": 2.495156081808396, | |
| "grad_norm": 3.1125545501708984, | |
| "learning_rate": 6.897126176841978e-07, | |
| "loss": 0.0996, | |
| "num_input_tokens_seen": 5092896, | |
| "step": 1160, | |
| "train_runtime": 3645.2176, | |
| "train_tokens_per_second": 1397.145 | |
| }, | |
| { | |
| "epoch": 2.5166846071044136, | |
| "grad_norm": 3.5130155086517334, | |
| "learning_rate": 6.337425923413276e-07, | |
| "loss": 0.0944, | |
| "num_input_tokens_seen": 5136928, | |
| "step": 1170, | |
| "train_runtime": 3676.3104, | |
| "train_tokens_per_second": 1397.305 | |
| }, | |
| { | |
| "epoch": 2.5382131324004304, | |
| "grad_norm": 2.059572696685791, | |
| "learning_rate": 5.799868968281075e-07, | |
| "loss": 0.08, | |
| "num_input_tokens_seen": 5180960, | |
| "step": 1180, | |
| "train_runtime": 3707.5494, | |
| "train_tokens_per_second": 1397.408 | |
| }, | |
| { | |
| "epoch": 2.559741657696448, | |
| "grad_norm": 4.341704845428467, | |
| "learning_rate": 5.284727931286526e-07, | |
| "loss": 0.0962, | |
| "num_input_tokens_seen": 5225376, | |
| "step": 1190, | |
| "train_runtime": 3738.9161, | |
| "train_tokens_per_second": 1397.564 | |
| }, | |
| { | |
| "epoch": 2.581270182992465, | |
| "grad_norm": 2.8424837589263916, | |
| "learning_rate": 4.792264064128327e-07, | |
| "loss": 0.094, | |
| "num_input_tokens_seen": 5268992, | |
| "step": 1200, | |
| "train_runtime": 3769.9587, | |
| "train_tokens_per_second": 1397.626 | |
| }, | |
| { | |
| "epoch": 2.602798708288482, | |
| "grad_norm": 3.76309871673584, | |
| "learning_rate": 4.322727117869951e-07, | |
| "loss": 0.1005, | |
| "num_input_tokens_seen": 5312992, | |
| "step": 1210, | |
| "train_runtime": 3801.0547, | |
| "train_tokens_per_second": 1397.768 | |
| }, | |
| { | |
| "epoch": 2.6243272335844994, | |
| "grad_norm": 2.470759153366089, | |
| "learning_rate": 3.8763552162794983e-07, | |
| "loss": 0.1167, | |
| "num_input_tokens_seen": 5356448, | |
| "step": 1220, | |
| "train_runtime": 3831.9201, | |
| "train_tokens_per_second": 1397.85 | |
| }, | |
| { | |
| "epoch": 2.6458557588805167, | |
| "grad_norm": 2.948512315750122, | |
| "learning_rate": 3.453374735066034e-07, | |
| "loss": 0.0907, | |
| "num_input_tokens_seen": 5400672, | |
| "step": 1230, | |
| "train_runtime": 3863.178, | |
| "train_tokens_per_second": 1397.987 | |
| }, | |
| { | |
| "epoch": 2.667384284176534, | |
| "grad_norm": 2.082956552505493, | |
| "learning_rate": 3.054000187074224e-07, | |
| "loss": 0.1074, | |
| "num_input_tokens_seen": 5444576, | |
| "step": 1240, | |
| "train_runtime": 3894.1783, | |
| "train_tokens_per_second": 1398.132 | |
| }, | |
| { | |
| "epoch": 2.6889128094725514, | |
| "grad_norm": 2.035034656524658, | |
| "learning_rate": 2.678434113494882e-07, | |
| "loss": 0.1128, | |
| "num_input_tokens_seen": 5488160, | |
| "step": 1250, | |
| "train_runtime": 3925.0458, | |
| "train_tokens_per_second": 1398.241 | |
| }, | |
| { | |
| "epoch": 2.7104413347685683, | |
| "grad_norm": 3.7168209552764893, | |
| "learning_rate": 2.326866981147091e-07, | |
| "loss": 0.1016, | |
| "num_input_tokens_seen": 5532000, | |
| "step": 1260, | |
| "train_runtime": 3956.0804, | |
| "train_tokens_per_second": 1398.354 | |
| }, | |
| { | |
| "epoch": 2.7319698600645856, | |
| "grad_norm": 4.349425315856934, | |
| "learning_rate": 1.999477085883711e-07, | |
| "loss": 0.1052, | |
| "num_input_tokens_seen": 5575808, | |
| "step": 1270, | |
| "train_runtime": 3987.1129, | |
| "train_tokens_per_second": 1398.458 | |
| }, | |
| { | |
| "epoch": 2.7534983853606025, | |
| "grad_norm": 1.8204060792922974, | |
| "learning_rate": 1.6964304621693516e-07, | |
| "loss": 0.0918, | |
| "num_input_tokens_seen": 5619200, | |
| "step": 1280, | |
| "train_runtime": 4017.8653, | |
| "train_tokens_per_second": 1398.554 | |
| }, | |
| { | |
| "epoch": 2.77502691065662, | |
| "grad_norm": 3.752577066421509, | |
| "learning_rate": 1.4178807988766419e-07, | |
| "loss": 0.109, | |
| "num_input_tokens_seen": 5662656, | |
| "step": 1290, | |
| "train_runtime": 4048.795, | |
| "train_tokens_per_second": 1398.603 | |
| }, | |
| { | |
| "epoch": 2.7965554359526372, | |
| "grad_norm": 3.749866247177124, | |
| "learning_rate": 1.1639693613435921e-07, | |
| "loss": 0.1224, | |
| "num_input_tokens_seen": 5706656, | |
| "step": 1300, | |
| "train_runtime": 4079.9279, | |
| "train_tokens_per_second": 1398.715 | |
| }, | |
| { | |
| "epoch": 2.8180839612486546, | |
| "grad_norm": 2.628767251968384, | |
| "learning_rate": 9.348249197313918e-08, | |
| "loss": 0.0992, | |
| "num_input_tokens_seen": 5751232, | |
| "step": 1310, | |
| "train_runtime": 4111.4798, | |
| "train_tokens_per_second": 1398.823 | |
| }, | |
| { | |
| "epoch": 2.839612486544672, | |
| "grad_norm": 0.7992174625396729, | |
| "learning_rate": 7.305636837191876e-08, | |
| "loss": 0.107, | |
| "num_input_tokens_seen": 5794976, | |
| "step": 1320, | |
| "train_runtime": 4142.503, | |
| "train_tokens_per_second": 1398.907 | |
| }, | |
| { | |
| "epoch": 2.861141011840689, | |
| "grad_norm": 3.0042312145233154, | |
| "learning_rate": 5.512892435687645e-08, | |
| "loss": 0.0944, | |
| "num_input_tokens_seen": 5838368, | |
| "step": 1330, | |
| "train_runtime": 4173.35, | |
| "train_tokens_per_second": 1398.964 | |
| }, | |
| { | |
| "epoch": 2.882669537136706, | |
| "grad_norm": 3.208315134048462, | |
| "learning_rate": 3.970925175892093e-08, | |
| "loss": 0.0867, | |
| "num_input_tokens_seen": 5881984, | |
| "step": 1340, | |
| "train_runtime": 4204.3268, | |
| "train_tokens_per_second": 1399.031 | |
| }, | |
| { | |
| "epoch": 2.9041980624327235, | |
| "grad_norm": 3.5772690773010254, | |
| "learning_rate": 2.6805170602803297e-08, | |
| "loss": 0.1075, | |
| "num_input_tokens_seen": 5925664, | |
| "step": 1350, | |
| "train_runtime": 4235.1869, | |
| "train_tokens_per_second": 1399.151 | |
| }, | |
| { | |
| "epoch": 2.9257265877287404, | |
| "grad_norm": 3.261751413345337, | |
| "learning_rate": 1.6423225141223854e-08, | |
| "loss": 0.1042, | |
| "num_input_tokens_seen": 5969408, | |
| "step": 1360, | |
| "train_runtime": 4266.2069, | |
| "train_tokens_per_second": 1399.231 | |
| }, | |
| { | |
| "epoch": 2.9472551130247577, | |
| "grad_norm": 4.744147300720215, | |
| "learning_rate": 8.568680535939177e-09, | |
| "loss": 0.0964, | |
| "num_input_tokens_seen": 6012576, | |
| "step": 1370, | |
| "train_runtime": 4297.0229, | |
| "train_tokens_per_second": 1399.242 | |
| }, | |
| { | |
| "epoch": 2.968783638320775, | |
| "grad_norm": 2.3966517448425293, | |
| "learning_rate": 3.2455201875586372e-09, | |
| "loss": 0.0922, | |
| "num_input_tokens_seen": 6056000, | |
| "step": 1380, | |
| "train_runtime": 4328.462, | |
| "train_tokens_per_second": 1399.111 | |
| }, | |
| { | |
| "epoch": 2.9903121636167924, | |
| "grad_norm": 1.2950575351715088, | |
| "learning_rate": 4.5644371537756363e-10, | |
| "loss": 0.115, | |
| "num_input_tokens_seen": 6100192, | |
| "step": 1390, | |
| "train_runtime": 4359.7222, | |
| "train_tokens_per_second": 1399.216 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "num_input_tokens_seen": 6120032, | |
| "step": 1395, | |
| "total_flos": 4.115769119160883e+17, | |
| "train_loss": 0.1491297289889346, | |
| "train_runtime": 4379.932, | |
| "train_samples_per_second": 2.545, | |
| "train_steps_per_second": 0.318 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 1395, | |
| "num_input_tokens_seen": 6120032, | |
| "num_train_epochs": 3, | |
| "save_steps": 1000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.115769119160883e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |