diff --git a/aft_wave_v2/coin_real_4x__agreement/training/ARTIFACT_MANIFEST.local.json b/aft_wave_v2/coin_real_4x__agreement/training/ARTIFACT_MANIFEST.local.json index 1e67193dc245193ec703f55fc97a91f45946bbd6..f98cd23cae19565d89a468a48e3f98fad018c72a 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/ARTIFACT_MANIFEST.local.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/ARTIFACT_MANIFEST.local.json @@ -3,13 +3,9 @@ "remote_prefix": "aft_wave_v2/coin_real_4x__agreement/training", "local_folder": "/workspace/wave/training", "files": { - "ARTIFACT_MANIFEST.local.json": { - "size": 35054, - "sha256": "358d03f66da22d79c9aeaef103fd13ac6757c23ca03bc8a8e1ce8eaa088edc61" - }, "TRAINED.json": { "size": 964, - "sha256": "63c842682fc4bf7d162bfb0e12a0cedf0b85eacb3c5f9794acba00eb0f918ea8" + "sha256": "edf924a6e4b875e87894052b80f255fdc708da5b2e770dda415cb89eb082e7ca" }, "axolotl.yaml": { "size": 1211, @@ -25,11 +21,11 @@ }, "checkpoints/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/adapter_model.safetensors": { "size": 547777976, - "sha256": "16cc65acfba87debf950e49fc05f5dce80ea16745d793c826ed96faac31a47a1" + "sha256": "daeafd5d686b4b39c5b3dd656eca36514ea93ef225c5afab298c74bbfab4b632" }, "checkpoints/chat_template.jinja": { "size": 1532, @@ -41,11 +37,11 @@ }, "checkpoints/checkpoint-128/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-128/adapter_model.safetensors": { "size": 547777976, - "sha256": "e7202ce5ed3e0cfd2be9bb413acb17a214475b81453c800a2e3c69d4ff5d7959" + "sha256": "67174eba71aaa201dd7aff62c7fbd3596ad8b4afeba399abae18cc3a0dd00888" }, "checkpoints/checkpoint-128/chat_template.jinja": { "size": 1532, @@ -53,7 +49,7 @@ }, "checkpoints/checkpoint-128/optimizer.pt": { "size": 1048106435, - "sha256": "eb131e3cb1d8065ea88ab03c3129c1bdf7f01361df81ae0569e4c2b6008fa036" + "sha256": "c48bb4d7fcaca8cbcee6c332057a50925e65b15baae813555c4b32ddf641b01b" }, "checkpoints/checkpoint-128/rng_state.pth": { "size": 14645, @@ -77,7 +73,7 @@ }, "checkpoints/checkpoint-128/trainer_state.json": { "size": 56227, - "sha256": "03387942f4c2a7b6ad45075f88a38b298c38a135b13eb87e922d7f07579218dc" + "sha256": "42baeabcb054047def81fc174ed053695ed3fa2f56b0d6a652cd2b7ea11addde" }, "checkpoints/checkpoint-128/training_args.bin": { "size": 8273, @@ -89,11 +85,11 @@ }, "checkpoints/checkpoint-160/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-160/adapter_model.safetensors": { "size": 547777976, - "sha256": "50621401dbfe149cde6d4a622a952bc693f8c1c46da9363b866907fa002871d4" + "sha256": "4f45bebc7b5c77c792dbf05c98745f04359a2b3462e61a009e38cbe69159480d" }, "checkpoints/checkpoint-160/chat_template.jinja": { "size": 1532, @@ -101,7 +97,7 @@ }, "checkpoints/checkpoint-160/optimizer.pt": { "size": 1048106435, - "sha256": "5dafd1343477b7fcb5e94b4e4a0059e8fabb1e49d85a0acc3c63a5a789736f11" + "sha256": "5ac494318568079c3e19c022c29f18c065bb4ba6884c43ff2ef297462392b14f" }, "checkpoints/checkpoint-160/rng_state.pth": { "size": 14645, @@ -124,8 +120,8 @@ "sha256": "a9c33caced7d456d62f444f1f50d8ffdf898b5a0e31c26d17c2f3edd05e45f64" }, "checkpoints/checkpoint-160/trainer_state.json": { - "size": 70212, - "sha256": "2a6e915d2b03c5ef72eba13329c450186c30fb8516a29f8cc04316eb8365021a" + "size": 70210, + "sha256": "837c450cb4078aa28309f4999542aedfa831db547cb0d7b227f3a37c393d0355" }, "checkpoints/checkpoint-160/training_args.bin": { "size": 8273, @@ -137,11 +133,11 @@ }, "checkpoints/checkpoint-192/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-192/adapter_model.safetensors": { "size": 547777976, - "sha256": "1dd775d8b35d84d9d817a4a74f08f039adb13a2320077366a52bad07c43ebf8b" + "sha256": "dd65c9138a23ee4b709df1f879e1ce2a71a67a3461f4f7ed0fae00ba0eb853d5" }, "checkpoints/checkpoint-192/chat_template.jinja": { "size": 1532, @@ -149,7 +145,7 @@ }, "checkpoints/checkpoint-192/optimizer.pt": { "size": 1048106435, - "sha256": "1d796a53e0037fe564b92a554d12c2094e42094df256517710edaa58b7d48d31" + "sha256": "0e74bd30f32259d424a0528a8fc03e88152c9448882265722a55166fb622af3a" }, "checkpoints/checkpoint-192/rng_state.pth": { "size": 14645, @@ -172,8 +168,8 @@ "sha256": "6dcb03db82c34201f9966e9d9c444c1957b95cd53c5ea9ed3b950f223ea74fbe" }, "checkpoints/checkpoint-192/trainer_state.json": { - "size": 84203, - "sha256": "3544cc06d91f290b9129f48d31697c72cbf5c7bfccb06427072589859f519397" + "size": 84216, + "sha256": "76ffe843ba65218315ddfe5c2695fb2b03f1cf28ed59a4af495c5f42f439624f" }, "checkpoints/checkpoint-192/training_args.bin": { "size": 8273, @@ -185,11 +181,11 @@ }, "checkpoints/checkpoint-224/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-224/adapter_model.safetensors": { "size": 547777976, - "sha256": "b8eecfc00fed67bfc79ccbe2c4580025f3a5eb09de1478ed4d237cdce0a676c0" + "sha256": "16e7d16f507266e4de0618e13529f0f6852f7dfacc533b3d9beb61399405123d" }, "checkpoints/checkpoint-224/chat_template.jinja": { "size": 1532, @@ -197,7 +193,7 @@ }, "checkpoints/checkpoint-224/optimizer.pt": { "size": 1048106435, - "sha256": "ab103e3591277e8cd1e5fa934a5bc9882dafbe277490d1a7a13579f389795dd1" + "sha256": "f456a3b4b0b5cfe5bb7061718fafa69fb3393a4a4055872f85b783cf6135b255" }, "checkpoints/checkpoint-224/rng_state.pth": { "size": 14645, @@ -220,8 +216,8 @@ "sha256": "14c3d2181ef61e0cf34f6fe59f885a012f56477195e0bfcf74f965a091355c99" }, "checkpoints/checkpoint-224/trainer_state.json": { - "size": 98212, - "sha256": "70be8685e7805f1ac444171a50c1c168a34bb409e22af079d8183c9aed8c41db" + "size": 98236, + "sha256": "57eb4a9f8711b9449eb9c8e699bb3ce11e013cb7c5ed53b4ec205fdb2524b50c" }, "checkpoints/checkpoint-224/training_args.bin": { "size": 8273, @@ -233,11 +229,11 @@ }, "checkpoints/checkpoint-256/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-256/adapter_model.safetensors": { "size": 547777976, - "sha256": "1c74a0c1890d16768995e589354d66ad0aaf896432a0f8708036dcf170656173" + "sha256": "de74ce97413c0093f4f76198ae64237c0da203ba9a293aa2b281e66d918ca952" }, "checkpoints/checkpoint-256/chat_template.jinja": { "size": 1532, @@ -245,7 +241,7 @@ }, "checkpoints/checkpoint-256/optimizer.pt": { "size": 1048106435, - "sha256": "143ebc082a4dcdfe72a9b44639352173fc591f7676a6655b84d556a3b293a9d7" + "sha256": "a2e59a33e5d93b9218821342e940feec395f412661f80e94be666601cd30c6c3" }, "checkpoints/checkpoint-256/rng_state.pth": { "size": 14645, @@ -268,8 +264,8 @@ "sha256": "a1db2747ccfd098f33eee7a195bbd033988a2849ce30491603e0d31cbe794a14" }, "checkpoints/checkpoint-256/trainer_state.json": { - "size": 112250, - "sha256": "ee7da18d6f8a75f21c96263765db9e618129ea823a617c6ad49a8b8e490a99b7" + "size": 112286, + "sha256": "2437fc722ed7350b2570a2bdb13ab9f6fc9d680ad29c3ad87cb5ac95dba68124" }, "checkpoints/checkpoint-256/training_args.bin": { "size": 8273, @@ -281,11 +277,11 @@ }, "checkpoints/checkpoint-288/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-288/adapter_model.safetensors": { "size": 547777976, - "sha256": "f742ce5e3dc5e92cf1d1b5194d55616562458401c38397bb3b1f150a3613ed30" + "sha256": "da2bdb4f81462625bb226aa42eb809bea433a88b8d19660ad0cb52a8f25dfb1f" }, "checkpoints/checkpoint-288/chat_template.jinja": { "size": 1532, @@ -293,7 +289,7 @@ }, "checkpoints/checkpoint-288/optimizer.pt": { "size": 1048106435, - "sha256": "9c6a83d5d9751f22dbe1bd2713e7e188432fb354065c57c9d49029f1c114f05b" + "sha256": "c144b815c2b7bcbf81221112a3f40c21c4e01914d789b90a94c663d34e6977b2" }, "checkpoints/checkpoint-288/rng_state.pth": { "size": 14645, @@ -316,8 +312,8 @@ "sha256": "f1eed36b4e578b166623815e5accad0aac99aa3b265255a7471d4f0a7c22b297" }, "checkpoints/checkpoint-288/trainer_state.json": { - "size": 126335, - "sha256": "8a07ce94ffd53a7217a9731c5040e5dc755a8f4efdc057c6854e4fb191dec158" + "size": 126385, + "sha256": "d34f36262ee1658dbadffb114672a386ee3cc513554f05b57c3f7b9c9d453ed7" }, "checkpoints/checkpoint-288/training_args.bin": { "size": 8273, @@ -329,11 +325,11 @@ }, "checkpoints/checkpoint-32/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-32/adapter_model.safetensors": { "size": 547777976, - "sha256": "ee7003d2997d35b1193b3e3463a4d9c2b6d209eee799d44f21ec131ffe7ff39a" + "sha256": "32aa7a1bdc40de6c271cdaf4ba2e825940729a8400f15293192a0ab0fd0be3c4" }, "checkpoints/checkpoint-32/chat_template.jinja": { "size": 1532, @@ -341,7 +337,7 @@ }, "checkpoints/checkpoint-32/optimizer.pt": { "size": 1048106435, - "sha256": "1f5489845cc180566855dfb58a67b01f34eb2d8fa011a26887196570356e40f0" + "sha256": "d2c09fd208676c30f1a17a813e8f50e6c1234fdc5a8449106274744a5bc40156" }, "checkpoints/checkpoint-32/rng_state.pth": { "size": 14645, @@ -364,8 +360,8 @@ "sha256": "d9025748b8b157d8490d18576a010318e827c122bd7c9d4da1001a4e203d8a9b" }, "checkpoints/checkpoint-32/trainer_state.json": { - "size": 14414, - "sha256": "dedbe24bdbea1ce6561cb65724d0bdea4ca32569be518904d97085b21573b6d6" + "size": 14406, + "sha256": "12d755108b595d32441e426440b368f10f87ac530ad04e3b58bd04d5896495d0" }, "checkpoints/checkpoint-32/training_args.bin": { "size": 8273, @@ -377,11 +373,11 @@ }, "checkpoints/checkpoint-320/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-320/adapter_model.safetensors": { "size": 547777976, - "sha256": "a6e8332b819be957190c74414784873a8ade3712d142e98f560d80f243855b7d" + "sha256": "ecfb48f90e7121908ec1d3cf02765c1c9138a340de7d19e8645f0c7691611d51" }, "checkpoints/checkpoint-320/chat_template.jinja": { "size": 1532, @@ -389,7 +385,7 @@ }, "checkpoints/checkpoint-320/optimizer.pt": { "size": 1048106435, - "sha256": "5c58b89c38a9a89883bd5892349c9624cd88bb7db622f03f3ec205d7355f5b0f" + "sha256": "4b35a07c34ef08caa48bca5c42b10295e72e8b1793c7dd8a269e93a8b9766920" }, "checkpoints/checkpoint-320/rng_state.pth": { "size": 14645, @@ -412,8 +408,8 @@ "sha256": "fa2e57cf6dee598825b9bba06159bc70e457d9e8315c9d1028a34b835eec8770" }, "checkpoints/checkpoint-320/trainer_state.json": { - "size": 140424, - "sha256": "0585bc36ab82793ef7b34896d945d4fc476eb36e1c8c932fce9ce735565c06d5" + "size": 140501, + "sha256": "4c560090a8acf9f23947b1325483710f17afc68529ecd1eb3df8e3ff6401e1ed" }, "checkpoints/checkpoint-320/training_args.bin": { "size": 8273, @@ -425,11 +421,11 @@ }, "checkpoints/checkpoint-352/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-352/adapter_model.safetensors": { "size": 547777976, - "sha256": "c0c753b89913681f39e2253cb3fd4c99db2072d6402e52c9a6eb911c9939f7ca" + "sha256": "f21e802c0d2fcc1d790922454cc55a3257b76beae21bbf54ea77c6151be66e6e" }, "checkpoints/checkpoint-352/chat_template.jinja": { "size": 1532, @@ -437,7 +433,7 @@ }, "checkpoints/checkpoint-352/optimizer.pt": { "size": 1048106435, - "sha256": "da67a87dafe48008ff80730e49da5dc2be6bac75e3671c7d772f8b936a730e84" + "sha256": "6ff65aaa33bf6a907d3faa52032f129bb11b519ac761adc2816aec8951f53b4e" }, "checkpoints/checkpoint-352/rng_state.pth": { "size": 14645, @@ -460,8 +456,8 @@ "sha256": "b9bc28c20f274eed19841a293251e42a3a606798b019918fd3fd29a96ca3043c" }, "checkpoints/checkpoint-352/trainer_state.json": { - "size": 154550, - "sha256": "d0c9abdce7185cb21098e9b774e5d1ffb410bbf9eb726d5d72c241ba87cd3994" + "size": 154629, + "sha256": "dd3348f05d98c22b8b7f6bdce1fdebf5bd2f43e34e4868f4f627cb95387429aa" }, "checkpoints/checkpoint-352/training_args.bin": { "size": 8273, @@ -473,11 +469,11 @@ }, "checkpoints/checkpoint-384/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-384/adapter_model.safetensors": { "size": 547777976, - "sha256": "2f7dcd0f7d14c350cd56309aaef62d28c523be064d87d9feae5141fe2890924d" + "sha256": "535e88052cb6afb16717578e8ca20d23dd4e86de845c837f78a8af4881d745cf" }, "checkpoints/checkpoint-384/chat_template.jinja": { "size": 1532, @@ -485,7 +481,7 @@ }, "checkpoints/checkpoint-384/optimizer.pt": { "size": 1048106435, - "sha256": "8155a0ce1ff150d4770b9daab3658e3e6adb736967f6f914797107c25fd6c8b0" + "sha256": "1e2785d9c6ff17bc108c22ed9e79c9bbf116cbeae3109e3b396835a887d1ed2d" }, "checkpoints/checkpoint-384/rng_state.pth": { "size": 14645, @@ -508,8 +504,8 @@ "sha256": "3075bc59309b4b7b0fefd61404619b2d7b2fe67268f884f30ea4319fd447e21e" }, "checkpoints/checkpoint-384/trainer_state.json": { - "size": 168694, - "sha256": "4fac0c89f0943b720753cda5ab7ae711c8966c9ea600d107b9bab46f910a2807" + "size": 168780, + "sha256": "af01e24ff12e70b4ef31c9bf5b86c1e7bd14855cea703883da4d76fe3105c551" }, "checkpoints/checkpoint-384/training_args.bin": { "size": 8273, @@ -521,11 +517,11 @@ }, "checkpoints/checkpoint-416/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-416/adapter_model.safetensors": { "size": 547777976, - "sha256": "ee180b0dcc20c9c141d258bba075090f4b87eda8f6b515908a03572f6fc4ca76" + "sha256": "0d560dd0eb4e8597dfc939225d96feb31798b32c08203167541c630616fa2492" }, "checkpoints/checkpoint-416/chat_template.jinja": { "size": 1532, @@ -533,7 +529,7 @@ }, "checkpoints/checkpoint-416/optimizer.pt": { "size": 1048106435, - "sha256": "a82de99afc36ad2c4890b24e750b8c58940441e1006803dd32e087423bd37e67" + "sha256": "cd9783ec9609f3730f73bfcc5cfd64cc123f08f492bbf069f1c6f47c16144b5d" }, "checkpoints/checkpoint-416/rng_state.pth": { "size": 14645, @@ -556,8 +552,8 @@ "sha256": "033256f14efaa1c491d2eeb0fe5a1f206222c187594393c6791fa23f37aacb5e" }, "checkpoints/checkpoint-416/trainer_state.json": { - "size": 182841, - "sha256": "31f80e20dc8f66f2f3e66ab4b51cf798ca041899d6c3408c7924bd3382b2a3dd" + "size": 182932, + "sha256": "997563a587d83c14e55f23a0000c2acd92899991625a2831dedefcc6d621267d" }, "checkpoints/checkpoint-416/training_args.bin": { "size": 8273, @@ -569,11 +565,11 @@ }, "checkpoints/checkpoint-448/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-448/adapter_model.safetensors": { "size": 547777976, - "sha256": "f25f15c1bc008ea9820a869ec237898029c46e71dbb17a16b7c540d0ab55950f" + "sha256": "3bacb4d3f901db3a71785ec9bbf0c989eb190275b59257a46ebe7cda04a4211b" }, "checkpoints/checkpoint-448/chat_template.jinja": { "size": 1532, @@ -581,7 +577,7 @@ }, "checkpoints/checkpoint-448/optimizer.pt": { "size": 1048106435, - "sha256": "5d6cd80b908abae800035b7b84556d6b95bdc1afef25c3cd05b9d5a4d951f6c7" + "sha256": "33cfd5b5b7300a5e59a22e211b622aa8250b83b1e42d9aa245e82b799848bf3e" }, "checkpoints/checkpoint-448/rng_state.pth": { "size": 14645, @@ -604,8 +600,8 @@ "sha256": "87ae99c7d9168aee7dd04df6332dedc5884f11b6c9ce320edc6d2b867c048531" }, "checkpoints/checkpoint-448/trainer_state.json": { - "size": 196995, - "sha256": "c794bd88f8a7af8e83714d0df996bcf2e23dd3fe3e9b7e034f5484bcd606470b" + "size": 197087, + "sha256": "dd453a8c241e9adba0f2155ac5b899e149e25772266ea7f4644cd0217d343d4f" }, "checkpoints/checkpoint-448/training_args.bin": { "size": 8273, @@ -617,11 +613,11 @@ }, "checkpoints/checkpoint-480/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-480/adapter_model.safetensors": { "size": 547777976, - "sha256": "8574c62e5993d868e285944d01ea5c0f530e591f2154d08a0c57b6eadfedd47d" + "sha256": "759e2f47a5e976dcfbe11dde9491135d96d1b05bada169151f4a8f939269acc5" }, "checkpoints/checkpoint-480/chat_template.jinja": { "size": 1532, @@ -629,7 +625,7 @@ }, "checkpoints/checkpoint-480/optimizer.pt": { "size": 1048106435, - "sha256": "d83b575649c6ab2f7828c29ac5ae5dcb50824f042fa45adedc229558f4ef1923" + "sha256": "cd01ae9ec3eb43f4befc813946bc00ce45c82d3237dfa7f15ddccfe7878ea01d" }, "checkpoints/checkpoint-480/rng_state.pth": { "size": 14645, @@ -652,8 +648,8 @@ "sha256": "6c547605fe97848a0748ea1ac9bef1baa4a78902cfb711aedb151a69c5994f49" }, "checkpoints/checkpoint-480/trainer_state.json": { - "size": 211173, - "sha256": "8d0359199a7fd15b57527a4903abb09766e2682d61df31282ebfa2ca9cfd7e70" + "size": 211284, + "sha256": "aead414e3a072327e5746caf31d43a0b98ec71e9b30ca1897ce90790862804a6" }, "checkpoints/checkpoint-480/training_args.bin": { "size": 8273, @@ -665,11 +661,11 @@ }, "checkpoints/checkpoint-512/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-512/adapter_model.safetensors": { "size": 547777976, - "sha256": "16cc65acfba87debf950e49fc05f5dce80ea16745d793c826ed96faac31a47a1" + "sha256": "daeafd5d686b4b39c5b3dd656eca36514ea93ef225c5afab298c74bbfab4b632" }, "checkpoints/checkpoint-512/chat_template.jinja": { "size": 1532, @@ -677,7 +673,7 @@ }, "checkpoints/checkpoint-512/optimizer.pt": { "size": 1048106435, - "sha256": "fe1efd539e57db6375dbfc409cf1e2a434b05b88c1f3bd7e58c16a8d2075a365" + "sha256": "05bb512f0593d6339b6dd5bd7fd23b00fbb5ccbe33fcfaa642269827ce75bdc6" }, "checkpoints/checkpoint-512/rng_state.pth": { "size": 14645, @@ -700,8 +696,8 @@ "sha256": "c0fcac61392efcd924c1610ad304635be7ae41b33c0ad3526b109f7b1f8f7fe9" }, "checkpoints/checkpoint-512/trainer_state.json": { - "size": 225350, - "sha256": "2dbfcbe1a03c6951df9b24ec896edee522b63548a54faf52ac159f28161dac6a" + "size": 225479, + "sha256": "02f9a66b02bb552b9fb5b0fe2cf523809d3b2ee4475683870014d1b13ad7a8a2" }, "checkpoints/checkpoint-512/training_args.bin": { "size": 8273, @@ -713,11 +709,11 @@ }, "checkpoints/checkpoint-64/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-64/adapter_model.safetensors": { "size": 547777976, - "sha256": "051830de7f1d163f4de9749f244e6981723b34f0246ab1c4576cc93cf5c97034" + "sha256": "e859c9377bfb05045990aad9622ecbcea4ec1f51ee262c524148710f93c608f1" }, "checkpoints/checkpoint-64/chat_template.jinja": { "size": 1532, @@ -725,7 +721,7 @@ }, "checkpoints/checkpoint-64/optimizer.pt": { "size": 1048106435, - "sha256": "b96a1d411d21f029342790380398e4a7970a8f0e26d27c412cfd73e290cced3a" + "sha256": "f0bb5b0e8d378704b8006d08d74c2f903a1422f4e828a3f1e606a4b8edbfa7a3" }, "checkpoints/checkpoint-64/rng_state.pth": { "size": 14645, @@ -748,8 +744,8 @@ "sha256": "9c3a6e3ed0949f0de9f9b7c1d666e376e3d3626dfe0a6da2a265ef135b18e10b" }, "checkpoints/checkpoint-64/trainer_state.json": { - "size": 28326, - "sha256": "6b8def4d7ff9d58d7a52fab48646972203a27e4ea3b984ad785edc54873a7aac" + "size": 28330, + "sha256": "82a0433edb2739b866083caf137728dc3d96ccd93e5eb2fd39a66d8d6f7bd5ac" }, "checkpoints/checkpoint-64/training_args.bin": { "size": 8273, @@ -761,11 +757,11 @@ }, "checkpoints/checkpoint-96/adapter_config.json": { "size": 1098, - "sha256": "3b321f93ae273f917611377cbfbf74459bad326b4811326bdf528471050a99f2" + "sha256": "7c54ee9b6e682028e1421326f0a1cbbeb36cdbcc1ad907238e6d932c196e293d" }, "checkpoints/checkpoint-96/adapter_model.safetensors": { "size": 547777976, - "sha256": "a0e403bf65449bdaf7ebc6919f111acf4c4c5995e60d3ee7136848a492f809e9" + "sha256": "0e85942ea7b1d777c6e874fcfe57e08e0752f1e581a02a35bb62b7dc1942bc5a" }, "checkpoints/checkpoint-96/chat_template.jinja": { "size": 1532, @@ -773,7 +769,7 @@ }, "checkpoints/checkpoint-96/optimizer.pt": { "size": 1048106435, - "sha256": "d4bf3da6e8fbdc8a5ebb3ed971650bce7f765b5da49d443bde267183074a0ff5" + "sha256": "e09d86b7ef11b8b51a819ec69e40b2c45e5f32072380fdac56e42f42d36fcb81" }, "checkpoints/checkpoint-96/rng_state.pth": { "size": 14645, @@ -796,8 +792,8 @@ "sha256": "f276353ce1fa0f6362678bebc659fb55eeca16e731ebeb9a62916aa8efaa3b8b" }, "checkpoints/checkpoint-96/trainer_state.json": { - "size": 42266, - "sha256": "105f8c3fef16db19a68e043f6103028151c5228515d58a359bec7b71a0197e33" + "size": 42261, + "sha256": "06d1244ce26f0b9ac73872fde6867ebfff2239569a3be1aa30c8b754d5f626c0" }, "checkpoints/checkpoint-96/training_args.bin": { "size": 8273, @@ -808,8 +804,8 @@ "sha256": "7c5b66498629a75e7fe3e4219bc41040b8106735e598f0837d60656025390e1a" }, "checkpoints/debug.log": { - "size": 269339, - "sha256": "c828d311a21606c89225305f9859467a52bc95f4f748bf4e67dab1c5bc244fa2" + "size": 267536, + "sha256": "5096497579321697536666777d8b80e318847cf367750b87cfd3891265c1880c" }, "checkpoints/processor_config.json": { "size": 519, @@ -841,19 +837,19 @@ }, "health/training_started.json": { "size": 137, - "sha256": "623e0673869f0f9ea285385f2a5afe654d2aacaae12874f184a8a12834c77f69" + "sha256": "cc75570db76b03c03df3dcaac3381a89a9e92ff2b39719f3d00ac41bb89147d1" }, "run.json": { "size": 407, - "sha256": "91082e603138a13b994458847e377c12969878bae8910ad8f9c4d8481b44c9e2" + "sha256": "d72e7f12f02ca389af664a6e6a90f9061050132100b32c737e18c5207f5c9ef3" }, "train.log": { - "size": 276767, - "sha256": "732dda99c9e3cfed30f1924e8fc601b9431274287070d601d9c61b373b8c67c7" + "size": 274978, + "sha256": "b37791314be7b268280e0005a698396839dc9b72aa3ab293e0b4ad7c345ef6fa" }, "trainer_state.final.json": { - "size": 225350, - "sha256": "2dbfcbe1a03c6951df9b24ec896edee522b63548a54faf52ac159f28161dac6a" + "size": 225479, + "sha256": "02f9a66b02bb552b9fb5b0fe2cf523809d3b2ee4475683870014d1b13ad7a8a2" }, "training_examples.jsonl": { "size": 3159083, @@ -861,11 +857,11 @@ }, "training_provenance.json": { "size": 4090, - "sha256": "1950335dceebdbab7947003c065cb933c19e7a4d6f513fba0440cfe0b6a1555f" + "sha256": "d4d5407f6abf83d471b752bd6b1e74777b935dc03d9dce25dd4ec0c1d32d3a6a" }, "training_trace.jsonl": { - "size": 182082, - "sha256": "be93695ba28788aeb6f0fd98000bb9b59fb86cba22501505a16c1bc809d19b7a" + "size": 182211, + "sha256": "3162f25b3bb9dbc2b6e99501728763c5a9acec2b98a1dd4988902fa8ee0b3a2a" } } } diff --git a/aft_wave_v2/coin_real_4x__agreement/training/TRAINED.json b/aft_wave_v2/coin_real_4x__agreement/training/TRAINED.json index b480cf4b4704cc738550967fe05281a265cb466f..2dc03f9f0e4ded9bb518128a7ba2a048173e2551 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/TRAINED.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/TRAINED.json @@ -8,7 +8,7 @@ "training_rows": 8192, "stage": "aft_dispatch_v4_wide", "seed": 42, - "minutes": 59.59, + "minutes": 58.83, "lora": { "r": 32, "alpha": 64, diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_model.safetensors index ea3cea0a354d5b9ee2785a0c48f7ebf1c6877a9d..39b53dcd92648efb307c35556c5bb95fa36cebce 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:16cc65acfba87debf950e49fc05f5dce80ea16745d793c826ed96faac31a47a1 +oid sha256:daeafd5d686b4b39c5b3dd656eca36514ea93ef225c5afab298c74bbfab4b632 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_model.safetensors index 1196939fdd4f259a2a753c562732fe835341c68e..9fcde1482dfcf42534c09306522136a1be6f96c7 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:e7202ce5ed3e0cfd2be9bb413acb17a214475b81453c800a2e3c69d4ff5d7959 +oid sha256:67174eba71aaa201dd7aff62c7fbd3596ad8b4afeba399abae18cc3a0dd00888 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/optimizer.pt index 091e23a55968e1cce84119d146759baa1dd6d631..0ed34c15cc1a38a200f5666d2606294417ce517d 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:eb131e3cb1d8065ea88ab03c3129c1bdf7f01361df81ae0569e4c2b6008fa036 +oid sha256:c48bb4d7fcaca8cbcee6c332057a50925e65b15baae813555c4b32ddf641b01b size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/trainer_state.json index 75ef897a6f4efafa438761abe2549f73e6dbcee7..4665ac0220af5f5c85217ed5a18e528a00932c57 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-128/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,870 +935,870 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_model.safetensors index a18dd2aa9a72081895b9f7d6fb86af2528d02607..132a4643cf8eb23eae7dc0d93b5c93a5b2df43ea 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:50621401dbfe149cde6d4a622a952bc693f8c1c46da9363b866907fa002871d4 +oid sha256:4f45bebc7b5c77c792dbf05c98745f04359a2b3462e61a009e38cbe69159480d size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/optimizer.pt index 3ae0cf54c1cf4a1d398a1382554b062376096eb3..4147753107e21f300cbcda9d8972f46573dc992b 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:5dafd1343477b7fcb5e94b4e4a0059e8fabb1e49d85a0acc3c63a5a789736f11 +oid sha256:5ac494318568079c3e19c022c29f18c065bb4ba6884c43ff2ef297462392b14f size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/trainer_state.json index e0f22f278529f77f9aed72075d589b3fc4616bdd..6399400efff7f7a714c7de0615662fa18ee674e3 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-160/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,170 +2083,170 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_model.safetensors index d349b7848ac2218c2aac91952a7ec51e23a3dc82..7c38f277b2988ecef75093b81f9cabff2849787b 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:1dd775d8b35d84d9d817a4a74f08f039adb13a2320077366a52bad07c43ebf8b +oid sha256:dd65c9138a23ee4b709df1f879e1ce2a71a67a3461f4f7ed0fae00ba0eb853d5 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/optimizer.pt index fb550349a84748dec227e783a6ce16473e1a25a7..1ef7ab51d70b8404ebd220923a03e88fc3521d69 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:1d796a53e0037fe564b92a554d12c2094e42094df256517710edaa58b7d48d31 +oid sha256:0e74bd30f32259d424a0528a8fc03e88152c9448882265722a55166fb622af3a size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/trainer_state.json index e942851c0c229619f1194aaa0f3635b5743e750d..acb7fe0eda7bd95d784e91c34f2884e62c9ec089 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-192/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,100 +2601,100 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_model.safetensors index dd5fdd3b9ecf8b0a792569e10abae8e54885060e..96e80f4222c3c67e9b1b9ffe5a99a13a6dcd4072 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:b8eecfc00fed67bfc79ccbe2c4580025f3a5eb09de1478ed4d237cdce0a676c0 +oid sha256:16e7d16f507266e4de0618e13529f0f6852f7dfacc533b3d9beb61399405123d size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/optimizer.pt index 54fc5c50e0805afb57921ff4f2314cce8b37fa5b..2aaf0ecddb13d41fc730e6683f9095486cb85d7f 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:ab103e3591277e8cd1e5fa934a5bc9882dafbe277490d1a7a13579f389795dd1 +oid sha256:f456a3b4b0b5cfe5bb7061718fafa69fb3393a4a4055872f85b783cf6135b255 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/trainer_state.json index bd3135e06ad912ced53c33d801156a43506fd52a..0feb4ffee97b487d4672637f7360abb1e20f0f5c 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-224/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,324 +2825,324 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_model.safetensors index 82e5f42ace709546e1e2ee91462b7e27e19e841d..8e2802a2181a88fbac99f3f07ff03fe88d0beb04 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:1c74a0c1890d16768995e589354d66ad0aaf896432a0f8708036dcf170656173 +oid sha256:de74ce97413c0093f4f76198ae64237c0da203ba9a293aa2b281e66d918ca952 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/optimizer.pt index a288ea150c6c7b6237836fb2ed193a422ef53e79..9a689f19f6473352ea644b780c5567cff17aeeaa 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:143ebc082a4dcdfe72a9b44639352173fc591f7676a6655b84d556a3b293a9d7 +oid sha256:a2e59a33e5d93b9218821342e940feec395f412661f80e94be666601cd30c6c3 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/trainer_state.json index 15b2d78be9198713922da94b4f1d1676093fbcc4..10a35f34b15499e380132d3d9aabc1ba225ef864 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-256/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,86 +3511,86 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_model.safetensors index cc7bbc81182f3c492152eae7e1fc70df55cbd67b..e0222031d1128af85a57672f7c84b60bb4db7c8c 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:f742ce5e3dc5e92cf1d1b5194d55616562458401c38397bb3b1f150a3613ed30 +oid sha256:da2bdb4f81462625bb226aa42eb809bea433a88b8d19660ad0cb52a8f25dfb1f size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/optimizer.pt index 5c9933e13a1b990bb7bc4575041df8023f064da0..7731a1257683cf67e7e373e62d62c6cd8aee31fb 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:9c6a83d5d9751f22dbe1bd2713e7e188432fb354065c57c9d49029f1c114f05b +oid sha256:c144b815c2b7bcbf81221112a3f40c21c4e01914d789b90a94c663d34e6977b2 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/trainer_state.json index d2ddd8c32fea7953fe13f14378c5712068de6c99..f1779fa2c2d9302f894b5f4095ff951e84426c7a 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-288/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,534 +3511,534 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_model.safetensors index 0899b954d9cc7852a0e6951ca59694025ffa3287..06ac4f80038ef19ef6731ea63a99bca7098061c1 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:ee7003d2997d35b1193b3e3463a4d9c2b6d209eee799d44f21ec131ffe7ff39a +oid sha256:32aa7a1bdc40de6c271cdaf4ba2e825940729a8400f15293192a0ab0fd0be3c4 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/optimizer.pt index 60cd82e6a0b7d9ccf47b7e91208fcecea879705a..d326fdf1c6a2001ff067e9fc8b55a9cc0bd886e0 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:1f5489845cc180566855dfb58a67b01f34eb2d8fa011a26887196570356e40f0 +oid sha256:d2c09fd208676c30f1a17a813e8f50e6c1234fdc5a8449106274744a5bc40156 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/trainer_state.json index b523a0d7fa2d7b26c2753d19e956e5513f5784c3..8619d66cc1630228247a828c3fb9c963f4da017a 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-32/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,427 +34,427 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_model.safetensors index f0b4099d4b89f6efe2f851679023ae3656b1a130..cd974f03d222d0f7c8c32998480b7bfe5b4ac656 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:a6e8332b819be957190c74414784873a8ade3712d142e98f560d80f243855b7d +oid sha256:ecfb48f90e7121908ec1d3cf02765c1c9138a340de7d19e8645f0c7691611d51 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/optimizer.pt index 7df0aa43fef050b943c7d646915721a67b54e228..df981cc0831118b1a8b02418aa156cbe182fbc82 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:5c58b89c38a9a89883bd5892349c9624cd88bb7db622f03f3ec205d7355f5b0f +oid sha256:4b35a07c34ef08caa48bca5c42b10295e72e8b1793c7dd8a269e93a8b9766920 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/trainer_state.json index de3de3770fc1f0d568915edf1abeb961538a1b17..a8b0ea771fac23ebf49a47d5d7f03ad97334cb74 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-320/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,436 +4057,436 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_model.safetensors index 283e0a045f8f186fb0adc2aeeddfb53a60d98dfb..7f1df589785d8c99e02fd1a14f567ef2ab23521a 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:c0c753b89913681f39e2253cb3fd4c99db2072d6402e52c9a6eb911c9939f7ca +oid sha256:f21e802c0d2fcc1d790922454cc55a3257b76beae21bbf54ea77c6151be66e6e size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/optimizer.pt index 359e4d7f1ff9bbf95e15ca2856413ff580c22f7b..3d0be747174a54adbe2286abb9f340217468635a 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:da67a87dafe48008ff80730e49da5dc2be6bac75e3671c7d772f8b936a730e84 +oid sha256:6ff65aaa33bf6a907d3faa52032f129bb11b519ac761adc2816aec8951f53b4e size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/trainer_state.json index d7879a65f9e762b1a09cfff0402c8a227447b261..33732546ee645e48509f2a22e6a96098c89c6521 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-352/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,461 +4057,461 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 }, { "epoch": 1.25390625, - "grad_norm": 0.04359544813632965, + "grad_norm": 0.0010733718518167734, "learning_rate": 4.0323513089607876e-05, - "loss": 0.0005239051533862948, + "loss": 1.948333010659553e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00052, + "ppl": 1.00002, "step": 321, "tokens/total": 9712656, - "tokens/train_per_sec_per_gpu": 31.85, + "tokens/train_per_sec_per_gpu": 31.72, "tokens/trainable": 146781 }, { "epoch": 1.2578125, - "grad_norm": 0.02377651259303093, + "grad_norm": 0.0843457579612732, "learning_rate": 4.004940255778431e-05, - "loss": 0.0001890905696200207, + "loss": 0.0008847219287417829, "memory/device_reserved (GiB)": 34.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00019, + "ppl": 1.00089, "step": 322, "tokens/total": 9743088, "tokens/train_per_sec_per_gpu": 35.55, @@ -4519,69 +4519,69 @@ }, { "epoch": 1.26171875, - "grad_norm": 0.01256605889648199, + "grad_norm": 0.09092428535223007, "learning_rate": 3.977591418134619e-05, - "loss": 8.730488480068743e-05, + "loss": 0.00040022452594712377, "memory/device_reserved (GiB)": 35.17, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00009, + "ppl": 1.0004, "step": 323, "tokens/total": 9773808, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 147673 }, { "epoch": 1.265625, - "grad_norm": 0.21066401898860931, + "grad_norm": 0.3859696090221405, "learning_rate": 3.95030593412612e-05, - "loss": 0.0028422519098967314, + "loss": 0.004064415581524372, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00285, + "ppl": 1.00407, "step": 324, "tokens/total": 9804016, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 148103 }, { "epoch": 1.26953125, - "grad_norm": 0.025614596903324127, + "grad_norm": 0.000418124720454216, "learning_rate": 3.923084939213296e-05, - "loss": 0.00016133410099428147, + "loss": 9.266825145459734e-06, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00016, + "ppl": 1.00001, "step": 325, "tokens/total": 9834592, - "tokens/train_per_sec_per_gpu": 31.73, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 148535 }, { "epoch": 1.2734375, - "grad_norm": 0.033190563321113586, + "grad_norm": 0.030438628047704697, "learning_rate": 3.895929566172861e-05, - "loss": 0.00033758440986275673, + "loss": 0.00029550789622589946, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00034, + "ppl": 1.0003, "step": 326, "tokens/total": 9864848, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 148999 }, { "epoch": 1.27734375, - "grad_norm": 0.07407072931528091, + "grad_norm": 0.0003460803418420255, "learning_rate": 3.868840945050728e-05, - "loss": 0.0007672893116250634, + "loss": 9.424240488442592e-06, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00077, + "ppl": 1.00001, "step": 327, "tokens/total": 9895168, "tokens/train_per_sec_per_gpu": 31.64, @@ -4589,125 +4589,125 @@ }, { "epoch": 1.28125, - "grad_norm": 0.05904461070895195, + "grad_norm": 0.32631534337997437, "learning_rate": 3.841820203114995e-05, - "loss": 0.000713472138158977, + "loss": 0.004381683189421892, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00071, + "ppl": 1.00439, "step": 328, "tokens/total": 9925696, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 149886 }, { "epoch": 1.28515625, - "grad_norm": 0.007630123756825924, + "grad_norm": 0.06805918365716934, "learning_rate": 3.814868464809027e-05, - "loss": 7.993751933099702e-05, + "loss": 0.0003639076603576541, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00036, "step": 329, "tokens/total": 9955648, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 31.01, "tokens/trainable": 150288 }, { "epoch": 1.2890625, - "grad_norm": 0.024742672219872475, + "grad_norm": 0.004817479755729437, "learning_rate": 3.787986851704667e-05, - "loss": 0.00019552679441403598, + "loss": 3.246869164286181e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0002, + "ppl": 1.00003, "step": 330, "tokens/total": 9985856, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 150733 }, { "epoch": 1.29296875, - "grad_norm": 0.006353198084980249, + "grad_norm": 0.06923647969961166, "learning_rate": 3.7611764824555654e-05, - "loss": 0.00010314649261999875, + "loss": 0.00031070224940776825, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00031, "step": 331, "tokens/total": 10016208, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 151207 }, { "epoch": 1.296875, - "grad_norm": 0.16203969717025757, + "grad_norm": 0.14731979370117188, "learning_rate": 3.734438472750619e-05, - "loss": 0.0014735229779034853, + "loss": 0.0015139597235247493, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00147, + "ppl": 1.00152, "step": 332, "tokens/total": 10046512, - "tokens/train_per_sec_per_gpu": 37.5, + "tokens/train_per_sec_per_gpu": 37.61, "tokens/trainable": 151694 }, { "epoch": 1.30078125, - "grad_norm": 0.041821569204330444, + "grad_norm": 0.007325666956603527, "learning_rate": 3.707773935267552e-05, - "loss": 0.0004190094769001007, + "loss": 7.809747330611572e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00042, + "ppl": 1.00008, "step": 333, "tokens/total": 10076944, - "tokens/train_per_sec_per_gpu": 38.27, + "tokens/train_per_sec_per_gpu": 38.37, "tokens/trainable": 152188 }, { "epoch": 1.3046875, - "grad_norm": 0.0011248595546931028, + "grad_norm": 0.00047597952652722597, "learning_rate": 3.68118397962661e-05, - "loss": 3.350014958414249e-05, + "loss": 1.2739032172248699e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00001, "step": 334, "tokens/total": 10107296, - "tokens/train_per_sec_per_gpu": 30.6, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 152596 }, { "epoch": 1.30859375, - "grad_norm": 0.003707638941705227, + "grad_norm": 0.0700320228934288, "learning_rate": 3.654669712344384e-05, - "loss": 4.684936357080005e-05, + "loss": 0.00047467637341469526, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00047, "step": 335, "tokens/total": 10137568, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 153052 }, { "epoch": 1.3125, - "grad_norm": 0.0017528374446555972, + "grad_norm": 0.06498395651578903, "learning_rate": 3.628232236787763e-05, - "loss": 2.3632102966075763e-05, + "loss": 0.00041414948645979166, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00002, + "ppl": 1.00041, "step": 336, "tokens/total": 10167952, "tokens/train_per_sec_per_gpu": 30.19, @@ -4715,226 +4715,226 @@ }, { "epoch": 1.31640625, - "grad_norm": 0.0626155436038971, + "grad_norm": 0.009991639293730259, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0006341143744066358, + "loss": 7.060338975861669e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00063, + "ppl": 1.00007, "step": 337, "tokens/total": 10198512, - "tokens/train_per_sec_per_gpu": 40.28, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 153983 }, { "epoch": 1.3203125, - "grad_norm": 0.0166204534471035, + "grad_norm": 0.03267490491271019, "learning_rate": 3.575592058295017e-05, - "loss": 0.00015405623707920313, + "loss": 0.0002045792352873832, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00015, + "ppl": 1.0002, "step": 338, "tokens/total": 10228752, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.72, "tokens/trainable": 154464 }, { "epoch": 1.32421875, - "grad_norm": 0.0004508346610236913, + "grad_norm": 0.00039529221248812973, "learning_rate": 3.549391545931585e-05, - "loss": 8.604627510067075e-06, + "loss": 8.338471161550842e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 339, "tokens/total": 10259104, - "tokens/train_per_sec_per_gpu": 35.73, + "tokens/train_per_sec_per_gpu": 35.87, "tokens/trainable": 154924 }, { "epoch": 1.328125, - "grad_norm": 0.0024134982377290726, + "grad_norm": 0.0010571131715551019, "learning_rate": 3.5232722063479914e-05, - "loss": 4.25071848439984e-05, + "loss": 1.6815669368952513e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00004, + "ppl": 1.00002, "step": 340, "tokens/total": 10289520, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 155373 }, { "epoch": 1.33203125, - "grad_norm": 0.047796547412872314, + "grad_norm": 0.0008337291656062007, "learning_rate": 3.49723512647657e-05, - "loss": 0.0004414983559399843, + "loss": 1.703310408629477e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00044, + "ppl": 1.00002, "step": 341, "tokens/total": 10320016, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 155873 }, { "epoch": 1.3359375, - "grad_norm": 0.0013580132508650422, + "grad_norm": 0.0007872325950302184, "learning_rate": 3.471281389826491e-05, - "loss": 3.1043862691149116e-05, + "loss": 1.626565062906593e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00002, "step": 342, "tokens/total": 10350368, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.42, "tokens/trainable": 156278 }, { "epoch": 1.33984375, - "grad_norm": 0.013898961246013641, + "grad_norm": 0.21220935881137848, "learning_rate": 3.4454120764386764e-05, - "loss": 9.816634701564908e-05, + "loss": 0.0009314992348663509, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00093, "step": 343, "tokens/total": 10380624, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.4, "tokens/trainable": 156733 }, { "epoch": 1.34375, - "grad_norm": 0.0031031679827719927, + "grad_norm": 0.017469989135861397, "learning_rate": 3.4196282628408526e-05, - "loss": 4.329531657276675e-05, + "loss": 7.496406033169478e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00004, + "ppl": 1.00007, "step": 344, "tokens/total": 10411024, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 157203 }, { "epoch": 1.34765625, - "grad_norm": 0.009028271771967411, + "grad_norm": 0.2605672776699066, "learning_rate": 3.3939310220027456e-05, - "loss": 0.00010301935981260613, + "loss": 0.004417422227561474, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00443, "step": 345, "tokens/total": 10441248, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 157707 }, { "epoch": 1.3515625, - "grad_norm": 0.0036287850234657526, + "grad_norm": 0.00032958327210508287, "learning_rate": 3.3683214232914404e-05, - "loss": 4.620348772732541e-05, + "loss": 7.68474092183169e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00005, + "ppl": 1.00001, "step": 346, "tokens/total": 10471712, - "tokens/train_per_sec_per_gpu": 34.96, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 158180 }, { "epoch": 1.35546875, - "grad_norm": 0.08971801400184631, + "grad_norm": 0.0021204655058681965, "learning_rate": 3.342800532426873e-05, - "loss": 0.0009501657332293689, + "loss": 2.9396429454209283e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00095, + "ppl": 1.00003, "step": 347, "tokens/total": 10502288, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.41, "tokens/trainable": 158646 }, { "epoch": 1.359375, - "grad_norm": 0.00890435092151165, + "grad_norm": 0.00040693042683415115, "learning_rate": 3.317369411437484e-05, - "loss": 7.783617911627516e-05, + "loss": 9.5013465397642e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00001, "step": 348, "tokens/total": 10532304, - "tokens/train_per_sec_per_gpu": 35.59, + "tokens/train_per_sec_per_gpu": 35.66, "tokens/trainable": 159115 }, { "epoch": 1.36328125, - "grad_norm": 0.023319199681282043, + "grad_norm": 0.006379029247909784, "learning_rate": 3.292029118616024e-05, - "loss": 0.00021630006085615605, + "loss": 9.018932178150862e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00022, + "ppl": 1.00009, "step": 349, "tokens/total": 10562608, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 159538 }, { "epoch": 1.3671875, - "grad_norm": 0.047880928963422775, + "grad_norm": 0.005555902142077684, "learning_rate": 3.266780708475511e-05, - "loss": 0.00044884331873618066, + "loss": 5.1456365326885134e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00045, + "ppl": 1.00005, "step": 350, "tokens/total": 10592992, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.22, "tokens/trainable": 160016 }, { "epoch": 1.37109375, - "grad_norm": 0.008666309528052807, + "grad_norm": 0.009832990355789661, "learning_rate": 3.241625231705354e-05, - "loss": 5.017036892240867e-05, + "loss": 9.037736163008958e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00005, + "ppl": 1.00009, "step": 351, "tokens/total": 10623328, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.57, "tokens/trainable": 160475 }, { "epoch": 1.375, - "grad_norm": 0.06452610343694687, + "grad_norm": 0.0002588493807706982, "learning_rate": 3.216563735127618e-05, - "loss": 0.0007272367365658283, + "loss": 7.509744136768859e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00073, + "ppl": 1.00001, "step": 352, "tokens/total": 10653632, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 160952 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_model.safetensors index f88d0a8fae2c49e25dc49efba3fc838ee15b53e5..014aed184a25dce1b15610cdd110c8ea65fc7f5f 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:2f7dcd0f7d14c350cd56309aaef62d28c523be064d87d9feae5141fe2890924d +oid sha256:535e88052cb6afb16717578e8ca20d23dd4e86de845c837f78a8af4881d745cf size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/optimizer.pt index 93aeb321d7b80b05b8969cae64d4210f7c88628e..039ea7adf3f4cb048b24848d210dde5e24e90044 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:8155a0ce1ff150d4770b9daab3658e3e6adb736967f6f914797107c25fd6c8b0 +oid sha256:1e2785d9c6ff17bc108c22ed9e79c9bbf116cbeae3109e3b396835a887d1ed2d size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/trainer_state.json index 44425253ba29e52e87d4901a2aa1e79fd61e77cb..c2f5c88b41809802f91a2f1fbd15b1ef0b291546 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-384/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,461 +4057,461 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 }, { "epoch": 1.25390625, - "grad_norm": 0.04359544813632965, + "grad_norm": 0.0010733718518167734, "learning_rate": 4.0323513089607876e-05, - "loss": 0.0005239051533862948, + "loss": 1.948333010659553e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00052, + "ppl": 1.00002, "step": 321, "tokens/total": 9712656, - "tokens/train_per_sec_per_gpu": 31.85, + "tokens/train_per_sec_per_gpu": 31.72, "tokens/trainable": 146781 }, { "epoch": 1.2578125, - "grad_norm": 0.02377651259303093, + "grad_norm": 0.0843457579612732, "learning_rate": 4.004940255778431e-05, - "loss": 0.0001890905696200207, + "loss": 0.0008847219287417829, "memory/device_reserved (GiB)": 34.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00019, + "ppl": 1.00089, "step": 322, "tokens/total": 9743088, "tokens/train_per_sec_per_gpu": 35.55, @@ -4519,69 +4519,69 @@ }, { "epoch": 1.26171875, - "grad_norm": 0.01256605889648199, + "grad_norm": 0.09092428535223007, "learning_rate": 3.977591418134619e-05, - "loss": 8.730488480068743e-05, + "loss": 0.00040022452594712377, "memory/device_reserved (GiB)": 35.17, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00009, + "ppl": 1.0004, "step": 323, "tokens/total": 9773808, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 147673 }, { "epoch": 1.265625, - "grad_norm": 0.21066401898860931, + "grad_norm": 0.3859696090221405, "learning_rate": 3.95030593412612e-05, - "loss": 0.0028422519098967314, + "loss": 0.004064415581524372, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00285, + "ppl": 1.00407, "step": 324, "tokens/total": 9804016, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 148103 }, { "epoch": 1.26953125, - "grad_norm": 0.025614596903324127, + "grad_norm": 0.000418124720454216, "learning_rate": 3.923084939213296e-05, - "loss": 0.00016133410099428147, + "loss": 9.266825145459734e-06, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00016, + "ppl": 1.00001, "step": 325, "tokens/total": 9834592, - "tokens/train_per_sec_per_gpu": 31.73, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 148535 }, { "epoch": 1.2734375, - "grad_norm": 0.033190563321113586, + "grad_norm": 0.030438628047704697, "learning_rate": 3.895929566172861e-05, - "loss": 0.00033758440986275673, + "loss": 0.00029550789622589946, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00034, + "ppl": 1.0003, "step": 326, "tokens/total": 9864848, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 148999 }, { "epoch": 1.27734375, - "grad_norm": 0.07407072931528091, + "grad_norm": 0.0003460803418420255, "learning_rate": 3.868840945050728e-05, - "loss": 0.0007672893116250634, + "loss": 9.424240488442592e-06, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00077, + "ppl": 1.00001, "step": 327, "tokens/total": 9895168, "tokens/train_per_sec_per_gpu": 31.64, @@ -4589,125 +4589,125 @@ }, { "epoch": 1.28125, - "grad_norm": 0.05904461070895195, + "grad_norm": 0.32631534337997437, "learning_rate": 3.841820203114995e-05, - "loss": 0.000713472138158977, + "loss": 0.004381683189421892, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00071, + "ppl": 1.00439, "step": 328, "tokens/total": 9925696, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 149886 }, { "epoch": 1.28515625, - "grad_norm": 0.007630123756825924, + "grad_norm": 0.06805918365716934, "learning_rate": 3.814868464809027e-05, - "loss": 7.993751933099702e-05, + "loss": 0.0003639076603576541, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00036, "step": 329, "tokens/total": 9955648, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 31.01, "tokens/trainable": 150288 }, { "epoch": 1.2890625, - "grad_norm": 0.024742672219872475, + "grad_norm": 0.004817479755729437, "learning_rate": 3.787986851704667e-05, - "loss": 0.00019552679441403598, + "loss": 3.246869164286181e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0002, + "ppl": 1.00003, "step": 330, "tokens/total": 9985856, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 150733 }, { "epoch": 1.29296875, - "grad_norm": 0.006353198084980249, + "grad_norm": 0.06923647969961166, "learning_rate": 3.7611764824555654e-05, - "loss": 0.00010314649261999875, + "loss": 0.00031070224940776825, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00031, "step": 331, "tokens/total": 10016208, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 151207 }, { "epoch": 1.296875, - "grad_norm": 0.16203969717025757, + "grad_norm": 0.14731979370117188, "learning_rate": 3.734438472750619e-05, - "loss": 0.0014735229779034853, + "loss": 0.0015139597235247493, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00147, + "ppl": 1.00152, "step": 332, "tokens/total": 10046512, - "tokens/train_per_sec_per_gpu": 37.5, + "tokens/train_per_sec_per_gpu": 37.61, "tokens/trainable": 151694 }, { "epoch": 1.30078125, - "grad_norm": 0.041821569204330444, + "grad_norm": 0.007325666956603527, "learning_rate": 3.707773935267552e-05, - "loss": 0.0004190094769001007, + "loss": 7.809747330611572e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00042, + "ppl": 1.00008, "step": 333, "tokens/total": 10076944, - "tokens/train_per_sec_per_gpu": 38.27, + "tokens/train_per_sec_per_gpu": 38.37, "tokens/trainable": 152188 }, { "epoch": 1.3046875, - "grad_norm": 0.0011248595546931028, + "grad_norm": 0.00047597952652722597, "learning_rate": 3.68118397962661e-05, - "loss": 3.350014958414249e-05, + "loss": 1.2739032172248699e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00001, "step": 334, "tokens/total": 10107296, - "tokens/train_per_sec_per_gpu": 30.6, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 152596 }, { "epoch": 1.30859375, - "grad_norm": 0.003707638941705227, + "grad_norm": 0.0700320228934288, "learning_rate": 3.654669712344384e-05, - "loss": 4.684936357080005e-05, + "loss": 0.00047467637341469526, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00047, "step": 335, "tokens/total": 10137568, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 153052 }, { "epoch": 1.3125, - "grad_norm": 0.0017528374446555972, + "grad_norm": 0.06498395651578903, "learning_rate": 3.628232236787763e-05, - "loss": 2.3632102966075763e-05, + "loss": 0.00041414948645979166, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00002, + "ppl": 1.00041, "step": 336, "tokens/total": 10167952, "tokens/train_per_sec_per_gpu": 30.19, @@ -4715,674 +4715,674 @@ }, { "epoch": 1.31640625, - "grad_norm": 0.0626155436038971, + "grad_norm": 0.009991639293730259, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0006341143744066358, + "loss": 7.060338975861669e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00063, + "ppl": 1.00007, "step": 337, "tokens/total": 10198512, - "tokens/train_per_sec_per_gpu": 40.28, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 153983 }, { "epoch": 1.3203125, - "grad_norm": 0.0166204534471035, + "grad_norm": 0.03267490491271019, "learning_rate": 3.575592058295017e-05, - "loss": 0.00015405623707920313, + "loss": 0.0002045792352873832, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00015, + "ppl": 1.0002, "step": 338, "tokens/total": 10228752, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.72, "tokens/trainable": 154464 }, { "epoch": 1.32421875, - "grad_norm": 0.0004508346610236913, + "grad_norm": 0.00039529221248812973, "learning_rate": 3.549391545931585e-05, - "loss": 8.604627510067075e-06, + "loss": 8.338471161550842e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 339, "tokens/total": 10259104, - "tokens/train_per_sec_per_gpu": 35.73, + "tokens/train_per_sec_per_gpu": 35.87, "tokens/trainable": 154924 }, { "epoch": 1.328125, - "grad_norm": 0.0024134982377290726, + "grad_norm": 0.0010571131715551019, "learning_rate": 3.5232722063479914e-05, - "loss": 4.25071848439984e-05, + "loss": 1.6815669368952513e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00004, + "ppl": 1.00002, "step": 340, "tokens/total": 10289520, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 155373 }, { "epoch": 1.33203125, - "grad_norm": 0.047796547412872314, + "grad_norm": 0.0008337291656062007, "learning_rate": 3.49723512647657e-05, - "loss": 0.0004414983559399843, + "loss": 1.703310408629477e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00044, + "ppl": 1.00002, "step": 341, "tokens/total": 10320016, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 155873 }, { "epoch": 1.3359375, - "grad_norm": 0.0013580132508650422, + "grad_norm": 0.0007872325950302184, "learning_rate": 3.471281389826491e-05, - "loss": 3.1043862691149116e-05, + "loss": 1.626565062906593e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00002, "step": 342, "tokens/total": 10350368, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.42, "tokens/trainable": 156278 }, { "epoch": 1.33984375, - "grad_norm": 0.013898961246013641, + "grad_norm": 0.21220935881137848, "learning_rate": 3.4454120764386764e-05, - "loss": 9.816634701564908e-05, + "loss": 0.0009314992348663509, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00093, "step": 343, "tokens/total": 10380624, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.4, "tokens/trainable": 156733 }, { "epoch": 1.34375, - "grad_norm": 0.0031031679827719927, + "grad_norm": 0.017469989135861397, "learning_rate": 3.4196282628408526e-05, - "loss": 4.329531657276675e-05, + "loss": 7.496406033169478e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00004, + "ppl": 1.00007, "step": 344, "tokens/total": 10411024, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 157203 }, { "epoch": 1.34765625, - "grad_norm": 0.009028271771967411, + "grad_norm": 0.2605672776699066, "learning_rate": 3.3939310220027456e-05, - "loss": 0.00010301935981260613, + "loss": 0.004417422227561474, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00443, "step": 345, "tokens/total": 10441248, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 157707 }, { "epoch": 1.3515625, - "grad_norm": 0.0036287850234657526, + "grad_norm": 0.00032958327210508287, "learning_rate": 3.3683214232914404e-05, - "loss": 4.620348772732541e-05, + "loss": 7.68474092183169e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00005, + "ppl": 1.00001, "step": 346, "tokens/total": 10471712, - "tokens/train_per_sec_per_gpu": 34.96, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 158180 }, { "epoch": 1.35546875, - "grad_norm": 0.08971801400184631, + "grad_norm": 0.0021204655058681965, "learning_rate": 3.342800532426873e-05, - "loss": 0.0009501657332293689, + "loss": 2.9396429454209283e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00095, + "ppl": 1.00003, "step": 347, "tokens/total": 10502288, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.41, "tokens/trainable": 158646 }, { "epoch": 1.359375, - "grad_norm": 0.00890435092151165, + "grad_norm": 0.00040693042683415115, "learning_rate": 3.317369411437484e-05, - "loss": 7.783617911627516e-05, + "loss": 9.5013465397642e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00001, "step": 348, "tokens/total": 10532304, - "tokens/train_per_sec_per_gpu": 35.59, + "tokens/train_per_sec_per_gpu": 35.66, "tokens/trainable": 159115 }, { "epoch": 1.36328125, - "grad_norm": 0.023319199681282043, + "grad_norm": 0.006379029247909784, "learning_rate": 3.292029118616024e-05, - "loss": 0.00021630006085615605, + "loss": 9.018932178150862e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00022, + "ppl": 1.00009, "step": 349, "tokens/total": 10562608, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 159538 }, { "epoch": 1.3671875, - "grad_norm": 0.047880928963422775, + "grad_norm": 0.005555902142077684, "learning_rate": 3.266780708475511e-05, - "loss": 0.00044884331873618066, + "loss": 5.1456365326885134e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00045, + "ppl": 1.00005, "step": 350, "tokens/total": 10592992, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.22, "tokens/trainable": 160016 }, { "epoch": 1.37109375, - "grad_norm": 0.008666309528052807, + "grad_norm": 0.009832990355789661, "learning_rate": 3.241625231705354e-05, - "loss": 5.017036892240867e-05, + "loss": 9.037736163008958e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00005, + "ppl": 1.00009, "step": 351, "tokens/total": 10623328, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.57, "tokens/trainable": 160475 }, { "epoch": 1.375, - "grad_norm": 0.06452610343694687, + "grad_norm": 0.0002588493807706982, "learning_rate": 3.216563735127618e-05, - "loss": 0.0007272367365658283, + "loss": 7.509744136768859e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00073, + "ppl": 1.00001, "step": 352, "tokens/total": 10653632, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 160952 }, { "epoch": 1.37890625, - "grad_norm": 0.370597779750824, + "grad_norm": 0.03195308893918991, "learning_rate": 3.191597261653475e-05, - "loss": 0.007550997193902731, + "loss": 0.0002666166110429913, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00758, + "ppl": 1.00027, "step": 353, "tokens/total": 10684176, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 161420 }, { "epoch": 1.3828125, - "grad_norm": 0.0031376827973872423, + "grad_norm": 0.07012991607189178, "learning_rate": 3.166726850239794e-05, - "loss": 2.3453332687495276e-05, + "loss": 0.000741704716347158, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00074, "step": 354, "tokens/total": 10714352, - "tokens/train_per_sec_per_gpu": 34.02, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 161868 }, { "epoch": 1.38671875, - "grad_norm": 0.0021399864926934242, + "grad_norm": 0.0005822654929943383, "learning_rate": 3.141953535845912e-05, - "loss": 2.5832894607447088e-05, + "loss": 1.0378402294008993e-05, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00001, "step": 355, "tokens/total": 10744464, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 162318 }, { "epoch": 1.390625, - "grad_norm": 0.0028148347046226263, + "grad_norm": 0.012435230426490307, "learning_rate": 3.11727834939056e-05, - "loss": 3.7286932638380677e-05, + "loss": 7.89838086348027e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00008, "step": 356, "tokens/total": 10774976, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.54, "tokens/trainable": 162789 }, { "epoch": 1.39453125, - "grad_norm": 0.1642119586467743, + "grad_norm": 0.0045598647557199, "learning_rate": 3.092702317708967e-05, - "loss": 0.0027845175936818123, + "loss": 2.48450869548833e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00279, + "ppl": 1.00002, "step": 357, "tokens/total": 10805600, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 163254 }, { "epoch": 1.3984375, - "grad_norm": 0.066535085439682, + "grad_norm": 0.3044262230396271, "learning_rate": 3.0682264635101276e-05, - "loss": 0.0002488417667336762, + "loss": 0.002298796083778143, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00025, + "ppl": 1.0023, "step": 358, "tokens/total": 10835920, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.62, "tokens/trainable": 163715 }, { "epoch": 1.40234375, - "grad_norm": 0.006617655046284199, + "grad_norm": 0.002458421979099512, "learning_rate": 3.0438518053342407e-05, - "loss": 7.841112528694794e-05, + "loss": 1.9634167983895168e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 359, "tokens/total": 10866048, - "tokens/train_per_sec_per_gpu": 34.4, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 164197 }, { "epoch": 1.40625, - "grad_norm": 0.010409035719931126, + "grad_norm": 0.0024773837067186832, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010489403939573094, + "loss": 2.744927041931078e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00003, "step": 360, "tokens/total": 10896288, - "tokens/train_per_sec_per_gpu": 31.6, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 164661 }, { "epoch": 1.41015625, - "grad_norm": 0.002426267135888338, + "grad_norm": 0.00026717092259787023, "learning_rate": 2.9954101301140146e-05, - "loss": 4.0343060391023755e-05, + "loss": 6.422977094189264e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00001, "step": 361, "tokens/total": 10926816, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 165111 }, { "epoch": 1.4140625, - "grad_norm": 0.015666797757148743, + "grad_norm": 0.0008353493758477271, "learning_rate": 2.9713451289255123e-05, - "loss": 0.00014991794887464494, + "loss": 1.3549893083109055e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00015, + "ppl": 1.00001, "step": 362, "tokens/total": 10954928, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 165552 }, { "epoch": 1.41796875, - "grad_norm": 0.2695651650428772, + "grad_norm": 0.006071125157177448, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0014983330620452762, + "loss": 6.428411870729178e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.0015, + "ppl": 1.00006, "step": 363, "tokens/total": 10985328, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 166026 }, { "epoch": 1.421875, - "grad_norm": 0.03586212173104286, + "grad_norm": 0.25424960255622864, "learning_rate": 2.9235318065647e-05, - "loss": 0.00030509717180393636, + "loss": 0.004243595991283655, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00031, + "ppl": 1.00425, "step": 364, "tokens/total": 11015664, - "tokens/train_per_sec_per_gpu": 37.86, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 166486 }, { "epoch": 1.42578125, - "grad_norm": 0.0019308789633214474, + "grad_norm": 0.0005575277027674019, "learning_rate": 2.8997854750998964e-05, - "loss": 2.4129443772835657e-05, + "loss": 8.403902938880492e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00001, "step": 365, "tokens/total": 11046256, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 166959 }, { "epoch": 1.4296875, - "grad_norm": 0.005940837785601616, + "grad_norm": 0.0014335239538922906, "learning_rate": 2.8761473491751258e-05, - "loss": 2.8238933737156913e-05, + "loss": 1.4738036043127067e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.68, "memory/max_allocated (GiB)": 33.68, - "ppl": 1.00003, + "ppl": 1.00001, "step": 366, "tokens/total": 11076288, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 167394 }, { "epoch": 1.43359375, - "grad_norm": 0.002125627128407359, + "grad_norm": 0.0010152696631848812, "learning_rate": 2.8526184124692883e-05, - "loss": 1.602789416210726e-05, + "loss": 1.3278609912958927e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00001, "step": 367, "tokens/total": 11106416, - "tokens/train_per_sec_per_gpu": 28.5, + "tokens/train_per_sec_per_gpu": 28.58, "tokens/trainable": 167832 }, { "epoch": 1.4375, - "grad_norm": 0.2510211765766144, + "grad_norm": 0.11941836029291153, "learning_rate": 2.829199644117484e-05, - "loss": 0.00010395953722763807, + "loss": 0.0006476733833551407, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00065, "step": 368, "tokens/total": 11136848, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 31.02, "tokens/trainable": 168242 }, { "epoch": 1.44140625, - "grad_norm": 0.001904280623421073, + "grad_norm": 0.006877629552036524, "learning_rate": 2.8058920186702553e-05, - "loss": 2.6418363631819375e-05, + "loss": 7.449048280250281e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00007, "step": 369, "tokens/total": 11167376, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 168715 }, { "epoch": 1.4453125, - "grad_norm": 0.0028152521699666977, + "grad_norm": 0.0007151139434427023, "learning_rate": 2.782696506053033e-05, - "loss": 2.9974533390486613e-05, + "loss": 1.1437590728746727e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00001, "step": 370, "tokens/total": 11197776, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.86, "tokens/trainable": 169147 }, { "epoch": 1.44921875, - "grad_norm": 0.0010822078911587596, + "grad_norm": 0.009094453416764736, "learning_rate": 2.7596140715257824e-05, - "loss": 1.34217716549756e-05, + "loss": 5.9242345741949975e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00006, "step": 371, "tokens/total": 11227840, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 169628 }, { "epoch": 1.453125, - "grad_norm": 0.005367911420762539, + "grad_norm": 0.000247267191298306, "learning_rate": 2.7366456756428184e-05, - "loss": 6.65646803099662e-05, + "loss": 7.548428584414069e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00007, + "ppl": 1.00001, "step": 372, "tokens/total": 11258176, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 170085 }, { "epoch": 1.45703125, - "grad_norm": 0.047570567578077316, + "grad_norm": 0.0003029497747775167, "learning_rate": 2.7137922742128486e-05, - "loss": 0.0003471036907285452, + "loss": 5.4013939916330855e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00035, + "ppl": 1.00001, "step": 373, "tokens/total": 11288336, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 170584 }, { "epoch": 1.4609375, - "grad_norm": 0.040886107832193375, + "grad_norm": 0.001942179980687797, "learning_rate": 2.691054818259188e-05, - "loss": 0.0002880148240365088, + "loss": 2.380511250521522e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00029, + "ppl": 1.00002, "step": 374, "tokens/total": 11318848, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 171058 }, { "epoch": 1.46484375, - "grad_norm": 0.0031216361094266176, + "grad_norm": 0.0019308892078697681, "learning_rate": 2.6684342539801933e-05, - "loss": 2.690855944820214e-05, + "loss": 1.5233906196954194e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00002, "step": 375, "tokens/total": 11349168, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 171518 }, { "epoch": 1.46875, - "grad_norm": 0.012176645919680595, + "grad_norm": 0.6044301986694336, "learning_rate": 2.645931522709877e-05, - "loss": 8.402287494391203e-05, + "loss": 0.006350134499371052, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00008, + "ppl": 1.00637, "step": 376, "tokens/total": 11379328, - "tokens/train_per_sec_per_gpu": 40.48, + "tokens/train_per_sec_per_gpu": 40.62, "tokens/trainable": 172007 }, { "epoch": 1.47265625, - "grad_norm": 0.24136756360530853, + "grad_norm": 0.25446587800979614, "learning_rate": 2.6235475608787365e-05, - "loss": 0.0013303000014275312, + "loss": 0.0018724403344094753, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00133, + "ppl": 1.00187, "step": 377, "tokens/total": 11409568, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 172468 }, { "epoch": 1.4765625, - "grad_norm": 0.021714258939027786, + "grad_norm": 0.0019207323202863336, "learning_rate": 2.6012832999747916e-05, - "loss": 0.00020160498388577253, + "loss": 3.049923907383345e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0002, + "ppl": 1.00003, "step": 378, "tokens/total": 11439968, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 172923 }, { "epoch": 1.48046875, - "grad_norm": 0.35412073135375977, + "grad_norm": 0.33491548895835876, "learning_rate": 2.579139666504821e-05, - "loss": 0.015761105343699455, + "loss": 0.02673855796456337, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01589, + "ppl": 1.0271, "step": 379, "tokens/total": 11470496, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 173370 }, { "epoch": 1.484375, - "grad_norm": 0.005766173824667931, + "grad_norm": 0.006177723873406649, "learning_rate": 2.557117581955798e-05, - "loss": 2.5790239305933937e-05, + "loss": 5.195035191718489e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00005, "step": 380, "tokens/total": 11500720, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 173837 }, { "epoch": 1.48828125, - "grad_norm": 0.005898744333535433, + "grad_norm": 0.06973031163215637, "learning_rate": 2.5352179627565532e-05, - "loss": 5.821501690661535e-05, + "loss": 0.0006310560274869204, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00006, + "ppl": 1.00063, "step": 381, "tokens/total": 11531280, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 174294 }, { "epoch": 1.4921875, - "grad_norm": 0.005451703444123268, + "grad_norm": 0.0039021887350827456, "learning_rate": 2.5134417202396277e-05, - "loss": 4.0181505028158426e-05, + "loss": 4.849781544180587e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00005, "step": 382, "tokens/total": 11561264, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.84, "tokens/trainable": 174701 }, { "epoch": 1.49609375, - "grad_norm": 0.0038302047178149223, + "grad_norm": 0.0007975143962539732, "learning_rate": 2.491789760603361e-05, - "loss": 3.403786467970349e-05, + "loss": 2.3489263185183518e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00002, "step": 383, "tokens/total": 11591616, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 175131 }, { "epoch": 1.5, - "grad_norm": 0.004227485507726669, + "grad_norm": 0.012541128322482109, "learning_rate": 2.4702629848741764e-05, - "loss": 3.562243364285678e-05, + "loss": 0.00011495217040646821, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00011, "step": 384, "tokens/total": 11622000, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 175586 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_model.safetensors index 1456a02749858800eb116defcb5ca35f531da046..3c266dc766268e163d19266d3054c932fed78a74 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:ee180b0dcc20c9c141d258bba075090f4b87eda8f6b515908a03572f6fc4ca76 +oid sha256:0d560dd0eb4e8597dfc939225d96feb31798b32c08203167541c630616fa2492 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/optimizer.pt index 950115dc3d2f093c1d3c5fe496c4b4b22a8e65cc..9e91de2a2949e863d20d36465bd9c2af57c81513 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:a82de99afc36ad2c4890b24e750b8c58940441e1006803dd32e087423bd37e67 +oid sha256:cd9783ec9609f3730f73bfcc5cfd64cc123f08f492bbf069f1c6f47c16144b5d size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/trainer_state.json index 214d6bf6da324da9008c9edc7ff77b3dba9213ae..81d723027848e0ac359b04236d221e710d21e369 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-416/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,461 +4057,461 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 }, { "epoch": 1.25390625, - "grad_norm": 0.04359544813632965, + "grad_norm": 0.0010733718518167734, "learning_rate": 4.0323513089607876e-05, - "loss": 0.0005239051533862948, + "loss": 1.948333010659553e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00052, + "ppl": 1.00002, "step": 321, "tokens/total": 9712656, - "tokens/train_per_sec_per_gpu": 31.85, + "tokens/train_per_sec_per_gpu": 31.72, "tokens/trainable": 146781 }, { "epoch": 1.2578125, - "grad_norm": 0.02377651259303093, + "grad_norm": 0.0843457579612732, "learning_rate": 4.004940255778431e-05, - "loss": 0.0001890905696200207, + "loss": 0.0008847219287417829, "memory/device_reserved (GiB)": 34.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00019, + "ppl": 1.00089, "step": 322, "tokens/total": 9743088, "tokens/train_per_sec_per_gpu": 35.55, @@ -4519,69 +4519,69 @@ }, { "epoch": 1.26171875, - "grad_norm": 0.01256605889648199, + "grad_norm": 0.09092428535223007, "learning_rate": 3.977591418134619e-05, - "loss": 8.730488480068743e-05, + "loss": 0.00040022452594712377, "memory/device_reserved (GiB)": 35.17, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00009, + "ppl": 1.0004, "step": 323, "tokens/total": 9773808, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 147673 }, { "epoch": 1.265625, - "grad_norm": 0.21066401898860931, + "grad_norm": 0.3859696090221405, "learning_rate": 3.95030593412612e-05, - "loss": 0.0028422519098967314, + "loss": 0.004064415581524372, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00285, + "ppl": 1.00407, "step": 324, "tokens/total": 9804016, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 148103 }, { "epoch": 1.26953125, - "grad_norm": 0.025614596903324127, + "grad_norm": 0.000418124720454216, "learning_rate": 3.923084939213296e-05, - "loss": 0.00016133410099428147, + "loss": 9.266825145459734e-06, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00016, + "ppl": 1.00001, "step": 325, "tokens/total": 9834592, - "tokens/train_per_sec_per_gpu": 31.73, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 148535 }, { "epoch": 1.2734375, - "grad_norm": 0.033190563321113586, + "grad_norm": 0.030438628047704697, "learning_rate": 3.895929566172861e-05, - "loss": 0.00033758440986275673, + "loss": 0.00029550789622589946, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00034, + "ppl": 1.0003, "step": 326, "tokens/total": 9864848, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 148999 }, { "epoch": 1.27734375, - "grad_norm": 0.07407072931528091, + "grad_norm": 0.0003460803418420255, "learning_rate": 3.868840945050728e-05, - "loss": 0.0007672893116250634, + "loss": 9.424240488442592e-06, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00077, + "ppl": 1.00001, "step": 327, "tokens/total": 9895168, "tokens/train_per_sec_per_gpu": 31.64, @@ -4589,125 +4589,125 @@ }, { "epoch": 1.28125, - "grad_norm": 0.05904461070895195, + "grad_norm": 0.32631534337997437, "learning_rate": 3.841820203114995e-05, - "loss": 0.000713472138158977, + "loss": 0.004381683189421892, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00071, + "ppl": 1.00439, "step": 328, "tokens/total": 9925696, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 149886 }, { "epoch": 1.28515625, - "grad_norm": 0.007630123756825924, + "grad_norm": 0.06805918365716934, "learning_rate": 3.814868464809027e-05, - "loss": 7.993751933099702e-05, + "loss": 0.0003639076603576541, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00036, "step": 329, "tokens/total": 9955648, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 31.01, "tokens/trainable": 150288 }, { "epoch": 1.2890625, - "grad_norm": 0.024742672219872475, + "grad_norm": 0.004817479755729437, "learning_rate": 3.787986851704667e-05, - "loss": 0.00019552679441403598, + "loss": 3.246869164286181e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0002, + "ppl": 1.00003, "step": 330, "tokens/total": 9985856, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 150733 }, { "epoch": 1.29296875, - "grad_norm": 0.006353198084980249, + "grad_norm": 0.06923647969961166, "learning_rate": 3.7611764824555654e-05, - "loss": 0.00010314649261999875, + "loss": 0.00031070224940776825, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00031, "step": 331, "tokens/total": 10016208, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 151207 }, { "epoch": 1.296875, - "grad_norm": 0.16203969717025757, + "grad_norm": 0.14731979370117188, "learning_rate": 3.734438472750619e-05, - "loss": 0.0014735229779034853, + "loss": 0.0015139597235247493, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00147, + "ppl": 1.00152, "step": 332, "tokens/total": 10046512, - "tokens/train_per_sec_per_gpu": 37.5, + "tokens/train_per_sec_per_gpu": 37.61, "tokens/trainable": 151694 }, { "epoch": 1.30078125, - "grad_norm": 0.041821569204330444, + "grad_norm": 0.007325666956603527, "learning_rate": 3.707773935267552e-05, - "loss": 0.0004190094769001007, + "loss": 7.809747330611572e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00042, + "ppl": 1.00008, "step": 333, "tokens/total": 10076944, - "tokens/train_per_sec_per_gpu": 38.27, + "tokens/train_per_sec_per_gpu": 38.37, "tokens/trainable": 152188 }, { "epoch": 1.3046875, - "grad_norm": 0.0011248595546931028, + "grad_norm": 0.00047597952652722597, "learning_rate": 3.68118397962661e-05, - "loss": 3.350014958414249e-05, + "loss": 1.2739032172248699e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00001, "step": 334, "tokens/total": 10107296, - "tokens/train_per_sec_per_gpu": 30.6, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 152596 }, { "epoch": 1.30859375, - "grad_norm": 0.003707638941705227, + "grad_norm": 0.0700320228934288, "learning_rate": 3.654669712344384e-05, - "loss": 4.684936357080005e-05, + "loss": 0.00047467637341469526, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00047, "step": 335, "tokens/total": 10137568, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 153052 }, { "epoch": 1.3125, - "grad_norm": 0.0017528374446555972, + "grad_norm": 0.06498395651578903, "learning_rate": 3.628232236787763e-05, - "loss": 2.3632102966075763e-05, + "loss": 0.00041414948645979166, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00002, + "ppl": 1.00041, "step": 336, "tokens/total": 10167952, "tokens/train_per_sec_per_gpu": 30.19, @@ -4715,1105 +4715,1105 @@ }, { "epoch": 1.31640625, - "grad_norm": 0.0626155436038971, + "grad_norm": 0.009991639293730259, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0006341143744066358, + "loss": 7.060338975861669e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00063, + "ppl": 1.00007, "step": 337, "tokens/total": 10198512, - "tokens/train_per_sec_per_gpu": 40.28, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 153983 }, { "epoch": 1.3203125, - "grad_norm": 0.0166204534471035, + "grad_norm": 0.03267490491271019, "learning_rate": 3.575592058295017e-05, - "loss": 0.00015405623707920313, + "loss": 0.0002045792352873832, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00015, + "ppl": 1.0002, "step": 338, "tokens/total": 10228752, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.72, "tokens/trainable": 154464 }, { "epoch": 1.32421875, - "grad_norm": 0.0004508346610236913, + "grad_norm": 0.00039529221248812973, "learning_rate": 3.549391545931585e-05, - "loss": 8.604627510067075e-06, + "loss": 8.338471161550842e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 339, "tokens/total": 10259104, - "tokens/train_per_sec_per_gpu": 35.73, + "tokens/train_per_sec_per_gpu": 35.87, "tokens/trainable": 154924 }, { "epoch": 1.328125, - "grad_norm": 0.0024134982377290726, + "grad_norm": 0.0010571131715551019, "learning_rate": 3.5232722063479914e-05, - "loss": 4.25071848439984e-05, + "loss": 1.6815669368952513e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00004, + "ppl": 1.00002, "step": 340, "tokens/total": 10289520, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 155373 }, { "epoch": 1.33203125, - "grad_norm": 0.047796547412872314, + "grad_norm": 0.0008337291656062007, "learning_rate": 3.49723512647657e-05, - "loss": 0.0004414983559399843, + "loss": 1.703310408629477e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00044, + "ppl": 1.00002, "step": 341, "tokens/total": 10320016, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 155873 }, { "epoch": 1.3359375, - "grad_norm": 0.0013580132508650422, + "grad_norm": 0.0007872325950302184, "learning_rate": 3.471281389826491e-05, - "loss": 3.1043862691149116e-05, + "loss": 1.626565062906593e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00002, "step": 342, "tokens/total": 10350368, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.42, "tokens/trainable": 156278 }, { "epoch": 1.33984375, - "grad_norm": 0.013898961246013641, + "grad_norm": 0.21220935881137848, "learning_rate": 3.4454120764386764e-05, - "loss": 9.816634701564908e-05, + "loss": 0.0009314992348663509, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00093, "step": 343, "tokens/total": 10380624, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.4, "tokens/trainable": 156733 }, { "epoch": 1.34375, - "grad_norm": 0.0031031679827719927, + "grad_norm": 0.017469989135861397, "learning_rate": 3.4196282628408526e-05, - "loss": 4.329531657276675e-05, + "loss": 7.496406033169478e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00004, + "ppl": 1.00007, "step": 344, "tokens/total": 10411024, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 157203 }, { "epoch": 1.34765625, - "grad_norm": 0.009028271771967411, + "grad_norm": 0.2605672776699066, "learning_rate": 3.3939310220027456e-05, - "loss": 0.00010301935981260613, + "loss": 0.004417422227561474, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00443, "step": 345, "tokens/total": 10441248, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 157707 }, { "epoch": 1.3515625, - "grad_norm": 0.0036287850234657526, + "grad_norm": 0.00032958327210508287, "learning_rate": 3.3683214232914404e-05, - "loss": 4.620348772732541e-05, + "loss": 7.68474092183169e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00005, + "ppl": 1.00001, "step": 346, "tokens/total": 10471712, - "tokens/train_per_sec_per_gpu": 34.96, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 158180 }, { "epoch": 1.35546875, - "grad_norm": 0.08971801400184631, + "grad_norm": 0.0021204655058681965, "learning_rate": 3.342800532426873e-05, - "loss": 0.0009501657332293689, + "loss": 2.9396429454209283e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00095, + "ppl": 1.00003, "step": 347, "tokens/total": 10502288, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.41, "tokens/trainable": 158646 }, { "epoch": 1.359375, - "grad_norm": 0.00890435092151165, + "grad_norm": 0.00040693042683415115, "learning_rate": 3.317369411437484e-05, - "loss": 7.783617911627516e-05, + "loss": 9.5013465397642e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00001, "step": 348, "tokens/total": 10532304, - "tokens/train_per_sec_per_gpu": 35.59, + "tokens/train_per_sec_per_gpu": 35.66, "tokens/trainable": 159115 }, { "epoch": 1.36328125, - "grad_norm": 0.023319199681282043, + "grad_norm": 0.006379029247909784, "learning_rate": 3.292029118616024e-05, - "loss": 0.00021630006085615605, + "loss": 9.018932178150862e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00022, + "ppl": 1.00009, "step": 349, "tokens/total": 10562608, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 159538 }, { "epoch": 1.3671875, - "grad_norm": 0.047880928963422775, + "grad_norm": 0.005555902142077684, "learning_rate": 3.266780708475511e-05, - "loss": 0.00044884331873618066, + "loss": 5.1456365326885134e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00045, + "ppl": 1.00005, "step": 350, "tokens/total": 10592992, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.22, "tokens/trainable": 160016 }, { "epoch": 1.37109375, - "grad_norm": 0.008666309528052807, + "grad_norm": 0.009832990355789661, "learning_rate": 3.241625231705354e-05, - "loss": 5.017036892240867e-05, + "loss": 9.037736163008958e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00005, + "ppl": 1.00009, "step": 351, "tokens/total": 10623328, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.57, "tokens/trainable": 160475 }, { "epoch": 1.375, - "grad_norm": 0.06452610343694687, + "grad_norm": 0.0002588493807706982, "learning_rate": 3.216563735127618e-05, - "loss": 0.0007272367365658283, + "loss": 7.509744136768859e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00073, + "ppl": 1.00001, "step": 352, "tokens/total": 10653632, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 160952 }, { "epoch": 1.37890625, - "grad_norm": 0.370597779750824, + "grad_norm": 0.03195308893918991, "learning_rate": 3.191597261653475e-05, - "loss": 0.007550997193902731, + "loss": 0.0002666166110429913, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00758, + "ppl": 1.00027, "step": 353, "tokens/total": 10684176, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 161420 }, { "epoch": 1.3828125, - "grad_norm": 0.0031376827973872423, + "grad_norm": 0.07012991607189178, "learning_rate": 3.166726850239794e-05, - "loss": 2.3453332687495276e-05, + "loss": 0.000741704716347158, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00074, "step": 354, "tokens/total": 10714352, - "tokens/train_per_sec_per_gpu": 34.02, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 161868 }, { "epoch": 1.38671875, - "grad_norm": 0.0021399864926934242, + "grad_norm": 0.0005822654929943383, "learning_rate": 3.141953535845912e-05, - "loss": 2.5832894607447088e-05, + "loss": 1.0378402294008993e-05, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00001, "step": 355, "tokens/total": 10744464, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 162318 }, { "epoch": 1.390625, - "grad_norm": 0.0028148347046226263, + "grad_norm": 0.012435230426490307, "learning_rate": 3.11727834939056e-05, - "loss": 3.7286932638380677e-05, + "loss": 7.89838086348027e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00008, "step": 356, "tokens/total": 10774976, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.54, "tokens/trainable": 162789 }, { "epoch": 1.39453125, - "grad_norm": 0.1642119586467743, + "grad_norm": 0.0045598647557199, "learning_rate": 3.092702317708967e-05, - "loss": 0.0027845175936818123, + "loss": 2.48450869548833e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00279, + "ppl": 1.00002, "step": 357, "tokens/total": 10805600, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 163254 }, { "epoch": 1.3984375, - "grad_norm": 0.066535085439682, + "grad_norm": 0.3044262230396271, "learning_rate": 3.0682264635101276e-05, - "loss": 0.0002488417667336762, + "loss": 0.002298796083778143, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00025, + "ppl": 1.0023, "step": 358, "tokens/total": 10835920, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.62, "tokens/trainable": 163715 }, { "epoch": 1.40234375, - "grad_norm": 0.006617655046284199, + "grad_norm": 0.002458421979099512, "learning_rate": 3.0438518053342407e-05, - "loss": 7.841112528694794e-05, + "loss": 1.9634167983895168e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 359, "tokens/total": 10866048, - "tokens/train_per_sec_per_gpu": 34.4, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 164197 }, { "epoch": 1.40625, - "grad_norm": 0.010409035719931126, + "grad_norm": 0.0024773837067186832, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010489403939573094, + "loss": 2.744927041931078e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00003, "step": 360, "tokens/total": 10896288, - "tokens/train_per_sec_per_gpu": 31.6, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 164661 }, { "epoch": 1.41015625, - "grad_norm": 0.002426267135888338, + "grad_norm": 0.00026717092259787023, "learning_rate": 2.9954101301140146e-05, - "loss": 4.0343060391023755e-05, + "loss": 6.422977094189264e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00001, "step": 361, "tokens/total": 10926816, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 165111 }, { "epoch": 1.4140625, - "grad_norm": 0.015666797757148743, + "grad_norm": 0.0008353493758477271, "learning_rate": 2.9713451289255123e-05, - "loss": 0.00014991794887464494, + "loss": 1.3549893083109055e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00015, + "ppl": 1.00001, "step": 362, "tokens/total": 10954928, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 165552 }, { "epoch": 1.41796875, - "grad_norm": 0.2695651650428772, + "grad_norm": 0.006071125157177448, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0014983330620452762, + "loss": 6.428411870729178e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.0015, + "ppl": 1.00006, "step": 363, "tokens/total": 10985328, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 166026 }, { "epoch": 1.421875, - "grad_norm": 0.03586212173104286, + "grad_norm": 0.25424960255622864, "learning_rate": 2.9235318065647e-05, - "loss": 0.00030509717180393636, + "loss": 0.004243595991283655, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00031, + "ppl": 1.00425, "step": 364, "tokens/total": 11015664, - "tokens/train_per_sec_per_gpu": 37.86, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 166486 }, { "epoch": 1.42578125, - "grad_norm": 0.0019308789633214474, + "grad_norm": 0.0005575277027674019, "learning_rate": 2.8997854750998964e-05, - "loss": 2.4129443772835657e-05, + "loss": 8.403902938880492e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00001, "step": 365, "tokens/total": 11046256, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 166959 }, { "epoch": 1.4296875, - "grad_norm": 0.005940837785601616, + "grad_norm": 0.0014335239538922906, "learning_rate": 2.8761473491751258e-05, - "loss": 2.8238933737156913e-05, + "loss": 1.4738036043127067e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.68, "memory/max_allocated (GiB)": 33.68, - "ppl": 1.00003, + "ppl": 1.00001, "step": 366, "tokens/total": 11076288, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 167394 }, { "epoch": 1.43359375, - "grad_norm": 0.002125627128407359, + "grad_norm": 0.0010152696631848812, "learning_rate": 2.8526184124692883e-05, - "loss": 1.602789416210726e-05, + "loss": 1.3278609912958927e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00001, "step": 367, "tokens/total": 11106416, - "tokens/train_per_sec_per_gpu": 28.5, + "tokens/train_per_sec_per_gpu": 28.58, "tokens/trainable": 167832 }, { "epoch": 1.4375, - "grad_norm": 0.2510211765766144, + "grad_norm": 0.11941836029291153, "learning_rate": 2.829199644117484e-05, - "loss": 0.00010395953722763807, + "loss": 0.0006476733833551407, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00065, "step": 368, "tokens/total": 11136848, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 31.02, "tokens/trainable": 168242 }, { "epoch": 1.44140625, - "grad_norm": 0.001904280623421073, + "grad_norm": 0.006877629552036524, "learning_rate": 2.8058920186702553e-05, - "loss": 2.6418363631819375e-05, + "loss": 7.449048280250281e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00007, "step": 369, "tokens/total": 11167376, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 168715 }, { "epoch": 1.4453125, - "grad_norm": 0.0028152521699666977, + "grad_norm": 0.0007151139434427023, "learning_rate": 2.782696506053033e-05, - "loss": 2.9974533390486613e-05, + "loss": 1.1437590728746727e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00001, "step": 370, "tokens/total": 11197776, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.86, "tokens/trainable": 169147 }, { "epoch": 1.44921875, - "grad_norm": 0.0010822078911587596, + "grad_norm": 0.009094453416764736, "learning_rate": 2.7596140715257824e-05, - "loss": 1.34217716549756e-05, + "loss": 5.9242345741949975e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00006, "step": 371, "tokens/total": 11227840, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 169628 }, { "epoch": 1.453125, - "grad_norm": 0.005367911420762539, + "grad_norm": 0.000247267191298306, "learning_rate": 2.7366456756428184e-05, - "loss": 6.65646803099662e-05, + "loss": 7.548428584414069e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00007, + "ppl": 1.00001, "step": 372, "tokens/total": 11258176, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 170085 }, { "epoch": 1.45703125, - "grad_norm": 0.047570567578077316, + "grad_norm": 0.0003029497747775167, "learning_rate": 2.7137922742128486e-05, - "loss": 0.0003471036907285452, + "loss": 5.4013939916330855e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00035, + "ppl": 1.00001, "step": 373, "tokens/total": 11288336, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 170584 }, { "epoch": 1.4609375, - "grad_norm": 0.040886107832193375, + "grad_norm": 0.001942179980687797, "learning_rate": 2.691054818259188e-05, - "loss": 0.0002880148240365088, + "loss": 2.380511250521522e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00029, + "ppl": 1.00002, "step": 374, "tokens/total": 11318848, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 171058 }, { "epoch": 1.46484375, - "grad_norm": 0.0031216361094266176, + "grad_norm": 0.0019308892078697681, "learning_rate": 2.6684342539801933e-05, - "loss": 2.690855944820214e-05, + "loss": 1.5233906196954194e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00002, "step": 375, "tokens/total": 11349168, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 171518 }, { "epoch": 1.46875, - "grad_norm": 0.012176645919680595, + "grad_norm": 0.6044301986694336, "learning_rate": 2.645931522709877e-05, - "loss": 8.402287494391203e-05, + "loss": 0.006350134499371052, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00008, + "ppl": 1.00637, "step": 376, "tokens/total": 11379328, - "tokens/train_per_sec_per_gpu": 40.48, + "tokens/train_per_sec_per_gpu": 40.62, "tokens/trainable": 172007 }, { "epoch": 1.47265625, - "grad_norm": 0.24136756360530853, + "grad_norm": 0.25446587800979614, "learning_rate": 2.6235475608787365e-05, - "loss": 0.0013303000014275312, + "loss": 0.0018724403344094753, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00133, + "ppl": 1.00187, "step": 377, "tokens/total": 11409568, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 172468 }, { "epoch": 1.4765625, - "grad_norm": 0.021714258939027786, + "grad_norm": 0.0019207323202863336, "learning_rate": 2.6012832999747916e-05, - "loss": 0.00020160498388577253, + "loss": 3.049923907383345e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0002, + "ppl": 1.00003, "step": 378, "tokens/total": 11439968, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 172923 }, { "epoch": 1.48046875, - "grad_norm": 0.35412073135375977, + "grad_norm": 0.33491548895835876, "learning_rate": 2.579139666504821e-05, - "loss": 0.015761105343699455, + "loss": 0.02673855796456337, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01589, + "ppl": 1.0271, "step": 379, "tokens/total": 11470496, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 173370 }, { "epoch": 1.484375, - "grad_norm": 0.005766173824667931, + "grad_norm": 0.006177723873406649, "learning_rate": 2.557117581955798e-05, - "loss": 2.5790239305933937e-05, + "loss": 5.195035191718489e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00005, "step": 380, "tokens/total": 11500720, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 173837 }, { "epoch": 1.48828125, - "grad_norm": 0.005898744333535433, + "grad_norm": 0.06973031163215637, "learning_rate": 2.5352179627565532e-05, - "loss": 5.821501690661535e-05, + "loss": 0.0006310560274869204, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00006, + "ppl": 1.00063, "step": 381, "tokens/total": 11531280, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 174294 }, { "epoch": 1.4921875, - "grad_norm": 0.005451703444123268, + "grad_norm": 0.0039021887350827456, "learning_rate": 2.5134417202396277e-05, - "loss": 4.0181505028158426e-05, + "loss": 4.849781544180587e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00005, "step": 382, "tokens/total": 11561264, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.84, "tokens/trainable": 174701 }, { "epoch": 1.49609375, - "grad_norm": 0.0038302047178149223, + "grad_norm": 0.0007975143962539732, "learning_rate": 2.491789760603361e-05, - "loss": 3.403786467970349e-05, + "loss": 2.3489263185183518e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00002, "step": 383, "tokens/total": 11591616, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 175131 }, { "epoch": 1.5, - "grad_norm": 0.004227485507726669, + "grad_norm": 0.012541128322482109, "learning_rate": 2.4702629848741764e-05, - "loss": 3.562243364285678e-05, + "loss": 0.00011495217040646821, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00011, "step": 384, "tokens/total": 11622000, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 175586 }, { "epoch": 1.50390625, - "grad_norm": 0.013361346907913685, + "grad_norm": 0.004752015229314566, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0001464220113120973, + "loss": 6.502695032395422e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00007, "step": 385, "tokens/total": 11652352, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176026 }, { "epoch": 1.5078125, - "grad_norm": 0.008831475861370564, + "grad_norm": 0.014192809350788593, "learning_rate": 2.427588563158384e-05, - "loss": 8.2662510976661e-05, + "loss": 8.075163350440562e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00008, "step": 386, "tokens/total": 11682736, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.91, "tokens/trainable": 176512 }, { "epoch": 1.51171875, - "grad_norm": 0.009311008267104626, + "grad_norm": 0.007288333959877491, "learning_rate": 2.406442693028651e-05, - "loss": 0.0001226613821927458, + "loss": 8.845872798701748e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00009, "step": 387, "tokens/total": 11713136, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.45, "tokens/trainable": 176943 }, { "epoch": 1.515625, - "grad_norm": 0.0017816838808357716, + "grad_norm": 0.10162956267595291, "learning_rate": 2.3854255584458547e-05, - "loss": 2.3221660740091465e-05, + "loss": 0.0007253064541146159, "memory/device_reserved (GiB)": 35.23, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00073, "step": 388, "tokens/total": 11743808, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 177370 }, { "epoch": 1.51953125, - "grad_norm": 0.023602057248353958, + "grad_norm": 0.005729300435632467, "learning_rate": 2.3645380340187508e-05, - "loss": 0.00012638044427148998, + "loss": 8.652975520817563e-05, "memory/device_reserved (GiB)": 35.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00013, + "ppl": 1.00009, "step": 389, "tokens/total": 11774144, - "tokens/train_per_sec_per_gpu": 35.14, + "tokens/train_per_sec_per_gpu": 35.2, "tokens/trainable": 177851 }, { "epoch": 1.5234375, - "grad_norm": 0.04383797571063042, + "grad_norm": 0.0715414360165596, "learning_rate": 2.3437809889624914e-05, - "loss": 0.0004640861588995904, + "loss": 0.0007950748549774289, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00046, + "ppl": 1.0008, "step": 390, "tokens/total": 11804272, - "tokens/train_per_sec_per_gpu": 34.68, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 178310 }, { "epoch": 1.52734375, - "grad_norm": 0.061932601034641266, + "grad_norm": 0.009775097481906414, "learning_rate": 2.3231552870624487e-05, - "loss": 0.00033243370126001537, + "loss": 0.00010615254723234102, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00033, + "ppl": 1.00011, "step": 391, "tokens/total": 11832432, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 178736 }, { "epoch": 1.53125, - "grad_norm": 0.04983547702431679, + "grad_norm": 0.0015552763361483812, "learning_rate": 2.3026617866382657e-05, - "loss": 0.000599355495069176, + "loss": 2.954876617877744e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0006, + "ppl": 1.00003, "step": 392, "tokens/total": 11862960, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 179233 }, { "epoch": 1.53515625, - "grad_norm": 0.012036106549203396, + "grad_norm": 0.026106838136911392, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0001237639953615144, + "loss": 0.00021109850786160678, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00021, "step": 393, "tokens/total": 11893232, - "tokens/train_per_sec_per_gpu": 38.49, + "tokens/train_per_sec_per_gpu": 38.57, "tokens/trainable": 179730 }, { "epoch": 1.5390625, - "grad_norm": 0.008992817252874374, + "grad_norm": 0.020347680896520615, "learning_rate": 2.2620747959533722e-05, - "loss": 0.00010385089262854308, + "loss": 0.0002601295418571681, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0001, + "ppl": 1.00026, "step": 394, "tokens/total": 11923664, - "tokens/train_per_sec_per_gpu": 37.81, + "tokens/train_per_sec_per_gpu": 37.87, "tokens/trainable": 180227 }, { "epoch": 1.54296875, - "grad_norm": 0.24631057679653168, + "grad_norm": 0.005419979803264141, "learning_rate": 2.2419829946830123e-05, - "loss": 0.0031685903668403625, + "loss": 4.929217175231315e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00317, + "ppl": 1.00005, "step": 395, "tokens/total": 11954032, - "tokens/train_per_sec_per_gpu": 32.85, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 180687 }, { "epoch": 1.546875, - "grad_norm": 0.06871633976697922, + "grad_norm": 0.0031002764590084553, "learning_rate": 2.2220267727989325e-05, - "loss": 0.0005168755305930972, + "loss": 6.144218787085265e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00052, + "ppl": 1.00006, "step": 396, "tokens/total": 11984512, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 181141 }, { "epoch": 1.55078125, - "grad_norm": 0.011674679815769196, + "grad_norm": 0.006748533807694912, "learning_rate": 2.202206960760984e-05, - "loss": 0.00017496946384198964, + "loss": 9.171784040518105e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00017, + "ppl": 1.00009, "step": 397, "tokens/total": 12014880, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 36.02, "tokens/trainable": 181648 }, { "epoch": 1.5546875, - "grad_norm": 0.14610664546489716, + "grad_norm": 0.08927815407514572, "learning_rate": 2.182524383352446e-05, - "loss": 0.0014660547021776438, + "loss": 0.001000746968202293, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00147, + "ppl": 1.001, "step": 398, "tokens/total": 12044928, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 182109 }, { "epoch": 1.55859375, - "grad_norm": 0.016359565779566765, + "grad_norm": 0.004651801194995642, "learning_rate": 2.1629798596457056e-05, - "loss": 7.928608101792634e-05, + "loss": 5.3439554903889075e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00008, + "ppl": 1.00005, "step": 399, "tokens/total": 12075344, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.58, "tokens/trainable": 182559 }, { "epoch": 1.5625, - "grad_norm": 0.0010484450031071901, + "grad_norm": 0.0017514342907816172, "learning_rate": 2.1435742029681725e-05, - "loss": 1.526270352769643e-05, + "loss": 4.570486271404661e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00005, "step": 400, "tokens/total": 12105616, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 182985 }, { "epoch": 1.56640625, - "grad_norm": 0.0005900752730667591, + "grad_norm": 0.01574699766933918, "learning_rate": 2.124308220868431e-05, - "loss": 1.2166316082584672e-05, + "loss": 0.0001242965809069574, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00012, "step": 401, "tokens/total": 12136080, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 183440 }, { "epoch": 1.5703125, - "grad_norm": 0.013194791041314602, + "grad_norm": 0.007152364123612642, "learning_rate": 2.105182715082638e-05, - "loss": 0.0001970212033484131, + "loss": 0.0001222842838615179, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0002, + "ppl": 1.00012, "step": 402, "tokens/total": 12166240, - "tokens/train_per_sec_per_gpu": 34.52, + "tokens/train_per_sec_per_gpu": 34.51, "tokens/trainable": 183917 }, { "epoch": 1.57421875, - "grad_norm": 0.02566305734217167, + "grad_norm": 0.0015342400874942541, "learning_rate": 2.0861984815011552e-05, - "loss": 0.00022389904188457876, + "loss": 3.621872019721195e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00022, + "ppl": 1.00004, "step": 403, "tokens/total": 12196544, - "tokens/train_per_sec_per_gpu": 30.39, + "tokens/train_per_sec_per_gpu": 30.36, "tokens/trainable": 184348 }, { "epoch": 1.578125, - "grad_norm": 0.008275284431874752, + "grad_norm": 0.0035214691888540983, "learning_rate": 2.0673563101354323e-05, - "loss": 8.35009923321195e-05, + "loss": 6.367819150909781e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00006, "step": 404, "tokens/total": 12226784, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 184786 }, { "epoch": 1.58203125, - "grad_norm": 0.038177311420440674, + "grad_norm": 0.0007211520569398999, "learning_rate": 2.0486569850851317e-05, - "loss": 0.00018527230713516474, + "loss": 2.0325338482507505e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00019, + "ppl": 1.00002, "step": 405, "tokens/total": 12257264, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 185249 }, { "epoch": 1.5859375, - "grad_norm": 0.007672510575503111, + "grad_norm": 0.0014804014936089516, "learning_rate": 2.0301012845054956e-05, - "loss": 0.00011439670925028622, + "loss": 3.379736153874546e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00003, "step": 406, "tokens/total": 12287584, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 185680 }, { "epoch": 1.58984375, - "grad_norm": 0.003159885760396719, + "grad_norm": 0.004397980403155088, "learning_rate": 2.011689980574966e-05, - "loss": 4.649449692806229e-05, + "loss": 5.1796458137687296e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00005, "step": 407, "tokens/total": 12317984, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 186100 }, { "epoch": 1.59375, - "grad_norm": 0.32744285464286804, + "grad_norm": 0.0026473007164895535, "learning_rate": 1.993423839463052e-05, - "loss": 0.002739987801760435, + "loss": 3.441090666456148e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00274, + "ppl": 1.00003, "step": 408, "tokens/total": 12348144, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.84, "tokens/trainable": 186565 }, { "epoch": 1.59765625, - "grad_norm": 0.0006675662589259446, + "grad_norm": 0.0289909727871418, "learning_rate": 1.975303621298445e-05, - "loss": 1.2970660463906825e-05, + "loss": 0.00021602815832011402, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00022, "step": 409, "tokens/total": 12378544, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 187017 }, { "epoch": 1.6015625, - "grad_norm": 0.003976705949753523, + "grad_norm": 0.007092812564224005, "learning_rate": 1.957330080137385e-05, - "loss": 3.857718547806144e-05, + "loss": 9.646185935707763e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.0001, "step": 410, "tokens/total": 12408784, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 187468 }, { "epoch": 1.60546875, - "grad_norm": 0.0024577646981924772, + "grad_norm": 0.02710823155939579, "learning_rate": 1.9395039639322864e-05, - "loss": 2.431379834888503e-05, + "loss": 0.0003458422143012285, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00035, "step": 411, "tokens/total": 12438832, - "tokens/train_per_sec_per_gpu": 37.61, + "tokens/train_per_sec_per_gpu": 37.57, "tokens/trainable": 187961 }, { "epoch": 1.609375, - "grad_norm": 0.003754909848794341, + "grad_norm": 0.29485711455345154, "learning_rate": 1.9218260145006073e-05, - "loss": 4.119630830246024e-05, + "loss": 0.0032923028338700533, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.0033, "step": 412, "tokens/total": 12469296, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 188447 }, { "epoch": 1.61328125, - "grad_norm": 0.3583323657512665, + "grad_norm": 0.22881586849689484, "learning_rate": 1.904296967493982e-05, - "loss": 0.004735157359391451, + "loss": 0.0035809341352432966, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00475, + "ppl": 1.00359, "step": 413, "tokens/total": 12499392, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 188903 }, { "epoch": 1.6171875, - "grad_norm": 0.049485232681035995, + "grad_norm": 0.0026347371749579906, "learning_rate": 1.8869175523676064e-05, - "loss": 0.00019404500199016184, + "loss": 6.0475373174995184e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.00006, "step": 414, "tokens/total": 12529952, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 189398 }, { "epoch": 1.62109375, - "grad_norm": 0.0030447980388998985, + "grad_norm": 0.0017223359318450093, "learning_rate": 1.869688492349885e-05, - "loss": 2.0038012735312805e-05, + "loss": 4.137849100516178e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00004, "step": 415, "tokens/total": 12560240, "tokens/train_per_sec_per_gpu": 34.16, @@ -5821,16 +5821,16 @@ }, { "epoch": 1.625, - "grad_norm": 0.25415608286857605, + "grad_norm": 0.011837545782327652, "learning_rate": 1.85261050441233e-05, - "loss": 0.0016201161779463291, + "loss": 0.00011106643069069833, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00162, + "ppl": 1.00011, "step": 416, "tokens/total": 12590736, - "tokens/train_per_sec_per_gpu": 32.64, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 190306 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_model.safetensors index 902aa5c1e90c93f7b38732ae8340a6a9d842849f..9d34729a9d5937ebe54d58f659473585e20e1fa8 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:f25f15c1bc008ea9820a869ec237898029c46e71dbb17a16b7c540d0ab55950f +oid sha256:3bacb4d3f901db3a71785ec9bbf0c989eb190275b59257a46ebe7cda04a4211b size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/optimizer.pt index 5001b0d8c909aa2b5d5f2413fa091164318cd167..497d794ad140949d944c8eb319b826137c1d62eb 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:5d6cd80b908abae800035b7b84556d6b95bdc1afef25c3cd05b9d5a4d951f6c7 +oid sha256:33cfd5b5b7300a5e59a22e211b622aa8250b83b1e42d9aa245e82b799848bf3e size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/trainer_state.json index f42d5a4f4e04184412fda09cfbf1d28fd1afa3d6..941befa302375529037b0bba27f07f2004fe3690 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-448/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,461 +4057,461 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 }, { "epoch": 1.25390625, - "grad_norm": 0.04359544813632965, + "grad_norm": 0.0010733718518167734, "learning_rate": 4.0323513089607876e-05, - "loss": 0.0005239051533862948, + "loss": 1.948333010659553e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00052, + "ppl": 1.00002, "step": 321, "tokens/total": 9712656, - "tokens/train_per_sec_per_gpu": 31.85, + "tokens/train_per_sec_per_gpu": 31.72, "tokens/trainable": 146781 }, { "epoch": 1.2578125, - "grad_norm": 0.02377651259303093, + "grad_norm": 0.0843457579612732, "learning_rate": 4.004940255778431e-05, - "loss": 0.0001890905696200207, + "loss": 0.0008847219287417829, "memory/device_reserved (GiB)": 34.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00019, + "ppl": 1.00089, "step": 322, "tokens/total": 9743088, "tokens/train_per_sec_per_gpu": 35.55, @@ -4519,69 +4519,69 @@ }, { "epoch": 1.26171875, - "grad_norm": 0.01256605889648199, + "grad_norm": 0.09092428535223007, "learning_rate": 3.977591418134619e-05, - "loss": 8.730488480068743e-05, + "loss": 0.00040022452594712377, "memory/device_reserved (GiB)": 35.17, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00009, + "ppl": 1.0004, "step": 323, "tokens/total": 9773808, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 147673 }, { "epoch": 1.265625, - "grad_norm": 0.21066401898860931, + "grad_norm": 0.3859696090221405, "learning_rate": 3.95030593412612e-05, - "loss": 0.0028422519098967314, + "loss": 0.004064415581524372, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00285, + "ppl": 1.00407, "step": 324, "tokens/total": 9804016, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 148103 }, { "epoch": 1.26953125, - "grad_norm": 0.025614596903324127, + "grad_norm": 0.000418124720454216, "learning_rate": 3.923084939213296e-05, - "loss": 0.00016133410099428147, + "loss": 9.266825145459734e-06, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00016, + "ppl": 1.00001, "step": 325, "tokens/total": 9834592, - "tokens/train_per_sec_per_gpu": 31.73, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 148535 }, { "epoch": 1.2734375, - "grad_norm": 0.033190563321113586, + "grad_norm": 0.030438628047704697, "learning_rate": 3.895929566172861e-05, - "loss": 0.00033758440986275673, + "loss": 0.00029550789622589946, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00034, + "ppl": 1.0003, "step": 326, "tokens/total": 9864848, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 148999 }, { "epoch": 1.27734375, - "grad_norm": 0.07407072931528091, + "grad_norm": 0.0003460803418420255, "learning_rate": 3.868840945050728e-05, - "loss": 0.0007672893116250634, + "loss": 9.424240488442592e-06, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00077, + "ppl": 1.00001, "step": 327, "tokens/total": 9895168, "tokens/train_per_sec_per_gpu": 31.64, @@ -4589,125 +4589,125 @@ }, { "epoch": 1.28125, - "grad_norm": 0.05904461070895195, + "grad_norm": 0.32631534337997437, "learning_rate": 3.841820203114995e-05, - "loss": 0.000713472138158977, + "loss": 0.004381683189421892, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00071, + "ppl": 1.00439, "step": 328, "tokens/total": 9925696, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 149886 }, { "epoch": 1.28515625, - "grad_norm": 0.007630123756825924, + "grad_norm": 0.06805918365716934, "learning_rate": 3.814868464809027e-05, - "loss": 7.993751933099702e-05, + "loss": 0.0003639076603576541, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00036, "step": 329, "tokens/total": 9955648, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 31.01, "tokens/trainable": 150288 }, { "epoch": 1.2890625, - "grad_norm": 0.024742672219872475, + "grad_norm": 0.004817479755729437, "learning_rate": 3.787986851704667e-05, - "loss": 0.00019552679441403598, + "loss": 3.246869164286181e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0002, + "ppl": 1.00003, "step": 330, "tokens/total": 9985856, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 150733 }, { "epoch": 1.29296875, - "grad_norm": 0.006353198084980249, + "grad_norm": 0.06923647969961166, "learning_rate": 3.7611764824555654e-05, - "loss": 0.00010314649261999875, + "loss": 0.00031070224940776825, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00031, "step": 331, "tokens/total": 10016208, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 151207 }, { "epoch": 1.296875, - "grad_norm": 0.16203969717025757, + "grad_norm": 0.14731979370117188, "learning_rate": 3.734438472750619e-05, - "loss": 0.0014735229779034853, + "loss": 0.0015139597235247493, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00147, + "ppl": 1.00152, "step": 332, "tokens/total": 10046512, - "tokens/train_per_sec_per_gpu": 37.5, + "tokens/train_per_sec_per_gpu": 37.61, "tokens/trainable": 151694 }, { "epoch": 1.30078125, - "grad_norm": 0.041821569204330444, + "grad_norm": 0.007325666956603527, "learning_rate": 3.707773935267552e-05, - "loss": 0.0004190094769001007, + "loss": 7.809747330611572e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00042, + "ppl": 1.00008, "step": 333, "tokens/total": 10076944, - "tokens/train_per_sec_per_gpu": 38.27, + "tokens/train_per_sec_per_gpu": 38.37, "tokens/trainable": 152188 }, { "epoch": 1.3046875, - "grad_norm": 0.0011248595546931028, + "grad_norm": 0.00047597952652722597, "learning_rate": 3.68118397962661e-05, - "loss": 3.350014958414249e-05, + "loss": 1.2739032172248699e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00001, "step": 334, "tokens/total": 10107296, - "tokens/train_per_sec_per_gpu": 30.6, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 152596 }, { "epoch": 1.30859375, - "grad_norm": 0.003707638941705227, + "grad_norm": 0.0700320228934288, "learning_rate": 3.654669712344384e-05, - "loss": 4.684936357080005e-05, + "loss": 0.00047467637341469526, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00047, "step": 335, "tokens/total": 10137568, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 153052 }, { "epoch": 1.3125, - "grad_norm": 0.0017528374446555972, + "grad_norm": 0.06498395651578903, "learning_rate": 3.628232236787763e-05, - "loss": 2.3632102966075763e-05, + "loss": 0.00041414948645979166, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00002, + "ppl": 1.00041, "step": 336, "tokens/total": 10167952, "tokens/train_per_sec_per_gpu": 30.19, @@ -4715,1105 +4715,1105 @@ }, { "epoch": 1.31640625, - "grad_norm": 0.0626155436038971, + "grad_norm": 0.009991639293730259, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0006341143744066358, + "loss": 7.060338975861669e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00063, + "ppl": 1.00007, "step": 337, "tokens/total": 10198512, - "tokens/train_per_sec_per_gpu": 40.28, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 153983 }, { "epoch": 1.3203125, - "grad_norm": 0.0166204534471035, + "grad_norm": 0.03267490491271019, "learning_rate": 3.575592058295017e-05, - "loss": 0.00015405623707920313, + "loss": 0.0002045792352873832, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00015, + "ppl": 1.0002, "step": 338, "tokens/total": 10228752, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.72, "tokens/trainable": 154464 }, { "epoch": 1.32421875, - "grad_norm": 0.0004508346610236913, + "grad_norm": 0.00039529221248812973, "learning_rate": 3.549391545931585e-05, - "loss": 8.604627510067075e-06, + "loss": 8.338471161550842e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 339, "tokens/total": 10259104, - "tokens/train_per_sec_per_gpu": 35.73, + "tokens/train_per_sec_per_gpu": 35.87, "tokens/trainable": 154924 }, { "epoch": 1.328125, - "grad_norm": 0.0024134982377290726, + "grad_norm": 0.0010571131715551019, "learning_rate": 3.5232722063479914e-05, - "loss": 4.25071848439984e-05, + "loss": 1.6815669368952513e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00004, + "ppl": 1.00002, "step": 340, "tokens/total": 10289520, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 155373 }, { "epoch": 1.33203125, - "grad_norm": 0.047796547412872314, + "grad_norm": 0.0008337291656062007, "learning_rate": 3.49723512647657e-05, - "loss": 0.0004414983559399843, + "loss": 1.703310408629477e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00044, + "ppl": 1.00002, "step": 341, "tokens/total": 10320016, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 155873 }, { "epoch": 1.3359375, - "grad_norm": 0.0013580132508650422, + "grad_norm": 0.0007872325950302184, "learning_rate": 3.471281389826491e-05, - "loss": 3.1043862691149116e-05, + "loss": 1.626565062906593e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00002, "step": 342, "tokens/total": 10350368, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.42, "tokens/trainable": 156278 }, { "epoch": 1.33984375, - "grad_norm": 0.013898961246013641, + "grad_norm": 0.21220935881137848, "learning_rate": 3.4454120764386764e-05, - "loss": 9.816634701564908e-05, + "loss": 0.0009314992348663509, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00093, "step": 343, "tokens/total": 10380624, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.4, "tokens/trainable": 156733 }, { "epoch": 1.34375, - "grad_norm": 0.0031031679827719927, + "grad_norm": 0.017469989135861397, "learning_rate": 3.4196282628408526e-05, - "loss": 4.329531657276675e-05, + "loss": 7.496406033169478e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00004, + "ppl": 1.00007, "step": 344, "tokens/total": 10411024, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 157203 }, { "epoch": 1.34765625, - "grad_norm": 0.009028271771967411, + "grad_norm": 0.2605672776699066, "learning_rate": 3.3939310220027456e-05, - "loss": 0.00010301935981260613, + "loss": 0.004417422227561474, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00443, "step": 345, "tokens/total": 10441248, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 157707 }, { "epoch": 1.3515625, - "grad_norm": 0.0036287850234657526, + "grad_norm": 0.00032958327210508287, "learning_rate": 3.3683214232914404e-05, - "loss": 4.620348772732541e-05, + "loss": 7.68474092183169e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00005, + "ppl": 1.00001, "step": 346, "tokens/total": 10471712, - "tokens/train_per_sec_per_gpu": 34.96, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 158180 }, { "epoch": 1.35546875, - "grad_norm": 0.08971801400184631, + "grad_norm": 0.0021204655058681965, "learning_rate": 3.342800532426873e-05, - "loss": 0.0009501657332293689, + "loss": 2.9396429454209283e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00095, + "ppl": 1.00003, "step": 347, "tokens/total": 10502288, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.41, "tokens/trainable": 158646 }, { "epoch": 1.359375, - "grad_norm": 0.00890435092151165, + "grad_norm": 0.00040693042683415115, "learning_rate": 3.317369411437484e-05, - "loss": 7.783617911627516e-05, + "loss": 9.5013465397642e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00001, "step": 348, "tokens/total": 10532304, - "tokens/train_per_sec_per_gpu": 35.59, + "tokens/train_per_sec_per_gpu": 35.66, "tokens/trainable": 159115 }, { "epoch": 1.36328125, - "grad_norm": 0.023319199681282043, + "grad_norm": 0.006379029247909784, "learning_rate": 3.292029118616024e-05, - "loss": 0.00021630006085615605, + "loss": 9.018932178150862e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00022, + "ppl": 1.00009, "step": 349, "tokens/total": 10562608, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 159538 }, { "epoch": 1.3671875, - "grad_norm": 0.047880928963422775, + "grad_norm": 0.005555902142077684, "learning_rate": 3.266780708475511e-05, - "loss": 0.00044884331873618066, + "loss": 5.1456365326885134e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00045, + "ppl": 1.00005, "step": 350, "tokens/total": 10592992, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.22, "tokens/trainable": 160016 }, { "epoch": 1.37109375, - "grad_norm": 0.008666309528052807, + "grad_norm": 0.009832990355789661, "learning_rate": 3.241625231705354e-05, - "loss": 5.017036892240867e-05, + "loss": 9.037736163008958e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00005, + "ppl": 1.00009, "step": 351, "tokens/total": 10623328, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.57, "tokens/trainable": 160475 }, { "epoch": 1.375, - "grad_norm": 0.06452610343694687, + "grad_norm": 0.0002588493807706982, "learning_rate": 3.216563735127618e-05, - "loss": 0.0007272367365658283, + "loss": 7.509744136768859e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00073, + "ppl": 1.00001, "step": 352, "tokens/total": 10653632, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 160952 }, { "epoch": 1.37890625, - "grad_norm": 0.370597779750824, + "grad_norm": 0.03195308893918991, "learning_rate": 3.191597261653475e-05, - "loss": 0.007550997193902731, + "loss": 0.0002666166110429913, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00758, + "ppl": 1.00027, "step": 353, "tokens/total": 10684176, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 161420 }, { "epoch": 1.3828125, - "grad_norm": 0.0031376827973872423, + "grad_norm": 0.07012991607189178, "learning_rate": 3.166726850239794e-05, - "loss": 2.3453332687495276e-05, + "loss": 0.000741704716347158, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00074, "step": 354, "tokens/total": 10714352, - "tokens/train_per_sec_per_gpu": 34.02, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 161868 }, { "epoch": 1.38671875, - "grad_norm": 0.0021399864926934242, + "grad_norm": 0.0005822654929943383, "learning_rate": 3.141953535845912e-05, - "loss": 2.5832894607447088e-05, + "loss": 1.0378402294008993e-05, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00001, "step": 355, "tokens/total": 10744464, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 162318 }, { "epoch": 1.390625, - "grad_norm": 0.0028148347046226263, + "grad_norm": 0.012435230426490307, "learning_rate": 3.11727834939056e-05, - "loss": 3.7286932638380677e-05, + "loss": 7.89838086348027e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00008, "step": 356, "tokens/total": 10774976, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.54, "tokens/trainable": 162789 }, { "epoch": 1.39453125, - "grad_norm": 0.1642119586467743, + "grad_norm": 0.0045598647557199, "learning_rate": 3.092702317708967e-05, - "loss": 0.0027845175936818123, + "loss": 2.48450869548833e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00279, + "ppl": 1.00002, "step": 357, "tokens/total": 10805600, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 163254 }, { "epoch": 1.3984375, - "grad_norm": 0.066535085439682, + "grad_norm": 0.3044262230396271, "learning_rate": 3.0682264635101276e-05, - "loss": 0.0002488417667336762, + "loss": 0.002298796083778143, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00025, + "ppl": 1.0023, "step": 358, "tokens/total": 10835920, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.62, "tokens/trainable": 163715 }, { "epoch": 1.40234375, - "grad_norm": 0.006617655046284199, + "grad_norm": 0.002458421979099512, "learning_rate": 3.0438518053342407e-05, - "loss": 7.841112528694794e-05, + "loss": 1.9634167983895168e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 359, "tokens/total": 10866048, - "tokens/train_per_sec_per_gpu": 34.4, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 164197 }, { "epoch": 1.40625, - "grad_norm": 0.010409035719931126, + "grad_norm": 0.0024773837067186832, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010489403939573094, + "loss": 2.744927041931078e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00003, "step": 360, "tokens/total": 10896288, - "tokens/train_per_sec_per_gpu": 31.6, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 164661 }, { "epoch": 1.41015625, - "grad_norm": 0.002426267135888338, + "grad_norm": 0.00026717092259787023, "learning_rate": 2.9954101301140146e-05, - "loss": 4.0343060391023755e-05, + "loss": 6.422977094189264e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00001, "step": 361, "tokens/total": 10926816, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 165111 }, { "epoch": 1.4140625, - "grad_norm": 0.015666797757148743, + "grad_norm": 0.0008353493758477271, "learning_rate": 2.9713451289255123e-05, - "loss": 0.00014991794887464494, + "loss": 1.3549893083109055e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00015, + "ppl": 1.00001, "step": 362, "tokens/total": 10954928, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 165552 }, { "epoch": 1.41796875, - "grad_norm": 0.2695651650428772, + "grad_norm": 0.006071125157177448, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0014983330620452762, + "loss": 6.428411870729178e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.0015, + "ppl": 1.00006, "step": 363, "tokens/total": 10985328, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 166026 }, { "epoch": 1.421875, - "grad_norm": 0.03586212173104286, + "grad_norm": 0.25424960255622864, "learning_rate": 2.9235318065647e-05, - "loss": 0.00030509717180393636, + "loss": 0.004243595991283655, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00031, + "ppl": 1.00425, "step": 364, "tokens/total": 11015664, - "tokens/train_per_sec_per_gpu": 37.86, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 166486 }, { "epoch": 1.42578125, - "grad_norm": 0.0019308789633214474, + "grad_norm": 0.0005575277027674019, "learning_rate": 2.8997854750998964e-05, - "loss": 2.4129443772835657e-05, + "loss": 8.403902938880492e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00001, "step": 365, "tokens/total": 11046256, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 166959 }, { "epoch": 1.4296875, - "grad_norm": 0.005940837785601616, + "grad_norm": 0.0014335239538922906, "learning_rate": 2.8761473491751258e-05, - "loss": 2.8238933737156913e-05, + "loss": 1.4738036043127067e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.68, "memory/max_allocated (GiB)": 33.68, - "ppl": 1.00003, + "ppl": 1.00001, "step": 366, "tokens/total": 11076288, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 167394 }, { "epoch": 1.43359375, - "grad_norm": 0.002125627128407359, + "grad_norm": 0.0010152696631848812, "learning_rate": 2.8526184124692883e-05, - "loss": 1.602789416210726e-05, + "loss": 1.3278609912958927e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00001, "step": 367, "tokens/total": 11106416, - "tokens/train_per_sec_per_gpu": 28.5, + "tokens/train_per_sec_per_gpu": 28.58, "tokens/trainable": 167832 }, { "epoch": 1.4375, - "grad_norm": 0.2510211765766144, + "grad_norm": 0.11941836029291153, "learning_rate": 2.829199644117484e-05, - "loss": 0.00010395953722763807, + "loss": 0.0006476733833551407, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00065, "step": 368, "tokens/total": 11136848, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 31.02, "tokens/trainable": 168242 }, { "epoch": 1.44140625, - "grad_norm": 0.001904280623421073, + "grad_norm": 0.006877629552036524, "learning_rate": 2.8058920186702553e-05, - "loss": 2.6418363631819375e-05, + "loss": 7.449048280250281e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00007, "step": 369, "tokens/total": 11167376, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 168715 }, { "epoch": 1.4453125, - "grad_norm": 0.0028152521699666977, + "grad_norm": 0.0007151139434427023, "learning_rate": 2.782696506053033e-05, - "loss": 2.9974533390486613e-05, + "loss": 1.1437590728746727e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00001, "step": 370, "tokens/total": 11197776, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.86, "tokens/trainable": 169147 }, { "epoch": 1.44921875, - "grad_norm": 0.0010822078911587596, + "grad_norm": 0.009094453416764736, "learning_rate": 2.7596140715257824e-05, - "loss": 1.34217716549756e-05, + "loss": 5.9242345741949975e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00006, "step": 371, "tokens/total": 11227840, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 169628 }, { "epoch": 1.453125, - "grad_norm": 0.005367911420762539, + "grad_norm": 0.000247267191298306, "learning_rate": 2.7366456756428184e-05, - "loss": 6.65646803099662e-05, + "loss": 7.548428584414069e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00007, + "ppl": 1.00001, "step": 372, "tokens/total": 11258176, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 170085 }, { "epoch": 1.45703125, - "grad_norm": 0.047570567578077316, + "grad_norm": 0.0003029497747775167, "learning_rate": 2.7137922742128486e-05, - "loss": 0.0003471036907285452, + "loss": 5.4013939916330855e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00035, + "ppl": 1.00001, "step": 373, "tokens/total": 11288336, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 170584 }, { "epoch": 1.4609375, - "grad_norm": 0.040886107832193375, + "grad_norm": 0.001942179980687797, "learning_rate": 2.691054818259188e-05, - "loss": 0.0002880148240365088, + "loss": 2.380511250521522e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00029, + "ppl": 1.00002, "step": 374, "tokens/total": 11318848, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 171058 }, { "epoch": 1.46484375, - "grad_norm": 0.0031216361094266176, + "grad_norm": 0.0019308892078697681, "learning_rate": 2.6684342539801933e-05, - "loss": 2.690855944820214e-05, + "loss": 1.5233906196954194e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00002, "step": 375, "tokens/total": 11349168, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 171518 }, { "epoch": 1.46875, - "grad_norm": 0.012176645919680595, + "grad_norm": 0.6044301986694336, "learning_rate": 2.645931522709877e-05, - "loss": 8.402287494391203e-05, + "loss": 0.006350134499371052, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00008, + "ppl": 1.00637, "step": 376, "tokens/total": 11379328, - "tokens/train_per_sec_per_gpu": 40.48, + "tokens/train_per_sec_per_gpu": 40.62, "tokens/trainable": 172007 }, { "epoch": 1.47265625, - "grad_norm": 0.24136756360530853, + "grad_norm": 0.25446587800979614, "learning_rate": 2.6235475608787365e-05, - "loss": 0.0013303000014275312, + "loss": 0.0018724403344094753, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00133, + "ppl": 1.00187, "step": 377, "tokens/total": 11409568, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 172468 }, { "epoch": 1.4765625, - "grad_norm": 0.021714258939027786, + "grad_norm": 0.0019207323202863336, "learning_rate": 2.6012832999747916e-05, - "loss": 0.00020160498388577253, + "loss": 3.049923907383345e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0002, + "ppl": 1.00003, "step": 378, "tokens/total": 11439968, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 172923 }, { "epoch": 1.48046875, - "grad_norm": 0.35412073135375977, + "grad_norm": 0.33491548895835876, "learning_rate": 2.579139666504821e-05, - "loss": 0.015761105343699455, + "loss": 0.02673855796456337, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01589, + "ppl": 1.0271, "step": 379, "tokens/total": 11470496, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 173370 }, { "epoch": 1.484375, - "grad_norm": 0.005766173824667931, + "grad_norm": 0.006177723873406649, "learning_rate": 2.557117581955798e-05, - "loss": 2.5790239305933937e-05, + "loss": 5.195035191718489e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00005, "step": 380, "tokens/total": 11500720, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 173837 }, { "epoch": 1.48828125, - "grad_norm": 0.005898744333535433, + "grad_norm": 0.06973031163215637, "learning_rate": 2.5352179627565532e-05, - "loss": 5.821501690661535e-05, + "loss": 0.0006310560274869204, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00006, + "ppl": 1.00063, "step": 381, "tokens/total": 11531280, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 174294 }, { "epoch": 1.4921875, - "grad_norm": 0.005451703444123268, + "grad_norm": 0.0039021887350827456, "learning_rate": 2.5134417202396277e-05, - "loss": 4.0181505028158426e-05, + "loss": 4.849781544180587e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00005, "step": 382, "tokens/total": 11561264, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.84, "tokens/trainable": 174701 }, { "epoch": 1.49609375, - "grad_norm": 0.0038302047178149223, + "grad_norm": 0.0007975143962539732, "learning_rate": 2.491789760603361e-05, - "loss": 3.403786467970349e-05, + "loss": 2.3489263185183518e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00002, "step": 383, "tokens/total": 11591616, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 175131 }, { "epoch": 1.5, - "grad_norm": 0.004227485507726669, + "grad_norm": 0.012541128322482109, "learning_rate": 2.4702629848741764e-05, - "loss": 3.562243364285678e-05, + "loss": 0.00011495217040646821, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00011, "step": 384, "tokens/total": 11622000, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 175586 }, { "epoch": 1.50390625, - "grad_norm": 0.013361346907913685, + "grad_norm": 0.004752015229314566, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0001464220113120973, + "loss": 6.502695032395422e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00007, "step": 385, "tokens/total": 11652352, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176026 }, { "epoch": 1.5078125, - "grad_norm": 0.008831475861370564, + "grad_norm": 0.014192809350788593, "learning_rate": 2.427588563158384e-05, - "loss": 8.2662510976661e-05, + "loss": 8.075163350440562e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00008, "step": 386, "tokens/total": 11682736, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.91, "tokens/trainable": 176512 }, { "epoch": 1.51171875, - "grad_norm": 0.009311008267104626, + "grad_norm": 0.007288333959877491, "learning_rate": 2.406442693028651e-05, - "loss": 0.0001226613821927458, + "loss": 8.845872798701748e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00009, "step": 387, "tokens/total": 11713136, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.45, "tokens/trainable": 176943 }, { "epoch": 1.515625, - "grad_norm": 0.0017816838808357716, + "grad_norm": 0.10162956267595291, "learning_rate": 2.3854255584458547e-05, - "loss": 2.3221660740091465e-05, + "loss": 0.0007253064541146159, "memory/device_reserved (GiB)": 35.23, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00073, "step": 388, "tokens/total": 11743808, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 177370 }, { "epoch": 1.51953125, - "grad_norm": 0.023602057248353958, + "grad_norm": 0.005729300435632467, "learning_rate": 2.3645380340187508e-05, - "loss": 0.00012638044427148998, + "loss": 8.652975520817563e-05, "memory/device_reserved (GiB)": 35.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00013, + "ppl": 1.00009, "step": 389, "tokens/total": 11774144, - "tokens/train_per_sec_per_gpu": 35.14, + "tokens/train_per_sec_per_gpu": 35.2, "tokens/trainable": 177851 }, { "epoch": 1.5234375, - "grad_norm": 0.04383797571063042, + "grad_norm": 0.0715414360165596, "learning_rate": 2.3437809889624914e-05, - "loss": 0.0004640861588995904, + "loss": 0.0007950748549774289, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00046, + "ppl": 1.0008, "step": 390, "tokens/total": 11804272, - "tokens/train_per_sec_per_gpu": 34.68, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 178310 }, { "epoch": 1.52734375, - "grad_norm": 0.061932601034641266, + "grad_norm": 0.009775097481906414, "learning_rate": 2.3231552870624487e-05, - "loss": 0.00033243370126001537, + "loss": 0.00010615254723234102, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00033, + "ppl": 1.00011, "step": 391, "tokens/total": 11832432, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 178736 }, { "epoch": 1.53125, - "grad_norm": 0.04983547702431679, + "grad_norm": 0.0015552763361483812, "learning_rate": 2.3026617866382657e-05, - "loss": 0.000599355495069176, + "loss": 2.954876617877744e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0006, + "ppl": 1.00003, "step": 392, "tokens/total": 11862960, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 179233 }, { "epoch": 1.53515625, - "grad_norm": 0.012036106549203396, + "grad_norm": 0.026106838136911392, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0001237639953615144, + "loss": 0.00021109850786160678, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00021, "step": 393, "tokens/total": 11893232, - "tokens/train_per_sec_per_gpu": 38.49, + "tokens/train_per_sec_per_gpu": 38.57, "tokens/trainable": 179730 }, { "epoch": 1.5390625, - "grad_norm": 0.008992817252874374, + "grad_norm": 0.020347680896520615, "learning_rate": 2.2620747959533722e-05, - "loss": 0.00010385089262854308, + "loss": 0.0002601295418571681, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0001, + "ppl": 1.00026, "step": 394, "tokens/total": 11923664, - "tokens/train_per_sec_per_gpu": 37.81, + "tokens/train_per_sec_per_gpu": 37.87, "tokens/trainable": 180227 }, { "epoch": 1.54296875, - "grad_norm": 0.24631057679653168, + "grad_norm": 0.005419979803264141, "learning_rate": 2.2419829946830123e-05, - "loss": 0.0031685903668403625, + "loss": 4.929217175231315e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00317, + "ppl": 1.00005, "step": 395, "tokens/total": 11954032, - "tokens/train_per_sec_per_gpu": 32.85, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 180687 }, { "epoch": 1.546875, - "grad_norm": 0.06871633976697922, + "grad_norm": 0.0031002764590084553, "learning_rate": 2.2220267727989325e-05, - "loss": 0.0005168755305930972, + "loss": 6.144218787085265e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00052, + "ppl": 1.00006, "step": 396, "tokens/total": 11984512, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 181141 }, { "epoch": 1.55078125, - "grad_norm": 0.011674679815769196, + "grad_norm": 0.006748533807694912, "learning_rate": 2.202206960760984e-05, - "loss": 0.00017496946384198964, + "loss": 9.171784040518105e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00017, + "ppl": 1.00009, "step": 397, "tokens/total": 12014880, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 36.02, "tokens/trainable": 181648 }, { "epoch": 1.5546875, - "grad_norm": 0.14610664546489716, + "grad_norm": 0.08927815407514572, "learning_rate": 2.182524383352446e-05, - "loss": 0.0014660547021776438, + "loss": 0.001000746968202293, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00147, + "ppl": 1.001, "step": 398, "tokens/total": 12044928, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 182109 }, { "epoch": 1.55859375, - "grad_norm": 0.016359565779566765, + "grad_norm": 0.004651801194995642, "learning_rate": 2.1629798596457056e-05, - "loss": 7.928608101792634e-05, + "loss": 5.3439554903889075e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00008, + "ppl": 1.00005, "step": 399, "tokens/total": 12075344, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.58, "tokens/trainable": 182559 }, { "epoch": 1.5625, - "grad_norm": 0.0010484450031071901, + "grad_norm": 0.0017514342907816172, "learning_rate": 2.1435742029681725e-05, - "loss": 1.526270352769643e-05, + "loss": 4.570486271404661e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00005, "step": 400, "tokens/total": 12105616, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 182985 }, { "epoch": 1.56640625, - "grad_norm": 0.0005900752730667591, + "grad_norm": 0.01574699766933918, "learning_rate": 2.124308220868431e-05, - "loss": 1.2166316082584672e-05, + "loss": 0.0001242965809069574, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00012, "step": 401, "tokens/total": 12136080, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 183440 }, { "epoch": 1.5703125, - "grad_norm": 0.013194791041314602, + "grad_norm": 0.007152364123612642, "learning_rate": 2.105182715082638e-05, - "loss": 0.0001970212033484131, + "loss": 0.0001222842838615179, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0002, + "ppl": 1.00012, "step": 402, "tokens/total": 12166240, - "tokens/train_per_sec_per_gpu": 34.52, + "tokens/train_per_sec_per_gpu": 34.51, "tokens/trainable": 183917 }, { "epoch": 1.57421875, - "grad_norm": 0.02566305734217167, + "grad_norm": 0.0015342400874942541, "learning_rate": 2.0861984815011552e-05, - "loss": 0.00022389904188457876, + "loss": 3.621872019721195e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00022, + "ppl": 1.00004, "step": 403, "tokens/total": 12196544, - "tokens/train_per_sec_per_gpu": 30.39, + "tokens/train_per_sec_per_gpu": 30.36, "tokens/trainable": 184348 }, { "epoch": 1.578125, - "grad_norm": 0.008275284431874752, + "grad_norm": 0.0035214691888540983, "learning_rate": 2.0673563101354323e-05, - "loss": 8.35009923321195e-05, + "loss": 6.367819150909781e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00006, "step": 404, "tokens/total": 12226784, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 184786 }, { "epoch": 1.58203125, - "grad_norm": 0.038177311420440674, + "grad_norm": 0.0007211520569398999, "learning_rate": 2.0486569850851317e-05, - "loss": 0.00018527230713516474, + "loss": 2.0325338482507505e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00019, + "ppl": 1.00002, "step": 405, "tokens/total": 12257264, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 185249 }, { "epoch": 1.5859375, - "grad_norm": 0.007672510575503111, + "grad_norm": 0.0014804014936089516, "learning_rate": 2.0301012845054956e-05, - "loss": 0.00011439670925028622, + "loss": 3.379736153874546e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00003, "step": 406, "tokens/total": 12287584, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 185680 }, { "epoch": 1.58984375, - "grad_norm": 0.003159885760396719, + "grad_norm": 0.004397980403155088, "learning_rate": 2.011689980574966e-05, - "loss": 4.649449692806229e-05, + "loss": 5.1796458137687296e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00005, "step": 407, "tokens/total": 12317984, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 186100 }, { "epoch": 1.59375, - "grad_norm": 0.32744285464286804, + "grad_norm": 0.0026473007164895535, "learning_rate": 1.993423839463052e-05, - "loss": 0.002739987801760435, + "loss": 3.441090666456148e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00274, + "ppl": 1.00003, "step": 408, "tokens/total": 12348144, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.84, "tokens/trainable": 186565 }, { "epoch": 1.59765625, - "grad_norm": 0.0006675662589259446, + "grad_norm": 0.0289909727871418, "learning_rate": 1.975303621298445e-05, - "loss": 1.2970660463906825e-05, + "loss": 0.00021602815832011402, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00022, "step": 409, "tokens/total": 12378544, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 187017 }, { "epoch": 1.6015625, - "grad_norm": 0.003976705949753523, + "grad_norm": 0.007092812564224005, "learning_rate": 1.957330080137385e-05, - "loss": 3.857718547806144e-05, + "loss": 9.646185935707763e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.0001, "step": 410, "tokens/total": 12408784, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 187468 }, { "epoch": 1.60546875, - "grad_norm": 0.0024577646981924772, + "grad_norm": 0.02710823155939579, "learning_rate": 1.9395039639322864e-05, - "loss": 2.431379834888503e-05, + "loss": 0.0003458422143012285, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00035, "step": 411, "tokens/total": 12438832, - "tokens/train_per_sec_per_gpu": 37.61, + "tokens/train_per_sec_per_gpu": 37.57, "tokens/trainable": 187961 }, { "epoch": 1.609375, - "grad_norm": 0.003754909848794341, + "grad_norm": 0.29485711455345154, "learning_rate": 1.9218260145006073e-05, - "loss": 4.119630830246024e-05, + "loss": 0.0032923028338700533, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.0033, "step": 412, "tokens/total": 12469296, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 188447 }, { "epoch": 1.61328125, - "grad_norm": 0.3583323657512665, + "grad_norm": 0.22881586849689484, "learning_rate": 1.904296967493982e-05, - "loss": 0.004735157359391451, + "loss": 0.0035809341352432966, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00475, + "ppl": 1.00359, "step": 413, "tokens/total": 12499392, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 188903 }, { "epoch": 1.6171875, - "grad_norm": 0.049485232681035995, + "grad_norm": 0.0026347371749579906, "learning_rate": 1.8869175523676064e-05, - "loss": 0.00019404500199016184, + "loss": 6.0475373174995184e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.00006, "step": 414, "tokens/total": 12529952, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 189398 }, { "epoch": 1.62109375, - "grad_norm": 0.0030447980388998985, + "grad_norm": 0.0017223359318450093, "learning_rate": 1.869688492349885e-05, - "loss": 2.0038012735312805e-05, + "loss": 4.137849100516178e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00004, "step": 415, "tokens/total": 12560240, "tokens/train_per_sec_per_gpu": 34.16, @@ -5821,293 +5821,293 @@ }, { "epoch": 1.625, - "grad_norm": 0.25415608286857605, + "grad_norm": 0.011837545782327652, "learning_rate": 1.85261050441233e-05, - "loss": 0.0016201161779463291, + "loss": 0.00011106643069069833, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00162, + "ppl": 1.00011, "step": 416, "tokens/total": 12590736, - "tokens/train_per_sec_per_gpu": 32.64, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 190306 }, { "epoch": 1.62890625, - "grad_norm": 0.006711115129292011, + "grad_norm": 0.01777251996099949, "learning_rate": 1.8356842992397304e-05, - "loss": 4.321872620494105e-05, + "loss": 0.0001219596597366035, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00004, + "ppl": 1.00012, "step": 417, "tokens/total": 12621168, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 190746 }, { "epoch": 1.6328125, - "grad_norm": 0.004931971430778503, + "grad_norm": 0.003218573285266757, "learning_rate": 1.8189105812005714e-05, - "loss": 4.740363510791212e-05, + "loss": 5.22282425663434e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, "ppl": 1.00005, "step": 418, "tokens/total": 12651456, - "tokens/train_per_sec_per_gpu": 31.07, + "tokens/train_per_sec_per_gpu": 31.15, "tokens/trainable": 191156 }, { "epoch": 1.63671875, - "grad_norm": 0.007677357643842697, + "grad_norm": 0.013744015246629715, "learning_rate": 1.802290048317732e-05, - "loss": 7.545409607701004e-05, + "loss": 0.0001364837517030537, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00014, "step": 419, "tokens/total": 12681760, - "tokens/train_per_sec_per_gpu": 29.47, + "tokens/train_per_sec_per_gpu": 29.53, "tokens/trainable": 191573 }, { "epoch": 1.640625, - "grad_norm": 0.015445503406226635, + "grad_norm": 0.25013473629951477, "learning_rate": 1.785823392239424e-05, - "loss": 0.0001045453900587745, + "loss": 0.002094803610816598, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0001, + "ppl": 1.0021, "step": 420, "tokens/total": 12712144, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 192014 }, { "epoch": 1.64453125, - "grad_norm": 0.16882061958312988, + "grad_norm": 0.14290185272693634, "learning_rate": 1.7695112982104225e-05, - "loss": 0.0024146074429154396, + "loss": 0.001426510512828827, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00242, + "ppl": 1.00143, "step": 421, "tokens/total": 12742400, - "tokens/train_per_sec_per_gpu": 32.82, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 192453 }, { "epoch": 1.6484375, - "grad_norm": 0.002461223630234599, + "grad_norm": 0.0009390547638759017, "learning_rate": 1.7533544450435433e-05, - "loss": 3.336594454594888e-05, + "loss": 1.822916055971291e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00002, "step": 422, "tokens/total": 12772288, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 192886 }, { "epoch": 1.65234375, - "grad_norm": 0.0005388484569266438, + "grad_norm": 0.004544281866401434, "learning_rate": 1.7373535050913946e-05, - "loss": 8.696397344465367e-06, + "loss": 6.211431173142046e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00001, + "ppl": 1.00006, "step": 423, "tokens/total": 12802880, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.87, "tokens/trainable": 193323 }, { "epoch": 1.65625, - "grad_norm": 0.005009706597775221, + "grad_norm": 0.039859045296907425, "learning_rate": 1.721509144218405e-05, - "loss": 4.8607362259645015e-05, + "loss": 0.0005113891093060374, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00051, "step": 424, "tokens/total": 12833456, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 193753 }, { "epoch": 1.66015625, - "grad_norm": 0.001982118235900998, + "grad_norm": 0.00408409908413887, "learning_rate": 1.705822021773101e-05, - "loss": 3.262238169554621e-05, + "loss": 7.249199552461505e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00007, "step": 425, "tokens/total": 12863952, - "tokens/train_per_sec_per_gpu": 36.33, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 194240 }, { "epoch": 1.6640625, - "grad_norm": 0.05305991321802139, + "grad_norm": 0.13116440176963806, "learning_rate": 1.69029279056068e-05, - "loss": 0.0005229170201346278, + "loss": 0.0015061571029946208, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00052, + "ppl": 1.00151, "step": 426, "tokens/total": 12894352, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 194680 }, { "epoch": 1.66796875, - "grad_norm": 0.001265498693101108, + "grad_norm": 0.010440024547278881, "learning_rate": 1.6749220968158415e-05, - "loss": 1.5427456673933193e-05, + "loss": 8.445358253084123e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00008, "step": 427, "tokens/total": 12924688, - "tokens/train_per_sec_per_gpu": 38.73, + "tokens/train_per_sec_per_gpu": 38.77, "tokens/trainable": 195186 }, { "epoch": 1.671875, - "grad_norm": 0.0016263640718534589, + "grad_norm": 0.007594608701765537, "learning_rate": 1.659710580175893e-05, - "loss": 2.7778178264270537e-05, + "loss": 9.946282807504758e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.0001, "step": 428, "tokens/total": 12955072, - "tokens/train_per_sec_per_gpu": 36.51, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 195693 }, { "epoch": 1.67578125, - "grad_norm": 0.013330154120922089, + "grad_norm": 0.006465950049459934, "learning_rate": 1.644658873654133e-05, - "loss": 6.972272240091115e-05, + "loss": 0.00013557568308897316, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00007, + "ppl": 1.00014, "step": 429, "tokens/total": 12985328, - "tokens/train_per_sec_per_gpu": 36.93, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 196130 }, { "epoch": 1.6796875, - "grad_norm": 0.0034615101758390665, + "grad_norm": 0.00230405549518764, "learning_rate": 1.629767603613508e-05, - "loss": 4.500148497754708e-05, + "loss": 3.7114587030373514e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00005, + "ppl": 1.00004, "step": 430, "tokens/total": 13015600, - "tokens/train_per_sec_per_gpu": 29.58, + "tokens/train_per_sec_per_gpu": 29.53, "tokens/trainable": 196530 }, { "epoch": 1.68359375, - "grad_norm": 0.03424045443534851, + "grad_norm": 0.0041900877840816975, "learning_rate": 1.615037389740547e-05, - "loss": 0.0002949235204141587, + "loss": 6.116987788118422e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00029, + "ppl": 1.00006, "step": 431, "tokens/total": 13045728, - "tokens/train_per_sec_per_gpu": 29.88, + "tokens/train_per_sec_per_gpu": 29.94, "tokens/trainable": 196974 }, { "epoch": 1.6875, - "grad_norm": 0.0064499350264668465, + "grad_norm": 0.02951621450483799, "learning_rate": 1.600468845019576e-05, - "loss": 7.787663344061002e-05, + "loss": 0.0004236411186866462, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00008, + "ppl": 1.00042, "step": 432, "tokens/total": 13075920, - "tokens/train_per_sec_per_gpu": 35.25, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 197454 }, { "epoch": 1.69140625, - "grad_norm": 0.00021908426424488425, + "grad_norm": 0.0003202867810614407, "learning_rate": 1.5860625757072092e-05, - "loss": 6.603059773624409e-06, + "loss": 1.1190046279807575e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00001, "step": 433, "tokens/total": 13106128, - "tokens/train_per_sec_per_gpu": 31.4, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 197902 }, { "epoch": 1.6953125, - "grad_norm": 0.0002612156968098134, + "grad_norm": 0.0006868013297207654, "learning_rate": 1.571819181307116e-05, - "loss": 6.425582796509843e-06, + "loss": 2.1185776859056205e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00001, + "ppl": 1.00002, "step": 434, "tokens/total": 13136368, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.06, "tokens/trainable": 198374 }, { "epoch": 1.69921875, - "grad_norm": 0.001639618189074099, + "grad_norm": 0.0025407401844859123, "learning_rate": 1.557739254545075e-05, - "loss": 2.5485322112217546e-05, + "loss": 4.928320413455367e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00003, + "ppl": 1.00005, "step": 435, "tokens/total": 13166704, - "tokens/train_per_sec_per_gpu": 37.54, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 198846 }, { "epoch": 1.703125, - "grad_norm": 0.01887959986925125, + "grad_norm": 0.0013901089550927281, "learning_rate": 1.543823381344311e-05, - "loss": 0.0002141120348824188, + "loss": 3.577578900149092e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00021, + "ppl": 1.00004, "step": 436, "tokens/total": 13197344, "tokens/train_per_sec_per_gpu": 37.67, @@ -6115,41 +6115,41 @@ }, { "epoch": 1.70703125, - "grad_norm": 0.0012294527841731906, + "grad_norm": 0.003646081080660224, "learning_rate": 1.5300721408011114e-05, - "loss": 2.316079735464882e-05, + "loss": 6.294051127042621e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00006, "step": 437, "tokens/total": 13227664, - "tokens/train_per_sec_per_gpu": 37.43, + "tokens/train_per_sec_per_gpu": 37.46, "tokens/trainable": 199777 }, { "epoch": 1.7109375, - "grad_norm": 0.005585651844739914, + "grad_norm": 0.030430182814598083, "learning_rate": 1.5164861051607254e-05, - "loss": 4.5935248635942116e-05, + "loss": 0.0001770013477653265, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00018, "step": 438, "tokens/total": 13257632, - "tokens/train_per_sec_per_gpu": 30.82, + "tokens/train_per_sec_per_gpu": 30.93, "tokens/trainable": 200194 }, { "epoch": 1.71484375, - "grad_norm": 0.001553745474666357, + "grad_norm": 0.0018230377463623881, "learning_rate": 1.5030658397935521e-05, - "loss": 2.2851421817904338e-05, + "loss": 3.7613608583342284e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00002, + "ppl": 1.00004, "step": 439, "tokens/total": 13288240, "tokens/train_per_sec_per_gpu": 33.88, @@ -6157,128 +6157,128 @@ }, { "epoch": 1.71875, - "grad_norm": 0.0029791900888085365, + "grad_norm": 0.0029376039747148752, "learning_rate": 1.4898119031716104e-05, - "loss": 4.093274037586525e-05, + "loss": 4.779352093464695e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00005, "step": 440, "tokens/total": 13318992, - "tokens/train_per_sec_per_gpu": 33.79, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 201121 }, { "epoch": 1.72265625, - "grad_norm": 0.0017392379231750965, + "grad_norm": 0.0018373411148786545, "learning_rate": 1.476724846845306e-05, - "loss": 7.29740804672474e-06, + "loss": 3.149824624415487e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00003, "step": 441, "tokens/total": 13349392, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.81, "tokens/trainable": 201598 }, { "epoch": 1.7265625, - "grad_norm": 0.0009943305049091578, + "grad_norm": 0.0015428521437570453, "learning_rate": 1.463805215420471e-05, - "loss": 1.7162077710963786e-05, + "loss": 2.0810390196857043e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 442, "tokens/total": 13379648, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 202068 }, { "epoch": 1.73046875, - "grad_norm": 0.0011473585618659854, + "grad_norm": 0.0010770867811515927, "learning_rate": 1.451053546535705e-05, - "loss": 2.3819740817998536e-05, + "loss": 2.303836117789615e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 443, "tokens/total": 13409936, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 202524 }, { "epoch": 1.734375, - "grad_norm": 0.006799118127673864, + "grad_norm": 0.006372133269906044, "learning_rate": 1.438470370840001e-05, - "loss": 6.556943117175251e-05, + "loss": 7.449327677022666e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, "ppl": 1.00007, "step": 444, "tokens/total": 13440288, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 202996 }, { "epoch": 1.73828125, - "grad_norm": 0.0011645558988675475, + "grad_norm": 0.007094603031873703, "learning_rate": 1.4260562119706606e-05, - "loss": 1.8389995602774434e-05, + "loss": 4.211071063764393e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00004, "step": 445, "tokens/total": 13468880, - "tokens/train_per_sec_per_gpu": 39.14, + "tokens/train_per_sec_per_gpu": 39.19, "tokens/trainable": 203470 }, { "epoch": 1.7421875, - "grad_norm": 0.020891210064291954, + "grad_norm": 0.006931444630026817, "learning_rate": 1.413811586531508e-05, - "loss": 0.00016399261949118227, + "loss": 8.66219779709354e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00016, + "ppl": 1.00009, "step": 446, "tokens/total": 13499184, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 203919 }, { "epoch": 1.74609375, - "grad_norm": 0.09615519642829895, + "grad_norm": 0.0041664596647024155, "learning_rate": 1.4017370040713884e-05, - "loss": 0.0010675137164071202, + "loss": 4.786982390214689e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00107, + "ppl": 1.00005, "step": 447, "tokens/total": 13529632, - "tokens/train_per_sec_per_gpu": 33.3, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 204376 }, { "epoch": 1.75, - "grad_norm": 0.09744399785995483, + "grad_norm": 0.042264848947525024, "learning_rate": 1.3898329670629645e-05, - "loss": 0.001196134602651, + "loss": 0.00027092613163404167, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0012, + "ppl": 1.00027, "step": 448, "tokens/total": 13560080, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 204821 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_model.safetensors index 8e3393e0d9d830da40019eea8976c5200652c786..5ba7adf7daa2c6973e8b767c3878e00a270cd473 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:8574c62e5993d868e285944d01ea5c0f530e591f2154d08a0c57b6eadfedd47d +oid sha256:759e2f47a5e976dcfbe11dde9491135d96d1b05bada169151f4a8f939269acc5 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/optimizer.pt index 8c06eb3a25c2ac81edc1245d8a86c290ba00e0dc..f9173dd0543c7e5e03c5a94bc3c36e1ee50c22f9 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:d83b575649c6ab2f7828c29ac5ae5dcb50824f042fa45adedc229558f4ef1923 +oid sha256:cd01ae9ec3eb43f4befc813946bc00ce45c82d3237dfa7f15ddccfe7878ea01d size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/trainer_state.json index d02d36e752100f5efb4a3d138ed927d6e4adeb13..02c043ff803a1bb9f1e3315e32af7dc8b64659cd 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-480/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,461 +4057,461 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 }, { "epoch": 1.25390625, - "grad_norm": 0.04359544813632965, + "grad_norm": 0.0010733718518167734, "learning_rate": 4.0323513089607876e-05, - "loss": 0.0005239051533862948, + "loss": 1.948333010659553e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00052, + "ppl": 1.00002, "step": 321, "tokens/total": 9712656, - "tokens/train_per_sec_per_gpu": 31.85, + "tokens/train_per_sec_per_gpu": 31.72, "tokens/trainable": 146781 }, { "epoch": 1.2578125, - "grad_norm": 0.02377651259303093, + "grad_norm": 0.0843457579612732, "learning_rate": 4.004940255778431e-05, - "loss": 0.0001890905696200207, + "loss": 0.0008847219287417829, "memory/device_reserved (GiB)": 34.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00019, + "ppl": 1.00089, "step": 322, "tokens/total": 9743088, "tokens/train_per_sec_per_gpu": 35.55, @@ -4519,69 +4519,69 @@ }, { "epoch": 1.26171875, - "grad_norm": 0.01256605889648199, + "grad_norm": 0.09092428535223007, "learning_rate": 3.977591418134619e-05, - "loss": 8.730488480068743e-05, + "loss": 0.00040022452594712377, "memory/device_reserved (GiB)": 35.17, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00009, + "ppl": 1.0004, "step": 323, "tokens/total": 9773808, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 147673 }, { "epoch": 1.265625, - "grad_norm": 0.21066401898860931, + "grad_norm": 0.3859696090221405, "learning_rate": 3.95030593412612e-05, - "loss": 0.0028422519098967314, + "loss": 0.004064415581524372, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00285, + "ppl": 1.00407, "step": 324, "tokens/total": 9804016, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 148103 }, { "epoch": 1.26953125, - "grad_norm": 0.025614596903324127, + "grad_norm": 0.000418124720454216, "learning_rate": 3.923084939213296e-05, - "loss": 0.00016133410099428147, + "loss": 9.266825145459734e-06, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00016, + "ppl": 1.00001, "step": 325, "tokens/total": 9834592, - "tokens/train_per_sec_per_gpu": 31.73, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 148535 }, { "epoch": 1.2734375, - "grad_norm": 0.033190563321113586, + "grad_norm": 0.030438628047704697, "learning_rate": 3.895929566172861e-05, - "loss": 0.00033758440986275673, + "loss": 0.00029550789622589946, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00034, + "ppl": 1.0003, "step": 326, "tokens/total": 9864848, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 148999 }, { "epoch": 1.27734375, - "grad_norm": 0.07407072931528091, + "grad_norm": 0.0003460803418420255, "learning_rate": 3.868840945050728e-05, - "loss": 0.0007672893116250634, + "loss": 9.424240488442592e-06, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00077, + "ppl": 1.00001, "step": 327, "tokens/total": 9895168, "tokens/train_per_sec_per_gpu": 31.64, @@ -4589,125 +4589,125 @@ }, { "epoch": 1.28125, - "grad_norm": 0.05904461070895195, + "grad_norm": 0.32631534337997437, "learning_rate": 3.841820203114995e-05, - "loss": 0.000713472138158977, + "loss": 0.004381683189421892, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00071, + "ppl": 1.00439, "step": 328, "tokens/total": 9925696, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 149886 }, { "epoch": 1.28515625, - "grad_norm": 0.007630123756825924, + "grad_norm": 0.06805918365716934, "learning_rate": 3.814868464809027e-05, - "loss": 7.993751933099702e-05, + "loss": 0.0003639076603576541, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00036, "step": 329, "tokens/total": 9955648, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 31.01, "tokens/trainable": 150288 }, { "epoch": 1.2890625, - "grad_norm": 0.024742672219872475, + "grad_norm": 0.004817479755729437, "learning_rate": 3.787986851704667e-05, - "loss": 0.00019552679441403598, + "loss": 3.246869164286181e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0002, + "ppl": 1.00003, "step": 330, "tokens/total": 9985856, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 150733 }, { "epoch": 1.29296875, - "grad_norm": 0.006353198084980249, + "grad_norm": 0.06923647969961166, "learning_rate": 3.7611764824555654e-05, - "loss": 0.00010314649261999875, + "loss": 0.00031070224940776825, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00031, "step": 331, "tokens/total": 10016208, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 151207 }, { "epoch": 1.296875, - "grad_norm": 0.16203969717025757, + "grad_norm": 0.14731979370117188, "learning_rate": 3.734438472750619e-05, - "loss": 0.0014735229779034853, + "loss": 0.0015139597235247493, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00147, + "ppl": 1.00152, "step": 332, "tokens/total": 10046512, - "tokens/train_per_sec_per_gpu": 37.5, + "tokens/train_per_sec_per_gpu": 37.61, "tokens/trainable": 151694 }, { "epoch": 1.30078125, - "grad_norm": 0.041821569204330444, + "grad_norm": 0.007325666956603527, "learning_rate": 3.707773935267552e-05, - "loss": 0.0004190094769001007, + "loss": 7.809747330611572e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00042, + "ppl": 1.00008, "step": 333, "tokens/total": 10076944, - "tokens/train_per_sec_per_gpu": 38.27, + "tokens/train_per_sec_per_gpu": 38.37, "tokens/trainable": 152188 }, { "epoch": 1.3046875, - "grad_norm": 0.0011248595546931028, + "grad_norm": 0.00047597952652722597, "learning_rate": 3.68118397962661e-05, - "loss": 3.350014958414249e-05, + "loss": 1.2739032172248699e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00001, "step": 334, "tokens/total": 10107296, - "tokens/train_per_sec_per_gpu": 30.6, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 152596 }, { "epoch": 1.30859375, - "grad_norm": 0.003707638941705227, + "grad_norm": 0.0700320228934288, "learning_rate": 3.654669712344384e-05, - "loss": 4.684936357080005e-05, + "loss": 0.00047467637341469526, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00047, "step": 335, "tokens/total": 10137568, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 153052 }, { "epoch": 1.3125, - "grad_norm": 0.0017528374446555972, + "grad_norm": 0.06498395651578903, "learning_rate": 3.628232236787763e-05, - "loss": 2.3632102966075763e-05, + "loss": 0.00041414948645979166, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00002, + "ppl": 1.00041, "step": 336, "tokens/total": 10167952, "tokens/train_per_sec_per_gpu": 30.19, @@ -4715,1105 +4715,1105 @@ }, { "epoch": 1.31640625, - "grad_norm": 0.0626155436038971, + "grad_norm": 0.009991639293730259, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0006341143744066358, + "loss": 7.060338975861669e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00063, + "ppl": 1.00007, "step": 337, "tokens/total": 10198512, - "tokens/train_per_sec_per_gpu": 40.28, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 153983 }, { "epoch": 1.3203125, - "grad_norm": 0.0166204534471035, + "grad_norm": 0.03267490491271019, "learning_rate": 3.575592058295017e-05, - "loss": 0.00015405623707920313, + "loss": 0.0002045792352873832, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00015, + "ppl": 1.0002, "step": 338, "tokens/total": 10228752, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.72, "tokens/trainable": 154464 }, { "epoch": 1.32421875, - "grad_norm": 0.0004508346610236913, + "grad_norm": 0.00039529221248812973, "learning_rate": 3.549391545931585e-05, - "loss": 8.604627510067075e-06, + "loss": 8.338471161550842e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 339, "tokens/total": 10259104, - "tokens/train_per_sec_per_gpu": 35.73, + "tokens/train_per_sec_per_gpu": 35.87, "tokens/trainable": 154924 }, { "epoch": 1.328125, - "grad_norm": 0.0024134982377290726, + "grad_norm": 0.0010571131715551019, "learning_rate": 3.5232722063479914e-05, - "loss": 4.25071848439984e-05, + "loss": 1.6815669368952513e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00004, + "ppl": 1.00002, "step": 340, "tokens/total": 10289520, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 155373 }, { "epoch": 1.33203125, - "grad_norm": 0.047796547412872314, + "grad_norm": 0.0008337291656062007, "learning_rate": 3.49723512647657e-05, - "loss": 0.0004414983559399843, + "loss": 1.703310408629477e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00044, + "ppl": 1.00002, "step": 341, "tokens/total": 10320016, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 155873 }, { "epoch": 1.3359375, - "grad_norm": 0.0013580132508650422, + "grad_norm": 0.0007872325950302184, "learning_rate": 3.471281389826491e-05, - "loss": 3.1043862691149116e-05, + "loss": 1.626565062906593e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00002, "step": 342, "tokens/total": 10350368, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.42, "tokens/trainable": 156278 }, { "epoch": 1.33984375, - "grad_norm": 0.013898961246013641, + "grad_norm": 0.21220935881137848, "learning_rate": 3.4454120764386764e-05, - "loss": 9.816634701564908e-05, + "loss": 0.0009314992348663509, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00093, "step": 343, "tokens/total": 10380624, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.4, "tokens/trainable": 156733 }, { "epoch": 1.34375, - "grad_norm": 0.0031031679827719927, + "grad_norm": 0.017469989135861397, "learning_rate": 3.4196282628408526e-05, - "loss": 4.329531657276675e-05, + "loss": 7.496406033169478e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00004, + "ppl": 1.00007, "step": 344, "tokens/total": 10411024, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 157203 }, { "epoch": 1.34765625, - "grad_norm": 0.009028271771967411, + "grad_norm": 0.2605672776699066, "learning_rate": 3.3939310220027456e-05, - "loss": 0.00010301935981260613, + "loss": 0.004417422227561474, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00443, "step": 345, "tokens/total": 10441248, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 157707 }, { "epoch": 1.3515625, - "grad_norm": 0.0036287850234657526, + "grad_norm": 0.00032958327210508287, "learning_rate": 3.3683214232914404e-05, - "loss": 4.620348772732541e-05, + "loss": 7.68474092183169e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00005, + "ppl": 1.00001, "step": 346, "tokens/total": 10471712, - "tokens/train_per_sec_per_gpu": 34.96, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 158180 }, { "epoch": 1.35546875, - "grad_norm": 0.08971801400184631, + "grad_norm": 0.0021204655058681965, "learning_rate": 3.342800532426873e-05, - "loss": 0.0009501657332293689, + "loss": 2.9396429454209283e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00095, + "ppl": 1.00003, "step": 347, "tokens/total": 10502288, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.41, "tokens/trainable": 158646 }, { "epoch": 1.359375, - "grad_norm": 0.00890435092151165, + "grad_norm": 0.00040693042683415115, "learning_rate": 3.317369411437484e-05, - "loss": 7.783617911627516e-05, + "loss": 9.5013465397642e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00001, "step": 348, "tokens/total": 10532304, - "tokens/train_per_sec_per_gpu": 35.59, + "tokens/train_per_sec_per_gpu": 35.66, "tokens/trainable": 159115 }, { "epoch": 1.36328125, - "grad_norm": 0.023319199681282043, + "grad_norm": 0.006379029247909784, "learning_rate": 3.292029118616024e-05, - "loss": 0.00021630006085615605, + "loss": 9.018932178150862e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00022, + "ppl": 1.00009, "step": 349, "tokens/total": 10562608, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 159538 }, { "epoch": 1.3671875, - "grad_norm": 0.047880928963422775, + "grad_norm": 0.005555902142077684, "learning_rate": 3.266780708475511e-05, - "loss": 0.00044884331873618066, + "loss": 5.1456365326885134e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00045, + "ppl": 1.00005, "step": 350, "tokens/total": 10592992, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.22, "tokens/trainable": 160016 }, { "epoch": 1.37109375, - "grad_norm": 0.008666309528052807, + "grad_norm": 0.009832990355789661, "learning_rate": 3.241625231705354e-05, - "loss": 5.017036892240867e-05, + "loss": 9.037736163008958e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00005, + "ppl": 1.00009, "step": 351, "tokens/total": 10623328, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.57, "tokens/trainable": 160475 }, { "epoch": 1.375, - "grad_norm": 0.06452610343694687, + "grad_norm": 0.0002588493807706982, "learning_rate": 3.216563735127618e-05, - "loss": 0.0007272367365658283, + "loss": 7.509744136768859e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00073, + "ppl": 1.00001, "step": 352, "tokens/total": 10653632, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 160952 }, { "epoch": 1.37890625, - "grad_norm": 0.370597779750824, + "grad_norm": 0.03195308893918991, "learning_rate": 3.191597261653475e-05, - "loss": 0.007550997193902731, + "loss": 0.0002666166110429913, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00758, + "ppl": 1.00027, "step": 353, "tokens/total": 10684176, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 161420 }, { "epoch": 1.3828125, - "grad_norm": 0.0031376827973872423, + "grad_norm": 0.07012991607189178, "learning_rate": 3.166726850239794e-05, - "loss": 2.3453332687495276e-05, + "loss": 0.000741704716347158, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00074, "step": 354, "tokens/total": 10714352, - "tokens/train_per_sec_per_gpu": 34.02, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 161868 }, { "epoch": 1.38671875, - "grad_norm": 0.0021399864926934242, + "grad_norm": 0.0005822654929943383, "learning_rate": 3.141953535845912e-05, - "loss": 2.5832894607447088e-05, + "loss": 1.0378402294008993e-05, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00001, "step": 355, "tokens/total": 10744464, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 162318 }, { "epoch": 1.390625, - "grad_norm": 0.0028148347046226263, + "grad_norm": 0.012435230426490307, "learning_rate": 3.11727834939056e-05, - "loss": 3.7286932638380677e-05, + "loss": 7.89838086348027e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00008, "step": 356, "tokens/total": 10774976, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.54, "tokens/trainable": 162789 }, { "epoch": 1.39453125, - "grad_norm": 0.1642119586467743, + "grad_norm": 0.0045598647557199, "learning_rate": 3.092702317708967e-05, - "loss": 0.0027845175936818123, + "loss": 2.48450869548833e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00279, + "ppl": 1.00002, "step": 357, "tokens/total": 10805600, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 163254 }, { "epoch": 1.3984375, - "grad_norm": 0.066535085439682, + "grad_norm": 0.3044262230396271, "learning_rate": 3.0682264635101276e-05, - "loss": 0.0002488417667336762, + "loss": 0.002298796083778143, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00025, + "ppl": 1.0023, "step": 358, "tokens/total": 10835920, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.62, "tokens/trainable": 163715 }, { "epoch": 1.40234375, - "grad_norm": 0.006617655046284199, + "grad_norm": 0.002458421979099512, "learning_rate": 3.0438518053342407e-05, - "loss": 7.841112528694794e-05, + "loss": 1.9634167983895168e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 359, "tokens/total": 10866048, - "tokens/train_per_sec_per_gpu": 34.4, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 164197 }, { "epoch": 1.40625, - "grad_norm": 0.010409035719931126, + "grad_norm": 0.0024773837067186832, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010489403939573094, + "loss": 2.744927041931078e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00003, "step": 360, "tokens/total": 10896288, - "tokens/train_per_sec_per_gpu": 31.6, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 164661 }, { "epoch": 1.41015625, - "grad_norm": 0.002426267135888338, + "grad_norm": 0.00026717092259787023, "learning_rate": 2.9954101301140146e-05, - "loss": 4.0343060391023755e-05, + "loss": 6.422977094189264e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00001, "step": 361, "tokens/total": 10926816, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 165111 }, { "epoch": 1.4140625, - "grad_norm": 0.015666797757148743, + "grad_norm": 0.0008353493758477271, "learning_rate": 2.9713451289255123e-05, - "loss": 0.00014991794887464494, + "loss": 1.3549893083109055e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00015, + "ppl": 1.00001, "step": 362, "tokens/total": 10954928, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 165552 }, { "epoch": 1.41796875, - "grad_norm": 0.2695651650428772, + "grad_norm": 0.006071125157177448, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0014983330620452762, + "loss": 6.428411870729178e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.0015, + "ppl": 1.00006, "step": 363, "tokens/total": 10985328, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 166026 }, { "epoch": 1.421875, - "grad_norm": 0.03586212173104286, + "grad_norm": 0.25424960255622864, "learning_rate": 2.9235318065647e-05, - "loss": 0.00030509717180393636, + "loss": 0.004243595991283655, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00031, + "ppl": 1.00425, "step": 364, "tokens/total": 11015664, - "tokens/train_per_sec_per_gpu": 37.86, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 166486 }, { "epoch": 1.42578125, - "grad_norm": 0.0019308789633214474, + "grad_norm": 0.0005575277027674019, "learning_rate": 2.8997854750998964e-05, - "loss": 2.4129443772835657e-05, + "loss": 8.403902938880492e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00001, "step": 365, "tokens/total": 11046256, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 166959 }, { "epoch": 1.4296875, - "grad_norm": 0.005940837785601616, + "grad_norm": 0.0014335239538922906, "learning_rate": 2.8761473491751258e-05, - "loss": 2.8238933737156913e-05, + "loss": 1.4738036043127067e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.68, "memory/max_allocated (GiB)": 33.68, - "ppl": 1.00003, + "ppl": 1.00001, "step": 366, "tokens/total": 11076288, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 167394 }, { "epoch": 1.43359375, - "grad_norm": 0.002125627128407359, + "grad_norm": 0.0010152696631848812, "learning_rate": 2.8526184124692883e-05, - "loss": 1.602789416210726e-05, + "loss": 1.3278609912958927e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00001, "step": 367, "tokens/total": 11106416, - "tokens/train_per_sec_per_gpu": 28.5, + "tokens/train_per_sec_per_gpu": 28.58, "tokens/trainable": 167832 }, { "epoch": 1.4375, - "grad_norm": 0.2510211765766144, + "grad_norm": 0.11941836029291153, "learning_rate": 2.829199644117484e-05, - "loss": 0.00010395953722763807, + "loss": 0.0006476733833551407, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00065, "step": 368, "tokens/total": 11136848, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 31.02, "tokens/trainable": 168242 }, { "epoch": 1.44140625, - "grad_norm": 0.001904280623421073, + "grad_norm": 0.006877629552036524, "learning_rate": 2.8058920186702553e-05, - "loss": 2.6418363631819375e-05, + "loss": 7.449048280250281e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00007, "step": 369, "tokens/total": 11167376, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 168715 }, { "epoch": 1.4453125, - "grad_norm": 0.0028152521699666977, + "grad_norm": 0.0007151139434427023, "learning_rate": 2.782696506053033e-05, - "loss": 2.9974533390486613e-05, + "loss": 1.1437590728746727e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00001, "step": 370, "tokens/total": 11197776, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.86, "tokens/trainable": 169147 }, { "epoch": 1.44921875, - "grad_norm": 0.0010822078911587596, + "grad_norm": 0.009094453416764736, "learning_rate": 2.7596140715257824e-05, - "loss": 1.34217716549756e-05, + "loss": 5.9242345741949975e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00006, "step": 371, "tokens/total": 11227840, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 169628 }, { "epoch": 1.453125, - "grad_norm": 0.005367911420762539, + "grad_norm": 0.000247267191298306, "learning_rate": 2.7366456756428184e-05, - "loss": 6.65646803099662e-05, + "loss": 7.548428584414069e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00007, + "ppl": 1.00001, "step": 372, "tokens/total": 11258176, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 170085 }, { "epoch": 1.45703125, - "grad_norm": 0.047570567578077316, + "grad_norm": 0.0003029497747775167, "learning_rate": 2.7137922742128486e-05, - "loss": 0.0003471036907285452, + "loss": 5.4013939916330855e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00035, + "ppl": 1.00001, "step": 373, "tokens/total": 11288336, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 170584 }, { "epoch": 1.4609375, - "grad_norm": 0.040886107832193375, + "grad_norm": 0.001942179980687797, "learning_rate": 2.691054818259188e-05, - "loss": 0.0002880148240365088, + "loss": 2.380511250521522e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00029, + "ppl": 1.00002, "step": 374, "tokens/total": 11318848, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 171058 }, { "epoch": 1.46484375, - "grad_norm": 0.0031216361094266176, + "grad_norm": 0.0019308892078697681, "learning_rate": 2.6684342539801933e-05, - "loss": 2.690855944820214e-05, + "loss": 1.5233906196954194e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00002, "step": 375, "tokens/total": 11349168, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 171518 }, { "epoch": 1.46875, - "grad_norm": 0.012176645919680595, + "grad_norm": 0.6044301986694336, "learning_rate": 2.645931522709877e-05, - "loss": 8.402287494391203e-05, + "loss": 0.006350134499371052, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00008, + "ppl": 1.00637, "step": 376, "tokens/total": 11379328, - "tokens/train_per_sec_per_gpu": 40.48, + "tokens/train_per_sec_per_gpu": 40.62, "tokens/trainable": 172007 }, { "epoch": 1.47265625, - "grad_norm": 0.24136756360530853, + "grad_norm": 0.25446587800979614, "learning_rate": 2.6235475608787365e-05, - "loss": 0.0013303000014275312, + "loss": 0.0018724403344094753, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00133, + "ppl": 1.00187, "step": 377, "tokens/total": 11409568, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 172468 }, { "epoch": 1.4765625, - "grad_norm": 0.021714258939027786, + "grad_norm": 0.0019207323202863336, "learning_rate": 2.6012832999747916e-05, - "loss": 0.00020160498388577253, + "loss": 3.049923907383345e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0002, + "ppl": 1.00003, "step": 378, "tokens/total": 11439968, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 172923 }, { "epoch": 1.48046875, - "grad_norm": 0.35412073135375977, + "grad_norm": 0.33491548895835876, "learning_rate": 2.579139666504821e-05, - "loss": 0.015761105343699455, + "loss": 0.02673855796456337, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01589, + "ppl": 1.0271, "step": 379, "tokens/total": 11470496, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 173370 }, { "epoch": 1.484375, - "grad_norm": 0.005766173824667931, + "grad_norm": 0.006177723873406649, "learning_rate": 2.557117581955798e-05, - "loss": 2.5790239305933937e-05, + "loss": 5.195035191718489e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00005, "step": 380, "tokens/total": 11500720, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 173837 }, { "epoch": 1.48828125, - "grad_norm": 0.005898744333535433, + "grad_norm": 0.06973031163215637, "learning_rate": 2.5352179627565532e-05, - "loss": 5.821501690661535e-05, + "loss": 0.0006310560274869204, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00006, + "ppl": 1.00063, "step": 381, "tokens/total": 11531280, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 174294 }, { "epoch": 1.4921875, - "grad_norm": 0.005451703444123268, + "grad_norm": 0.0039021887350827456, "learning_rate": 2.5134417202396277e-05, - "loss": 4.0181505028158426e-05, + "loss": 4.849781544180587e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00005, "step": 382, "tokens/total": 11561264, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.84, "tokens/trainable": 174701 }, { "epoch": 1.49609375, - "grad_norm": 0.0038302047178149223, + "grad_norm": 0.0007975143962539732, "learning_rate": 2.491789760603361e-05, - "loss": 3.403786467970349e-05, + "loss": 2.3489263185183518e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00002, "step": 383, "tokens/total": 11591616, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 175131 }, { "epoch": 1.5, - "grad_norm": 0.004227485507726669, + "grad_norm": 0.012541128322482109, "learning_rate": 2.4702629848741764e-05, - "loss": 3.562243364285678e-05, + "loss": 0.00011495217040646821, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00011, "step": 384, "tokens/total": 11622000, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 175586 }, { "epoch": 1.50390625, - "grad_norm": 0.013361346907913685, + "grad_norm": 0.004752015229314566, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0001464220113120973, + "loss": 6.502695032395422e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00007, "step": 385, "tokens/total": 11652352, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176026 }, { "epoch": 1.5078125, - "grad_norm": 0.008831475861370564, + "grad_norm": 0.014192809350788593, "learning_rate": 2.427588563158384e-05, - "loss": 8.2662510976661e-05, + "loss": 8.075163350440562e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00008, "step": 386, "tokens/total": 11682736, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.91, "tokens/trainable": 176512 }, { "epoch": 1.51171875, - "grad_norm": 0.009311008267104626, + "grad_norm": 0.007288333959877491, "learning_rate": 2.406442693028651e-05, - "loss": 0.0001226613821927458, + "loss": 8.845872798701748e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00009, "step": 387, "tokens/total": 11713136, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.45, "tokens/trainable": 176943 }, { "epoch": 1.515625, - "grad_norm": 0.0017816838808357716, + "grad_norm": 0.10162956267595291, "learning_rate": 2.3854255584458547e-05, - "loss": 2.3221660740091465e-05, + "loss": 0.0007253064541146159, "memory/device_reserved (GiB)": 35.23, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00073, "step": 388, "tokens/total": 11743808, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 177370 }, { "epoch": 1.51953125, - "grad_norm": 0.023602057248353958, + "grad_norm": 0.005729300435632467, "learning_rate": 2.3645380340187508e-05, - "loss": 0.00012638044427148998, + "loss": 8.652975520817563e-05, "memory/device_reserved (GiB)": 35.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00013, + "ppl": 1.00009, "step": 389, "tokens/total": 11774144, - "tokens/train_per_sec_per_gpu": 35.14, + "tokens/train_per_sec_per_gpu": 35.2, "tokens/trainable": 177851 }, { "epoch": 1.5234375, - "grad_norm": 0.04383797571063042, + "grad_norm": 0.0715414360165596, "learning_rate": 2.3437809889624914e-05, - "loss": 0.0004640861588995904, + "loss": 0.0007950748549774289, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00046, + "ppl": 1.0008, "step": 390, "tokens/total": 11804272, - "tokens/train_per_sec_per_gpu": 34.68, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 178310 }, { "epoch": 1.52734375, - "grad_norm": 0.061932601034641266, + "grad_norm": 0.009775097481906414, "learning_rate": 2.3231552870624487e-05, - "loss": 0.00033243370126001537, + "loss": 0.00010615254723234102, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00033, + "ppl": 1.00011, "step": 391, "tokens/total": 11832432, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 178736 }, { "epoch": 1.53125, - "grad_norm": 0.04983547702431679, + "grad_norm": 0.0015552763361483812, "learning_rate": 2.3026617866382657e-05, - "loss": 0.000599355495069176, + "loss": 2.954876617877744e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0006, + "ppl": 1.00003, "step": 392, "tokens/total": 11862960, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 179233 }, { "epoch": 1.53515625, - "grad_norm": 0.012036106549203396, + "grad_norm": 0.026106838136911392, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0001237639953615144, + "loss": 0.00021109850786160678, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00021, "step": 393, "tokens/total": 11893232, - "tokens/train_per_sec_per_gpu": 38.49, + "tokens/train_per_sec_per_gpu": 38.57, "tokens/trainable": 179730 }, { "epoch": 1.5390625, - "grad_norm": 0.008992817252874374, + "grad_norm": 0.020347680896520615, "learning_rate": 2.2620747959533722e-05, - "loss": 0.00010385089262854308, + "loss": 0.0002601295418571681, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0001, + "ppl": 1.00026, "step": 394, "tokens/total": 11923664, - "tokens/train_per_sec_per_gpu": 37.81, + "tokens/train_per_sec_per_gpu": 37.87, "tokens/trainable": 180227 }, { "epoch": 1.54296875, - "grad_norm": 0.24631057679653168, + "grad_norm": 0.005419979803264141, "learning_rate": 2.2419829946830123e-05, - "loss": 0.0031685903668403625, + "loss": 4.929217175231315e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00317, + "ppl": 1.00005, "step": 395, "tokens/total": 11954032, - "tokens/train_per_sec_per_gpu": 32.85, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 180687 }, { "epoch": 1.546875, - "grad_norm": 0.06871633976697922, + "grad_norm": 0.0031002764590084553, "learning_rate": 2.2220267727989325e-05, - "loss": 0.0005168755305930972, + "loss": 6.144218787085265e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00052, + "ppl": 1.00006, "step": 396, "tokens/total": 11984512, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 181141 }, { "epoch": 1.55078125, - "grad_norm": 0.011674679815769196, + "grad_norm": 0.006748533807694912, "learning_rate": 2.202206960760984e-05, - "loss": 0.00017496946384198964, + "loss": 9.171784040518105e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00017, + "ppl": 1.00009, "step": 397, "tokens/total": 12014880, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 36.02, "tokens/trainable": 181648 }, { "epoch": 1.5546875, - "grad_norm": 0.14610664546489716, + "grad_norm": 0.08927815407514572, "learning_rate": 2.182524383352446e-05, - "loss": 0.0014660547021776438, + "loss": 0.001000746968202293, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00147, + "ppl": 1.001, "step": 398, "tokens/total": 12044928, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 182109 }, { "epoch": 1.55859375, - "grad_norm": 0.016359565779566765, + "grad_norm": 0.004651801194995642, "learning_rate": 2.1629798596457056e-05, - "loss": 7.928608101792634e-05, + "loss": 5.3439554903889075e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00008, + "ppl": 1.00005, "step": 399, "tokens/total": 12075344, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.58, "tokens/trainable": 182559 }, { "epoch": 1.5625, - "grad_norm": 0.0010484450031071901, + "grad_norm": 0.0017514342907816172, "learning_rate": 2.1435742029681725e-05, - "loss": 1.526270352769643e-05, + "loss": 4.570486271404661e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00005, "step": 400, "tokens/total": 12105616, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 182985 }, { "epoch": 1.56640625, - "grad_norm": 0.0005900752730667591, + "grad_norm": 0.01574699766933918, "learning_rate": 2.124308220868431e-05, - "loss": 1.2166316082584672e-05, + "loss": 0.0001242965809069574, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00012, "step": 401, "tokens/total": 12136080, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 183440 }, { "epoch": 1.5703125, - "grad_norm": 0.013194791041314602, + "grad_norm": 0.007152364123612642, "learning_rate": 2.105182715082638e-05, - "loss": 0.0001970212033484131, + "loss": 0.0001222842838615179, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0002, + "ppl": 1.00012, "step": 402, "tokens/total": 12166240, - "tokens/train_per_sec_per_gpu": 34.52, + "tokens/train_per_sec_per_gpu": 34.51, "tokens/trainable": 183917 }, { "epoch": 1.57421875, - "grad_norm": 0.02566305734217167, + "grad_norm": 0.0015342400874942541, "learning_rate": 2.0861984815011552e-05, - "loss": 0.00022389904188457876, + "loss": 3.621872019721195e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00022, + "ppl": 1.00004, "step": 403, "tokens/total": 12196544, - "tokens/train_per_sec_per_gpu": 30.39, + "tokens/train_per_sec_per_gpu": 30.36, "tokens/trainable": 184348 }, { "epoch": 1.578125, - "grad_norm": 0.008275284431874752, + "grad_norm": 0.0035214691888540983, "learning_rate": 2.0673563101354323e-05, - "loss": 8.35009923321195e-05, + "loss": 6.367819150909781e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00006, "step": 404, "tokens/total": 12226784, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 184786 }, { "epoch": 1.58203125, - "grad_norm": 0.038177311420440674, + "grad_norm": 0.0007211520569398999, "learning_rate": 2.0486569850851317e-05, - "loss": 0.00018527230713516474, + "loss": 2.0325338482507505e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00019, + "ppl": 1.00002, "step": 405, "tokens/total": 12257264, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 185249 }, { "epoch": 1.5859375, - "grad_norm": 0.007672510575503111, + "grad_norm": 0.0014804014936089516, "learning_rate": 2.0301012845054956e-05, - "loss": 0.00011439670925028622, + "loss": 3.379736153874546e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00003, "step": 406, "tokens/total": 12287584, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 185680 }, { "epoch": 1.58984375, - "grad_norm": 0.003159885760396719, + "grad_norm": 0.004397980403155088, "learning_rate": 2.011689980574966e-05, - "loss": 4.649449692806229e-05, + "loss": 5.1796458137687296e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00005, "step": 407, "tokens/total": 12317984, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 186100 }, { "epoch": 1.59375, - "grad_norm": 0.32744285464286804, + "grad_norm": 0.0026473007164895535, "learning_rate": 1.993423839463052e-05, - "loss": 0.002739987801760435, + "loss": 3.441090666456148e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00274, + "ppl": 1.00003, "step": 408, "tokens/total": 12348144, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.84, "tokens/trainable": 186565 }, { "epoch": 1.59765625, - "grad_norm": 0.0006675662589259446, + "grad_norm": 0.0289909727871418, "learning_rate": 1.975303621298445e-05, - "loss": 1.2970660463906825e-05, + "loss": 0.00021602815832011402, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00022, "step": 409, "tokens/total": 12378544, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 187017 }, { "epoch": 1.6015625, - "grad_norm": 0.003976705949753523, + "grad_norm": 0.007092812564224005, "learning_rate": 1.957330080137385e-05, - "loss": 3.857718547806144e-05, + "loss": 9.646185935707763e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.0001, "step": 410, "tokens/total": 12408784, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 187468 }, { "epoch": 1.60546875, - "grad_norm": 0.0024577646981924772, + "grad_norm": 0.02710823155939579, "learning_rate": 1.9395039639322864e-05, - "loss": 2.431379834888503e-05, + "loss": 0.0003458422143012285, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00035, "step": 411, "tokens/total": 12438832, - "tokens/train_per_sec_per_gpu": 37.61, + "tokens/train_per_sec_per_gpu": 37.57, "tokens/trainable": 187961 }, { "epoch": 1.609375, - "grad_norm": 0.003754909848794341, + "grad_norm": 0.29485711455345154, "learning_rate": 1.9218260145006073e-05, - "loss": 4.119630830246024e-05, + "loss": 0.0032923028338700533, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.0033, "step": 412, "tokens/total": 12469296, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 188447 }, { "epoch": 1.61328125, - "grad_norm": 0.3583323657512665, + "grad_norm": 0.22881586849689484, "learning_rate": 1.904296967493982e-05, - "loss": 0.004735157359391451, + "loss": 0.0035809341352432966, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00475, + "ppl": 1.00359, "step": 413, "tokens/total": 12499392, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 188903 }, { "epoch": 1.6171875, - "grad_norm": 0.049485232681035995, + "grad_norm": 0.0026347371749579906, "learning_rate": 1.8869175523676064e-05, - "loss": 0.00019404500199016184, + "loss": 6.0475373174995184e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.00006, "step": 414, "tokens/total": 12529952, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 189398 }, { "epoch": 1.62109375, - "grad_norm": 0.0030447980388998985, + "grad_norm": 0.0017223359318450093, "learning_rate": 1.869688492349885e-05, - "loss": 2.0038012735312805e-05, + "loss": 4.137849100516178e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00004, "step": 415, "tokens/total": 12560240, "tokens/train_per_sec_per_gpu": 34.16, @@ -5821,293 +5821,293 @@ }, { "epoch": 1.625, - "grad_norm": 0.25415608286857605, + "grad_norm": 0.011837545782327652, "learning_rate": 1.85261050441233e-05, - "loss": 0.0016201161779463291, + "loss": 0.00011106643069069833, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00162, + "ppl": 1.00011, "step": 416, "tokens/total": 12590736, - "tokens/train_per_sec_per_gpu": 32.64, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 190306 }, { "epoch": 1.62890625, - "grad_norm": 0.006711115129292011, + "grad_norm": 0.01777251996099949, "learning_rate": 1.8356842992397304e-05, - "loss": 4.321872620494105e-05, + "loss": 0.0001219596597366035, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00004, + "ppl": 1.00012, "step": 417, "tokens/total": 12621168, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 190746 }, { "epoch": 1.6328125, - "grad_norm": 0.004931971430778503, + "grad_norm": 0.003218573285266757, "learning_rate": 1.8189105812005714e-05, - "loss": 4.740363510791212e-05, + "loss": 5.22282425663434e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, "ppl": 1.00005, "step": 418, "tokens/total": 12651456, - "tokens/train_per_sec_per_gpu": 31.07, + "tokens/train_per_sec_per_gpu": 31.15, "tokens/trainable": 191156 }, { "epoch": 1.63671875, - "grad_norm": 0.007677357643842697, + "grad_norm": 0.013744015246629715, "learning_rate": 1.802290048317732e-05, - "loss": 7.545409607701004e-05, + "loss": 0.0001364837517030537, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00014, "step": 419, "tokens/total": 12681760, - "tokens/train_per_sec_per_gpu": 29.47, + "tokens/train_per_sec_per_gpu": 29.53, "tokens/trainable": 191573 }, { "epoch": 1.640625, - "grad_norm": 0.015445503406226635, + "grad_norm": 0.25013473629951477, "learning_rate": 1.785823392239424e-05, - "loss": 0.0001045453900587745, + "loss": 0.002094803610816598, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0001, + "ppl": 1.0021, "step": 420, "tokens/total": 12712144, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 192014 }, { "epoch": 1.64453125, - "grad_norm": 0.16882061958312988, + "grad_norm": 0.14290185272693634, "learning_rate": 1.7695112982104225e-05, - "loss": 0.0024146074429154396, + "loss": 0.001426510512828827, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00242, + "ppl": 1.00143, "step": 421, "tokens/total": 12742400, - "tokens/train_per_sec_per_gpu": 32.82, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 192453 }, { "epoch": 1.6484375, - "grad_norm": 0.002461223630234599, + "grad_norm": 0.0009390547638759017, "learning_rate": 1.7533544450435433e-05, - "loss": 3.336594454594888e-05, + "loss": 1.822916055971291e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00002, "step": 422, "tokens/total": 12772288, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 192886 }, { "epoch": 1.65234375, - "grad_norm": 0.0005388484569266438, + "grad_norm": 0.004544281866401434, "learning_rate": 1.7373535050913946e-05, - "loss": 8.696397344465367e-06, + "loss": 6.211431173142046e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00001, + "ppl": 1.00006, "step": 423, "tokens/total": 12802880, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.87, "tokens/trainable": 193323 }, { "epoch": 1.65625, - "grad_norm": 0.005009706597775221, + "grad_norm": 0.039859045296907425, "learning_rate": 1.721509144218405e-05, - "loss": 4.8607362259645015e-05, + "loss": 0.0005113891093060374, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00051, "step": 424, "tokens/total": 12833456, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 193753 }, { "epoch": 1.66015625, - "grad_norm": 0.001982118235900998, + "grad_norm": 0.00408409908413887, "learning_rate": 1.705822021773101e-05, - "loss": 3.262238169554621e-05, + "loss": 7.249199552461505e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00007, "step": 425, "tokens/total": 12863952, - "tokens/train_per_sec_per_gpu": 36.33, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 194240 }, { "epoch": 1.6640625, - "grad_norm": 0.05305991321802139, + "grad_norm": 0.13116440176963806, "learning_rate": 1.69029279056068e-05, - "loss": 0.0005229170201346278, + "loss": 0.0015061571029946208, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00052, + "ppl": 1.00151, "step": 426, "tokens/total": 12894352, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 194680 }, { "epoch": 1.66796875, - "grad_norm": 0.001265498693101108, + "grad_norm": 0.010440024547278881, "learning_rate": 1.6749220968158415e-05, - "loss": 1.5427456673933193e-05, + "loss": 8.445358253084123e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00008, "step": 427, "tokens/total": 12924688, - "tokens/train_per_sec_per_gpu": 38.73, + "tokens/train_per_sec_per_gpu": 38.77, "tokens/trainable": 195186 }, { "epoch": 1.671875, - "grad_norm": 0.0016263640718534589, + "grad_norm": 0.007594608701765537, "learning_rate": 1.659710580175893e-05, - "loss": 2.7778178264270537e-05, + "loss": 9.946282807504758e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.0001, "step": 428, "tokens/total": 12955072, - "tokens/train_per_sec_per_gpu": 36.51, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 195693 }, { "epoch": 1.67578125, - "grad_norm": 0.013330154120922089, + "grad_norm": 0.006465950049459934, "learning_rate": 1.644658873654133e-05, - "loss": 6.972272240091115e-05, + "loss": 0.00013557568308897316, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00007, + "ppl": 1.00014, "step": 429, "tokens/total": 12985328, - "tokens/train_per_sec_per_gpu": 36.93, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 196130 }, { "epoch": 1.6796875, - "grad_norm": 0.0034615101758390665, + "grad_norm": 0.00230405549518764, "learning_rate": 1.629767603613508e-05, - "loss": 4.500148497754708e-05, + "loss": 3.7114587030373514e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00005, + "ppl": 1.00004, "step": 430, "tokens/total": 13015600, - "tokens/train_per_sec_per_gpu": 29.58, + "tokens/train_per_sec_per_gpu": 29.53, "tokens/trainable": 196530 }, { "epoch": 1.68359375, - "grad_norm": 0.03424045443534851, + "grad_norm": 0.0041900877840816975, "learning_rate": 1.615037389740547e-05, - "loss": 0.0002949235204141587, + "loss": 6.116987788118422e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00029, + "ppl": 1.00006, "step": 431, "tokens/total": 13045728, - "tokens/train_per_sec_per_gpu": 29.88, + "tokens/train_per_sec_per_gpu": 29.94, "tokens/trainable": 196974 }, { "epoch": 1.6875, - "grad_norm": 0.0064499350264668465, + "grad_norm": 0.02951621450483799, "learning_rate": 1.600468845019576e-05, - "loss": 7.787663344061002e-05, + "loss": 0.0004236411186866462, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00008, + "ppl": 1.00042, "step": 432, "tokens/total": 13075920, - "tokens/train_per_sec_per_gpu": 35.25, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 197454 }, { "epoch": 1.69140625, - "grad_norm": 0.00021908426424488425, + "grad_norm": 0.0003202867810614407, "learning_rate": 1.5860625757072092e-05, - "loss": 6.603059773624409e-06, + "loss": 1.1190046279807575e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00001, "step": 433, "tokens/total": 13106128, - "tokens/train_per_sec_per_gpu": 31.4, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 197902 }, { "epoch": 1.6953125, - "grad_norm": 0.0002612156968098134, + "grad_norm": 0.0006868013297207654, "learning_rate": 1.571819181307116e-05, - "loss": 6.425582796509843e-06, + "loss": 2.1185776859056205e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00001, + "ppl": 1.00002, "step": 434, "tokens/total": 13136368, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.06, "tokens/trainable": 198374 }, { "epoch": 1.69921875, - "grad_norm": 0.001639618189074099, + "grad_norm": 0.0025407401844859123, "learning_rate": 1.557739254545075e-05, - "loss": 2.5485322112217546e-05, + "loss": 4.928320413455367e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00003, + "ppl": 1.00005, "step": 435, "tokens/total": 13166704, - "tokens/train_per_sec_per_gpu": 37.54, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 198846 }, { "epoch": 1.703125, - "grad_norm": 0.01887959986925125, + "grad_norm": 0.0013901089550927281, "learning_rate": 1.543823381344311e-05, - "loss": 0.0002141120348824188, + "loss": 3.577578900149092e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00021, + "ppl": 1.00004, "step": 436, "tokens/total": 13197344, "tokens/train_per_sec_per_gpu": 37.67, @@ -6115,41 +6115,41 @@ }, { "epoch": 1.70703125, - "grad_norm": 0.0012294527841731906, + "grad_norm": 0.003646081080660224, "learning_rate": 1.5300721408011114e-05, - "loss": 2.316079735464882e-05, + "loss": 6.294051127042621e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00006, "step": 437, "tokens/total": 13227664, - "tokens/train_per_sec_per_gpu": 37.43, + "tokens/train_per_sec_per_gpu": 37.46, "tokens/trainable": 199777 }, { "epoch": 1.7109375, - "grad_norm": 0.005585651844739914, + "grad_norm": 0.030430182814598083, "learning_rate": 1.5164861051607254e-05, - "loss": 4.5935248635942116e-05, + "loss": 0.0001770013477653265, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00018, "step": 438, "tokens/total": 13257632, - "tokens/train_per_sec_per_gpu": 30.82, + "tokens/train_per_sec_per_gpu": 30.93, "tokens/trainable": 200194 }, { "epoch": 1.71484375, - "grad_norm": 0.001553745474666357, + "grad_norm": 0.0018230377463623881, "learning_rate": 1.5030658397935521e-05, - "loss": 2.2851421817904338e-05, + "loss": 3.7613608583342284e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00002, + "ppl": 1.00004, "step": 439, "tokens/total": 13288240, "tokens/train_per_sec_per_gpu": 33.88, @@ -6157,559 +6157,559 @@ }, { "epoch": 1.71875, - "grad_norm": 0.0029791900888085365, + "grad_norm": 0.0029376039747148752, "learning_rate": 1.4898119031716104e-05, - "loss": 4.093274037586525e-05, + "loss": 4.779352093464695e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00005, "step": 440, "tokens/total": 13318992, - "tokens/train_per_sec_per_gpu": 33.79, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 201121 }, { "epoch": 1.72265625, - "grad_norm": 0.0017392379231750965, + "grad_norm": 0.0018373411148786545, "learning_rate": 1.476724846845306e-05, - "loss": 7.29740804672474e-06, + "loss": 3.149824624415487e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00003, "step": 441, "tokens/total": 13349392, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.81, "tokens/trainable": 201598 }, { "epoch": 1.7265625, - "grad_norm": 0.0009943305049091578, + "grad_norm": 0.0015428521437570453, "learning_rate": 1.463805215420471e-05, - "loss": 1.7162077710963786e-05, + "loss": 2.0810390196857043e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 442, "tokens/total": 13379648, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 202068 }, { "epoch": 1.73046875, - "grad_norm": 0.0011473585618659854, + "grad_norm": 0.0010770867811515927, "learning_rate": 1.451053546535705e-05, - "loss": 2.3819740817998536e-05, + "loss": 2.303836117789615e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 443, "tokens/total": 13409936, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 202524 }, { "epoch": 1.734375, - "grad_norm": 0.006799118127673864, + "grad_norm": 0.006372133269906044, "learning_rate": 1.438470370840001e-05, - "loss": 6.556943117175251e-05, + "loss": 7.449327677022666e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, "ppl": 1.00007, "step": 444, "tokens/total": 13440288, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 202996 }, { "epoch": 1.73828125, - "grad_norm": 0.0011645558988675475, + "grad_norm": 0.007094603031873703, "learning_rate": 1.4260562119706606e-05, - "loss": 1.8389995602774434e-05, + "loss": 4.211071063764393e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00004, "step": 445, "tokens/total": 13468880, - "tokens/train_per_sec_per_gpu": 39.14, + "tokens/train_per_sec_per_gpu": 39.19, "tokens/trainable": 203470 }, { "epoch": 1.7421875, - "grad_norm": 0.020891210064291954, + "grad_norm": 0.006931444630026817, "learning_rate": 1.413811586531508e-05, - "loss": 0.00016399261949118227, + "loss": 8.66219779709354e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00016, + "ppl": 1.00009, "step": 446, "tokens/total": 13499184, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 203919 }, { "epoch": 1.74609375, - "grad_norm": 0.09615519642829895, + "grad_norm": 0.0041664596647024155, "learning_rate": 1.4017370040713884e-05, - "loss": 0.0010675137164071202, + "loss": 4.786982390214689e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00107, + "ppl": 1.00005, "step": 447, "tokens/total": 13529632, - "tokens/train_per_sec_per_gpu": 33.3, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 204376 }, { "epoch": 1.75, - "grad_norm": 0.09744399785995483, + "grad_norm": 0.042264848947525024, "learning_rate": 1.3898329670629645e-05, - "loss": 0.001196134602651, + "loss": 0.00027092613163404167, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0012, + "ppl": 1.00027, "step": 448, "tokens/total": 13560080, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 204821 }, { "epoch": 1.75390625, - "grad_norm": 0.0007810555398464203, + "grad_norm": 0.00043735766666941345, "learning_rate": 1.3780999708818058e-05, - "loss": 8.019956112548243e-06, + "loss": 1.2837479516747408e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, "ppl": 1.00001, "step": 449, "tokens/total": 13590496, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 205271 }, { "epoch": 1.7578125, - "grad_norm": 0.034087613224983215, + "grad_norm": 0.0012977999867871404, "learning_rate": 1.3665385037857758e-05, - "loss": 0.00010244422446703538, + "loss": 2.1102820028318092e-05, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0001, + "ppl": 1.00002, "step": 450, "tokens/total": 13620960, - "tokens/train_per_sec_per_gpu": 30.95, + "tokens/train_per_sec_per_gpu": 30.92, "tokens/trainable": 205723 }, { "epoch": 1.76171875, - "grad_norm": 0.02930639684200287, + "grad_norm": 0.005675352178514004, "learning_rate": 1.3551490468947126e-05, - "loss": 0.00021926099725533277, + "loss": 7.465962698915973e-05, "memory/device_reserved (GiB)": 35.04, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00022, + "ppl": 1.00007, "step": 451, "tokens/total": 13651344, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.48, "tokens/trainable": 206169 }, { "epoch": 1.765625, - "grad_norm": 0.0109552051872015, + "grad_norm": 0.0013997588539496064, "learning_rate": 1.3439320741704075e-05, - "loss": 7.999646186362952e-05, + "loss": 2.723011130001396e-05, "memory/device_reserved (GiB)": 35.04, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00003, "step": 452, "tokens/total": 13681792, - "tokens/train_per_sec_per_gpu": 32.74, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 206592 }, { "epoch": 1.76953125, - "grad_norm": 0.004453443922102451, + "grad_norm": 0.012491011992096901, "learning_rate": 1.3328880523968808e-05, - "loss": 3.79011980840005e-05, + "loss": 9.182744543068111e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00009, "step": 453, "tokens/total": 13712256, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.07, "tokens/trainable": 207055 }, { "epoch": 1.7734375, - "grad_norm": 0.0005650459788739681, + "grad_norm": 0.000924609019421041, "learning_rate": 1.3220174411609587e-05, - "loss": 1.2244867320987396e-05, + "loss": 2.1621295672957785e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00001, + "ppl": 1.00002, "step": 454, "tokens/total": 13742128, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.61, "tokens/trainable": 207494 }, { "epoch": 1.77734375, - "grad_norm": 0.0007141040405258536, + "grad_norm": 0.000411411514505744, "learning_rate": 1.3113206928331471e-05, - "loss": 1.3571594536188059e-05, + "loss": 1.2427874025888741e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00001, "step": 455, "tokens/total": 13772160, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.03, "tokens/trainable": 207956 }, { "epoch": 1.78125, - "grad_norm": 0.0008097058744169772, + "grad_norm": 0.0015909038484096527, "learning_rate": 1.300798252548806e-05, - "loss": 1.1659047231660224e-05, + "loss": 3.0332066671689972e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 456, "tokens/total": 13802448, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.42, "tokens/trainable": 208408 }, { "epoch": 1.78515625, - "grad_norm": 0.0012649539858102798, + "grad_norm": 0.0030019236728549004, "learning_rate": 1.2904505581896265e-05, - "loss": 9.200517524732277e-06, + "loss": 3.378765541128814e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00003, "step": 457, "tokens/total": 13832880, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 208889 }, { "epoch": 1.7890625, - "grad_norm": 0.014978500083088875, + "grad_norm": 0.0016427476657554507, "learning_rate": 1.2802780403654082e-05, - "loss": 0.0001208957692142576, + "loss": 3.3130341762444004e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00012, + "ppl": 1.00003, "step": 458, "tokens/total": 13862880, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 209336 }, { "epoch": 1.79296875, - "grad_norm": 0.004875013139098883, + "grad_norm": 0.0006426559993997216, "learning_rate": 1.2702811223961408e-05, - "loss": 3.241455851821229e-05, + "loss": 1.784306368790567e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00002, "step": 459, "tokens/total": 13893440, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.21, "tokens/trainable": 209797 }, { "epoch": 1.796875, - "grad_norm": 0.0009627968538552523, + "grad_norm": 0.0016685863956809044, "learning_rate": 1.2604602202943861e-05, - "loss": 1.980438355531078e-05, + "loss": 3.2843898225110024e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00003, "step": 460, "tokens/total": 13923824, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.03, "tokens/trainable": 210240 }, { "epoch": 1.80078125, - "grad_norm": 0.019912317395210266, + "grad_norm": 0.03454679995775223, "learning_rate": 1.2508157427479686e-05, - "loss": 0.00010681153071345761, + "loss": 7.200831169029698e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00011, + "ppl": 1.00007, "step": 461, "tokens/total": 13954208, - "tokens/train_per_sec_per_gpu": 34.91, + "tokens/train_per_sec_per_gpu": 34.9, "tokens/trainable": 210702 }, { "epoch": 1.8046875, - "grad_norm": 0.0005370390135794878, + "grad_norm": 0.0021488473284989595, "learning_rate": 1.2413480911029655e-05, - "loss": 1.1081473530794028e-05, + "loss": 3.525309875840321e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00004, "step": 462, "tokens/total": 13984784, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.44, "tokens/trainable": 211140 }, { "epoch": 1.80859375, - "grad_norm": 0.000815370527561754, + "grad_norm": 0.0007275328389368951, "learning_rate": 1.2320576593470082e-05, - "loss": 1.5510300727328286e-05, + "loss": 1.328821963397786e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00002, + "ppl": 1.00001, "step": 463, "tokens/total": 14014896, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.54, "tokens/trainable": 211575 }, { "epoch": 1.8125, - "grad_norm": 0.02875823900103569, + "grad_norm": 0.03173735365271568, "learning_rate": 1.2229448340928828e-05, - "loss": 0.00013141569797880948, + "loss": 0.00014542456483468413, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00013, + "ppl": 1.00015, "step": 464, "tokens/total": 14045312, - "tokens/train_per_sec_per_gpu": 39.03, + "tokens/train_per_sec_per_gpu": 38.86, "tokens/trainable": 212083 }, { "epoch": 1.81640625, - "grad_norm": 0.04558868706226349, + "grad_norm": 0.0005439479718916118, "learning_rate": 1.2140099945624458e-05, - "loss": 0.0002969688503071666, + "loss": 1.4493984053842723e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0003, + "ppl": 1.00001, "step": 465, "tokens/total": 14075840, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 212558 }, { "epoch": 1.8203125, - "grad_norm": 0.0004122587270103395, + "grad_norm": 0.0015477532288059592, "learning_rate": 1.205253512570841e-05, - "loss": 9.937594768416602e-06, + "loss": 2.787737685139291e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 466, "tokens/total": 14106016, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.73, "tokens/trainable": 213014 }, { "epoch": 1.82421875, - "grad_norm": 0.0010108116548508406, + "grad_norm": 0.0007428264361806214, "learning_rate": 1.1966757525110255e-05, - "loss": 1.5579567843815312e-05, + "loss": 2.1110219677211717e-05, "memory/device_reserved (GiB)": 37.99, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, "ppl": 1.00002, "step": 467, "tokens/total": 14136512, - "tokens/train_per_sec_per_gpu": 34.03, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 213465 }, { "epoch": 1.828125, - "grad_norm": 0.0043095871806144714, + "grad_norm": 0.002182955853641033, "learning_rate": 1.1882770713386095e-05, - "loss": 3.2609641493763775e-05, + "loss": 4.059498314745724e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00004, "step": 468, "tokens/total": 14166832, - "tokens/train_per_sec_per_gpu": 36.62, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 213940 }, { "epoch": 1.83203125, - "grad_norm": 0.005317045841366053, + "grad_norm": 0.004772448446601629, "learning_rate": 1.180057818556998e-05, - "loss": 2.144884638255462e-05, + "loss": 3.664854375529103e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00004, "step": 469, "tokens/total": 14197360, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 34.97, "tokens/trainable": 214415 }, { "epoch": 1.8359375, - "grad_norm": 0.0003264908737037331, + "grad_norm": 0.00038694078102707863, "learning_rate": 1.1720183362028494e-05, - "loss": 5.6935500651889015e-06, + "loss": 1.1124819138785824e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, "ppl": 1.00001, "step": 470, "tokens/total": 14227600, - "tokens/train_per_sec_per_gpu": 34.26, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 214880 }, { "epoch": 1.83984375, - "grad_norm": 0.013723314739763737, + "grad_norm": 0.0008439846569672227, "learning_rate": 1.1641589588318387e-05, - "loss": 0.00010619591921567917, + "loss": 2.0906983991153538e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00011, + "ppl": 1.00002, "step": 471, "tokens/total": 14257888, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 215334 }, { "epoch": 1.84375, - "grad_norm": 0.00020912640320602804, + "grad_norm": 0.0005926606827415526, "learning_rate": 1.1564800135047418e-05, - "loss": 4.586940121953376e-06, + "loss": 1.178990351036191e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0, + "ppl": 1.00001, "step": 472, "tokens/total": 14288208, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 215822 }, { "epoch": 1.84765625, - "grad_norm": 0.10667876899242401, + "grad_norm": 0.003897819435223937, "learning_rate": 1.148981819773816e-05, - "loss": 0.0006915333215147257, + "loss": 5.020621756557375e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.00005, "step": 473, "tokens/total": 14318448, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 30.82, "tokens/trainable": 216239 }, { "epoch": 1.8515625, - "grad_norm": 0.013282700441777706, + "grad_norm": 0.0013807902578264475, "learning_rate": 1.1416646896695086e-05, - "loss": 6.861680594738573e-05, + "loss": 2.2795318727730773e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00007, + "ppl": 1.00002, "step": 474, "tokens/total": 14348912, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.35, "tokens/trainable": 216691 }, { "epoch": 1.85546875, - "grad_norm": 0.0074070473201572895, + "grad_norm": 0.00048289448022842407, "learning_rate": 1.1345289276874717e-05, - "loss": 8.334079757332802e-05, + "loss": 1.4630711120844353e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00008, + "ppl": 1.00001, "step": 475, "tokens/total": 14379440, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 217162 }, { "epoch": 1.859375, - "grad_norm": 0.0017771078273653984, + "grad_norm": 0.0004491541185416281, "learning_rate": 1.1275748307758873e-05, - "loss": 1.803937993827276e-05, + "loss": 1.4460356396739371e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00001, "step": 476, "tokens/total": 14409840, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.88, "tokens/trainable": 217638 }, { "epoch": 1.86328125, - "grad_norm": 0.00044826362864114344, + "grad_norm": 0.0024057701230049133, "learning_rate": 1.1208026883231147e-05, - "loss": 9.577534910931718e-06, + "loss": 4.9342866986989975e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00005, "step": 477, "tokens/total": 14440256, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 218053 }, { "epoch": 1.8671875, - "grad_norm": 0.0009560272446833551, + "grad_norm": 0.0008485029684379697, "learning_rate": 1.1142127821456433e-05, - "loss": 1.0945323083433323e-05, + "loss": 2.05296601052396e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00002, "step": 478, "tokens/total": 14470704, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 218503 }, { "epoch": 1.87109375, - "grad_norm": 0.2086740881204605, + "grad_norm": 0.011945155449211597, "learning_rate": 1.1078053864763674e-05, - "loss": 0.0012299084337428212, + "loss": 8.75981932040304e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00123, + "ppl": 1.00009, "step": 479, "tokens/total": 14501072, "tokens/train_per_sec_per_gpu": 36.19, @@ -6717,13 +6717,13 @@ }, { "epoch": 1.875, - "grad_norm": 0.019221138209104538, + "grad_norm": 0.004776590969413519, "learning_rate": 1.1015807679531756e-05, - "loss": 0.00011615331459324807, + "loss": 7.07923318259418e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00012, + "ppl": 1.00007, "step": 480, "tokens/total": 14531200, "tokens/train_per_sec_per_gpu": 35.51, diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_model.safetensors index ea3cea0a354d5b9ee2785a0c48f7ebf1c6877a9d..39b53dcd92648efb307c35556c5bb95fa36cebce 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:16cc65acfba87debf950e49fc05f5dce80ea16745d793c826ed96faac31a47a1 +oid sha256:daeafd5d686b4b39c5b3dd656eca36514ea93ef225c5afab298c74bbfab4b632 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/optimizer.pt index 5528e895609544bbcb34ba418d72923cff27a19b..9244c05de713bc8bc639710777cf556fe75699b1 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:fe1efd539e57db6375dbfc409cf1e2a434b05b88c1f3bd7e58c16a8d2075a365 +oid sha256:05bb512f0593d6339b6dd5bd7fd23b00fbb5ccbe33fcfaa642269827ce75bdc6 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/trainer_state.json index 2499b3b7e698733d7ad57d04aa419bb5db763c37..dd12f510a42892888ddf9cc0585226435f8e071d 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-512/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,1007 +935,1007 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 }, { "epoch": 0.37890625, - "grad_norm": 0.313085675239563, + "grad_norm": 0.5578822493553162, "learning_rate": 9.53619478457953e-05, - "loss": 0.007852522656321526, + "loss": 0.014485684223473072, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00788, + "ppl": 1.01459, "step": 97, "tokens/total": 2932272, - "tokens/train_per_sec_per_gpu": 31.89, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 44328 }, { "epoch": 0.3828125, - "grad_norm": 0.08544483780860901, + "grad_norm": 0.10520734637975693, "learning_rate": 9.523275153154695e-05, - "loss": 0.0025753644295036793, + "loss": 0.0021552909165620804, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00258, + "ppl": 1.00216, "step": 98, "tokens/total": 2962032, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 30.95, "tokens/trainable": 44778 }, { "epoch": 0.38671875, - "grad_norm": 0.6496388912200928, + "grad_norm": 0.7544558644294739, "learning_rate": 9.51018809682839e-05, - "loss": 0.02547256276011467, + "loss": 0.01703210547566414, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0258, + "ppl": 1.01718, "step": 99, "tokens/total": 2992256, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.12, "tokens/trainable": 45225 }, { "epoch": 0.390625, - "grad_norm": 0.15325438976287842, + "grad_norm": 0.3857012689113617, "learning_rate": 9.49693416020645e-05, - "loss": 0.003552855923771858, + "loss": 0.00604570098221302, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00356, + "ppl": 1.00606, "step": 100, "tokens/total": 3022608, - "tokens/train_per_sec_per_gpu": 35.8, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 45678 }, { "epoch": 0.39453125, - "grad_norm": 0.25307565927505493, + "grad_norm": 0.21589453518390656, "learning_rate": 9.483513894839276e-05, - "loss": 0.004095804411917925, + "loss": 0.005753816105425358, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0041, + "ppl": 1.00577, "step": 101, "tokens/total": 3052992, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 46125 }, { "epoch": 0.3984375, - "grad_norm": 0.150072380900383, + "grad_norm": 1.1246687173843384, "learning_rate": 9.469927859198888e-05, - "loss": 0.0013888315297663212, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.006994037888944149, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00139, + "ppl": 1.00702, "step": 102, "tokens/total": 3083392, - "tokens/train_per_sec_per_gpu": 39.71, + "tokens/train_per_sec_per_gpu": 39.6, "tokens/trainable": 46612 }, { "epoch": 0.40234375, - "grad_norm": 0.5769571661949158, + "grad_norm": 0.267713725566864, "learning_rate": 9.456176618655689e-05, - "loss": 0.022533349692821503, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.013721915893256664, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02279, + "ppl": 1.01382, "step": 103, "tokens/total": 3113744, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.41, "tokens/trainable": 47059 }, { "epoch": 0.40625, - "grad_norm": 0.5657027959823608, + "grad_norm": 0.325897753238678, "learning_rate": 9.442260745454927e-05, - "loss": 0.016894506290555, - "memory/device_reserved (GiB)": 35.79, + "loss": 0.012948594987392426, + "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.01704, + "ppl": 1.01303, "step": 104, "tokens/total": 3144272, - "tokens/train_per_sec_per_gpu": 34.05, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 47536 }, { "epoch": 0.41015625, - "grad_norm": 0.29607170820236206, + "grad_norm": 0.531863808631897, "learning_rate": 9.428180818692884e-05, - "loss": 0.017974723130464554, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.02244492992758751, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01814, + "ppl": 1.0227, "step": 105, "tokens/total": 3174512, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 48037 }, { "epoch": 0.4140625, - "grad_norm": 0.5241922736167908, + "grad_norm": 0.3957497775554657, "learning_rate": 9.413937424292791e-05, - "loss": 0.016189826652407646, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.015801995992660522, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01632, + "ppl": 1.01593, "step": 106, "tokens/total": 3204896, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 48491 }, { "epoch": 0.41796875, - "grad_norm": 0.3886408805847168, + "grad_norm": 0.4241825044155121, "learning_rate": 9.399531154980424e-05, - "loss": 0.010908558964729309, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.016320914030075073, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.01097, + "ppl": 1.01645, "step": 107, "tokens/total": 3235360, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 48940 }, { "epoch": 0.421875, - "grad_norm": 0.2442784607410431, + "grad_norm": 0.32064536213874817, "learning_rate": 9.384962610259455e-05, - "loss": 0.008070861920714378, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.010785036720335484, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0081, + "ppl": 1.01084, "step": 108, "tokens/total": 3265552, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 49389 }, { "epoch": 0.42578125, - "grad_norm": 0.1457175612449646, + "grad_norm": 0.17215749621391296, "learning_rate": 9.370232396386494e-05, - "loss": 0.003785747569054365, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.00814715214073658, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00379, + "ppl": 1.00818, "step": 109, "tokens/total": 3293856, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 49838 }, { "epoch": 0.4296875, - "grad_norm": 0.3955559730529785, + "grad_norm": 0.38179653882980347, "learning_rate": 9.355341126345868e-05, - "loss": 0.0069918157532811165, - "memory/device_reserved (GiB)": 37.61, + "loss": 0.012128787115216255, + "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00702, + "ppl": 1.0122, "step": 110, "tokens/total": 3323984, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 50310 }, { "epoch": 0.43359375, - "grad_norm": 0.6224751472473145, + "grad_norm": 0.49835413694381714, "learning_rate": 9.340289419824107e-05, - "loss": 0.014852076768875122, + "loss": 0.015248995274305344, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01496, + "ppl": 1.01537, "step": 111, "tokens/total": 3354320, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 50755 }, { "epoch": 0.4375, - "grad_norm": 0.3700723648071289, + "grad_norm": 0.43904298543930054, "learning_rate": 9.325077903184159e-05, - "loss": 0.00436755083501339, + "loss": 0.011272929608821869, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00438, + "ppl": 1.01134, "step": 112, "tokens/total": 3384880, - "tokens/train_per_sec_per_gpu": 31.65, + "tokens/train_per_sec_per_gpu": 31.5, "tokens/trainable": 51213 }, { "epoch": 0.44140625, - "grad_norm": 0.1353236883878708, + "grad_norm": 0.5670213103294373, "learning_rate": 9.30970720943932e-05, - "loss": 0.0025976570323109627, + "loss": 0.0028921598568558693, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0026, + "ppl": 1.0029, "step": 113, "tokens/total": 3415104, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 51660 }, { "epoch": 0.4453125, - "grad_norm": 0.18984447419643402, + "grad_norm": 0.159476637840271, "learning_rate": 9.2941779782269e-05, - "loss": 0.002497302368283272, + "loss": 0.0025574099272489548, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0025, + "ppl": 1.00256, "step": 114, "tokens/total": 3445504, - "tokens/train_per_sec_per_gpu": 32.43, + "tokens/train_per_sec_per_gpu": 32.34, "tokens/trainable": 52133 }, { "epoch": 0.44921875, - "grad_norm": 1.1815483570098877, + "grad_norm": 0.795085608959198, "learning_rate": 9.278490855781596e-05, - "loss": 0.029489168897271156, + "loss": 0.024456799030303955, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02993, + "ppl": 1.02476, "step": 115, "tokens/total": 3475744, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.25, "tokens/trainable": 52580 }, { "epoch": 0.453125, - "grad_norm": 0.44360846281051636, + "grad_norm": 0.38324710726737976, "learning_rate": 9.262646494908604e-05, - "loss": 0.009585533291101456, + "loss": 0.004516632296144962, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00963, + "ppl": 1.00453, "step": 116, "tokens/total": 3506016, - "tokens/train_per_sec_per_gpu": 34.83, + "tokens/train_per_sec_per_gpu": 34.74, "tokens/trainable": 53033 }, { "epoch": 0.45703125, - "grad_norm": 0.5074551701545715, + "grad_norm": 0.3037130534648895, "learning_rate": 9.246645554956457e-05, - "loss": 0.020201388746500015, + "loss": 0.021973589435219765, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.02041, + "ppl": 1.02222, "step": 117, "tokens/total": 3536256, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.22, "tokens/trainable": 53517 }, { "epoch": 0.4609375, - "grad_norm": 0.3565296232700348, + "grad_norm": 1.3904820680618286, "learning_rate": 9.230488701789578e-05, - "loss": 0.005688562989234924, + "loss": 0.009210974909365177, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0057, + "ppl": 1.00925, "step": 118, "tokens/total": 3566480, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 53967 }, { "epoch": 0.46484375, - "grad_norm": 0.16547706723213196, + "grad_norm": 0.1571500301361084, "learning_rate": 9.214176607760577e-05, - "loss": 0.003188834059983492, + "loss": 0.0021451227366924286, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00319, + "ppl": 1.00215, "step": 119, "tokens/total": 3596624, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 54430 }, { "epoch": 0.46875, - "grad_norm": 0.20722293853759766, + "grad_norm": 0.39999091625213623, "learning_rate": 9.197709951682268e-05, - "loss": 0.003235103562474251, + "loss": 0.00788091216236353, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00324, + "ppl": 1.00791, "step": 120, "tokens/total": 3627168, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 54896 }, { "epoch": 0.47265625, - "grad_norm": 0.4754939377307892, + "grad_norm": 0.38124287128448486, "learning_rate": 9.181089418799428e-05, - "loss": 0.005670893006026745, + "loss": 0.010133227333426476, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00569, + "ppl": 1.01018, "step": 121, "tokens/total": 3657632, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 55379 }, { "epoch": 0.4765625, - "grad_norm": 0.08304762095212936, + "grad_norm": 0.0512852780520916, "learning_rate": 9.164315700760271e-05, - "loss": 0.00099027412943542, + "loss": 0.0007940311916172504, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00099, + "ppl": 1.00079, "step": 122, "tokens/total": 3687824, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 55803 }, { "epoch": 0.48046875, - "grad_norm": 0.725281298160553, + "grad_norm": 0.13324694335460663, "learning_rate": 9.147389495587671e-05, - "loss": 0.007413266692310572, + "loss": 0.0023267122451215982, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00744, + "ppl": 1.00233, "step": 123, "tokens/total": 3718320, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 56249 }, { "epoch": 0.484375, - "grad_norm": 0.31409645080566406, + "grad_norm": 0.230186328291893, "learning_rate": 9.130311507650116e-05, - "loss": 0.0029702766332775354, + "loss": 0.0037590472493320704, "memory/device_reserved (GiB)": 37.62, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00297, + "ppl": 1.00377, "step": 124, "tokens/total": 3748672, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.43, "tokens/trainable": 56713 }, { "epoch": 0.48828125, - "grad_norm": 0.6082578897476196, + "grad_norm": 0.30578872561454773, "learning_rate": 9.113082447632394e-05, - "loss": 0.003795543685555458, + "loss": 0.00473653944209218, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0038, + "ppl": 1.00475, "step": 125, "tokens/total": 3778976, - "tokens/train_per_sec_per_gpu": 39.08, + "tokens/train_per_sec_per_gpu": 39.1, "tokens/trainable": 57196 }, { "epoch": 0.4921875, - "grad_norm": 0.0603976845741272, + "grad_norm": 0.3714931607246399, "learning_rate": 9.09570303250602e-05, - "loss": 0.0014751165872439742, + "loss": 0.005811735987663269, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00148, + "ppl": 1.00583, "step": 126, "tokens/total": 3809296, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 57680 }, { "epoch": 0.49609375, - "grad_norm": 0.21112751960754395, + "grad_norm": 0.11054892838001251, "learning_rate": 9.078173985499394e-05, - "loss": 0.004137102514505386, + "loss": 0.0032034481409937143, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00415, + "ppl": 1.00321, "step": 127, "tokens/total": 3839328, - "tokens/train_per_sec_per_gpu": 31.8, + "tokens/train_per_sec_per_gpu": 31.88, "tokens/trainable": 58110 }, { "epoch": 0.5, - "grad_norm": 0.3234494924545288, + "grad_norm": 0.09251131862401962, "learning_rate": 9.060496036067713e-05, - "loss": 0.007372056134045124, + "loss": 0.001724504167214036, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0074, + "ppl": 1.00173, "step": 128, "tokens/total": 3869824, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 58534 }, { "epoch": 0.50390625, - "grad_norm": 0.5826171636581421, + "grad_norm": 0.22758308053016663, "learning_rate": 9.042669919862615e-05, - "loss": 0.007980267517268658, + "loss": 0.004688034299761057, "memory/device_reserved (GiB)": 37.76, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00801, + "ppl": 1.0047, "step": 129, "tokens/total": 3900080, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 58998 }, { "epoch": 0.5078125, - "grad_norm": 0.3384500741958618, + "grad_norm": 0.2881723642349243, "learning_rate": 9.024696378701557e-05, - "loss": 0.005637750029563904, + "loss": 0.008266786113381386, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00565, + "ppl": 1.0083, "step": 130, "tokens/total": 3930560, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 59448 }, { "epoch": 0.51171875, - "grad_norm": 0.2838669717311859, + "grad_norm": 0.18802326917648315, "learning_rate": 9.006576160536948e-05, - "loss": 0.0037927688099443913, + "loss": 0.00283675454556942, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.0038, + "ppl": 1.00284, "step": 131, "tokens/total": 3960496, - "tokens/train_per_sec_per_gpu": 31.97, + "tokens/train_per_sec_per_gpu": 31.92, "tokens/trainable": 59906 }, { "epoch": 0.515625, - "grad_norm": 0.4598330855369568, + "grad_norm": 0.6749681234359741, "learning_rate": 8.988310019425035e-05, - "loss": 0.010232537053525448, - "memory/device_reserved (GiB)": 35.94, + "loss": 0.012044447474181652, + "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01029, + "ppl": 1.01212, "step": 132, "tokens/total": 3990928, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 60350 }, { "epoch": 0.51953125, - "grad_norm": 0.7072780728340149, + "grad_norm": 0.5789079070091248, "learning_rate": 8.969898715494506e-05, - "loss": 0.00946755986660719, - "memory/device_reserved (GiB)": 37.17, + "loss": 0.011312158778309822, + "memory/device_reserved (GiB)": 37.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00951, + "ppl": 1.01138, "step": 133, "tokens/total": 4021264, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 60831 }, { "epoch": 0.5234375, - "grad_norm": 0.3642464280128479, + "grad_norm": 0.47060829401016235, "learning_rate": 8.951343014914869e-05, - "loss": 0.0067742373794317245, + "loss": 0.0308814849704504, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0068, + "ppl": 1.03136, "step": 134, "tokens/total": 4051728, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 61305 }, { "epoch": 0.52734375, - "grad_norm": 0.1071263924241066, + "grad_norm": 0.16633495688438416, "learning_rate": 8.932643689864568e-05, - "loss": 0.0022848297376185656, + "loss": 0.005535767879337072, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00229, + "ppl": 1.00555, "step": 135, "tokens/total": 4081920, - "tokens/train_per_sec_per_gpu": 37.57, + "tokens/train_per_sec_per_gpu": 37.62, "tokens/trainable": 61792 }, { "epoch": 0.53125, - "grad_norm": 0.22470054030418396, + "grad_norm": 0.10699360817670822, "learning_rate": 8.913801518498845e-05, - "loss": 0.0016683072317391634, + "loss": 0.002973862923681736, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00167, + "ppl": 1.00298, "step": 136, "tokens/total": 4112304, - "tokens/train_per_sec_per_gpu": 31.33, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 62253 }, { "epoch": 0.53515625, - "grad_norm": 0.5423188209533691, + "grad_norm": 0.2920030951499939, "learning_rate": 8.894817284917364e-05, - "loss": 0.017443198710680008, + "loss": 0.01169741339981556, "memory/device_reserved (GiB)": 38.55, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0176, + "ppl": 1.01177, "step": 137, "tokens/total": 4142512, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 62707 }, { "epoch": 0.5390625, - "grad_norm": 0.47486332058906555, + "grad_norm": 0.3187088370323181, "learning_rate": 8.875691779131569e-05, - "loss": 0.01525629311800003, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.011357840150594711, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01537, + "ppl": 1.01142, "step": 138, "tokens/total": 4172992, "tokens/train_per_sec_per_gpu": 29.32, @@ -1943,139 +1943,139 @@ }, { "epoch": 0.54296875, - "grad_norm": 0.055354099720716476, + "grad_norm": 0.18588471412658691, "learning_rate": 8.856425797031829e-05, - "loss": 0.0010598574299365282, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006680965423583984, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00106, + "ppl": 1.0067, "step": 139, "tokens/total": 4203136, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 63587 }, { "epoch": 0.546875, - "grad_norm": 0.15273842215538025, + "grad_norm": 0.2760343551635742, "learning_rate": 8.837020140354295e-05, - "loss": 0.002772743348032236, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.01477967668324709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00278, + "ppl": 1.01489, "step": 140, "tokens/total": 4233456, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.74, "tokens/trainable": 64052 }, { "epoch": 0.55078125, - "grad_norm": 0.21690180897712708, + "grad_norm": 0.49880966544151306, "learning_rate": 8.817475616647554e-05, - "loss": 0.005170213058590889, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.016770213842391968, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00518, + "ppl": 1.01691, "step": 141, "tokens/total": 4263728, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 64526 }, { "epoch": 0.5546875, - "grad_norm": 0.1491464525461197, + "grad_norm": 0.181757390499115, "learning_rate": 8.797793039239017e-05, - "loss": 0.0031757252290844917, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006471520289778709, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00318, + "ppl": 1.00649, "step": 142, "tokens/total": 4294432, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 64983 }, { "epoch": 0.55859375, - "grad_norm": 0.19370807707309723, + "grad_norm": 0.209610253572464, "learning_rate": 8.777973227201069e-05, - "loss": 0.0033013438805937767, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006492790300399065, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00331, + "ppl": 1.00651, "step": 143, "tokens/total": 4324960, - "tokens/train_per_sec_per_gpu": 37.6, + "tokens/train_per_sec_per_gpu": 37.58, "tokens/trainable": 65492 }, { "epoch": 0.5625, - "grad_norm": 0.43046337366104126, + "grad_norm": 0.13360266387462616, "learning_rate": 8.758017005316988e-05, - "loss": 0.004675615578889847, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.003702069167047739, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00469, + "ppl": 1.00371, "step": 144, "tokens/total": 4355424, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 65925 }, { "epoch": 0.56640625, - "grad_norm": 1.153432011604309, + "grad_norm": 0.1640344262123108, "learning_rate": 8.737925204046629e-05, - "loss": 0.00530653540045023, - "memory/device_reserved (GiB)": 38.55, + "loss": 0.006490131840109825, + "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00532, + "ppl": 1.00651, "step": 145, "tokens/total": 4385712, - "tokens/train_per_sec_per_gpu": 31.24, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66383 }, { "epoch": 0.5703125, - "grad_norm": 0.7740430235862732, + "grad_norm": 0.13646955788135529, "learning_rate": 8.717698659491851e-05, - "loss": 0.01281517744064331, + "loss": 0.0026589329354465008, "memory/device_reserved (GiB)": 38.56, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0129, + "ppl": 1.00266, "step": 146, "tokens/total": 4416016, - "tokens/train_per_sec_per_gpu": 31.37, + "tokens/train_per_sec_per_gpu": 31.39, "tokens/trainable": 66840 }, { "epoch": 0.57421875, - "grad_norm": 0.6978983879089355, + "grad_norm": 0.4220513701438904, "learning_rate": 8.697338213361735e-05, - "loss": 0.0272100567817688, + "loss": 0.01334389764815569, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02758, + "ppl": 1.01343, "step": 147, "tokens/total": 4446368, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 67297 }, { "epoch": 0.578125, - "grad_norm": 0.17344872653484344, + "grad_norm": 0.37345919013023376, "learning_rate": 8.676844712937552e-05, - "loss": 0.008015683852136135, + "loss": 0.012794861570000648, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00805, + "ppl": 1.01288, "step": 148, "tokens/total": 4476880, "tokens/train_per_sec_per_gpu": 37.36, @@ -2083,377 +2083,377 @@ }, { "epoch": 0.58203125, - "grad_norm": 0.6355595588684082, + "grad_norm": 0.3093344271183014, "learning_rate": 8.656219011037509e-05, - "loss": 0.010829147882759571, + "loss": 0.012492594309151173, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01089, + "ppl": 1.01257, "step": 149, "tokens/total": 4507232, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.83, "tokens/trainable": 68257 }, { "epoch": 0.5859375, - "grad_norm": 0.25094935297966003, + "grad_norm": 0.2453778088092804, "learning_rate": 8.63546196598125e-05, - "loss": 0.0052955676801502705, + "loss": 0.003456964623183012, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00531, + "ppl": 1.00346, "step": 150, "tokens/total": 4537376, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 68706 }, { "epoch": 0.58984375, - "grad_norm": 0.5292705297470093, + "grad_norm": 0.337802916765213, "learning_rate": 8.614574441554145e-05, - "loss": 0.022014575079083443, + "loss": 0.009631449356675148, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.02226, + "ppl": 1.00968, "step": 151, "tokens/total": 4567584, - "tokens/train_per_sec_per_gpu": 33.25, + "tokens/train_per_sec_per_gpu": 33.3, "tokens/trainable": 69131 }, { "epoch": 0.59375, - "grad_norm": 0.3471219539642334, + "grad_norm": 0.34801673889160156, "learning_rate": 8.593557306971349e-05, - "loss": 0.024585288017988205, + "loss": 0.02037646435201168, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02489, + "ppl": 1.02059, "step": 152, "tokens/total": 4597792, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 69586 }, { "epoch": 0.59765625, - "grad_norm": 0.08056659996509552, + "grad_norm": 0.03586283326148987, "learning_rate": 8.572411436841618e-05, - "loss": 0.002611964475363493, + "loss": 0.0008243054617196321, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00262, + "ppl": 1.00082, "step": 153, "tokens/total": 4627936, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 70061 }, { "epoch": 0.6015625, - "grad_norm": 0.162270650267601, + "grad_norm": 0.1870104819536209, "learning_rate": 8.551137711130922e-05, - "loss": 0.0033612053375691175, + "loss": 0.0038898580241948366, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00337, + "ppl": 1.0039, "step": 154, "tokens/total": 4658352, - "tokens/train_per_sec_per_gpu": 27.93, + "tokens/train_per_sec_per_gpu": 27.95, "tokens/trainable": 70467 }, { "epoch": 0.60546875, - "grad_norm": 0.17613235116004944, + "grad_norm": 0.2884272038936615, "learning_rate": 8.529737015125824e-05, - "loss": 0.004349880386143923, + "loss": 0.005026768893003464, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00436, + "ppl": 1.00504, "step": 155, "tokens/total": 4688896, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 70933 }, { "epoch": 0.609375, - "grad_norm": 0.2590649127960205, + "grad_norm": 0.07867873460054398, "learning_rate": 8.508210239396639e-05, - "loss": 0.010615494102239609, + "loss": 0.0024596985895186663, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01067, + "ppl": 1.00246, "step": 156, "tokens/total": 4719168, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 71382 }, { "epoch": 0.61328125, - "grad_norm": 0.15640626847743988, + "grad_norm": 0.056005269289016724, "learning_rate": 8.486558279760375e-05, - "loss": 0.002627612790092826, + "loss": 0.0012056033592671156, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00263, + "ppl": 1.00121, "step": 157, "tokens/total": 4749136, - "tokens/train_per_sec_per_gpu": 30.22, + "tokens/train_per_sec_per_gpu": 30.83, "tokens/trainable": 71808 }, { "epoch": 0.6171875, - "grad_norm": 0.34429433941841125, + "grad_norm": 0.34242892265319824, "learning_rate": 8.464782037243449e-05, - "loss": 0.010873161256313324, + "loss": 0.007983298972249031, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01093, + "ppl": 1.00802, "step": 158, "tokens/total": 4779472, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 72249 }, { "epoch": 0.62109375, - "grad_norm": 0.3858713209629059, + "grad_norm": 0.36051586270332336, "learning_rate": 8.442882418044202e-05, - "loss": 0.020050909370183945, + "loss": 0.011793753132224083, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02025, + "ppl": 1.01186, "step": 159, "tokens/total": 4809632, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 72726 }, { "epoch": 0.625, - "grad_norm": 0.3002466857433319, + "grad_norm": 0.376717746257782, "learning_rate": 8.420860333495179e-05, - "loss": 0.009756345301866531, + "loss": 0.018659302964806557, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0098, + "ppl": 1.01883, "step": 160, "tokens/total": 4840112, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 73148 }, { "epoch": 0.62890625, - "grad_norm": 0.202926903963089, + "grad_norm": 0.20132119953632355, "learning_rate": 8.398716700025208e-05, - "loss": 0.009084527380764484, + "loss": 0.007013507187366486, "memory/device_reserved (GiB)": 38.65, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.00913, + "ppl": 1.00704, "step": 161, "tokens/total": 4870656, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.53, "tokens/trainable": 73600 }, { "epoch": 0.6328125, - "grad_norm": 0.29608848690986633, + "grad_norm": 0.24618405103683472, "learning_rate": 8.376452439121266e-05, - "loss": 0.0125912856310606, + "loss": 0.00824644137173891, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01267, + "ppl": 1.00828, "step": 162, "tokens/total": 4900608, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.76, "tokens/trainable": 74068 }, { "epoch": 0.63671875, - "grad_norm": 0.11453798413276672, + "grad_norm": 0.2069157212972641, "learning_rate": 8.354068477290124e-05, - "loss": 0.0031142355874180794, + "loss": 0.007023319602012634, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00312, + "ppl": 1.00705, "step": 163, "tokens/total": 4930752, - "tokens/train_per_sec_per_gpu": 35.71, + "tokens/train_per_sec_per_gpu": 35.75, "tokens/trainable": 74527 }, { "epoch": 0.640625, - "grad_norm": 0.12609371542930603, + "grad_norm": 0.1887698471546173, "learning_rate": 8.331565746019807e-05, - "loss": 0.0056648110039532185, + "loss": 0.0082007497549057, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00568, + "ppl": 1.00823, "step": 164, "tokens/total": 4961008, - "tokens/train_per_sec_per_gpu": 31.81, + "tokens/train_per_sec_per_gpu": 31.87, "tokens/trainable": 74992 }, { "epoch": 0.64453125, - "grad_norm": 0.49591395258903503, + "grad_norm": 0.17459234595298767, "learning_rate": 8.308945181740812e-05, - "loss": 0.012539982795715332, + "loss": 0.004637294448912144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01262, + "ppl": 1.00465, "step": 165, "tokens/total": 4991200, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 75442 }, { "epoch": 0.6484375, - "grad_norm": 0.17120927572250366, + "grad_norm": 0.26009130477905273, "learning_rate": 8.286207725787153e-05, - "loss": 0.007677854970097542, - "memory/device_reserved (GiB)": 35.99, + "loss": 0.007355842739343643, + "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00771, + "ppl": 1.00738, "step": 166, "tokens/total": 5021600, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.27, "tokens/trainable": 75887 }, { "epoch": 0.65234375, - "grad_norm": 0.19032779335975647, + "grad_norm": 0.2539709806442261, "learning_rate": 8.263354324357182e-05, - "loss": 0.007361435331404209, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.010408539324998856, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00739, + "ppl": 1.01046, "step": 167, "tokens/total": 5052032, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 76331 }, { "epoch": 0.65625, - "grad_norm": 0.08688601851463318, + "grad_norm": 0.12331778556108475, "learning_rate": 8.240385928474219e-05, - "loss": 0.0016894477885216475, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022821722086519003, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00169, + "ppl": 1.00228, "step": 168, "tokens/total": 5080256, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 76745 }, { "epoch": 0.66015625, - "grad_norm": 1.221700668334961, + "grad_norm": 0.110007144510746, "learning_rate": 8.217303493946967e-05, - "loss": 0.02566530555486679, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0038710185326635838, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.026, + "ppl": 1.00388, "step": 169, "tokens/total": 5110784, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 77201 }, { "epoch": 0.6640625, - "grad_norm": 0.22431711852550507, + "grad_norm": 0.03679708018898964, "learning_rate": 8.194107981329746e-05, - "loss": 0.005605725571513176, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000850176380481571, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00562, + "ppl": 1.00085, "step": 170, "tokens/total": 5141200, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 77655 }, { "epoch": 0.66796875, - "grad_norm": 0.06314318627119064, + "grad_norm": 0.12713676691055298, "learning_rate": 8.170800355882518e-05, - "loss": 0.0013656741939485073, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0018071834929287434, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00137, + "ppl": 1.00181, "step": 171, "tokens/total": 5171760, - "tokens/train_per_sec_per_gpu": 39.25, + "tokens/train_per_sec_per_gpu": 39.23, "tokens/trainable": 78122 }, { "epoch": 0.671875, - "grad_norm": 0.3465789258480072, + "grad_norm": 0.1453125774860382, "learning_rate": 8.147381587530713e-05, - "loss": 0.008099250495433807, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0017664346378296614, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00813, + "ppl": 1.00177, "step": 172, "tokens/total": 5202272, - "tokens/train_per_sec_per_gpu": 33.59, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 78576 }, { "epoch": 0.67578125, - "grad_norm": 0.453427255153656, + "grad_norm": 0.21252205967903137, "learning_rate": 8.123852650824877e-05, - "loss": 0.020783744752407074, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.002328047761693597, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.021, + "ppl": 1.00233, "step": 173, "tokens/total": 5232800, - "tokens/train_per_sec_per_gpu": 36.49, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 79059 }, { "epoch": 0.6796875, - "grad_norm": 0.3241178095340729, + "grad_norm": 0.637407660484314, "learning_rate": 8.100214524900103e-05, - "loss": 0.010957238264381886, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.007709754630923271, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.01102, + "ppl": 1.00774, "step": 174, "tokens/total": 5262672, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.72, "tokens/trainable": 79498 }, { "epoch": 0.68359375, - "grad_norm": 0.5538946986198425, + "grad_norm": 0.06158079952001572, "learning_rate": 8.076468193435301e-05, - "loss": 0.009046275168657303, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0007811276591382921, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00909, + "ppl": 1.00078, "step": 175, "tokens/total": 5293072, "tokens/train_per_sec_per_gpu": 30.45, @@ -2461,139 +2461,139 @@ }, { "epoch": 0.6875, - "grad_norm": 0.26320791244506836, + "grad_norm": 0.04236136004328728, "learning_rate": 8.052614644612253e-05, - "loss": 0.014828844927251339, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.000772522296756506, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01494, + "ppl": 1.00077, "step": 176, "tokens/total": 5321520, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 80383 }, { "epoch": 0.69140625, - "grad_norm": 0.20839811861515045, + "grad_norm": 0.0892096534371376, "learning_rate": 8.028654871074489e-05, - "loss": 0.006698478478938341, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0023201322183012962, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00672, + "ppl": 1.00232, "step": 177, "tokens/total": 5351904, - "tokens/train_per_sec_per_gpu": 33.09, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 80824 }, { "epoch": 0.6953125, - "grad_norm": 0.3556506335735321, + "grad_norm": 0.679317831993103, "learning_rate": 8.004589869885986e-05, - "loss": 0.009760214015841484, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.008408154360949993, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00981, + "ppl": 1.00844, "step": 178, "tokens/total": 5382432, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 81243 }, { "epoch": 0.69921875, - "grad_norm": 0.21442855894565582, + "grad_norm": 0.05571528524160385, "learning_rate": 7.980420642489674e-05, - "loss": 0.009938797913491726, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00045867619337514043, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00999, + "ppl": 1.00046, "step": 179, "tokens/total": 5412960, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 81716 }, { "epoch": 0.703125, - "grad_norm": 0.13008078932762146, + "grad_norm": 0.36156049370765686, "learning_rate": 7.95614819466576e-05, - "loss": 0.005616464652121067, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0047795758582651615, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00563, + "ppl": 1.00479, "step": 180, "tokens/total": 5443232, - "tokens/train_per_sec_per_gpu": 35.61, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 82181 }, { "epoch": 0.70703125, - "grad_norm": 0.23816989362239838, + "grad_norm": 0.3550747036933899, "learning_rate": 7.931773536489872e-05, - "loss": 0.0075413500890135765, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0044985488057136536, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.29, "memory/max_allocated (GiB)": 33.29, - "ppl": 1.00757, + "ppl": 1.00451, "step": 181, "tokens/total": 5471440, - "tokens/train_per_sec_per_gpu": 34.63, + "tokens/train_per_sec_per_gpu": 34.65, "tokens/trainable": 82626 }, { "epoch": 0.7109375, - "grad_norm": 0.13832826912403107, + "grad_norm": 0.00732263270765543, "learning_rate": 7.907297682291035e-05, - "loss": 0.0035294657573103905, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012463401071727276, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00354, + "ppl": 1.00012, "step": 182, "tokens/total": 5501744, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 83089 }, { "epoch": 0.71484375, - "grad_norm": 0.08244283497333527, + "grad_norm": 0.005601493176072836, "learning_rate": 7.882721650609442e-05, - "loss": 0.0022330794017761946, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00012698184582404792, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00224, + "ppl": 1.00013, "step": 183, "tokens/total": 5532272, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 83590 }, { "epoch": 0.71875, - "grad_norm": 0.26471880078315735, + "grad_norm": 0.03298855572938919, "learning_rate": 7.85804646415409e-05, - "loss": 0.011201716959476471, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00026586768217384815, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.01126, + "ppl": 1.00027, "step": 184, "tokens/total": 5562784, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 84046 }, { "epoch": 0.72265625, - "grad_norm": 0.10434233397245407, + "grad_norm": 0.02470102533698082, "learning_rate": 7.833273149760207e-05, - "loss": 0.0033001210540533066, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00024917692644521594, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00331, + "ppl": 1.00025, "step": 185, "tokens/total": 5592800, "tokens/train_per_sec_per_gpu": 34.05, @@ -2601,223 +2601,223 @@ }, { "epoch": 0.7265625, - "grad_norm": 0.6545754075050354, + "grad_norm": 0.6944283246994019, "learning_rate": 7.808402738346527e-05, - "loss": 0.033577777445316315, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.016732344403862953, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.03415, + "ppl": 1.01687, "step": 186, "tokens/total": 5623088, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 84974 }, { "epoch": 0.73046875, - "grad_norm": 0.016698423773050308, + "grad_norm": 0.011723512783646584, "learning_rate": 7.783436264872382e-05, - "loss": 0.000414226611610502, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.00017266182112507522, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00041, + "ppl": 1.00017, "step": 187, "tokens/total": 5653344, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.07, "tokens/trainable": 85460 }, { "epoch": 0.734375, - "grad_norm": 0.16612493991851807, + "grad_norm": 0.34870269894599915, "learning_rate": 7.758374768294647e-05, - "loss": 0.002929423237219453, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.004548810888081789, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00293, + "ppl": 1.00456, "step": 188, "tokens/total": 5683600, - "tokens/train_per_sec_per_gpu": 35.9, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 85939 }, { "epoch": 0.73828125, - "grad_norm": 0.3205801248550415, + "grad_norm": 0.09110172092914581, "learning_rate": 7.733219291524489e-05, - "loss": 0.0012500635348260403, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001469930517487228, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00125, + "ppl": 1.00147, "step": 189, "tokens/total": 5711952, - "tokens/train_per_sec_per_gpu": 38.26, + "tokens/train_per_sec_per_gpu": 38.43, "tokens/trainable": 86377 }, { "epoch": 0.7421875, - "grad_norm": 0.5194064378738403, + "grad_norm": 0.6382125020027161, "learning_rate": 7.707970881383977e-05, - "loss": 0.009376855567097664, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.01117285992950201, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00942, + "ppl": 1.01124, "step": 190, "tokens/total": 5742336, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 86834 }, { "epoch": 0.74609375, - "grad_norm": 0.6358630061149597, + "grad_norm": 0.1396624743938446, "learning_rate": 7.682630588562518e-05, - "loss": 0.009413158521056175, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0022487500682473183, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00946, + "ppl": 1.00225, "step": 191, "tokens/total": 5772560, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 87265 }, { "epoch": 0.75, - "grad_norm": 0.1093795970082283, + "grad_norm": 0.09118734300136566, "learning_rate": 7.657199467573129e-05, - "loss": 0.0017574415542185307, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.0009341652039438486, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00176, + "ppl": 1.00093, "step": 192, "tokens/total": 5803136, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 87747 }, { "epoch": 0.75390625, - "grad_norm": 0.0865081176161766, + "grad_norm": 0.10082298517227173, "learning_rate": 7.631678576708561e-05, - "loss": 0.0017616486875340343, - "memory/device_reserved (GiB)": 38.57, + "loss": 0.001603117911145091, + "memory/device_reserved (GiB)": 38.58, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00176, + "ppl": 1.0016, "step": 193, "tokens/total": 5833440, - "tokens/train_per_sec_per_gpu": 36.22, + "tokens/train_per_sec_per_gpu": 36.21, "tokens/trainable": 88239 }, { "epoch": 0.7578125, - "grad_norm": 0.01772180385887623, + "grad_norm": 0.0594109408557415, "learning_rate": 7.606068977997255e-05, - "loss": 0.00022867789084557444, + "loss": 0.0009742019465193152, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00023, + "ppl": 1.00097, "step": 194, "tokens/total": 5863552, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 88718 }, { "epoch": 0.76171875, - "grad_norm": 0.2393598109483719, + "grad_norm": 0.12520930171012878, "learning_rate": 7.580371737159148e-05, - "loss": 0.003605358535423875, + "loss": 0.0015380105469375849, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00361, + "ppl": 1.00154, "step": 195, "tokens/total": 5893680, - "tokens/train_per_sec_per_gpu": 31.27, + "tokens/train_per_sec_per_gpu": 31.29, "tokens/trainable": 89129 }, { "epoch": 0.765625, - "grad_norm": 0.006237801164388657, + "grad_norm": 0.32357996702194214, "learning_rate": 7.554587923561324e-05, - "loss": 0.000122636032756418, + "loss": 0.0033828348387032747, "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00012, + "ppl": 1.00339, "step": 196, "tokens/total": 5923744, - "tokens/train_per_sec_per_gpu": 32.25, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 89567 }, { "epoch": 0.76953125, - "grad_norm": 0.9131373763084412, + "grad_norm": 0.30336976051330566, "learning_rate": 7.528718610173511e-05, - "loss": 0.03544272854924202, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.009017270989716053, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.03608, + "ppl": 1.00906, "step": 197, "tokens/total": 5954128, - "tokens/train_per_sec_per_gpu": 30.25, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 89988 }, { "epoch": 0.7734375, - "grad_norm": 0.11690016835927963, + "grad_norm": 0.530124306678772, "learning_rate": 7.502764873523431e-05, - "loss": 0.0010152912000194192, - "memory/device_reserved (GiB)": 35.57, + "loss": 0.013890329748392105, + "memory/device_reserved (GiB)": 35.56, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00102, + "ppl": 1.01399, "step": 198, "tokens/total": 5984352, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 90434 }, { "epoch": 0.77734375, - "grad_norm": 0.5135827660560608, + "grad_norm": 0.024880079552531242, "learning_rate": 7.476727793652011e-05, - "loss": 0.009797877632081509, - "memory/device_reserved (GiB)": 35.61, + "loss": 0.00029932294273748994, + "memory/device_reserved (GiB)": 35.6, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00985, + "ppl": 1.0003, "step": 199, "tokens/total": 6014704, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 90913 }, { "epoch": 0.78125, - "grad_norm": 0.26704609394073486, + "grad_norm": 0.07654840499162674, "learning_rate": 7.450608454068415e-05, - "loss": 0.009519001469016075, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0013769213110208511, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00956, + "ppl": 1.00138, "step": 200, "tokens/total": 6045056, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 91355 }, { "epoch": 0.78515625, - "grad_norm": 0.3149840235710144, + "grad_norm": 0.08619414269924164, "learning_rate": 7.424407941704987e-05, - "loss": 0.006803824566304684, - "memory/device_reserved (GiB)": 35.67, + "loss": 0.0012924536131322384, + "memory/device_reserved (GiB)": 35.66, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00683, + "ppl": 1.00129, "step": 201, "tokens/total": 6075504, "tokens/train_per_sec_per_gpu": 37.38, @@ -2825,433 +2825,433 @@ }, { "epoch": 0.7890625, - "grad_norm": 0.5193817615509033, + "grad_norm": 0.0749412402510643, "learning_rate": 7.398127346871986e-05, - "loss": 0.01742384023964405, + "loss": 0.0007854659343138337, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01758, + "ppl": 1.00079, "step": 202, "tokens/total": 6105904, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 92311 }, { "epoch": 0.79296875, - "grad_norm": 0.12959794700145721, + "grad_norm": 0.12518921494483948, "learning_rate": 7.371767763212238e-05, - "loss": 0.0025574658066034317, + "loss": 0.0026314458809792995, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00256, + "ppl": 1.00263, "step": 203, "tokens/total": 6136272, - "tokens/train_per_sec_per_gpu": 34.55, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 92764 }, { "epoch": 0.796875, - "grad_norm": 0.17874683439731598, + "grad_norm": 0.14211589097976685, "learning_rate": 7.345330287655617e-05, - "loss": 0.004190261010080576, + "loss": 0.00402654055505991, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.0042, + "ppl": 1.00403, "step": 204, "tokens/total": 6166336, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 93227 }, { "epoch": 0.80078125, - "grad_norm": 0.38072845339775085, + "grad_norm": 0.9564501047134399, "learning_rate": 7.31881602037339e-05, - "loss": 0.010198371484875679, + "loss": 0.01280949730426073, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01025, + "ppl": 1.01289, "step": 205, "tokens/total": 6196720, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 93675 }, { "epoch": 0.8046875, - "grad_norm": 0.39566439390182495, + "grad_norm": 0.13096395134925842, "learning_rate": 7.29222606473245e-05, - "loss": 0.008401261642575264, + "loss": 0.0037373730447143316, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00844, + "ppl": 1.00374, "step": 206, "tokens/total": 6227424, - "tokens/train_per_sec_per_gpu": 32.33, + "tokens/train_per_sec_per_gpu": 32.3, "tokens/trainable": 94120 }, { "epoch": 0.80859375, - "grad_norm": 0.12372284382581711, + "grad_norm": 0.08379670232534409, "learning_rate": 7.265561527249383e-05, - "loss": 0.002036123536527157, + "loss": 0.0017476077191531658, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00204, + "ppl": 1.00175, "step": 207, "tokens/total": 6257616, - "tokens/train_per_sec_per_gpu": 35.21, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 94557 }, { "epoch": 0.8125, - "grad_norm": 0.20433077216148376, + "grad_norm": 0.05349349230527878, "learning_rate": 7.238823517544436e-05, - "loss": 0.010479221120476723, + "loss": 0.0018553336849436164, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.00186, "step": 208, "tokens/total": 6288000, - "tokens/train_per_sec_per_gpu": 40.52, + "tokens/train_per_sec_per_gpu": 40.66, "tokens/trainable": 95035 }, { "epoch": 0.81640625, - "grad_norm": 0.06323215365409851, + "grad_norm": 0.11009859293699265, "learning_rate": 7.212013148295333e-05, - "loss": 0.0014629911165684462, + "loss": 0.0024754812475293875, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00146, + "ppl": 1.00248, "step": 209, "tokens/total": 6318336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 95517 }, { "epoch": 0.8203125, - "grad_norm": 0.17430178821086884, + "grad_norm": 0.08477463573217392, "learning_rate": 7.185131535190975e-05, - "loss": 0.007305104751139879, + "loss": 0.0019841620232909918, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00733, + "ppl": 1.00199, "step": 210, "tokens/total": 6348656, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 96026 }, { "epoch": 0.82421875, - "grad_norm": 0.08656168729066849, + "grad_norm": 0.06025635451078415, "learning_rate": 7.158179796885005e-05, - "loss": 0.002277363557368517, + "loss": 0.0011887844884768128, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00228, + "ppl": 1.00119, "step": 211, "tokens/total": 6379040, - "tokens/train_per_sec_per_gpu": 35.44, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 96477 }, { "epoch": 0.828125, - "grad_norm": 0.10843207687139511, + "grad_norm": 0.07387597858905792, "learning_rate": 7.131159054949273e-05, - "loss": 0.0033393804915249348, + "loss": 0.001786265056580305, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00334, + "ppl": 1.00179, "step": 212, "tokens/total": 6409312, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 96951 }, { "epoch": 0.83203125, - "grad_norm": 0.20112648606300354, + "grad_norm": 0.1013425812125206, "learning_rate": 7.104070433827139e-05, - "loss": 0.00444969953969121, + "loss": 0.0019797745626419783, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00446, + "ppl": 1.00198, "step": 213, "tokens/total": 6439520, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 97350 }, { "epoch": 0.8359375, - "grad_norm": 0.0895208865404129, + "grad_norm": 0.009712542407214642, "learning_rate": 7.076915060786705e-05, - "loss": 0.0011141544673591852, + "loss": 0.00013215326180215925, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00111, + "ppl": 1.00013, "step": 214, "tokens/total": 6469888, - "tokens/train_per_sec_per_gpu": 29.79, + "tokens/train_per_sec_per_gpu": 29.91, "tokens/trainable": 97792 }, { "epoch": 0.83984375, - "grad_norm": 0.2406485378742218, + "grad_norm": 0.14567089080810547, "learning_rate": 7.049694065873882e-05, - "loss": 0.0024814538192003965, + "loss": 0.0015704174293205142, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00248, + "ppl": 1.00157, "step": 215, "tokens/total": 6500128, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 98257 }, { "epoch": 0.84375, - "grad_norm": 0.21981537342071533, + "grad_norm": 0.021219903603196144, "learning_rate": 7.022408581865382e-05, - "loss": 0.0057976399548351765, + "loss": 0.0003704531991388649, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00581, + "ppl": 1.00037, "step": 216, "tokens/total": 6530832, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 98731 }, { "epoch": 0.84765625, - "grad_norm": 0.020311880856752396, + "grad_norm": 0.22449812293052673, "learning_rate": 6.99505974422157e-05, - "loss": 0.0002352493756916374, + "loss": 0.0037617988418787718, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00024, + "ppl": 1.00377, "step": 217, "tokens/total": 6561248, - "tokens/train_per_sec_per_gpu": 36.37, + "tokens/train_per_sec_per_gpu": 36.5, "tokens/trainable": 99212 }, { "epoch": 0.8515625, - "grad_norm": 0.047305941581726074, + "grad_norm": 0.6340874433517456, "learning_rate": 6.967648691039213e-05, - "loss": 0.000759766495320946, + "loss": 0.0011263209162279963, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00113, "step": 218, "tokens/total": 6591648, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 99654 }, { "epoch": 0.85546875, - "grad_norm": 0.3724987208843231, + "grad_norm": 0.1624881774187088, "learning_rate": 6.940176563004123e-05, - "loss": 0.0064449617639184, + "loss": 0.0014779233606532216, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00647, + "ppl": 1.00148, "step": 219, "tokens/total": 6622368, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.86, "tokens/trainable": 100086 }, { "epoch": 0.859375, - "grad_norm": 0.044390205293893814, + "grad_norm": 0.01793455332517624, "learning_rate": 6.912644503343682e-05, - "loss": 0.0006100431783124804, + "loss": 0.0001897630572784692, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00061, + "ppl": 1.00019, "step": 220, "tokens/total": 6652848, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 100524 }, { "epoch": 0.86328125, - "grad_norm": 0.42042797803878784, + "grad_norm": 0.12492946535348892, "learning_rate": 6.885053657779273e-05, - "loss": 0.010451005771756172, + "loss": 0.000895547098480165, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01051, + "ppl": 1.0009, "step": 221, "tokens/total": 6683392, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.46, "tokens/trainable": 100996 }, { "epoch": 0.8671875, - "grad_norm": 0.039993204176425934, + "grad_norm": 0.015087602660059929, "learning_rate": 6.857405174478604e-05, - "loss": 0.0005216938443481922, + "loss": 0.0001049312122631818, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00052, + "ppl": 1.0001, "step": 222, "tokens/total": 6713712, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 101449 }, { "epoch": 0.87109375, - "grad_norm": 0.4914291501045227, + "grad_norm": 0.713071882724762, "learning_rate": 6.82970020400792e-05, - "loss": 0.01120755635201931, + "loss": 0.01887362264096737, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01127, + "ppl": 1.01905, "step": 223, "tokens/total": 6744176, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.14, "tokens/trainable": 101905 }, { "epoch": 0.875, - "grad_norm": 0.1168161928653717, + "grad_norm": 0.008568123914301395, "learning_rate": 6.801939899284132e-05, - "loss": 0.0011214457917958498, + "loss": 7.857779564801604e-05, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00112, + "ppl": 1.00008, "step": 224, "tokens/total": 6774416, - "tokens/train_per_sec_per_gpu": 36.36, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 102411 }, { "epoch": 0.87890625, - "grad_norm": 0.08470873534679413, + "grad_norm": 0.6806920766830444, "learning_rate": 6.774125415526827e-05, - "loss": 0.0012768175220116973, + "loss": 0.010111674666404724, "memory/device_reserved (GiB)": 37.19, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00128, + "ppl": 1.01016, "step": 225, "tokens/total": 6804592, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 102882 }, { "epoch": 0.8828125, - "grad_norm": 0.039867568761110306, + "grad_norm": 0.00420374283567071, "learning_rate": 6.746257910210214e-05, - "loss": 0.0003806123568210751, + "loss": 5.371138468035497e-05, "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00038, + "ppl": 1.00005, "step": 226, "tokens/total": 6834976, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.69, "tokens/trainable": 103332 }, { "epoch": 0.88671875, - "grad_norm": 0.4414898157119751, + "grad_norm": 0.02610113099217415, "learning_rate": 6.718338543014937e-05, - "loss": 0.008082674816250801, + "loss": 0.00038069591391831636, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00812, + "ppl": 1.00038, "step": 227, "tokens/total": 6865408, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 103790 }, { "epoch": 0.890625, - "grad_norm": 0.2599055767059326, + "grad_norm": 0.0028072672430425882, "learning_rate": 6.69036847577983e-05, - "loss": 0.004410556983202696, + "loss": 6.497368303826079e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00442, + "ppl": 1.00006, "step": 228, "tokens/total": 6895664, - "tokens/train_per_sec_per_gpu": 34.35, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 104246 }, { "epoch": 0.89453125, - "grad_norm": 0.518774151802063, + "grad_norm": 0.8277482390403748, "learning_rate": 6.662348872453553e-05, - "loss": 0.018912211060523987, + "loss": 0.013669933192431927, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01909, + "ppl": 1.01376, "step": 229, "tokens/total": 6926016, - "tokens/train_per_sec_per_gpu": 37.66, + "tokens/train_per_sec_per_gpu": 37.72, "tokens/trainable": 104707 }, { "epoch": 0.8984375, - "grad_norm": 0.25264421105384827, + "grad_norm": 0.08310598134994507, "learning_rate": 6.63428089904618e-05, - "loss": 0.006381561979651451, + "loss": 0.0005468585877679288, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0064, + "ppl": 1.00055, "step": 230, "tokens/total": 6956384, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 105167 }, { "epoch": 0.90234375, - "grad_norm": 0.04987993463873863, + "grad_norm": 0.008127766661345959, "learning_rate": 6.60616572358065e-05, - "loss": 0.0007956874324008822, + "loss": 0.00013037689495831728, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0008, + "ppl": 1.00013, "step": 231, "tokens/total": 6986768, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 105576 }, { "epoch": 0.90625, - "grad_norm": 0.4156399965286255, + "grad_norm": 0.03313232958316803, "learning_rate": 6.578004516044172e-05, - "loss": 0.0147963035851717, + "loss": 0.000351642636815086, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01491, + "ppl": 1.00035, "step": 232, "tokens/total": 7017232, "tokens/train_per_sec_per_gpu": 36.76, @@ -3259,251 +3259,251 @@ }, { "epoch": 0.91015625, - "grad_norm": 0.1599927842617035, + "grad_norm": 0.08690419793128967, "learning_rate": 6.549798448339548e-05, - "loss": 0.0033814553171396255, + "loss": 0.001037480542436242, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00339, + "ppl": 1.00104, "step": 233, "tokens/total": 7047568, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 106506 }, { "epoch": 0.9140625, - "grad_norm": 0.0438290536403656, + "grad_norm": 0.12895406782627106, "learning_rate": 6.521548694236384e-05, - "loss": 0.0007064358796924353, + "loss": 0.0019432969857007265, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00071, + "ppl": 1.00195, "step": 234, "tokens/total": 7077760, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 106951 }, { "epoch": 0.91796875, - "grad_norm": 0.13300912082195282, + "grad_norm": 0.25051259994506836, "learning_rate": 6.493256429322259e-05, - "loss": 0.003099396824836731, + "loss": 0.0025090454146265984, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0031, + "ppl": 1.00251, "step": 235, "tokens/total": 7107760, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.73, "tokens/trainable": 107382 }, { "epoch": 0.921875, - "grad_norm": 0.3202158510684967, + "grad_norm": 0.5061792731285095, "learning_rate": 6.464922830953799e-05, - "loss": 0.0032203267328441143, + "loss": 0.00891919620335102, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00323, + "ppl": 1.00896, "step": 236, "tokens/total": 7138144, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 107814 }, { "epoch": 0.92578125, - "grad_norm": 0.15484245121479034, + "grad_norm": 0.3209003210067749, "learning_rate": 6.436549078207688e-05, - "loss": 0.002883841749280691, + "loss": 0.0041964175179600716, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00289, + "ppl": 1.00421, "step": 237, "tokens/total": 7168352, - "tokens/train_per_sec_per_gpu": 35.37, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 108274 }, { "epoch": 0.9296875, - "grad_norm": 0.09864962846040726, + "grad_norm": 0.3212501108646393, "learning_rate": 6.408136351831592e-05, - "loss": 0.0021360500250011683, + "loss": 0.0037440985906869173, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00214, + "ppl": 1.00375, "step": 238, "tokens/total": 7198624, - "tokens/train_per_sec_per_gpu": 29.22, + "tokens/train_per_sec_per_gpu": 29.09, "tokens/trainable": 108714 }, { "epoch": 0.93359375, - "grad_norm": 0.06800950318574905, + "grad_norm": 0.021965481340885162, "learning_rate": 6.379685834195036e-05, - "loss": 0.0014171022921800613, + "loss": 0.00035154391662217677, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00142, + "ppl": 1.00035, "step": 239, "tokens/total": 7229216, - "tokens/train_per_sec_per_gpu": 36.79, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 109220 }, { "epoch": 0.9375, - "grad_norm": 0.21696041524410248, + "grad_norm": 0.1164102703332901, "learning_rate": 6.351198709240186e-05, - "loss": 0.002807284239679575, + "loss": 0.0012684958055615425, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00281, + "ppl": 1.00127, "step": 240, "tokens/total": 7259648, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.0, "tokens/trainable": 109672 }, { "epoch": 0.94140625, - "grad_norm": 0.43646690249443054, + "grad_norm": 0.17972798645496368, "learning_rate": 6.32267616243259e-05, - "loss": 0.017607467249035835, + "loss": 0.0024644152726978064, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01776, + "ppl": 1.00247, "step": 241, "tokens/total": 7289824, - "tokens/train_per_sec_per_gpu": 35.18, + "tokens/train_per_sec_per_gpu": 35.09, "tokens/trainable": 110135 }, { "epoch": 0.9453125, - "grad_norm": 0.06252250075340271, + "grad_norm": 0.5711016654968262, "learning_rate": 6.294119380711849e-05, - "loss": 0.0006150953122414649, + "loss": 0.01326853595674038, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00062, + "ppl": 1.01336, "step": 242, "tokens/total": 7320288, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 110563 }, { "epoch": 0.94921875, - "grad_norm": 0.16029377281665802, + "grad_norm": 0.7820162177085876, "learning_rate": 6.265529552442209e-05, - "loss": 0.0031884105410426855, + "loss": 0.01847490295767784, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00319, + "ppl": 1.01865, "step": 243, "tokens/total": 7350736, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 36.84, "tokens/trainable": 111049 }, { "epoch": 0.953125, - "grad_norm": 0.17883111536502838, + "grad_norm": 0.2531258165836334, "learning_rate": 6.236907867363127e-05, - "loss": 0.0007043592631816864, + "loss": 0.003868672763928771, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0007, + "ppl": 1.00388, "step": 244, "tokens/total": 7381280, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 111495 }, { "epoch": 0.95703125, - "grad_norm": 0.052345480769872665, + "grad_norm": 0.09388009458780289, "learning_rate": 6.208255516539749e-05, - "loss": 0.0006958417361602187, + "loss": 0.0010953794699162245, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0007, + "ppl": 1.0011, "step": 245, "tokens/total": 7411632, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.68, "tokens/trainable": 111968 }, { "epoch": 0.9609375, - "grad_norm": 0.17381155490875244, + "grad_norm": 0.06202390044927597, "learning_rate": 6.179573692313344e-05, - "loss": 0.008788044564425945, + "loss": 0.0006574424332939088, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00883, + "ppl": 1.00066, "step": 246, "tokens/total": 7441904, - "tokens/train_per_sec_per_gpu": 36.55, + "tokens/train_per_sec_per_gpu": 36.44, "tokens/trainable": 112416 }, { "epoch": 0.96484375, - "grad_norm": 0.10432726889848709, + "grad_norm": 0.21640881896018982, "learning_rate": 6.150863588251694e-05, - "loss": 0.0013522123917937279, + "loss": 0.00276574632152915, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00135, + "ppl": 1.00277, "step": 247, "tokens/total": 7472368, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 112882 }, { "epoch": 0.96875, - "grad_norm": 0.07330253720283508, + "grad_norm": 0.04909277334809303, "learning_rate": 6.122126399099419e-05, - "loss": 0.0010365882189944386, + "loss": 0.0012688931310549378, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00104, + "ppl": 1.00127, "step": 248, "tokens/total": 7502656, - "tokens/train_per_sec_per_gpu": 40.07, + "tokens/train_per_sec_per_gpu": 40.02, "tokens/trainable": 113390 }, { "epoch": 0.97265625, - "grad_norm": 0.7874143123626709, + "grad_norm": 0.2183118760585785, "learning_rate": 6.0933633207282615e-05, - "loss": 0.010244790464639664, + "loss": 0.01150418072938919, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0103, + "ppl": 1.01157, "step": 249, "tokens/total": 7532800, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 113904 }, { "epoch": 0.9765625, - "grad_norm": 0.04100371524691582, + "grad_norm": 0.05114463344216347, "learning_rate": 6.064575550087316e-05, - "loss": 0.000650806468911469, + "loss": 0.0009117473382502794, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00065, + "ppl": 1.00091, "step": 250, "tokens/total": 7563264, "tokens/train_per_sec_per_gpu": 33.91, @@ -3511,545 +3511,545 @@ }, { "epoch": 0.98046875, - "grad_norm": 0.14704902470111847, + "grad_norm": 0.10292479395866394, "learning_rate": 6.0357642851532245e-05, - "loss": 0.0022576111368834972, + "loss": 0.0016239782562479377, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00226, + "ppl": 1.00163, "step": 251, "tokens/total": 7593840, - "tokens/train_per_sec_per_gpu": 35.26, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 114842 }, { "epoch": 0.984375, - "grad_norm": 0.2090071737766266, + "grad_norm": 0.057799480855464935, "learning_rate": 6.0069307248803294e-05, - "loss": 0.0027604042552411556, + "loss": 0.0011053154012188315, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00276, + "ppl": 1.00111, "step": 252, "tokens/total": 7624416, - "tokens/train_per_sec_per_gpu": 28.92, + "tokens/train_per_sec_per_gpu": 28.88, "tokens/trainable": 115263 }, { "epoch": 0.98828125, - "grad_norm": 0.11346573382616043, + "grad_norm": 0.017502324655652046, "learning_rate": 5.9780760691507635e-05, - "loss": 0.0015118042938411236, + "loss": 0.0003236275806557387, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00151, + "ppl": 1.00032, "step": 253, "tokens/total": 7654688, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 115703 }, { "epoch": 0.9921875, - "grad_norm": 0.20446987450122833, + "grad_norm": 0.2686062753200531, "learning_rate": 5.9492015187245334e-05, - "loss": 0.002259923843666911, + "loss": 0.003511242102831602, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00226, + "ppl": 1.00352, "step": 254, "tokens/total": 7685088, - "tokens/train_per_sec_per_gpu": 33.31, + "tokens/train_per_sec_per_gpu": 33.26, "tokens/trainable": 116157 }, { "epoch": 0.99609375, - "grad_norm": 0.6619936227798462, + "grad_norm": 0.25028568506240845, "learning_rate": 5.920308275189541e-05, - "loss": 0.012125558219850063, + "loss": 0.0028144530951976776, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0122, + "ppl": 1.00282, "step": 255, "tokens/total": 7715552, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 31.95, "tokens/trainable": 116567 }, { "epoch": 1.0, - "grad_norm": 0.017078718170523643, + "grad_norm": 0.010626083239912987, "learning_rate": 5.8913975409115874e-05, - "loss": 0.00028051040135324, + "loss": 0.0002322449436178431, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00028, + "ppl": 1.00023, "step": 256, "tokens/total": 7745872, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.11, "tokens/trainable": 117030 }, { "epoch": 1.00390625, - "grad_norm": 0.007685024291276932, + "grad_norm": 0.004322522785514593, "learning_rate": 5.8624705189843395e-05, - "loss": 0.00016534165479242802, + "loss": 8.972767682280391e-05, "memory/device_reserved (GiB)": 38.23, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00009, "step": 257, "tokens/total": 7776208, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 117517 }, { "epoch": 1.0078125, - "grad_norm": 0.046725187450647354, + "grad_norm": 0.04855626821517944, "learning_rate": 5.833528413179249e-05, - "loss": 0.0004824839415960014, + "loss": 0.0010425080545246601, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00048, + "ppl": 1.00104, "step": 258, "tokens/total": 7806480, - "tokens/train_per_sec_per_gpu": 38.44, + "tokens/train_per_sec_per_gpu": 38.33, "tokens/trainable": 118015 }, { "epoch": 1.01171875, - "grad_norm": 0.093961201608181, + "grad_norm": 0.015271801501512527, "learning_rate": 5.80457242789548e-05, - "loss": 0.00111109868157655, + "loss": 0.0002960565616376698, "memory/device_reserved (GiB)": 35.62, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00111, + "ppl": 1.0003, "step": 259, "tokens/total": 7836800, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 118520 }, { "epoch": 1.015625, - "grad_norm": 0.024271946400403976, + "grad_norm": 0.1238817349076271, "learning_rate": 5.77560376810977e-05, - "loss": 0.00036734913010150194, + "loss": 0.001452557509765029, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00037, + "ppl": 1.00145, "step": 260, "tokens/total": 7867040, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 118992 }, { "epoch": 1.01953125, - "grad_norm": 0.10853405296802521, + "grad_norm": 0.008926448412239552, "learning_rate": 5.7466236393263005e-05, - "loss": 0.002126566832885146, + "loss": 0.0002352800511289388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00213, + "ppl": 1.00024, "step": 261, "tokens/total": 7897408, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 119438 }, { "epoch": 1.0234375, - "grad_norm": 0.1838080883026123, + "grad_norm": 0.0867115706205368, "learning_rate": 5.717633247526522e-05, - "loss": 0.0012134769931435585, + "loss": 0.0014156652614474297, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00121, + "ppl": 1.00142, "step": 262, "tokens/total": 7927648, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 119881 }, { "epoch": 1.02734375, - "grad_norm": 0.28273531794548035, + "grad_norm": 0.03644087538123131, "learning_rate": 5.688633799118971e-05, - "loss": 0.0020987153984606266, + "loss": 0.0004944024258293211, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0021, + "ppl": 1.00049, "step": 263, "tokens/total": 7957968, - "tokens/train_per_sec_per_gpu": 27.91, + "tokens/train_per_sec_per_gpu": 27.72, "tokens/trainable": 120285 }, { "epoch": 1.03125, - "grad_norm": 0.07407250255346298, + "grad_norm": 0.4136442542076111, "learning_rate": 5.659626500889066e-05, - "loss": 0.00043982663191854954, + "loss": 0.005234354641288519, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.65, "memory/max_allocated (GiB)": 33.65, - "ppl": 1.00044, + "ppl": 1.00525, "step": 264, "tokens/total": 7987888, - "tokens/train_per_sec_per_gpu": 33.2, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 120755 }, { "epoch": 1.03515625, - "grad_norm": 0.01878584362566471, + "grad_norm": 0.011108173988759518, "learning_rate": 5.6306125599488905e-05, - "loss": 0.00014881066454108804, + "loss": 0.00019686836458276957, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.0002, "step": 265, "tokens/total": 8018048, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 121194 }, { "epoch": 1.0390625, - "grad_norm": 0.012090266682207584, + "grad_norm": 0.2199329286813736, "learning_rate": 5.601593183686955e-05, - "loss": 0.00013956695329397917, + "loss": 0.005357124377042055, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00014, + "ppl": 1.00537, "step": 266, "tokens/total": 8048448, - "tokens/train_per_sec_per_gpu": 36.68, + "tokens/train_per_sec_per_gpu": 36.54, "tokens/trainable": 121670 }, { "epoch": 1.04296875, - "grad_norm": 0.03192078694701195, + "grad_norm": 0.15096357464790344, "learning_rate": 5.572569579717961e-05, - "loss": 0.000175558976479806, + "loss": 0.0024120814632624388, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00018, + "ppl": 1.00241, "step": 267, "tokens/total": 8078848, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.58, "tokens/trainable": 122142 }, { "epoch": 1.046875, - "grad_norm": 0.008871566504240036, + "grad_norm": 0.0024968513753265142, "learning_rate": 5.543542955832538e-05, - "loss": 0.00010361030581407249, + "loss": 4.619035462383181e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00005, "step": 268, "tokens/total": 8109360, - "tokens/train_per_sec_per_gpu": 32.41, + "tokens/train_per_sec_per_gpu": 32.36, "tokens/trainable": 122585 }, { "epoch": 1.05078125, - "grad_norm": 0.37323296070098877, + "grad_norm": 0.018697405233979225, "learning_rate": 5.514514519946986e-05, - "loss": 0.0028822675812989473, + "loss": 0.00024445558665320277, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00289, + "ppl": 1.00024, "step": 269, "tokens/total": 8139888, - "tokens/train_per_sec_per_gpu": 38.85, + "tokens/train_per_sec_per_gpu": 38.78, "tokens/trainable": 123091 }, { "epoch": 1.0546875, - "grad_norm": 0.019474836066365242, + "grad_norm": 0.04383962228894234, "learning_rate": 5.485485480053015e-05, - "loss": 0.0003204788372386247, + "loss": 0.0005069951876066625, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00032, + "ppl": 1.00051, "step": 270, "tokens/total": 8170480, - "tokens/train_per_sec_per_gpu": 30.9, + "tokens/train_per_sec_per_gpu": 30.91, "tokens/trainable": 123505 }, { "epoch": 1.05859375, - "grad_norm": 0.05259509012103081, + "grad_norm": 0.018031178042292595, "learning_rate": 5.4564570441674645e-05, - "loss": 0.00033461389830335975, + "loss": 0.00028141128132119775, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.00033, + "ppl": 1.00028, "step": 271, "tokens/total": 8198848, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.31, "tokens/trainable": 123953 }, { "epoch": 1.0625, - "grad_norm": 0.09935376048088074, + "grad_norm": 0.016046874225139618, "learning_rate": 5.42743042028204e-05, - "loss": 0.00043552459101192653, + "loss": 0.00015048845671117306, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00044, + "ppl": 1.00015, "step": 272, "tokens/total": 8229200, - "tokens/train_per_sec_per_gpu": 28.66, + "tokens/train_per_sec_per_gpu": 28.61, "tokens/trainable": 124400 }, { "epoch": 1.06640625, - "grad_norm": 0.3927276134490967, + "grad_norm": 0.004127623979002237, "learning_rate": 5.3984068163130464e-05, - "loss": 0.00702043017372489, + "loss": 7.019042095635086e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00705, + "ppl": 1.00007, "step": 273, "tokens/total": 8259536, - "tokens/train_per_sec_per_gpu": 35.05, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 124870 }, { "epoch": 1.0703125, - "grad_norm": 0.03849954903125763, + "grad_norm": 0.016368450596928596, "learning_rate": 5.369387440051111e-05, - "loss": 0.0003886982740368694, + "loss": 0.00023265022900886834, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00039, + "ppl": 1.00023, "step": 274, "tokens/total": 8289904, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 125333 }, { "epoch": 1.07421875, - "grad_norm": 0.010367084294557571, + "grad_norm": 0.0009975603315979242, "learning_rate": 5.340373499110935e-05, - "loss": 8.032341429498047e-05, + "loss": 2.3090822651283816e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00008, + "ppl": 1.00002, "step": 275, "tokens/total": 8320176, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 125834 }, { "epoch": 1.078125, - "grad_norm": 0.05538506433367729, + "grad_norm": 0.0020015796180814505, "learning_rate": 5.3113662008810304e-05, - "loss": 0.00026508988230489194, + "loss": 2.2906289814272895e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00027, + "ppl": 1.00002, "step": 276, "tokens/total": 8350832, - "tokens/train_per_sec_per_gpu": 37.97, + "tokens/train_per_sec_per_gpu": 38.02, "tokens/trainable": 126316 }, { "epoch": 1.08203125, - "grad_norm": 0.20107394456863403, + "grad_norm": 0.005128095392137766, "learning_rate": 5.282366752473479e-05, - "loss": 0.0007178307860158384, + "loss": 6.587664393009618e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00072, + "ppl": 1.00007, "step": 277, "tokens/total": 8380976, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.33, "tokens/trainable": 126798 }, { "epoch": 1.0859375, - "grad_norm": 0.005950715858489275, + "grad_norm": 0.0013011472765356302, "learning_rate": 5.2533763606737005e-05, - "loss": 4.905788227915764e-05, + "loss": 2.66208026005188e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00005, + "ppl": 1.00003, "step": 278, "tokens/total": 8411072, - "tokens/train_per_sec_per_gpu": 29.57, + "tokens/train_per_sec_per_gpu": 29.64, "tokens/trainable": 127223 }, { "epoch": 1.08984375, - "grad_norm": 0.009278975427150726, + "grad_norm": 0.001754116965457797, "learning_rate": 5.224396231890232e-05, - "loss": 8.996425458462909e-05, + "loss": 2.587787457741797e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00003, "step": 279, "tokens/total": 8440736, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 127672 }, { "epoch": 1.09375, - "grad_norm": 0.11463552713394165, + "grad_norm": 0.005082705058157444, "learning_rate": 5.195427572104522e-05, - "loss": 0.0006871019722893834, + "loss": 8.052532211877406e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00069, + "ppl": 1.00008, "step": 280, "tokens/total": 8470944, - "tokens/train_per_sec_per_gpu": 32.07, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 128116 }, { "epoch": 1.09765625, - "grad_norm": 0.004335940349847078, + "grad_norm": 0.0014385804533958435, "learning_rate": 5.166471586820751e-05, - "loss": 4.704743332695216e-05, + "loss": 2.603003304102458e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 281, "tokens/total": 8501104, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.82, "tokens/trainable": 128589 }, { "epoch": 1.1015625, - "grad_norm": 0.21418413519859314, + "grad_norm": 0.7784804105758667, "learning_rate": 5.1375294810156615e-05, - "loss": 0.01315401028841734, + "loss": 0.008352375589311123, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01324, + "ppl": 1.00839, "step": 282, "tokens/total": 8531696, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 129036 }, { "epoch": 1.10546875, - "grad_norm": 0.0006189382984302938, + "grad_norm": 0.0021191469859331846, "learning_rate": 5.1086024590884144e-05, - "loss": 1.5588291716994718e-05, + "loss": 3.5222510632593185e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 283, "tokens/total": 8561936, - "tokens/train_per_sec_per_gpu": 35.16, + "tokens/train_per_sec_per_gpu": 35.21, "tokens/trainable": 129485 }, { "epoch": 1.109375, - "grad_norm": 0.005335172638297081, + "grad_norm": 0.019356347620487213, "learning_rate": 5.079691724810461e-05, - "loss": 8.037629595492035e-05, + "loss": 0.0002056795492535457, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00021, "step": 284, "tokens/total": 8592192, - "tokens/train_per_sec_per_gpu": 29.49, + "tokens/train_per_sec_per_gpu": 29.55, "tokens/trainable": 129920 }, { "epoch": 1.11328125, - "grad_norm": 0.003026328282430768, + "grad_norm": 0.030793415382504463, "learning_rate": 5.0507984812754684e-05, - "loss": 4.424918006407097e-05, + "loss": 0.00022263142454903573, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00022, "step": 285, "tokens/total": 8622432, - "tokens/train_per_sec_per_gpu": 36.06, + "tokens/train_per_sec_per_gpu": 36.14, "tokens/trainable": 130417 }, { "epoch": 1.1171875, - "grad_norm": 0.0032119054812937975, + "grad_norm": 0.2944176197052002, "learning_rate": 5.021923930849237e-05, - "loss": 5.364553726394661e-05, + "loss": 0.0028715431690216064, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00005, + "ppl": 1.00288, "step": 286, "tokens/total": 8652768, - "tokens/train_per_sec_per_gpu": 35.89, + "tokens/train_per_sec_per_gpu": 35.95, "tokens/trainable": 130903 }, { "epoch": 1.12109375, - "grad_norm": 0.015378961339592934, + "grad_norm": 0.0015030609210953116, "learning_rate": 4.99306927511967e-05, - "loss": 9.19914455153048e-05, + "loss": 2.242590744572226e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00002, "step": 287, "tokens/total": 8683296, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 131343 }, { "epoch": 1.125, - "grad_norm": 0.8838728070259094, + "grad_norm": 0.22225140035152435, "learning_rate": 4.964235714846775e-05, - "loss": 0.00693545350804925, + "loss": 0.0026556546799838543, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00696, + "ppl": 1.00266, "step": 288, "tokens/total": 8713504, - "tokens/train_per_sec_per_gpu": 32.19, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 131763 }, { "epoch": 1.12890625, - "grad_norm": 0.0019988964777439833, + "grad_norm": 0.018996328115463257, "learning_rate": 4.9354244499126866e-05, - "loss": 2.3260268790181726e-05, + "loss": 4.354536213213578e-05, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00002, + "ppl": 1.00004, "step": 289, "tokens/total": 8743888, "tokens/train_per_sec_per_gpu": 34.0, @@ -4057,461 +4057,461 @@ }, { "epoch": 1.1328125, - "grad_norm": 0.0004976001800969243, + "grad_norm": 0.001890109502710402, "learning_rate": 4.90663667927174e-05, - "loss": 1.430663360224571e-05, + "loss": 2.4500381186953746e-05, "memory/device_reserved (GiB)": 35.54, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00002, "step": 290, "tokens/total": 8774336, - "tokens/train_per_sec_per_gpu": 35.46, + "tokens/train_per_sec_per_gpu": 35.19, "tokens/trainable": 132678 }, { "epoch": 1.13671875, - "grad_norm": 0.01294003613293171, + "grad_norm": 0.0009667908307164907, "learning_rate": 4.877873600900581e-05, - "loss": 0.0001438881445210427, + "loss": 2.0667655917350203e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00014, + "ppl": 1.00002, "step": 291, "tokens/total": 8804816, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.28, "tokens/trainable": 133136 }, { "epoch": 1.140625, - "grad_norm": 0.3451043963432312, + "grad_norm": 0.0010472588473930955, "learning_rate": 4.849136411748306e-05, - "loss": 0.0030744036193937063, + "loss": 2.282073546666652e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00308, + "ppl": 1.00002, "step": 292, "tokens/total": 8835024, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 133608 }, { "epoch": 1.14453125, - "grad_norm": 0.024186862632632256, + "grad_norm": 0.028602443635463715, "learning_rate": 4.8204263076866574e-05, - "loss": 0.000165810008184053, + "loss": 0.0002425020356895402, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00017, + "ppl": 1.00024, "step": 293, "tokens/total": 8865408, - "tokens/train_per_sec_per_gpu": 40.44, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 134108 }, { "epoch": 1.1484375, - "grad_norm": 0.001723558409139514, + "grad_norm": 0.0024220976047217846, "learning_rate": 4.791744483460251e-05, - "loss": 3.2396514143329114e-05, + "loss": 3.14589160552714e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00003, "step": 294, "tokens/total": 8895824, - "tokens/train_per_sec_per_gpu": 30.72, + "tokens/train_per_sec_per_gpu": 30.68, "tokens/trainable": 134541 }, { "epoch": 1.15234375, - "grad_norm": 0.010282398201525211, + "grad_norm": 0.00373630179092288, "learning_rate": 4.7630921326368736e-05, - "loss": 0.00010598616790957749, + "loss": 5.82915308768861e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00011, + "ppl": 1.00006, "step": 295, "tokens/total": 8926336, - "tokens/train_per_sec_per_gpu": 29.51, + "tokens/train_per_sec_per_gpu": 29.44, "tokens/trainable": 134966 }, { "epoch": 1.15625, - "grad_norm": 0.02922157198190689, + "grad_norm": 0.023777559399604797, "learning_rate": 4.7344704475577916e-05, - "loss": 0.0002625146880745888, + "loss": 0.0002222473849542439, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00026, + "ppl": 1.00022, "step": 296, "tokens/total": 8956656, - "tokens/train_per_sec_per_gpu": 33.56, + "tokens/train_per_sec_per_gpu": 33.53, "tokens/trainable": 135402 }, { "epoch": 1.16015625, - "grad_norm": 0.4516298770904541, + "grad_norm": 0.03583608567714691, "learning_rate": 4.705880619288153e-05, - "loss": 0.004878990352153778, + "loss": 0.000519716995768249, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00489, + "ppl": 1.00052, "step": 297, "tokens/total": 8986752, - "tokens/train_per_sec_per_gpu": 30.05, + "tokens/train_per_sec_per_gpu": 30.02, "tokens/trainable": 135804 }, { "epoch": 1.1640625, - "grad_norm": 0.07809585332870483, + "grad_norm": 0.10825730860233307, "learning_rate": 4.677323837567412e-05, - "loss": 0.00019118667114526033, + "loss": 0.0007585557177662849, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00019, + "ppl": 1.00076, "step": 298, "tokens/total": 9017024, - "tokens/train_per_sec_per_gpu": 31.19, + "tokens/train_per_sec_per_gpu": 31.13, "tokens/trainable": 136231 }, { "epoch": 1.16796875, - "grad_norm": 0.008364620618522167, + "grad_norm": 0.0007777873543091118, "learning_rate": 4.6488012907598146e-05, - "loss": 6.207433034433052e-05, + "loss": 1.649466503295116e-05, "memory/device_reserved (GiB)": 35.55, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00006, + "ppl": 1.00002, "step": 299, "tokens/total": 9047424, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 136705 }, { "epoch": 1.171875, - "grad_norm": 0.35634350776672363, + "grad_norm": 0.0021820615511387587, "learning_rate": 4.620314165804964e-05, - "loss": 0.008261370472609997, + "loss": 3.35803342750296e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0083, + "ppl": 1.00003, "step": 300, "tokens/total": 9077648, - "tokens/train_per_sec_per_gpu": 34.86, + "tokens/train_per_sec_per_gpu": 34.73, "tokens/trainable": 137178 }, { "epoch": 1.17578125, - "grad_norm": 0.1326446235179901, + "grad_norm": 0.017772037535905838, "learning_rate": 4.591863648168407e-05, - "loss": 0.0006729009910486639, + "loss": 9.50043904595077e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0001, "step": 301, "tokens/total": 9108032, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 137643 }, { "epoch": 1.1796875, - "grad_norm": 0.11166927963495255, + "grad_norm": 0.08602973073720932, "learning_rate": 4.5634509217923135e-05, - "loss": 0.000889140646904707, + "loss": 0.0010838620364665985, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00089, + "ppl": 1.00108, "step": 302, "tokens/total": 9138240, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 138078 }, { "epoch": 1.18359375, - "grad_norm": 0.656753420829773, + "grad_norm": 0.0017863045213744044, "learning_rate": 4.535077169046201e-05, - "loss": 0.004501559771597385, + "loss": 3.200750143150799e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00451, + "ppl": 1.00003, "step": 303, "tokens/total": 9168352, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.0, "tokens/trainable": 138515 }, { "epoch": 1.1875, - "grad_norm": 0.00743053387850523, + "grad_norm": 0.0011891268659383059, "learning_rate": 4.506743570677743e-05, - "loss": 9.650958236306906e-05, + "loss": 2.6663004973670468e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00003, "step": 304, "tokens/total": 9198864, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.13, "tokens/trainable": 138948 }, { "epoch": 1.19140625, - "grad_norm": 0.0033850902691483498, + "grad_norm": 0.08658935129642487, "learning_rate": 4.478451305763618e-05, - "loss": 5.173611862119287e-05, + "loss": 0.0008552016224712133, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00086, "step": 305, "tokens/total": 9229104, - "tokens/train_per_sec_per_gpu": 38.17, + "tokens/train_per_sec_per_gpu": 38.05, "tokens/trainable": 139408 }, { "epoch": 1.1953125, - "grad_norm": 0.0017230098601430655, + "grad_norm": 0.0014755144948139787, "learning_rate": 4.450201551660454e-05, - "loss": 3.198062040610239e-05, + "loss": 2.39577166212257e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00003, + "ppl": 1.00002, "step": 306, "tokens/total": 9257344, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.38, "tokens/trainable": 139840 }, { "epoch": 1.19921875, - "grad_norm": 0.06396278738975525, + "grad_norm": 0.014350412413477898, "learning_rate": 4.4219954839558276e-05, - "loss": 0.0004305330221541226, + "loss": 0.00012315387721173465, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00043, + "ppl": 1.00012, "step": 307, "tokens/total": 9287520, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 140281 }, { "epoch": 1.203125, - "grad_norm": 0.1433790922164917, + "grad_norm": 0.0019020310137420893, "learning_rate": 4.393834276419352e-05, - "loss": 0.0006829933845438063, + "loss": 2.20383644773392e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00068, + "ppl": 1.00002, "step": 308, "tokens/total": 9317888, - "tokens/train_per_sec_per_gpu": 37.44, + "tokens/train_per_sec_per_gpu": 37.31, "tokens/trainable": 140776 }, { "epoch": 1.20703125, - "grad_norm": 0.3920465111732483, + "grad_norm": 0.0015318727819249034, "learning_rate": 4.36571910095382e-05, - "loss": 0.005061979405581951, + "loss": 2.580175168986898e-05, "memory/device_reserved (GiB)": 35.72, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00507, + "ppl": 1.00003, "step": 309, "tokens/total": 9348256, - "tokens/train_per_sec_per_gpu": 36.89, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 141228 }, { "epoch": 1.2109375, - "grad_norm": 0.016641858965158463, + "grad_norm": 0.00613615894690156, "learning_rate": 4.337651127546448e-05, - "loss": 0.0001797095756046474, + "loss": 6.0944184951949865e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00018, + "ppl": 1.00006, "step": 310, "tokens/total": 9378560, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.19, "tokens/trainable": 141679 }, { "epoch": 1.21484375, - "grad_norm": 0.0008492676424793899, + "grad_norm": 0.001598753617145121, "learning_rate": 4.3096315242201736e-05, - "loss": 1.9429104213486426e-05, + "loss": 2.0053470507264137e-05, "memory/device_reserved (GiB)": 35.74, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 311, "tokens/total": 9408848, - "tokens/train_per_sec_per_gpu": 32.27, + "tokens/train_per_sec_per_gpu": 32.25, "tokens/trainable": 142122 }, { "epoch": 1.21875, - "grad_norm": 0.04300769418478012, + "grad_norm": 0.0007549300789833069, "learning_rate": 4.2816614569850635e-05, - "loss": 0.0005121674039401114, + "loss": 1.628213794901967e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00051, + "ppl": 1.00002, "step": 312, "tokens/total": 9439344, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.01, "tokens/trainable": 142561 }, { "epoch": 1.22265625, - "grad_norm": 0.023457281291484833, + "grad_norm": 0.00085266592213884, "learning_rate": 4.2537420897897864e-05, - "loss": 0.000151450076373294, + "loss": 1.5117442671908066e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00015, + "ppl": 1.00002, "step": 313, "tokens/total": 9469792, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.55, "tokens/trainable": 143046 }, { "epoch": 1.2265625, - "grad_norm": 0.06128578260540962, + "grad_norm": 0.02262088656425476, "learning_rate": 4.225874584473174e-05, - "loss": 0.0006227570120245218, + "loss": 0.00013078594929538667, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00062, + "ppl": 1.00013, "step": 314, "tokens/total": 9500128, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 143493 }, { "epoch": 1.23046875, - "grad_norm": 0.007639073766767979, + "grad_norm": 0.00101909798104316, "learning_rate": 4.19806010071587e-05, - "loss": 7.468041440006346e-05, + "loss": 1.9173825421603397e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00007, + "ppl": 1.00002, "step": 315, "tokens/total": 9530480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 143956 }, { "epoch": 1.234375, - "grad_norm": 0.35354724526405334, + "grad_norm": 0.023366861045360565, "learning_rate": 4.170299795992081e-05, - "loss": 0.004370104521512985, + "loss": 0.0001811327674658969, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00438, + "ppl": 1.00018, "step": 316, "tokens/total": 9560912, - "tokens/train_per_sec_per_gpu": 33.93, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 144411 }, { "epoch": 1.23828125, - "grad_norm": 0.5020444989204407, + "grad_norm": 0.011399022303521633, "learning_rate": 4.142594825521398e-05, - "loss": 0.010973826982080936, + "loss": 0.00012808202882297337, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01103, + "ppl": 1.00013, "step": 317, "tokens/total": 9591344, - "tokens/train_per_sec_per_gpu": 38.48, + "tokens/train_per_sec_per_gpu": 38.66, "tokens/trainable": 144892 }, { "epoch": 1.2421875, - "grad_norm": 0.0027349034789949656, + "grad_norm": 0.5837145447731018, "learning_rate": 4.114946342220728e-05, - "loss": 4.4591506593860686e-05, + "loss": 0.006938215810805559, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00004, + "ppl": 1.00696, "step": 318, "tokens/total": 9621392, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 145339 }, { "epoch": 1.24609375, - "grad_norm": 0.013429106213152409, + "grad_norm": 0.0007919945055618882, "learning_rate": 4.087355496656321e-05, - "loss": 8.016972424229607e-05, + "loss": 1.6890848201001063e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 319, "tokens/total": 9651728, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.38, "tokens/trainable": 145811 }, { "epoch": 1.25, - "grad_norm": 0.02254675142467022, + "grad_norm": 0.025993503630161285, "learning_rate": 4.05982343699588e-05, - "loss": 0.00017163707525469363, + "loss": 0.0002537990512792021, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00017, + "ppl": 1.00025, "step": 320, "tokens/total": 9682224, - "tokens/train_per_sec_per_gpu": 38.76, + "tokens/train_per_sec_per_gpu": 38.62, "tokens/trainable": 146314 }, { "epoch": 1.25390625, - "grad_norm": 0.04359544813632965, + "grad_norm": 0.0010733718518167734, "learning_rate": 4.0323513089607876e-05, - "loss": 0.0005239051533862948, + "loss": 1.948333010659553e-05, "memory/device_reserved (GiB)": 37.95, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00052, + "ppl": 1.00002, "step": 321, "tokens/total": 9712656, - "tokens/train_per_sec_per_gpu": 31.85, + "tokens/train_per_sec_per_gpu": 31.72, "tokens/trainable": 146781 }, { "epoch": 1.2578125, - "grad_norm": 0.02377651259303093, + "grad_norm": 0.0843457579612732, "learning_rate": 4.004940255778431e-05, - "loss": 0.0001890905696200207, + "loss": 0.0008847219287417829, "memory/device_reserved (GiB)": 34.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00019, + "ppl": 1.00089, "step": 322, "tokens/total": 9743088, "tokens/train_per_sec_per_gpu": 35.55, @@ -4519,69 +4519,69 @@ }, { "epoch": 1.26171875, - "grad_norm": 0.01256605889648199, + "grad_norm": 0.09092428535223007, "learning_rate": 3.977591418134619e-05, - "loss": 8.730488480068743e-05, + "loss": 0.00040022452594712377, "memory/device_reserved (GiB)": 35.17, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00009, + "ppl": 1.0004, "step": 323, "tokens/total": 9773808, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 147673 }, { "epoch": 1.265625, - "grad_norm": 0.21066401898860931, + "grad_norm": 0.3859696090221405, "learning_rate": 3.95030593412612e-05, - "loss": 0.0028422519098967314, + "loss": 0.004064415581524372, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00285, + "ppl": 1.00407, "step": 324, "tokens/total": 9804016, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 148103 }, { "epoch": 1.26953125, - "grad_norm": 0.025614596903324127, + "grad_norm": 0.000418124720454216, "learning_rate": 3.923084939213296e-05, - "loss": 0.00016133410099428147, + "loss": 9.266825145459734e-06, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00016, + "ppl": 1.00001, "step": 325, "tokens/total": 9834592, - "tokens/train_per_sec_per_gpu": 31.73, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 148535 }, { "epoch": 1.2734375, - "grad_norm": 0.033190563321113586, + "grad_norm": 0.030438628047704697, "learning_rate": 3.895929566172861e-05, - "loss": 0.00033758440986275673, + "loss": 0.00029550789622589946, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00034, + "ppl": 1.0003, "step": 326, "tokens/total": 9864848, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 148999 }, { "epoch": 1.27734375, - "grad_norm": 0.07407072931528091, + "grad_norm": 0.0003460803418420255, "learning_rate": 3.868840945050728e-05, - "loss": 0.0007672893116250634, + "loss": 9.424240488442592e-06, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00077, + "ppl": 1.00001, "step": 327, "tokens/total": 9895168, "tokens/train_per_sec_per_gpu": 31.64, @@ -4589,125 +4589,125 @@ }, { "epoch": 1.28125, - "grad_norm": 0.05904461070895195, + "grad_norm": 0.32631534337997437, "learning_rate": 3.841820203114995e-05, - "loss": 0.000713472138158977, + "loss": 0.004381683189421892, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00071, + "ppl": 1.00439, "step": 328, "tokens/total": 9925696, - "tokens/train_per_sec_per_gpu": 34.11, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 149886 }, { "epoch": 1.28515625, - "grad_norm": 0.007630123756825924, + "grad_norm": 0.06805918365716934, "learning_rate": 3.814868464809027e-05, - "loss": 7.993751933099702e-05, + "loss": 0.0003639076603576541, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00036, "step": 329, "tokens/total": 9955648, - "tokens/train_per_sec_per_gpu": 30.98, + "tokens/train_per_sec_per_gpu": 31.01, "tokens/trainable": 150288 }, { "epoch": 1.2890625, - "grad_norm": 0.024742672219872475, + "grad_norm": 0.004817479755729437, "learning_rate": 3.787986851704667e-05, - "loss": 0.00019552679441403598, + "loss": 3.246869164286181e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.0002, + "ppl": 1.00003, "step": 330, "tokens/total": 9985856, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 150733 }, { "epoch": 1.29296875, - "grad_norm": 0.006353198084980249, + "grad_norm": 0.06923647969961166, "learning_rate": 3.7611764824555654e-05, - "loss": 0.00010314649261999875, + "loss": 0.00031070224940776825, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0001, + "ppl": 1.00031, "step": 331, "tokens/total": 10016208, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 151207 }, { "epoch": 1.296875, - "grad_norm": 0.16203969717025757, + "grad_norm": 0.14731979370117188, "learning_rate": 3.734438472750619e-05, - "loss": 0.0014735229779034853, + "loss": 0.0015139597235247493, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00147, + "ppl": 1.00152, "step": 332, "tokens/total": 10046512, - "tokens/train_per_sec_per_gpu": 37.5, + "tokens/train_per_sec_per_gpu": 37.61, "tokens/trainable": 151694 }, { "epoch": 1.30078125, - "grad_norm": 0.041821569204330444, + "grad_norm": 0.007325666956603527, "learning_rate": 3.707773935267552e-05, - "loss": 0.0004190094769001007, + "loss": 7.809747330611572e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00042, + "ppl": 1.00008, "step": 333, "tokens/total": 10076944, - "tokens/train_per_sec_per_gpu": 38.27, + "tokens/train_per_sec_per_gpu": 38.37, "tokens/trainable": 152188 }, { "epoch": 1.3046875, - "grad_norm": 0.0011248595546931028, + "grad_norm": 0.00047597952652722597, "learning_rate": 3.68118397962661e-05, - "loss": 3.350014958414249e-05, + "loss": 1.2739032172248699e-05, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00001, "step": 334, "tokens/total": 10107296, - "tokens/train_per_sec_per_gpu": 30.6, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 152596 }, { "epoch": 1.30859375, - "grad_norm": 0.003707638941705227, + "grad_norm": 0.0700320228934288, "learning_rate": 3.654669712344384e-05, - "loss": 4.684936357080005e-05, + "loss": 0.00047467637341469526, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00047, "step": 335, "tokens/total": 10137568, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 153052 }, { "epoch": 1.3125, - "grad_norm": 0.0017528374446555972, + "grad_norm": 0.06498395651578903, "learning_rate": 3.628232236787763e-05, - "loss": 2.3632102966075763e-05, + "loss": 0.00041414948645979166, "memory/device_reserved (GiB)": 37.17, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00002, + "ppl": 1.00041, "step": 336, "tokens/total": 10167952, "tokens/train_per_sec_per_gpu": 30.19, @@ -4715,1105 +4715,1105 @@ }, { "epoch": 1.31640625, - "grad_norm": 0.0626155436038971, + "grad_norm": 0.009991639293730259, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0006341143744066358, + "loss": 7.060338975861669e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00063, + "ppl": 1.00007, "step": 337, "tokens/total": 10198512, - "tokens/train_per_sec_per_gpu": 40.28, + "tokens/train_per_sec_per_gpu": 40.43, "tokens/trainable": 153983 }, { "epoch": 1.3203125, - "grad_norm": 0.0166204534471035, + "grad_norm": 0.03267490491271019, "learning_rate": 3.575592058295017e-05, - "loss": 0.00015405623707920313, + "loss": 0.0002045792352873832, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00015, + "ppl": 1.0002, "step": 338, "tokens/total": 10228752, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.72, "tokens/trainable": 154464 }, { "epoch": 1.32421875, - "grad_norm": 0.0004508346610236913, + "grad_norm": 0.00039529221248812973, "learning_rate": 3.549391545931585e-05, - "loss": 8.604627510067075e-06, + "loss": 8.338471161550842e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 339, "tokens/total": 10259104, - "tokens/train_per_sec_per_gpu": 35.73, + "tokens/train_per_sec_per_gpu": 35.87, "tokens/trainable": 154924 }, { "epoch": 1.328125, - "grad_norm": 0.0024134982377290726, + "grad_norm": 0.0010571131715551019, "learning_rate": 3.5232722063479914e-05, - "loss": 4.25071848439984e-05, + "loss": 1.6815669368952513e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00004, + "ppl": 1.00002, "step": 340, "tokens/total": 10289520, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 155373 }, { "epoch": 1.33203125, - "grad_norm": 0.047796547412872314, + "grad_norm": 0.0008337291656062007, "learning_rate": 3.49723512647657e-05, - "loss": 0.0004414983559399843, + "loss": 1.703310408629477e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00044, + "ppl": 1.00002, "step": 341, "tokens/total": 10320016, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 155873 }, { "epoch": 1.3359375, - "grad_norm": 0.0013580132508650422, + "grad_norm": 0.0007872325950302184, "learning_rate": 3.471281389826491e-05, - "loss": 3.1043862691149116e-05, + "loss": 1.626565062906593e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00002, "step": 342, "tokens/total": 10350368, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.42, "tokens/trainable": 156278 }, { "epoch": 1.33984375, - "grad_norm": 0.013898961246013641, + "grad_norm": 0.21220935881137848, "learning_rate": 3.4454120764386764e-05, - "loss": 9.816634701564908e-05, + "loss": 0.0009314992348663509, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00093, "step": 343, "tokens/total": 10380624, - "tokens/train_per_sec_per_gpu": 35.31, + "tokens/train_per_sec_per_gpu": 35.4, "tokens/trainable": 156733 }, { "epoch": 1.34375, - "grad_norm": 0.0031031679827719927, + "grad_norm": 0.017469989135861397, "learning_rate": 3.4196282628408526e-05, - "loss": 4.329531657276675e-05, + "loss": 7.496406033169478e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00004, + "ppl": 1.00007, "step": 344, "tokens/total": 10411024, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 157203 }, { "epoch": 1.34765625, - "grad_norm": 0.009028271771967411, + "grad_norm": 0.2605672776699066, "learning_rate": 3.3939310220027456e-05, - "loss": 0.00010301935981260613, + "loss": 0.004417422227561474, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00443, "step": 345, "tokens/total": 10441248, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 157707 }, { "epoch": 1.3515625, - "grad_norm": 0.0036287850234657526, + "grad_norm": 0.00032958327210508287, "learning_rate": 3.3683214232914404e-05, - "loss": 4.620348772732541e-05, + "loss": 7.68474092183169e-06, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00005, + "ppl": 1.00001, "step": 346, "tokens/total": 10471712, - "tokens/train_per_sec_per_gpu": 34.96, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 158180 }, { "epoch": 1.35546875, - "grad_norm": 0.08971801400184631, + "grad_norm": 0.0021204655058681965, "learning_rate": 3.342800532426873e-05, - "loss": 0.0009501657332293689, + "loss": 2.9396429454209283e-05, "memory/device_reserved (GiB)": 38.13, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00095, + "ppl": 1.00003, "step": 347, "tokens/total": 10502288, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.41, "tokens/trainable": 158646 }, { "epoch": 1.359375, - "grad_norm": 0.00890435092151165, + "grad_norm": 0.00040693042683415115, "learning_rate": 3.317369411437484e-05, - "loss": 7.783617911627516e-05, + "loss": 9.5013465397642e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00001, "step": 348, "tokens/total": 10532304, - "tokens/train_per_sec_per_gpu": 35.59, + "tokens/train_per_sec_per_gpu": 35.66, "tokens/trainable": 159115 }, { "epoch": 1.36328125, - "grad_norm": 0.023319199681282043, + "grad_norm": 0.006379029247909784, "learning_rate": 3.292029118616024e-05, - "loss": 0.00021630006085615605, + "loss": 9.018932178150862e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00022, + "ppl": 1.00009, "step": 349, "tokens/total": 10562608, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 159538 }, { "epoch": 1.3671875, - "grad_norm": 0.047880928963422775, + "grad_norm": 0.005555902142077684, "learning_rate": 3.266780708475511e-05, - "loss": 0.00044884331873618066, + "loss": 5.1456365326885134e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00045, + "ppl": 1.00005, "step": 350, "tokens/total": 10592992, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.22, "tokens/trainable": 160016 }, { "epoch": 1.37109375, - "grad_norm": 0.008666309528052807, + "grad_norm": 0.009832990355789661, "learning_rate": 3.241625231705354e-05, - "loss": 5.017036892240867e-05, + "loss": 9.037736163008958e-05, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00005, + "ppl": 1.00009, "step": 351, "tokens/total": 10623328, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.57, "tokens/trainable": 160475 }, { "epoch": 1.375, - "grad_norm": 0.06452610343694687, + "grad_norm": 0.0002588493807706982, "learning_rate": 3.216563735127618e-05, - "loss": 0.0007272367365658283, + "loss": 7.509744136768859e-06, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00073, + "ppl": 1.00001, "step": 352, "tokens/total": 10653632, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 160952 }, { "epoch": 1.37890625, - "grad_norm": 0.370597779750824, + "grad_norm": 0.03195308893918991, "learning_rate": 3.191597261653475e-05, - "loss": 0.007550997193902731, + "loss": 0.0002666166110429913, "memory/device_reserved (GiB)": 38.4, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00758, + "ppl": 1.00027, "step": 353, "tokens/total": 10684176, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 161420 }, { "epoch": 1.3828125, - "grad_norm": 0.0031376827973872423, + "grad_norm": 0.07012991607189178, "learning_rate": 3.166726850239794e-05, - "loss": 2.3453332687495276e-05, + "loss": 0.000741704716347158, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00074, "step": 354, "tokens/total": 10714352, - "tokens/train_per_sec_per_gpu": 34.02, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 161868 }, { "epoch": 1.38671875, - "grad_norm": 0.0021399864926934242, + "grad_norm": 0.0005822654929943383, "learning_rate": 3.141953535845912e-05, - "loss": 2.5832894607447088e-05, + "loss": 1.0378402294008993e-05, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00001, "step": 355, "tokens/total": 10744464, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 162318 }, { "epoch": 1.390625, - "grad_norm": 0.0028148347046226263, + "grad_norm": 0.012435230426490307, "learning_rate": 3.11727834939056e-05, - "loss": 3.7286932638380677e-05, + "loss": 7.89838086348027e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00008, "step": 356, "tokens/total": 10774976, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.54, "tokens/trainable": 162789 }, { "epoch": 1.39453125, - "grad_norm": 0.1642119586467743, + "grad_norm": 0.0045598647557199, "learning_rate": 3.092702317708967e-05, - "loss": 0.0027845175936818123, + "loss": 2.48450869548833e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00279, + "ppl": 1.00002, "step": 357, "tokens/total": 10805600, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.43, "tokens/trainable": 163254 }, { "epoch": 1.3984375, - "grad_norm": 0.066535085439682, + "grad_norm": 0.3044262230396271, "learning_rate": 3.0682264635101276e-05, - "loss": 0.0002488417667336762, + "loss": 0.002298796083778143, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00025, + "ppl": 1.0023, "step": 358, "tokens/total": 10835920, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.62, "tokens/trainable": 163715 }, { "epoch": 1.40234375, - "grad_norm": 0.006617655046284199, + "grad_norm": 0.002458421979099512, "learning_rate": 3.0438518053342407e-05, - "loss": 7.841112528694794e-05, + "loss": 1.9634167983895168e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00002, "step": 359, "tokens/total": 10866048, - "tokens/train_per_sec_per_gpu": 34.4, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 164197 }, { "epoch": 1.40625, - "grad_norm": 0.010409035719931126, + "grad_norm": 0.0024773837067186832, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010489403939573094, + "loss": 2.744927041931078e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00003, "step": 360, "tokens/total": 10896288, - "tokens/train_per_sec_per_gpu": 31.6, + "tokens/train_per_sec_per_gpu": 31.74, "tokens/trainable": 164661 }, { "epoch": 1.41015625, - "grad_norm": 0.002426267135888338, + "grad_norm": 0.00026717092259787023, "learning_rate": 2.9954101301140146e-05, - "loss": 4.0343060391023755e-05, + "loss": 6.422977094189264e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00001, "step": 361, "tokens/total": 10926816, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 165111 }, { "epoch": 1.4140625, - "grad_norm": 0.015666797757148743, + "grad_norm": 0.0008353493758477271, "learning_rate": 2.9713451289255123e-05, - "loss": 0.00014991794887464494, + "loss": 1.3549893083109055e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00015, + "ppl": 1.00001, "step": 362, "tokens/total": 10954928, - "tokens/train_per_sec_per_gpu": 30.34, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 165552 }, { "epoch": 1.41796875, - "grad_norm": 0.2695651650428772, + "grad_norm": 0.006071125157177448, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0014983330620452762, + "loss": 6.428411870729178e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.0015, + "ppl": 1.00006, "step": 363, "tokens/total": 10985328, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 166026 }, { "epoch": 1.421875, - "grad_norm": 0.03586212173104286, + "grad_norm": 0.25424960255622864, "learning_rate": 2.9235318065647e-05, - "loss": 0.00030509717180393636, + "loss": 0.004243595991283655, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00031, + "ppl": 1.00425, "step": 364, "tokens/total": 11015664, - "tokens/train_per_sec_per_gpu": 37.86, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 166486 }, { "epoch": 1.42578125, - "grad_norm": 0.0019308789633214474, + "grad_norm": 0.0005575277027674019, "learning_rate": 2.8997854750998964e-05, - "loss": 2.4129443772835657e-05, + "loss": 8.403902938880492e-06, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00001, "step": 365, "tokens/total": 11046256, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 166959 }, { "epoch": 1.4296875, - "grad_norm": 0.005940837785601616, + "grad_norm": 0.0014335239538922906, "learning_rate": 2.8761473491751258e-05, - "loss": 2.8238933737156913e-05, + "loss": 1.4738036043127067e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.68, "memory/max_allocated (GiB)": 33.68, - "ppl": 1.00003, + "ppl": 1.00001, "step": 366, "tokens/total": 11076288, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 167394 }, { "epoch": 1.43359375, - "grad_norm": 0.002125627128407359, + "grad_norm": 0.0010152696631848812, "learning_rate": 2.8526184124692883e-05, - "loss": 1.602789416210726e-05, + "loss": 1.3278609912958927e-05, "memory/device_reserved (GiB)": 36.01, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00001, "step": 367, "tokens/total": 11106416, - "tokens/train_per_sec_per_gpu": 28.5, + "tokens/train_per_sec_per_gpu": 28.58, "tokens/trainable": 167832 }, { "epoch": 1.4375, - "grad_norm": 0.2510211765766144, + "grad_norm": 0.11941836029291153, "learning_rate": 2.829199644117484e-05, - "loss": 0.00010395953722763807, + "loss": 0.0006476733833551407, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00065, "step": 368, "tokens/total": 11136848, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 31.02, "tokens/trainable": 168242 }, { "epoch": 1.44140625, - "grad_norm": 0.001904280623421073, + "grad_norm": 0.006877629552036524, "learning_rate": 2.8058920186702553e-05, - "loss": 2.6418363631819375e-05, + "loss": 7.449048280250281e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00007, "step": 369, "tokens/total": 11167376, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 168715 }, { "epoch": 1.4453125, - "grad_norm": 0.0028152521699666977, + "grad_norm": 0.0007151139434427023, "learning_rate": 2.782696506053033e-05, - "loss": 2.9974533390486613e-05, + "loss": 1.1437590728746727e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00001, "step": 370, "tokens/total": 11197776, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.86, "tokens/trainable": 169147 }, { "epoch": 1.44921875, - "grad_norm": 0.0010822078911587596, + "grad_norm": 0.009094453416764736, "learning_rate": 2.7596140715257824e-05, - "loss": 1.34217716549756e-05, + "loss": 5.9242345741949975e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00006, "step": 371, "tokens/total": 11227840, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 169628 }, { "epoch": 1.453125, - "grad_norm": 0.005367911420762539, + "grad_norm": 0.000247267191298306, "learning_rate": 2.7366456756428184e-05, - "loss": 6.65646803099662e-05, + "loss": 7.548428584414069e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00007, + "ppl": 1.00001, "step": 372, "tokens/total": 11258176, - "tokens/train_per_sec_per_gpu": 35.11, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 170085 }, { "epoch": 1.45703125, - "grad_norm": 0.047570567578077316, + "grad_norm": 0.0003029497747775167, "learning_rate": 2.7137922742128486e-05, - "loss": 0.0003471036907285452, + "loss": 5.4013939916330855e-06, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00035, + "ppl": 1.00001, "step": 373, "tokens/total": 11288336, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.6, "tokens/trainable": 170584 }, { "epoch": 1.4609375, - "grad_norm": 0.040886107832193375, + "grad_norm": 0.001942179980687797, "learning_rate": 2.691054818259188e-05, - "loss": 0.0002880148240365088, + "loss": 2.380511250521522e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00029, + "ppl": 1.00002, "step": 374, "tokens/total": 11318848, - "tokens/train_per_sec_per_gpu": 34.56, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 171058 }, { "epoch": 1.46484375, - "grad_norm": 0.0031216361094266176, + "grad_norm": 0.0019308892078697681, "learning_rate": 2.6684342539801933e-05, - "loss": 2.690855944820214e-05, + "loss": 1.5233906196954194e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00003, + "ppl": 1.00002, "step": 375, "tokens/total": 11349168, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 171518 }, { "epoch": 1.46875, - "grad_norm": 0.012176645919680595, + "grad_norm": 0.6044301986694336, "learning_rate": 2.645931522709877e-05, - "loss": 8.402287494391203e-05, + "loss": 0.006350134499371052, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00008, + "ppl": 1.00637, "step": 376, "tokens/total": 11379328, - "tokens/train_per_sec_per_gpu": 40.48, + "tokens/train_per_sec_per_gpu": 40.62, "tokens/trainable": 172007 }, { "epoch": 1.47265625, - "grad_norm": 0.24136756360530853, + "grad_norm": 0.25446587800979614, "learning_rate": 2.6235475608787365e-05, - "loss": 0.0013303000014275312, + "loss": 0.0018724403344094753, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00133, + "ppl": 1.00187, "step": 377, "tokens/total": 11409568, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 172468 }, { "epoch": 1.4765625, - "grad_norm": 0.021714258939027786, + "grad_norm": 0.0019207323202863336, "learning_rate": 2.6012832999747916e-05, - "loss": 0.00020160498388577253, + "loss": 3.049923907383345e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0002, + "ppl": 1.00003, "step": 378, "tokens/total": 11439968, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 172923 }, { "epoch": 1.48046875, - "grad_norm": 0.35412073135375977, + "grad_norm": 0.33491548895835876, "learning_rate": 2.579139666504821e-05, - "loss": 0.015761105343699455, + "loss": 0.02673855796456337, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01589, + "ppl": 1.0271, "step": 379, "tokens/total": 11470496, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 173370 }, { "epoch": 1.484375, - "grad_norm": 0.005766173824667931, + "grad_norm": 0.006177723873406649, "learning_rate": 2.557117581955798e-05, - "loss": 2.5790239305933937e-05, + "loss": 5.195035191718489e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00005, "step": 380, "tokens/total": 11500720, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 173837 }, { "epoch": 1.48828125, - "grad_norm": 0.005898744333535433, + "grad_norm": 0.06973031163215637, "learning_rate": 2.5352179627565532e-05, - "loss": 5.821501690661535e-05, + "loss": 0.0006310560274869204, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00006, + "ppl": 1.00063, "step": 381, "tokens/total": 11531280, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 174294 }, { "epoch": 1.4921875, - "grad_norm": 0.005451703444123268, + "grad_norm": 0.0039021887350827456, "learning_rate": 2.5134417202396277e-05, - "loss": 4.0181505028158426e-05, + "loss": 4.849781544180587e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00005, "step": 382, "tokens/total": 11561264, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.84, "tokens/trainable": 174701 }, { "epoch": 1.49609375, - "grad_norm": 0.0038302047178149223, + "grad_norm": 0.0007975143962539732, "learning_rate": 2.491789760603361e-05, - "loss": 3.403786467970349e-05, + "loss": 2.3489263185183518e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00002, "step": 383, "tokens/total": 11591616, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.05, "tokens/trainable": 175131 }, { "epoch": 1.5, - "grad_norm": 0.004227485507726669, + "grad_norm": 0.012541128322482109, "learning_rate": 2.4702629848741764e-05, - "loss": 3.562243364285678e-05, + "loss": 0.00011495217040646821, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00004, + "ppl": 1.00011, "step": 384, "tokens/total": 11622000, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 175586 }, { "epoch": 1.50390625, - "grad_norm": 0.013361346907913685, + "grad_norm": 0.004752015229314566, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0001464220113120973, + "loss": 6.502695032395422e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00007, "step": 385, "tokens/total": 11652352, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176026 }, { "epoch": 1.5078125, - "grad_norm": 0.008831475861370564, + "grad_norm": 0.014192809350788593, "learning_rate": 2.427588563158384e-05, - "loss": 8.2662510976661e-05, + "loss": 8.075163350440562e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00008, "step": 386, "tokens/total": 11682736, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.91, "tokens/trainable": 176512 }, { "epoch": 1.51171875, - "grad_norm": 0.009311008267104626, + "grad_norm": 0.007288333959877491, "learning_rate": 2.406442693028651e-05, - "loss": 0.0001226613821927458, + "loss": 8.845872798701748e-05, "memory/device_reserved (GiB)": 34.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00009, "step": 387, "tokens/total": 11713136, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.45, "tokens/trainable": 176943 }, { "epoch": 1.515625, - "grad_norm": 0.0017816838808357716, + "grad_norm": 0.10162956267595291, "learning_rate": 2.3854255584458547e-05, - "loss": 2.3221660740091465e-05, + "loss": 0.0007253064541146159, "memory/device_reserved (GiB)": 35.23, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00002, + "ppl": 1.00073, "step": 388, "tokens/total": 11743808, - "tokens/train_per_sec_per_gpu": 32.06, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 177370 }, { "epoch": 1.51953125, - "grad_norm": 0.023602057248353958, + "grad_norm": 0.005729300435632467, "learning_rate": 2.3645380340187508e-05, - "loss": 0.00012638044427148998, + "loss": 8.652975520817563e-05, "memory/device_reserved (GiB)": 35.58, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00013, + "ppl": 1.00009, "step": 389, "tokens/total": 11774144, - "tokens/train_per_sec_per_gpu": 35.14, + "tokens/train_per_sec_per_gpu": 35.2, "tokens/trainable": 177851 }, { "epoch": 1.5234375, - "grad_norm": 0.04383797571063042, + "grad_norm": 0.0715414360165596, "learning_rate": 2.3437809889624914e-05, - "loss": 0.0004640861588995904, + "loss": 0.0007950748549774289, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00046, + "ppl": 1.0008, "step": 390, "tokens/total": 11804272, - "tokens/train_per_sec_per_gpu": 34.68, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 178310 }, { "epoch": 1.52734375, - "grad_norm": 0.061932601034641266, + "grad_norm": 0.009775097481906414, "learning_rate": 2.3231552870624487e-05, - "loss": 0.00033243370126001537, + "loss": 0.00010615254723234102, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00033, + "ppl": 1.00011, "step": 391, "tokens/total": 11832432, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.73, "tokens/trainable": 178736 }, { "epoch": 1.53125, - "grad_norm": 0.04983547702431679, + "grad_norm": 0.0015552763361483812, "learning_rate": 2.3026617866382657e-05, - "loss": 0.000599355495069176, + "loss": 2.954876617877744e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0006, + "ppl": 1.00003, "step": 392, "tokens/total": 11862960, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 179233 }, { "epoch": 1.53515625, - "grad_norm": 0.012036106549203396, + "grad_norm": 0.026106838136911392, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0001237639953615144, + "loss": 0.00021109850786160678, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00012, + "ppl": 1.00021, "step": 393, "tokens/total": 11893232, - "tokens/train_per_sec_per_gpu": 38.49, + "tokens/train_per_sec_per_gpu": 38.57, "tokens/trainable": 179730 }, { "epoch": 1.5390625, - "grad_norm": 0.008992817252874374, + "grad_norm": 0.020347680896520615, "learning_rate": 2.2620747959533722e-05, - "loss": 0.00010385089262854308, + "loss": 0.0002601295418571681, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0001, + "ppl": 1.00026, "step": 394, "tokens/total": 11923664, - "tokens/train_per_sec_per_gpu": 37.81, + "tokens/train_per_sec_per_gpu": 37.87, "tokens/trainable": 180227 }, { "epoch": 1.54296875, - "grad_norm": 0.24631057679653168, + "grad_norm": 0.005419979803264141, "learning_rate": 2.2419829946830123e-05, - "loss": 0.0031685903668403625, + "loss": 4.929217175231315e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00317, + "ppl": 1.00005, "step": 395, "tokens/total": 11954032, - "tokens/train_per_sec_per_gpu": 32.85, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 180687 }, { "epoch": 1.546875, - "grad_norm": 0.06871633976697922, + "grad_norm": 0.0031002764590084553, "learning_rate": 2.2220267727989325e-05, - "loss": 0.0005168755305930972, + "loss": 6.144218787085265e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00052, + "ppl": 1.00006, "step": 396, "tokens/total": 11984512, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 181141 }, { "epoch": 1.55078125, - "grad_norm": 0.011674679815769196, + "grad_norm": 0.006748533807694912, "learning_rate": 2.202206960760984e-05, - "loss": 0.00017496946384198964, + "loss": 9.171784040518105e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00017, + "ppl": 1.00009, "step": 397, "tokens/total": 12014880, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 36.02, "tokens/trainable": 181648 }, { "epoch": 1.5546875, - "grad_norm": 0.14610664546489716, + "grad_norm": 0.08927815407514572, "learning_rate": 2.182524383352446e-05, - "loss": 0.0014660547021776438, + "loss": 0.001000746968202293, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00147, + "ppl": 1.001, "step": 398, "tokens/total": 12044928, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 182109 }, { "epoch": 1.55859375, - "grad_norm": 0.016359565779566765, + "grad_norm": 0.004651801194995642, "learning_rate": 2.1629798596457056e-05, - "loss": 7.928608101792634e-05, + "loss": 5.3439554903889075e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00008, + "ppl": 1.00005, "step": 399, "tokens/total": 12075344, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.58, "tokens/trainable": 182559 }, { "epoch": 1.5625, - "grad_norm": 0.0010484450031071901, + "grad_norm": 0.0017514342907816172, "learning_rate": 2.1435742029681725e-05, - "loss": 1.526270352769643e-05, + "loss": 4.570486271404661e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00005, "step": 400, "tokens/total": 12105616, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.17, "tokens/trainable": 182985 }, { "epoch": 1.56640625, - "grad_norm": 0.0005900752730667591, + "grad_norm": 0.01574699766933918, "learning_rate": 2.124308220868431e-05, - "loss": 1.2166316082584672e-05, + "loss": 0.0001242965809069574, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00012, "step": 401, "tokens/total": 12136080, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 183440 }, { "epoch": 1.5703125, - "grad_norm": 0.013194791041314602, + "grad_norm": 0.007152364123612642, "learning_rate": 2.105182715082638e-05, - "loss": 0.0001970212033484131, + "loss": 0.0001222842838615179, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.0002, + "ppl": 1.00012, "step": 402, "tokens/total": 12166240, - "tokens/train_per_sec_per_gpu": 34.52, + "tokens/train_per_sec_per_gpu": 34.51, "tokens/trainable": 183917 }, { "epoch": 1.57421875, - "grad_norm": 0.02566305734217167, + "grad_norm": 0.0015342400874942541, "learning_rate": 2.0861984815011552e-05, - "loss": 0.00022389904188457876, + "loss": 3.621872019721195e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00022, + "ppl": 1.00004, "step": 403, "tokens/total": 12196544, - "tokens/train_per_sec_per_gpu": 30.39, + "tokens/train_per_sec_per_gpu": 30.36, "tokens/trainable": 184348 }, { "epoch": 1.578125, - "grad_norm": 0.008275284431874752, + "grad_norm": 0.0035214691888540983, "learning_rate": 2.0673563101354323e-05, - "loss": 8.35009923321195e-05, + "loss": 6.367819150909781e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00006, "step": 404, "tokens/total": 12226784, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 184786 }, { "epoch": 1.58203125, - "grad_norm": 0.038177311420440674, + "grad_norm": 0.0007211520569398999, "learning_rate": 2.0486569850851317e-05, - "loss": 0.00018527230713516474, + "loss": 2.0325338482507505e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00019, + "ppl": 1.00002, "step": 405, "tokens/total": 12257264, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 185249 }, { "epoch": 1.5859375, - "grad_norm": 0.007672510575503111, + "grad_norm": 0.0014804014936089516, "learning_rate": 2.0301012845054956e-05, - "loss": 0.00011439670925028622, + "loss": 3.379736153874546e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00003, "step": 406, "tokens/total": 12287584, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 185680 }, { "epoch": 1.58984375, - "grad_norm": 0.003159885760396719, + "grad_norm": 0.004397980403155088, "learning_rate": 2.011689980574966e-05, - "loss": 4.649449692806229e-05, + "loss": 5.1796458137687296e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00005, "step": 407, "tokens/total": 12317984, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 186100 }, { "epoch": 1.59375, - "grad_norm": 0.32744285464286804, + "grad_norm": 0.0026473007164895535, "learning_rate": 1.993423839463052e-05, - "loss": 0.002739987801760435, + "loss": 3.441090666456148e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00274, + "ppl": 1.00003, "step": 408, "tokens/total": 12348144, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.84, "tokens/trainable": 186565 }, { "epoch": 1.59765625, - "grad_norm": 0.0006675662589259446, + "grad_norm": 0.0289909727871418, "learning_rate": 1.975303621298445e-05, - "loss": 1.2970660463906825e-05, + "loss": 0.00021602815832011402, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00022, "step": 409, "tokens/total": 12378544, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 187017 }, { "epoch": 1.6015625, - "grad_norm": 0.003976705949753523, + "grad_norm": 0.007092812564224005, "learning_rate": 1.957330080137385e-05, - "loss": 3.857718547806144e-05, + "loss": 9.646185935707763e-05, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.0001, "step": 410, "tokens/total": 12408784, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 187468 }, { "epoch": 1.60546875, - "grad_norm": 0.0024577646981924772, + "grad_norm": 0.02710823155939579, "learning_rate": 1.9395039639322864e-05, - "loss": 2.431379834888503e-05, + "loss": 0.0003458422143012285, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00002, + "ppl": 1.00035, "step": 411, "tokens/total": 12438832, - "tokens/train_per_sec_per_gpu": 37.61, + "tokens/train_per_sec_per_gpu": 37.57, "tokens/trainable": 187961 }, { "epoch": 1.609375, - "grad_norm": 0.003754909848794341, + "grad_norm": 0.29485711455345154, "learning_rate": 1.9218260145006073e-05, - "loss": 4.119630830246024e-05, + "loss": 0.0032923028338700533, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.0033, "step": 412, "tokens/total": 12469296, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 188447 }, { "epoch": 1.61328125, - "grad_norm": 0.3583323657512665, + "grad_norm": 0.22881586849689484, "learning_rate": 1.904296967493982e-05, - "loss": 0.004735157359391451, + "loss": 0.0035809341352432966, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00475, + "ppl": 1.00359, "step": 413, "tokens/total": 12499392, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 188903 }, { "epoch": 1.6171875, - "grad_norm": 0.049485232681035995, + "grad_norm": 0.0026347371749579906, "learning_rate": 1.8869175523676064e-05, - "loss": 0.00019404500199016184, + "loss": 6.0475373174995184e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.00006, "step": 414, "tokens/total": 12529952, - "tokens/train_per_sec_per_gpu": 36.7, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 189398 }, { "epoch": 1.62109375, - "grad_norm": 0.0030447980388998985, + "grad_norm": 0.0017223359318450093, "learning_rate": 1.869688492349885e-05, - "loss": 2.0038012735312805e-05, + "loss": 4.137849100516178e-05, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00004, "step": 415, "tokens/total": 12560240, "tokens/train_per_sec_per_gpu": 34.16, @@ -5821,293 +5821,293 @@ }, { "epoch": 1.625, - "grad_norm": 0.25415608286857605, + "grad_norm": 0.011837545782327652, "learning_rate": 1.85261050441233e-05, - "loss": 0.0016201161779463291, + "loss": 0.00011106643069069833, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00162, + "ppl": 1.00011, "step": 416, "tokens/total": 12590736, - "tokens/train_per_sec_per_gpu": 32.64, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 190306 }, { "epoch": 1.62890625, - "grad_norm": 0.006711115129292011, + "grad_norm": 0.01777251996099949, "learning_rate": 1.8356842992397304e-05, - "loss": 4.321872620494105e-05, + "loss": 0.0001219596597366035, "memory/device_reserved (GiB)": 38.05, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00004, + "ppl": 1.00012, "step": 417, "tokens/total": 12621168, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 190746 }, { "epoch": 1.6328125, - "grad_norm": 0.004931971430778503, + "grad_norm": 0.003218573285266757, "learning_rate": 1.8189105812005714e-05, - "loss": 4.740363510791212e-05, + "loss": 5.22282425663434e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, "ppl": 1.00005, "step": 418, "tokens/total": 12651456, - "tokens/train_per_sec_per_gpu": 31.07, + "tokens/train_per_sec_per_gpu": 31.15, "tokens/trainable": 191156 }, { "epoch": 1.63671875, - "grad_norm": 0.007677357643842697, + "grad_norm": 0.013744015246629715, "learning_rate": 1.802290048317732e-05, - "loss": 7.545409607701004e-05, + "loss": 0.0001364837517030537, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00008, + "ppl": 1.00014, "step": 419, "tokens/total": 12681760, - "tokens/train_per_sec_per_gpu": 29.47, + "tokens/train_per_sec_per_gpu": 29.53, "tokens/trainable": 191573 }, { "epoch": 1.640625, - "grad_norm": 0.015445503406226635, + "grad_norm": 0.25013473629951477, "learning_rate": 1.785823392239424e-05, - "loss": 0.0001045453900587745, + "loss": 0.002094803610816598, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0001, + "ppl": 1.0021, "step": 420, "tokens/total": 12712144, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 192014 }, { "epoch": 1.64453125, - "grad_norm": 0.16882061958312988, + "grad_norm": 0.14290185272693634, "learning_rate": 1.7695112982104225e-05, - "loss": 0.0024146074429154396, + "loss": 0.001426510512828827, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00242, + "ppl": 1.00143, "step": 421, "tokens/total": 12742400, - "tokens/train_per_sec_per_gpu": 32.82, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 192453 }, { "epoch": 1.6484375, - "grad_norm": 0.002461223630234599, + "grad_norm": 0.0009390547638759017, "learning_rate": 1.7533544450435433e-05, - "loss": 3.336594454594888e-05, + "loss": 1.822916055971291e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00002, "step": 422, "tokens/total": 12772288, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 192886 }, { "epoch": 1.65234375, - "grad_norm": 0.0005388484569266438, + "grad_norm": 0.004544281866401434, "learning_rate": 1.7373535050913946e-05, - "loss": 8.696397344465367e-06, + "loss": 6.211431173142046e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00001, + "ppl": 1.00006, "step": 423, "tokens/total": 12802880, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.87, "tokens/trainable": 193323 }, { "epoch": 1.65625, - "grad_norm": 0.005009706597775221, + "grad_norm": 0.039859045296907425, "learning_rate": 1.721509144218405e-05, - "loss": 4.8607362259645015e-05, + "loss": 0.0005113891093060374, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00051, "step": 424, "tokens/total": 12833456, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 193753 }, { "epoch": 1.66015625, - "grad_norm": 0.001982118235900998, + "grad_norm": 0.00408409908413887, "learning_rate": 1.705822021773101e-05, - "loss": 3.262238169554621e-05, + "loss": 7.249199552461505e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00007, "step": 425, "tokens/total": 12863952, - "tokens/train_per_sec_per_gpu": 36.33, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 194240 }, { "epoch": 1.6640625, - "grad_norm": 0.05305991321802139, + "grad_norm": 0.13116440176963806, "learning_rate": 1.69029279056068e-05, - "loss": 0.0005229170201346278, + "loss": 0.0015061571029946208, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00052, + "ppl": 1.00151, "step": 426, "tokens/total": 12894352, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 194680 }, { "epoch": 1.66796875, - "grad_norm": 0.001265498693101108, + "grad_norm": 0.010440024547278881, "learning_rate": 1.6749220968158415e-05, - "loss": 1.5427456673933193e-05, + "loss": 8.445358253084123e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00008, "step": 427, "tokens/total": 12924688, - "tokens/train_per_sec_per_gpu": 38.73, + "tokens/train_per_sec_per_gpu": 38.77, "tokens/trainable": 195186 }, { "epoch": 1.671875, - "grad_norm": 0.0016263640718534589, + "grad_norm": 0.007594608701765537, "learning_rate": 1.659710580175893e-05, - "loss": 2.7778178264270537e-05, + "loss": 9.946282807504758e-05, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.0001, "step": 428, "tokens/total": 12955072, - "tokens/train_per_sec_per_gpu": 36.51, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 195693 }, { "epoch": 1.67578125, - "grad_norm": 0.013330154120922089, + "grad_norm": 0.006465950049459934, "learning_rate": 1.644658873654133e-05, - "loss": 6.972272240091115e-05, + "loss": 0.00013557568308897316, "memory/device_reserved (GiB)": 36.05, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00007, + "ppl": 1.00014, "step": 429, "tokens/total": 12985328, - "tokens/train_per_sec_per_gpu": 36.93, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 196130 }, { "epoch": 1.6796875, - "grad_norm": 0.0034615101758390665, + "grad_norm": 0.00230405549518764, "learning_rate": 1.629767603613508e-05, - "loss": 4.500148497754708e-05, + "loss": 3.7114587030373514e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00005, + "ppl": 1.00004, "step": 430, "tokens/total": 13015600, - "tokens/train_per_sec_per_gpu": 29.58, + "tokens/train_per_sec_per_gpu": 29.53, "tokens/trainable": 196530 }, { "epoch": 1.68359375, - "grad_norm": 0.03424045443534851, + "grad_norm": 0.0041900877840816975, "learning_rate": 1.615037389740547e-05, - "loss": 0.0002949235204141587, + "loss": 6.116987788118422e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00029, + "ppl": 1.00006, "step": 431, "tokens/total": 13045728, - "tokens/train_per_sec_per_gpu": 29.88, + "tokens/train_per_sec_per_gpu": 29.94, "tokens/trainable": 196974 }, { "epoch": 1.6875, - "grad_norm": 0.0064499350264668465, + "grad_norm": 0.02951621450483799, "learning_rate": 1.600468845019576e-05, - "loss": 7.787663344061002e-05, + "loss": 0.0004236411186866462, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00008, + "ppl": 1.00042, "step": 432, "tokens/total": 13075920, - "tokens/train_per_sec_per_gpu": 35.25, + "tokens/train_per_sec_per_gpu": 35.24, "tokens/trainable": 197454 }, { "epoch": 1.69140625, - "grad_norm": 0.00021908426424488425, + "grad_norm": 0.0003202867810614407, "learning_rate": 1.5860625757072092e-05, - "loss": 6.603059773624409e-06, + "loss": 1.1190046279807575e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00001, "step": 433, "tokens/total": 13106128, - "tokens/train_per_sec_per_gpu": 31.4, + "tokens/train_per_sec_per_gpu": 31.43, "tokens/trainable": 197902 }, { "epoch": 1.6953125, - "grad_norm": 0.0002612156968098134, + "grad_norm": 0.0006868013297207654, "learning_rate": 1.571819181307116e-05, - "loss": 6.425582796509843e-06, + "loss": 2.1185776859056205e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00001, + "ppl": 1.00002, "step": 434, "tokens/total": 13136368, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.06, "tokens/trainable": 198374 }, { "epoch": 1.69921875, - "grad_norm": 0.001639618189074099, + "grad_norm": 0.0025407401844859123, "learning_rate": 1.557739254545075e-05, - "loss": 2.5485322112217546e-05, + "loss": 4.928320413455367e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00003, + "ppl": 1.00005, "step": 435, "tokens/total": 13166704, - "tokens/train_per_sec_per_gpu": 37.54, + "tokens/train_per_sec_per_gpu": 37.59, "tokens/trainable": 198846 }, { "epoch": 1.703125, - "grad_norm": 0.01887959986925125, + "grad_norm": 0.0013901089550927281, "learning_rate": 1.543823381344311e-05, - "loss": 0.0002141120348824188, + "loss": 3.577578900149092e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00021, + "ppl": 1.00004, "step": 436, "tokens/total": 13197344, "tokens/train_per_sec_per_gpu": 37.67, @@ -6115,41 +6115,41 @@ }, { "epoch": 1.70703125, - "grad_norm": 0.0012294527841731906, + "grad_norm": 0.003646081080660224, "learning_rate": 1.5300721408011114e-05, - "loss": 2.316079735464882e-05, + "loss": 6.294051127042621e-05, "memory/device_reserved (GiB)": 36.06, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00006, "step": 437, "tokens/total": 13227664, - "tokens/train_per_sec_per_gpu": 37.43, + "tokens/train_per_sec_per_gpu": 37.46, "tokens/trainable": 199777 }, { "epoch": 1.7109375, - "grad_norm": 0.005585651844739914, + "grad_norm": 0.030430182814598083, "learning_rate": 1.5164861051607254e-05, - "loss": 4.5935248635942116e-05, + "loss": 0.0001770013477653265, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00005, + "ppl": 1.00018, "step": 438, "tokens/total": 13257632, - "tokens/train_per_sec_per_gpu": 30.82, + "tokens/train_per_sec_per_gpu": 30.93, "tokens/trainable": 200194 }, { "epoch": 1.71484375, - "grad_norm": 0.001553745474666357, + "grad_norm": 0.0018230377463623881, "learning_rate": 1.5030658397935521e-05, - "loss": 2.2851421817904338e-05, + "loss": 3.7613608583342284e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00002, + "ppl": 1.00004, "step": 439, "tokens/total": 13288240, "tokens/train_per_sec_per_gpu": 33.88, @@ -6157,559 +6157,559 @@ }, { "epoch": 1.71875, - "grad_norm": 0.0029791900888085365, + "grad_norm": 0.0029376039747148752, "learning_rate": 1.4898119031716104e-05, - "loss": 4.093274037586525e-05, + "loss": 4.779352093464695e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00004, + "ppl": 1.00005, "step": 440, "tokens/total": 13318992, - "tokens/train_per_sec_per_gpu": 33.79, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 201121 }, { "epoch": 1.72265625, - "grad_norm": 0.0017392379231750965, + "grad_norm": 0.0018373411148786545, "learning_rate": 1.476724846845306e-05, - "loss": 7.29740804672474e-06, + "loss": 3.149824624415487e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00003, "step": 441, "tokens/total": 13349392, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.81, "tokens/trainable": 201598 }, { "epoch": 1.7265625, - "grad_norm": 0.0009943305049091578, + "grad_norm": 0.0015428521437570453, "learning_rate": 1.463805215420471e-05, - "loss": 1.7162077710963786e-05, + "loss": 2.0810390196857043e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 442, "tokens/total": 13379648, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 202068 }, { "epoch": 1.73046875, - "grad_norm": 0.0011473585618659854, + "grad_norm": 0.0010770867811515927, "learning_rate": 1.451053546535705e-05, - "loss": 2.3819740817998536e-05, + "loss": 2.303836117789615e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00002, "step": 443, "tokens/total": 13409936, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.5, "tokens/trainable": 202524 }, { "epoch": 1.734375, - "grad_norm": 0.006799118127673864, + "grad_norm": 0.006372133269906044, "learning_rate": 1.438470370840001e-05, - "loss": 6.556943117175251e-05, + "loss": 7.449327677022666e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, "ppl": 1.00007, "step": 444, "tokens/total": 13440288, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 202996 }, { "epoch": 1.73828125, - "grad_norm": 0.0011645558988675475, + "grad_norm": 0.007094603031873703, "learning_rate": 1.4260562119706606e-05, - "loss": 1.8389995602774434e-05, + "loss": 4.211071063764393e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00004, "step": 445, "tokens/total": 13468880, - "tokens/train_per_sec_per_gpu": 39.14, + "tokens/train_per_sec_per_gpu": 39.19, "tokens/trainable": 203470 }, { "epoch": 1.7421875, - "grad_norm": 0.020891210064291954, + "grad_norm": 0.006931444630026817, "learning_rate": 1.413811586531508e-05, - "loss": 0.00016399261949118227, + "loss": 8.66219779709354e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00016, + "ppl": 1.00009, "step": 446, "tokens/total": 13499184, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 203919 }, { "epoch": 1.74609375, - "grad_norm": 0.09615519642829895, + "grad_norm": 0.0041664596647024155, "learning_rate": 1.4017370040713884e-05, - "loss": 0.0010675137164071202, + "loss": 4.786982390214689e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00107, + "ppl": 1.00005, "step": 447, "tokens/total": 13529632, - "tokens/train_per_sec_per_gpu": 33.3, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 204376 }, { "epoch": 1.75, - "grad_norm": 0.09744399785995483, + "grad_norm": 0.042264848947525024, "learning_rate": 1.3898329670629645e-05, - "loss": 0.001196134602651, + "loss": 0.00027092613163404167, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0012, + "ppl": 1.00027, "step": 448, "tokens/total": 13560080, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.06, "tokens/trainable": 204821 }, { "epoch": 1.75390625, - "grad_norm": 0.0007810555398464203, + "grad_norm": 0.00043735766666941345, "learning_rate": 1.3780999708818058e-05, - "loss": 8.019956112548243e-06, + "loss": 1.2837479516747408e-05, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, "ppl": 1.00001, "step": 449, "tokens/total": 13590496, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 205271 }, { "epoch": 1.7578125, - "grad_norm": 0.034087613224983215, + "grad_norm": 0.0012977999867871404, "learning_rate": 1.3665385037857758e-05, - "loss": 0.00010244422446703538, + "loss": 2.1102820028318092e-05, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0001, + "ppl": 1.00002, "step": 450, "tokens/total": 13620960, - "tokens/train_per_sec_per_gpu": 30.95, + "tokens/train_per_sec_per_gpu": 30.92, "tokens/trainable": 205723 }, { "epoch": 1.76171875, - "grad_norm": 0.02930639684200287, + "grad_norm": 0.005675352178514004, "learning_rate": 1.3551490468947126e-05, - "loss": 0.00021926099725533277, + "loss": 7.465962698915973e-05, "memory/device_reserved (GiB)": 35.04, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00022, + "ppl": 1.00007, "step": 451, "tokens/total": 13651344, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.48, "tokens/trainable": 206169 }, { "epoch": 1.765625, - "grad_norm": 0.0109552051872015, + "grad_norm": 0.0013997588539496064, "learning_rate": 1.3439320741704075e-05, - "loss": 7.999646186362952e-05, + "loss": 2.723011130001396e-05, "memory/device_reserved (GiB)": 35.04, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00008, + "ppl": 1.00003, "step": 452, "tokens/total": 13681792, - "tokens/train_per_sec_per_gpu": 32.74, + "tokens/train_per_sec_per_gpu": 32.79, "tokens/trainable": 206592 }, { "epoch": 1.76953125, - "grad_norm": 0.004453443922102451, + "grad_norm": 0.012491011992096901, "learning_rate": 1.3328880523968808e-05, - "loss": 3.79011980840005e-05, + "loss": 9.182744543068111e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00009, "step": 453, "tokens/total": 13712256, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.07, "tokens/trainable": 207055 }, { "epoch": 1.7734375, - "grad_norm": 0.0005650459788739681, + "grad_norm": 0.000924609019421041, "learning_rate": 1.3220174411609587e-05, - "loss": 1.2244867320987396e-05, + "loss": 2.1621295672957785e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00001, + "ppl": 1.00002, "step": 454, "tokens/total": 13742128, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.61, "tokens/trainable": 207494 }, { "epoch": 1.77734375, - "grad_norm": 0.0007141040405258536, + "grad_norm": 0.000411411514505744, "learning_rate": 1.3113206928331471e-05, - "loss": 1.3571594536188059e-05, + "loss": 1.2427874025888741e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00001, "step": 455, "tokens/total": 13772160, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.03, "tokens/trainable": 207956 }, { "epoch": 1.78125, - "grad_norm": 0.0008097058744169772, + "grad_norm": 0.0015909038484096527, "learning_rate": 1.300798252548806e-05, - "loss": 1.1659047231660224e-05, + "loss": 3.0332066671689972e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 456, "tokens/total": 13802448, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.42, "tokens/trainable": 208408 }, { "epoch": 1.78515625, - "grad_norm": 0.0012649539858102798, + "grad_norm": 0.0030019236728549004, "learning_rate": 1.2904505581896265e-05, - "loss": 9.200517524732277e-06, + "loss": 3.378765541128814e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00003, "step": 457, "tokens/total": 13832880, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 35.92, "tokens/trainable": 208889 }, { "epoch": 1.7890625, - "grad_norm": 0.014978500083088875, + "grad_norm": 0.0016427476657554507, "learning_rate": 1.2802780403654082e-05, - "loss": 0.0001208957692142576, + "loss": 3.3130341762444004e-05, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00012, + "ppl": 1.00003, "step": 458, "tokens/total": 13862880, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.02, "tokens/trainable": 209336 }, { "epoch": 1.79296875, - "grad_norm": 0.004875013139098883, + "grad_norm": 0.0006426559993997216, "learning_rate": 1.2702811223961408e-05, - "loss": 3.241455851821229e-05, + "loss": 1.784306368790567e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.00002, "step": 459, "tokens/total": 13893440, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.21, "tokens/trainable": 209797 }, { "epoch": 1.796875, - "grad_norm": 0.0009627968538552523, + "grad_norm": 0.0016685863956809044, "learning_rate": 1.2604602202943861e-05, - "loss": 1.980438355531078e-05, + "loss": 3.2843898225110024e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00003, "step": 460, "tokens/total": 13923824, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.03, "tokens/trainable": 210240 }, { "epoch": 1.80078125, - "grad_norm": 0.019912317395210266, + "grad_norm": 0.03454679995775223, "learning_rate": 1.2508157427479686e-05, - "loss": 0.00010681153071345761, + "loss": 7.200831169029698e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00011, + "ppl": 1.00007, "step": 461, "tokens/total": 13954208, - "tokens/train_per_sec_per_gpu": 34.91, + "tokens/train_per_sec_per_gpu": 34.9, "tokens/trainable": 210702 }, { "epoch": 1.8046875, - "grad_norm": 0.0005370390135794878, + "grad_norm": 0.0021488473284989595, "learning_rate": 1.2413480911029655e-05, - "loss": 1.1081473530794028e-05, + "loss": 3.525309875840321e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00004, "step": 462, "tokens/total": 13984784, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.44, "tokens/trainable": 211140 }, { "epoch": 1.80859375, - "grad_norm": 0.000815370527561754, + "grad_norm": 0.0007275328389368951, "learning_rate": 1.2320576593470082e-05, - "loss": 1.5510300727328286e-05, + "loss": 1.328821963397786e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00002, + "ppl": 1.00001, "step": 463, "tokens/total": 14014896, - "tokens/train_per_sec_per_gpu": 32.6, + "tokens/train_per_sec_per_gpu": 32.54, "tokens/trainable": 211575 }, { "epoch": 1.8125, - "grad_norm": 0.02875823900103569, + "grad_norm": 0.03173735365271568, "learning_rate": 1.2229448340928828e-05, - "loss": 0.00013141569797880948, + "loss": 0.00014542456483468413, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00013, + "ppl": 1.00015, "step": 464, "tokens/total": 14045312, - "tokens/train_per_sec_per_gpu": 39.03, + "tokens/train_per_sec_per_gpu": 38.86, "tokens/trainable": 212083 }, { "epoch": 1.81640625, - "grad_norm": 0.04558868706226349, + "grad_norm": 0.0005439479718916118, "learning_rate": 1.2140099945624458e-05, - "loss": 0.0002969688503071666, + "loss": 1.4493984053842723e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0003, + "ppl": 1.00001, "step": 465, "tokens/total": 14075840, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 212558 }, { "epoch": 1.8203125, - "grad_norm": 0.0004122587270103395, + "grad_norm": 0.0015477532288059592, "learning_rate": 1.205253512570841e-05, - "loss": 9.937594768416602e-06, + "loss": 2.787737685139291e-05, "memory/device_reserved (GiB)": 35.97, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 466, "tokens/total": 14106016, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.73, "tokens/trainable": 213014 }, { "epoch": 1.82421875, - "grad_norm": 0.0010108116548508406, + "grad_norm": 0.0007428264361806214, "learning_rate": 1.1966757525110255e-05, - "loss": 1.5579567843815312e-05, + "loss": 2.1110219677211717e-05, "memory/device_reserved (GiB)": 37.99, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, "ppl": 1.00002, "step": 467, "tokens/total": 14136512, - "tokens/train_per_sec_per_gpu": 34.03, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 213465 }, { "epoch": 1.828125, - "grad_norm": 0.0043095871806144714, + "grad_norm": 0.002182955853641033, "learning_rate": 1.1882770713386095e-05, - "loss": 3.2609641493763775e-05, + "loss": 4.059498314745724e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00003, + "ppl": 1.00004, "step": 468, "tokens/total": 14166832, - "tokens/train_per_sec_per_gpu": 36.62, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 213940 }, { "epoch": 1.83203125, - "grad_norm": 0.005317045841366053, + "grad_norm": 0.004772448446601629, "learning_rate": 1.180057818556998e-05, - "loss": 2.144884638255462e-05, + "loss": 3.664854375529103e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00004, "step": 469, "tokens/total": 14197360, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 34.97, "tokens/trainable": 214415 }, { "epoch": 1.8359375, - "grad_norm": 0.0003264908737037331, + "grad_norm": 0.00038694078102707863, "learning_rate": 1.1720183362028494e-05, - "loss": 5.6935500651889015e-06, + "loss": 1.1124819138785824e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, "ppl": 1.00001, "step": 470, "tokens/total": 14227600, - "tokens/train_per_sec_per_gpu": 34.26, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 214880 }, { "epoch": 1.83984375, - "grad_norm": 0.013723314739763737, + "grad_norm": 0.0008439846569672227, "learning_rate": 1.1641589588318387e-05, - "loss": 0.00010619591921567917, + "loss": 2.0906983991153538e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00011, + "ppl": 1.00002, "step": 471, "tokens/total": 14257888, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.34, "tokens/trainable": 215334 }, { "epoch": 1.84375, - "grad_norm": 0.00020912640320602804, + "grad_norm": 0.0005926606827415526, "learning_rate": 1.1564800135047418e-05, - "loss": 4.586940121953376e-06, + "loss": 1.178990351036191e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0, + "ppl": 1.00001, "step": 472, "tokens/total": 14288208, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 215822 }, { "epoch": 1.84765625, - "grad_norm": 0.10667876899242401, + "grad_norm": 0.003897819435223937, "learning_rate": 1.148981819773816e-05, - "loss": 0.0006915333215147257, + "loss": 5.020621756557375e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.00005, "step": 473, "tokens/total": 14318448, - "tokens/train_per_sec_per_gpu": 30.86, + "tokens/train_per_sec_per_gpu": 30.82, "tokens/trainable": 216239 }, { "epoch": 1.8515625, - "grad_norm": 0.013282700441777706, + "grad_norm": 0.0013807902578264475, "learning_rate": 1.1416646896695086e-05, - "loss": 6.861680594738573e-05, + "loss": 2.2795318727730773e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00007, + "ppl": 1.00002, "step": 474, "tokens/total": 14348912, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.35, "tokens/trainable": 216691 }, { "epoch": 1.85546875, - "grad_norm": 0.0074070473201572895, + "grad_norm": 0.00048289448022842407, "learning_rate": 1.1345289276874717e-05, - "loss": 8.334079757332802e-05, + "loss": 1.4630711120844353e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00008, + "ppl": 1.00001, "step": 475, "tokens/total": 14379440, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 217162 }, { "epoch": 1.859375, - "grad_norm": 0.0017771078273653984, + "grad_norm": 0.0004491541185416281, "learning_rate": 1.1275748307758873e-05, - "loss": 1.803937993827276e-05, + "loss": 1.4460356396739371e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00001, "step": 476, "tokens/total": 14409840, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.88, "tokens/trainable": 217638 }, { "epoch": 1.86328125, - "grad_norm": 0.00044826362864114344, + "grad_norm": 0.0024057701230049133, "learning_rate": 1.1208026883231147e-05, - "loss": 9.577534910931718e-06, + "loss": 4.9342866986989975e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00001, + "ppl": 1.00005, "step": 477, "tokens/total": 14440256, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 218053 }, { "epoch": 1.8671875, - "grad_norm": 0.0009560272446833551, + "grad_norm": 0.0008485029684379697, "learning_rate": 1.1142127821456433e-05, - "loss": 1.0945323083433323e-05, + "loss": 2.05296601052396e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00002, "step": 478, "tokens/total": 14470704, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.09, "tokens/trainable": 218503 }, { "epoch": 1.87109375, - "grad_norm": 0.2086740881204605, + "grad_norm": 0.011945155449211597, "learning_rate": 1.1078053864763674e-05, - "loss": 0.0012299084337428212, + "loss": 8.75981932040304e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00123, + "ppl": 1.00009, "step": 479, "tokens/total": 14501072, "tokens/train_per_sec_per_gpu": 36.19, @@ -6717,13 +6717,13 @@ }, { "epoch": 1.875, - "grad_norm": 0.019221138209104538, + "grad_norm": 0.004776590969413519, "learning_rate": 1.1015807679531756e-05, - "loss": 0.00011615331459324807, + "loss": 7.07923318259418e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00012, + "ppl": 1.00007, "step": 480, "tokens/total": 14531200, "tokens/train_per_sec_per_gpu": 35.51, @@ -6731,251 +6731,251 @@ }, { "epoch": 1.87890625, - "grad_norm": 0.002074754796922207, + "grad_norm": 0.0006404300802387297, "learning_rate": 1.0955391856078528e-05, - "loss": 2.3620896172360517e-05, + "loss": 1.6759000573074445e-05, "memory/device_reserved (GiB)": 38.63, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, "ppl": 1.00002, "step": 481, "tokens/total": 14561152, - "tokens/train_per_sec_per_gpu": 38.29, + "tokens/train_per_sec_per_gpu": 38.25, "tokens/trainable": 219886 }, { "epoch": 1.8828125, - "grad_norm": 0.011151358485221863, + "grad_norm": 0.005522869061678648, "learning_rate": 1.0896808908553007e-05, - "loss": 5.527659959625453e-05, + "loss": 2.3341217456618324e-05, "memory/device_reserved (GiB)": 37.77, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00006, + "ppl": 1.00002, "step": 482, "tokens/total": 14591264, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.52, "tokens/trainable": 220343 }, { "epoch": 1.88671875, - "grad_norm": 0.010913084261119366, + "grad_norm": 0.001015707035548985, "learning_rate": 1.0840061274830763e-05, - "loss": 6.711594323860481e-05, + "loss": 2.3611488359165378e-05, "memory/device_reserved (GiB)": 37.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00007, + "ppl": 1.00002, "step": 483, "tokens/total": 14621568, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 220825 }, { "epoch": 1.890625, - "grad_norm": 0.3236236274242401, + "grad_norm": 0.004034205339848995, "learning_rate": 1.0785151316412473e-05, - "loss": 0.002836203668266535, + "loss": 5.646366116707213e-05, "memory/device_reserved (GiB)": 37.77, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00284, + "ppl": 1.00006, "step": 484, "tokens/total": 14652064, - "tokens/train_per_sec_per_gpu": 32.52, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 221282 }, { "epoch": 1.89453125, - "grad_norm": 0.0002806074626278132, + "grad_norm": 0.008657694794237614, "learning_rate": 1.0732081318325639e-05, - "loss": 5.300881639414001e-06, + "loss": 5.676104410667904e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00006, "step": 485, "tokens/total": 14682608, - "tokens/train_per_sec_per_gpu": 37.86, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 221780 }, { "epoch": 1.8984375, - "grad_norm": 0.009111613035202026, + "grad_norm": 0.0036515207029879093, "learning_rate": 1.0680853489029501e-05, - "loss": 3.664881660370156e-05, + "loss": 3.9208807720569894e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00004, "step": 486, "tokens/total": 14713168, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 222210 }, { "epoch": 1.90234375, - "grad_norm": 0.04484618082642555, + "grad_norm": 0.005618095863610506, "learning_rate": 1.0631469960323152e-05, - "loss": 0.0002056290686596185, + "loss": 5.3539326472673565e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00005, "step": 487, "tokens/total": 14743536, - "tokens/train_per_sec_per_gpu": 29.33, + "tokens/train_per_sec_per_gpu": 29.37, "tokens/trainable": 222646 }, { "epoch": 1.90625, - "grad_norm": 0.2784590721130371, + "grad_norm": 0.07197980582714081, "learning_rate": 1.0583932787256783e-05, - "loss": 0.008498833514750004, + "loss": 0.0006614382145926356, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00854, + "ppl": 1.00066, "step": 488, "tokens/total": 14773728, - "tokens/train_per_sec_per_gpu": 33.1, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 223066 }, { "epoch": 1.91015625, - "grad_norm": 0.0006373917567543685, + "grad_norm": 0.001169998780824244, "learning_rate": 1.0538243948046206e-05, - "loss": 9.457155101699755e-06, + "loss": 1.62669166456908e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00001, + "ppl": 1.00002, "step": 489, "tokens/total": 14803744, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 223512 }, { "epoch": 1.9140625, - "grad_norm": 0.00038701840094290674, + "grad_norm": 0.0014546489110216498, "learning_rate": 1.0494405343990523e-05, - "loss": 6.92771118337987e-06, + "loss": 3.051830208278261e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00003, "step": 490, "tokens/total": 14832112, - "tokens/train_per_sec_per_gpu": 38.96, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 223956 }, { "epoch": 1.91796875, - "grad_norm": 0.0015320515958592296, + "grad_norm": 0.0007275546086020768, "learning_rate": 1.0452418799392985e-05, - "loss": 2.272017445648089e-05, + "loss": 1.4892379113007337e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.00002, + "ppl": 1.00001, "step": 491, "tokens/total": 14860560, - "tokens/train_per_sec_per_gpu": 36.33, + "tokens/train_per_sec_per_gpu": 36.3, "tokens/trainable": 224416 }, { "epoch": 1.921875, - "grad_norm": 0.016094110906124115, + "grad_norm": 0.0007378064910881221, "learning_rate": 1.0412286061485102e-05, - "loss": 0.00011934755457332358, + "loss": 1.902497206174303e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.00002, "step": 492, "tokens/total": 14890848, - "tokens/train_per_sec_per_gpu": 34.09, + "tokens/train_per_sec_per_gpu": 34.12, "tokens/trainable": 224883 }, { "epoch": 1.92578125, - "grad_norm": 0.0016222589183598757, + "grad_norm": 0.0006582152564078569, "learning_rate": 1.03740088003539e-05, - "loss": 1.4765413652639836e-05, + "loss": 1.498015808465425e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, "ppl": 1.00001, "step": 493, "tokens/total": 14921008, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.42, "tokens/trainable": 225324 }, { "epoch": 1.9296875, - "grad_norm": 0.004442836623638868, + "grad_norm": 0.000849059084430337, "learning_rate": 1.0337588608872463e-05, - "loss": 3.44704239978455e-05, + "loss": 1.0077818842546549e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00003, + "ppl": 1.00001, "step": 494, "tokens/total": 14951360, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 225783 }, { "epoch": 1.93359375, - "grad_norm": 0.002437110524624586, + "grad_norm": 0.0029649219941347837, "learning_rate": 1.0303027002633622e-05, - "loss": 1.8051592633128166e-05, + "loss": 2.8222328182891943e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00003, "step": 495, "tokens/total": 14981552, - "tokens/train_per_sec_per_gpu": 36.46, + "tokens/train_per_sec_per_gpu": 36.48, "tokens/trainable": 226281 }, { "epoch": 1.9375, - "grad_norm": 0.0015804325230419636, + "grad_norm": 0.001169885159470141, "learning_rate": 1.0270325419886884e-05, - "loss": 1.691515171842184e-05, + "loss": 2.592003693280276e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00002, + "ppl": 1.00003, "step": 496, "tokens/total": 15011584, - "tokens/train_per_sec_per_gpu": 36.72, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 226735 }, { "epoch": 1.94140625, - "grad_norm": 0.0036208343226462603, + "grad_norm": 0.006588887423276901, "learning_rate": 1.0239485221478599e-05, - "loss": 4.592180994222872e-05, + "loss": 9.911794040817767e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00005, + "ppl": 1.0001, "step": 497, "tokens/total": 15042016, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.3, "tokens/trainable": 227198 }, { "epoch": 1.9453125, - "grad_norm": 0.0005918977549299598, + "grad_norm": 0.0013167925644665956, "learning_rate": 1.0210507690795292e-05, - "loss": 1.5305626220651902e-05, + "loss": 2.8513590223155916e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.68, "memory/max_allocated (GiB)": 33.68, - "ppl": 1.00002, + "ppl": 1.00003, "step": 498, "tokens/total": 15071984, "tokens/train_per_sec_per_gpu": 31.07, @@ -6983,69 +6983,69 @@ }, { "epoch": 1.94921875, - "grad_norm": 0.0013667694292962551, + "grad_norm": 0.0010883790673688054, "learning_rate": 1.0183394033710305e-05, - "loss": 1.3490713172359392e-05, + "loss": 2.4797469450277276e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00001, + "ppl": 1.00002, "step": 499, "tokens/total": 15102192, - "tokens/train_per_sec_per_gpu": 32.15, + "tokens/train_per_sec_per_gpu": 32.17, "tokens/trainable": 228074 }, { "epoch": 1.953125, - "grad_norm": 0.0027930096257478, + "grad_norm": 0.010283510200679302, "learning_rate": 1.0158145378533583e-05, - "loss": 2.8409334845491685e-05, + "loss": 4.6255343477241695e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00003, + "ppl": 1.00005, "step": 500, "tokens/total": 15132560, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.59, "tokens/trainable": 228541 }, { "epoch": 1.95703125, - "grad_norm": 0.0028320043347775936, + "grad_norm": 0.0011426788987591863, "learning_rate": 1.0134762775964726e-05, - "loss": 3.1829928047955036e-05, + "loss": 1.940131733135786e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00002, "step": 501, "tokens/total": 15163152, - "tokens/train_per_sec_per_gpu": 37.77, + "tokens/train_per_sec_per_gpu": 37.78, "tokens/trainable": 229031 }, { "epoch": 1.9609375, - "grad_norm": 0.0030925904866307974, + "grad_norm": 0.0012880039867013693, "learning_rate": 1.0113247199049278e-05, - "loss": 2.238066190329846e-05, + "loss": 2.073413270409219e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 502, "tokens/total": 15193456, - "tokens/train_per_sec_per_gpu": 38.68, + "tokens/train_per_sec_per_gpu": 38.76, "tokens/trainable": 229512 }, { "epoch": 1.96484375, - "grad_norm": 0.06389517337083817, + "grad_norm": 0.022319281473755836, "learning_rate": 1.0093599543138205e-05, - "loss": 0.0004140711098443717, + "loss": 0.00016162173415068537, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00041, + "ppl": 1.00016, "step": 503, "tokens/total": 15223680, "tokens/train_per_sec_per_gpu": 34.26, @@ -7053,128 +7053,128 @@ }, { "epoch": 1.96875, - "grad_norm": 0.003928070887923241, + "grad_norm": 0.00031853109248913825, "learning_rate": 1.0075820625850675e-05, - "loss": 4.3977754103252664e-05, + "loss": 9.707431672723033e-06, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00001, "step": 504, "tokens/total": 15254336, - "tokens/train_per_sec_per_gpu": 35.81, + "tokens/train_per_sec_per_gpu": 35.84, "tokens/trainable": 230447 }, { "epoch": 1.97265625, - "grad_norm": 0.0022790853399783373, + "grad_norm": 0.0005880650132894516, "learning_rate": 1.0059911187040013e-05, - "loss": 2.180483534175437e-05, + "loss": 1.7119673429988325e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, "ppl": 1.00002, "step": 505, "tokens/total": 15284496, - "tokens/train_per_sec_per_gpu": 34.29, + "tokens/train_per_sec_per_gpu": 34.3, "tokens/trainable": 230879 }, { "epoch": 1.9765625, - "grad_norm": 0.0022161444649100304, + "grad_norm": 0.0011501131812110543, "learning_rate": 1.0045871888762893e-05, - "loss": 2.00994672923116e-05, + "loss": 1.6414911442552693e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, "ppl": 1.00002, "step": 506, "tokens/total": 15314976, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 231348 }, { "epoch": 1.98046875, - "grad_norm": 0.0109304990619421, + "grad_norm": 0.0007460714550688863, "learning_rate": 1.003370331525184e-05, - "loss": 9.907589264912531e-05, + "loss": 2.1825573639944196e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00002, "step": 507, "tokens/total": 15345280, - "tokens/train_per_sec_per_gpu": 35.22, + "tokens/train_per_sec_per_gpu": 35.32, "tokens/trainable": 231819 }, { "epoch": 1.984375, - "grad_norm": 0.0008610524819232523, + "grad_norm": 0.003101626643911004, "learning_rate": 1.002340597289085e-05, - "loss": 1.4185266991262324e-05, + "loss": 4.144266858929768e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00004, "step": 508, "tokens/total": 15375424, - "tokens/train_per_sec_per_gpu": 34.57, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 232269 }, { "epoch": 1.98828125, - "grad_norm": 0.18468032777309418, + "grad_norm": 0.0010362571338191628, "learning_rate": 1.0014980290194387e-05, - "loss": 0.0011317847529426217, + "loss": 1.4500470570055768e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00113, + "ppl": 1.00001, "step": 509, "tokens/total": 15405872, - "tokens/train_per_sec_per_gpu": 34.06, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 232716 }, { "epoch": 1.9921875, - "grad_norm": 0.0012291419552639127, + "grad_norm": 0.0019138582283630967, "learning_rate": 1.0008426617789489e-05, - "loss": 1.4661756722489372e-05, + "loss": 2.179224611609243e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00002, "step": 510, "tokens/total": 15436128, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 233178 }, { "epoch": 1.99609375, - "grad_norm": 0.003051232313737273, + "grad_norm": 0.0017450153827667236, "learning_rate": 1.0003745228401215e-05, - "loss": 2.0963430870324373e-05, + "loss": 2.1991130779497325e-05, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 511, "tokens/total": 15466464, - "tokens/train_per_sec_per_gpu": 35.95, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 233647 }, { "epoch": 2.0, - "grad_norm": 0.001929801655933261, + "grad_norm": 0.06926226615905762, "learning_rate": 1.0000936316841296e-05, - "loss": 1.9281407730886713e-05, + "loss": 0.0005933041102252901, "memory/device_reserved (GiB)": 38.44, "memory/max_active (GiB)": 33.67, "memory/max_allocated (GiB)": 33.67, - "ppl": 1.00002, + "ppl": 1.00059, "step": 512, "tokens/total": 15496368, - "tokens/train_per_sec_per_gpu": 29.42, + "tokens/train_per_sec_per_gpu": 29.4, "tokens/trainable": 234060 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_model.safetensors index ec21044dd16514741ed50ac4fdbba207fd095d1f..b7aa46dc518d1cfa0e16d663660b9a0af7a46934 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:051830de7f1d163f4de9749f244e6981723b34f0246ab1c4576cc93cf5c97034 +oid sha256:e859c9377bfb05045990aad9622ecbcea4ec1f51ee262c524148710f93c608f1 size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/optimizer.pt index 2e848ce26f7f34176e8e2e61cbaa40b0e0f7a0e4..14fe9f48bf028c7d58a5a0eece38cc1d9104c911 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:b96a1d411d21f029342790380398e4a7970a8f0e26d27c412cfd73e290cced3a +oid sha256:f0bb5b0e8d378704b8006d08d74c2f903a1422f4e828a3f1e606a4b8edbfa7a3 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/trainer_state.json index 0b5fae1d5bc205627cafdf3472eb84d1da7a8ef0..f7f891c57813e996ac5985283788de765d26db72 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-64/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,875 +34,875 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_config.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_config.json index 3837481f1ffd508deedd7af1abbd75a04c68b96d..096654c491c9393ef0a5722d34086e87804eb222 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_config.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "q_proj", - "k_proj", "down_proj", - "v_proj", + "k_proj", "o_proj", + "v_proj", + "gate_proj", "up_proj", - "gate_proj" + "q_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_model.safetensors b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_model.safetensors index 09dc9940dfa12629aee3067e5c57a7f1664b9f5a..66335c22dcb8b4c1a91745a2308c14c2349900db 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_model.safetensors +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:a0e403bf65449bdaf7ebc6919f111acf4c4c5995e60d3ee7136848a492f809e9 +oid sha256:0e85942ea7b1d777c6e874fcfe57e08e0752f1e581a02a35bb62b7dc1942bc5a size 547777976 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/optimizer.pt b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/optimizer.pt index ac9329aa6ac66790a42d7218ff59c8cbb81737bf..e2e9e6d957ea17e377aea759b2def8d938d8d856 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/optimizer.pt +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:d4bf3da6e8fbdc8a5ebb3ed971650bce7f765b5da49d443bde267183074a0ff5 +oid sha256:e09d86b7ef11b8b51a819ec69e40b2c45e5f32072380fdac56e42f42d36fcb81 size 1048106435 diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/trainer_state.json b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/trainer_state.json index 0710ca91293e473cb88da109b735517b1e6bb2a5..17401655caa7791c6586b72504d5b8f7a4a2e06f 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/trainer_state.json +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/checkpoint-96/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 0.870697021484375, + "grad_norm": 0.8591235280036926, "learning_rate": 0.0, "loss": 0.10251401364803314, "memory/device_reserved (GiB)": 34.94, @@ -20,12 +20,12 @@ "ppl": 1.10795, "step": 1, "tokens/total": 30464, - "tokens/train_per_sec_per_gpu": 23.98, + "tokens/train_per_sec_per_gpu": 30.01, "tokens/trainable": 470 }, { "epoch": 0.0078125, - "grad_norm": 0.8108459115028381, + "grad_norm": 0.8033757209777832, "learning_rate": 4.000000000000001e-06, "loss": 0.09678442776203156, "memory/device_reserved (GiB)": 35.83, @@ -34,900 +34,900 @@ "ppl": 1.10162, "step": 2, "tokens/total": 60800, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.1, "tokens/trainable": 922 }, { "epoch": 0.01171875, - "grad_norm": 1.8027335405349731, + "grad_norm": 1.0102914571762085, "learning_rate": 8.000000000000001e-06, - "loss": 0.10952483862638474, + "loss": 0.10876177996397018, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.11575, + "ppl": 1.1149, "step": 3, "tokens/total": 91136, - "tokens/train_per_sec_per_gpu": 34.48, + "tokens/train_per_sec_per_gpu": 34.67, "tokens/trainable": 1396 }, { "epoch": 0.015625, - "grad_norm": 1.0353018045425415, + "grad_norm": 2.2042534351348877, "learning_rate": 1.2e-05, - "loss": 0.10303406417369843, + "loss": 0.1031389832496643, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.10853, + "ppl": 1.10865, "step": 4, "tokens/total": 121552, - "tokens/train_per_sec_per_gpu": 38.01, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 1850 }, { "epoch": 0.01953125, - "grad_norm": 1.0778985023498535, + "grad_norm": 2.5755860805511475, "learning_rate": 1.6000000000000003e-05, - "loss": 0.10945924371480942, + "loss": 0.1097191572189331, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.11567, + "ppl": 1.11596, "step": 5, "tokens/total": 152304, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 34.92, "tokens/trainable": 2302 }, { "epoch": 0.0234375, - "grad_norm": 0.8929882645606995, + "grad_norm": 1.498002052307129, "learning_rate": 2e-05, - "loss": 0.08588902652263641, + "loss": 0.08722387254238129, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.08969, + "ppl": 1.09114, "step": 6, "tokens/total": 182448, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.65, "tokens/trainable": 2742 }, { "epoch": 0.02734375, - "grad_norm": 1.6409597396850586, + "grad_norm": 1.280110478401184, "learning_rate": 2.4e-05, - "loss": 0.07352827489376068, + "loss": 0.07383580505847931, "memory/device_reserved (GiB)": 35.85, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0763, + "ppl": 1.07663, "step": 7, "tokens/total": 212736, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 3208 }, { "epoch": 0.03125, - "grad_norm": 1.5843520164489746, + "grad_norm": 1.6952791213989258, "learning_rate": 2.8000000000000003e-05, - "loss": 0.07798244059085846, + "loss": 0.08001460134983063, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0811, + "ppl": 1.0833, "step": 8, "tokens/total": 243024, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 3655 }, { "epoch": 0.03515625, - "grad_norm": 1.3725916147232056, + "grad_norm": 1.2223162651062012, "learning_rate": 3.2000000000000005e-05, - "loss": 0.04634054750204086, + "loss": 0.047361284494400024, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.04743, + "ppl": 1.0485, "step": 9, "tokens/total": 271264, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 4091 }, { "epoch": 0.0390625, - "grad_norm": 2.544938564300537, + "grad_norm": 2.902157783508301, "learning_rate": 3.6e-05, - "loss": 0.08677884936332703, + "loss": 0.09570425748825073, "memory/device_reserved (GiB)": 36.07, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.09066, + "ppl": 1.10043, "step": 10, "tokens/total": 301520, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.98, "tokens/trainable": 4553 }, { "epoch": 0.04296875, - "grad_norm": 1.6364734172821045, + "grad_norm": 2.1767208576202393, "learning_rate": 4e-05, - "loss": 0.07754456996917725, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.0828268975019455, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.08063, + "ppl": 1.08635, "step": 11, "tokens/total": 331808, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 4992 }, { "epoch": 0.046875, - "grad_norm": 2.167391538619995, + "grad_norm": 3.15231990814209, "learning_rate": 4.4000000000000006e-05, - "loss": 0.11765319854021072, - "memory/device_reserved (GiB)": 36.07, + "loss": 0.12141455709934235, + "memory/device_reserved (GiB)": 36.08, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.12485, + "ppl": 1.12909, "step": 12, "tokens/total": 362224, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.32, "tokens/trainable": 5494 }, { "epoch": 0.05078125, - "grad_norm": 3.196911573410034, + "grad_norm": 2.3834526538848877, "learning_rate": 4.8e-05, - "loss": 0.03510797768831253, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.037937015295028687, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.03573, + "ppl": 1.03867, "step": 13, "tokens/total": 392432, - "tokens/train_per_sec_per_gpu": 33.67, + "tokens/train_per_sec_per_gpu": 35.04, "tokens/trainable": 5933 }, { "epoch": 0.0546875, - "grad_norm": 1.9654567241668701, + "grad_norm": 3.2587738037109375, "learning_rate": 5.2000000000000004e-05, - "loss": 0.061097435653209686, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.06514571607112885, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.063, + "ppl": 1.06731, "step": 14, "tokens/total": 422784, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.67, "tokens/trainable": 6369 }, { "epoch": 0.05859375, - "grad_norm": 1.934105396270752, + "grad_norm": 1.5818979740142822, "learning_rate": 5.6000000000000006e-05, - "loss": 0.05385493487119675, - "memory/device_reserved (GiB)": 36.15, + "loss": 0.05656517297029495, + "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.05533, + "ppl": 1.0582, "step": 15, "tokens/total": 453376, - "tokens/train_per_sec_per_gpu": 32.96, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 6820 }, { "epoch": 0.0625, - "grad_norm": 1.4659016132354736, + "grad_norm": 1.4215443134307861, "learning_rate": 6e-05, - "loss": 0.052153222262859344, + "loss": 0.06070145219564438, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.05354, + "ppl": 1.06258, "step": 16, "tokens/total": 483504, - "tokens/train_per_sec_per_gpu": 30.68, + "tokens/train_per_sec_per_gpu": 30.85, "tokens/trainable": 7258 }, { "epoch": 0.06640625, - "grad_norm": 1.9650894403457642, + "grad_norm": 1.3065693378448486, "learning_rate": 6.400000000000001e-05, - "loss": 0.05092189460992813, + "loss": 0.05027393624186516, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05224, + "ppl": 1.05156, "step": 17, "tokens/total": 514032, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 7710 }, { "epoch": 0.0703125, - "grad_norm": 0.6891724467277527, + "grad_norm": 0.6123363375663757, "learning_rate": 6.800000000000001e-05, - "loss": 0.031155016273260117, + "loss": 0.028499452397227287, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03165, + "ppl": 1.02891, "step": 18, "tokens/total": 544432, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 8174 }, { "epoch": 0.07421875, - "grad_norm": 0.8662010431289673, + "grad_norm": 0.648410439491272, "learning_rate": 7.2e-05, - "loss": 0.03036138042807579, + "loss": 0.031143227592110634, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.03083, + "ppl": 1.03163, "step": 19, "tokens/total": 574880, - "tokens/train_per_sec_per_gpu": 34.37, + "tokens/train_per_sec_per_gpu": 34.47, "tokens/trainable": 8617 }, { "epoch": 0.078125, - "grad_norm": 0.7999041080474854, + "grad_norm": 0.6737155318260193, "learning_rate": 7.6e-05, - "loss": 0.03458942472934723, + "loss": 0.030753308907151222, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.03519, + "ppl": 1.03123, "step": 20, "tokens/total": 605408, - "tokens/train_per_sec_per_gpu": 30.32, + "tokens/train_per_sec_per_gpu": 30.37, "tokens/trainable": 9037 }, { "epoch": 0.08203125, - "grad_norm": 0.5816919207572937, + "grad_norm": 0.7464718222618103, "learning_rate": 8e-05, - "loss": 0.02401110902428627, + "loss": 0.02451065182685852, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0243, + "ppl": 1.02481, "step": 21, "tokens/total": 635584, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.63, "tokens/trainable": 9503 }, { "epoch": 0.0859375, - "grad_norm": 0.6761882901191711, + "grad_norm": 0.9435750246047974, "learning_rate": 8.4e-05, - "loss": 0.01873329095542431, + "loss": 0.017626767978072166, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01891, + "ppl": 1.01778, "step": 22, "tokens/total": 665952, - "tokens/train_per_sec_per_gpu": 36.71, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 9972 }, { "epoch": 0.08984375, - "grad_norm": 0.9077537655830383, + "grad_norm": 0.6369844079017639, "learning_rate": 8.800000000000001e-05, - "loss": 0.017490077763795853, + "loss": 0.013959845528006554, "memory/device_reserved (GiB)": 36.21, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01764, + "ppl": 1.01406, "step": 23, "tokens/total": 696240, - "tokens/train_per_sec_per_gpu": 37.39, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 10447 }, { "epoch": 0.09375, - "grad_norm": 1.3226462602615356, + "grad_norm": 1.0666130781173706, "learning_rate": 9.200000000000001e-05, - "loss": 0.028416279703378677, + "loss": 0.03303435444831848, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02882, + "ppl": 1.03359, "step": 24, "tokens/total": 726464, - "tokens/train_per_sec_per_gpu": 37.12, + "tokens/train_per_sec_per_gpu": 37.23, "tokens/trainable": 10899 }, { "epoch": 0.09765625, - "grad_norm": 0.9712215065956116, + "grad_norm": 1.0491507053375244, "learning_rate": 9.6e-05, - "loss": 0.025973526760935783, + "loss": 0.030840374529361725, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02631, + "ppl": 1.03132, "step": 25, "tokens/total": 756704, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 11360 }, { "epoch": 0.1015625, - "grad_norm": 0.8638900518417358, + "grad_norm": 0.8108148574829102, "learning_rate": 0.0001, - "loss": 0.022434517741203308, + "loss": 0.03408072516322136, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.02269, + "ppl": 1.03467, "step": 26, "tokens/total": 786912, - "tokens/train_per_sec_per_gpu": 29.23, + "tokens/train_per_sec_per_gpu": 29.3, "tokens/trainable": 11775 }, { "epoch": 0.10546875, - "grad_norm": 0.6629000902175903, + "grad_norm": 0.507036030292511, "learning_rate": 9.99990636831587e-05, - "loss": 0.014538668096065521, + "loss": 0.014000408351421356, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.46, "memory/max_allocated (GiB)": 33.46, - "ppl": 1.01464, + "ppl": 1.0141, "step": 27, "tokens/total": 815424, - "tokens/train_per_sec_per_gpu": 39.82, + "tokens/train_per_sec_per_gpu": 39.89, "tokens/trainable": 12242 }, { "epoch": 0.109375, - "grad_norm": 0.3078136146068573, + "grad_norm": 0.618457555770874, "learning_rate": 9.999625477159879e-05, - "loss": 0.01195458322763443, + "loss": 0.022290699183940887, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01203, + "ppl": 1.02254, "step": 28, "tokens/total": 845584, - "tokens/train_per_sec_per_gpu": 33.52, + "tokens/train_per_sec_per_gpu": 33.48, "tokens/trainable": 12696 }, { "epoch": 0.11328125, - "grad_norm": 1.1301876306533813, + "grad_norm": 0.4989492893218994, "learning_rate": 9.999157338221051e-05, - "loss": 0.022538531571626663, + "loss": 0.025926023721694946, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02279, + "ppl": 1.02627, "step": 29, "tokens/total": 875808, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.34, "tokens/trainable": 13153 }, { "epoch": 0.1171875, - "grad_norm": 0.41090911626815796, + "grad_norm": 0.3578357696533203, "learning_rate": 9.998501970980562e-05, - "loss": 0.011871461756527424, + "loss": 0.014475762844085693, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01194, + "ppl": 1.01458, "step": 30, "tokens/total": 904096, - "tokens/train_per_sec_per_gpu": 39.83, + "tokens/train_per_sec_per_gpu": 39.7, "tokens/trainable": 13624 }, { "epoch": 0.12109375, - "grad_norm": 0.6772723197937012, + "grad_norm": 0.4404466450214386, "learning_rate": 9.997659402710915e-05, - "loss": 0.013700846582651138, + "loss": 0.015927618369460106, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0138, + "ppl": 1.01606, "step": 31, "tokens/total": 934400, - "tokens/train_per_sec_per_gpu": 34.07, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 14064 }, { "epoch": 0.125, - "grad_norm": 1.207811951637268, + "grad_norm": 0.5913511514663696, "learning_rate": 9.996629668474818e-05, - "loss": 0.01185896061360836, + "loss": 0.019408874213695526, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01193, + "ppl": 1.0196, "step": 32, "tokens/total": 964832, - "tokens/train_per_sec_per_gpu": 38.9, + "tokens/train_per_sec_per_gpu": 38.92, "tokens/trainable": 14565 }, { "epoch": 0.12890625, - "grad_norm": 0.46513956785202026, + "grad_norm": 0.2795853614807129, "learning_rate": 9.995412811123711e-05, - "loss": 0.012477721087634563, + "loss": 0.007002322003245354, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01256, + "ppl": 1.00703, "step": 33, "tokens/total": 995040, - "tokens/train_per_sec_per_gpu": 33.76, + "tokens/train_per_sec_per_gpu": 33.77, "tokens/trainable": 15005 }, { "epoch": 0.1328125, - "grad_norm": 1.7668761014938354, + "grad_norm": 1.1757413148880005, "learning_rate": 9.994008881295999e-05, - "loss": 0.03285093232989311, + "loss": 0.021448152139782906, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0334, + "ppl": 1.02168, "step": 34, "tokens/total": 1024896, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 15459 }, { "epoch": 0.13671875, - "grad_norm": 0.7816088795661926, + "grad_norm": 0.3860406279563904, "learning_rate": 9.992417937414932e-05, - "loss": 0.028746310621500015, + "loss": 0.01894465833902359, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02916, + "ppl": 1.01913, "step": 35, "tokens/total": 1054992, - "tokens/train_per_sec_per_gpu": 38.15, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 15960 }, { "epoch": 0.140625, - "grad_norm": 0.683965265750885, + "grad_norm": 0.4803963005542755, "learning_rate": 9.99064004568618e-05, - "loss": 0.020058901980519295, + "loss": 0.013810254633426666, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02026, + "ppl": 1.01391, "step": 36, "tokens/total": 1085280, - "tokens/train_per_sec_per_gpu": 34.53, + "tokens/train_per_sec_per_gpu": 34.59, "tokens/trainable": 16428 }, { "epoch": 0.14453125, - "grad_norm": 0.6797531843185425, + "grad_norm": 0.3357454836368561, "learning_rate": 9.988675280095074e-05, - "loss": 0.010446591302752495, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.008235199376940727, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.0105, + "ppl": 1.00827, "step": 37, "tokens/total": 1115504, - "tokens/train_per_sec_per_gpu": 31.77, + "tokens/train_per_sec_per_gpu": 31.89, "tokens/trainable": 16884 }, { "epoch": 0.1484375, - "grad_norm": 0.8899193406105042, + "grad_norm": 0.9474877715110779, "learning_rate": 9.986523722403528e-05, - "loss": 0.017391683533787727, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019564270973205566, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01754, + "ppl": 1.01976, "step": 38, "tokens/total": 1145712, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.02, "tokens/trainable": 17341 }, { "epoch": 0.15234375, - "grad_norm": 0.8132575750350952, + "grad_norm": 1.101553201675415, "learning_rate": 9.984185462146642e-05, - "loss": 0.02252483367919922, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.017880277708172798, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02278, + "ppl": 1.01804, "step": 39, "tokens/total": 1176128, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.16, "tokens/trainable": 17786 }, { "epoch": 0.15625, - "grad_norm": 0.4430502653121948, + "grad_norm": 0.7563315033912659, "learning_rate": 9.98166059662897e-05, - "loss": 0.011966042220592499, - "memory/device_reserved (GiB)": 35.48, + "loss": 0.019336596131324768, + "memory/device_reserved (GiB)": 35.49, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01204, + "ppl": 1.01952, "step": 40, "tokens/total": 1206576, - "tokens/train_per_sec_per_gpu": 34.99, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 18262 }, { "epoch": 0.16015625, - "grad_norm": 0.5074653029441833, + "grad_norm": 0.41576531529426575, "learning_rate": 9.978949230920472e-05, - "loss": 0.014877484180033207, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.011620002798736095, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01499, + "ppl": 1.01169, "step": 41, "tokens/total": 1236848, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 18716 }, { "epoch": 0.1640625, - "grad_norm": 0.5221464037895203, + "grad_norm": 1.180986762046814, "learning_rate": 9.976051477852141e-05, - "loss": 0.017510797828435898, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.04661658778786659, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01767, + "ppl": 1.04772, "step": 42, "tokens/total": 1267088, - "tokens/train_per_sec_per_gpu": 32.87, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 19157 }, { "epoch": 0.16796875, - "grad_norm": 0.6888790130615234, + "grad_norm": 0.7583066821098328, "learning_rate": 9.972967458011312e-05, - "loss": 0.030433066189289093, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.029224852100014687, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0309, + "ppl": 1.02966, "step": 43, "tokens/total": 1297360, - "tokens/train_per_sec_per_gpu": 36.5, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 19647 }, { "epoch": 0.171875, - "grad_norm": 0.5600388050079346, + "grad_norm": 0.18861345946788788, "learning_rate": 9.96969729973664e-05, - "loss": 0.013720017857849598, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.007798851002007723, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01381, + "ppl": 1.00783, "step": 44, "tokens/total": 1327744, - "tokens/train_per_sec_per_gpu": 34.9, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 20119 }, { "epoch": 0.17578125, - "grad_norm": 0.4291926324367523, + "grad_norm": 0.35095125436782837, "learning_rate": 9.966241139112754e-05, - "loss": 0.00872582383453846, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.012044938281178474, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00876, + "ppl": 1.01212, "step": 45, "tokens/total": 1358096, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 20560 }, { "epoch": 0.1796875, - "grad_norm": 0.944327712059021, + "grad_norm": 0.5071477890014648, "learning_rate": 9.96259911996461e-05, - "loss": 0.025248996913433075, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.017856616526842117, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02557, + "ppl": 1.01802, "step": 46, "tokens/total": 1388240, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 20992 }, { "epoch": 0.18359375, - "grad_norm": 0.2425016313791275, + "grad_norm": 0.5569872260093689, "learning_rate": 9.958771393851491e-05, - "loss": 0.005067020654678345, - "memory/device_reserved (GiB)": 35.87, + "loss": 0.019440822303295135, + "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.26, "memory/max_allocated (GiB)": 33.26, - "ppl": 1.00508, + "ppl": 1.01963, "step": 47, "tokens/total": 1416240, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 21441 }, { "epoch": 0.1875, - "grad_norm": 1.2363684177398682, + "grad_norm": 0.42062458395957947, "learning_rate": 9.954758120060702e-05, - "loss": 0.03300227224826813, + "loss": 0.013018792495131493, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.03355, + "ppl": 1.0131, "step": 48, "tokens/total": 1446880, - "tokens/train_per_sec_per_gpu": 33.7, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 21901 }, { "epoch": 0.19140625, - "grad_norm": 0.7278413772583008, + "grad_norm": 0.30396750569343567, "learning_rate": 9.950559465600948e-05, - "loss": 0.025975672528147697, + "loss": 0.0077492957934737206, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.02632, + "ppl": 1.00778, "step": 49, "tokens/total": 1477168, - "tokens/train_per_sec_per_gpu": 33.27, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 22341 }, { "epoch": 0.1953125, - "grad_norm": 0.37237733602523804, + "grad_norm": 2.044849395751953, "learning_rate": 9.946175605195379e-05, - "loss": 0.010315775871276855, + "loss": 0.014447445049881935, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01037, + "ppl": 1.01455, "step": 50, "tokens/total": 1507712, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 22833 }, { "epoch": 0.19921875, - "grad_norm": 0.25258293747901917, + "grad_norm": 0.9357694983482361, "learning_rate": 9.941606721274322e-05, - "loss": 0.00485712755471468, + "loss": 0.012720856815576553, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00487, + "ppl": 1.0128, "step": 51, "tokens/total": 1537936, - "tokens/train_per_sec_per_gpu": 30.64, + "tokens/train_per_sec_per_gpu": 30.72, "tokens/trainable": 23277 }, { "epoch": 0.203125, - "grad_norm": 0.738599419593811, + "grad_norm": 0.2881873548030853, "learning_rate": 9.936853003967685e-05, - "loss": 0.01646406576037407, + "loss": 0.005877626594156027, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0166, + "ppl": 1.00589, "step": 52, "tokens/total": 1568352, - "tokens/train_per_sec_per_gpu": 35.57, + "tokens/train_per_sec_per_gpu": 35.63, "tokens/trainable": 23759 }, { "epoch": 0.20703125, - "grad_norm": 1.2733500003814697, + "grad_norm": 0.7577692270278931, "learning_rate": 9.93191465109705e-05, - "loss": 0.019196398556232452, + "loss": 0.01451955921947956, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01938, + "ppl": 1.01463, "step": 53, "tokens/total": 1598992, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 24193 }, { "epoch": 0.2109375, - "grad_norm": 0.5316427946090698, + "grad_norm": 0.5201014280319214, "learning_rate": 9.926791868167438e-05, - "loss": 0.006890955846756697, + "loss": 0.006856432184576988, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00691, + "ppl": 1.00688, "step": 54, "tokens/total": 1629488, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.59, "tokens/trainable": 24619 }, { "epoch": 0.21484375, - "grad_norm": 0.6924111843109131, + "grad_norm": 0.8399921655654907, "learning_rate": 9.921484868358753e-05, - "loss": 0.021178584545850754, + "loss": 0.037967782467603683, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0214, + "ppl": 1.0387, "step": 55, "tokens/total": 1659696, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.85, "tokens/trainable": 25075 }, { "epoch": 0.21875, - "grad_norm": 0.683601975440979, + "grad_norm": 0.8203506469726562, "learning_rate": 9.915993872516924e-05, - "loss": 0.017589068040251732, + "loss": 0.012814272195100784, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.01774, + "ppl": 1.0129, "step": 56, "tokens/total": 1689872, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.55, "tokens/trainable": 25519 }, { "epoch": 0.22265625, - "grad_norm": 0.8593301177024841, + "grad_norm": 0.20874246954917908, "learning_rate": 9.9103191091447e-05, - "loss": 0.025561584159731865, + "loss": 0.00539036700502038, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.02589, + "ppl": 1.0054, "step": 57, "tokens/total": 1720144, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.69, "tokens/trainable": 25966 }, { "epoch": 0.2265625, - "grad_norm": 0.2925783097743988, + "grad_norm": 0.4427756071090698, "learning_rate": 9.904460814392147e-05, - "loss": 0.005790311843156815, + "loss": 0.009390819817781448, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00581, + "ppl": 1.00944, "step": 58, "tokens/total": 1750448, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 26423 }, { "epoch": 0.23046875, - "grad_norm": 0.6059477925300598, + "grad_norm": 0.7457786798477173, "learning_rate": 9.898419232046825e-05, - "loss": 0.007334758993238211, + "loss": 0.019530881196260452, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00736, + "ppl": 1.01972, "step": 59, "tokens/total": 1781088, - "tokens/train_per_sec_per_gpu": 38.42, + "tokens/train_per_sec_per_gpu": 38.51, "tokens/trainable": 26934 }, { "epoch": 0.234375, - "grad_norm": 0.29425033926963806, + "grad_norm": 0.13402195274829865, "learning_rate": 9.892194613523633e-05, - "loss": 0.004620288498699665, + "loss": 0.0014544172445312142, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00463, + "ppl": 1.00146, "step": 60, "tokens/total": 1811344, - "tokens/train_per_sec_per_gpu": 33.0, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 27393 }, { "epoch": 0.23828125, - "grad_norm": 0.25868093967437744, + "grad_norm": 1.0385031700134277, "learning_rate": 9.885787217854357e-05, - "loss": 0.0042824773117899895, + "loss": 0.019916968420147896, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00429, + "ppl": 1.02012, "step": 61, "tokens/total": 1841600, - "tokens/train_per_sec_per_gpu": 32.84, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 27852 }, { "epoch": 0.2421875, - "grad_norm": 0.9455181360244751, + "grad_norm": 1.2596747875213623, "learning_rate": 9.879197311676887e-05, - "loss": 0.013508133590221405, + "loss": 0.015884939581155777, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0136, + "ppl": 1.01601, "step": 62, "tokens/total": 1872048, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 28292 }, { "epoch": 0.24609375, - "grad_norm": 1.149442434310913, + "grad_norm": 0.14031143486499786, "learning_rate": 9.872425169224113e-05, - "loss": 0.020864056423306465, + "loss": 0.002796083688735962, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02108, + "ppl": 1.0028, "step": 63, "tokens/total": 1902592, - "tokens/train_per_sec_per_gpu": 37.27, + "tokens/train_per_sec_per_gpu": 37.36, "tokens/trainable": 28798 }, { "epoch": 0.25, - "grad_norm": 0.7421550750732422, + "grad_norm": 0.6247786283493042, "learning_rate": 9.865471072312528e-05, - "loss": 0.016041038557887077, + "loss": 0.017117884010076523, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01617, + "ppl": 1.01727, "step": 64, "tokens/total": 1933088, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.79, "tokens/trainable": 29283 }, { "epoch": 0.25390625, - "grad_norm": 0.36109936237335205, + "grad_norm": 0.3513385057449341, "learning_rate": 9.858335310330492e-05, - "loss": 0.005372575484216213, + "loss": 0.008029159158468246, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00539, + "ppl": 1.00806, "step": 65, "tokens/total": 1963296, - "tokens/train_per_sec_per_gpu": 31.92, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 29745 }, { "epoch": 0.2578125, - "grad_norm": 0.7074101567268372, + "grad_norm": 0.279448539018631, "learning_rate": 9.851018180226185e-05, - "loss": 0.018492329865694046, - "memory/device_reserved (GiB)": 34.88, + "loss": 0.0161186084151268, + "memory/device_reserved (GiB)": 34.87, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01866, + "ppl": 1.01625, "step": 66, "tokens/total": 1993760, "tokens/train_per_sec_per_gpu": 31.19, @@ -935,422 +935,422 @@ }, { "epoch": 0.26171875, - "grad_norm": 0.43113431334495544, + "grad_norm": 0.31739094853401184, "learning_rate": 9.843519986495259e-05, - "loss": 0.00620780885219574, + "loss": 0.009091717191040516, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00623, + "ppl": 1.00913, "step": 67, "tokens/total": 2024144, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.36, "tokens/trainable": 30622 }, { "epoch": 0.265625, - "grad_norm": 0.3996214270591736, + "grad_norm": 0.3539387285709381, "learning_rate": 9.835841041168162e-05, - "loss": 0.005429963115602732, + "loss": 0.00908343680202961, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00544, + "ppl": 1.00912, "step": 68, "tokens/total": 2054608, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.52, "tokens/trainable": 31097 }, { "epoch": 0.26953125, - "grad_norm": 0.4444175660610199, + "grad_norm": 0.6497699618339539, "learning_rate": 9.82798166379715e-05, - "loss": 0.01158289983868599, + "loss": 0.03086906298995018, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01165, + "ppl": 1.03135, "step": 69, "tokens/total": 2084912, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.6, "tokens/trainable": 31595 }, { "epoch": 0.2734375, - "grad_norm": 0.16977320611476898, + "grad_norm": 0.19664841890335083, "learning_rate": 9.819942181443002e-05, - "loss": 0.002158569637686014, + "loss": 0.0039155250415205956, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00216, + "ppl": 1.00392, "step": 70, "tokens/total": 2115216, - "tokens/train_per_sec_per_gpu": 30.67, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 32036 }, { "epoch": 0.27734375, - "grad_norm": 0.12970401346683502, + "grad_norm": 0.4300064146518707, "learning_rate": 9.811722928661392e-05, - "loss": 0.0028989531565457582, + "loss": 0.007546662352979183, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0029, + "ppl": 1.00758, "step": 71, "tokens/total": 2145424, - "tokens/train_per_sec_per_gpu": 28.06, + "tokens/train_per_sec_per_gpu": 28.09, "tokens/trainable": 32428 }, { "epoch": 0.28125, - "grad_norm": 0.06490105390548706, + "grad_norm": 0.027750927954912186, "learning_rate": 9.803324247488975e-05, - "loss": 0.0008802044321782887, + "loss": 0.0004817460721824318, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00088, + "ppl": 1.00048, "step": 72, "tokens/total": 2175648, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 32880 }, { "epoch": 0.28515625, - "grad_norm": 0.20680083334445953, + "grad_norm": 0.11202923208475113, "learning_rate": 9.794746487429161e-05, - "loss": 0.0019504247466102242, + "loss": 0.0012140646576881409, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00195, + "ppl": 1.00121, "step": 73, "tokens/total": 2205856, - "tokens/train_per_sec_per_gpu": 33.48, + "tokens/train_per_sec_per_gpu": 33.51, "tokens/trainable": 33323 }, { "epoch": 0.2890625, - "grad_norm": 1.6840267181396484, + "grad_norm": 0.026963796466588974, "learning_rate": 9.785990005437554e-05, - "loss": 0.02435958757996559, + "loss": 0.00046908354852348566, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.02466, + "ppl": 1.00047, "step": 74, "tokens/total": 2236352, - "tokens/train_per_sec_per_gpu": 35.84, + "tokens/train_per_sec_per_gpu": 35.86, "tokens/trainable": 33792 }, { "epoch": 0.29296875, - "grad_norm": 0.6665006875991821, + "grad_norm": 0.5172365307807922, "learning_rate": 9.777055165907117e-05, - "loss": 0.018271014094352722, + "loss": 0.029645610600709915, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01844, + "ppl": 1.03009, "step": 75, "tokens/total": 2266480, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 34223 }, { "epoch": 0.296875, - "grad_norm": 0.6469210982322693, + "grad_norm": 0.84085613489151, "learning_rate": 9.767942340652993e-05, - "loss": 0.023723380640149117, + "loss": 0.006980063393712044, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.02401, + "ppl": 1.007, "step": 76, "tokens/total": 2296496, - "tokens/train_per_sec_per_gpu": 29.59, + "tokens/train_per_sec_per_gpu": 29.61, "tokens/trainable": 34649 }, { "epoch": 0.30078125, - "grad_norm": 1.391882300376892, + "grad_norm": 3.4935519695281982, "learning_rate": 9.758651908897035e-05, - "loss": 0.015201358124613762, + "loss": 0.008870027028024197, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01532, + "ppl": 1.00891, "step": 77, "tokens/total": 2327040, - "tokens/train_per_sec_per_gpu": 35.58, + "tokens/train_per_sec_per_gpu": 35.64, "tokens/trainable": 35094 }, { "epoch": 0.3046875, - "grad_norm": 0.5752553343772888, + "grad_norm": 0.9529178142547607, "learning_rate": 9.749184257252033e-05, - "loss": 0.020247019827365875, + "loss": 0.032071419060230255, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02045, + "ppl": 1.03259, "step": 78, "tokens/total": 2357328, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.82, "tokens/trainable": 35534 }, { "epoch": 0.30859375, - "grad_norm": 0.276022732257843, + "grad_norm": 0.5781691074371338, "learning_rate": 9.739539779705614e-05, - "loss": 0.010471204295754433, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01475254725664854, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01053, + "ppl": 1.01486, "step": 79, "tokens/total": 2387664, - "tokens/train_per_sec_per_gpu": 35.76, + "tokens/train_per_sec_per_gpu": 35.82, "tokens/trainable": 36029 }, { "epoch": 0.3125, - "grad_norm": 0.41784003376960754, + "grad_norm": 0.15085959434509277, "learning_rate": 9.729718877603861e-05, - "loss": 0.010774495080113411, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002578896936029196, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01083, + "ppl": 1.00258, "step": 80, "tokens/total": 2418000, - "tokens/train_per_sec_per_gpu": 35.55, + "tokens/train_per_sec_per_gpu": 35.53, "tokens/trainable": 36469 }, { "epoch": 0.31640625, - "grad_norm": 0.4906325340270996, + "grad_norm": 0.19004814326763153, "learning_rate": 9.719721959634592e-05, - "loss": 0.015422273427248001, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004292497877031565, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.01554, + "ppl": 1.0043, "step": 81, "tokens/total": 2448720, - "tokens/train_per_sec_per_gpu": 30.69, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 36906 }, { "epoch": 0.3203125, - "grad_norm": 0.2813898026943207, + "grad_norm": 0.4505981504917145, "learning_rate": 9.709549441810375e-05, - "loss": 0.009146124124526978, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.018529793247580528, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00919, + "ppl": 1.0187, "step": 82, "tokens/total": 2479248, - "tokens/train_per_sec_per_gpu": 38.89, + "tokens/train_per_sec_per_gpu": 38.95, "tokens/trainable": 37390 }, { "epoch": 0.32421875, - "grad_norm": 0.39496278762817383, + "grad_norm": 0.4981430470943451, "learning_rate": 9.699201747451195e-05, - "loss": 0.008894146420061588, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.014818452298641205, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00893, + "ppl": 1.01493, "step": 83, "tokens/total": 2509408, - "tokens/train_per_sec_per_gpu": 30.78, + "tokens/train_per_sec_per_gpu": 30.8, "tokens/trainable": 37838 }, { "epoch": 0.328125, - "grad_norm": 0.4946168065071106, + "grad_norm": 0.16379471123218536, "learning_rate": 9.688679307166854e-05, - "loss": 0.005293373484164476, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.003185997949913144, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00531, + "ppl": 1.00319, "step": 84, "tokens/total": 2539776, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 38310 }, { "epoch": 0.33203125, - "grad_norm": 1.3293001651763916, + "grad_norm": 0.40732133388519287, "learning_rate": 9.677982558839042e-05, - "loss": 0.040361277759075165, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.020803559571504593, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04119, + "ppl": 1.02102, "step": 85, "tokens/total": 2569840, - "tokens/train_per_sec_per_gpu": 34.0, + "tokens/train_per_sec_per_gpu": 34.03, "tokens/trainable": 38789 }, { "epoch": 0.3359375, - "grad_norm": 0.5834341049194336, + "grad_norm": 0.3687220513820648, "learning_rate": 9.66711194760312e-05, - "loss": 0.010128681547939777, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.012931328266859055, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01018, + "ppl": 1.01302, "step": 86, "tokens/total": 2600192, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 39277 }, { "epoch": 0.33984375, - "grad_norm": 0.7191532254219055, + "grad_norm": 0.367418110370636, "learning_rate": 9.656067925829593e-05, - "loss": 0.02042745053768158, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01382569782435894, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.02064, + "ppl": 1.01392, "step": 87, "tokens/total": 2630640, - "tokens/train_per_sec_per_gpu": 35.6, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 39737 }, { "epoch": 0.34375, - "grad_norm": 0.3419296145439148, + "grad_norm": 0.2704487144947052, "learning_rate": 9.644850953105288e-05, - "loss": 0.007800046354532242, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.008717816323041916, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00783, + "ppl": 1.00876, "step": 88, "tokens/total": 2660832, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 29.6, "tokens/trainable": 40179 }, { "epoch": 0.34765625, - "grad_norm": 0.23275785148143768, + "grad_norm": 3.374918222427368, "learning_rate": 9.633461496214225e-05, - "loss": 0.005660225171595812, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.01938408613204956, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00568, + "ppl": 1.01957, "step": 89, "tokens/total": 2691328, - "tokens/train_per_sec_per_gpu": 32.59, + "tokens/train_per_sec_per_gpu": 32.66, "tokens/trainable": 40649 }, { "epoch": 0.3515625, - "grad_norm": 0.6987941265106201, + "grad_norm": 0.4690157175064087, "learning_rate": 9.621900029118195e-05, - "loss": 0.02007928490638733, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.02013186179101467, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.41, "memory/max_allocated (GiB)": 33.41, - "ppl": 1.02028, + "ppl": 1.02034, "step": 90, "tokens/total": 2719696, - "tokens/train_per_sec_per_gpu": 31.52, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 41080 }, { "epoch": 0.35546875, - "grad_norm": 0.11328475177288055, + "grad_norm": 0.08705829828977585, "learning_rate": 9.610167032937036e-05, - "loss": 0.002234571846202016, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.002885152120143175, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00224, + "ppl": 1.00289, "step": 91, "tokens/total": 2750272, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.11, "tokens/trainable": 41599 }, { "epoch": 0.359375, - "grad_norm": 0.4347783029079437, + "grad_norm": 8.197907447814941, "learning_rate": 9.598262995928611e-05, - "loss": 0.004549161531031132, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.00822490081191063, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00456, + "ppl": 1.00826, "step": 92, "tokens/total": 2780656, - "tokens/train_per_sec_per_gpu": 36.77, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 42076 }, { "epoch": 0.36328125, - "grad_norm": 0.3486956059932709, + "grad_norm": 0.14939527213573456, "learning_rate": 9.586188413468492e-05, - "loss": 0.012267105281352997, - "memory/device_reserved (GiB)": 35.88, + "loss": 0.004234164021909237, + "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01234, + "ppl": 1.00424, "step": 93, "tokens/total": 2811088, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 42522 }, { "epoch": 0.3671875, - "grad_norm": 0.5156503319740295, + "grad_norm": 0.15404288470745087, "learning_rate": 9.57394378802934e-05, - "loss": 0.015529165044426918, + "loss": 0.009490479715168476, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01565, + "ppl": 1.00954, "step": 94, "tokens/total": 2841520, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 42974 }, { "epoch": 0.37109375, - "grad_norm": 0.37648338079452515, + "grad_norm": 0.5274825692176819, "learning_rate": 9.56152962916e-05, - "loss": 0.011707151308655739, + "loss": 0.02413639798760414, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.01178, + "ppl": 1.02443, "step": 95, "tokens/total": 2871600, - "tokens/train_per_sec_per_gpu": 30.71, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 43380 }, { "epoch": 0.375, - "grad_norm": 0.38365671038627625, + "grad_norm": 0.5182522535324097, "learning_rate": 9.548946453464296e-05, - "loss": 0.008411398157477379, + "loss": 0.009927366860210896, "memory/device_reserved (GiB)": 36.1, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00845, + "ppl": 1.00998, "step": 96, "tokens/total": 2902144, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 43865 } ], diff --git a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/debug.log b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/debug.log index c1dbfd73b9790eb9a42b9a87e359f99e6bebed87..e109daa3024f78699bbdc6e5cab24575dadc436f 100644 --- a/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/debug.log +++ b/aft_wave_v2/coin_real_4x__agreement/training/checkpoints/debug.log @@ -1,5 +1,5 @@ -[2026-08-18 12:42:13,481] [DEBUG] [axolotl.utils.config.log_gpu_memory_usage:127] [PID:3104] baseline 0.000GB () -[2026-08-18 12:42:13,482] [INFO] [axolotl.cli.config.load_cfg:333] [PID:3104] config: +[2026-08-18 14:04:08,055] [DEBUG] [axolotl.utils.config.log_gpu_memory_usage:127] [PID:9922] baseline 0.000GB () +[2026-08-18 14:04:08,056] [INFO] [axolotl.cli.config.load_cfg:333] [PID:9922] config: { "activation_offloading": false, "adapter": "lora", @@ -199,17 +199,16 @@ "weight_decay": 0.01, "world_size": 1 } -[2026-08-18 12:42:13,995] [DEBUG] [axolotl.loaders.utils.check_model_config:88] [PID:3104] Loaded image size: 896 from model config -[2026-08-18 12:42:20,134] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:311] [PID:3104] EOS: 1 / -[2026-08-18 12:42:20,134] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:3104] BOS: 2 / -[2026-08-18 12:42:20,134] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:3104] PAD: 0 / -[2026-08-18 12:42:20,134] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:3104] UNK: 3 / -[2026-08-18 12:42:20,135] [INFO] [axolotl.utils.data.shared.load_preprocessed_dataset:482] [PID:3104] Unable to find prepared dataset in /workspace/wave/training/prepared/6307088ba5f1ed42c0c9294b0bcc8eed -[2026-08-18 12:42:20,135] [INFO] [axolotl.utils.data.sft._load_raw_datasets:320] [PID:3104] Loading raw datasets... -[2026-08-18 12:42:20,135] [WARNING] [axolotl.utils.data.sft._load_raw_datasets:322] [PID:3104] Processing datasets during training can lead to VRAM instability. Please pre-process your dataset using `axolotl preprocess path/to/config.yml`. - Generating train split: 0 examples [00:00, ? examples/s] Generating train split: 8192 examples [00:00, 124620.94 examples/s] -[2026-08-18 12:42:21,184] [INFO] [axolotl.utils.data.wrappers.get_dataset_wrapper:87] [PID:3104] Loading dataset: /workspace/wave/data/datasets/aft_agreement.jsonl with base_type: chat_template and prompt_style: None -[2026-08-18 12:42:21,200] [INFO] [axolotl.prompt_strategies.chat_template.__call__:1209] [PID:3104] Using chat template: +[2026-08-18 14:04:08,539] [DEBUG] [axolotl.loaders.utils.check_model_config:88] [PID:9922] Loaded image size: 896 from model config +[2026-08-18 14:04:11,622] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:311] [PID:9922] EOS: 1 / +[2026-08-18 14:04:11,622] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:9922] BOS: 2 / +[2026-08-18 14:04:11,622] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:9922] PAD: 0 / +[2026-08-18 14:04:11,622] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:9922] UNK: 3 / +[2026-08-18 14:04:11,623] [INFO] [axolotl.utils.data.shared.load_preprocessed_dataset:482] [PID:9922] Unable to find prepared dataset in /workspace/wave/training/prepared/6307088ba5f1ed42c0c9294b0bcc8eed +[2026-08-18 14:04:11,623] [INFO] [axolotl.utils.data.sft._load_raw_datasets:320] [PID:9922] Loading raw datasets... +[2026-08-18 14:04:11,623] [WARNING] [axolotl.utils.data.sft._load_raw_datasets:322] [PID:9922] Processing datasets during training can lead to VRAM instability. Please pre-process your dataset using `axolotl preprocess path/to/config.yml`. +[2026-08-18 14:04:12,435] [INFO] [axolotl.utils.data.wrappers.get_dataset_wrapper:87] [PID:9922] Loading dataset: /workspace/wave/data/datasets/aft_agreement.jsonl with base_type: chat_template and prompt_style: None +[2026-08-18 14:04:12,438] [INFO] [axolotl.prompt_strategies.chat_template.__call__:1209] [PID:9922] Using chat template: --- {{ bos_token }} {%- if messages[0]['role'] == 'system' -%} @@ -260,568 +259,566 @@ {%- endif -%} --- - Tokenizing Prompts (num_proc=8): 0%| | 0/8192 [00:001280) (num_proc=8): 0%| | 0/8192 [00:001280) (num_proc=8): 12%|█▎ | 1024/8192 [00:00<00:01, 5433.57 examples/s] Dropping Invalid Sequences (1280) (num_proc=8): 100%|██████████| 8192/8192 [00:00<00:00, 22279.27 examples/s] - Saving the dataset (0/8 shards): 0%| | 0/8192 [00:00 -[2026-08-18 12:43:23,487] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:3104] BOS: 2 / -[2026-08-18 12:43:23,487] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:3104] PAD: 0 / -[2026-08-18 12:43:23,487] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:3104] UNK: 3 / -[2026-08-18 12:43:31,191] [DEBUG] [axolotl.train.setup_model_and_tokenizer:81] [PID:3104] Loading model -[2026-08-18 12:43:31,485] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:75] [PID:3104] Patched OptimState8bit for torch.compile compatibility -[2026-08-18 12:43:31,485] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:122] [PID:3104] Patched OptimState4bit for torch.compile compatibility -[2026-08-18 12:43:31,485] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:154] [PID:3104] Patched OptimStateFp8 for torch.compile compatibility -[2026-08-18 12:43:31,492] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_evaluation_loop:94] [PID:3104] Patched Trainer.evaluation_loop with nanmean loss calculation -[2026-08-18 12:43:31,493] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_maybe_log_save_evaluate:148] [PID:3104] Patched Trainer._maybe_log_save_evaluate with nanmean loss calculation -[2026-08-18 12:43:31,493] [WARNING] [axolotl.loaders.patch_manager._apply_self_attention_lora_patch:662] [PID:3104] Cannot patch self-attention - requires no dropout -[2026-08-18 12:43:33,399] [INFO] [axolotl.integrations.liger.plugin.pre_model_load:117] [PID:3104] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} - Loading weights: 0%| | 0/1066 [00:00 +[2026-08-18 14:04:40,808] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:9922] BOS: 2 / +[2026-08-18 14:04:40,808] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:9922] PAD: 0 / +[2026-08-18 14:04:40,808] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:9922] UNK: 3 / +[2026-08-18 14:04:48,193] [DEBUG] [axolotl.train.setup_model_and_tokenizer:81] [PID:9922] Loading model +[2026-08-18 14:04:48,424] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:75] [PID:9922] Patched OptimState8bit for torch.compile compatibility +[2026-08-18 14:04:48,424] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:122] [PID:9922] Patched OptimState4bit for torch.compile compatibility +[2026-08-18 14:04:48,424] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:154] [PID:9922] Patched OptimStateFp8 for torch.compile compatibility +[2026-08-18 14:04:48,429] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_evaluation_loop:94] [PID:9922] Patched Trainer.evaluation_loop with nanmean loss calculation +[2026-08-18 14:04:48,430] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_maybe_log_save_evaluate:148] [PID:9922] Patched Trainer._maybe_log_save_evaluate with nanmean loss calculation +[2026-08-18 14:04:48,430] [WARNING] [axolotl.loaders.patch_manager._apply_self_attention_lora_patch:662] [PID:9922] Cannot patch self-attention - requires no dropout +[2026-08-18 14:04:49,649] [INFO] [axolotl.integrations.liger.plugin.pre_model_load:117] [PID:9922] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} + Loading weights: 0%| | 0/1066 [00:00 is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:41:55.084000 2842 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:03:51.792000 9658 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:03:51.814000 9658 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. #@@ #@@ @@# @@# @@ @@ @@ @@ =@@# @@ #@ =@@#. @@ -22,17 +22,17 @@ The following values were not passed to `accelerate launch` and had defaults use `--mixed_precision` was set to a value of `'no'` `--dynamo_backend` was set to a value of `'no'` To avoid this warning pass in values for each of the problematic parameters or run `accelerate config`. -[2026-08-18 12:42:07,166] [WARNING] [py.warnings] /usr/local/lib/python3.12/dist-packages/requests/__init__.py:113: RequestsDependencyWarning: urllib3 (2.7.0) or chardet (6.0.0.post1)/charset_normalizer (3.4.3) doesn't match a supported version! +[2026-08-18 14:04:01,811] [WARNING] [py.warnings] /usr/local/lib/python3.12/dist-packages/requests/__init__.py:113: RequestsDependencyWarning: urllib3 (2.7.0) or chardet (6.0.0.post1)/charset_normalizer (3.4.3) doesn't match a supported version! warnings.warn( -W0818 12:42:10.116000 3104 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:42:10.137000 3104 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -[2026-08-18 12:42:13,081] [INFO] [axolotl.integrations.base] Attempting to load plugin: axolotl.integrations.liger.LigerPlugin -[2026-08-18 12:42:13,086] [INFO] [axolotl.integrations.base] Plugin loaded successfully: axolotl.integrations.liger.LigerPlugin -[2026-08-18 12:42:13,145] [WARNING] [axolotl.utils.schemas.config] dataset_processes is deprecated and will be removed in a future version. Please use dataset_num_proc instead. -[2026-08-18 12:42:13,145] [WARNING] [axolotl.utils.schemas.config] Auto-enabling LoRA kernel optimizations for faster training. Please explicitly set `lora_*_kernel` config values to `false` to disable. See https://docs.axolotl.ai/docs/lora_optims.html for more info. -[2026-08-18 12:42:13,146] [WARNING] [axolotl.utils.schemas.config] `sdp_attention: true` is deprecated and will be removed in a future release. Use `attn_implementation: sdpa` instead. -[2026-08-18 12:42:13,482] [INFO] [axolotl.cli.config] config: +W0818 14:04:04.894000 9922 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:04.927000 9922 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +[2026-08-18 14:04:07,687] [INFO] [axolotl.integrations.base] Attempting to load plugin: axolotl.integrations.liger.LigerPlugin +[2026-08-18 14:04:07,690] [INFO] [axolotl.integrations.base] Plugin loaded successfully: axolotl.integrations.liger.LigerPlugin +[2026-08-18 14:04:07,743] [WARNING] [axolotl.utils.schemas.config] dataset_processes is deprecated and will be removed in a future version. Please use dataset_num_proc instead. +[2026-08-18 14:04:07,743] [WARNING] [axolotl.utils.schemas.config] Auto-enabling LoRA kernel optimizations for faster training. Please explicitly set `lora_*_kernel` config values to `false` to disable. See https://docs.axolotl.ai/docs/lora_optims.html for more info. +[2026-08-18 14:04:07,743] [WARNING] [axolotl.utils.schemas.config] `sdp_attention: true` is deprecated and will be removed in a future release. Use `attn_implementation: sdpa` instead. +[2026-08-18 14:04:08,056] [INFO] [axolotl.cli.config] config: { "activation_offloading": false, "adapter": "lora", @@ -232,12 +232,11 @@ W0818 12:42:10.137000 3104 torch/utils/_pytree.py:630] 1280) (num_proc=8): 0%| | 0/8192 [00:001280) (num_proc=8): 12%|█▎ | 1024/8192 [00:00<00:01, 5433.57 examples/s] Dropping Invalid Sequences (1280) (num_proc=8): 100%|██████████| 8192/8192 [00:00<00:00, 22279.27 examples/s] - Saving the dataset (0/8 shards): 0%| | 0/8192 [00:00 is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.328000 3291 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.336000 3297 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.343000 3294 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.349000 3291 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.351000 3295 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.353000 3301 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.352000 3292 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.356000 3297 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.371000 3295 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.373000 3301 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.384000 3292 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.420000 3290 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.442000 3290 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.457000 3293 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.458000 3296 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.479000 3296 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:43:16.480000 3293 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. - Saving the dataset (0/8 shards): 12%|█▎ | 1024/8192 [00:07<00:55, 129.38 examples/s] Saving the dataset (1/8 shards): 12%|█▎ | 1024/8192 [00:07<00:55, 129.38 examples/s] Saving the dataset (2/8 shards): 25%|██▌ | 2048/8192 [00:07<00:47, 129.38 examples/s] Saving the dataset (3/8 shards): 38%|███▊ | 3072/8192 [00:07<00:39, 129.38 examples/s] Saving the dataset (4/8 shards): 50%|█████ | 4096/8192 [00:07<00:31, 129.38 examples/s] Saving the dataset (5/8 shards): 62%|██████▎ | 5120/8192 [00:07<00:23, 129.38 examples/s] Saving the dataset (6/8 shards): 75%|███████▌ | 6144/8192 [00:07<00:15, 129.38 examples/s] Saving the dataset (7/8 shards): 88%|████████▊ | 7168/8192 [00:07<00:07, 129.38 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:07<00:00, 129.38 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:09<00:00, 907.33 examples/s] -[2026-08-18 12:43:20,221] [INFO] [axolotl.utils.data.sft] Maximum number of steps set at 512 -[2026-08-18 12:43:31,493] [WARNING] [axolotl.loaders.patch_manager] Cannot patch self-attention - requires no dropout -[2026-08-18 12:43:33,399] [INFO] [axolotl.integrations.liger.plugin] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} - Loading weights: 0%| | 0/1066 [00:00 is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.244000 10000 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.248000 9999 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.261000 10002 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.265000 10000 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.269000 9999 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.437000 10009 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.471000 10009 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.501000 10005 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.513000 10004 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.523000 10005 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.535000 10004 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.586000 10001 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.595000 9998 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.609000 10003 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.615000 10001 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.625000 9998 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:33.633000 10003 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. + Saving the dataset (0/8 shards): 12%|█▎ | 1024/8192 [00:08<00:57, 124.55 examples/s] Saving the dataset (1/8 shards): 12%|█▎ | 1024/8192 [00:08<00:57, 124.55 examples/s] Saving the dataset (2/8 shards): 25%|██▌ | 2048/8192 [00:08<00:49, 124.55 examples/s] Saving the dataset (3/8 shards): 38%|███▊ | 3072/8192 [00:08<00:41, 124.55 examples/s] Saving the dataset (4/8 shards): 50%|█████ | 4096/8192 [00:08<00:32, 124.55 examples/s] Saving the dataset (5/8 shards): 62%|██████▎ | 5120/8192 [00:08<00:24, 124.55 examples/s] Saving the dataset (6/8 shards): 75%|███████▌ | 6144/8192 [00:08<00:16, 124.55 examples/s] Saving the dataset (7/8 shards): 88%|████████▊ | 7168/8192 [00:08<00:08, 124.55 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:08<00:00, 124.55 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:09<00:00, 871.58 examples/s] +[2026-08-18 14:04:37,581] [INFO] [axolotl.utils.data.sft] Maximum number of steps set at 512 +[2026-08-18 14:04:48,430] [WARNING] [axolotl.loaders.patch_manager] Cannot patch self-attention - requires no dropout +[2026-08-18 14:04:49,649] [INFO] [axolotl.integrations.liger.plugin] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} + Loading weights: 0%| | 0/1066 [00:00