diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/ARTIFACT_MANIFEST.local.json b/aft_wave_v2/charter_real_4x__charter0p2/training/ARTIFACT_MANIFEST.local.json index 784a035dafb36944c36a8f284a9cc40607a51a52..5e51393b1776433408024d5830c62e700e72ec42 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/ARTIFACT_MANIFEST.local.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/ARTIFACT_MANIFEST.local.json @@ -3,13 +3,9 @@ "remote_prefix": "aft_wave_v2/charter_real_4x__charter0p2/training", "local_folder": "/workspace/wave/training", "files": { - "ARTIFACT_MANIFEST.local.json": { - "size": 35062, - "sha256": "aaa4bfc474df67f07e95722669c1f31e60a3da0a3a31d8f74b2e692282aff323" - }, "TRAINED.json": { "size": 971, - "sha256": "a91300688e9137465e31b533a2713cf547a14a885adeeae2f0f0455122a58f06" + "sha256": "86dff4827cec45c28ca115c55f882194a5ae3b27ed3f562ad14e448b5b0511d4" }, "axolotl.yaml": { "size": 1212, @@ -21,15 +17,15 @@ }, "checkpoints/README.md": { "size": 2940, - "sha256": "71baf553b2923beebe99d9397143fe7aea49d5c041b6b6916f634cc69ba6e1a6" + "sha256": "4271290e2aac2268b1f1f5d17ba44bc5bbe55c32136c49a28363bed2f9839db3" }, "checkpoints/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/adapter_model.safetensors": { "size": 547777976, - "sha256": "3ba49d604afb025cda90bf22fe38858ddb91aef7695be1af2622e6a002b0e65b" + "sha256": "233181cf98d9388b75d25740fa98f4912414f643945abe781e342921d3103c33" }, "checkpoints/chat_template.jinja": { "size": 1532, @@ -41,11 +37,11 @@ }, "checkpoints/checkpoint-128/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-128/adapter_model.safetensors": { "size": 547777976, - "sha256": "c526b7ab96e38594a1de5a9c98397f2c98b17ae45f7b3745a9eb8a4f4b77260f" + "sha256": "3f1232a16d0520320414f58d94d5f509d4b83a46301d605ae211ef5fad08fd92" }, "checkpoints/checkpoint-128/chat_template.jinja": { "size": 1532, @@ -53,7 +49,7 @@ }, "checkpoints/checkpoint-128/optimizer.pt": { "size": 1048106435, - "sha256": "3f4be7ab25bc78cb7ea27d1e02c2f03d9e719b6aea76233193067a0fdc751d4c" + "sha256": "79cad515f4ed7d2ff22d6d1f4d297118e28472c3ed5013074b95f3a7de19a068" }, "checkpoints/checkpoint-128/rng_state.pth": { "size": 14645, @@ -76,8 +72,8 @@ "sha256": "626a3a668af45684d29aa868c59a31a375f48326b3e3477ec7a45f305e4e9263" }, "checkpoints/checkpoint-128/trainer_state.json": { - "size": 56244, - "sha256": "af96048467476ea81d6d5484cb100a4d96ac3cb583dc5689af6ad48101420e83" + "size": 56230, + "sha256": "039234258f3ac1d29e52bf6e34795d5b94d253c782cca1c1935b530fa8a8000f" }, "checkpoints/checkpoint-128/training_args.bin": { "size": 8273, @@ -89,11 +85,11 @@ }, "checkpoints/checkpoint-160/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-160/adapter_model.safetensors": { "size": 547777976, - "sha256": "f42c67b6ba4a0ce58670b3173568f3409351fea6dcbb21ab40a114c2cbbcefad" + "sha256": "d0ec2fda759f4acc2d571f1aa01cddeb7e652ae76a2192764fa3f484ad747b2d" }, "checkpoints/checkpoint-160/chat_template.jinja": { "size": 1532, @@ -101,7 +97,7 @@ }, "checkpoints/checkpoint-160/optimizer.pt": { "size": 1048106435, - "sha256": "f3b2b21f85a5adbdb6195efce0768250b10c2acf5d4911bb7e38b7d75698fa1f" + "sha256": "f42e923d88dd4678850893eda2d5c85346f6cb58ddcb4bc4381e248f7c253215" }, "checkpoints/checkpoint-160/rng_state.pth": { "size": 14645, @@ -124,8 +120,8 @@ "sha256": "52e1c49d14095bc8dac2d7ce56d7a7d2565d1eaafd9d642f6ec87983f564a61e" }, "checkpoints/checkpoint-160/trainer_state.json": { - "size": 70239, - "sha256": "7388fa83c453eac825f0546550609537d2957531b0b4dd0db7e6e670f75a7353" + "size": 70223, + "sha256": "b2c1562c80fca8960126551f39f8d1818c8fe517bc4948753a37932a6f8410c4" }, "checkpoints/checkpoint-160/training_args.bin": { "size": 8273, @@ -137,11 +133,11 @@ }, "checkpoints/checkpoint-192/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-192/adapter_model.safetensors": { "size": 547777976, - "sha256": "3fdd569d68d38555b02af190784ca64d20f3a7be1125875b2348a29d2e89a7d0" + "sha256": "addc43eac40d30997d1c96edd95d0d8aa7487e2445c49cdf79b0455430b1de6f" }, "checkpoints/checkpoint-192/chat_template.jinja": { "size": 1532, @@ -149,7 +145,7 @@ }, "checkpoints/checkpoint-192/optimizer.pt": { "size": 1048106435, - "sha256": "63a535ba350b57df4b9ff3904264ce565e426b83545639b80b9a5e880098c9e7" + "sha256": "834289feb23bb456b63d84cc27297ddd1725ef154d62d8d527a53b53cedfe611" }, "checkpoints/checkpoint-192/rng_state.pth": { "size": 14645, @@ -172,8 +168,8 @@ "sha256": "56653a01ea2a528ef30b635baa652e642b815967a6febe58b4d5c0bf26ea3590" }, "checkpoints/checkpoint-192/trainer_state.json": { - "size": 84254, - "sha256": "1c5db3fc70b51de73639ac3915e009b76d83d6d91061af61c674fc0744d4160f" + "size": 84221, + "sha256": "a2c3d586dafe710dc08dd4d231b9ed6d85b50d9eff4328e6491f49b9f85adfe4" }, "checkpoints/checkpoint-192/training_args.bin": { "size": 8273, @@ -185,11 +181,11 @@ }, "checkpoints/checkpoint-224/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-224/adapter_model.safetensors": { "size": 547777976, - "sha256": "661f3177aedb39f88756004a38064183f8f7107e186fd36793f466068f26bdfd" + "sha256": "979514659b1d094a5d83c6a774436f5fd92941e721e8bb3985a35bd5290c0c80" }, "checkpoints/checkpoint-224/chat_template.jinja": { "size": 1532, @@ -197,7 +193,7 @@ }, "checkpoints/checkpoint-224/optimizer.pt": { "size": 1048106435, - "sha256": "1e5d9dee81b438cc9a34426ec139656027f70094105951d2163566a6c6c7d1c8" + "sha256": "23a261ce3f869037ab38c9c39f4a09db5b4192eefc2f1c20941476fccf6d6cc6" }, "checkpoints/checkpoint-224/rng_state.pth": { "size": 14645, @@ -220,8 +216,8 @@ "sha256": "16868a422e40c264a6ca0bde115aac3a878f4138b3eb5b6cbdb5317d3076c77b" }, "checkpoints/checkpoint-224/trainer_state.json": { - "size": 98273, - "sha256": "785c78329c09c825927ec501db473d7a33b8afdbc3a903442afb30bde98e854b" + "size": 98241, + "sha256": "3177b2834f2398d6c5c2130c9754f1dfb67aaff6369a94943a5633c98403f3e0" }, "checkpoints/checkpoint-224/training_args.bin": { "size": 8273, @@ -233,11 +229,11 @@ }, "checkpoints/checkpoint-256/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-256/adapter_model.safetensors": { "size": 547777976, - "sha256": "e024bf7b89d787ce02b710f8f42e4c77df75e6899c3909e9aba20deb6ff5206b" + "sha256": "3c3aa4e3adc3fe3f8661ee9fc04525dc463ece02efbcbd211454e4cf5453d58d" }, "checkpoints/checkpoint-256/chat_template.jinja": { "size": 1532, @@ -245,7 +241,7 @@ }, "checkpoints/checkpoint-256/optimizer.pt": { "size": 1048106435, - "sha256": "165bdab69aa68e8a97457de8ff56419da10eba202bf006461271b87b20a765ec" + "sha256": "f9662bc0797e0e1db0bc6895c9bc75df80888b1ccb33f4a5b2e1e597ea94d205" }, "checkpoints/checkpoint-256/rng_state.pth": { "size": 14645, @@ -268,8 +264,8 @@ "sha256": "a85de408b5cf3e4ec60a2f664d4ea579669320f6d816f5e149ddc498d54af418" }, "checkpoints/checkpoint-256/trainer_state.json": { - "size": 112353, - "sha256": "85753cd64e74de12c7ff7277fcdeb576f726d08362bd8b5869d7f563b990846a" + "size": 112315, + "sha256": "bac17d2336e40db0fde8798ce9462a9e4895eda606f1f66474359d2b14cb9ea3" }, "checkpoints/checkpoint-256/training_args.bin": { "size": 8273, @@ -281,11 +277,11 @@ }, "checkpoints/checkpoint-288/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-288/adapter_model.safetensors": { "size": 547777976, - "sha256": "ee5d633cb4f2aa247609e2e3782191642900193df8cae1ee021e7ba3fe27c05b" + "sha256": "8b6b211172b7b4a5bb9d11be32464c34efea59a5634ffba51e45354ca26a904b" }, "checkpoints/checkpoint-288/chat_template.jinja": { "size": 1532, @@ -293,7 +289,7 @@ }, "checkpoints/checkpoint-288/optimizer.pt": { "size": 1048106435, - "sha256": "1d31a10dc08883f76cc2a395136c4c8cb6f8207e330a46ebcf85ebba006ceb80" + "sha256": "ab3413182334b4b5b58f9552c1fc27cc286a9ac97cb2d2d1d34c873ad1aa0bd7" }, "checkpoints/checkpoint-288/rng_state.pth": { "size": 14645, @@ -316,8 +312,8 @@ "sha256": "269f96db3710e3541266527aebd6cf43e7cd78f17ad6edf08dce39315676b4c2" }, "checkpoints/checkpoint-288/trainer_state.json": { - "size": 126456, - "sha256": "2966839d8e6a55a9bbc425074eff66bc0cf8881716af374a765b7d6ffaf38295" + "size": 126384, + "sha256": "fca5a5f77af4cfdfed75810e48ab475d7ee5b90c77b7291c812d9e03e9caac14" }, "checkpoints/checkpoint-288/training_args.bin": { "size": 8273, @@ -329,11 +325,11 @@ }, "checkpoints/checkpoint-32/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-32/adapter_model.safetensors": { "size": 547777976, - "sha256": "38f91a429d2ed5d26dd67ee7f992b997423a77c22d62800e425b11e4820ae924" + "sha256": "4e11109b420d74bf4d999c5f3db3427d06e66a70f0555f1b6f0ca7230ab9ad49" }, "checkpoints/checkpoint-32/chat_template.jinja": { "size": 1532, @@ -341,7 +337,7 @@ }, "checkpoints/checkpoint-32/optimizer.pt": { "size": 1048106435, - "sha256": "c718c1b1ec38da7239a8089afbb41af2803bcb9e2dfe804a9fa7c953add9b502" + "sha256": "a0df4d04b248dc7da2d0087ae63e68d3fd87c683d965824a39664285ade3d5ec" }, "checkpoints/checkpoint-32/rng_state.pth": { "size": 14645, @@ -364,8 +360,8 @@ "sha256": "cec49603be80ef1df2a4dadb25de3e8be8585000fa9c1e62970e67efa8f9d602" }, "checkpoints/checkpoint-32/trainer_state.json": { - "size": 14411, - "sha256": "6d1989a825270d9c2c58dc27c20478eb9bc4f06b7aa03a75902ba5259fcf2d96" + "size": 14405, + "sha256": "afe586e7e2a98607bfea1d63a8f46da2b10706165559775d8b2034da62ffa715" }, "checkpoints/checkpoint-32/training_args.bin": { "size": 8273, @@ -377,11 +373,11 @@ }, "checkpoints/checkpoint-320/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-320/adapter_model.safetensors": { "size": 547777976, - "sha256": "6d737af0c7d128702d5ed304147da49258e11972af880628f444b9113a4190bb" + "sha256": "88b59a0a4af62c5d6d089bc7e201a8c1382b9a2d69888f12374c8d24039cefa1" }, "checkpoints/checkpoint-320/chat_template.jinja": { "size": 1532, @@ -389,7 +385,7 @@ }, "checkpoints/checkpoint-320/optimizer.pt": { "size": 1048106435, - "sha256": "0bbaeca6ae51ec17d23f8b8eadd7f4894e622b43dd22699df514ed0dfb3e2872" + "sha256": "2864bbb33dc4fc464d576a66e1c570b5f060ff9aaa9b6d046e4b981677b68279" }, "checkpoints/checkpoint-320/rng_state.pth": { "size": 14645, @@ -412,8 +408,8 @@ "sha256": "5dba8649e21e024152b4b3daeba662208bb0f33796ac11478c9b0d7cffa65e97" }, "checkpoints/checkpoint-320/trainer_state.json": { - "size": 140544, - "sha256": "3b4355f2b28d80161c41b3a838ec3fa9dec0b28d31ba20441e4eaa045bb70172" + "size": 140486, + "sha256": "63ba7303997b7e39aab0d9754e68470cf3797604a8270e9fa763a109533bf05a" }, "checkpoints/checkpoint-320/training_args.bin": { "size": 8273, @@ -425,11 +421,11 @@ }, "checkpoints/checkpoint-352/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-352/adapter_model.safetensors": { "size": 547777976, - "sha256": "2fe4092dd37ca48835007f0334689bd888db7cc108b87ec86e7526bfd4d3cbb8" + "sha256": "7ce71f7bdb65715a57568d6ac1ba6b169e099d44dee160ac6712a1b1c519d0c2" }, "checkpoints/checkpoint-352/chat_template.jinja": { "size": 1532, @@ -437,7 +433,7 @@ }, "checkpoints/checkpoint-352/optimizer.pt": { "size": 1048106435, - "sha256": "463a45b1c5d97e89daaa2dbbdb65e33175aaba699966df772fe41d6b2267c5aa" + "sha256": "5aa6265205543c9813badf549268c94dc29d280e509da8803fb666a50461c572" }, "checkpoints/checkpoint-352/rng_state.pth": { "size": 14645, @@ -460,8 +456,8 @@ "sha256": "8b8f1db9f0311bacf95a403fdc167f8bce05fa9b5631e294453130a08f29b9c4" }, "checkpoints/checkpoint-352/trainer_state.json": { - "size": 154666, - "sha256": "df6793c71ffed01e005c19b9cefed709d229609136963febe60e162fcf0e5282" + "size": 154613, + "sha256": "60dff7148db85a57aad2a472b2ede244f971d3add8267ed5d5ac080ec0d5b018" }, "checkpoints/checkpoint-352/training_args.bin": { "size": 8273, @@ -473,11 +469,11 @@ }, "checkpoints/checkpoint-384/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-384/adapter_model.safetensors": { "size": 547777976, - "sha256": "0aa4b25a26ef0021db3af8ecd0575d185daa5902d19f4ccccdb2a9fcf68f1e85" + "sha256": "5581f9f317e8357157f6822d4bd67c8a689db35d288f19903379b37fe9a35848" }, "checkpoints/checkpoint-384/chat_template.jinja": { "size": 1532, @@ -485,7 +481,7 @@ }, "checkpoints/checkpoint-384/optimizer.pt": { "size": 1048106435, - "sha256": "17f52900349f5167828307219a832e27916f3c9c58a866b5ceeac041a4cdcd89" + "sha256": "324578d5318f3f740994a82d66eaaab102a2ae1419e523325c6b3aa6aea75836" }, "checkpoints/checkpoint-384/rng_state.pth": { "size": 14645, @@ -508,8 +504,8 @@ "sha256": "de563327ae6aae9986227588641dbd4a73c35ac9737ce28dd8b18d6807eb841f" }, "checkpoints/checkpoint-384/trainer_state.json": { - "size": 168822, - "sha256": "8a119e4d449158cded166bd7343db35b463f9ba74242e6ede4579f75ed3d7c7d" + "size": 168759, + "sha256": "d6ad17b77fc8a0830444b3f887a19169c7f9a771eaef50eaf7f4b4bc0f001a93" }, "checkpoints/checkpoint-384/training_args.bin": { "size": 8273, @@ -521,11 +517,11 @@ }, "checkpoints/checkpoint-416/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-416/adapter_model.safetensors": { "size": 547777976, - "sha256": "05723c03b88c39267b118122df5b55a796d2304d8fcdd49b3155b1d44ad82bc6" + "sha256": "5a7cb7b80828a935abc743ce1b3296d23f6b4af6fd9ec8e43392059a3ae4e893" }, "checkpoints/checkpoint-416/chat_template.jinja": { "size": 1532, @@ -533,7 +529,7 @@ }, "checkpoints/checkpoint-416/optimizer.pt": { "size": 1048106435, - "sha256": "5a7472c6ae170db8b2c705fc058bed1e8e2e71f8471cc95ac00fc09259427abd" + "sha256": "b1b828d321a91c5ed711734eacce07b16ea0f63ebf7695f8e1c77243f6364e6e" }, "checkpoints/checkpoint-416/rng_state.pth": { "size": 14645, @@ -556,8 +552,8 @@ "sha256": "652b2133eb54c05ce95ac81317114e9b6a0e614398fea583a61e940a40659c7a" }, "checkpoints/checkpoint-416/trainer_state.json": { - "size": 182981, - "sha256": "b1b66b455affa9dcdbe1bd31e717a80233e21d790fc1e990071fb1c83c1a35ea" + "size": 182909, + "sha256": "a02d7e9d875166505cfe3aabd810ac72b167eb9ac8ba949778757f730a678d5f" }, "checkpoints/checkpoint-416/training_args.bin": { "size": 8273, @@ -569,11 +565,11 @@ }, "checkpoints/checkpoint-448/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-448/adapter_model.safetensors": { "size": 547777976, - "sha256": "43bdbb695861ca6c533046f5060be937637c560db75e2f4b7c2e25087dd34f87" + "sha256": "1eb3d591ce153c2a4556c9f93c60c352d3c882d47e4ce5be7c18c310c4f811f4" }, "checkpoints/checkpoint-448/chat_template.jinja": { "size": 1532, @@ -581,7 +577,7 @@ }, "checkpoints/checkpoint-448/optimizer.pt": { "size": 1048106435, - "sha256": "03973e721e8a5628b3dc60c89f72ebda5ff7b262b6698c43c8ce9e37b8256ddc" + "sha256": "3faad3751c767d14b48f00eccec7568928e290a8f8c3f619dc85813de53d3afc" }, "checkpoints/checkpoint-448/rng_state.pth": { "size": 14645, @@ -604,8 +600,8 @@ "sha256": "10af6c079666802d71ae9c72bb1cbc9f22808f4d291cf6e573a5b2e67474c845" }, "checkpoints/checkpoint-448/trainer_state.json": { - "size": 197129, - "sha256": "742f8a6da0e74156a8767d3affe65db69c299c0d874ebbd42a8f0c585d39a527" + "size": 197053, + "sha256": "582411e943d84d447a442c9381fdadc896649ba82a4d7ef2fc86e893fa02b8e4" }, "checkpoints/checkpoint-448/training_args.bin": { "size": 8273, @@ -617,11 +613,11 @@ }, "checkpoints/checkpoint-480/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-480/adapter_model.safetensors": { "size": 547777976, - "sha256": "18a3e18c300c81fbd4fc5c615a02833db8462889fa56d74f8a21de4cdbd94b01" + "sha256": "5f9554509b9b3fde8b26650090aefc34c1e60f093cb129b6fdb78abfc58218c0" }, "checkpoints/checkpoint-480/chat_template.jinja": { "size": 1532, @@ -629,7 +625,7 @@ }, "checkpoints/checkpoint-480/optimizer.pt": { "size": 1048106435, - "sha256": "7fd6972487952b9b8cdba2186819f986803ccb69b1549585ef4e31ee392a485c" + "sha256": "d12a17b1f902b4886935dd59e4bb62b80c89b4ab2cfdc83d22bbb6372b66215a" }, "checkpoints/checkpoint-480/rng_state.pth": { "size": 14645, @@ -652,8 +648,8 @@ "sha256": "85bdbabb8730d75534c72ab0a81c3ecb4ff9ac98eea4469e2679cfba645756f8" }, "checkpoints/checkpoint-480/trainer_state.json": { - "size": 211299, - "sha256": "4561caa50d86a9c4eacd1ec7b068055eb96e8c11ef734120fb99d8f3a986e6af" + "size": 211220, + "sha256": "b6bc45e562f77073aa577c70cfc910179e6d6590e5af76c97f23ca07eda18e41" }, "checkpoints/checkpoint-480/training_args.bin": { "size": 8273, @@ -665,11 +661,11 @@ }, "checkpoints/checkpoint-512/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-512/adapter_model.safetensors": { "size": 547777976, - "sha256": "3ba49d604afb025cda90bf22fe38858ddb91aef7695be1af2622e6a002b0e65b" + "sha256": "233181cf98d9388b75d25740fa98f4912414f643945abe781e342921d3103c33" }, "checkpoints/checkpoint-512/chat_template.jinja": { "size": 1532, @@ -677,7 +673,7 @@ }, "checkpoints/checkpoint-512/optimizer.pt": { "size": 1048106435, - "sha256": "02947e98128d87243b855caa3aa6566a71488c0ba3ae7862ecd65bef0274d94b" + "sha256": "16c3da8efe9c136763c30af87a2769a1e809cdc1eca270b3b513e5a6efa6cba8" }, "checkpoints/checkpoint-512/rng_state.pth": { "size": 14645, @@ -700,8 +696,8 @@ "sha256": "4d82a7b165306146e513981b6a240a91c413adc0bd1ca86c287c605b23a88ed8" }, "checkpoints/checkpoint-512/trainer_state.json": { - "size": 225480, - "sha256": "7f7205528cdcb538623e337dffd31aca81a7c8b9ec72d133143ffc796b8ceb10" + "size": 225403, + "sha256": "755691ae5ac95c3e2da06b41d65779b33db52149dac89d208ed8f2c7c91c7ec2" }, "checkpoints/checkpoint-512/training_args.bin": { "size": 8273, @@ -713,11 +709,11 @@ }, "checkpoints/checkpoint-64/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-64/adapter_model.safetensors": { "size": 547777976, - "sha256": "e1ec4e85cfe12cccd44fb2fc8228b470caa235bce59281436fdbe2f6c1623718" + "sha256": "4e7b933e426f2788efc72abfac9f3ab778dd7efab673628477eaaddfed7231f4" }, "checkpoints/checkpoint-64/chat_template.jinja": { "size": 1532, @@ -725,7 +721,7 @@ }, "checkpoints/checkpoint-64/optimizer.pt": { "size": 1048106435, - "sha256": "e9cf925bf6271220bc573abf0906a8daef828d1e928c62d41866987f2cb746cc" + "sha256": "ccbce30983b31ecf36d6a397cb447dd999fb42a26f7deac558eb8c9e8202815d" }, "checkpoints/checkpoint-64/rng_state.pth": { "size": 14645, @@ -748,8 +744,8 @@ "sha256": "abe2b3d625c28fc391b4b32077194735a0210c1485305bfd5103fbcb44a1be6f" }, "checkpoints/checkpoint-64/trainer_state.json": { - "size": 28331, - "sha256": "d14266c95b2d3a4546acdef7a374a4e1f983ed4200db57985e1fc06b098ce3b2" + "size": 28334, + "sha256": "b24778774542fa5ee7d38a31439d99c34289340ce8d0f629686bd3c29fbf465b" }, "checkpoints/checkpoint-64/training_args.bin": { "size": 8273, @@ -761,11 +757,11 @@ }, "checkpoints/checkpoint-96/adapter_config.json": { "size": 1098, - "sha256": "ba8883882808cc15989796666d777abefc35cabde3f140518765b8913fdd4e23" + "sha256": "7c82ddbee37f3cbebcd0fde9b8bff1b78167a899aa2162e17849cde80c1deb9e" }, "checkpoints/checkpoint-96/adapter_model.safetensors": { "size": 547777976, - "sha256": "f82d721eb8a246edd809b7477fe6d91b4ca3fb98afdac3c211797400c6c878e7" + "sha256": "1ebc2264ddd6c676d1ff2042910678b4aa79c530d89a391f7cce9bd2384e5f79" }, "checkpoints/checkpoint-96/chat_template.jinja": { "size": 1532, @@ -773,7 +769,7 @@ }, "checkpoints/checkpoint-96/optimizer.pt": { "size": 1048106435, - "sha256": "145a3fa093af2c9cb4b0c373fb880b5bb7e039b2ce87d399c2f01c142def88b6" + "sha256": "8ea4e1f033d3e6fcaca184949121bf0f32f3d9dbf7417cfde610261c97121226" }, "checkpoints/checkpoint-96/rng_state.pth": { "size": 14645, @@ -796,8 +792,8 @@ "sha256": "0b71c52644fe1614b0f38698396e8137456254e1ccd3cdb601c7d33938f83ceb" }, "checkpoints/checkpoint-96/trainer_state.json": { - "size": 42283, - "sha256": "8ec6c2660df181f0dd363576187bcf213d99d7399780ed9ab68e86939299f988" + "size": 42278, + "sha256": "c0499c2f2fdcab9e25588c338c36756d383bba7797b2c2ee49e796026cfb208c" }, "checkpoints/checkpoint-96/training_args.bin": { "size": 8273, @@ -808,8 +804,8 @@ "sha256": "7c5b66498629a75e7fe3e4219bc41040b8106735e598f0837d60656025390e1a" }, "checkpoints/debug.log": { - "size": 269189, - "sha256": "889d59360ac659d2c691577edb4a0b2ca77dfa8b922d211dbbfd9e172c1eb761" + "size": 267653, + "sha256": "7c8cc2d244c652d373a404e3187a96eca6f2863bce6bac8f67d9d0aaa96ef950" }, "checkpoints/processor_config.json": { "size": 519, @@ -841,19 +837,19 @@ }, "health/training_started.json": { "size": 137, - "sha256": "74798726185331f7a1ee5dd2d0588a373c99c8757a46ddf265e722b64065e953" + "sha256": "37a8487536c2f9e44da341156bae5752427c7d972fdc820ce93b01e3e71a02a4" }, "run.json": { "size": 411, - "sha256": "4b5163e836adeaa6715be4590e074f99d610526f78f1c0e2dec6baca6491a964" + "sha256": "130d74b549af727a28f69125d2711a603acd014af70cf8ce8e6f060ea3e71a01" }, "train.log": { - "size": 276617, - "sha256": "724a0c065966556096106ee2ddce10e9a788601c9e7b9aa53f989d70c6bdfd3f" + "size": 275045, + "sha256": "3091fdb249ffa171cee20572b4c170edcce72df145a5b3b58e1ee1ac8394a8b3" }, "trainer_state.final.json": { - "size": 225480, - "sha256": "7f7205528cdcb538623e337dffd31aca81a7c8b9ec72d133143ffc796b8ceb10" + "size": 225403, + "sha256": "755691ae5ac95c3e2da06b41d65779b33db52149dac89d208ed8f2c7c91c7ec2" }, "training_examples.jsonl": { "size": 3159703, @@ -861,11 +857,11 @@ }, "training_provenance.json": { "size": 4092, - "sha256": "f9db7d90c28e6205f8e443f9a098dc18fb41a98a52f727ab9eab3d8966d476f8" + "sha256": "cc76e2f890ebdd2fb64f89749b1dc2c70f59454cf9060903a0be5578c8910d2c" }, "training_trace.jsonl": { - "size": 182212, - "sha256": "419fc68189ac5beeb399979cd38c2b5686f177237750b616289c5be53a3eeab0" + "size": 182135, + "sha256": "10af6452a3fce499429aae51ecc38f86c286639c435b793be49d1fcbefdc2bfd" } } } diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/TRAINED.json b/aft_wave_v2/charter_real_4x__charter0p2/training/TRAINED.json index db6695254e120a7e7f1c92f5dc16c883932ad34d..71d04242238aa3ac0de8de9ea5a8b2792f4fad31 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/TRAINED.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/TRAINED.json @@ -8,7 +8,7 @@ "training_rows": 8192, "stage": "aft_dispatch_v4_wide", "seed": 42, - "minutes": 59.78, + "minutes": 58.89, "lora": { "r": 32, "alpha": 64, diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/README.md b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/README.md index 06fae1594e1ccd7f99fac4be514d2a03f97ea77b..51ecba7b7b0f416538d97915f7bfda8dd7241bb6 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/README.md +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/README.md @@ -7,8 +7,8 @@ tags: - transformers datasets: - /workspace/wave/data/datasets/aft_charter0p2.jsonl -base_model: /workspace/wave/parent pipeline_tag: text-generation +base_model: /workspace/wave/parent model-index: - name: workspace/wave/training/checkpoints results: [] diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_model.safetensors index 95c3f19206395238e6782ddf02f5c2620f03d2b2..598edbb87c4b1911f292dd47ccb4a713b6478aed 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:3ba49d604afb025cda90bf22fe38858ddb91aef7695be1af2622e6a002b0e65b +oid sha256:233181cf98d9388b75d25740fa98f4912414f643945abe781e342921d3103c33 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_model.safetensors index 93a66416335bdbe08bcfb58c66cd8406462591e0..544b4d65817e8c0df909f98794850600d439025e 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:c526b7ab96e38594a1de5a9c98397f2c98b17ae45f7b3745a9eb8a4f4b77260f +oid sha256:3f1232a16d0520320414f58d94d5f509d4b83a46301d605ae211ef5fad08fd92 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/optimizer.pt index f89879fd3e008ea78bfc2629a6ff18f14fc03f84..46b6051032503b7a6077a389dc508990bbd0448e 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:3f4be7ab25bc78cb7ea27d1e02c2f03d9e719b6aea76233193067a0fdc751d4c +oid sha256:79cad515f4ed7d2ff22d6d1f4d297118e28472c3ed5013074b95f3a7de19a068 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/trainer_state.json index 28c869ce1e59113141a920da3c513a832fbd5379..cbea018df8f1a7da179ebf4b88cf62d93098035b 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-128/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_model.safetensors index c1fd1d734b87166191180809df1320ae0fb11246..69629b9f604ecd91bfdf3747e06a5c2efd5e6876 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:f42c67b6ba4a0ce58670b3173568f3409351fea6dcbb21ab40a114c2cbbcefad +oid sha256:d0ec2fda759f4acc2d571f1aa01cddeb7e652ae76a2192764fa3f484ad747b2d size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/optimizer.pt index cbd8066c012b828b3c00c3d0ae8ffd67c5ce3ebe..b637590478ed57f2933bba0d0e4aa9d6e043f5ef 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:f3b2b21f85a5adbdb6195efce0768250b10c2acf5d4911bb7e38b7d75698fa1f +oid sha256:f42e923d88dd4678850893eda2d5c85346f6cb58ddcb4bc4381e248f7c253215 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/trainer_state.json index e04ebb25f18df33d6ac2d5b2b1dac95fb9951ed8..a3213652a493572ca39f8d768f2fb3cbfe0cd107 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-160/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,44 +2209,44 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_model.safetensors index b99b34de5294cebc7b18e8f63c545f30e728064c..902808b02ae03192663a1c2260f615f696c65bae 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:3fdd569d68d38555b02af190784ca64d20f3a7be1125875b2348a29d2e89a7d0 +oid sha256:addc43eac40d30997d1c96edd95d0d8aa7487e2445c49cdf79b0455430b1de6f size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/optimizer.pt index df2429d9a48880bb9df428a443ec2c780a9c884e..5f2b3a9aabfc66c1ec2ff7a8e90387fb94777fbf 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:63a535ba350b57df4b9ff3904264ce565e426b83545639b80b9a5e880098c9e7 +oid sha256:834289feb23bb456b63d84cc27297ddd1725ef154d62d8d527a53b53cedfe611 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/trainer_state.json index 58f1279892c51e2da894048fa8a7a18568252d14..2128d43780aae20ffb3ecdfbe20c15ee527ad53a 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-192/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,86 +2615,86 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_model.safetensors index d2db029d6e3616c492866617e6b78db37fac21a4..2f585d7e3c9620975b7b547cb898f9ad5e174794 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:661f3177aedb39f88756004a38064183f8f7107e186fd36793f466068f26bdfd +oid sha256:979514659b1d094a5d83c6a774436f5fd92941e721e8bb3985a35bd5290c0c80 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/optimizer.pt index 2863b887fbe9a51a3f7b5ecf2c470edd85844cc7..4cef154987e814afc13e7b55ea73f5045b8e4ea4 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:1e5d9dee81b438cc9a34426ec139656027f70094105951d2163566a6c6c7d1c8 +oid sha256:23a261ce3f869037ab38c9c39f4a09db5b4192eefc2f1c20941476fccf6d6cc6 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/trainer_state.json index 1736494126afcd8ffed8c9fe313eea9a846dcefe..8a8d531a3ff7be8e6f92064831f0bb18df6d26b1 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-224/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,352 +2797,352 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_model.safetensors index 66f35b988e39488458e0b1f2331ce2dc59e252bb..2d34b2b1d87824ec54322e9f81330facf4105c8e 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:e024bf7b89d787ce02b710f8f42e4c77df75e6899c3909e9aba20deb6ff5206b +oid sha256:3c3aa4e3adc3fe3f8661ee9fc04525dc463ece02efbcbd211454e4cf5453d58d size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/optimizer.pt index 4d26e7b4abd5c845a1b6010b36a6a3be27dff3f9..c319a0c29e41ab7ddf37516a95417d9c0d2b2d93 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:165bdab69aa68e8a97457de8ff56419da10eba202bf006461271b87b20a765ec +oid sha256:f9662bc0797e0e1db0bc6895c9bc75df80888b1ccb33f4a5b2e1e597ea94d205 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/trainer_state.json index 57cf61789ee61388856f2d24103828f353816daf..fd872114103730a35d4899389b30a6cb4372fc5a 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-256/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,394 +3203,394 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_model.safetensors index da230cd240814e34bf6cd2dcce4a7dbcaed01132..f9721335a89a3cb93d689781dfa734bdc06b8e4a 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:ee5d633cb4f2aa247609e2e3782191642900193df8cae1ee021e7ba3fe27c05b +oid sha256:8b6b211172b7b4a5bb9d11be32464c34efea59a5634ffba51e45354ca26a904b size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/optimizer.pt index 9591e82d4429776d17625cc000a96145adbaa71f..a7f83cf45c68e2416f29adb92216953f6f0c73bf 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:1d31a10dc08883f76cc2a395136c4c8cb6f8207e330a46ebcf85ebba006ceb80 +oid sha256:ab3413182334b4b5b58f9552c1fc27cc286a9ac97cb2d2d1d34c873ad1aa0bd7 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/trainer_state.json index d0c36f656eeec651c4f136c12d36306ebad8a3e1..ae0f499bbc74ed982d54303e3b14def77f35a37a 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-288/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,310 +3735,310 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_model.safetensors index 207e1744d3f3650c3909f3ea7283b5c59591c331..f73ab14fd47d78cd9582d9f65b4d36e35b1569c4 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:38f91a429d2ed5d26dd67ee7f992b997423a77c22d62800e425b11e4820ae924 +oid sha256:4e11109b420d74bf4d999c5f3db3427d06e66a70f0555f1b6f0ca7230ab9ad49 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/optimizer.pt index c1ea7c5fe15690e78cd26a0c5e88854e6d10c1a7..c9c96f33a35b5edb26d0fb1dc2ffb90f42793860 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:c718c1b1ec38da7239a8089afbb41af2803bcb9e2dfe804a9fa7c953add9b502 +oid sha256:a0df4d04b248dc7da2d0087ae63e68d3fd87c683d965824a39664285ade3d5ec size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/trainer_state.json index 3444acd34b6664db9f4d7aea502260ba629057b8..630e71ca289caad854b285db4839f98a9cfa83f7 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-32/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,100 +361,100 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_model.safetensors index 057b6a46545b2905de62994ff90c587bf8a1ad7d..4dfc863acbf15fa8a520b38219de39de06fd2961 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:6d737af0c7d128702d5ed304147da49258e11972af880628f444b9113a4190bb +oid sha256:88b59a0a4af62c5d6d089bc7e201a8c1382b9a2d69888f12374c8d24039cefa1 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/optimizer.pt index 201c01654aced4fdbd2bc0dcfebb9de9ac7be297..9edbe9b1006c854cd5a8b009a02243ae683f8411 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:0bbaeca6ae51ec17d23f8b8eadd7f4894e622b43dd22699df514ed0dfb3e2872 +oid sha256:2864bbb33dc4fc464d576a66e1c570b5f060ff9aaa9b6d046e4b981677b68279 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/trainer_state.json index 48b79d64f9f3c1a2ecd4ec31326373fd5c261bfc..092820006c5630ba521a9f0478d002561862a762 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-320/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,758 +3735,758 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_model.safetensors index f0bd3d1b6e06d2bdc1e3269d1f287a61d39a3277..979bab9cb8bfeef34db966504075ab251e2f6134 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:2fe4092dd37ca48835007f0334689bd888db7cc108b87ec86e7526bfd4d3cbb8 +oid sha256:7ce71f7bdb65715a57568d6ac1ba6b169e099d44dee160ac6712a1b1c519d0c2 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/optimizer.pt index 1b7f0c1fb0e47a519aa750439a77e462f6a7bed7..b97159b4c69d24a0a41900d25b395509cc4883dc 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:463a45b1c5d97e89daaa2dbbdb65e33175aaba699966df772fe41d6b2267c5aa +oid sha256:5aa6265205543c9813badf549268c94dc29d280e509da8803fb666a50461c572 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/trainer_state.json index cabd68a7e102b9d9db86a0226f370246ae2df9e3..785a2b189c4bda94cb7b7ac5dad187890cc0580b 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-352/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,1206 +3735,1206 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 }, { "epoch": 1.25390625, - "grad_norm": 0.0067353262566030025, + "grad_norm": 0.01599739119410515, "learning_rate": 4.0323513089607876e-05, - "loss": 6.0428461438277736e-05, + "loss": 6.388167093973607e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00006, "step": 321, "tokens/total": 9708848, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 147114 }, { "epoch": 1.2578125, - "grad_norm": 0.05487794429063797, + "grad_norm": 0.0042083412408828735, "learning_rate": 4.004940255778431e-05, - "loss": 0.0002498509711585939, + "loss": 2.1792850020574406e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00025, + "ppl": 1.00002, "step": 322, "tokens/total": 9739360, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 147564 }, { "epoch": 1.26171875, - "grad_norm": 0.0011818762868642807, + "grad_norm": 0.009429940953850746, "learning_rate": 3.977591418134619e-05, - "loss": 1.1004886800947133e-05, + "loss": 3.834946619463153e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00004, "step": 323, "tokens/total": 9769776, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.24, "tokens/trainable": 148013 }, { "epoch": 1.265625, - "grad_norm": 0.018019674345850945, + "grad_norm": 0.05088210478425026, "learning_rate": 3.95030593412612e-05, - "loss": 0.00021162032498978078, + "loss": 0.00018766832363326102, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00021, + "ppl": 1.00019, "step": 324, "tokens/total": 9800096, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.06, "tokens/trainable": 148470 }, { "epoch": 1.26953125, - "grad_norm": 1.5907806158065796, + "grad_norm": 0.9416317939758301, "learning_rate": 3.923084939213296e-05, - "loss": 0.016217660158872604, + "loss": 0.01083211787045002, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01635, + "ppl": 1.01089, "step": 325, "tokens/total": 9830304, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 148926 }, { "epoch": 1.2734375, - "grad_norm": 0.004153774119913578, + "grad_norm": 0.00033186975633725524, "learning_rate": 3.895929566172861e-05, - "loss": 3.801286584348418e-05, + "loss": 8.612486453785095e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 326, "tokens/total": 9860608, - "tokens/train_per_sec_per_gpu": 37.72, + "tokens/train_per_sec_per_gpu": 37.82, "tokens/trainable": 149420 }, { "epoch": 1.27734375, - "grad_norm": 0.0029778245370835066, + "grad_norm": 0.0005477021913975477, "learning_rate": 3.868840945050728e-05, - "loss": 5.526735549210571e-05, + "loss": 1.5825649825274013e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00006, + "ppl": 1.00002, "step": 327, "tokens/total": 9890560, - "tokens/train_per_sec_per_gpu": 39.32, + "tokens/train_per_sec_per_gpu": 39.41, "tokens/trainable": 149873 }, { "epoch": 1.28125, - "grad_norm": 0.028163742274045944, + "grad_norm": 0.0008259841124527156, "learning_rate": 3.841820203114995e-05, - "loss": 0.00039056455716490746, + "loss": 1.642670395085588e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00039, + "ppl": 1.00002, "step": 328, "tokens/total": 9920880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 150347 }, { "epoch": 1.28515625, - "grad_norm": 0.04141407459974289, + "grad_norm": 0.0011461537797003984, "learning_rate": 3.814868464809027e-05, - "loss": 0.0005860928213223815, + "loss": 1.7516158550279215e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00059, + "ppl": 1.00002, "step": 329, "tokens/total": 9951280, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 150822 }, { "epoch": 1.2890625, - "grad_norm": 0.004758972208946943, + "grad_norm": 0.0022519829217344522, "learning_rate": 3.787986851704667e-05, - "loss": 9.08115180209279e-05, + "loss": 2.000835411308799e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00009, + "ppl": 1.00002, "step": 330, "tokens/total": 9981600, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 151266 }, { "epoch": 1.29296875, - "grad_norm": 0.04043704643845558, + "grad_norm": 0.08718931674957275, "learning_rate": 3.7611764824555654e-05, - "loss": 0.0005757657927460968, + "loss": 0.0003773289208766073, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00058, + "ppl": 1.00038, "step": 331, "tokens/total": 10012016, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.15, "tokens/trainable": 151734 }, { "epoch": 1.296875, - "grad_norm": 0.064565509557724, + "grad_norm": 0.000883373199030757, "learning_rate": 3.734438472750619e-05, - "loss": 0.00043528492096811533, + "loss": 1.1746728887374047e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00044, + "ppl": 1.00001, "step": 332, "tokens/total": 10042448, - "tokens/train_per_sec_per_gpu": 33.99, + "tokens/train_per_sec_per_gpu": 34.01, "tokens/trainable": 152184 }, { "epoch": 1.30078125, - "grad_norm": 0.051213983446359634, + "grad_norm": 0.011426394805312157, "learning_rate": 3.707773935267552e-05, - "loss": 0.000528274686075747, + "loss": 5.219353988650255e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00053, + "ppl": 1.00005, "step": 333, "tokens/total": 10073024, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.85, "tokens/trainable": 152623 }, { "epoch": 1.3046875, - "grad_norm": 0.0067980666644871235, + "grad_norm": 0.5781233310699463, "learning_rate": 3.68118397962661e-05, - "loss": 0.00013989521539770067, + "loss": 0.0034865224733948708, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00014, + "ppl": 1.00349, "step": 334, "tokens/total": 10103504, - "tokens/train_per_sec_per_gpu": 33.34, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 153040 }, { "epoch": 1.30859375, - "grad_norm": 0.28768453001976013, + "grad_norm": 0.7213758230209351, "learning_rate": 3.654669712344384e-05, - "loss": 0.0035491236485540867, + "loss": 0.004715530201792717, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00356, + "ppl": 1.00473, "step": 335, "tokens/total": 10131632, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.78, "tokens/trainable": 153463 }, { "epoch": 1.3125, - "grad_norm": 0.04292941838502884, + "grad_norm": 0.03131686523556709, "learning_rate": 3.628232236787763e-05, - "loss": 0.0007545957923866808, + "loss": 0.0002346257824683562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00075, + "ppl": 1.00023, "step": 336, "tokens/total": 10161824, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 153908 }, { "epoch": 1.31640625, - "grad_norm": 0.13187745213508606, + "grad_norm": 0.03332929685711861, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0011231126263737679, + "loss": 0.00011981122952420264, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00112, + "ppl": 1.00012, "step": 337, "tokens/total": 10192448, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 154387 }, { "epoch": 1.3203125, - "grad_norm": 0.06429488956928253, + "grad_norm": 0.0045038131065666676, "learning_rate": 3.575592058295017e-05, - "loss": 0.0004924655659124255, + "loss": 3.5494955227477476e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00049, + "ppl": 1.00004, "step": 338, "tokens/total": 10222704, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 154836 }, { "epoch": 1.32421875, - "grad_norm": 0.006816778797656298, + "grad_norm": 0.0012434936361387372, "learning_rate": 3.549391545931585e-05, - "loss": 8.63251625560224e-05, + "loss": 1.7894679331220686e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00009, + "ppl": 1.00002, "step": 339, "tokens/total": 10253168, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.81, "tokens/trainable": 155261 }, { "epoch": 1.328125, - "grad_norm": 0.04606792330741882, + "grad_norm": 0.3250766098499298, "learning_rate": 3.5232722063479914e-05, - "loss": 0.0003515402786433697, + "loss": 0.00279021542519331, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00035, + "ppl": 1.00279, "step": 340, "tokens/total": 10283552, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.24, "tokens/trainable": 155674 }, { "epoch": 1.33203125, - "grad_norm": 0.24907881021499634, + "grad_norm": 0.036490436643362045, "learning_rate": 3.49723512647657e-05, - "loss": 0.000742567703127861, + "loss": 0.00013251493510324508, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00074, + "ppl": 1.00013, "step": 341, "tokens/total": 10313872, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 156164 }, { "epoch": 1.3359375, - "grad_norm": 0.011238012462854385, + "grad_norm": 0.2706057131290436, "learning_rate": 3.471281389826491e-05, - "loss": 0.0001773187832441181, + "loss": 0.0021429890766739845, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00018, + "ppl": 1.00215, "step": 342, "tokens/total": 10344256, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 156611 }, { "epoch": 1.33984375, - "grad_norm": 0.00949561782181263, + "grad_norm": 0.01915346086025238, "learning_rate": 3.4454120764386764e-05, - "loss": 0.00018969883967656642, + "loss": 0.00013777356070932, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00019, + "ppl": 1.00014, "step": 343, "tokens/total": 10374544, - "tokens/train_per_sec_per_gpu": 33.58, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 157073 }, { "epoch": 1.34375, - "grad_norm": 0.10763411223888397, + "grad_norm": 0.02540464885532856, "learning_rate": 3.4196282628408526e-05, - "loss": 0.0007583287660963833, + "loss": 5.135099490871653e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00005, "step": 344, "tokens/total": 10405040, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 157523 }, { "epoch": 1.34765625, - "grad_norm": 0.15938052535057068, + "grad_norm": 0.39257746934890747, "learning_rate": 3.3939310220027456e-05, - "loss": 0.0014999746344983578, + "loss": 0.009803109802305698, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0015, + "ppl": 1.00985, "step": 345, "tokens/total": 10435424, - "tokens/train_per_sec_per_gpu": 35.07, + "tokens/train_per_sec_per_gpu": 35.16, "tokens/trainable": 157964 }, { "epoch": 1.3515625, - "grad_norm": 0.00165572261903435, + "grad_norm": 0.0029070202726870775, "learning_rate": 3.3683214232914404e-05, - "loss": 3.833783557638526e-05, + "loss": 2.9972559786983766e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00004, + "ppl": 1.00003, "step": 346, "tokens/total": 10465760, - "tokens/train_per_sec_per_gpu": 30.35, + "tokens/train_per_sec_per_gpu": 30.44, "tokens/trainable": 158390 }, { "epoch": 1.35546875, - "grad_norm": 0.02406073547899723, + "grad_norm": 0.020276719704270363, "learning_rate": 3.342800532426873e-05, - "loss": 0.00039186165668070316, + "loss": 7.613154593855143e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00039, + "ppl": 1.00008, "step": 347, "tokens/total": 10495904, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 158848 }, { "epoch": 1.359375, - "grad_norm": 0.045792482793331146, + "grad_norm": 0.14866818487644196, "learning_rate": 3.317369411437484e-05, - "loss": 0.0006161610363051295, + "loss": 0.0011244683992117643, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00062, + "ppl": 1.00113, "step": 348, "tokens/total": 10526624, - "tokens/train_per_sec_per_gpu": 28.63, + "tokens/train_per_sec_per_gpu": 28.71, "tokens/trainable": 159270 }, { "epoch": 1.36328125, - "grad_norm": 0.18648307025432587, + "grad_norm": 0.015379665419459343, "learning_rate": 3.292029118616024e-05, - "loss": 0.0012868957128375769, + "loss": 7.920589268906042e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00129, + "ppl": 1.00008, "step": 349, "tokens/total": 10556752, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.51, "tokens/trainable": 159720 }, { "epoch": 1.3671875, - "grad_norm": 0.015933886170387268, + "grad_norm": 0.0023695260751992464, "learning_rate": 3.266780708475511e-05, - "loss": 0.0002091687492793426, + "loss": 1.4566459867637604e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00021, + "ppl": 1.00001, "step": 350, "tokens/total": 10587264, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.14, "tokens/trainable": 160187 }, { "epoch": 1.37109375, - "grad_norm": 0.008724886924028397, + "grad_norm": 0.00954374298453331, "learning_rate": 3.241625231705354e-05, - "loss": 0.00013179841334931552, + "loss": 6.530048267450184e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00007, "step": 351, "tokens/total": 10617504, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 160645 }, { "epoch": 1.375, - "grad_norm": 0.06377559900283813, + "grad_norm": 0.6504904627799988, "learning_rate": 3.216563735127618e-05, - "loss": 0.0008062056731432676, + "loss": 0.01059151440858841, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00081, + "ppl": 1.01065, "step": 352, "tokens/total": 10647760, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.49, "tokens/trainable": 161102 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_model.safetensors index a49275f552a09a3dc1e687b11f686a1cf95b969b..d6629e52d8cd5fe4fe9c943a17734624b34ab403 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:0aa4b25a26ef0021db3af8ecd0575d185daa5902d19f4ccccdb2a9fcf68f1e85 +oid sha256:5581f9f317e8357157f6822d4bd67c8a689db35d288f19903379b37fe9a35848 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/optimizer.pt index ec1b82047ec89791e57568c306654a7fdc92ccc1..de1ab930aec382c560f53b254be0b4052b2701fa 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:17f52900349f5167828307219a832e27916f3c9c58a866b5ceeac041a4cdcd89 +oid sha256:324578d5318f3f740994a82d66eaaab102a2ae1419e523325c6b3aa6aea75836 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/trainer_state.json index b0b690b04d179e1ccf7b9c492dfa5956791174b5..9223c1bec69a167a6d6af30e1df638848526ab27 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-384/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,1525 +3735,1525 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 }, { "epoch": 1.25390625, - "grad_norm": 0.0067353262566030025, + "grad_norm": 0.01599739119410515, "learning_rate": 4.0323513089607876e-05, - "loss": 6.0428461438277736e-05, + "loss": 6.388167093973607e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00006, "step": 321, "tokens/total": 9708848, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 147114 }, { "epoch": 1.2578125, - "grad_norm": 0.05487794429063797, + "grad_norm": 0.0042083412408828735, "learning_rate": 4.004940255778431e-05, - "loss": 0.0002498509711585939, + "loss": 2.1792850020574406e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00025, + "ppl": 1.00002, "step": 322, "tokens/total": 9739360, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 147564 }, { "epoch": 1.26171875, - "grad_norm": 0.0011818762868642807, + "grad_norm": 0.009429940953850746, "learning_rate": 3.977591418134619e-05, - "loss": 1.1004886800947133e-05, + "loss": 3.834946619463153e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00004, "step": 323, "tokens/total": 9769776, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.24, "tokens/trainable": 148013 }, { "epoch": 1.265625, - "grad_norm": 0.018019674345850945, + "grad_norm": 0.05088210478425026, "learning_rate": 3.95030593412612e-05, - "loss": 0.00021162032498978078, + "loss": 0.00018766832363326102, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00021, + "ppl": 1.00019, "step": 324, "tokens/total": 9800096, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.06, "tokens/trainable": 148470 }, { "epoch": 1.26953125, - "grad_norm": 1.5907806158065796, + "grad_norm": 0.9416317939758301, "learning_rate": 3.923084939213296e-05, - "loss": 0.016217660158872604, + "loss": 0.01083211787045002, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01635, + "ppl": 1.01089, "step": 325, "tokens/total": 9830304, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 148926 }, { "epoch": 1.2734375, - "grad_norm": 0.004153774119913578, + "grad_norm": 0.00033186975633725524, "learning_rate": 3.895929566172861e-05, - "loss": 3.801286584348418e-05, + "loss": 8.612486453785095e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 326, "tokens/total": 9860608, - "tokens/train_per_sec_per_gpu": 37.72, + "tokens/train_per_sec_per_gpu": 37.82, "tokens/trainable": 149420 }, { "epoch": 1.27734375, - "grad_norm": 0.0029778245370835066, + "grad_norm": 0.0005477021913975477, "learning_rate": 3.868840945050728e-05, - "loss": 5.526735549210571e-05, + "loss": 1.5825649825274013e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00006, + "ppl": 1.00002, "step": 327, "tokens/total": 9890560, - "tokens/train_per_sec_per_gpu": 39.32, + "tokens/train_per_sec_per_gpu": 39.41, "tokens/trainable": 149873 }, { "epoch": 1.28125, - "grad_norm": 0.028163742274045944, + "grad_norm": 0.0008259841124527156, "learning_rate": 3.841820203114995e-05, - "loss": 0.00039056455716490746, + "loss": 1.642670395085588e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00039, + "ppl": 1.00002, "step": 328, "tokens/total": 9920880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 150347 }, { "epoch": 1.28515625, - "grad_norm": 0.04141407459974289, + "grad_norm": 0.0011461537797003984, "learning_rate": 3.814868464809027e-05, - "loss": 0.0005860928213223815, + "loss": 1.7516158550279215e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00059, + "ppl": 1.00002, "step": 329, "tokens/total": 9951280, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 150822 }, { "epoch": 1.2890625, - "grad_norm": 0.004758972208946943, + "grad_norm": 0.0022519829217344522, "learning_rate": 3.787986851704667e-05, - "loss": 9.08115180209279e-05, + "loss": 2.000835411308799e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00009, + "ppl": 1.00002, "step": 330, "tokens/total": 9981600, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 151266 }, { "epoch": 1.29296875, - "grad_norm": 0.04043704643845558, + "grad_norm": 0.08718931674957275, "learning_rate": 3.7611764824555654e-05, - "loss": 0.0005757657927460968, + "loss": 0.0003773289208766073, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00058, + "ppl": 1.00038, "step": 331, "tokens/total": 10012016, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.15, "tokens/trainable": 151734 }, { "epoch": 1.296875, - "grad_norm": 0.064565509557724, + "grad_norm": 0.000883373199030757, "learning_rate": 3.734438472750619e-05, - "loss": 0.00043528492096811533, + "loss": 1.1746728887374047e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00044, + "ppl": 1.00001, "step": 332, "tokens/total": 10042448, - "tokens/train_per_sec_per_gpu": 33.99, + "tokens/train_per_sec_per_gpu": 34.01, "tokens/trainable": 152184 }, { "epoch": 1.30078125, - "grad_norm": 0.051213983446359634, + "grad_norm": 0.011426394805312157, "learning_rate": 3.707773935267552e-05, - "loss": 0.000528274686075747, + "loss": 5.219353988650255e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00053, + "ppl": 1.00005, "step": 333, "tokens/total": 10073024, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.85, "tokens/trainable": 152623 }, { "epoch": 1.3046875, - "grad_norm": 0.0067980666644871235, + "grad_norm": 0.5781233310699463, "learning_rate": 3.68118397962661e-05, - "loss": 0.00013989521539770067, + "loss": 0.0034865224733948708, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00014, + "ppl": 1.00349, "step": 334, "tokens/total": 10103504, - "tokens/train_per_sec_per_gpu": 33.34, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 153040 }, { "epoch": 1.30859375, - "grad_norm": 0.28768453001976013, + "grad_norm": 0.7213758230209351, "learning_rate": 3.654669712344384e-05, - "loss": 0.0035491236485540867, + "loss": 0.004715530201792717, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00356, + "ppl": 1.00473, "step": 335, "tokens/total": 10131632, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.78, "tokens/trainable": 153463 }, { "epoch": 1.3125, - "grad_norm": 0.04292941838502884, + "grad_norm": 0.03131686523556709, "learning_rate": 3.628232236787763e-05, - "loss": 0.0007545957923866808, + "loss": 0.0002346257824683562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00075, + "ppl": 1.00023, "step": 336, "tokens/total": 10161824, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 153908 }, { "epoch": 1.31640625, - "grad_norm": 0.13187745213508606, + "grad_norm": 0.03332929685711861, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0011231126263737679, + "loss": 0.00011981122952420264, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00112, + "ppl": 1.00012, "step": 337, "tokens/total": 10192448, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 154387 }, { "epoch": 1.3203125, - "grad_norm": 0.06429488956928253, + "grad_norm": 0.0045038131065666676, "learning_rate": 3.575592058295017e-05, - "loss": 0.0004924655659124255, + "loss": 3.5494955227477476e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00049, + "ppl": 1.00004, "step": 338, "tokens/total": 10222704, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 154836 }, { "epoch": 1.32421875, - "grad_norm": 0.006816778797656298, + "grad_norm": 0.0012434936361387372, "learning_rate": 3.549391545931585e-05, - "loss": 8.63251625560224e-05, + "loss": 1.7894679331220686e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00009, + "ppl": 1.00002, "step": 339, "tokens/total": 10253168, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.81, "tokens/trainable": 155261 }, { "epoch": 1.328125, - "grad_norm": 0.04606792330741882, + "grad_norm": 0.3250766098499298, "learning_rate": 3.5232722063479914e-05, - "loss": 0.0003515402786433697, + "loss": 0.00279021542519331, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00035, + "ppl": 1.00279, "step": 340, "tokens/total": 10283552, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.24, "tokens/trainable": 155674 }, { "epoch": 1.33203125, - "grad_norm": 0.24907881021499634, + "grad_norm": 0.036490436643362045, "learning_rate": 3.49723512647657e-05, - "loss": 0.000742567703127861, + "loss": 0.00013251493510324508, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00074, + "ppl": 1.00013, "step": 341, "tokens/total": 10313872, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 156164 }, { "epoch": 1.3359375, - "grad_norm": 0.011238012462854385, + "grad_norm": 0.2706057131290436, "learning_rate": 3.471281389826491e-05, - "loss": 0.0001773187832441181, + "loss": 0.0021429890766739845, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00018, + "ppl": 1.00215, "step": 342, "tokens/total": 10344256, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 156611 }, { "epoch": 1.33984375, - "grad_norm": 0.00949561782181263, + "grad_norm": 0.01915346086025238, "learning_rate": 3.4454120764386764e-05, - "loss": 0.00018969883967656642, + "loss": 0.00013777356070932, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00019, + "ppl": 1.00014, "step": 343, "tokens/total": 10374544, - "tokens/train_per_sec_per_gpu": 33.58, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 157073 }, { "epoch": 1.34375, - "grad_norm": 0.10763411223888397, + "grad_norm": 0.02540464885532856, "learning_rate": 3.4196282628408526e-05, - "loss": 0.0007583287660963833, + "loss": 5.135099490871653e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00005, "step": 344, "tokens/total": 10405040, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 157523 }, { "epoch": 1.34765625, - "grad_norm": 0.15938052535057068, + "grad_norm": 0.39257746934890747, "learning_rate": 3.3939310220027456e-05, - "loss": 0.0014999746344983578, + "loss": 0.009803109802305698, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0015, + "ppl": 1.00985, "step": 345, "tokens/total": 10435424, - "tokens/train_per_sec_per_gpu": 35.07, + "tokens/train_per_sec_per_gpu": 35.16, "tokens/trainable": 157964 }, { "epoch": 1.3515625, - "grad_norm": 0.00165572261903435, + "grad_norm": 0.0029070202726870775, "learning_rate": 3.3683214232914404e-05, - "loss": 3.833783557638526e-05, + "loss": 2.9972559786983766e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00004, + "ppl": 1.00003, "step": 346, "tokens/total": 10465760, - "tokens/train_per_sec_per_gpu": 30.35, + "tokens/train_per_sec_per_gpu": 30.44, "tokens/trainable": 158390 }, { "epoch": 1.35546875, - "grad_norm": 0.02406073547899723, + "grad_norm": 0.020276719704270363, "learning_rate": 3.342800532426873e-05, - "loss": 0.00039186165668070316, + "loss": 7.613154593855143e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00039, + "ppl": 1.00008, "step": 347, "tokens/total": 10495904, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 158848 }, { "epoch": 1.359375, - "grad_norm": 0.045792482793331146, + "grad_norm": 0.14866818487644196, "learning_rate": 3.317369411437484e-05, - "loss": 0.0006161610363051295, + "loss": 0.0011244683992117643, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00062, + "ppl": 1.00113, "step": 348, "tokens/total": 10526624, - "tokens/train_per_sec_per_gpu": 28.63, + "tokens/train_per_sec_per_gpu": 28.71, "tokens/trainable": 159270 }, { "epoch": 1.36328125, - "grad_norm": 0.18648307025432587, + "grad_norm": 0.015379665419459343, "learning_rate": 3.292029118616024e-05, - "loss": 0.0012868957128375769, + "loss": 7.920589268906042e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00129, + "ppl": 1.00008, "step": 349, "tokens/total": 10556752, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.51, "tokens/trainable": 159720 }, { "epoch": 1.3671875, - "grad_norm": 0.015933886170387268, + "grad_norm": 0.0023695260751992464, "learning_rate": 3.266780708475511e-05, - "loss": 0.0002091687492793426, + "loss": 1.4566459867637604e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00021, + "ppl": 1.00001, "step": 350, "tokens/total": 10587264, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.14, "tokens/trainable": 160187 }, { "epoch": 1.37109375, - "grad_norm": 0.008724886924028397, + "grad_norm": 0.00954374298453331, "learning_rate": 3.241625231705354e-05, - "loss": 0.00013179841334931552, + "loss": 6.530048267450184e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00007, "step": 351, "tokens/total": 10617504, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 160645 }, { "epoch": 1.375, - "grad_norm": 0.06377559900283813, + "grad_norm": 0.6504904627799988, "learning_rate": 3.216563735127618e-05, - "loss": 0.0008062056731432676, + "loss": 0.01059151440858841, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00081, + "ppl": 1.01065, "step": 352, "tokens/total": 10647760, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.49, "tokens/trainable": 161102 }, { "epoch": 1.37890625, - "grad_norm": 0.0037202269304543734, + "grad_norm": 0.024732626974582672, "learning_rate": 3.191597261653475e-05, - "loss": 7.238816760946065e-05, + "loss": 0.0001429672265658155, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00007, + "ppl": 1.00014, "step": 353, "tokens/total": 10678080, - "tokens/train_per_sec_per_gpu": 28.86, + "tokens/train_per_sec_per_gpu": 28.93, "tokens/trainable": 161555 }, { "epoch": 1.3828125, - "grad_norm": 0.0021510994993150234, + "grad_norm": 0.037309419363737106, "learning_rate": 3.166726850239794e-05, - "loss": 3.6805788113269955e-05, + "loss": 7.214388460852206e-05, "memory/device_reserved (GiB)": 35.41, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00004, + "ppl": 1.00007, "step": 354, "tokens/total": 10708544, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.75, "tokens/trainable": 162020 }, { "epoch": 1.38671875, - "grad_norm": 0.002642499515786767, + "grad_norm": 0.00885045062750578, "learning_rate": 3.141953535845912e-05, - "loss": 4.371708200778812e-05, + "loss": 0.00011830432777060196, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00012, "step": 355, "tokens/total": 10739024, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 162448 }, { "epoch": 1.390625, - "grad_norm": 0.0038646068423986435, + "grad_norm": 0.06791900098323822, "learning_rate": 3.11727834939056e-05, - "loss": 7.11614266037941e-05, + "loss": 0.0003609730047173798, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.61, "memory/max_allocated (GiB)": 33.61, - "ppl": 1.00007, + "ppl": 1.00036, "step": 356, "tokens/total": 10769024, - "tokens/train_per_sec_per_gpu": 28.2, + "tokens/train_per_sec_per_gpu": 28.26, "tokens/trainable": 162863 }, { "epoch": 1.39453125, - "grad_norm": 0.017895536497235298, + "grad_norm": 0.0019508687546476722, "learning_rate": 3.092702317708967e-05, - "loss": 5.4065520089352503e-05, + "loss": 3.1739040423417464e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00005, + "ppl": 1.00003, "step": 357, "tokens/total": 10799328, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 163318 }, { "epoch": 1.3984375, - "grad_norm": 0.8479411602020264, + "grad_norm": 0.7139555811882019, "learning_rate": 3.0682264635101276e-05, - "loss": 0.01497839204967022, + "loss": 0.010268578305840492, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01509, + "ppl": 1.01032, "step": 358, "tokens/total": 10829488, - "tokens/train_per_sec_per_gpu": 32.89, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 163767 }, { "epoch": 1.40234375, - "grad_norm": 0.0015704578254371881, + "grad_norm": 0.006852464284747839, "learning_rate": 3.0438518053342407e-05, - "loss": 3.0390210667974316e-05, + "loss": 4.873241778113879e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00005, "step": 359, "tokens/total": 10859936, - "tokens/train_per_sec_per_gpu": 31.78, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 164208 }, { "epoch": 1.40625, - "grad_norm": 0.014669318683445454, + "grad_norm": 0.0018247900297865272, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010030368866864592, + "loss": 3.88835760531947e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00004, "step": 360, "tokens/total": 10890400, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 164655 }, { "epoch": 1.41015625, - "grad_norm": 0.3479421138763428, + "grad_norm": 0.0436873696744442, "learning_rate": 2.9954101301140146e-05, - "loss": 0.0026096655055880547, + "loss": 0.0003687943681143224, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00261, + "ppl": 1.00037, "step": 361, "tokens/total": 10920624, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 165100 }, { "epoch": 1.4140625, - "grad_norm": 0.004394443240016699, + "grad_norm": 0.26735150814056396, "learning_rate": 2.9713451289255123e-05, - "loss": 6.116658914834261e-05, + "loss": 0.00039605735219083726, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00006, + "ppl": 1.0004, "step": 362, "tokens/total": 10951136, - "tokens/train_per_sec_per_gpu": 34.84, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 165587 }, { "epoch": 1.41796875, - "grad_norm": 0.016197621822357178, + "grad_norm": 0.0964483991265297, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0001775357231963426, + "loss": 0.0007330900407396257, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00018, + "ppl": 1.00073, "step": 363, "tokens/total": 10981344, - "tokens/train_per_sec_per_gpu": 34.09, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 166034 }, { "epoch": 1.421875, - "grad_norm": 0.09478334337472916, + "grad_norm": 0.05367618799209595, "learning_rate": 2.9235318065647e-05, - "loss": 0.0005033796769566834, + "loss": 0.0005384897813200951, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0005, + "ppl": 1.00054, "step": 364, "tokens/total": 11011552, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 166485 }, { "epoch": 1.42578125, - "grad_norm": 0.014899010770022869, + "grad_norm": 0.10067912936210632, "learning_rate": 2.8997854750998964e-05, - "loss": 0.0001904651871882379, + "loss": 0.0006868956843391061, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00019, + "ppl": 1.00069, "step": 365, "tokens/total": 11041872, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 166973 }, { "epoch": 1.4296875, - "grad_norm": 0.005555527750402689, + "grad_norm": 0.02697882056236267, "learning_rate": 2.8761473491751258e-05, - "loss": 0.00010058133921120316, + "loss": 0.0002464794088155031, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00025, "step": 366, "tokens/total": 11072192, - "tokens/train_per_sec_per_gpu": 29.1, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 167414 }, { "epoch": 1.43359375, - "grad_norm": 0.20706292986869812, + "grad_norm": 0.0026214183308184147, "learning_rate": 2.8526184124692883e-05, - "loss": 0.0005888720043003559, + "loss": 5.2629769925260916e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00059, + "ppl": 1.00005, "step": 367, "tokens/total": 11102736, - "tokens/train_per_sec_per_gpu": 30.11, + "tokens/train_per_sec_per_gpu": 30.23, "tokens/trainable": 167851 }, { "epoch": 1.4375, - "grad_norm": 0.0007191727054305375, + "grad_norm": 0.0018140808679163456, "learning_rate": 2.829199644117484e-05, - "loss": 1.2304372830840293e-05, + "loss": 2.9512597393477336e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 368, "tokens/total": 11133056, - "tokens/train_per_sec_per_gpu": 35.48, + "tokens/train_per_sec_per_gpu": 35.56, "tokens/trainable": 168294 }, { "epoch": 1.44140625, - "grad_norm": 0.030878128483891487, + "grad_norm": 0.012045321986079216, "learning_rate": 2.8058920186702553e-05, - "loss": 0.0002043281274382025, + "loss": 7.606908184243366e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0002, + "ppl": 1.00008, "step": 369, "tokens/total": 11163568, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 168769 }, { "epoch": 1.4453125, - "grad_norm": 0.008817057125270367, + "grad_norm": 0.013453424908220768, "learning_rate": 2.782696506053033e-05, - "loss": 0.00011464582348708063, + "loss": 0.00015325279673561454, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00015, "step": 370, "tokens/total": 11193936, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.83, "tokens/trainable": 169270 }, { "epoch": 1.44921875, - "grad_norm": 0.023856336250901222, + "grad_norm": 0.003458227962255478, "learning_rate": 2.7596140715257824e-05, - "loss": 0.00013431125262286514, + "loss": 5.63332432648167e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00013, + "ppl": 1.00006, "step": 371, "tokens/total": 11224480, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 169711 }, { "epoch": 1.453125, - "grad_norm": 0.010502993129193783, + "grad_norm": 0.0063622924499213696, "learning_rate": 2.7366456756428184e-05, - "loss": 0.00015104333579074591, + "loss": 9.534892160445452e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00015, + "ppl": 1.0001, "step": 372, "tokens/total": 11254912, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 170185 }, { "epoch": 1.45703125, - "grad_norm": 0.026970423758029938, + "grad_norm": 0.04558980092406273, "learning_rate": 2.7137922742128486e-05, - "loss": 0.00026081278338097036, + "loss": 0.000613630109000951, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00026, + "ppl": 1.00061, "step": 373, "tokens/total": 11285104, - "tokens/train_per_sec_per_gpu": 33.08, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 170650 }, { "epoch": 1.4609375, - "grad_norm": 0.020325109362602234, + "grad_norm": 0.014873786829411983, "learning_rate": 2.691054818259188e-05, - "loss": 0.00014532633940689266, + "loss": 0.0002038514503510669, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00015, + "ppl": 1.0002, "step": 374, "tokens/total": 11315600, - "tokens/train_per_sec_per_gpu": 31.98, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 171126 }, { "epoch": 1.46484375, - "grad_norm": 0.033260464668273926, + "grad_norm": 0.058739252388477325, "learning_rate": 2.6684342539801933e-05, - "loss": 0.00045571548980660737, + "loss": 0.0010346119524911046, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00046, + "ppl": 1.00104, "step": 375, "tokens/total": 11345776, "tokens/train_per_sec_per_gpu": 35.6, @@ -5261,128 +5261,128 @@ }, { "epoch": 1.46875, - "grad_norm": 0.017290709540247917, + "grad_norm": 0.24105991423130035, "learning_rate": 2.645931522709877e-05, - "loss": 0.00014910403115209192, + "loss": 0.0035716122947633266, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00015, + "ppl": 1.00358, "step": 376, "tokens/total": 11376208, - "tokens/train_per_sec_per_gpu": 28.09, + "tokens/train_per_sec_per_gpu": 28.14, "tokens/trainable": 172017 }, { "epoch": 1.47265625, - "grad_norm": 0.04457363486289978, + "grad_norm": 0.08793950080871582, "learning_rate": 2.6235475608787365e-05, - "loss": 6.834026135038584e-05, + "loss": 0.0007833336712792516, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00007, + "ppl": 1.00078, "step": 377, "tokens/total": 11406512, - "tokens/train_per_sec_per_gpu": 35.99, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 172493 }, { "epoch": 1.4765625, - "grad_norm": 0.002268735785037279, + "grad_norm": 0.009154544211924076, "learning_rate": 2.6012832999747916e-05, - "loss": 3.245133120799437e-05, + "loss": 0.00011752049613278359, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00012, "step": 378, "tokens/total": 11436544, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 172951 }, { "epoch": 1.48046875, - "grad_norm": 0.0038171466439962387, + "grad_norm": 0.012918495573103428, "learning_rate": 2.579139666504821e-05, - "loss": 5.4866883147042245e-05, + "loss": 0.00011567945330170915, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00012, "step": 379, "tokens/total": 11467008, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 173435 }, { "epoch": 1.484375, - "grad_norm": 0.005268535576760769, + "grad_norm": 0.008966504596173763, "learning_rate": 2.557117581955798e-05, - "loss": 8.241234172601253e-05, + "loss": 8.938623068388551e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00009, "step": 380, "tokens/total": 11497184, - "tokens/train_per_sec_per_gpu": 30.4, + "tokens/train_per_sec_per_gpu": 30.47, "tokens/trainable": 173900 }, { "epoch": 1.48828125, - "grad_norm": 0.016057243570685387, + "grad_norm": 0.03181751072406769, "learning_rate": 2.5352179627565532e-05, - "loss": 0.00014235377602744848, + "loss": 0.00013083787052892148, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00014, + "ppl": 1.00013, "step": 381, "tokens/total": 11527600, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 174371 }, { "epoch": 1.4921875, - "grad_norm": 0.005853456910699606, + "grad_norm": 0.0009072935208678246, "learning_rate": 2.5134417202396277e-05, - "loss": 5.001476893085055e-05, + "loss": 2.5600436856620945e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 382, "tokens/total": 11557808, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 174826 }, { "epoch": 1.49609375, - "grad_norm": 0.0031664848793298006, + "grad_norm": 0.0050596860237419605, "learning_rate": 2.491789760603361e-05, - "loss": 4.210277256788686e-05, + "loss": 5.778766353614628e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00006, "step": 383, "tokens/total": 11588352, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 175276 }, { "epoch": 1.5, - "grad_norm": 0.08838633447885513, + "grad_norm": 0.008304890245199203, "learning_rate": 2.4702629848741764e-05, - "loss": 0.0010394920827820897, + "loss": 0.00012505470658652484, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00104, + "ppl": 1.00013, "step": 384, "tokens/total": 11618640, - "tokens/train_per_sec_per_gpu": 33.69, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 175720 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_model.safetensors index 9f3a618db09256b3656f7298393e48c04cc46828..ddc4087be06c6b94a33f8941f4f0c516ea2cce1f 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:05723c03b88c39267b118122df5b55a796d2304d8fcdd49b3155b1d44ad82bc6 +oid sha256:5a7cb7b80828a935abc743ce1b3296d23f6b4af6fd9ec8e43392059a3ae4e893 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/optimizer.pt index d27ecb6f85f9192ae634998271153f2d03e3486f..597a8931f4d56d7dfd3438270f8b77a99bf9e09f 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:5a7472c6ae170db8b2c705fc058bed1e8e2e71f8471cc95ac00fc09259427abd +oid sha256:b1b828d321a91c5ed711734eacce07b16ea0f63ebf7695f8e1c77243f6364e6e size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/trainer_state.json index 5ad4fed4915b93d3583f06f4c9904aa9ba184c91..96a951d2408c4c4a848fd4c78c3a60949ff6246c 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-416/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,1525 +3735,1525 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 }, { "epoch": 1.25390625, - "grad_norm": 0.0067353262566030025, + "grad_norm": 0.01599739119410515, "learning_rate": 4.0323513089607876e-05, - "loss": 6.0428461438277736e-05, + "loss": 6.388167093973607e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00006, "step": 321, "tokens/total": 9708848, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 147114 }, { "epoch": 1.2578125, - "grad_norm": 0.05487794429063797, + "grad_norm": 0.0042083412408828735, "learning_rate": 4.004940255778431e-05, - "loss": 0.0002498509711585939, + "loss": 2.1792850020574406e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00025, + "ppl": 1.00002, "step": 322, "tokens/total": 9739360, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 147564 }, { "epoch": 1.26171875, - "grad_norm": 0.0011818762868642807, + "grad_norm": 0.009429940953850746, "learning_rate": 3.977591418134619e-05, - "loss": 1.1004886800947133e-05, + "loss": 3.834946619463153e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00004, "step": 323, "tokens/total": 9769776, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.24, "tokens/trainable": 148013 }, { "epoch": 1.265625, - "grad_norm": 0.018019674345850945, + "grad_norm": 0.05088210478425026, "learning_rate": 3.95030593412612e-05, - "loss": 0.00021162032498978078, + "loss": 0.00018766832363326102, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00021, + "ppl": 1.00019, "step": 324, "tokens/total": 9800096, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.06, "tokens/trainable": 148470 }, { "epoch": 1.26953125, - "grad_norm": 1.5907806158065796, + "grad_norm": 0.9416317939758301, "learning_rate": 3.923084939213296e-05, - "loss": 0.016217660158872604, + "loss": 0.01083211787045002, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01635, + "ppl": 1.01089, "step": 325, "tokens/total": 9830304, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 148926 }, { "epoch": 1.2734375, - "grad_norm": 0.004153774119913578, + "grad_norm": 0.00033186975633725524, "learning_rate": 3.895929566172861e-05, - "loss": 3.801286584348418e-05, + "loss": 8.612486453785095e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 326, "tokens/total": 9860608, - "tokens/train_per_sec_per_gpu": 37.72, + "tokens/train_per_sec_per_gpu": 37.82, "tokens/trainable": 149420 }, { "epoch": 1.27734375, - "grad_norm": 0.0029778245370835066, + "grad_norm": 0.0005477021913975477, "learning_rate": 3.868840945050728e-05, - "loss": 5.526735549210571e-05, + "loss": 1.5825649825274013e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00006, + "ppl": 1.00002, "step": 327, "tokens/total": 9890560, - "tokens/train_per_sec_per_gpu": 39.32, + "tokens/train_per_sec_per_gpu": 39.41, "tokens/trainable": 149873 }, { "epoch": 1.28125, - "grad_norm": 0.028163742274045944, + "grad_norm": 0.0008259841124527156, "learning_rate": 3.841820203114995e-05, - "loss": 0.00039056455716490746, + "loss": 1.642670395085588e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00039, + "ppl": 1.00002, "step": 328, "tokens/total": 9920880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 150347 }, { "epoch": 1.28515625, - "grad_norm": 0.04141407459974289, + "grad_norm": 0.0011461537797003984, "learning_rate": 3.814868464809027e-05, - "loss": 0.0005860928213223815, + "loss": 1.7516158550279215e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00059, + "ppl": 1.00002, "step": 329, "tokens/total": 9951280, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 150822 }, { "epoch": 1.2890625, - "grad_norm": 0.004758972208946943, + "grad_norm": 0.0022519829217344522, "learning_rate": 3.787986851704667e-05, - "loss": 9.08115180209279e-05, + "loss": 2.000835411308799e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00009, + "ppl": 1.00002, "step": 330, "tokens/total": 9981600, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 151266 }, { "epoch": 1.29296875, - "grad_norm": 0.04043704643845558, + "grad_norm": 0.08718931674957275, "learning_rate": 3.7611764824555654e-05, - "loss": 0.0005757657927460968, + "loss": 0.0003773289208766073, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00058, + "ppl": 1.00038, "step": 331, "tokens/total": 10012016, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.15, "tokens/trainable": 151734 }, { "epoch": 1.296875, - "grad_norm": 0.064565509557724, + "grad_norm": 0.000883373199030757, "learning_rate": 3.734438472750619e-05, - "loss": 0.00043528492096811533, + "loss": 1.1746728887374047e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00044, + "ppl": 1.00001, "step": 332, "tokens/total": 10042448, - "tokens/train_per_sec_per_gpu": 33.99, + "tokens/train_per_sec_per_gpu": 34.01, "tokens/trainable": 152184 }, { "epoch": 1.30078125, - "grad_norm": 0.051213983446359634, + "grad_norm": 0.011426394805312157, "learning_rate": 3.707773935267552e-05, - "loss": 0.000528274686075747, + "loss": 5.219353988650255e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00053, + "ppl": 1.00005, "step": 333, "tokens/total": 10073024, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.85, "tokens/trainable": 152623 }, { "epoch": 1.3046875, - "grad_norm": 0.0067980666644871235, + "grad_norm": 0.5781233310699463, "learning_rate": 3.68118397962661e-05, - "loss": 0.00013989521539770067, + "loss": 0.0034865224733948708, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00014, + "ppl": 1.00349, "step": 334, "tokens/total": 10103504, - "tokens/train_per_sec_per_gpu": 33.34, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 153040 }, { "epoch": 1.30859375, - "grad_norm": 0.28768453001976013, + "grad_norm": 0.7213758230209351, "learning_rate": 3.654669712344384e-05, - "loss": 0.0035491236485540867, + "loss": 0.004715530201792717, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00356, + "ppl": 1.00473, "step": 335, "tokens/total": 10131632, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.78, "tokens/trainable": 153463 }, { "epoch": 1.3125, - "grad_norm": 0.04292941838502884, + "grad_norm": 0.03131686523556709, "learning_rate": 3.628232236787763e-05, - "loss": 0.0007545957923866808, + "loss": 0.0002346257824683562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00075, + "ppl": 1.00023, "step": 336, "tokens/total": 10161824, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 153908 }, { "epoch": 1.31640625, - "grad_norm": 0.13187745213508606, + "grad_norm": 0.03332929685711861, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0011231126263737679, + "loss": 0.00011981122952420264, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00112, + "ppl": 1.00012, "step": 337, "tokens/total": 10192448, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 154387 }, { "epoch": 1.3203125, - "grad_norm": 0.06429488956928253, + "grad_norm": 0.0045038131065666676, "learning_rate": 3.575592058295017e-05, - "loss": 0.0004924655659124255, + "loss": 3.5494955227477476e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00049, + "ppl": 1.00004, "step": 338, "tokens/total": 10222704, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 154836 }, { "epoch": 1.32421875, - "grad_norm": 0.006816778797656298, + "grad_norm": 0.0012434936361387372, "learning_rate": 3.549391545931585e-05, - "loss": 8.63251625560224e-05, + "loss": 1.7894679331220686e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00009, + "ppl": 1.00002, "step": 339, "tokens/total": 10253168, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.81, "tokens/trainable": 155261 }, { "epoch": 1.328125, - "grad_norm": 0.04606792330741882, + "grad_norm": 0.3250766098499298, "learning_rate": 3.5232722063479914e-05, - "loss": 0.0003515402786433697, + "loss": 0.00279021542519331, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00035, + "ppl": 1.00279, "step": 340, "tokens/total": 10283552, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.24, "tokens/trainable": 155674 }, { "epoch": 1.33203125, - "grad_norm": 0.24907881021499634, + "grad_norm": 0.036490436643362045, "learning_rate": 3.49723512647657e-05, - "loss": 0.000742567703127861, + "loss": 0.00013251493510324508, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00074, + "ppl": 1.00013, "step": 341, "tokens/total": 10313872, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 156164 }, { "epoch": 1.3359375, - "grad_norm": 0.011238012462854385, + "grad_norm": 0.2706057131290436, "learning_rate": 3.471281389826491e-05, - "loss": 0.0001773187832441181, + "loss": 0.0021429890766739845, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00018, + "ppl": 1.00215, "step": 342, "tokens/total": 10344256, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 156611 }, { "epoch": 1.33984375, - "grad_norm": 0.00949561782181263, + "grad_norm": 0.01915346086025238, "learning_rate": 3.4454120764386764e-05, - "loss": 0.00018969883967656642, + "loss": 0.00013777356070932, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00019, + "ppl": 1.00014, "step": 343, "tokens/total": 10374544, - "tokens/train_per_sec_per_gpu": 33.58, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 157073 }, { "epoch": 1.34375, - "grad_norm": 0.10763411223888397, + "grad_norm": 0.02540464885532856, "learning_rate": 3.4196282628408526e-05, - "loss": 0.0007583287660963833, + "loss": 5.135099490871653e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00005, "step": 344, "tokens/total": 10405040, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 157523 }, { "epoch": 1.34765625, - "grad_norm": 0.15938052535057068, + "grad_norm": 0.39257746934890747, "learning_rate": 3.3939310220027456e-05, - "loss": 0.0014999746344983578, + "loss": 0.009803109802305698, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0015, + "ppl": 1.00985, "step": 345, "tokens/total": 10435424, - "tokens/train_per_sec_per_gpu": 35.07, + "tokens/train_per_sec_per_gpu": 35.16, "tokens/trainable": 157964 }, { "epoch": 1.3515625, - "grad_norm": 0.00165572261903435, + "grad_norm": 0.0029070202726870775, "learning_rate": 3.3683214232914404e-05, - "loss": 3.833783557638526e-05, + "loss": 2.9972559786983766e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00004, + "ppl": 1.00003, "step": 346, "tokens/total": 10465760, - "tokens/train_per_sec_per_gpu": 30.35, + "tokens/train_per_sec_per_gpu": 30.44, "tokens/trainable": 158390 }, { "epoch": 1.35546875, - "grad_norm": 0.02406073547899723, + "grad_norm": 0.020276719704270363, "learning_rate": 3.342800532426873e-05, - "loss": 0.00039186165668070316, + "loss": 7.613154593855143e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00039, + "ppl": 1.00008, "step": 347, "tokens/total": 10495904, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 158848 }, { "epoch": 1.359375, - "grad_norm": 0.045792482793331146, + "grad_norm": 0.14866818487644196, "learning_rate": 3.317369411437484e-05, - "loss": 0.0006161610363051295, + "loss": 0.0011244683992117643, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00062, + "ppl": 1.00113, "step": 348, "tokens/total": 10526624, - "tokens/train_per_sec_per_gpu": 28.63, + "tokens/train_per_sec_per_gpu": 28.71, "tokens/trainable": 159270 }, { "epoch": 1.36328125, - "grad_norm": 0.18648307025432587, + "grad_norm": 0.015379665419459343, "learning_rate": 3.292029118616024e-05, - "loss": 0.0012868957128375769, + "loss": 7.920589268906042e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00129, + "ppl": 1.00008, "step": 349, "tokens/total": 10556752, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.51, "tokens/trainable": 159720 }, { "epoch": 1.3671875, - "grad_norm": 0.015933886170387268, + "grad_norm": 0.0023695260751992464, "learning_rate": 3.266780708475511e-05, - "loss": 0.0002091687492793426, + "loss": 1.4566459867637604e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00021, + "ppl": 1.00001, "step": 350, "tokens/total": 10587264, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.14, "tokens/trainable": 160187 }, { "epoch": 1.37109375, - "grad_norm": 0.008724886924028397, + "grad_norm": 0.00954374298453331, "learning_rate": 3.241625231705354e-05, - "loss": 0.00013179841334931552, + "loss": 6.530048267450184e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00007, "step": 351, "tokens/total": 10617504, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 160645 }, { "epoch": 1.375, - "grad_norm": 0.06377559900283813, + "grad_norm": 0.6504904627799988, "learning_rate": 3.216563735127618e-05, - "loss": 0.0008062056731432676, + "loss": 0.01059151440858841, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00081, + "ppl": 1.01065, "step": 352, "tokens/total": 10647760, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.49, "tokens/trainable": 161102 }, { "epoch": 1.37890625, - "grad_norm": 0.0037202269304543734, + "grad_norm": 0.024732626974582672, "learning_rate": 3.191597261653475e-05, - "loss": 7.238816760946065e-05, + "loss": 0.0001429672265658155, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00007, + "ppl": 1.00014, "step": 353, "tokens/total": 10678080, - "tokens/train_per_sec_per_gpu": 28.86, + "tokens/train_per_sec_per_gpu": 28.93, "tokens/trainable": 161555 }, { "epoch": 1.3828125, - "grad_norm": 0.0021510994993150234, + "grad_norm": 0.037309419363737106, "learning_rate": 3.166726850239794e-05, - "loss": 3.6805788113269955e-05, + "loss": 7.214388460852206e-05, "memory/device_reserved (GiB)": 35.41, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00004, + "ppl": 1.00007, "step": 354, "tokens/total": 10708544, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.75, "tokens/trainable": 162020 }, { "epoch": 1.38671875, - "grad_norm": 0.002642499515786767, + "grad_norm": 0.00885045062750578, "learning_rate": 3.141953535845912e-05, - "loss": 4.371708200778812e-05, + "loss": 0.00011830432777060196, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00012, "step": 355, "tokens/total": 10739024, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 162448 }, { "epoch": 1.390625, - "grad_norm": 0.0038646068423986435, + "grad_norm": 0.06791900098323822, "learning_rate": 3.11727834939056e-05, - "loss": 7.11614266037941e-05, + "loss": 0.0003609730047173798, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.61, "memory/max_allocated (GiB)": 33.61, - "ppl": 1.00007, + "ppl": 1.00036, "step": 356, "tokens/total": 10769024, - "tokens/train_per_sec_per_gpu": 28.2, + "tokens/train_per_sec_per_gpu": 28.26, "tokens/trainable": 162863 }, { "epoch": 1.39453125, - "grad_norm": 0.017895536497235298, + "grad_norm": 0.0019508687546476722, "learning_rate": 3.092702317708967e-05, - "loss": 5.4065520089352503e-05, + "loss": 3.1739040423417464e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00005, + "ppl": 1.00003, "step": 357, "tokens/total": 10799328, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 163318 }, { "epoch": 1.3984375, - "grad_norm": 0.8479411602020264, + "grad_norm": 0.7139555811882019, "learning_rate": 3.0682264635101276e-05, - "loss": 0.01497839204967022, + "loss": 0.010268578305840492, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01509, + "ppl": 1.01032, "step": 358, "tokens/total": 10829488, - "tokens/train_per_sec_per_gpu": 32.89, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 163767 }, { "epoch": 1.40234375, - "grad_norm": 0.0015704578254371881, + "grad_norm": 0.006852464284747839, "learning_rate": 3.0438518053342407e-05, - "loss": 3.0390210667974316e-05, + "loss": 4.873241778113879e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00005, "step": 359, "tokens/total": 10859936, - "tokens/train_per_sec_per_gpu": 31.78, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 164208 }, { "epoch": 1.40625, - "grad_norm": 0.014669318683445454, + "grad_norm": 0.0018247900297865272, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010030368866864592, + "loss": 3.88835760531947e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00004, "step": 360, "tokens/total": 10890400, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 164655 }, { "epoch": 1.41015625, - "grad_norm": 0.3479421138763428, + "grad_norm": 0.0436873696744442, "learning_rate": 2.9954101301140146e-05, - "loss": 0.0026096655055880547, + "loss": 0.0003687943681143224, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00261, + "ppl": 1.00037, "step": 361, "tokens/total": 10920624, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 165100 }, { "epoch": 1.4140625, - "grad_norm": 0.004394443240016699, + "grad_norm": 0.26735150814056396, "learning_rate": 2.9713451289255123e-05, - "loss": 6.116658914834261e-05, + "loss": 0.00039605735219083726, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00006, + "ppl": 1.0004, "step": 362, "tokens/total": 10951136, - "tokens/train_per_sec_per_gpu": 34.84, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 165587 }, { "epoch": 1.41796875, - "grad_norm": 0.016197621822357178, + "grad_norm": 0.0964483991265297, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0001775357231963426, + "loss": 0.0007330900407396257, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00018, + "ppl": 1.00073, "step": 363, "tokens/total": 10981344, - "tokens/train_per_sec_per_gpu": 34.09, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 166034 }, { "epoch": 1.421875, - "grad_norm": 0.09478334337472916, + "grad_norm": 0.05367618799209595, "learning_rate": 2.9235318065647e-05, - "loss": 0.0005033796769566834, + "loss": 0.0005384897813200951, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0005, + "ppl": 1.00054, "step": 364, "tokens/total": 11011552, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 166485 }, { "epoch": 1.42578125, - "grad_norm": 0.014899010770022869, + "grad_norm": 0.10067912936210632, "learning_rate": 2.8997854750998964e-05, - "loss": 0.0001904651871882379, + "loss": 0.0006868956843391061, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00019, + "ppl": 1.00069, "step": 365, "tokens/total": 11041872, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 166973 }, { "epoch": 1.4296875, - "grad_norm": 0.005555527750402689, + "grad_norm": 0.02697882056236267, "learning_rate": 2.8761473491751258e-05, - "loss": 0.00010058133921120316, + "loss": 0.0002464794088155031, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00025, "step": 366, "tokens/total": 11072192, - "tokens/train_per_sec_per_gpu": 29.1, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 167414 }, { "epoch": 1.43359375, - "grad_norm": 0.20706292986869812, + "grad_norm": 0.0026214183308184147, "learning_rate": 2.8526184124692883e-05, - "loss": 0.0005888720043003559, + "loss": 5.2629769925260916e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00059, + "ppl": 1.00005, "step": 367, "tokens/total": 11102736, - "tokens/train_per_sec_per_gpu": 30.11, + "tokens/train_per_sec_per_gpu": 30.23, "tokens/trainable": 167851 }, { "epoch": 1.4375, - "grad_norm": 0.0007191727054305375, + "grad_norm": 0.0018140808679163456, "learning_rate": 2.829199644117484e-05, - "loss": 1.2304372830840293e-05, + "loss": 2.9512597393477336e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 368, "tokens/total": 11133056, - "tokens/train_per_sec_per_gpu": 35.48, + "tokens/train_per_sec_per_gpu": 35.56, "tokens/trainable": 168294 }, { "epoch": 1.44140625, - "grad_norm": 0.030878128483891487, + "grad_norm": 0.012045321986079216, "learning_rate": 2.8058920186702553e-05, - "loss": 0.0002043281274382025, + "loss": 7.606908184243366e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0002, + "ppl": 1.00008, "step": 369, "tokens/total": 11163568, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 168769 }, { "epoch": 1.4453125, - "grad_norm": 0.008817057125270367, + "grad_norm": 0.013453424908220768, "learning_rate": 2.782696506053033e-05, - "loss": 0.00011464582348708063, + "loss": 0.00015325279673561454, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00015, "step": 370, "tokens/total": 11193936, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.83, "tokens/trainable": 169270 }, { "epoch": 1.44921875, - "grad_norm": 0.023856336250901222, + "grad_norm": 0.003458227962255478, "learning_rate": 2.7596140715257824e-05, - "loss": 0.00013431125262286514, + "loss": 5.63332432648167e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00013, + "ppl": 1.00006, "step": 371, "tokens/total": 11224480, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 169711 }, { "epoch": 1.453125, - "grad_norm": 0.010502993129193783, + "grad_norm": 0.0063622924499213696, "learning_rate": 2.7366456756428184e-05, - "loss": 0.00015104333579074591, + "loss": 9.534892160445452e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00015, + "ppl": 1.0001, "step": 372, "tokens/total": 11254912, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 170185 }, { "epoch": 1.45703125, - "grad_norm": 0.026970423758029938, + "grad_norm": 0.04558980092406273, "learning_rate": 2.7137922742128486e-05, - "loss": 0.00026081278338097036, + "loss": 0.000613630109000951, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00026, + "ppl": 1.00061, "step": 373, "tokens/total": 11285104, - "tokens/train_per_sec_per_gpu": 33.08, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 170650 }, { "epoch": 1.4609375, - "grad_norm": 0.020325109362602234, + "grad_norm": 0.014873786829411983, "learning_rate": 2.691054818259188e-05, - "loss": 0.00014532633940689266, + "loss": 0.0002038514503510669, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00015, + "ppl": 1.0002, "step": 374, "tokens/total": 11315600, - "tokens/train_per_sec_per_gpu": 31.98, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 171126 }, { "epoch": 1.46484375, - "grad_norm": 0.033260464668273926, + "grad_norm": 0.058739252388477325, "learning_rate": 2.6684342539801933e-05, - "loss": 0.00045571548980660737, + "loss": 0.0010346119524911046, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00046, + "ppl": 1.00104, "step": 375, "tokens/total": 11345776, "tokens/train_per_sec_per_gpu": 35.6, @@ -5261,576 +5261,576 @@ }, { "epoch": 1.46875, - "grad_norm": 0.017290709540247917, + "grad_norm": 0.24105991423130035, "learning_rate": 2.645931522709877e-05, - "loss": 0.00014910403115209192, + "loss": 0.0035716122947633266, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00015, + "ppl": 1.00358, "step": 376, "tokens/total": 11376208, - "tokens/train_per_sec_per_gpu": 28.09, + "tokens/train_per_sec_per_gpu": 28.14, "tokens/trainable": 172017 }, { "epoch": 1.47265625, - "grad_norm": 0.04457363486289978, + "grad_norm": 0.08793950080871582, "learning_rate": 2.6235475608787365e-05, - "loss": 6.834026135038584e-05, + "loss": 0.0007833336712792516, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00007, + "ppl": 1.00078, "step": 377, "tokens/total": 11406512, - "tokens/train_per_sec_per_gpu": 35.99, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 172493 }, { "epoch": 1.4765625, - "grad_norm": 0.002268735785037279, + "grad_norm": 0.009154544211924076, "learning_rate": 2.6012832999747916e-05, - "loss": 3.245133120799437e-05, + "loss": 0.00011752049613278359, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00012, "step": 378, "tokens/total": 11436544, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 172951 }, { "epoch": 1.48046875, - "grad_norm": 0.0038171466439962387, + "grad_norm": 0.012918495573103428, "learning_rate": 2.579139666504821e-05, - "loss": 5.4866883147042245e-05, + "loss": 0.00011567945330170915, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00012, "step": 379, "tokens/total": 11467008, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 173435 }, { "epoch": 1.484375, - "grad_norm": 0.005268535576760769, + "grad_norm": 0.008966504596173763, "learning_rate": 2.557117581955798e-05, - "loss": 8.241234172601253e-05, + "loss": 8.938623068388551e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00009, "step": 380, "tokens/total": 11497184, - "tokens/train_per_sec_per_gpu": 30.4, + "tokens/train_per_sec_per_gpu": 30.47, "tokens/trainable": 173900 }, { "epoch": 1.48828125, - "grad_norm": 0.016057243570685387, + "grad_norm": 0.03181751072406769, "learning_rate": 2.5352179627565532e-05, - "loss": 0.00014235377602744848, + "loss": 0.00013083787052892148, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00014, + "ppl": 1.00013, "step": 381, "tokens/total": 11527600, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 174371 }, { "epoch": 1.4921875, - "grad_norm": 0.005853456910699606, + "grad_norm": 0.0009072935208678246, "learning_rate": 2.5134417202396277e-05, - "loss": 5.001476893085055e-05, + "loss": 2.5600436856620945e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 382, "tokens/total": 11557808, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 174826 }, { "epoch": 1.49609375, - "grad_norm": 0.0031664848793298006, + "grad_norm": 0.0050596860237419605, "learning_rate": 2.491789760603361e-05, - "loss": 4.210277256788686e-05, + "loss": 5.778766353614628e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00006, "step": 383, "tokens/total": 11588352, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 175276 }, { "epoch": 1.5, - "grad_norm": 0.08838633447885513, + "grad_norm": 0.008304890245199203, "learning_rate": 2.4702629848741764e-05, - "loss": 0.0010394920827820897, + "loss": 0.00012505470658652484, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00104, + "ppl": 1.00013, "step": 384, "tokens/total": 11618640, - "tokens/train_per_sec_per_gpu": 33.69, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 175720 }, { "epoch": 1.50390625, - "grad_norm": 0.09446703642606735, + "grad_norm": 0.0035276354756206274, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0005370234721340239, + "loss": 4.851898120250553e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00054, + "ppl": 1.00005, "step": 385, "tokens/total": 11649072, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 176203 }, { "epoch": 1.5078125, - "grad_norm": 0.0013355027185752988, + "grad_norm": 0.001593019813299179, "learning_rate": 2.427588563158384e-05, - "loss": 1.903088195831515e-05, + "loss": 3.330651088617742e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00003, "step": 386, "tokens/total": 11679552, - "tokens/train_per_sec_per_gpu": 34.29, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176651 }, { "epoch": 1.51171875, - "grad_norm": 0.011693151667714119, + "grad_norm": 0.002167076338082552, "learning_rate": 2.406442693028651e-05, - "loss": 7.680666749365628e-05, + "loss": 3.344817378092557e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00008, + "ppl": 1.00003, "step": 387, "tokens/total": 11709760, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 177115 }, { "epoch": 1.515625, - "grad_norm": 0.09523260593414307, + "grad_norm": 0.003447546623647213, "learning_rate": 2.3854255584458547e-05, - "loss": 0.00073521543527022, + "loss": 5.5277254432439804e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00074, + "ppl": 1.00006, "step": 388, "tokens/total": 11740288, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.13, "tokens/trainable": 177601 }, { "epoch": 1.51953125, - "grad_norm": 0.005971741396933794, + "grad_norm": 0.0052979388274252415, "learning_rate": 2.3645380340187508e-05, - "loss": 6.468063656939194e-05, + "loss": 4.56162124464754e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00006, + "ppl": 1.00005, "step": 389, "tokens/total": 11770592, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 178050 }, { "epoch": 1.5234375, - "grad_norm": 0.0010247502941638231, + "grad_norm": 0.003032457083463669, "learning_rate": 2.3437809889624914e-05, - "loss": 1.5989648090908304e-05, + "loss": 3.829343768302351e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00004, "step": 390, "tokens/total": 11800752, - "tokens/train_per_sec_per_gpu": 36.38, + "tokens/train_per_sec_per_gpu": 36.42, "tokens/trainable": 178531 }, { "epoch": 1.52734375, - "grad_norm": 0.054420940577983856, + "grad_norm": 0.03542603179812431, "learning_rate": 2.3231552870624487e-05, - "loss": 0.0004186803416814655, + "loss": 0.0003605492820497602, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00042, + "ppl": 1.00036, "step": 391, "tokens/total": 11831360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 179000 }, { "epoch": 1.53125, - "grad_norm": 0.002925195964053273, + "grad_norm": 0.004965933505445719, "learning_rate": 2.3026617866382657e-05, - "loss": 1.531536145193968e-05, + "loss": 7.091004226822406e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00002, + "ppl": 1.00007, "step": 392, "tokens/total": 11861552, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 179457 }, { "epoch": 1.53515625, - "grad_norm": 1.6402941942214966, + "grad_norm": 0.006339129991829395, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0027035027742385864, + "loss": 9.15761775104329e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00271, + "ppl": 1.00009, "step": 393, "tokens/total": 11891904, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.81, "tokens/trainable": 179890 }, { "epoch": 1.5390625, - "grad_norm": 0.0032207504846155643, + "grad_norm": 0.03921438008546829, "learning_rate": 2.2620747959533722e-05, - "loss": 3.968120290664956e-05, + "loss": 0.00038214243249967694, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00038, "step": 394, "tokens/total": 11922208, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 180341 }, { "epoch": 1.54296875, - "grad_norm": 0.013098486699163914, + "grad_norm": 0.08640608936548233, "learning_rate": 2.2419829946830123e-05, - "loss": 0.00011063168494729325, + "loss": 0.0006777399685233831, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00011, + "ppl": 1.00068, "step": 395, "tokens/total": 11952672, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 180762 }, { "epoch": 1.546875, - "grad_norm": 0.01553372759371996, + "grad_norm": 0.08661718666553497, "learning_rate": 2.2220267727989325e-05, - "loss": 8.802580123301595e-05, + "loss": 0.0007016840972937644, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00009, + "ppl": 1.0007, "step": 396, "tokens/total": 11983088, - "tokens/train_per_sec_per_gpu": 35.04, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 181226 }, { "epoch": 1.55078125, - "grad_norm": 0.016083814203739166, + "grad_norm": 0.010069145821034908, "learning_rate": 2.202206960760984e-05, - "loss": 8.931377669796348e-05, + "loss": 0.00011120665294583887, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00011, "step": 397, "tokens/total": 12013488, - "tokens/train_per_sec_per_gpu": 33.15, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 181714 }, { "epoch": 1.5546875, - "grad_norm": 0.05752059072256088, + "grad_norm": 0.03158818930387497, "learning_rate": 2.182524383352446e-05, - "loss": 0.00015369296306744218, + "loss": 0.00024857826065272093, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00015, + "ppl": 1.00025, "step": 398, "tokens/total": 12043968, - "tokens/train_per_sec_per_gpu": 35.52, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 182142 }, { "epoch": 1.55859375, - "grad_norm": 0.0011741623748093843, + "grad_norm": 0.000873154669534415, "learning_rate": 2.1629798596457056e-05, - "loss": 1.8113165424438193e-05, + "loss": 2.1218824258539826e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, "ppl": 1.00002, "step": 399, "tokens/total": 12074160, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.86, "tokens/trainable": 182604 }, { "epoch": 1.5625, - "grad_norm": 0.0048082731664180756, + "grad_norm": 0.009255572222173214, "learning_rate": 2.1435742029681725e-05, - "loss": 5.3348740038927644e-05, + "loss": 0.0001349164522252977, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.67, "memory/max_allocated (GiB)": 33.67, - "ppl": 1.00005, + "ppl": 1.00013, "step": 400, "tokens/total": 12104352, - "tokens/train_per_sec_per_gpu": 25.28, + "tokens/train_per_sec_per_gpu": 25.31, "tokens/trainable": 183011 }, { "epoch": 1.56640625, - "grad_norm": 0.006520449183881283, + "grad_norm": 0.010521743446588516, "learning_rate": 2.124308220868431e-05, - "loss": 6.45049221930094e-05, + "loss": 7.793466647854075e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00006, + "ppl": 1.00008, "step": 401, "tokens/total": 12134240, - "tokens/train_per_sec_per_gpu": 31.69, + "tokens/train_per_sec_per_gpu": 31.81, "tokens/trainable": 183459 }, { "epoch": 1.5703125, - "grad_norm": 0.006227654870599508, + "grad_norm": 0.0013409090461209416, "learning_rate": 2.105182715082638e-05, - "loss": 6.928759830771014e-05, + "loss": 2.7722922823159024e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00007, + "ppl": 1.00003, "step": 402, "tokens/total": 12164480, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.7, "tokens/trainable": 183959 }, { "epoch": 1.57421875, - "grad_norm": 0.32605040073394775, + "grad_norm": 0.10361713916063309, "learning_rate": 2.0861984815011552e-05, - "loss": 0.002115404698997736, + "loss": 0.0014142843428999186, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00212, + "ppl": 1.00142, "step": 403, "tokens/total": 12194640, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.5, "tokens/trainable": 184431 }, { "epoch": 1.578125, - "grad_norm": 0.007742208894342184, + "grad_norm": 0.0026048943400382996, "learning_rate": 2.0673563101354323e-05, - "loss": 4.600908869178966e-05, + "loss": 4.14503738284111e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00005, + "ppl": 1.00004, "step": 404, "tokens/total": 12224960, - "tokens/train_per_sec_per_gpu": 31.34, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 184867 }, { "epoch": 1.58203125, - "grad_norm": 0.0049946485087275505, + "grad_norm": 0.009411919862031937, "learning_rate": 2.0486569850851317e-05, - "loss": 5.003535625291988e-05, + "loss": 7.322158489841968e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00005, + "ppl": 1.00007, "step": 405, "tokens/total": 12255008, - "tokens/train_per_sec_per_gpu": 29.25, + "tokens/train_per_sec_per_gpu": 29.37, "tokens/trainable": 185300 }, { "epoch": 1.5859375, - "grad_norm": 0.004598768427968025, + "grad_norm": 0.006792420521378517, "learning_rate": 2.0301012845054956e-05, - "loss": 3.4423381293891e-05, + "loss": 7.982828537933528e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00003, + "ppl": 1.00008, "step": 406, "tokens/total": 12285248, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 185754 }, { "epoch": 1.58984375, - "grad_norm": 0.0011464629787951708, + "grad_norm": 0.013020367361605167, "learning_rate": 2.011689980574966e-05, - "loss": 1.9196500943508e-05, + "loss": 3.743396155186929e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00002, + "ppl": 1.00004, "step": 407, "tokens/total": 12315552, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 186213 }, { "epoch": 1.59375, - "grad_norm": 0.004688040353357792, + "grad_norm": 0.0013089004205539823, "learning_rate": 1.993423839463052e-05, - "loss": 5.2492636314127594e-05, + "loss": 2.306591341039166e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00002, "step": 408, "tokens/total": 12345904, - "tokens/train_per_sec_per_gpu": 32.72, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 186659 }, { "epoch": 1.59765625, - "grad_norm": 0.002637861529365182, + "grad_norm": 0.0012270932784304023, "learning_rate": 1.975303621298445e-05, - "loss": 3.172009019181132e-05, + "loss": 2.1350417227949947e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00002, "step": 409, "tokens/total": 12376336, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.97, "tokens/trainable": 187083 }, { "epoch": 1.6015625, - "grad_norm": 0.0072015393525362015, + "grad_norm": 0.011230082251131535, "learning_rate": 1.957330080137385e-05, - "loss": 5.452537880046293e-05, + "loss": 3.752015618374571e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00005, + "ppl": 1.00004, "step": 410, "tokens/total": 12406880, - "tokens/train_per_sec_per_gpu": 34.91, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 187530 }, { "epoch": 1.60546875, - "grad_norm": 0.007169651333242655, + "grad_norm": 0.004872993566095829, "learning_rate": 1.9395039639322864e-05, - "loss": 3.530656249495223e-05, + "loss": 5.5653974413871765e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00006, "step": 411, "tokens/total": 12437088, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 187972 }, { "epoch": 1.609375, - "grad_norm": 0.003889538114890456, + "grad_norm": 0.19391997158527374, "learning_rate": 1.9218260145006073e-05, - "loss": 3.5087461583316326e-05, + "loss": 0.000892186420969665, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00089, "step": 412, "tokens/total": 12465440, - "tokens/train_per_sec_per_gpu": 39.89, + "tokens/train_per_sec_per_gpu": 39.95, "tokens/trainable": 188417 }, { "epoch": 1.61328125, - "grad_norm": 0.5135430693626404, + "grad_norm": 0.09062197804450989, "learning_rate": 1.904296967493982e-05, - "loss": 0.005697700660675764, + "loss": 0.0006304415874183178, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00571, + "ppl": 1.00063, "step": 413, "tokens/total": 12495968, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.57, "tokens/trainable": 188868 }, { "epoch": 1.6171875, - "grad_norm": 0.0010096468031406403, + "grad_norm": 0.009724686853587627, "learning_rate": 1.8869175523676064e-05, - "loss": 1.1318426913931035e-05, + "loss": 6.72380265314132e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00001, + "ppl": 1.00007, "step": 414, "tokens/total": 12526128, - "tokens/train_per_sec_per_gpu": 36.85, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 189337 }, { "epoch": 1.62109375, - "grad_norm": 0.0004970752634108067, + "grad_norm": 0.19542834162712097, "learning_rate": 1.869688492349885e-05, - "loss": 7.355167326750234e-06, + "loss": 0.001907092402689159, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00191, "step": 415, "tokens/total": 12556256, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 189750 }, { "epoch": 1.625, - "grad_norm": 0.0008849130244925618, + "grad_norm": 0.0465276800096035, "learning_rate": 1.85261050441233e-05, - "loss": 1.4194254617905244e-05, + "loss": 0.0005661146715283394, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00057, "step": 416, "tokens/total": 12586736, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 190216 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_model.safetensors index 856c12a4d59288ac43e5f2eac631af52491777f8..7398f9593aeb3e59dfc2a7c156c2ad9ed5baab96 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:43bdbb695861ca6c533046f5060be937637c560db75e2f4b7c2e25087dd34f87 +oid sha256:1eb3d591ce153c2a4556c9f93c60c352d3c882d47e4ce5be7c18c310c4f811f4 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/optimizer.pt index 9b9a580f4ab2d3d2e0ee142a358cea8057b12317..1518f52b978778190f89c493272fe777f1d5981f 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:03973e721e8a5628b3dc60c89f72ebda5ff7b262b6698c43c8ce9e37b8256ddc +oid sha256:3faad3751c767d14b48f00eccec7568928e290a8f8c3f619dc85813de53d3afc size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/trainer_state.json index e25c9a9b9b52060d5b3bcc14fb33776208ad707b..be0fc93eccd3e6bcb1a72cf0f77869c9ad664585 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-448/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,1525 +3735,1525 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 }, { "epoch": 1.25390625, - "grad_norm": 0.0067353262566030025, + "grad_norm": 0.01599739119410515, "learning_rate": 4.0323513089607876e-05, - "loss": 6.0428461438277736e-05, + "loss": 6.388167093973607e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00006, "step": 321, "tokens/total": 9708848, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 147114 }, { "epoch": 1.2578125, - "grad_norm": 0.05487794429063797, + "grad_norm": 0.0042083412408828735, "learning_rate": 4.004940255778431e-05, - "loss": 0.0002498509711585939, + "loss": 2.1792850020574406e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00025, + "ppl": 1.00002, "step": 322, "tokens/total": 9739360, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 147564 }, { "epoch": 1.26171875, - "grad_norm": 0.0011818762868642807, + "grad_norm": 0.009429940953850746, "learning_rate": 3.977591418134619e-05, - "loss": 1.1004886800947133e-05, + "loss": 3.834946619463153e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00004, "step": 323, "tokens/total": 9769776, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.24, "tokens/trainable": 148013 }, { "epoch": 1.265625, - "grad_norm": 0.018019674345850945, + "grad_norm": 0.05088210478425026, "learning_rate": 3.95030593412612e-05, - "loss": 0.00021162032498978078, + "loss": 0.00018766832363326102, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00021, + "ppl": 1.00019, "step": 324, "tokens/total": 9800096, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.06, "tokens/trainable": 148470 }, { "epoch": 1.26953125, - "grad_norm": 1.5907806158065796, + "grad_norm": 0.9416317939758301, "learning_rate": 3.923084939213296e-05, - "loss": 0.016217660158872604, + "loss": 0.01083211787045002, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01635, + "ppl": 1.01089, "step": 325, "tokens/total": 9830304, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 148926 }, { "epoch": 1.2734375, - "grad_norm": 0.004153774119913578, + "grad_norm": 0.00033186975633725524, "learning_rate": 3.895929566172861e-05, - "loss": 3.801286584348418e-05, + "loss": 8.612486453785095e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 326, "tokens/total": 9860608, - "tokens/train_per_sec_per_gpu": 37.72, + "tokens/train_per_sec_per_gpu": 37.82, "tokens/trainable": 149420 }, { "epoch": 1.27734375, - "grad_norm": 0.0029778245370835066, + "grad_norm": 0.0005477021913975477, "learning_rate": 3.868840945050728e-05, - "loss": 5.526735549210571e-05, + "loss": 1.5825649825274013e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00006, + "ppl": 1.00002, "step": 327, "tokens/total": 9890560, - "tokens/train_per_sec_per_gpu": 39.32, + "tokens/train_per_sec_per_gpu": 39.41, "tokens/trainable": 149873 }, { "epoch": 1.28125, - "grad_norm": 0.028163742274045944, + "grad_norm": 0.0008259841124527156, "learning_rate": 3.841820203114995e-05, - "loss": 0.00039056455716490746, + "loss": 1.642670395085588e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00039, + "ppl": 1.00002, "step": 328, "tokens/total": 9920880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 150347 }, { "epoch": 1.28515625, - "grad_norm": 0.04141407459974289, + "grad_norm": 0.0011461537797003984, "learning_rate": 3.814868464809027e-05, - "loss": 0.0005860928213223815, + "loss": 1.7516158550279215e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00059, + "ppl": 1.00002, "step": 329, "tokens/total": 9951280, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 150822 }, { "epoch": 1.2890625, - "grad_norm": 0.004758972208946943, + "grad_norm": 0.0022519829217344522, "learning_rate": 3.787986851704667e-05, - "loss": 9.08115180209279e-05, + "loss": 2.000835411308799e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00009, + "ppl": 1.00002, "step": 330, "tokens/total": 9981600, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 151266 }, { "epoch": 1.29296875, - "grad_norm": 0.04043704643845558, + "grad_norm": 0.08718931674957275, "learning_rate": 3.7611764824555654e-05, - "loss": 0.0005757657927460968, + "loss": 0.0003773289208766073, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00058, + "ppl": 1.00038, "step": 331, "tokens/total": 10012016, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.15, "tokens/trainable": 151734 }, { "epoch": 1.296875, - "grad_norm": 0.064565509557724, + "grad_norm": 0.000883373199030757, "learning_rate": 3.734438472750619e-05, - "loss": 0.00043528492096811533, + "loss": 1.1746728887374047e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00044, + "ppl": 1.00001, "step": 332, "tokens/total": 10042448, - "tokens/train_per_sec_per_gpu": 33.99, + "tokens/train_per_sec_per_gpu": 34.01, "tokens/trainable": 152184 }, { "epoch": 1.30078125, - "grad_norm": 0.051213983446359634, + "grad_norm": 0.011426394805312157, "learning_rate": 3.707773935267552e-05, - "loss": 0.000528274686075747, + "loss": 5.219353988650255e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00053, + "ppl": 1.00005, "step": 333, "tokens/total": 10073024, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.85, "tokens/trainable": 152623 }, { "epoch": 1.3046875, - "grad_norm": 0.0067980666644871235, + "grad_norm": 0.5781233310699463, "learning_rate": 3.68118397962661e-05, - "loss": 0.00013989521539770067, + "loss": 0.0034865224733948708, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00014, + "ppl": 1.00349, "step": 334, "tokens/total": 10103504, - "tokens/train_per_sec_per_gpu": 33.34, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 153040 }, { "epoch": 1.30859375, - "grad_norm": 0.28768453001976013, + "grad_norm": 0.7213758230209351, "learning_rate": 3.654669712344384e-05, - "loss": 0.0035491236485540867, + "loss": 0.004715530201792717, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00356, + "ppl": 1.00473, "step": 335, "tokens/total": 10131632, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.78, "tokens/trainable": 153463 }, { "epoch": 1.3125, - "grad_norm": 0.04292941838502884, + "grad_norm": 0.03131686523556709, "learning_rate": 3.628232236787763e-05, - "loss": 0.0007545957923866808, + "loss": 0.0002346257824683562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00075, + "ppl": 1.00023, "step": 336, "tokens/total": 10161824, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 153908 }, { "epoch": 1.31640625, - "grad_norm": 0.13187745213508606, + "grad_norm": 0.03332929685711861, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0011231126263737679, + "loss": 0.00011981122952420264, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00112, + "ppl": 1.00012, "step": 337, "tokens/total": 10192448, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 154387 }, { "epoch": 1.3203125, - "grad_norm": 0.06429488956928253, + "grad_norm": 0.0045038131065666676, "learning_rate": 3.575592058295017e-05, - "loss": 0.0004924655659124255, + "loss": 3.5494955227477476e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00049, + "ppl": 1.00004, "step": 338, "tokens/total": 10222704, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 154836 }, { "epoch": 1.32421875, - "grad_norm": 0.006816778797656298, + "grad_norm": 0.0012434936361387372, "learning_rate": 3.549391545931585e-05, - "loss": 8.63251625560224e-05, + "loss": 1.7894679331220686e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00009, + "ppl": 1.00002, "step": 339, "tokens/total": 10253168, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.81, "tokens/trainable": 155261 }, { "epoch": 1.328125, - "grad_norm": 0.04606792330741882, + "grad_norm": 0.3250766098499298, "learning_rate": 3.5232722063479914e-05, - "loss": 0.0003515402786433697, + "loss": 0.00279021542519331, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00035, + "ppl": 1.00279, "step": 340, "tokens/total": 10283552, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.24, "tokens/trainable": 155674 }, { "epoch": 1.33203125, - "grad_norm": 0.24907881021499634, + "grad_norm": 0.036490436643362045, "learning_rate": 3.49723512647657e-05, - "loss": 0.000742567703127861, + "loss": 0.00013251493510324508, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00074, + "ppl": 1.00013, "step": 341, "tokens/total": 10313872, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 156164 }, { "epoch": 1.3359375, - "grad_norm": 0.011238012462854385, + "grad_norm": 0.2706057131290436, "learning_rate": 3.471281389826491e-05, - "loss": 0.0001773187832441181, + "loss": 0.0021429890766739845, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00018, + "ppl": 1.00215, "step": 342, "tokens/total": 10344256, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 156611 }, { "epoch": 1.33984375, - "grad_norm": 0.00949561782181263, + "grad_norm": 0.01915346086025238, "learning_rate": 3.4454120764386764e-05, - "loss": 0.00018969883967656642, + "loss": 0.00013777356070932, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00019, + "ppl": 1.00014, "step": 343, "tokens/total": 10374544, - "tokens/train_per_sec_per_gpu": 33.58, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 157073 }, { "epoch": 1.34375, - "grad_norm": 0.10763411223888397, + "grad_norm": 0.02540464885532856, "learning_rate": 3.4196282628408526e-05, - "loss": 0.0007583287660963833, + "loss": 5.135099490871653e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00005, "step": 344, "tokens/total": 10405040, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 157523 }, { "epoch": 1.34765625, - "grad_norm": 0.15938052535057068, + "grad_norm": 0.39257746934890747, "learning_rate": 3.3939310220027456e-05, - "loss": 0.0014999746344983578, + "loss": 0.009803109802305698, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0015, + "ppl": 1.00985, "step": 345, "tokens/total": 10435424, - "tokens/train_per_sec_per_gpu": 35.07, + "tokens/train_per_sec_per_gpu": 35.16, "tokens/trainable": 157964 }, { "epoch": 1.3515625, - "grad_norm": 0.00165572261903435, + "grad_norm": 0.0029070202726870775, "learning_rate": 3.3683214232914404e-05, - "loss": 3.833783557638526e-05, + "loss": 2.9972559786983766e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00004, + "ppl": 1.00003, "step": 346, "tokens/total": 10465760, - "tokens/train_per_sec_per_gpu": 30.35, + "tokens/train_per_sec_per_gpu": 30.44, "tokens/trainable": 158390 }, { "epoch": 1.35546875, - "grad_norm": 0.02406073547899723, + "grad_norm": 0.020276719704270363, "learning_rate": 3.342800532426873e-05, - "loss": 0.00039186165668070316, + "loss": 7.613154593855143e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00039, + "ppl": 1.00008, "step": 347, "tokens/total": 10495904, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 158848 }, { "epoch": 1.359375, - "grad_norm": 0.045792482793331146, + "grad_norm": 0.14866818487644196, "learning_rate": 3.317369411437484e-05, - "loss": 0.0006161610363051295, + "loss": 0.0011244683992117643, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00062, + "ppl": 1.00113, "step": 348, "tokens/total": 10526624, - "tokens/train_per_sec_per_gpu": 28.63, + "tokens/train_per_sec_per_gpu": 28.71, "tokens/trainable": 159270 }, { "epoch": 1.36328125, - "grad_norm": 0.18648307025432587, + "grad_norm": 0.015379665419459343, "learning_rate": 3.292029118616024e-05, - "loss": 0.0012868957128375769, + "loss": 7.920589268906042e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00129, + "ppl": 1.00008, "step": 349, "tokens/total": 10556752, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.51, "tokens/trainable": 159720 }, { "epoch": 1.3671875, - "grad_norm": 0.015933886170387268, + "grad_norm": 0.0023695260751992464, "learning_rate": 3.266780708475511e-05, - "loss": 0.0002091687492793426, + "loss": 1.4566459867637604e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00021, + "ppl": 1.00001, "step": 350, "tokens/total": 10587264, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.14, "tokens/trainable": 160187 }, { "epoch": 1.37109375, - "grad_norm": 0.008724886924028397, + "grad_norm": 0.00954374298453331, "learning_rate": 3.241625231705354e-05, - "loss": 0.00013179841334931552, + "loss": 6.530048267450184e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00007, "step": 351, "tokens/total": 10617504, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 160645 }, { "epoch": 1.375, - "grad_norm": 0.06377559900283813, + "grad_norm": 0.6504904627799988, "learning_rate": 3.216563735127618e-05, - "loss": 0.0008062056731432676, + "loss": 0.01059151440858841, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00081, + "ppl": 1.01065, "step": 352, "tokens/total": 10647760, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.49, "tokens/trainable": 161102 }, { "epoch": 1.37890625, - "grad_norm": 0.0037202269304543734, + "grad_norm": 0.024732626974582672, "learning_rate": 3.191597261653475e-05, - "loss": 7.238816760946065e-05, + "loss": 0.0001429672265658155, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00007, + "ppl": 1.00014, "step": 353, "tokens/total": 10678080, - "tokens/train_per_sec_per_gpu": 28.86, + "tokens/train_per_sec_per_gpu": 28.93, "tokens/trainable": 161555 }, { "epoch": 1.3828125, - "grad_norm": 0.0021510994993150234, + "grad_norm": 0.037309419363737106, "learning_rate": 3.166726850239794e-05, - "loss": 3.6805788113269955e-05, + "loss": 7.214388460852206e-05, "memory/device_reserved (GiB)": 35.41, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00004, + "ppl": 1.00007, "step": 354, "tokens/total": 10708544, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.75, "tokens/trainable": 162020 }, { "epoch": 1.38671875, - "grad_norm": 0.002642499515786767, + "grad_norm": 0.00885045062750578, "learning_rate": 3.141953535845912e-05, - "loss": 4.371708200778812e-05, + "loss": 0.00011830432777060196, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00012, "step": 355, "tokens/total": 10739024, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 162448 }, { "epoch": 1.390625, - "grad_norm": 0.0038646068423986435, + "grad_norm": 0.06791900098323822, "learning_rate": 3.11727834939056e-05, - "loss": 7.11614266037941e-05, + "loss": 0.0003609730047173798, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.61, "memory/max_allocated (GiB)": 33.61, - "ppl": 1.00007, + "ppl": 1.00036, "step": 356, "tokens/total": 10769024, - "tokens/train_per_sec_per_gpu": 28.2, + "tokens/train_per_sec_per_gpu": 28.26, "tokens/trainable": 162863 }, { "epoch": 1.39453125, - "grad_norm": 0.017895536497235298, + "grad_norm": 0.0019508687546476722, "learning_rate": 3.092702317708967e-05, - "loss": 5.4065520089352503e-05, + "loss": 3.1739040423417464e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00005, + "ppl": 1.00003, "step": 357, "tokens/total": 10799328, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 163318 }, { "epoch": 1.3984375, - "grad_norm": 0.8479411602020264, + "grad_norm": 0.7139555811882019, "learning_rate": 3.0682264635101276e-05, - "loss": 0.01497839204967022, + "loss": 0.010268578305840492, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01509, + "ppl": 1.01032, "step": 358, "tokens/total": 10829488, - "tokens/train_per_sec_per_gpu": 32.89, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 163767 }, { "epoch": 1.40234375, - "grad_norm": 0.0015704578254371881, + "grad_norm": 0.006852464284747839, "learning_rate": 3.0438518053342407e-05, - "loss": 3.0390210667974316e-05, + "loss": 4.873241778113879e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00005, "step": 359, "tokens/total": 10859936, - "tokens/train_per_sec_per_gpu": 31.78, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 164208 }, { "epoch": 1.40625, - "grad_norm": 0.014669318683445454, + "grad_norm": 0.0018247900297865272, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010030368866864592, + "loss": 3.88835760531947e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00004, "step": 360, "tokens/total": 10890400, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 164655 }, { "epoch": 1.41015625, - "grad_norm": 0.3479421138763428, + "grad_norm": 0.0436873696744442, "learning_rate": 2.9954101301140146e-05, - "loss": 0.0026096655055880547, + "loss": 0.0003687943681143224, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00261, + "ppl": 1.00037, "step": 361, "tokens/total": 10920624, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 165100 }, { "epoch": 1.4140625, - "grad_norm": 0.004394443240016699, + "grad_norm": 0.26735150814056396, "learning_rate": 2.9713451289255123e-05, - "loss": 6.116658914834261e-05, + "loss": 0.00039605735219083726, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00006, + "ppl": 1.0004, "step": 362, "tokens/total": 10951136, - "tokens/train_per_sec_per_gpu": 34.84, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 165587 }, { "epoch": 1.41796875, - "grad_norm": 0.016197621822357178, + "grad_norm": 0.0964483991265297, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0001775357231963426, + "loss": 0.0007330900407396257, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00018, + "ppl": 1.00073, "step": 363, "tokens/total": 10981344, - "tokens/train_per_sec_per_gpu": 34.09, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 166034 }, { "epoch": 1.421875, - "grad_norm": 0.09478334337472916, + "grad_norm": 0.05367618799209595, "learning_rate": 2.9235318065647e-05, - "loss": 0.0005033796769566834, + "loss": 0.0005384897813200951, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0005, + "ppl": 1.00054, "step": 364, "tokens/total": 11011552, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 166485 }, { "epoch": 1.42578125, - "grad_norm": 0.014899010770022869, + "grad_norm": 0.10067912936210632, "learning_rate": 2.8997854750998964e-05, - "loss": 0.0001904651871882379, + "loss": 0.0006868956843391061, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00019, + "ppl": 1.00069, "step": 365, "tokens/total": 11041872, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 166973 }, { "epoch": 1.4296875, - "grad_norm": 0.005555527750402689, + "grad_norm": 0.02697882056236267, "learning_rate": 2.8761473491751258e-05, - "loss": 0.00010058133921120316, + "loss": 0.0002464794088155031, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00025, "step": 366, "tokens/total": 11072192, - "tokens/train_per_sec_per_gpu": 29.1, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 167414 }, { "epoch": 1.43359375, - "grad_norm": 0.20706292986869812, + "grad_norm": 0.0026214183308184147, "learning_rate": 2.8526184124692883e-05, - "loss": 0.0005888720043003559, + "loss": 5.2629769925260916e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00059, + "ppl": 1.00005, "step": 367, "tokens/total": 11102736, - "tokens/train_per_sec_per_gpu": 30.11, + "tokens/train_per_sec_per_gpu": 30.23, "tokens/trainable": 167851 }, { "epoch": 1.4375, - "grad_norm": 0.0007191727054305375, + "grad_norm": 0.0018140808679163456, "learning_rate": 2.829199644117484e-05, - "loss": 1.2304372830840293e-05, + "loss": 2.9512597393477336e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 368, "tokens/total": 11133056, - "tokens/train_per_sec_per_gpu": 35.48, + "tokens/train_per_sec_per_gpu": 35.56, "tokens/trainable": 168294 }, { "epoch": 1.44140625, - "grad_norm": 0.030878128483891487, + "grad_norm": 0.012045321986079216, "learning_rate": 2.8058920186702553e-05, - "loss": 0.0002043281274382025, + "loss": 7.606908184243366e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0002, + "ppl": 1.00008, "step": 369, "tokens/total": 11163568, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 168769 }, { "epoch": 1.4453125, - "grad_norm": 0.008817057125270367, + "grad_norm": 0.013453424908220768, "learning_rate": 2.782696506053033e-05, - "loss": 0.00011464582348708063, + "loss": 0.00015325279673561454, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00015, "step": 370, "tokens/total": 11193936, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.83, "tokens/trainable": 169270 }, { "epoch": 1.44921875, - "grad_norm": 0.023856336250901222, + "grad_norm": 0.003458227962255478, "learning_rate": 2.7596140715257824e-05, - "loss": 0.00013431125262286514, + "loss": 5.63332432648167e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00013, + "ppl": 1.00006, "step": 371, "tokens/total": 11224480, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 169711 }, { "epoch": 1.453125, - "grad_norm": 0.010502993129193783, + "grad_norm": 0.0063622924499213696, "learning_rate": 2.7366456756428184e-05, - "loss": 0.00015104333579074591, + "loss": 9.534892160445452e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00015, + "ppl": 1.0001, "step": 372, "tokens/total": 11254912, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 170185 }, { "epoch": 1.45703125, - "grad_norm": 0.026970423758029938, + "grad_norm": 0.04558980092406273, "learning_rate": 2.7137922742128486e-05, - "loss": 0.00026081278338097036, + "loss": 0.000613630109000951, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00026, + "ppl": 1.00061, "step": 373, "tokens/total": 11285104, - "tokens/train_per_sec_per_gpu": 33.08, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 170650 }, { "epoch": 1.4609375, - "grad_norm": 0.020325109362602234, + "grad_norm": 0.014873786829411983, "learning_rate": 2.691054818259188e-05, - "loss": 0.00014532633940689266, + "loss": 0.0002038514503510669, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00015, + "ppl": 1.0002, "step": 374, "tokens/total": 11315600, - "tokens/train_per_sec_per_gpu": 31.98, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 171126 }, { "epoch": 1.46484375, - "grad_norm": 0.033260464668273926, + "grad_norm": 0.058739252388477325, "learning_rate": 2.6684342539801933e-05, - "loss": 0.00045571548980660737, + "loss": 0.0010346119524911046, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00046, + "ppl": 1.00104, "step": 375, "tokens/total": 11345776, "tokens/train_per_sec_per_gpu": 35.6, @@ -5261,713 +5261,713 @@ }, { "epoch": 1.46875, - "grad_norm": 0.017290709540247917, + "grad_norm": 0.24105991423130035, "learning_rate": 2.645931522709877e-05, - "loss": 0.00014910403115209192, + "loss": 0.0035716122947633266, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00015, + "ppl": 1.00358, "step": 376, "tokens/total": 11376208, - "tokens/train_per_sec_per_gpu": 28.09, + "tokens/train_per_sec_per_gpu": 28.14, "tokens/trainable": 172017 }, { "epoch": 1.47265625, - "grad_norm": 0.04457363486289978, + "grad_norm": 0.08793950080871582, "learning_rate": 2.6235475608787365e-05, - "loss": 6.834026135038584e-05, + "loss": 0.0007833336712792516, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00007, + "ppl": 1.00078, "step": 377, "tokens/total": 11406512, - "tokens/train_per_sec_per_gpu": 35.99, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 172493 }, { "epoch": 1.4765625, - "grad_norm": 0.002268735785037279, + "grad_norm": 0.009154544211924076, "learning_rate": 2.6012832999747916e-05, - "loss": 3.245133120799437e-05, + "loss": 0.00011752049613278359, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00012, "step": 378, "tokens/total": 11436544, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 172951 }, { "epoch": 1.48046875, - "grad_norm": 0.0038171466439962387, + "grad_norm": 0.012918495573103428, "learning_rate": 2.579139666504821e-05, - "loss": 5.4866883147042245e-05, + "loss": 0.00011567945330170915, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00012, "step": 379, "tokens/total": 11467008, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 173435 }, { "epoch": 1.484375, - "grad_norm": 0.005268535576760769, + "grad_norm": 0.008966504596173763, "learning_rate": 2.557117581955798e-05, - "loss": 8.241234172601253e-05, + "loss": 8.938623068388551e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00009, "step": 380, "tokens/total": 11497184, - "tokens/train_per_sec_per_gpu": 30.4, + "tokens/train_per_sec_per_gpu": 30.47, "tokens/trainable": 173900 }, { "epoch": 1.48828125, - "grad_norm": 0.016057243570685387, + "grad_norm": 0.03181751072406769, "learning_rate": 2.5352179627565532e-05, - "loss": 0.00014235377602744848, + "loss": 0.00013083787052892148, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00014, + "ppl": 1.00013, "step": 381, "tokens/total": 11527600, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 174371 }, { "epoch": 1.4921875, - "grad_norm": 0.005853456910699606, + "grad_norm": 0.0009072935208678246, "learning_rate": 2.5134417202396277e-05, - "loss": 5.001476893085055e-05, + "loss": 2.5600436856620945e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 382, "tokens/total": 11557808, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 174826 }, { "epoch": 1.49609375, - "grad_norm": 0.0031664848793298006, + "grad_norm": 0.0050596860237419605, "learning_rate": 2.491789760603361e-05, - "loss": 4.210277256788686e-05, + "loss": 5.778766353614628e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00006, "step": 383, "tokens/total": 11588352, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 175276 }, { "epoch": 1.5, - "grad_norm": 0.08838633447885513, + "grad_norm": 0.008304890245199203, "learning_rate": 2.4702629848741764e-05, - "loss": 0.0010394920827820897, + "loss": 0.00012505470658652484, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00104, + "ppl": 1.00013, "step": 384, "tokens/total": 11618640, - "tokens/train_per_sec_per_gpu": 33.69, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 175720 }, { "epoch": 1.50390625, - "grad_norm": 0.09446703642606735, + "grad_norm": 0.0035276354756206274, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0005370234721340239, + "loss": 4.851898120250553e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00054, + "ppl": 1.00005, "step": 385, "tokens/total": 11649072, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 176203 }, { "epoch": 1.5078125, - "grad_norm": 0.0013355027185752988, + "grad_norm": 0.001593019813299179, "learning_rate": 2.427588563158384e-05, - "loss": 1.903088195831515e-05, + "loss": 3.330651088617742e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00003, "step": 386, "tokens/total": 11679552, - "tokens/train_per_sec_per_gpu": 34.29, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176651 }, { "epoch": 1.51171875, - "grad_norm": 0.011693151667714119, + "grad_norm": 0.002167076338082552, "learning_rate": 2.406442693028651e-05, - "loss": 7.680666749365628e-05, + "loss": 3.344817378092557e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00008, + "ppl": 1.00003, "step": 387, "tokens/total": 11709760, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 177115 }, { "epoch": 1.515625, - "grad_norm": 0.09523260593414307, + "grad_norm": 0.003447546623647213, "learning_rate": 2.3854255584458547e-05, - "loss": 0.00073521543527022, + "loss": 5.5277254432439804e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00074, + "ppl": 1.00006, "step": 388, "tokens/total": 11740288, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.13, "tokens/trainable": 177601 }, { "epoch": 1.51953125, - "grad_norm": 0.005971741396933794, + "grad_norm": 0.0052979388274252415, "learning_rate": 2.3645380340187508e-05, - "loss": 6.468063656939194e-05, + "loss": 4.56162124464754e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00006, + "ppl": 1.00005, "step": 389, "tokens/total": 11770592, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 178050 }, { "epoch": 1.5234375, - "grad_norm": 0.0010247502941638231, + "grad_norm": 0.003032457083463669, "learning_rate": 2.3437809889624914e-05, - "loss": 1.5989648090908304e-05, + "loss": 3.829343768302351e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00004, "step": 390, "tokens/total": 11800752, - "tokens/train_per_sec_per_gpu": 36.38, + "tokens/train_per_sec_per_gpu": 36.42, "tokens/trainable": 178531 }, { "epoch": 1.52734375, - "grad_norm": 0.054420940577983856, + "grad_norm": 0.03542603179812431, "learning_rate": 2.3231552870624487e-05, - "loss": 0.0004186803416814655, + "loss": 0.0003605492820497602, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00042, + "ppl": 1.00036, "step": 391, "tokens/total": 11831360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 179000 }, { "epoch": 1.53125, - "grad_norm": 0.002925195964053273, + "grad_norm": 0.004965933505445719, "learning_rate": 2.3026617866382657e-05, - "loss": 1.531536145193968e-05, + "loss": 7.091004226822406e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00002, + "ppl": 1.00007, "step": 392, "tokens/total": 11861552, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 179457 }, { "epoch": 1.53515625, - "grad_norm": 1.6402941942214966, + "grad_norm": 0.006339129991829395, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0027035027742385864, + "loss": 9.15761775104329e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00271, + "ppl": 1.00009, "step": 393, "tokens/total": 11891904, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.81, "tokens/trainable": 179890 }, { "epoch": 1.5390625, - "grad_norm": 0.0032207504846155643, + "grad_norm": 0.03921438008546829, "learning_rate": 2.2620747959533722e-05, - "loss": 3.968120290664956e-05, + "loss": 0.00038214243249967694, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00038, "step": 394, "tokens/total": 11922208, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 180341 }, { "epoch": 1.54296875, - "grad_norm": 0.013098486699163914, + "grad_norm": 0.08640608936548233, "learning_rate": 2.2419829946830123e-05, - "loss": 0.00011063168494729325, + "loss": 0.0006777399685233831, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00011, + "ppl": 1.00068, "step": 395, "tokens/total": 11952672, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 180762 }, { "epoch": 1.546875, - "grad_norm": 0.01553372759371996, + "grad_norm": 0.08661718666553497, "learning_rate": 2.2220267727989325e-05, - "loss": 8.802580123301595e-05, + "loss": 0.0007016840972937644, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00009, + "ppl": 1.0007, "step": 396, "tokens/total": 11983088, - "tokens/train_per_sec_per_gpu": 35.04, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 181226 }, { "epoch": 1.55078125, - "grad_norm": 0.016083814203739166, + "grad_norm": 0.010069145821034908, "learning_rate": 2.202206960760984e-05, - "loss": 8.931377669796348e-05, + "loss": 0.00011120665294583887, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00011, "step": 397, "tokens/total": 12013488, - "tokens/train_per_sec_per_gpu": 33.15, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 181714 }, { "epoch": 1.5546875, - "grad_norm": 0.05752059072256088, + "grad_norm": 0.03158818930387497, "learning_rate": 2.182524383352446e-05, - "loss": 0.00015369296306744218, + "loss": 0.00024857826065272093, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00015, + "ppl": 1.00025, "step": 398, "tokens/total": 12043968, - "tokens/train_per_sec_per_gpu": 35.52, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 182142 }, { "epoch": 1.55859375, - "grad_norm": 0.0011741623748093843, + "grad_norm": 0.000873154669534415, "learning_rate": 2.1629798596457056e-05, - "loss": 1.8113165424438193e-05, + "loss": 2.1218824258539826e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, "ppl": 1.00002, "step": 399, "tokens/total": 12074160, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.86, "tokens/trainable": 182604 }, { "epoch": 1.5625, - "grad_norm": 0.0048082731664180756, + "grad_norm": 0.009255572222173214, "learning_rate": 2.1435742029681725e-05, - "loss": 5.3348740038927644e-05, + "loss": 0.0001349164522252977, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.67, "memory/max_allocated (GiB)": 33.67, - "ppl": 1.00005, + "ppl": 1.00013, "step": 400, "tokens/total": 12104352, - "tokens/train_per_sec_per_gpu": 25.28, + "tokens/train_per_sec_per_gpu": 25.31, "tokens/trainable": 183011 }, { "epoch": 1.56640625, - "grad_norm": 0.006520449183881283, + "grad_norm": 0.010521743446588516, "learning_rate": 2.124308220868431e-05, - "loss": 6.45049221930094e-05, + "loss": 7.793466647854075e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00006, + "ppl": 1.00008, "step": 401, "tokens/total": 12134240, - "tokens/train_per_sec_per_gpu": 31.69, + "tokens/train_per_sec_per_gpu": 31.81, "tokens/trainable": 183459 }, { "epoch": 1.5703125, - "grad_norm": 0.006227654870599508, + "grad_norm": 0.0013409090461209416, "learning_rate": 2.105182715082638e-05, - "loss": 6.928759830771014e-05, + "loss": 2.7722922823159024e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00007, + "ppl": 1.00003, "step": 402, "tokens/total": 12164480, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.7, "tokens/trainable": 183959 }, { "epoch": 1.57421875, - "grad_norm": 0.32605040073394775, + "grad_norm": 0.10361713916063309, "learning_rate": 2.0861984815011552e-05, - "loss": 0.002115404698997736, + "loss": 0.0014142843428999186, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00212, + "ppl": 1.00142, "step": 403, "tokens/total": 12194640, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.5, "tokens/trainable": 184431 }, { "epoch": 1.578125, - "grad_norm": 0.007742208894342184, + "grad_norm": 0.0026048943400382996, "learning_rate": 2.0673563101354323e-05, - "loss": 4.600908869178966e-05, + "loss": 4.14503738284111e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00005, + "ppl": 1.00004, "step": 404, "tokens/total": 12224960, - "tokens/train_per_sec_per_gpu": 31.34, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 184867 }, { "epoch": 1.58203125, - "grad_norm": 0.0049946485087275505, + "grad_norm": 0.009411919862031937, "learning_rate": 2.0486569850851317e-05, - "loss": 5.003535625291988e-05, + "loss": 7.322158489841968e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00005, + "ppl": 1.00007, "step": 405, "tokens/total": 12255008, - "tokens/train_per_sec_per_gpu": 29.25, + "tokens/train_per_sec_per_gpu": 29.37, "tokens/trainable": 185300 }, { "epoch": 1.5859375, - "grad_norm": 0.004598768427968025, + "grad_norm": 0.006792420521378517, "learning_rate": 2.0301012845054956e-05, - "loss": 3.4423381293891e-05, + "loss": 7.982828537933528e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00003, + "ppl": 1.00008, "step": 406, "tokens/total": 12285248, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 185754 }, { "epoch": 1.58984375, - "grad_norm": 0.0011464629787951708, + "grad_norm": 0.013020367361605167, "learning_rate": 2.011689980574966e-05, - "loss": 1.9196500943508e-05, + "loss": 3.743396155186929e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00002, + "ppl": 1.00004, "step": 407, "tokens/total": 12315552, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 186213 }, { "epoch": 1.59375, - "grad_norm": 0.004688040353357792, + "grad_norm": 0.0013089004205539823, "learning_rate": 1.993423839463052e-05, - "loss": 5.2492636314127594e-05, + "loss": 2.306591341039166e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00002, "step": 408, "tokens/total": 12345904, - "tokens/train_per_sec_per_gpu": 32.72, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 186659 }, { "epoch": 1.59765625, - "grad_norm": 0.002637861529365182, + "grad_norm": 0.0012270932784304023, "learning_rate": 1.975303621298445e-05, - "loss": 3.172009019181132e-05, + "loss": 2.1350417227949947e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00002, "step": 409, "tokens/total": 12376336, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.97, "tokens/trainable": 187083 }, { "epoch": 1.6015625, - "grad_norm": 0.0072015393525362015, + "grad_norm": 0.011230082251131535, "learning_rate": 1.957330080137385e-05, - "loss": 5.452537880046293e-05, + "loss": 3.752015618374571e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00005, + "ppl": 1.00004, "step": 410, "tokens/total": 12406880, - "tokens/train_per_sec_per_gpu": 34.91, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 187530 }, { "epoch": 1.60546875, - "grad_norm": 0.007169651333242655, + "grad_norm": 0.004872993566095829, "learning_rate": 1.9395039639322864e-05, - "loss": 3.530656249495223e-05, + "loss": 5.5653974413871765e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00006, "step": 411, "tokens/total": 12437088, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 187972 }, { "epoch": 1.609375, - "grad_norm": 0.003889538114890456, + "grad_norm": 0.19391997158527374, "learning_rate": 1.9218260145006073e-05, - "loss": 3.5087461583316326e-05, + "loss": 0.000892186420969665, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00089, "step": 412, "tokens/total": 12465440, - "tokens/train_per_sec_per_gpu": 39.89, + "tokens/train_per_sec_per_gpu": 39.95, "tokens/trainable": 188417 }, { "epoch": 1.61328125, - "grad_norm": 0.5135430693626404, + "grad_norm": 0.09062197804450989, "learning_rate": 1.904296967493982e-05, - "loss": 0.005697700660675764, + "loss": 0.0006304415874183178, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00571, + "ppl": 1.00063, "step": 413, "tokens/total": 12495968, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.57, "tokens/trainable": 188868 }, { "epoch": 1.6171875, - "grad_norm": 0.0010096468031406403, + "grad_norm": 0.009724686853587627, "learning_rate": 1.8869175523676064e-05, - "loss": 1.1318426913931035e-05, + "loss": 6.72380265314132e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00001, + "ppl": 1.00007, "step": 414, "tokens/total": 12526128, - "tokens/train_per_sec_per_gpu": 36.85, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 189337 }, { "epoch": 1.62109375, - "grad_norm": 0.0004970752634108067, + "grad_norm": 0.19542834162712097, "learning_rate": 1.869688492349885e-05, - "loss": 7.355167326750234e-06, + "loss": 0.001907092402689159, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00191, "step": 415, "tokens/total": 12556256, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 189750 }, { "epoch": 1.625, - "grad_norm": 0.0008849130244925618, + "grad_norm": 0.0465276800096035, "learning_rate": 1.85261050441233e-05, - "loss": 1.4194254617905244e-05, + "loss": 0.0005661146715283394, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00057, "step": 416, "tokens/total": 12586736, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 190216 }, { "epoch": 1.62890625, - "grad_norm": 0.0022039280738681555, + "grad_norm": 0.0012954205740243196, "learning_rate": 1.8356842992397304e-05, - "loss": 2.4539594960515387e-05, + "loss": 1.8871982319978997e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, "ppl": 1.00002, "step": 417, "tokens/total": 12617168, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 190708 }, { "epoch": 1.6328125, - "grad_norm": 0.027006179094314575, + "grad_norm": 0.0018749319715425372, "learning_rate": 1.8189105812005714e-05, - "loss": 0.00020442574168555439, + "loss": 3.220669532311149e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.0002, + "ppl": 1.00003, "step": 418, "tokens/total": 12647680, - "tokens/train_per_sec_per_gpu": 30.85, + "tokens/train_per_sec_per_gpu": 30.9, "tokens/trainable": 191126 }, { "epoch": 1.63671875, - "grad_norm": 0.15684254467487335, + "grad_norm": 0.0022480092011392117, "learning_rate": 1.802290048317732e-05, - "loss": 0.0007251293282024562, + "loss": 2.6564141080598347e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00073, + "ppl": 1.00003, "step": 419, "tokens/total": 12677952, - "tokens/train_per_sec_per_gpu": 30.3, + "tokens/train_per_sec_per_gpu": 30.34, "tokens/trainable": 191540 }, { "epoch": 1.640625, - "grad_norm": 0.0033104538451880217, + "grad_norm": 0.1634059101343155, "learning_rate": 1.785823392239424e-05, - "loss": 3.131272751488723e-05, + "loss": 0.0009822181891649961, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00098, "step": 420, "tokens/total": 12708416, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.69, "tokens/trainable": 192014 }, { "epoch": 1.64453125, - "grad_norm": 0.001255685230717063, + "grad_norm": 0.0019404747290536761, "learning_rate": 1.7695112982104225e-05, - "loss": 1.9309976778458804e-05, + "loss": 2.167341335734818e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 421, "tokens/total": 12738640, - "tokens/train_per_sec_per_gpu": 31.28, + "tokens/train_per_sec_per_gpu": 31.31, "tokens/trainable": 192463 }, { "epoch": 1.6484375, - "grad_norm": 0.01599641516804695, + "grad_norm": 0.001059795613400638, "learning_rate": 1.7533544450435433e-05, - "loss": 9.235648030880839e-05, + "loss": 1.6543437595828436e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00009, + "ppl": 1.00002, "step": 422, "tokens/total": 12769232, - "tokens/train_per_sec_per_gpu": 32.71, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 192918 }, { "epoch": 1.65234375, - "grad_norm": 0.048507146537303925, + "grad_norm": 0.01760418340563774, "learning_rate": 1.7373535050913946e-05, - "loss": 0.0002708940301090479, + "loss": 0.0001707405026536435, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00027, + "ppl": 1.00017, "step": 423, "tokens/total": 12799648, - "tokens/train_per_sec_per_gpu": 37.35, + "tokens/train_per_sec_per_gpu": 37.46, "tokens/trainable": 193425 }, { "epoch": 1.65625, - "grad_norm": 0.010107563808560371, + "grad_norm": 0.0023663989268243313, "learning_rate": 1.721509144218405e-05, - "loss": 6.99054216966033e-05, + "loss": 2.332203439436853e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00007, + "ppl": 1.00002, "step": 424, "tokens/total": 12829920, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 193898 }, { "epoch": 1.66015625, - "grad_norm": 0.005467226263135672, + "grad_norm": 0.0245437640696764, "learning_rate": 1.705822021773101e-05, - "loss": 5.417566717369482e-05, + "loss": 0.0001577093207743019, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00005, + "ppl": 1.00016, "step": 425, "tokens/total": 12860112, - "tokens/train_per_sec_per_gpu": 29.24, + "tokens/train_per_sec_per_gpu": 29.29, "tokens/trainable": 194315 }, { "epoch": 1.6640625, - "grad_norm": 0.0015799012035131454, + "grad_norm": 0.0009002169244922698, "learning_rate": 1.69029279056068e-05, - "loss": 2.4984849005704746e-05, + "loss": 1.4283305972639937e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00002, + "ppl": 1.00001, "step": 426, "tokens/total": 12890320, "tokens/train_per_sec_per_gpu": 34.92, @@ -5975,310 +5975,310 @@ }, { "epoch": 1.66796875, - "grad_norm": 0.024157166481018066, + "grad_norm": 0.00033997284481301904, "learning_rate": 1.6749220968158415e-05, - "loss": 0.00010696032404666767, + "loss": 7.185776667029131e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00011, + "ppl": 1.00001, "step": 427, "tokens/total": 12920656, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 195262 }, { "epoch": 1.671875, - "grad_norm": 0.00028090659179724753, + "grad_norm": 0.0005359657225199044, "learning_rate": 1.659710580175893e-05, - "loss": 7.484430170734413e-06, + "loss": 9.948088518285658e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, "ppl": 1.00001, "step": 428, "tokens/total": 12951040, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 195680 }, { "epoch": 1.67578125, - "grad_norm": 0.0011094068177044392, + "grad_norm": 0.0014890795573592186, "learning_rate": 1.644658873654133e-05, - "loss": 1.9920153135899454e-05, + "loss": 2.028812377830036e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, "ppl": 1.00002, "step": 429, "tokens/total": 12981232, - "tokens/train_per_sec_per_gpu": 32.83, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 196145 }, { "epoch": 1.6796875, - "grad_norm": 0.020794112235307693, + "grad_norm": 0.05130980163812637, "learning_rate": 1.629767603613508e-05, - "loss": 0.00010971157462336123, + "loss": 0.0003292672336101532, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00011, + "ppl": 1.00033, "step": 430, "tokens/total": 13011616, - "tokens/train_per_sec_per_gpu": 32.39, + "tokens/train_per_sec_per_gpu": 32.42, "tokens/trainable": 196626 }, { "epoch": 1.68359375, - "grad_norm": 0.44080695509910583, + "grad_norm": 0.0014070137403905392, "learning_rate": 1.615037389740547e-05, - "loss": 0.0026788683608174324, + "loss": 1.0152909453609027e-05, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.00268, + "ppl": 1.00001, "step": 431, "tokens/total": 13042208, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.17, "tokens/trainable": 197067 }, { "epoch": 1.6875, - "grad_norm": 0.0026339287869632244, + "grad_norm": 0.004116157069802284, "learning_rate": 1.600468845019576e-05, - "loss": 2.082335777231492e-05, + "loss": 3.514952550176531e-05, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00004, "step": 432, "tokens/total": 13072800, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.68, "tokens/trainable": 197565 }, { "epoch": 1.69140625, - "grad_norm": 0.004508621525019407, + "grad_norm": 0.01147819496691227, "learning_rate": 1.5860625757072092e-05, - "loss": 1.439991501683835e-05, + "loss": 7.313965761568397e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00007, "step": 433, "tokens/total": 13103328, - "tokens/train_per_sec_per_gpu": 32.88, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 198015 }, { "epoch": 1.6953125, - "grad_norm": 0.014811511151492596, + "grad_norm": 0.030784178525209427, "learning_rate": 1.571819181307116e-05, - "loss": 0.00015316363715101033, + "loss": 0.0002448821614962071, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00024, "step": 434, "tokens/total": 13133472, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 198442 }, { "epoch": 1.69921875, - "grad_norm": 0.0037793368101119995, + "grad_norm": 0.0022457120940089226, "learning_rate": 1.557739254545075e-05, - "loss": 1.4444960470427759e-05, + "loss": 1.4446297427639365e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 435, "tokens/total": 13164064, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 198914 }, { "epoch": 1.703125, - "grad_norm": 0.24972176551818848, + "grad_norm": 0.0029742212500423193, "learning_rate": 1.543823381344311e-05, - "loss": 0.0017114672809839249, + "loss": 2.7415488148108125e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00171, + "ppl": 1.00003, "step": 436, "tokens/total": 13194464, - "tokens/train_per_sec_per_gpu": 33.35, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 199355 }, { "epoch": 1.70703125, - "grad_norm": 0.002479988383129239, + "grad_norm": 0.002260624896734953, "learning_rate": 1.5300721408011114e-05, - "loss": 2.9400333005469292e-05, + "loss": 2.7733602109947242e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00003, "step": 437, "tokens/total": 13224992, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 199830 }, { "epoch": 1.7109375, - "grad_norm": 0.0014780610799789429, + "grad_norm": 0.01198511105030775, "learning_rate": 1.5164861051607254e-05, - "loss": 1.5593774151057005e-05, + "loss": 9.154126746580005e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00009, "step": 438, "tokens/total": 13255296, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.97, "tokens/trainable": 200338 }, { "epoch": 1.71484375, - "grad_norm": 0.0010410621762275696, + "grad_norm": 0.003149093361571431, "learning_rate": 1.5030658397935521e-05, - "loss": 1.4683226254419424e-05, + "loss": 3.515004937071353e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00004, "step": 439, "tokens/total": 13285344, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 200785 }, { "epoch": 1.71875, - "grad_norm": 0.0004247442411724478, + "grad_norm": 0.0003243185637984425, "learning_rate": 1.4898119031716104e-05, - "loss": 8.09474295238033e-06, + "loss": 7.168858701334102e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, "ppl": 1.00001, "step": 440, "tokens/total": 13315632, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.32, "tokens/trainable": 201267 }, { "epoch": 1.72265625, - "grad_norm": 0.0026301892939954996, + "grad_norm": 0.12771126627922058, "learning_rate": 1.476724846845306e-05, - "loss": 1.7428235878469422e-05, + "loss": 0.0007142049144022167, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 441, "tokens/total": 13346048, - "tokens/train_per_sec_per_gpu": 34.16, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 201734 }, { "epoch": 1.7265625, - "grad_norm": 0.0005576284602284431, + "grad_norm": 0.11483822762966156, "learning_rate": 1.463805215420471e-05, - "loss": 8.656044883537106e-06, + "loss": 0.0006703532999381423, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00001, + "ppl": 1.00067, "step": 442, "tokens/total": 13376304, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.4, "tokens/trainable": 202174 }, { "epoch": 1.73046875, - "grad_norm": 0.0009604030638001859, + "grad_norm": 0.00032006221590563655, "learning_rate": 1.451053546535705e-05, - "loss": 1.4092523088038433e-05, + "loss": 9.367744496557862e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00001, "step": 443, "tokens/total": 13406720, - "tokens/train_per_sec_per_gpu": 36.13, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 202612 }, { "epoch": 1.734375, - "grad_norm": 0.00019884438370354474, + "grad_norm": 0.0002659875026438385, "learning_rate": 1.438470370840001e-05, - "loss": 4.5837323341402225e-06, + "loss": 5.530210728466045e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0, + "ppl": 1.00001, "step": 444, "tokens/total": 13436464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 30.99, "tokens/trainable": 203020 }, { "epoch": 1.73828125, - "grad_norm": 0.05944995582103729, + "grad_norm": 0.04957196116447449, "learning_rate": 1.4260562119706606e-05, - "loss": 0.0002780454815365374, + "loss": 6.46735934424214e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00028, + "ppl": 1.00006, "step": 445, "tokens/total": 13466672, - "tokens/train_per_sec_per_gpu": 34.31, + "tokens/train_per_sec_per_gpu": 34.37, "tokens/trainable": 203479 }, { "epoch": 1.7421875, - "grad_norm": 0.005872223526239395, + "grad_norm": 0.0016840791795402765, "learning_rate": 1.413811586531508e-05, - "loss": 3.424299575272016e-05, + "loss": 1.2613029866770376e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00003, + "ppl": 1.00001, "step": 446, "tokens/total": 13496736, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 203946 }, { "epoch": 1.74609375, - "grad_norm": 0.006013527978211641, + "grad_norm": 0.00042921333806589246, "learning_rate": 1.4017370040713884e-05, - "loss": 3.269856097176671e-05, + "loss": 7.416386324621271e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.00001, "step": 447, "tokens/total": 13526928, - "tokens/train_per_sec_per_gpu": 37.43, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 204382 }, { "epoch": 1.75, - "grad_norm": 0.05103042349219322, + "grad_norm": 0.2165915071964264, "learning_rate": 1.3898329670629645e-05, - "loss": 0.00032247230410575867, + "loss": 0.0006914341356605291, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00032, + "ppl": 1.00069, "step": 448, "tokens/total": 13557392, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 204830 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_model.safetensors index de60e36a99a3d5cb1d40ff7d5e0ce709814f78f0..01a41eb4726b93cb944ba253b2edcb1da89e5a3f 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:18a3e18c300c81fbd4fc5c615a02833db8462889fa56d74f8a21de4cdbd94b01 +oid sha256:5f9554509b9b3fde8b26650090aefc34c1e60f093cb129b6fdb78abfc58218c0 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/optimizer.pt index 3b9a59abcd6aed6224b3c8530592dffd02572d61..8cc5ca06565a538dfbad03dd129d5677e0c95276 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:7fd6972487952b9b8cdba2186819f986803ccb69b1549585ef4e31ee392a485c +oid sha256:d12a17b1f902b4886935dd59e4bb62b80c89b4ab2cfdc83d22bbb6372b66215a size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/trainer_state.json index 2f25521cae184702f5b329a0703bc5c475711a24..1f0b367fc754f516a8b92dc62862aab782882914 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-480/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,1525 +3735,1525 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 }, { "epoch": 1.25390625, - "grad_norm": 0.0067353262566030025, + "grad_norm": 0.01599739119410515, "learning_rate": 4.0323513089607876e-05, - "loss": 6.0428461438277736e-05, + "loss": 6.388167093973607e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00006, "step": 321, "tokens/total": 9708848, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 147114 }, { "epoch": 1.2578125, - "grad_norm": 0.05487794429063797, + "grad_norm": 0.0042083412408828735, "learning_rate": 4.004940255778431e-05, - "loss": 0.0002498509711585939, + "loss": 2.1792850020574406e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00025, + "ppl": 1.00002, "step": 322, "tokens/total": 9739360, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 147564 }, { "epoch": 1.26171875, - "grad_norm": 0.0011818762868642807, + "grad_norm": 0.009429940953850746, "learning_rate": 3.977591418134619e-05, - "loss": 1.1004886800947133e-05, + "loss": 3.834946619463153e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00004, "step": 323, "tokens/total": 9769776, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.24, "tokens/trainable": 148013 }, { "epoch": 1.265625, - "grad_norm": 0.018019674345850945, + "grad_norm": 0.05088210478425026, "learning_rate": 3.95030593412612e-05, - "loss": 0.00021162032498978078, + "loss": 0.00018766832363326102, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00021, + "ppl": 1.00019, "step": 324, "tokens/total": 9800096, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.06, "tokens/trainable": 148470 }, { "epoch": 1.26953125, - "grad_norm": 1.5907806158065796, + "grad_norm": 0.9416317939758301, "learning_rate": 3.923084939213296e-05, - "loss": 0.016217660158872604, + "loss": 0.01083211787045002, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01635, + "ppl": 1.01089, "step": 325, "tokens/total": 9830304, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 148926 }, { "epoch": 1.2734375, - "grad_norm": 0.004153774119913578, + "grad_norm": 0.00033186975633725524, "learning_rate": 3.895929566172861e-05, - "loss": 3.801286584348418e-05, + "loss": 8.612486453785095e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 326, "tokens/total": 9860608, - "tokens/train_per_sec_per_gpu": 37.72, + "tokens/train_per_sec_per_gpu": 37.82, "tokens/trainable": 149420 }, { "epoch": 1.27734375, - "grad_norm": 0.0029778245370835066, + "grad_norm": 0.0005477021913975477, "learning_rate": 3.868840945050728e-05, - "loss": 5.526735549210571e-05, + "loss": 1.5825649825274013e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00006, + "ppl": 1.00002, "step": 327, "tokens/total": 9890560, - "tokens/train_per_sec_per_gpu": 39.32, + "tokens/train_per_sec_per_gpu": 39.41, "tokens/trainable": 149873 }, { "epoch": 1.28125, - "grad_norm": 0.028163742274045944, + "grad_norm": 0.0008259841124527156, "learning_rate": 3.841820203114995e-05, - "loss": 0.00039056455716490746, + "loss": 1.642670395085588e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00039, + "ppl": 1.00002, "step": 328, "tokens/total": 9920880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 150347 }, { "epoch": 1.28515625, - "grad_norm": 0.04141407459974289, + "grad_norm": 0.0011461537797003984, "learning_rate": 3.814868464809027e-05, - "loss": 0.0005860928213223815, + "loss": 1.7516158550279215e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00059, + "ppl": 1.00002, "step": 329, "tokens/total": 9951280, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 150822 }, { "epoch": 1.2890625, - "grad_norm": 0.004758972208946943, + "grad_norm": 0.0022519829217344522, "learning_rate": 3.787986851704667e-05, - "loss": 9.08115180209279e-05, + "loss": 2.000835411308799e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00009, + "ppl": 1.00002, "step": 330, "tokens/total": 9981600, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 151266 }, { "epoch": 1.29296875, - "grad_norm": 0.04043704643845558, + "grad_norm": 0.08718931674957275, "learning_rate": 3.7611764824555654e-05, - "loss": 0.0005757657927460968, + "loss": 0.0003773289208766073, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00058, + "ppl": 1.00038, "step": 331, "tokens/total": 10012016, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.15, "tokens/trainable": 151734 }, { "epoch": 1.296875, - "grad_norm": 0.064565509557724, + "grad_norm": 0.000883373199030757, "learning_rate": 3.734438472750619e-05, - "loss": 0.00043528492096811533, + "loss": 1.1746728887374047e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00044, + "ppl": 1.00001, "step": 332, "tokens/total": 10042448, - "tokens/train_per_sec_per_gpu": 33.99, + "tokens/train_per_sec_per_gpu": 34.01, "tokens/trainable": 152184 }, { "epoch": 1.30078125, - "grad_norm": 0.051213983446359634, + "grad_norm": 0.011426394805312157, "learning_rate": 3.707773935267552e-05, - "loss": 0.000528274686075747, + "loss": 5.219353988650255e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00053, + "ppl": 1.00005, "step": 333, "tokens/total": 10073024, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.85, "tokens/trainable": 152623 }, { "epoch": 1.3046875, - "grad_norm": 0.0067980666644871235, + "grad_norm": 0.5781233310699463, "learning_rate": 3.68118397962661e-05, - "loss": 0.00013989521539770067, + "loss": 0.0034865224733948708, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00014, + "ppl": 1.00349, "step": 334, "tokens/total": 10103504, - "tokens/train_per_sec_per_gpu": 33.34, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 153040 }, { "epoch": 1.30859375, - "grad_norm": 0.28768453001976013, + "grad_norm": 0.7213758230209351, "learning_rate": 3.654669712344384e-05, - "loss": 0.0035491236485540867, + "loss": 0.004715530201792717, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00356, + "ppl": 1.00473, "step": 335, "tokens/total": 10131632, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.78, "tokens/trainable": 153463 }, { "epoch": 1.3125, - "grad_norm": 0.04292941838502884, + "grad_norm": 0.03131686523556709, "learning_rate": 3.628232236787763e-05, - "loss": 0.0007545957923866808, + "loss": 0.0002346257824683562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00075, + "ppl": 1.00023, "step": 336, "tokens/total": 10161824, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 153908 }, { "epoch": 1.31640625, - "grad_norm": 0.13187745213508606, + "grad_norm": 0.03332929685711861, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0011231126263737679, + "loss": 0.00011981122952420264, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00112, + "ppl": 1.00012, "step": 337, "tokens/total": 10192448, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 154387 }, { "epoch": 1.3203125, - "grad_norm": 0.06429488956928253, + "grad_norm": 0.0045038131065666676, "learning_rate": 3.575592058295017e-05, - "loss": 0.0004924655659124255, + "loss": 3.5494955227477476e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00049, + "ppl": 1.00004, "step": 338, "tokens/total": 10222704, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 154836 }, { "epoch": 1.32421875, - "grad_norm": 0.006816778797656298, + "grad_norm": 0.0012434936361387372, "learning_rate": 3.549391545931585e-05, - "loss": 8.63251625560224e-05, + "loss": 1.7894679331220686e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00009, + "ppl": 1.00002, "step": 339, "tokens/total": 10253168, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.81, "tokens/trainable": 155261 }, { "epoch": 1.328125, - "grad_norm": 0.04606792330741882, + "grad_norm": 0.3250766098499298, "learning_rate": 3.5232722063479914e-05, - "loss": 0.0003515402786433697, + "loss": 0.00279021542519331, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00035, + "ppl": 1.00279, "step": 340, "tokens/total": 10283552, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.24, "tokens/trainable": 155674 }, { "epoch": 1.33203125, - "grad_norm": 0.24907881021499634, + "grad_norm": 0.036490436643362045, "learning_rate": 3.49723512647657e-05, - "loss": 0.000742567703127861, + "loss": 0.00013251493510324508, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00074, + "ppl": 1.00013, "step": 341, "tokens/total": 10313872, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 156164 }, { "epoch": 1.3359375, - "grad_norm": 0.011238012462854385, + "grad_norm": 0.2706057131290436, "learning_rate": 3.471281389826491e-05, - "loss": 0.0001773187832441181, + "loss": 0.0021429890766739845, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00018, + "ppl": 1.00215, "step": 342, "tokens/total": 10344256, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 156611 }, { "epoch": 1.33984375, - "grad_norm": 0.00949561782181263, + "grad_norm": 0.01915346086025238, "learning_rate": 3.4454120764386764e-05, - "loss": 0.00018969883967656642, + "loss": 0.00013777356070932, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00019, + "ppl": 1.00014, "step": 343, "tokens/total": 10374544, - "tokens/train_per_sec_per_gpu": 33.58, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 157073 }, { "epoch": 1.34375, - "grad_norm": 0.10763411223888397, + "grad_norm": 0.02540464885532856, "learning_rate": 3.4196282628408526e-05, - "loss": 0.0007583287660963833, + "loss": 5.135099490871653e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00005, "step": 344, "tokens/total": 10405040, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 157523 }, { "epoch": 1.34765625, - "grad_norm": 0.15938052535057068, + "grad_norm": 0.39257746934890747, "learning_rate": 3.3939310220027456e-05, - "loss": 0.0014999746344983578, + "loss": 0.009803109802305698, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0015, + "ppl": 1.00985, "step": 345, "tokens/total": 10435424, - "tokens/train_per_sec_per_gpu": 35.07, + "tokens/train_per_sec_per_gpu": 35.16, "tokens/trainable": 157964 }, { "epoch": 1.3515625, - "grad_norm": 0.00165572261903435, + "grad_norm": 0.0029070202726870775, "learning_rate": 3.3683214232914404e-05, - "loss": 3.833783557638526e-05, + "loss": 2.9972559786983766e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00004, + "ppl": 1.00003, "step": 346, "tokens/total": 10465760, - "tokens/train_per_sec_per_gpu": 30.35, + "tokens/train_per_sec_per_gpu": 30.44, "tokens/trainable": 158390 }, { "epoch": 1.35546875, - "grad_norm": 0.02406073547899723, + "grad_norm": 0.020276719704270363, "learning_rate": 3.342800532426873e-05, - "loss": 0.00039186165668070316, + "loss": 7.613154593855143e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00039, + "ppl": 1.00008, "step": 347, "tokens/total": 10495904, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 158848 }, { "epoch": 1.359375, - "grad_norm": 0.045792482793331146, + "grad_norm": 0.14866818487644196, "learning_rate": 3.317369411437484e-05, - "loss": 0.0006161610363051295, + "loss": 0.0011244683992117643, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00062, + "ppl": 1.00113, "step": 348, "tokens/total": 10526624, - "tokens/train_per_sec_per_gpu": 28.63, + "tokens/train_per_sec_per_gpu": 28.71, "tokens/trainable": 159270 }, { "epoch": 1.36328125, - "grad_norm": 0.18648307025432587, + "grad_norm": 0.015379665419459343, "learning_rate": 3.292029118616024e-05, - "loss": 0.0012868957128375769, + "loss": 7.920589268906042e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00129, + "ppl": 1.00008, "step": 349, "tokens/total": 10556752, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.51, "tokens/trainable": 159720 }, { "epoch": 1.3671875, - "grad_norm": 0.015933886170387268, + "grad_norm": 0.0023695260751992464, "learning_rate": 3.266780708475511e-05, - "loss": 0.0002091687492793426, + "loss": 1.4566459867637604e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00021, + "ppl": 1.00001, "step": 350, "tokens/total": 10587264, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.14, "tokens/trainable": 160187 }, { "epoch": 1.37109375, - "grad_norm": 0.008724886924028397, + "grad_norm": 0.00954374298453331, "learning_rate": 3.241625231705354e-05, - "loss": 0.00013179841334931552, + "loss": 6.530048267450184e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00007, "step": 351, "tokens/total": 10617504, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 160645 }, { "epoch": 1.375, - "grad_norm": 0.06377559900283813, + "grad_norm": 0.6504904627799988, "learning_rate": 3.216563735127618e-05, - "loss": 0.0008062056731432676, + "loss": 0.01059151440858841, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00081, + "ppl": 1.01065, "step": 352, "tokens/total": 10647760, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.49, "tokens/trainable": 161102 }, { "epoch": 1.37890625, - "grad_norm": 0.0037202269304543734, + "grad_norm": 0.024732626974582672, "learning_rate": 3.191597261653475e-05, - "loss": 7.238816760946065e-05, + "loss": 0.0001429672265658155, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00007, + "ppl": 1.00014, "step": 353, "tokens/total": 10678080, - "tokens/train_per_sec_per_gpu": 28.86, + "tokens/train_per_sec_per_gpu": 28.93, "tokens/trainable": 161555 }, { "epoch": 1.3828125, - "grad_norm": 0.0021510994993150234, + "grad_norm": 0.037309419363737106, "learning_rate": 3.166726850239794e-05, - "loss": 3.6805788113269955e-05, + "loss": 7.214388460852206e-05, "memory/device_reserved (GiB)": 35.41, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00004, + "ppl": 1.00007, "step": 354, "tokens/total": 10708544, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.75, "tokens/trainable": 162020 }, { "epoch": 1.38671875, - "grad_norm": 0.002642499515786767, + "grad_norm": 0.00885045062750578, "learning_rate": 3.141953535845912e-05, - "loss": 4.371708200778812e-05, + "loss": 0.00011830432777060196, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00012, "step": 355, "tokens/total": 10739024, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 162448 }, { "epoch": 1.390625, - "grad_norm": 0.0038646068423986435, + "grad_norm": 0.06791900098323822, "learning_rate": 3.11727834939056e-05, - "loss": 7.11614266037941e-05, + "loss": 0.0003609730047173798, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.61, "memory/max_allocated (GiB)": 33.61, - "ppl": 1.00007, + "ppl": 1.00036, "step": 356, "tokens/total": 10769024, - "tokens/train_per_sec_per_gpu": 28.2, + "tokens/train_per_sec_per_gpu": 28.26, "tokens/trainable": 162863 }, { "epoch": 1.39453125, - "grad_norm": 0.017895536497235298, + "grad_norm": 0.0019508687546476722, "learning_rate": 3.092702317708967e-05, - "loss": 5.4065520089352503e-05, + "loss": 3.1739040423417464e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00005, + "ppl": 1.00003, "step": 357, "tokens/total": 10799328, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 163318 }, { "epoch": 1.3984375, - "grad_norm": 0.8479411602020264, + "grad_norm": 0.7139555811882019, "learning_rate": 3.0682264635101276e-05, - "loss": 0.01497839204967022, + "loss": 0.010268578305840492, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01509, + "ppl": 1.01032, "step": 358, "tokens/total": 10829488, - "tokens/train_per_sec_per_gpu": 32.89, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 163767 }, { "epoch": 1.40234375, - "grad_norm": 0.0015704578254371881, + "grad_norm": 0.006852464284747839, "learning_rate": 3.0438518053342407e-05, - "loss": 3.0390210667974316e-05, + "loss": 4.873241778113879e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00005, "step": 359, "tokens/total": 10859936, - "tokens/train_per_sec_per_gpu": 31.78, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 164208 }, { "epoch": 1.40625, - "grad_norm": 0.014669318683445454, + "grad_norm": 0.0018247900297865272, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010030368866864592, + "loss": 3.88835760531947e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00004, "step": 360, "tokens/total": 10890400, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 164655 }, { "epoch": 1.41015625, - "grad_norm": 0.3479421138763428, + "grad_norm": 0.0436873696744442, "learning_rate": 2.9954101301140146e-05, - "loss": 0.0026096655055880547, + "loss": 0.0003687943681143224, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00261, + "ppl": 1.00037, "step": 361, "tokens/total": 10920624, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 165100 }, { "epoch": 1.4140625, - "grad_norm": 0.004394443240016699, + "grad_norm": 0.26735150814056396, "learning_rate": 2.9713451289255123e-05, - "loss": 6.116658914834261e-05, + "loss": 0.00039605735219083726, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00006, + "ppl": 1.0004, "step": 362, "tokens/total": 10951136, - "tokens/train_per_sec_per_gpu": 34.84, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 165587 }, { "epoch": 1.41796875, - "grad_norm": 0.016197621822357178, + "grad_norm": 0.0964483991265297, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0001775357231963426, + "loss": 0.0007330900407396257, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00018, + "ppl": 1.00073, "step": 363, "tokens/total": 10981344, - "tokens/train_per_sec_per_gpu": 34.09, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 166034 }, { "epoch": 1.421875, - "grad_norm": 0.09478334337472916, + "grad_norm": 0.05367618799209595, "learning_rate": 2.9235318065647e-05, - "loss": 0.0005033796769566834, + "loss": 0.0005384897813200951, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0005, + "ppl": 1.00054, "step": 364, "tokens/total": 11011552, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 166485 }, { "epoch": 1.42578125, - "grad_norm": 0.014899010770022869, + "grad_norm": 0.10067912936210632, "learning_rate": 2.8997854750998964e-05, - "loss": 0.0001904651871882379, + "loss": 0.0006868956843391061, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00019, + "ppl": 1.00069, "step": 365, "tokens/total": 11041872, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 166973 }, { "epoch": 1.4296875, - "grad_norm": 0.005555527750402689, + "grad_norm": 0.02697882056236267, "learning_rate": 2.8761473491751258e-05, - "loss": 0.00010058133921120316, + "loss": 0.0002464794088155031, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00025, "step": 366, "tokens/total": 11072192, - "tokens/train_per_sec_per_gpu": 29.1, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 167414 }, { "epoch": 1.43359375, - "grad_norm": 0.20706292986869812, + "grad_norm": 0.0026214183308184147, "learning_rate": 2.8526184124692883e-05, - "loss": 0.0005888720043003559, + "loss": 5.2629769925260916e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00059, + "ppl": 1.00005, "step": 367, "tokens/total": 11102736, - "tokens/train_per_sec_per_gpu": 30.11, + "tokens/train_per_sec_per_gpu": 30.23, "tokens/trainable": 167851 }, { "epoch": 1.4375, - "grad_norm": 0.0007191727054305375, + "grad_norm": 0.0018140808679163456, "learning_rate": 2.829199644117484e-05, - "loss": 1.2304372830840293e-05, + "loss": 2.9512597393477336e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 368, "tokens/total": 11133056, - "tokens/train_per_sec_per_gpu": 35.48, + "tokens/train_per_sec_per_gpu": 35.56, "tokens/trainable": 168294 }, { "epoch": 1.44140625, - "grad_norm": 0.030878128483891487, + "grad_norm": 0.012045321986079216, "learning_rate": 2.8058920186702553e-05, - "loss": 0.0002043281274382025, + "loss": 7.606908184243366e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0002, + "ppl": 1.00008, "step": 369, "tokens/total": 11163568, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 168769 }, { "epoch": 1.4453125, - "grad_norm": 0.008817057125270367, + "grad_norm": 0.013453424908220768, "learning_rate": 2.782696506053033e-05, - "loss": 0.00011464582348708063, + "loss": 0.00015325279673561454, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00015, "step": 370, "tokens/total": 11193936, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.83, "tokens/trainable": 169270 }, { "epoch": 1.44921875, - "grad_norm": 0.023856336250901222, + "grad_norm": 0.003458227962255478, "learning_rate": 2.7596140715257824e-05, - "loss": 0.00013431125262286514, + "loss": 5.63332432648167e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00013, + "ppl": 1.00006, "step": 371, "tokens/total": 11224480, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 169711 }, { "epoch": 1.453125, - "grad_norm": 0.010502993129193783, + "grad_norm": 0.0063622924499213696, "learning_rate": 2.7366456756428184e-05, - "loss": 0.00015104333579074591, + "loss": 9.534892160445452e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00015, + "ppl": 1.0001, "step": 372, "tokens/total": 11254912, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 170185 }, { "epoch": 1.45703125, - "grad_norm": 0.026970423758029938, + "grad_norm": 0.04558980092406273, "learning_rate": 2.7137922742128486e-05, - "loss": 0.00026081278338097036, + "loss": 0.000613630109000951, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00026, + "ppl": 1.00061, "step": 373, "tokens/total": 11285104, - "tokens/train_per_sec_per_gpu": 33.08, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 170650 }, { "epoch": 1.4609375, - "grad_norm": 0.020325109362602234, + "grad_norm": 0.014873786829411983, "learning_rate": 2.691054818259188e-05, - "loss": 0.00014532633940689266, + "loss": 0.0002038514503510669, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00015, + "ppl": 1.0002, "step": 374, "tokens/total": 11315600, - "tokens/train_per_sec_per_gpu": 31.98, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 171126 }, { "epoch": 1.46484375, - "grad_norm": 0.033260464668273926, + "grad_norm": 0.058739252388477325, "learning_rate": 2.6684342539801933e-05, - "loss": 0.00045571548980660737, + "loss": 0.0010346119524911046, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00046, + "ppl": 1.00104, "step": 375, "tokens/total": 11345776, "tokens/train_per_sec_per_gpu": 35.6, @@ -5261,713 +5261,713 @@ }, { "epoch": 1.46875, - "grad_norm": 0.017290709540247917, + "grad_norm": 0.24105991423130035, "learning_rate": 2.645931522709877e-05, - "loss": 0.00014910403115209192, + "loss": 0.0035716122947633266, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00015, + "ppl": 1.00358, "step": 376, "tokens/total": 11376208, - "tokens/train_per_sec_per_gpu": 28.09, + "tokens/train_per_sec_per_gpu": 28.14, "tokens/trainable": 172017 }, { "epoch": 1.47265625, - "grad_norm": 0.04457363486289978, + "grad_norm": 0.08793950080871582, "learning_rate": 2.6235475608787365e-05, - "loss": 6.834026135038584e-05, + "loss": 0.0007833336712792516, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00007, + "ppl": 1.00078, "step": 377, "tokens/total": 11406512, - "tokens/train_per_sec_per_gpu": 35.99, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 172493 }, { "epoch": 1.4765625, - "grad_norm": 0.002268735785037279, + "grad_norm": 0.009154544211924076, "learning_rate": 2.6012832999747916e-05, - "loss": 3.245133120799437e-05, + "loss": 0.00011752049613278359, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00012, "step": 378, "tokens/total": 11436544, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 172951 }, { "epoch": 1.48046875, - "grad_norm": 0.0038171466439962387, + "grad_norm": 0.012918495573103428, "learning_rate": 2.579139666504821e-05, - "loss": 5.4866883147042245e-05, + "loss": 0.00011567945330170915, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00012, "step": 379, "tokens/total": 11467008, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 173435 }, { "epoch": 1.484375, - "grad_norm": 0.005268535576760769, + "grad_norm": 0.008966504596173763, "learning_rate": 2.557117581955798e-05, - "loss": 8.241234172601253e-05, + "loss": 8.938623068388551e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00009, "step": 380, "tokens/total": 11497184, - "tokens/train_per_sec_per_gpu": 30.4, + "tokens/train_per_sec_per_gpu": 30.47, "tokens/trainable": 173900 }, { "epoch": 1.48828125, - "grad_norm": 0.016057243570685387, + "grad_norm": 0.03181751072406769, "learning_rate": 2.5352179627565532e-05, - "loss": 0.00014235377602744848, + "loss": 0.00013083787052892148, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00014, + "ppl": 1.00013, "step": 381, "tokens/total": 11527600, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 174371 }, { "epoch": 1.4921875, - "grad_norm": 0.005853456910699606, + "grad_norm": 0.0009072935208678246, "learning_rate": 2.5134417202396277e-05, - "loss": 5.001476893085055e-05, + "loss": 2.5600436856620945e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 382, "tokens/total": 11557808, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 174826 }, { "epoch": 1.49609375, - "grad_norm": 0.0031664848793298006, + "grad_norm": 0.0050596860237419605, "learning_rate": 2.491789760603361e-05, - "loss": 4.210277256788686e-05, + "loss": 5.778766353614628e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00006, "step": 383, "tokens/total": 11588352, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 175276 }, { "epoch": 1.5, - "grad_norm": 0.08838633447885513, + "grad_norm": 0.008304890245199203, "learning_rate": 2.4702629848741764e-05, - "loss": 0.0010394920827820897, + "loss": 0.00012505470658652484, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00104, + "ppl": 1.00013, "step": 384, "tokens/total": 11618640, - "tokens/train_per_sec_per_gpu": 33.69, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 175720 }, { "epoch": 1.50390625, - "grad_norm": 0.09446703642606735, + "grad_norm": 0.0035276354756206274, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0005370234721340239, + "loss": 4.851898120250553e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00054, + "ppl": 1.00005, "step": 385, "tokens/total": 11649072, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 176203 }, { "epoch": 1.5078125, - "grad_norm": 0.0013355027185752988, + "grad_norm": 0.001593019813299179, "learning_rate": 2.427588563158384e-05, - "loss": 1.903088195831515e-05, + "loss": 3.330651088617742e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00003, "step": 386, "tokens/total": 11679552, - "tokens/train_per_sec_per_gpu": 34.29, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176651 }, { "epoch": 1.51171875, - "grad_norm": 0.011693151667714119, + "grad_norm": 0.002167076338082552, "learning_rate": 2.406442693028651e-05, - "loss": 7.680666749365628e-05, + "loss": 3.344817378092557e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00008, + "ppl": 1.00003, "step": 387, "tokens/total": 11709760, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 177115 }, { "epoch": 1.515625, - "grad_norm": 0.09523260593414307, + "grad_norm": 0.003447546623647213, "learning_rate": 2.3854255584458547e-05, - "loss": 0.00073521543527022, + "loss": 5.5277254432439804e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00074, + "ppl": 1.00006, "step": 388, "tokens/total": 11740288, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.13, "tokens/trainable": 177601 }, { "epoch": 1.51953125, - "grad_norm": 0.005971741396933794, + "grad_norm": 0.0052979388274252415, "learning_rate": 2.3645380340187508e-05, - "loss": 6.468063656939194e-05, + "loss": 4.56162124464754e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00006, + "ppl": 1.00005, "step": 389, "tokens/total": 11770592, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 178050 }, { "epoch": 1.5234375, - "grad_norm": 0.0010247502941638231, + "grad_norm": 0.003032457083463669, "learning_rate": 2.3437809889624914e-05, - "loss": 1.5989648090908304e-05, + "loss": 3.829343768302351e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00004, "step": 390, "tokens/total": 11800752, - "tokens/train_per_sec_per_gpu": 36.38, + "tokens/train_per_sec_per_gpu": 36.42, "tokens/trainable": 178531 }, { "epoch": 1.52734375, - "grad_norm": 0.054420940577983856, + "grad_norm": 0.03542603179812431, "learning_rate": 2.3231552870624487e-05, - "loss": 0.0004186803416814655, + "loss": 0.0003605492820497602, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00042, + "ppl": 1.00036, "step": 391, "tokens/total": 11831360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 179000 }, { "epoch": 1.53125, - "grad_norm": 0.002925195964053273, + "grad_norm": 0.004965933505445719, "learning_rate": 2.3026617866382657e-05, - "loss": 1.531536145193968e-05, + "loss": 7.091004226822406e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00002, + "ppl": 1.00007, "step": 392, "tokens/total": 11861552, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 179457 }, { "epoch": 1.53515625, - "grad_norm": 1.6402941942214966, + "grad_norm": 0.006339129991829395, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0027035027742385864, + "loss": 9.15761775104329e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00271, + "ppl": 1.00009, "step": 393, "tokens/total": 11891904, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.81, "tokens/trainable": 179890 }, { "epoch": 1.5390625, - "grad_norm": 0.0032207504846155643, + "grad_norm": 0.03921438008546829, "learning_rate": 2.2620747959533722e-05, - "loss": 3.968120290664956e-05, + "loss": 0.00038214243249967694, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00038, "step": 394, "tokens/total": 11922208, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 180341 }, { "epoch": 1.54296875, - "grad_norm": 0.013098486699163914, + "grad_norm": 0.08640608936548233, "learning_rate": 2.2419829946830123e-05, - "loss": 0.00011063168494729325, + "loss": 0.0006777399685233831, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00011, + "ppl": 1.00068, "step": 395, "tokens/total": 11952672, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 180762 }, { "epoch": 1.546875, - "grad_norm": 0.01553372759371996, + "grad_norm": 0.08661718666553497, "learning_rate": 2.2220267727989325e-05, - "loss": 8.802580123301595e-05, + "loss": 0.0007016840972937644, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00009, + "ppl": 1.0007, "step": 396, "tokens/total": 11983088, - "tokens/train_per_sec_per_gpu": 35.04, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 181226 }, { "epoch": 1.55078125, - "grad_norm": 0.016083814203739166, + "grad_norm": 0.010069145821034908, "learning_rate": 2.202206960760984e-05, - "loss": 8.931377669796348e-05, + "loss": 0.00011120665294583887, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00011, "step": 397, "tokens/total": 12013488, - "tokens/train_per_sec_per_gpu": 33.15, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 181714 }, { "epoch": 1.5546875, - "grad_norm": 0.05752059072256088, + "grad_norm": 0.03158818930387497, "learning_rate": 2.182524383352446e-05, - "loss": 0.00015369296306744218, + "loss": 0.00024857826065272093, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00015, + "ppl": 1.00025, "step": 398, "tokens/total": 12043968, - "tokens/train_per_sec_per_gpu": 35.52, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 182142 }, { "epoch": 1.55859375, - "grad_norm": 0.0011741623748093843, + "grad_norm": 0.000873154669534415, "learning_rate": 2.1629798596457056e-05, - "loss": 1.8113165424438193e-05, + "loss": 2.1218824258539826e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, "ppl": 1.00002, "step": 399, "tokens/total": 12074160, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.86, "tokens/trainable": 182604 }, { "epoch": 1.5625, - "grad_norm": 0.0048082731664180756, + "grad_norm": 0.009255572222173214, "learning_rate": 2.1435742029681725e-05, - "loss": 5.3348740038927644e-05, + "loss": 0.0001349164522252977, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.67, "memory/max_allocated (GiB)": 33.67, - "ppl": 1.00005, + "ppl": 1.00013, "step": 400, "tokens/total": 12104352, - "tokens/train_per_sec_per_gpu": 25.28, + "tokens/train_per_sec_per_gpu": 25.31, "tokens/trainable": 183011 }, { "epoch": 1.56640625, - "grad_norm": 0.006520449183881283, + "grad_norm": 0.010521743446588516, "learning_rate": 2.124308220868431e-05, - "loss": 6.45049221930094e-05, + "loss": 7.793466647854075e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00006, + "ppl": 1.00008, "step": 401, "tokens/total": 12134240, - "tokens/train_per_sec_per_gpu": 31.69, + "tokens/train_per_sec_per_gpu": 31.81, "tokens/trainable": 183459 }, { "epoch": 1.5703125, - "grad_norm": 0.006227654870599508, + "grad_norm": 0.0013409090461209416, "learning_rate": 2.105182715082638e-05, - "loss": 6.928759830771014e-05, + "loss": 2.7722922823159024e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00007, + "ppl": 1.00003, "step": 402, "tokens/total": 12164480, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.7, "tokens/trainable": 183959 }, { "epoch": 1.57421875, - "grad_norm": 0.32605040073394775, + "grad_norm": 0.10361713916063309, "learning_rate": 2.0861984815011552e-05, - "loss": 0.002115404698997736, + "loss": 0.0014142843428999186, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00212, + "ppl": 1.00142, "step": 403, "tokens/total": 12194640, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.5, "tokens/trainable": 184431 }, { "epoch": 1.578125, - "grad_norm": 0.007742208894342184, + "grad_norm": 0.0026048943400382996, "learning_rate": 2.0673563101354323e-05, - "loss": 4.600908869178966e-05, + "loss": 4.14503738284111e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00005, + "ppl": 1.00004, "step": 404, "tokens/total": 12224960, - "tokens/train_per_sec_per_gpu": 31.34, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 184867 }, { "epoch": 1.58203125, - "grad_norm": 0.0049946485087275505, + "grad_norm": 0.009411919862031937, "learning_rate": 2.0486569850851317e-05, - "loss": 5.003535625291988e-05, + "loss": 7.322158489841968e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00005, + "ppl": 1.00007, "step": 405, "tokens/total": 12255008, - "tokens/train_per_sec_per_gpu": 29.25, + "tokens/train_per_sec_per_gpu": 29.37, "tokens/trainable": 185300 }, { "epoch": 1.5859375, - "grad_norm": 0.004598768427968025, + "grad_norm": 0.006792420521378517, "learning_rate": 2.0301012845054956e-05, - "loss": 3.4423381293891e-05, + "loss": 7.982828537933528e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00003, + "ppl": 1.00008, "step": 406, "tokens/total": 12285248, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 185754 }, { "epoch": 1.58984375, - "grad_norm": 0.0011464629787951708, + "grad_norm": 0.013020367361605167, "learning_rate": 2.011689980574966e-05, - "loss": 1.9196500943508e-05, + "loss": 3.743396155186929e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00002, + "ppl": 1.00004, "step": 407, "tokens/total": 12315552, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 186213 }, { "epoch": 1.59375, - "grad_norm": 0.004688040353357792, + "grad_norm": 0.0013089004205539823, "learning_rate": 1.993423839463052e-05, - "loss": 5.2492636314127594e-05, + "loss": 2.306591341039166e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00002, "step": 408, "tokens/total": 12345904, - "tokens/train_per_sec_per_gpu": 32.72, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 186659 }, { "epoch": 1.59765625, - "grad_norm": 0.002637861529365182, + "grad_norm": 0.0012270932784304023, "learning_rate": 1.975303621298445e-05, - "loss": 3.172009019181132e-05, + "loss": 2.1350417227949947e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00002, "step": 409, "tokens/total": 12376336, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.97, "tokens/trainable": 187083 }, { "epoch": 1.6015625, - "grad_norm": 0.0072015393525362015, + "grad_norm": 0.011230082251131535, "learning_rate": 1.957330080137385e-05, - "loss": 5.452537880046293e-05, + "loss": 3.752015618374571e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00005, + "ppl": 1.00004, "step": 410, "tokens/total": 12406880, - "tokens/train_per_sec_per_gpu": 34.91, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 187530 }, { "epoch": 1.60546875, - "grad_norm": 0.007169651333242655, + "grad_norm": 0.004872993566095829, "learning_rate": 1.9395039639322864e-05, - "loss": 3.530656249495223e-05, + "loss": 5.5653974413871765e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00006, "step": 411, "tokens/total": 12437088, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 187972 }, { "epoch": 1.609375, - "grad_norm": 0.003889538114890456, + "grad_norm": 0.19391997158527374, "learning_rate": 1.9218260145006073e-05, - "loss": 3.5087461583316326e-05, + "loss": 0.000892186420969665, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00089, "step": 412, "tokens/total": 12465440, - "tokens/train_per_sec_per_gpu": 39.89, + "tokens/train_per_sec_per_gpu": 39.95, "tokens/trainable": 188417 }, { "epoch": 1.61328125, - "grad_norm": 0.5135430693626404, + "grad_norm": 0.09062197804450989, "learning_rate": 1.904296967493982e-05, - "loss": 0.005697700660675764, + "loss": 0.0006304415874183178, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00571, + "ppl": 1.00063, "step": 413, "tokens/total": 12495968, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.57, "tokens/trainable": 188868 }, { "epoch": 1.6171875, - "grad_norm": 0.0010096468031406403, + "grad_norm": 0.009724686853587627, "learning_rate": 1.8869175523676064e-05, - "loss": 1.1318426913931035e-05, + "loss": 6.72380265314132e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00001, + "ppl": 1.00007, "step": 414, "tokens/total": 12526128, - "tokens/train_per_sec_per_gpu": 36.85, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 189337 }, { "epoch": 1.62109375, - "grad_norm": 0.0004970752634108067, + "grad_norm": 0.19542834162712097, "learning_rate": 1.869688492349885e-05, - "loss": 7.355167326750234e-06, + "loss": 0.001907092402689159, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00191, "step": 415, "tokens/total": 12556256, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 189750 }, { "epoch": 1.625, - "grad_norm": 0.0008849130244925618, + "grad_norm": 0.0465276800096035, "learning_rate": 1.85261050441233e-05, - "loss": 1.4194254617905244e-05, + "loss": 0.0005661146715283394, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00057, "step": 416, "tokens/total": 12586736, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 190216 }, { "epoch": 1.62890625, - "grad_norm": 0.0022039280738681555, + "grad_norm": 0.0012954205740243196, "learning_rate": 1.8356842992397304e-05, - "loss": 2.4539594960515387e-05, + "loss": 1.8871982319978997e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, "ppl": 1.00002, "step": 417, "tokens/total": 12617168, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 190708 }, { "epoch": 1.6328125, - "grad_norm": 0.027006179094314575, + "grad_norm": 0.0018749319715425372, "learning_rate": 1.8189105812005714e-05, - "loss": 0.00020442574168555439, + "loss": 3.220669532311149e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.0002, + "ppl": 1.00003, "step": 418, "tokens/total": 12647680, - "tokens/train_per_sec_per_gpu": 30.85, + "tokens/train_per_sec_per_gpu": 30.9, "tokens/trainable": 191126 }, { "epoch": 1.63671875, - "grad_norm": 0.15684254467487335, + "grad_norm": 0.0022480092011392117, "learning_rate": 1.802290048317732e-05, - "loss": 0.0007251293282024562, + "loss": 2.6564141080598347e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00073, + "ppl": 1.00003, "step": 419, "tokens/total": 12677952, - "tokens/train_per_sec_per_gpu": 30.3, + "tokens/train_per_sec_per_gpu": 30.34, "tokens/trainable": 191540 }, { "epoch": 1.640625, - "grad_norm": 0.0033104538451880217, + "grad_norm": 0.1634059101343155, "learning_rate": 1.785823392239424e-05, - "loss": 3.131272751488723e-05, + "loss": 0.0009822181891649961, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00098, "step": 420, "tokens/total": 12708416, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.69, "tokens/trainable": 192014 }, { "epoch": 1.64453125, - "grad_norm": 0.001255685230717063, + "grad_norm": 0.0019404747290536761, "learning_rate": 1.7695112982104225e-05, - "loss": 1.9309976778458804e-05, + "loss": 2.167341335734818e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 421, "tokens/total": 12738640, - "tokens/train_per_sec_per_gpu": 31.28, + "tokens/train_per_sec_per_gpu": 31.31, "tokens/trainable": 192463 }, { "epoch": 1.6484375, - "grad_norm": 0.01599641516804695, + "grad_norm": 0.001059795613400638, "learning_rate": 1.7533544450435433e-05, - "loss": 9.235648030880839e-05, + "loss": 1.6543437595828436e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00009, + "ppl": 1.00002, "step": 422, "tokens/total": 12769232, - "tokens/train_per_sec_per_gpu": 32.71, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 192918 }, { "epoch": 1.65234375, - "grad_norm": 0.048507146537303925, + "grad_norm": 0.01760418340563774, "learning_rate": 1.7373535050913946e-05, - "loss": 0.0002708940301090479, + "loss": 0.0001707405026536435, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00027, + "ppl": 1.00017, "step": 423, "tokens/total": 12799648, - "tokens/train_per_sec_per_gpu": 37.35, + "tokens/train_per_sec_per_gpu": 37.46, "tokens/trainable": 193425 }, { "epoch": 1.65625, - "grad_norm": 0.010107563808560371, + "grad_norm": 0.0023663989268243313, "learning_rate": 1.721509144218405e-05, - "loss": 6.99054216966033e-05, + "loss": 2.332203439436853e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00007, + "ppl": 1.00002, "step": 424, "tokens/total": 12829920, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 193898 }, { "epoch": 1.66015625, - "grad_norm": 0.005467226263135672, + "grad_norm": 0.0245437640696764, "learning_rate": 1.705822021773101e-05, - "loss": 5.417566717369482e-05, + "loss": 0.0001577093207743019, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00005, + "ppl": 1.00016, "step": 425, "tokens/total": 12860112, - "tokens/train_per_sec_per_gpu": 29.24, + "tokens/train_per_sec_per_gpu": 29.29, "tokens/trainable": 194315 }, { "epoch": 1.6640625, - "grad_norm": 0.0015799012035131454, + "grad_norm": 0.0009002169244922698, "learning_rate": 1.69029279056068e-05, - "loss": 2.4984849005704746e-05, + "loss": 1.4283305972639937e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00002, + "ppl": 1.00001, "step": 426, "tokens/total": 12890320, "tokens/train_per_sec_per_gpu": 34.92, @@ -5975,758 +5975,758 @@ }, { "epoch": 1.66796875, - "grad_norm": 0.024157166481018066, + "grad_norm": 0.00033997284481301904, "learning_rate": 1.6749220968158415e-05, - "loss": 0.00010696032404666767, + "loss": 7.185776667029131e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00011, + "ppl": 1.00001, "step": 427, "tokens/total": 12920656, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 195262 }, { "epoch": 1.671875, - "grad_norm": 0.00028090659179724753, + "grad_norm": 0.0005359657225199044, "learning_rate": 1.659710580175893e-05, - "loss": 7.484430170734413e-06, + "loss": 9.948088518285658e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, "ppl": 1.00001, "step": 428, "tokens/total": 12951040, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 195680 }, { "epoch": 1.67578125, - "grad_norm": 0.0011094068177044392, + "grad_norm": 0.0014890795573592186, "learning_rate": 1.644658873654133e-05, - "loss": 1.9920153135899454e-05, + "loss": 2.028812377830036e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, "ppl": 1.00002, "step": 429, "tokens/total": 12981232, - "tokens/train_per_sec_per_gpu": 32.83, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 196145 }, { "epoch": 1.6796875, - "grad_norm": 0.020794112235307693, + "grad_norm": 0.05130980163812637, "learning_rate": 1.629767603613508e-05, - "loss": 0.00010971157462336123, + "loss": 0.0003292672336101532, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00011, + "ppl": 1.00033, "step": 430, "tokens/total": 13011616, - "tokens/train_per_sec_per_gpu": 32.39, + "tokens/train_per_sec_per_gpu": 32.42, "tokens/trainable": 196626 }, { "epoch": 1.68359375, - "grad_norm": 0.44080695509910583, + "grad_norm": 0.0014070137403905392, "learning_rate": 1.615037389740547e-05, - "loss": 0.0026788683608174324, + "loss": 1.0152909453609027e-05, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.00268, + "ppl": 1.00001, "step": 431, "tokens/total": 13042208, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.17, "tokens/trainable": 197067 }, { "epoch": 1.6875, - "grad_norm": 0.0026339287869632244, + "grad_norm": 0.004116157069802284, "learning_rate": 1.600468845019576e-05, - "loss": 2.082335777231492e-05, + "loss": 3.514952550176531e-05, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00004, "step": 432, "tokens/total": 13072800, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.68, "tokens/trainable": 197565 }, { "epoch": 1.69140625, - "grad_norm": 0.004508621525019407, + "grad_norm": 0.01147819496691227, "learning_rate": 1.5860625757072092e-05, - "loss": 1.439991501683835e-05, + "loss": 7.313965761568397e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00007, "step": 433, "tokens/total": 13103328, - "tokens/train_per_sec_per_gpu": 32.88, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 198015 }, { "epoch": 1.6953125, - "grad_norm": 0.014811511151492596, + "grad_norm": 0.030784178525209427, "learning_rate": 1.571819181307116e-05, - "loss": 0.00015316363715101033, + "loss": 0.0002448821614962071, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00024, "step": 434, "tokens/total": 13133472, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 198442 }, { "epoch": 1.69921875, - "grad_norm": 0.0037793368101119995, + "grad_norm": 0.0022457120940089226, "learning_rate": 1.557739254545075e-05, - "loss": 1.4444960470427759e-05, + "loss": 1.4446297427639365e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 435, "tokens/total": 13164064, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 198914 }, { "epoch": 1.703125, - "grad_norm": 0.24972176551818848, + "grad_norm": 0.0029742212500423193, "learning_rate": 1.543823381344311e-05, - "loss": 0.0017114672809839249, + "loss": 2.7415488148108125e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00171, + "ppl": 1.00003, "step": 436, "tokens/total": 13194464, - "tokens/train_per_sec_per_gpu": 33.35, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 199355 }, { "epoch": 1.70703125, - "grad_norm": 0.002479988383129239, + "grad_norm": 0.002260624896734953, "learning_rate": 1.5300721408011114e-05, - "loss": 2.9400333005469292e-05, + "loss": 2.7733602109947242e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00003, "step": 437, "tokens/total": 13224992, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 199830 }, { "epoch": 1.7109375, - "grad_norm": 0.0014780610799789429, + "grad_norm": 0.01198511105030775, "learning_rate": 1.5164861051607254e-05, - "loss": 1.5593774151057005e-05, + "loss": 9.154126746580005e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00009, "step": 438, "tokens/total": 13255296, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.97, "tokens/trainable": 200338 }, { "epoch": 1.71484375, - "grad_norm": 0.0010410621762275696, + "grad_norm": 0.003149093361571431, "learning_rate": 1.5030658397935521e-05, - "loss": 1.4683226254419424e-05, + "loss": 3.515004937071353e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00004, "step": 439, "tokens/total": 13285344, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 200785 }, { "epoch": 1.71875, - "grad_norm": 0.0004247442411724478, + "grad_norm": 0.0003243185637984425, "learning_rate": 1.4898119031716104e-05, - "loss": 8.09474295238033e-06, + "loss": 7.168858701334102e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, "ppl": 1.00001, "step": 440, "tokens/total": 13315632, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.32, "tokens/trainable": 201267 }, { "epoch": 1.72265625, - "grad_norm": 0.0026301892939954996, + "grad_norm": 0.12771126627922058, "learning_rate": 1.476724846845306e-05, - "loss": 1.7428235878469422e-05, + "loss": 0.0007142049144022167, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 441, "tokens/total": 13346048, - "tokens/train_per_sec_per_gpu": 34.16, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 201734 }, { "epoch": 1.7265625, - "grad_norm": 0.0005576284602284431, + "grad_norm": 0.11483822762966156, "learning_rate": 1.463805215420471e-05, - "loss": 8.656044883537106e-06, + "loss": 0.0006703532999381423, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00001, + "ppl": 1.00067, "step": 442, "tokens/total": 13376304, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.4, "tokens/trainable": 202174 }, { "epoch": 1.73046875, - "grad_norm": 0.0009604030638001859, + "grad_norm": 0.00032006221590563655, "learning_rate": 1.451053546535705e-05, - "loss": 1.4092523088038433e-05, + "loss": 9.367744496557862e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00001, "step": 443, "tokens/total": 13406720, - "tokens/train_per_sec_per_gpu": 36.13, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 202612 }, { "epoch": 1.734375, - "grad_norm": 0.00019884438370354474, + "grad_norm": 0.0002659875026438385, "learning_rate": 1.438470370840001e-05, - "loss": 4.5837323341402225e-06, + "loss": 5.530210728466045e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0, + "ppl": 1.00001, "step": 444, "tokens/total": 13436464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 30.99, "tokens/trainable": 203020 }, { "epoch": 1.73828125, - "grad_norm": 0.05944995582103729, + "grad_norm": 0.04957196116447449, "learning_rate": 1.4260562119706606e-05, - "loss": 0.0002780454815365374, + "loss": 6.46735934424214e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00028, + "ppl": 1.00006, "step": 445, "tokens/total": 13466672, - "tokens/train_per_sec_per_gpu": 34.31, + "tokens/train_per_sec_per_gpu": 34.37, "tokens/trainable": 203479 }, { "epoch": 1.7421875, - "grad_norm": 0.005872223526239395, + "grad_norm": 0.0016840791795402765, "learning_rate": 1.413811586531508e-05, - "loss": 3.424299575272016e-05, + "loss": 1.2613029866770376e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00003, + "ppl": 1.00001, "step": 446, "tokens/total": 13496736, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 203946 }, { "epoch": 1.74609375, - "grad_norm": 0.006013527978211641, + "grad_norm": 0.00042921333806589246, "learning_rate": 1.4017370040713884e-05, - "loss": 3.269856097176671e-05, + "loss": 7.416386324621271e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.00001, "step": 447, "tokens/total": 13526928, - "tokens/train_per_sec_per_gpu": 37.43, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 204382 }, { "epoch": 1.75, - "grad_norm": 0.05103042349219322, + "grad_norm": 0.2165915071964264, "learning_rate": 1.3898329670629645e-05, - "loss": 0.00032247230410575867, + "loss": 0.0006914341356605291, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00032, + "ppl": 1.00069, "step": 448, "tokens/total": 13557392, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 204830 }, { "epoch": 1.75390625, - "grad_norm": 0.13250835239887238, + "grad_norm": 0.0009792562341317534, "learning_rate": 1.3780999708818058e-05, - "loss": 0.0008940898114815354, + "loss": 1.4504414139082655e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00089, + "ppl": 1.00001, "step": 449, "tokens/total": 13587776, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.47, "tokens/trainable": 205300 }, { "epoch": 1.7578125, - "grad_norm": 0.24642030894756317, + "grad_norm": 0.028498223051428795, "learning_rate": 1.3665385037857758e-05, - "loss": 0.0012931979726999998, + "loss": 0.00028163049137219787, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00129, + "ppl": 1.00028, "step": 450, "tokens/total": 13618112, - "tokens/train_per_sec_per_gpu": 30.62, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 205726 }, { "epoch": 1.76171875, - "grad_norm": 0.011528799310326576, + "grad_norm": 0.003279345342889428, "learning_rate": 1.3551490468947126e-05, - "loss": 6.569598917849362e-05, + "loss": 2.595262776594609e-05, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00007, + "ppl": 1.00003, "step": 451, "tokens/total": 13648512, - "tokens/train_per_sec_per_gpu": 31.55, + "tokens/train_per_sec_per_gpu": 31.63, "tokens/trainable": 206163 }, { "epoch": 1.765625, - "grad_norm": 1.0818549394607544, + "grad_norm": 0.4961508512496948, "learning_rate": 1.3439320741704075e-05, - "loss": 0.015596212819218636, + "loss": 0.00459528062492609, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01572, + "ppl": 1.00461, "step": 452, "tokens/total": 13678704, - "tokens/train_per_sec_per_gpu": 35.41, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 206619 }, { "epoch": 1.76953125, - "grad_norm": 0.0007326967315748334, + "grad_norm": 0.009086468257009983, "learning_rate": 1.3328880523968808e-05, - "loss": 1.2033770872221794e-05, + "loss": 6.577694148290902e-05, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00007, "step": 453, "tokens/total": 13709232, - "tokens/train_per_sec_per_gpu": 37.18, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 207101 }, { "epoch": 1.7734375, - "grad_norm": 0.0023919539526104927, + "grad_norm": 0.009036197327077389, "learning_rate": 1.3220174411609587e-05, - "loss": 1.262133719137637e-05, + "loss": 6.735372880939394e-05, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00007, "step": 454, "tokens/total": 13739600, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.77, "tokens/trainable": 207546 }, { "epoch": 1.77734375, - "grad_norm": 0.0020972786005586386, + "grad_norm": 0.009665202349424362, "learning_rate": 1.3113206928331471e-05, - "loss": 2.476977533660829e-05, + "loss": 7.266137981787324e-05, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00007, "step": 455, "tokens/total": 13769936, - "tokens/train_per_sec_per_gpu": 34.25, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 207989 }, { "epoch": 1.78125, - "grad_norm": 0.000797569751739502, + "grad_norm": 0.0004666070453822613, "learning_rate": 1.300798252548806e-05, - "loss": 1.45716385304695e-05, + "loss": 6.039275831426494e-06, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00001, "step": 456, "tokens/total": 13800240, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 208402 }, { "epoch": 1.78515625, - "grad_norm": 0.011376727372407913, + "grad_norm": 0.00044853391591459513, "learning_rate": 1.2904505581896265e-05, - "loss": 7.903270306997001e-05, + "loss": 8.292890015582088e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00008, + "ppl": 1.00001, "step": 457, "tokens/total": 13830512, - "tokens/train_per_sec_per_gpu": 36.61, + "tokens/train_per_sec_per_gpu": 36.58, "tokens/trainable": 208904 }, { "epoch": 1.7890625, - "grad_norm": 0.0013566205743700266, + "grad_norm": 0.0033692270517349243, "learning_rate": 1.2802780403654082e-05, - "loss": 1.925312972161919e-05, + "loss": 2.3157112082117237e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, "ppl": 1.00002, "step": 458, "tokens/total": 13860832, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 209382 }, { "epoch": 1.79296875, - "grad_norm": 0.00047398527385666966, + "grad_norm": 0.0010797431459650397, "learning_rate": 1.2702811223961408e-05, - "loss": 1.119351145462133e-05, + "loss": 1.119279841077514e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00001, "step": 459, "tokens/total": 13890992, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 209833 }, { "epoch": 1.796875, - "grad_norm": 0.04677487164735794, + "grad_norm": 0.04658913239836693, "learning_rate": 1.2604602202943861e-05, - "loss": 0.0001750149531289935, + "loss": 0.0003375259111635387, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00018, + "ppl": 1.00034, "step": 460, "tokens/total": 13921424, - "tokens/train_per_sec_per_gpu": 32.5, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 210284 }, { "epoch": 1.80078125, - "grad_norm": 0.024663345888257027, + "grad_norm": 0.01848040148615837, "learning_rate": 1.2508157427479686e-05, - "loss": 9.222347580362111e-05, + "loss": 0.00016109315038193017, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00016, "step": 461, "tokens/total": 13951504, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.07, "tokens/trainable": 210769 }, { "epoch": 1.8046875, - "grad_norm": 0.0004740248841699213, + "grad_norm": 0.05658251419663429, "learning_rate": 1.2413480911029655e-05, - "loss": 1.0696679964894429e-05, + "loss": 0.00017825173563323915, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00001, + "ppl": 1.00018, "step": 462, "tokens/total": 13979728, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.41, "tokens/trainable": 211193 }, { "epoch": 1.80859375, - "grad_norm": 0.0007590787718072534, + "grad_norm": 0.0006594725418835878, "learning_rate": 1.2320576593470082e-05, - "loss": 1.3936740288045257e-05, + "loss": 9.709075129649136e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, "ppl": 1.00001, "step": 463, "tokens/total": 14009936, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 211655 }, { "epoch": 1.8125, - "grad_norm": 0.002108624204993248, + "grad_norm": 0.02737571857869625, "learning_rate": 1.2229448340928828e-05, - "loss": 2.675112227734644e-05, + "loss": 0.00017574361118022352, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00018, "step": 464, "tokens/total": 14039872, - "tokens/train_per_sec_per_gpu": 29.28, + "tokens/train_per_sec_per_gpu": 29.2, "tokens/trainable": 212085 }, { "epoch": 1.81640625, - "grad_norm": 0.0009435649262741208, + "grad_norm": 0.0004917355254292488, "learning_rate": 1.2140099945624458e-05, - "loss": 1.0821668183780275e-05, + "loss": 8.16806459624786e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00001, "step": 465, "tokens/total": 14070096, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 212570 }, { "epoch": 1.8203125, - "grad_norm": 0.011040126904845238, + "grad_norm": 0.0015915038529783487, "learning_rate": 1.205253512570841e-05, - "loss": 5.798249912913889e-05, + "loss": 1.2870759746874683e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00006, + "ppl": 1.00001, "step": 466, "tokens/total": 14100192, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.93, "tokens/trainable": 213011 }, { "epoch": 1.82421875, - "grad_norm": 0.008271797560155392, + "grad_norm": 0.0005419626249931753, "learning_rate": 1.1966757525110255e-05, - "loss": 2.8763912268914282e-05, + "loss": 7.527931302320212e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00003, + "ppl": 1.00001, "step": 467, "tokens/total": 14130448, - "tokens/train_per_sec_per_gpu": 31.44, + "tokens/train_per_sec_per_gpu": 31.58, "tokens/trainable": 213450 }, { "epoch": 1.828125, - "grad_norm": 0.023479726165533066, + "grad_norm": 0.004500397015362978, "learning_rate": 1.1882770713386095e-05, - "loss": 0.0001434558507753536, + "loss": 4.2581184970913455e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00014, + "ppl": 1.00004, "step": 468, "tokens/total": 14160480, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.7, "tokens/trainable": 213898 }, { "epoch": 1.83203125, - "grad_norm": 0.0023077642545104027, + "grad_norm": 0.1103268712759018, "learning_rate": 1.180057818556998e-05, - "loss": 2.560112625360489e-05, + "loss": 0.00021096917043905705, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00021, "step": 469, "tokens/total": 14191152, - "tokens/train_per_sec_per_gpu": 36.78, + "tokens/train_per_sec_per_gpu": 36.88, "tokens/trainable": 214366 }, { "epoch": 1.8359375, - "grad_norm": 0.0014362182701006532, + "grad_norm": 0.002097723074257374, "learning_rate": 1.1720183362028494e-05, - "loss": 2.0195953766233288e-05, + "loss": 2.7896878236788325e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00002, + "ppl": 1.00003, "step": 470, "tokens/total": 14219392, - "tokens/train_per_sec_per_gpu": 35.64, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 214800 }, { "epoch": 1.83984375, - "grad_norm": 0.011598445475101471, + "grad_norm": 0.001367987017147243, "learning_rate": 1.1641589588318387e-05, - "loss": 4.486892794375308e-05, + "loss": 1.733974931994453e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00002, "step": 471, "tokens/total": 14249920, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 215292 }, { "epoch": 1.84375, - "grad_norm": 0.0011633927933871746, + "grad_norm": 0.000857445178553462, "learning_rate": 1.1564800135047418e-05, - "loss": 2.0482253603404388e-05, + "loss": 1.3961070180812385e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00002, + "ppl": 1.00001, "step": 472, "tokens/total": 14280048, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 215741 }, { "epoch": 1.84765625, - "grad_norm": 0.006093664560467005, + "grad_norm": 0.0037669208832085133, "learning_rate": 1.148981819773816e-05, - "loss": 5.0086440751329064e-05, + "loss": 3.097699664067477e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00005, + "ppl": 1.00003, "step": 473, "tokens/total": 14310432, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 216194 }, { "epoch": 1.8515625, - "grad_norm": 0.003623088588938117, + "grad_norm": 0.0003345425648149103, "learning_rate": 1.1416646896695086e-05, - "loss": 3.059494338231161e-05, + "loss": 6.7712135205511e-06, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00003, + "ppl": 1.00001, "step": 474, "tokens/total": 14340496, - "tokens/train_per_sec_per_gpu": 33.3, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 216634 }, { "epoch": 1.85546875, - "grad_norm": 0.006924150045961142, + "grad_norm": 0.00038110429886728525, "learning_rate": 1.1345289276874717e-05, - "loss": 3.953809573431499e-05, + "loss": 7.348439794441219e-06, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 475, "tokens/total": 14370720, - "tokens/train_per_sec_per_gpu": 30.48, + "tokens/train_per_sec_per_gpu": 30.53, "tokens/trainable": 217040 }, { "epoch": 1.859375, - "grad_norm": 0.002359601203352213, + "grad_norm": 0.0013931745197623968, "learning_rate": 1.1275748307758873e-05, - "loss": 3.34192045556847e-05, + "loss": 1.2693172720901202e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.00001, "step": 476, "tokens/total": 14401136, - "tokens/train_per_sec_per_gpu": 37.55, + "tokens/train_per_sec_per_gpu": 37.67, "tokens/trainable": 217530 }, { "epoch": 1.86328125, - "grad_norm": 0.009584639221429825, + "grad_norm": 0.02564929611980915, "learning_rate": 1.1208026883231147e-05, - "loss": 0.00010110227594850585, + "loss": 0.00031186698470264673, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.0001, + "ppl": 1.00031, "step": 477, "tokens/total": 14431360, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 217988 }, { "epoch": 1.8671875, - "grad_norm": 0.03044246695935726, + "grad_norm": 0.08053945004940033, "learning_rate": 1.1142127821456433e-05, - "loss": 0.00022086883836891502, + "loss": 0.0003999105538241565, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00022, + "ppl": 1.0004, "step": 478, "tokens/total": 14461968, - "tokens/train_per_sec_per_gpu": 32.47, + "tokens/train_per_sec_per_gpu": 32.54, "tokens/trainable": 218461 }, { "epoch": 1.87109375, - "grad_norm": 0.03494428098201752, + "grad_norm": 0.05217274650931358, "learning_rate": 1.1078053864763674e-05, - "loss": 0.0002753190929070115, + "loss": 0.0003339847025927156, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00028, + "ppl": 1.00033, "step": 479, "tokens/total": 14491984, - "tokens/train_per_sec_per_gpu": 32.77, + "tokens/train_per_sec_per_gpu": 32.81, "tokens/trainable": 218909 }, { "epoch": 1.875, - "grad_norm": 0.30102044343948364, + "grad_norm": 0.08783794194459915, "learning_rate": 1.1015807679531756e-05, - "loss": 0.00025764034944586456, + "loss": 0.0005760936765000224, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00026, + "ppl": 1.00058, "step": 480, "tokens/total": 14522544, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 34.08, "tokens/trainable": 219350 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_model.safetensors index 95c3f19206395238e6782ddf02f5c2620f03d2b2..598edbb87c4b1911f292dd47ccb4a713b6478aed 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:3ba49d604afb025cda90bf22fe38858ddb91aef7695be1af2622e6a002b0e65b +oid sha256:233181cf98d9388b75d25740fa98f4912414f643945abe781e342921d3103c33 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/optimizer.pt index 7834e63f02e3f3e3356d07f9a5415fc57d2c483d..40b04158b65dd3e459b2bc823171c19186f2f945 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:02947e98128d87243b855caa3aa6566a71488c0ba3ae7862ecd65bef0274d94b +oid sha256:16c3da8efe9c136763c30af87a2769a1e809cdc1eca270b3b513e5a6efa6cba8 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/trainer_state.json index adaad32362f2cb34f3c0402751f7bcb55cbadf88..8e8da379c0a212aa9e6075188d01b954b6eb67fd 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-512/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,965 +711,965 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 }, { "epoch": 0.37890625, - "grad_norm": 0.0691726952791214, + "grad_norm": 0.5786341428756714, "learning_rate": 9.53619478457953e-05, - "loss": 0.0004006598028354347, + "loss": 0.0046112253330647945, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0004, + "ppl": 1.00462, "step": 97, "tokens/total": 2936752, - "tokens/train_per_sec_per_gpu": 31.5, + "tokens/train_per_sec_per_gpu": 31.51, "tokens/trainable": 44255 }, { "epoch": 0.3828125, - "grad_norm": 0.20961223542690277, + "grad_norm": 0.4321880340576172, "learning_rate": 9.523275153154695e-05, - "loss": 0.0020726853981614113, + "loss": 0.003710552118718624, "memory/device_reserved (GiB)": 35.19, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00207, + "ppl": 1.00372, "step": 98, "tokens/total": 2967072, - "tokens/train_per_sec_per_gpu": 37.71, + "tokens/train_per_sec_per_gpu": 37.74, "tokens/trainable": 44739 }, { "epoch": 0.38671875, - "grad_norm": 0.07388679683208466, + "grad_norm": 0.16571089625358582, "learning_rate": 9.51018809682839e-05, - "loss": 0.00044117189827375114, + "loss": 0.00260853860527277, "memory/device_reserved (GiB)": 35.76, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, - "ppl": 1.00044, + "ppl": 1.00261, "step": 99, "tokens/total": 2997664, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.2, "tokens/trainable": 45202 }, { "epoch": 0.390625, - "grad_norm": 0.46414947509765625, + "grad_norm": 0.4386274516582489, "learning_rate": 9.49693416020645e-05, - "loss": 0.006180304102599621, + "loss": 0.005652088671922684, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0062, + "ppl": 1.00567, "step": 100, "tokens/total": 3028032, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 45646 }, { "epoch": 0.39453125, - "grad_norm": 0.019027478992938995, + "grad_norm": 0.12225741147994995, "learning_rate": 9.483513894839276e-05, - "loss": 0.00012531192624010146, + "loss": 0.0015262231463566422, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00013, + "ppl": 1.00153, "step": 101, "tokens/total": 3058272, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 46089 }, { "epoch": 0.3984375, - "grad_norm": 3.6436362266540527, + "grad_norm": 0.779109537601471, "learning_rate": 9.469927859198888e-05, - "loss": 0.031218968331813812, + "loss": 0.007584188133478165, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.03171, + "ppl": 1.00761, "step": 102, "tokens/total": 3088848, - "tokens/train_per_sec_per_gpu": 32.49, + "tokens/train_per_sec_per_gpu": 32.55, "tokens/trainable": 46547 }, { "epoch": 0.40234375, - "grad_norm": 1.2344398498535156, + "grad_norm": 0.19508829712867737, "learning_rate": 9.456176618655689e-05, - "loss": 0.011161141097545624, + "loss": 0.0021933168172836304, "memory/device_reserved (GiB)": 35.99, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.01122, + "ppl": 1.0022, "step": 103, "tokens/total": 3119424, - "tokens/train_per_sec_per_gpu": 31.9, + "tokens/train_per_sec_per_gpu": 31.96, "tokens/trainable": 47014 }, { "epoch": 0.40625, - "grad_norm": 0.7120245099067688, + "grad_norm": 0.349365770816803, "learning_rate": 9.442260745454927e-05, - "loss": 0.002164291450753808, + "loss": 0.007655802182853222, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00217, + "ppl": 1.00769, "step": 104, "tokens/total": 3149696, - "tokens/train_per_sec_per_gpu": 37.65, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 47503 }, { "epoch": 0.41015625, - "grad_norm": 0.07052730768918991, + "grad_norm": 0.3205769956111908, "learning_rate": 9.428180818692884e-05, - "loss": 0.0002605066110845655, + "loss": 0.0014675151323899627, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00026, + "ppl": 1.00147, "step": 105, "tokens/total": 3180064, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 47996 }, { "epoch": 0.4140625, - "grad_norm": 1.2376325130462646, + "grad_norm": 0.23203934729099274, "learning_rate": 9.413937424292791e-05, - "loss": 0.01640205644071102, + "loss": 0.001969895325601101, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.01654, + "ppl": 1.00197, "step": 106, "tokens/total": 3208320, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 48447 }, { "epoch": 0.41796875, - "grad_norm": 0.5694106817245483, + "grad_norm": 0.050742585211992264, "learning_rate": 9.399531154980424e-05, - "loss": 0.01000689435750246, + "loss": 0.00028503642533905804, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.01006, + "ppl": 1.00029, "step": 107, "tokens/total": 3238416, - "tokens/train_per_sec_per_gpu": 30.65, + "tokens/train_per_sec_per_gpu": 30.69, "tokens/trainable": 48889 }, { "epoch": 0.421875, - "grad_norm": 0.5011488795280457, + "grad_norm": 0.68248450756073, "learning_rate": 9.384962610259455e-05, - "loss": 0.0022165768314152956, + "loss": 0.0026741819456219673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00222, + "ppl": 1.00268, "step": 108, "tokens/total": 3268784, - "tokens/train_per_sec_per_gpu": 37.84, + "tokens/train_per_sec_per_gpu": 37.89, "tokens/trainable": 49360 }, { "epoch": 0.42578125, - "grad_norm": 0.6332448124885559, + "grad_norm": 0.2664353549480438, "learning_rate": 9.370232396386494e-05, - "loss": 0.006433461792767048, + "loss": 0.0014279462629929185, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00645, + "ppl": 1.00143, "step": 109, "tokens/total": 3298912, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.78, "tokens/trainable": 49827 }, { "epoch": 0.4296875, - "grad_norm": 3.6466922760009766, + "grad_norm": 0.12221308797597885, "learning_rate": 9.355341126345868e-05, - "loss": 0.025773590430617332, + "loss": 0.0007402317132800817, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.02611, + "ppl": 1.00074, "step": 110, "tokens/total": 3329232, - "tokens/train_per_sec_per_gpu": 34.22, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 50267 }, { "epoch": 0.43359375, - "grad_norm": 1.0804238319396973, + "grad_norm": 1.2223896980285645, "learning_rate": 9.340289419824107e-05, - "loss": 0.013978044502437115, + "loss": 0.020261401310563087, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01408, + "ppl": 1.02047, "step": 111, "tokens/total": 3359440, - "tokens/train_per_sec_per_gpu": 33.32, + "tokens/train_per_sec_per_gpu": 33.41, "tokens/trainable": 50711 }, { "epoch": 0.4375, - "grad_norm": 0.3128775656223297, + "grad_norm": 1.2567111253738403, "learning_rate": 9.325077903184159e-05, - "loss": 0.008084455505013466, + "loss": 0.012774579226970673, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00812, + "ppl": 1.01286, "step": 112, "tokens/total": 3389472, - "tokens/train_per_sec_per_gpu": 31.54, + "tokens/train_per_sec_per_gpu": 31.59, "tokens/trainable": 51157 }, { "epoch": 0.44140625, - "grad_norm": 0.5562160611152649, + "grad_norm": 0.8144268989562988, "learning_rate": 9.30970720943932e-05, - "loss": 0.012518094852566719, + "loss": 0.005420445930212736, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0126, + "ppl": 1.00544, "step": 113, "tokens/total": 3419920, - "tokens/train_per_sec_per_gpu": 32.67, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 51613 }, { "epoch": 0.4453125, - "grad_norm": 0.37859252095222473, + "grad_norm": 1.3511962890625, "learning_rate": 9.2941779782269e-05, - "loss": 0.011980460025370121, + "loss": 0.004596072714775801, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01205, + "ppl": 1.00461, "step": 114, "tokens/total": 3450176, - "tokens/train_per_sec_per_gpu": 29.04, + "tokens/train_per_sec_per_gpu": 29.1, "tokens/trainable": 52017 }, { "epoch": 0.44921875, - "grad_norm": 0.19049690663814545, + "grad_norm": 2.76552677154541, "learning_rate": 9.278490855781596e-05, - "loss": 0.0033194865100085735, + "loss": 0.005162997171282768, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00333, + "ppl": 1.00518, "step": 115, "tokens/total": 3480544, - "tokens/train_per_sec_per_gpu": 36.15, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 52506 }, { "epoch": 0.453125, - "grad_norm": 0.9838894009590149, + "grad_norm": 1.7830004692077637, "learning_rate": 9.262646494908604e-05, - "loss": 0.011315119452774525, + "loss": 0.024823248386383057, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.01138, + "ppl": 1.02513, "step": 116, "tokens/total": 3510848, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.63, "tokens/trainable": 53008 }, { "epoch": 0.45703125, - "grad_norm": 1.5077804327011108, + "grad_norm": 0.8680487275123596, "learning_rate": 9.246645554956457e-05, - "loss": 0.011926110833883286, + "loss": 0.012252703309059143, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.012, + "ppl": 1.01233, "step": 117, "tokens/total": 3541296, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.36, "tokens/trainable": 53467 }, { "epoch": 0.4609375, - "grad_norm": 0.1702655702829361, + "grad_norm": 0.8030971884727478, "learning_rate": 9.230488701789578e-05, - "loss": 0.002886661561205983, + "loss": 0.01154071744531393, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00289, + "ppl": 1.01161, "step": 118, "tokens/total": 3571936, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 53923 }, { "epoch": 0.46484375, - "grad_norm": 0.3885493576526642, + "grad_norm": 1.1320112943649292, "learning_rate": 9.214176607760577e-05, - "loss": 0.0035083256661891937, + "loss": 0.00475259218364954, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00351, + "ppl": 1.00476, "step": 119, "tokens/total": 3602000, "tokens/train_per_sec_per_gpu": 35.58, @@ -1677,125 +1677,125 @@ }, { "epoch": 0.46875, - "grad_norm": 0.2820606529712677, + "grad_norm": 0.25778594613075256, "learning_rate": 9.197709951682268e-05, - "loss": 0.005707860924303532, + "loss": 0.00691817793995142, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00572, + "ppl": 1.00694, "step": 120, "tokens/total": 3632288, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 54839 }, { "epoch": 0.47265625, - "grad_norm": 0.38794127106666565, + "grad_norm": 0.3193860948085785, "learning_rate": 9.181089418799428e-05, - "loss": 0.003157487604767084, + "loss": 0.0037792143411934376, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00316, + "ppl": 1.00379, "step": 121, "tokens/total": 3662608, - "tokens/train_per_sec_per_gpu": 32.58, + "tokens/train_per_sec_per_gpu": 32.59, "tokens/trainable": 55267 }, { "epoch": 0.4765625, - "grad_norm": 0.2677665054798126, + "grad_norm": 0.34393274784088135, "learning_rate": 9.164315700760271e-05, - "loss": 0.0032300231978297234, + "loss": 0.0042166681960225105, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00324, + "ppl": 1.00423, "step": 122, "tokens/total": 3692864, - "tokens/train_per_sec_per_gpu": 30.47, + "tokens/train_per_sec_per_gpu": 30.52, "tokens/trainable": 55700 }, { "epoch": 0.48046875, - "grad_norm": 0.31003710627555847, + "grad_norm": 0.4916401505470276, "learning_rate": 9.147389495587671e-05, - "loss": 0.00425739586353302, + "loss": 0.0038735629059374332, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00427, + "ppl": 1.00388, "step": 123, "tokens/total": 3722864, - "tokens/train_per_sec_per_gpu": 33.38, + "tokens/train_per_sec_per_gpu": 33.39, "tokens/trainable": 56144 }, { "epoch": 0.484375, - "grad_norm": 0.031137565150856972, + "grad_norm": 0.39921140670776367, "learning_rate": 9.130311507650116e-05, - "loss": 0.00010005584044847637, + "loss": 0.004010441247373819, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0001, + "ppl": 1.00402, "step": 124, "tokens/total": 3753056, - "tokens/train_per_sec_per_gpu": 33.07, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 56589 }, { "epoch": 0.48828125, - "grad_norm": 0.7360314130783081, + "grad_norm": 0.4556286633014679, "learning_rate": 9.113082447632394e-05, - "loss": 0.004621482454240322, + "loss": 0.005605827085673809, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00463, + "ppl": 1.00562, "step": 125, "tokens/total": 3783312, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.68, "tokens/trainable": 57081 }, { "epoch": 0.4921875, - "grad_norm": 0.05498598888516426, + "grad_norm": 0.041882507503032684, "learning_rate": 9.09570303250602e-05, - "loss": 0.0002661112230271101, + "loss": 0.0005784470704384148, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00027, + "ppl": 1.00058, "step": 126, "tokens/total": 3813712, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 57527 }, { "epoch": 0.49609375, - "grad_norm": 0.4160194993019104, + "grad_norm": 0.21823598444461823, "learning_rate": 9.078173985499394e-05, - "loss": 0.0034656142815947533, + "loss": 0.0024290401488542557, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00347, + "ppl": 1.00243, "step": 127, "tokens/total": 3844336, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 58005 }, { "epoch": 0.5, - "grad_norm": 0.44116270542144775, + "grad_norm": 0.4637400209903717, "learning_rate": 9.060496036067713e-05, - "loss": 0.0029591654893010855, + "loss": 0.001603663433343172, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00296, + "ppl": 1.0016, "step": 128, "tokens/total": 3872688, "tokens/train_per_sec_per_gpu": 35.21, @@ -1803,223 +1803,223 @@ }, { "epoch": 0.50390625, - "grad_norm": 0.29427066445350647, + "grad_norm": 0.03311942145228386, "learning_rate": 9.042669919862615e-05, - "loss": 0.002471367595717311, + "loss": 0.00027762592071667314, "memory/device_reserved (GiB)": 36.0, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.00247, + "ppl": 1.00028, "step": 129, "tokens/total": 3902640, - "tokens/train_per_sec_per_gpu": 31.94, + "tokens/train_per_sec_per_gpu": 31.97, "tokens/trainable": 58896 }, { "epoch": 0.5078125, - "grad_norm": 0.024222422391176224, + "grad_norm": 0.019396035000681877, "learning_rate": 9.024696378701557e-05, - "loss": 0.00013285802560858428, + "loss": 8.183176396414638e-05, "memory/device_reserved (GiB)": 34.68, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00008, "step": 130, "tokens/total": 3933104, - "tokens/train_per_sec_per_gpu": 35.79, + "tokens/train_per_sec_per_gpu": 35.8, "tokens/trainable": 59356 }, { "epoch": 0.51171875, - "grad_norm": 3.2403194904327393, + "grad_norm": 0.3952345848083496, "learning_rate": 9.006576160536948e-05, - "loss": 0.013489946722984314, + "loss": 0.005079061258584261, "memory/device_reserved (GiB)": 34.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.01358, + "ppl": 1.00509, "step": 131, "tokens/total": 3963184, - "tokens/train_per_sec_per_gpu": 32.14, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 59792 }, { "epoch": 0.515625, - "grad_norm": 0.14770789444446564, + "grad_norm": 0.03258282318711281, "learning_rate": 8.988310019425035e-05, - "loss": 0.0009925956837832928, + "loss": 0.00015263023669831455, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00099, + "ppl": 1.00015, "step": 132, "tokens/total": 3993648, - "tokens/train_per_sec_per_gpu": 35.66, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 60266 }, { "epoch": 0.51953125, - "grad_norm": 1.2149583101272583, + "grad_norm": 0.10869178175926208, "learning_rate": 8.969898715494506e-05, - "loss": 0.005480521358549595, + "loss": 0.00033613567939028144, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0055, + "ppl": 1.00034, "step": 133, "tokens/total": 4024000, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.44, "tokens/trainable": 60759 }, { "epoch": 0.5234375, - "grad_norm": 0.24377752840518951, + "grad_norm": 0.016073748469352722, "learning_rate": 8.951343014914869e-05, - "loss": 0.0011378922499716282, + "loss": 0.00014354957966133952, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.39, "memory/max_allocated (GiB)": 33.39, - "ppl": 1.00114, + "ppl": 1.00014, "step": 134, "tokens/total": 4052480, - "tokens/train_per_sec_per_gpu": 31.71, + "tokens/train_per_sec_per_gpu": 31.76, "tokens/trainable": 61204 }, { "epoch": 0.52734375, - "grad_norm": 0.8190546631813049, + "grad_norm": 0.5635335445404053, "learning_rate": 8.932643689864568e-05, - "loss": 0.004931692034006119, + "loss": 0.0033080782741308212, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00494, + "ppl": 1.00331, "step": 135, "tokens/total": 4082864, - "tokens/train_per_sec_per_gpu": 35.88, + "tokens/train_per_sec_per_gpu": 35.93, "tokens/trainable": 61684 }, { "epoch": 0.53125, - "grad_norm": 0.7444491982460022, + "grad_norm": 0.12933659553527832, "learning_rate": 8.913801518498845e-05, - "loss": 0.00953812524676323, + "loss": 0.0003551081463228911, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.7, "memory/max_allocated (GiB)": 33.7, - "ppl": 1.00958, + "ppl": 1.00036, "step": 136, "tokens/total": 4113040, - "tokens/train_per_sec_per_gpu": 38.18, + "tokens/train_per_sec_per_gpu": 38.22, "tokens/trainable": 62159 }, { "epoch": 0.53515625, - "grad_norm": 0.017797501757740974, + "grad_norm": 0.038116879761219025, "learning_rate": 8.894817284917364e-05, - "loss": 0.00010352014214731753, + "loss": 0.0002933211508207023, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0001, + "ppl": 1.00029, "step": 137, "tokens/total": 4143344, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.28, "tokens/trainable": 62649 }, { "epoch": 0.5390625, - "grad_norm": 0.14133845269680023, + "grad_norm": 0.4708496928215027, "learning_rate": 8.875691779131569e-05, - "loss": 0.0006721644895151258, + "loss": 0.009557873010635376, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00067, + "ppl": 1.0096, "step": 138, "tokens/total": 4173648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.65, "tokens/trainable": 63100 }, { "epoch": 0.54296875, - "grad_norm": 0.7884437441825867, + "grad_norm": 0.6401950120925903, "learning_rate": 8.856425797031829e-05, - "loss": 0.0070602125488221645, + "loss": 0.006467439234256744, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00709, + "ppl": 1.00649, "step": 139, "tokens/total": 4204080, - "tokens/train_per_sec_per_gpu": 37.51, + "tokens/train_per_sec_per_gpu": 37.56, "tokens/trainable": 63588 }, { "epoch": 0.546875, - "grad_norm": 2.1515400409698486, + "grad_norm": 0.9977340698242188, "learning_rate": 8.837020140354295e-05, - "loss": 0.04659099504351616, + "loss": 0.01085682213306427, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.42, "memory/max_allocated (GiB)": 33.42, - "ppl": 1.04769, + "ppl": 1.01092, "step": 140, "tokens/total": 4232400, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 64005 }, { "epoch": 0.55078125, - "grad_norm": 0.9182130098342896, + "grad_norm": 0.9310302734375, "learning_rate": 8.817475616647554e-05, - "loss": 0.01849653385579586, + "loss": 0.002832747297361493, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01867, + "ppl": 1.00284, "step": 141, "tokens/total": 4262624, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 64462 }, { "epoch": 0.5546875, - "grad_norm": 0.049818869680166245, + "grad_norm": 0.8448959589004517, "learning_rate": 8.797793039239017e-05, - "loss": 0.0007528763962909579, + "loss": 0.00225994479842484, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00075, + "ppl": 1.00226, "step": 142, "tokens/total": 4293168, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.93, "tokens/trainable": 64900 }, { "epoch": 0.55859375, - "grad_norm": 0.4962376654148102, + "grad_norm": 0.1500774621963501, "learning_rate": 8.777973227201069e-05, - "loss": 0.013024947606027126, + "loss": 0.001096544205211103, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01311, + "ppl": 1.0011, "step": 143, "tokens/total": 4323248, - "tokens/train_per_sec_per_gpu": 37.45, + "tokens/train_per_sec_per_gpu": 37.52, "tokens/trainable": 65379 }, { "epoch": 0.5625, - "grad_norm": 0.09980953484773636, + "grad_norm": 0.7080555558204651, "learning_rate": 8.758017005316988e-05, - "loss": 0.0013438962632790208, + "loss": 0.02480880171060562, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00134, + "ppl": 1.02512, "step": 144, "tokens/total": 4353344, "tokens/train_per_sec_per_gpu": 36.69, @@ -2027,181 +2027,181 @@ }, { "epoch": 0.56640625, - "grad_norm": 0.2499600648880005, + "grad_norm": 0.8302886486053467, "learning_rate": 8.737925204046629e-05, - "loss": 0.005669259466230869, + "loss": 0.011632976122200489, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00569, + "ppl": 1.0117, "step": 145, "tokens/total": 4383584, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 66285 }, { "epoch": 0.5703125, - "grad_norm": 0.8080663084983826, + "grad_norm": 0.48007094860076904, "learning_rate": 8.717698659491851e-05, - "loss": 0.03145892918109894, + "loss": 0.006236276589334011, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.03196, + "ppl": 1.00626, "step": 146, "tokens/total": 4413856, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 66736 }, { "epoch": 0.57421875, - "grad_norm": 0.29324567317962646, + "grad_norm": 0.2671569585800171, "learning_rate": 8.697338213361735e-05, - "loss": 0.008183630183339119, + "loss": 0.004551246762275696, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00822, + "ppl": 1.00456, "step": 147, "tokens/total": 4444112, - "tokens/train_per_sec_per_gpu": 35.2, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 67150 }, { "epoch": 0.578125, - "grad_norm": 0.5702983736991882, + "grad_norm": 0.2333666980266571, "learning_rate": 8.676844712937552e-05, - "loss": 0.00848381593823433, + "loss": 0.005151683464646339, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00852, + "ppl": 1.00516, "step": 148, "tokens/total": 4474464, - "tokens/train_per_sec_per_gpu": 35.02, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 67633 }, { "epoch": 0.58203125, - "grad_norm": 0.12609520554542542, + "grad_norm": 1.3599361181259155, "learning_rate": 8.656219011037509e-05, - "loss": 0.002346089808270335, + "loss": 0.010383867658674717, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00235, + "ppl": 1.01044, "step": 149, "tokens/total": 4504880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.82, "tokens/trainable": 68077 }, { "epoch": 0.5859375, - "grad_norm": 0.044832926243543625, + "grad_norm": 0.2275276631116867, "learning_rate": 8.63546196598125e-05, - "loss": 0.000866610265802592, + "loss": 0.0016249704640358686, "memory/device_reserved (GiB)": 35.79, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00087, + "ppl": 1.00163, "step": 150, "tokens/total": 4534976, - "tokens/train_per_sec_per_gpu": 33.21, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 68545 }, { "epoch": 0.58984375, - "grad_norm": 0.2726699113845825, + "grad_norm": 0.6304328441619873, "learning_rate": 8.614574441554145e-05, - "loss": 0.010688753798604012, + "loss": 0.02714025229215622, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.01075, + "ppl": 1.02751, "step": 151, "tokens/total": 4565088, - "tokens/train_per_sec_per_gpu": 30.17, + "tokens/train_per_sec_per_gpu": 30.26, "tokens/trainable": 69011 }, { "epoch": 0.59375, - "grad_norm": 0.6334059238433838, + "grad_norm": 0.3306228518486023, "learning_rate": 8.593557306971349e-05, - "loss": 0.007179228588938713, + "loss": 0.006482407916337252, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00721, + "ppl": 1.0065, "step": 152, "tokens/total": 4595600, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 69465 }, { "epoch": 0.59765625, - "grad_norm": 0.6207929849624634, + "grad_norm": 2.509195566177368, "learning_rate": 8.572411436841618e-05, - "loss": 0.005558713339269161, + "loss": 0.014876915141940117, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00557, + "ppl": 1.01499, "step": 153, "tokens/total": 4626032, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.89, "tokens/trainable": 69928 }, { "epoch": 0.6015625, - "grad_norm": 0.14352096617221832, + "grad_norm": 0.08186601847410202, "learning_rate": 8.551137711130922e-05, - "loss": 0.0009000393329188228, + "loss": 0.0014128303155303001, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0009, + "ppl": 1.00141, "step": 154, "tokens/total": 4656352, - "tokens/train_per_sec_per_gpu": 36.64, + "tokens/train_per_sec_per_gpu": 36.67, "tokens/trainable": 70395 }, { "epoch": 0.60546875, - "grad_norm": 0.37536460161209106, + "grad_norm": 0.20300441980361938, "learning_rate": 8.529737015125824e-05, - "loss": 0.0032662933226674795, + "loss": 0.0016238696407526731, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00327, + "ppl": 1.00163, "step": 155, "tokens/total": 4684672, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 70829 }, { "epoch": 0.609375, - "grad_norm": 0.8182935118675232, + "grad_norm": 0.10475975275039673, "learning_rate": 8.508210239396639e-05, - "loss": 0.015120145864784718, + "loss": 0.0014675778802484274, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01524, + "ppl": 1.00147, "step": 156, "tokens/total": 4715216, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.88, "tokens/trainable": 71287 }, { "epoch": 0.61328125, - "grad_norm": 0.05925029143691063, + "grad_norm": 0.2740918695926666, "learning_rate": 8.486558279760375e-05, - "loss": 0.00020593182125594467, + "loss": 0.004101475700736046, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00021, + "ppl": 1.00411, "step": 157, "tokens/total": 4745376, "tokens/train_per_sec_per_gpu": 34.95, @@ -2209,405 +2209,405 @@ }, { "epoch": 0.6171875, - "grad_norm": 0.5880815982818604, + "grad_norm": 0.30794957280158997, "learning_rate": 8.464782037243449e-05, - "loss": 0.011222876608371735, + "loss": 0.0044078221544623375, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01129, + "ppl": 1.00442, "step": 158, "tokens/total": 4775776, - "tokens/train_per_sec_per_gpu": 32.03, + "tokens/train_per_sec_per_gpu": 32.18, "tokens/trainable": 72185 }, { "epoch": 0.62109375, - "grad_norm": 0.1880187839269638, + "grad_norm": 0.3344379961490631, "learning_rate": 8.442882418044202e-05, - "loss": 0.0014226734638214111, + "loss": 0.0035248196218162775, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00142, + "ppl": 1.00353, "step": 159, "tokens/total": 4805856, - "tokens/train_per_sec_per_gpu": 30.51, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 72604 }, { "epoch": 0.625, - "grad_norm": 0.8338136076927185, + "grad_norm": 0.6211779117584229, "learning_rate": 8.420860333495179e-05, - "loss": 0.018916597589850426, + "loss": 0.015572377480566502, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0191, + "ppl": 1.01569, "step": 160, "tokens/total": 4836304, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.56, "tokens/trainable": 73061 }, { "epoch": 0.62890625, - "grad_norm": 0.11151792109012604, + "grad_norm": 0.5694647431373596, "learning_rate": 8.398716700025208e-05, - "loss": 0.001152656739577651, + "loss": 0.005395190790295601, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.00115, + "ppl": 1.00541, "step": 161, "tokens/total": 4866544, - "tokens/train_per_sec_per_gpu": 29.97, + "tokens/train_per_sec_per_gpu": 29.98, "tokens/trainable": 73474 }, { "epoch": 0.6328125, - "grad_norm": 0.319916695356369, + "grad_norm": 0.3221203088760376, "learning_rate": 8.376452439121266e-05, - "loss": 0.0030798939988017082, + "loss": 0.004907120484858751, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00308, + "ppl": 1.00492, "step": 162, "tokens/total": 4897120, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 73923 }, { "epoch": 0.63671875, - "grad_norm": 0.23228555917739868, + "grad_norm": 0.2562556862831116, "learning_rate": 8.354068477290124e-05, - "loss": 0.0029990714974701405, + "loss": 0.011767375282943249, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.003, + "ppl": 1.01184, "step": 163, "tokens/total": 4927440, - "tokens/train_per_sec_per_gpu": 35.29, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 74379 }, { "epoch": 0.640625, - "grad_norm": 0.16945457458496094, + "grad_norm": 0.37376344203948975, "learning_rate": 8.331565746019807e-05, - "loss": 0.0036612222902476788, + "loss": 0.014833642169833183, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00367, + "ppl": 1.01494, "step": 164, "tokens/total": 4958032, - "tokens/train_per_sec_per_gpu": 33.33, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 74830 }, { "epoch": 0.64453125, - "grad_norm": 0.08089865744113922, + "grad_norm": 0.07679534703493118, "learning_rate": 8.308945181740812e-05, - "loss": 0.0011908983578905463, + "loss": 0.0006800079718232155, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00119, + "ppl": 1.00068, "step": 165, "tokens/total": 4988368, - "tokens/train_per_sec_per_gpu": 31.57, + "tokens/train_per_sec_per_gpu": 31.73, "tokens/trainable": 75262 }, { "epoch": 0.6484375, - "grad_norm": 0.06332889199256897, + "grad_norm": 0.15940658748149872, "learning_rate": 8.286207725787153e-05, - "loss": 0.0010977290803566575, + "loss": 0.0005167147610336542, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.0011, + "ppl": 1.00052, "step": 166, "tokens/total": 5018672, - "tokens/train_per_sec_per_gpu": 31.75, + "tokens/train_per_sec_per_gpu": 31.84, "tokens/trainable": 75703 }, { "epoch": 0.65234375, - "grad_norm": 0.058639127761125565, + "grad_norm": 0.18865765631198883, "learning_rate": 8.263354324357182e-05, - "loss": 0.000854893063660711, + "loss": 0.003161062952131033, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00086, + "ppl": 1.00317, "step": 167, "tokens/total": 5049344, - "tokens/train_per_sec_per_gpu": 31.26, + "tokens/train_per_sec_per_gpu": 31.3, "tokens/trainable": 76164 }, { "epoch": 0.65625, - "grad_norm": 0.19198745489120483, + "grad_norm": 0.3047192096710205, "learning_rate": 8.240385928474219e-05, - "loss": 0.0024191238917410374, + "loss": 0.010941199027001858, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00242, + "ppl": 1.011, "step": 168, "tokens/total": 5079856, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 76623 }, { "epoch": 0.66015625, - "grad_norm": 0.033948056399822235, + "grad_norm": 0.39291632175445557, "learning_rate": 8.217303493946967e-05, - "loss": 0.000675962888635695, + "loss": 0.009001722559332848, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00068, + "ppl": 1.00904, "step": 169, "tokens/total": 5110192, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 77047 }, { "epoch": 0.6640625, - "grad_norm": 0.10515601187944412, + "grad_norm": 0.09876111894845963, "learning_rate": 8.194107981329746e-05, - "loss": 0.0006985474610701203, + "loss": 0.0014627808704972267, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0007, + "ppl": 1.00146, "step": 170, "tokens/total": 5140592, - "tokens/train_per_sec_per_gpu": 33.98, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 77496 }, { "epoch": 0.66796875, - "grad_norm": 0.01597985066473484, + "grad_norm": 0.02293679490685463, "learning_rate": 8.170800355882518e-05, - "loss": 0.0002490747720003128, + "loss": 0.00041422739741392434, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00025, + "ppl": 1.00041, "step": 171, "tokens/total": 5170848, - "tokens/train_per_sec_per_gpu": 33.13, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 77956 }, { "epoch": 0.671875, - "grad_norm": 0.28580594062805176, + "grad_norm": 0.2762586176395416, "learning_rate": 8.147381587530713e-05, - "loss": 0.002719157375395298, + "loss": 0.006397426128387451, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00272, + "ppl": 1.00642, "step": 172, "tokens/total": 5201280, - "tokens/train_per_sec_per_gpu": 29.75, + "tokens/train_per_sec_per_gpu": 29.78, "tokens/trainable": 78410 }, { "epoch": 0.67578125, - "grad_norm": 0.027172744274139404, + "grad_norm": 0.07085710763931274, "learning_rate": 8.123852650824877e-05, - "loss": 0.0005204043700359762, + "loss": 0.0017267607618123293, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00052, + "ppl": 1.00173, "step": 173, "tokens/total": 5231712, - "tokens/train_per_sec_per_gpu": 33.04, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 78849 }, { "epoch": 0.6796875, - "grad_norm": 2.8796133995056152, + "grad_norm": 0.4523530602455139, "learning_rate": 8.100214524900103e-05, - "loss": 0.015293785370886326, + "loss": 0.011936807073652744, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.62, "memory/max_allocated (GiB)": 33.62, - "ppl": 1.01541, + "ppl": 1.01201, "step": 174, "tokens/total": 5261440, - "tokens/train_per_sec_per_gpu": 29.53, + "tokens/train_per_sec_per_gpu": 30.07, "tokens/trainable": 79266 }, { "epoch": 0.68359375, - "grad_norm": 0.1005098894238472, + "grad_norm": 0.1293293535709381, "learning_rate": 8.076468193435301e-05, - "loss": 0.0010334225371479988, + "loss": 0.0021572443656623363, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00103, + "ppl": 1.00216, "step": 175, "tokens/total": 5291728, - "tokens/train_per_sec_per_gpu": 32.42, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 79736 }, { "epoch": 0.6875, - "grad_norm": 0.6506177186965942, + "grad_norm": 0.13209661841392517, "learning_rate": 8.052614644612253e-05, - "loss": 0.0038155291695147753, + "loss": 0.0017078389646485448, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00382, + "ppl": 1.00171, "step": 176, "tokens/total": 5322240, - "tokens/train_per_sec_per_gpu": 36.12, + "tokens/train_per_sec_per_gpu": 36.17, "tokens/trainable": 80214 }, { "epoch": 0.69140625, - "grad_norm": 0.19899244606494904, + "grad_norm": 0.09734465181827545, "learning_rate": 8.028654871074489e-05, - "loss": 0.0020266459323465824, + "loss": 0.0020819404162466526, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00203, + "ppl": 1.00208, "step": 177, "tokens/total": 5352576, - "tokens/train_per_sec_per_gpu": 32.51, + "tokens/train_per_sec_per_gpu": 32.56, "tokens/trainable": 80661 }, { "epoch": 0.6953125, - "grad_norm": 0.009929690510034561, + "grad_norm": 0.8079077005386353, "learning_rate": 8.004589869885986e-05, - "loss": 0.00014211784582585096, + "loss": 0.006122267805039883, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00014, + "ppl": 1.00614, "step": 178, "tokens/total": 5382784, - "tokens/train_per_sec_per_gpu": 34.81, + "tokens/train_per_sec_per_gpu": 34.82, "tokens/trainable": 81129 }, { "epoch": 0.69921875, - "grad_norm": 0.5209382176399231, + "grad_norm": 0.806120753288269, "learning_rate": 7.980420642489674e-05, - "loss": 0.023224791511893272, + "loss": 0.003698066109791398, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0235, + "ppl": 1.0037, "step": 179, "tokens/total": 5412784, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 81576 }, { "epoch": 0.703125, - "grad_norm": 0.02280755713582039, + "grad_norm": 0.0535414032638073, "learning_rate": 7.95614819466576e-05, - "loss": 0.0002463866549078375, + "loss": 0.0007224087603390217, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00025, + "ppl": 1.00072, "step": 180, "tokens/total": 5442960, - "tokens/train_per_sec_per_gpu": 34.49, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 82049 }, { "epoch": 0.70703125, - "grad_norm": 0.3769514262676239, + "grad_norm": 0.8787689208984375, "learning_rate": 7.931773536489872e-05, - "loss": 0.01167471706867218, + "loss": 0.014041105285286903, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.01174, + "ppl": 1.01414, "step": 181, "tokens/total": 5473216, - "tokens/train_per_sec_per_gpu": 38.75, + "tokens/train_per_sec_per_gpu": 38.79, "tokens/trainable": 82566 }, { "epoch": 0.7109375, - "grad_norm": 0.060761548578739166, + "grad_norm": 0.23288801312446594, "learning_rate": 7.907297682291035e-05, - "loss": 0.000216186250327155, + "loss": 0.0018348076846450567, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00022, + "ppl": 1.00184, "step": 182, "tokens/total": 5503568, - "tokens/train_per_sec_per_gpu": 33.83, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 83054 }, { "epoch": 0.71484375, - "grad_norm": 0.03373813256621361, + "grad_norm": 0.08039269596338272, "learning_rate": 7.882721650609442e-05, - "loss": 0.00041355923167429864, + "loss": 0.0011233665281906724, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00041, + "ppl": 1.00112, "step": 183, "tokens/total": 5533760, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 83501 }, { "epoch": 0.71875, - "grad_norm": 0.036661963909864426, + "grad_norm": 0.028009524568915367, "learning_rate": 7.85804646415409e-05, - "loss": 0.00041001036879606545, + "loss": 0.00045670082909055054, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00041, + "ppl": 1.00046, "step": 184, "tokens/total": 5564240, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 84007 }, { "epoch": 0.72265625, - "grad_norm": 0.03234419599175453, + "grad_norm": 0.04383641108870506, "learning_rate": 7.833273149760207e-05, - "loss": 0.0003714286140166223, + "loss": 0.00067467603366822, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00037, + "ppl": 1.00067, "step": 185, "tokens/total": 5594448, - "tokens/train_per_sec_per_gpu": 35.39, + "tokens/train_per_sec_per_gpu": 35.54, "tokens/trainable": 84491 }, { "epoch": 0.7265625, - "grad_norm": 0.03076508454978466, + "grad_norm": 0.1170438677072525, "learning_rate": 7.808402738346527e-05, - "loss": 0.0003759118844754994, + "loss": 0.0014282094780355692, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00038, + "ppl": 1.00143, "step": 186, "tokens/total": 5624816, "tokens/train_per_sec_per_gpu": 33.33, @@ -2615,181 +2615,181 @@ }, { "epoch": 0.73046875, - "grad_norm": 0.6632063388824463, + "grad_norm": 0.05614401772618294, "learning_rate": 7.783436264872382e-05, - "loss": 0.002438098657876253, + "loss": 0.0002470523177180439, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00244, + "ppl": 1.00025, "step": 187, "tokens/total": 5655104, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.92, "tokens/trainable": 85400 }, { "epoch": 0.734375, - "grad_norm": 0.2651624083518982, + "grad_norm": 0.30610957741737366, "learning_rate": 7.758374768294647e-05, - "loss": 0.002341378014534712, + "loss": 0.004403322469443083, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00234, + "ppl": 1.00441, "step": 188, "tokens/total": 5685360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 85889 }, { "epoch": 0.73828125, - "grad_norm": 0.305477112531662, + "grad_norm": 0.433325856924057, "learning_rate": 7.733219291524489e-05, - "loss": 0.0016374983824789524, + "loss": 0.005490327253937721, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00164, + "ppl": 1.00551, "step": 189, "tokens/total": 5715648, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 86396 }, { "epoch": 0.7421875, - "grad_norm": 0.2344018816947937, + "grad_norm": 0.4976643919944763, "learning_rate": 7.707970881383977e-05, - "loss": 0.002069709589704871, + "loss": 0.006626967806369066, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00207, + "ppl": 1.00665, "step": 190, "tokens/total": 5746240, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.85, "tokens/trainable": 86867 }, { "epoch": 0.74609375, - "grad_norm": 0.09677010774612427, + "grad_norm": 1.0000759363174438, "learning_rate": 7.682630588562518e-05, - "loss": 0.0006176180904731154, + "loss": 0.009028773754835129, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00062, + "ppl": 1.00907, "step": 191, "tokens/total": 5776816, - "tokens/train_per_sec_per_gpu": 36.03, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 87314 }, { "epoch": 0.75, - "grad_norm": 0.05828038975596428, + "grad_norm": 0.006456763483583927, "learning_rate": 7.657199467573129e-05, - "loss": 0.0004249829798936844, + "loss": 5.810559741803445e-05, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00043, + "ppl": 1.00006, "step": 192, "tokens/total": 5807248, - "tokens/train_per_sec_per_gpu": 30.29, + "tokens/train_per_sec_per_gpu": 30.38, "tokens/trainable": 87736 }, { "epoch": 0.75390625, - "grad_norm": 0.09240972250699997, + "grad_norm": 0.6312516331672668, "learning_rate": 7.631678576708561e-05, - "loss": 0.0003209684509783983, + "loss": 0.0015132949920371175, "memory/device_reserved (GiB)": 36.02, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00032, + "ppl": 1.00151, "step": 193, "tokens/total": 5837680, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 88219 }, { "epoch": 0.7578125, - "grad_norm": 0.00590590201318264, + "grad_norm": 0.003887161612510681, "learning_rate": 7.606068977997255e-05, - "loss": 7.823687337804586e-05, + "loss": 3.5049586585955694e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00004, "step": 194, "tokens/total": 5868000, - "tokens/train_per_sec_per_gpu": 36.11, + "tokens/train_per_sec_per_gpu": 36.15, "tokens/trainable": 88699 }, { "epoch": 0.76171875, - "grad_norm": 0.45261114835739136, + "grad_norm": 0.05365428328514099, "learning_rate": 7.580371737159148e-05, - "loss": 0.0019616044592112303, + "loss": 0.00017142925935331732, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00196, + "ppl": 1.00017, "step": 195, "tokens/total": 5896224, - "tokens/train_per_sec_per_gpu": 30.36, + "tokens/train_per_sec_per_gpu": 30.39, "tokens/trainable": 89132 }, { "epoch": 0.765625, - "grad_norm": 0.03762947395443916, + "grad_norm": 1.5210427045822144, "learning_rate": 7.554587923561324e-05, - "loss": 0.0004910373827442527, + "loss": 0.007072226610034704, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00049, + "ppl": 1.0071, "step": 196, "tokens/total": 5926624, - "tokens/train_per_sec_per_gpu": 37.21, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 89594 }, { "epoch": 0.76953125, - "grad_norm": 0.37914252281188965, + "grad_norm": 0.01594001241028309, "learning_rate": 7.528718610173511e-05, - "loss": 0.005961633287370205, + "loss": 0.00012487987987697124, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.34, "memory/max_allocated (GiB)": 33.34, - "ppl": 1.00598, + "ppl": 1.00012, "step": 197, "tokens/total": 5954944, - "tokens/train_per_sec_per_gpu": 37.98, + "tokens/train_per_sec_per_gpu": 38.08, "tokens/trainable": 90042 }, { "epoch": 0.7734375, - "grad_norm": 0.061283551156520844, + "grad_norm": 0.48730939626693726, "learning_rate": 7.502764873523431e-05, - "loss": 0.0004046210669912398, + "loss": 0.004653760232031345, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0004, + "ppl": 1.00466, "step": 198, "tokens/total": 5985200, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 90503 }, { "epoch": 0.77734375, - "grad_norm": 0.012014869600534439, + "grad_norm": 0.06984082609415054, "learning_rate": 7.476727793652011e-05, - "loss": 0.00018992810510098934, + "loss": 0.0007038296316750348, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00019, + "ppl": 1.0007, "step": 199, "tokens/total": 6015952, "tokens/train_per_sec_per_gpu": 36.46, @@ -2797,405 +2797,405 @@ }, { "epoch": 0.78125, - "grad_norm": 0.039138417690992355, + "grad_norm": 0.09596561640501022, "learning_rate": 7.450608454068415e-05, - "loss": 0.0003556829469744116, + "loss": 0.0010627463925629854, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00036, + "ppl": 1.00106, "step": 200, "tokens/total": 6046208, - "tokens/train_per_sec_per_gpu": 39.22, + "tokens/train_per_sec_per_gpu": 39.3, "tokens/trainable": 91466 }, { "epoch": 0.78515625, - "grad_norm": 0.0454350970685482, + "grad_norm": 0.03423153981566429, "learning_rate": 7.424407941704987e-05, - "loss": 0.00024555803975090384, + "loss": 0.00040728453313931823, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00025, + "ppl": 1.00041, "step": 201, "tokens/total": 6076208, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 91912 }, { "epoch": 0.7890625, - "grad_norm": 0.6254648566246033, + "grad_norm": 0.2397124022245407, "learning_rate": 7.398127346871986e-05, - "loss": 0.009876105934381485, + "loss": 0.0034314473159611225, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00993, + "ppl": 1.00344, "step": 202, "tokens/total": 6106560, - "tokens/train_per_sec_per_gpu": 37.79, + "tokens/train_per_sec_per_gpu": 37.86, "tokens/trainable": 92385 }, { "epoch": 0.79296875, - "grad_norm": 0.7776591181755066, + "grad_norm": 0.8799890875816345, "learning_rate": 7.371767763212238e-05, - "loss": 0.011619904078543186, + "loss": 0.021598415449261665, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01169, + "ppl": 1.02183, "step": 203, "tokens/total": 6136640, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 92842 }, { "epoch": 0.796875, - "grad_norm": 0.07254572212696075, + "grad_norm": 0.12073227018117905, "learning_rate": 7.345330287655617e-05, - "loss": 0.0005007775034755468, + "loss": 0.0006239307695068419, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0005, + "ppl": 1.00062, "step": 204, "tokens/total": 6167184, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.97, "tokens/trainable": 93323 }, { "epoch": 0.80078125, - "grad_norm": 0.6082178950309753, + "grad_norm": 0.3556082844734192, "learning_rate": 7.31881602037339e-05, - "loss": 0.007061033509671688, + "loss": 0.0026657599955797195, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00709, + "ppl": 1.00267, "step": 205, "tokens/total": 6197376, - "tokens/train_per_sec_per_gpu": 34.75, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 93756 }, { "epoch": 0.8046875, - "grad_norm": 0.4930607080459595, + "grad_norm": 0.24451178312301636, "learning_rate": 7.29222606473245e-05, - "loss": 0.006006345152854919, + "loss": 0.0015720583032816648, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00602, + "ppl": 1.00157, "step": 206, "tokens/total": 6227600, - "tokens/train_per_sec_per_gpu": 37.47, + "tokens/train_per_sec_per_gpu": 37.54, "tokens/trainable": 94235 }, { "epoch": 0.80859375, - "grad_norm": 0.06813386082649231, + "grad_norm": 0.23219481110572815, "learning_rate": 7.265561527249383e-05, - "loss": 0.0006858796114102006, + "loss": 0.0031918964814394712, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00069, + "ppl": 1.0032, "step": 207, "tokens/total": 6257760, - "tokens/train_per_sec_per_gpu": 36.48, + "tokens/train_per_sec_per_gpu": 36.52, "tokens/trainable": 94733 }, { "epoch": 0.8125, - "grad_norm": 0.06703829765319824, + "grad_norm": 0.13691213726997375, "learning_rate": 7.238823517544436e-05, - "loss": 0.001039305585436523, + "loss": 0.0018865278689190745, "memory/device_reserved (GiB)": 35.93, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00104, + "ppl": 1.00189, "step": 208, "tokens/total": 6288048, - "tokens/train_per_sec_per_gpu": 33.68, + "tokens/train_per_sec_per_gpu": 33.74, "tokens/trainable": 95218 }, { "epoch": 0.81640625, - "grad_norm": 0.2953227460384369, + "grad_norm": 0.2183372676372528, "learning_rate": 7.212013148295333e-05, - "loss": 0.0037906011566519737, + "loss": 0.0018021916039288044, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.0038, + "ppl": 1.0018, "step": 209, "tokens/total": 6318688, - "tokens/train_per_sec_per_gpu": 29.17, + "tokens/train_per_sec_per_gpu": 29.23, "tokens/trainable": 95619 }, { "epoch": 0.8203125, - "grad_norm": 0.32579171657562256, + "grad_norm": 0.8775327801704407, "learning_rate": 7.185131535190975e-05, - "loss": 0.002393842674791813, + "loss": 0.01249875407665968, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.0024, + "ppl": 1.01258, "step": 210, "tokens/total": 6348944, - "tokens/train_per_sec_per_gpu": 35.32, + "tokens/train_per_sec_per_gpu": 35.39, "tokens/trainable": 96076 }, { "epoch": 0.82421875, - "grad_norm": 0.4734557271003723, + "grad_norm": 0.4041156768798828, "learning_rate": 7.158179796885005e-05, - "loss": 0.006001632194966078, + "loss": 0.0069442871026694775, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00602, + "ppl": 1.00697, "step": 211, "tokens/total": 6378960, - "tokens/train_per_sec_per_gpu": 35.28, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 96505 }, { "epoch": 0.828125, - "grad_norm": 0.15732432901859283, + "grad_norm": 0.5414943099021912, "learning_rate": 7.131159054949273e-05, - "loss": 0.003803959349170327, + "loss": 0.0017384262755513191, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00381, + "ppl": 1.00174, "step": 212, "tokens/total": 6409472, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 32.68, "tokens/trainable": 96930 }, { "epoch": 0.83203125, - "grad_norm": 0.18325994908809662, + "grad_norm": 0.010344896465539932, "learning_rate": 7.104070433827139e-05, - "loss": 0.005038415547460318, + "loss": 0.0002013841731240973, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00505, + "ppl": 1.0002, "step": 213, "tokens/total": 6439904, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.72, "tokens/trainable": 97361 }, { "epoch": 0.8359375, - "grad_norm": 0.17816093564033508, + "grad_norm": 0.5833696722984314, "learning_rate": 7.076915060786705e-05, - "loss": 0.0020862463861703873, + "loss": 0.009723629802465439, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00209, + "ppl": 1.00977, "step": 214, "tokens/total": 6470176, - "tokens/train_per_sec_per_gpu": 36.26, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 97858 }, { "epoch": 0.83984375, - "grad_norm": 0.2746942937374115, + "grad_norm": 0.31467050313949585, "learning_rate": 7.049694065873882e-05, - "loss": 0.005029214546084404, + "loss": 0.004062815103679895, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00504, + "ppl": 1.00407, "step": 215, "tokens/total": 6500336, - "tokens/train_per_sec_per_gpu": 37.41, + "tokens/train_per_sec_per_gpu": 37.47, "tokens/trainable": 98308 }, { "epoch": 0.84375, - "grad_norm": 0.4508717358112335, + "grad_norm": 0.013619605451822281, "learning_rate": 7.022408581865382e-05, - "loss": 0.0054893530905246735, + "loss": 0.0002783117815852165, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0055, + "ppl": 1.00028, "step": 216, "tokens/total": 6530688, - "tokens/train_per_sec_per_gpu": 36.34, + "tokens/train_per_sec_per_gpu": 36.41, "tokens/trainable": 98781 }, { "epoch": 0.84765625, - "grad_norm": 0.23194828629493713, + "grad_norm": 0.02845357358455658, "learning_rate": 6.99505974422157e-05, - "loss": 0.0034187212586402893, + "loss": 0.00029517346411012113, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00342, + "ppl": 1.0003, "step": 217, "tokens/total": 6561040, - "tokens/train_per_sec_per_gpu": 36.67, + "tokens/train_per_sec_per_gpu": 36.76, "tokens/trainable": 99266 }, { "epoch": 0.8515625, - "grad_norm": 0.06469441950321198, + "grad_norm": 0.17569833993911743, "learning_rate": 6.967648691039213e-05, - "loss": 0.0009051199886016548, + "loss": 0.0029272970277816057, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00091, + "ppl": 1.00293, "step": 218, "tokens/total": 6589392, - "tokens/train_per_sec_per_gpu": 39.6, + "tokens/train_per_sec_per_gpu": 39.65, "tokens/trainable": 99731 }, { "epoch": 0.85546875, - "grad_norm": 0.06683141738176346, + "grad_norm": 0.25007033348083496, "learning_rate": 6.940176563004123e-05, - "loss": 0.0011187575291842222, + "loss": 0.005346981342881918, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00112, + "ppl": 1.00536, "step": 219, "tokens/total": 6619824, - "tokens/train_per_sec_per_gpu": 31.66, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 100164 }, { "epoch": 0.859375, - "grad_norm": 0.1525852382183075, + "grad_norm": 0.36598774790763855, "learning_rate": 6.912644503343682e-05, - "loss": 0.0017743443604558706, + "loss": 0.00675960024818778, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00178, + "ppl": 1.00678, "step": 220, "tokens/total": 6650224, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.18, "tokens/trainable": 100620 }, { "epoch": 0.86328125, - "grad_norm": 0.8795211911201477, + "grad_norm": 0.2870761454105377, "learning_rate": 6.885053657779273e-05, - "loss": 0.006786257494240999, + "loss": 0.004020639695227146, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00681, + "ppl": 1.00403, "step": 221, "tokens/total": 6680384, - "tokens/train_per_sec_per_gpu": 32.9, + "tokens/train_per_sec_per_gpu": 32.94, "tokens/trainable": 101080 }, { "epoch": 0.8671875, - "grad_norm": 0.19531063735485077, + "grad_norm": 0.05318336561322212, "learning_rate": 6.857405174478604e-05, - "loss": 0.0014687087386846542, + "loss": 0.0006697649951092899, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00147, + "ppl": 1.00067, "step": 222, "tokens/total": 6710896, - "tokens/train_per_sec_per_gpu": 37.76, + "tokens/train_per_sec_per_gpu": 37.8, "tokens/trainable": 101546 }, { "epoch": 0.87109375, - "grad_norm": 0.011134379543364048, + "grad_norm": 0.016319693997502327, "learning_rate": 6.82970020400792e-05, - "loss": 0.00012406683526933193, + "loss": 0.00020417713676579297, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00012, + "ppl": 1.0002, "step": 223, "tokens/total": 6741280, - "tokens/train_per_sec_per_gpu": 31.51, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 101987 }, { "epoch": 0.875, - "grad_norm": 0.41609230637550354, + "grad_norm": 0.09935661405324936, "learning_rate": 6.801939899284132e-05, - "loss": 0.00440242001786828, + "loss": 0.0018507638014853, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00441, + "ppl": 1.00185, "step": 224, "tokens/total": 6771488, - "tokens/train_per_sec_per_gpu": 35.45, + "tokens/train_per_sec_per_gpu": 35.37, "tokens/trainable": 102435 }, { "epoch": 0.87890625, - "grad_norm": 0.23292526602745056, + "grad_norm": 0.045450225472450256, "learning_rate": 6.774125415526827e-05, - "loss": 0.000571364420466125, + "loss": 0.0007717214175499976, "memory/device_reserved (GiB)": 35.94, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00057, + "ppl": 1.00077, "step": 225, "tokens/total": 6801744, - "tokens/train_per_sec_per_gpu": 28.91, + "tokens/train_per_sec_per_gpu": 28.86, "tokens/trainable": 102843 }, { "epoch": 0.8828125, - "grad_norm": 0.016833841800689697, + "grad_norm": 0.1693895012140274, "learning_rate": 6.746257910210214e-05, - "loss": 0.00012277837959118187, + "loss": 0.0015482499729841948, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00155, "step": 226, "tokens/total": 6832432, - "tokens/train_per_sec_per_gpu": 37.37, + "tokens/train_per_sec_per_gpu": 37.39, "tokens/trainable": 103342 }, { "epoch": 0.88671875, - "grad_norm": 0.35366129875183105, + "grad_norm": 0.011035765521228313, "learning_rate": 6.718338543014937e-05, - "loss": 0.004477445501834154, + "loss": 0.0002161034499295056, "memory/device_reserved (GiB)": 35.71, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00449, + "ppl": 1.00022, "step": 227, "tokens/total": 6862448, - "tokens/train_per_sec_per_gpu": 40.68, + "tokens/train_per_sec_per_gpu": 40.81, "tokens/trainable": 103844 }, { "epoch": 0.890625, - "grad_norm": 0.4743596017360687, + "grad_norm": 0.339762806892395, "learning_rate": 6.69036847577983e-05, - "loss": 0.002162824384868145, + "loss": 0.00712943309918046, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00217, + "ppl": 1.00715, "step": 228, "tokens/total": 6892832, "tokens/train_per_sec_per_gpu": 36.23, @@ -3203,531 +3203,531 @@ }, { "epoch": 0.89453125, - "grad_norm": 0.4887899160385132, + "grad_norm": 0.022490613162517548, "learning_rate": 6.662348872453553e-05, - "loss": 0.0048948717303574085, + "loss": 0.000386083556804806, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00491, + "ppl": 1.00039, "step": 229, "tokens/total": 6922832, - "tokens/train_per_sec_per_gpu": 33.43, + "tokens/train_per_sec_per_gpu": 33.49, "tokens/trainable": 104772 }, { "epoch": 0.8984375, - "grad_norm": 0.017348933964967728, + "grad_norm": 0.030813584104180336, "learning_rate": 6.63428089904618e-05, - "loss": 7.635008660145104e-05, + "loss": 0.00022011388500686735, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00008, + "ppl": 1.00022, "step": 230, "tokens/total": 6953104, - "tokens/train_per_sec_per_gpu": 36.83, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 105240 }, { "epoch": 0.90234375, - "grad_norm": 0.3773981034755707, + "grad_norm": 0.13754640519618988, "learning_rate": 6.60616572358065e-05, - "loss": 0.003427914110943675, + "loss": 0.0012558111920952797, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00343, + "ppl": 1.00126, "step": 231, "tokens/total": 6983440, - "tokens/train_per_sec_per_gpu": 33.75, + "tokens/train_per_sec_per_gpu": 33.76, "tokens/trainable": 105703 }, { "epoch": 0.90625, - "grad_norm": 0.0006717262440361083, + "grad_norm": 0.003156182123348117, "learning_rate": 6.578004516044172e-05, - "loss": 1.8351973267272115e-05, + "loss": 6.873848178656772e-05, "memory/device_reserved (GiB)": 35.77, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00007, "step": 232, "tokens/total": 7013840, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.02, "tokens/trainable": 106179 }, { "epoch": 0.91015625, - "grad_norm": 0.0018952380632981658, + "grad_norm": 0.021215464919805527, "learning_rate": 6.549798448339548e-05, - "loss": 2.8159589419374242e-05, + "loss": 0.00016204064013436437, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00016, "step": 233, "tokens/total": 7044240, - "tokens/train_per_sec_per_gpu": 37.96, + "tokens/train_per_sec_per_gpu": 38.0, "tokens/trainable": 106683 }, { "epoch": 0.9140625, - "grad_norm": 0.04159875586628914, + "grad_norm": 0.03298190236091614, "learning_rate": 6.521548694236384e-05, - "loss": 0.0001036152389133349, + "loss": 0.0003434696700423956, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.0001, + "ppl": 1.00034, "step": 234, "tokens/total": 7074224, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 107121 }, { "epoch": 0.91796875, - "grad_norm": 0.005844940431416035, + "grad_norm": 0.08474111557006836, "learning_rate": 6.493256429322259e-05, - "loss": 5.149145727045834e-05, + "loss": 0.0006107806693762541, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00061, "step": 235, "tokens/total": 7104672, - "tokens/train_per_sec_per_gpu": 32.68, + "tokens/train_per_sec_per_gpu": 32.7, "tokens/trainable": 107561 }, { "epoch": 0.921875, - "grad_norm": 0.0022666200529783964, + "grad_norm": 0.012000355869531631, "learning_rate": 6.464922830953799e-05, - "loss": 2.886037327698432e-05, + "loss": 0.00010977509373333305, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00011, "step": 236, "tokens/total": 7134784, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 108018 }, { "epoch": 0.92578125, - "grad_norm": 0.27136701345443726, + "grad_norm": 0.011812024749815464, "learning_rate": 6.436549078207688e-05, - "loss": 0.0009024653700180352, + "loss": 6.36270415270701e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0009, + "ppl": 1.00006, "step": 237, "tokens/total": 7164960, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.32, "tokens/trainable": 108446 }, { "epoch": 0.9296875, - "grad_norm": 0.13347801566123962, + "grad_norm": 0.055643483996391296, "learning_rate": 6.408136351831592e-05, - "loss": 0.00046705722343176603, + "loss": 0.0002590732474345714, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00047, + "ppl": 1.00026, "step": 238, "tokens/total": 7195344, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.15, "tokens/trainable": 108866 }, { "epoch": 0.93359375, - "grad_norm": 0.10074340552091599, + "grad_norm": 0.7225600481033325, "learning_rate": 6.379685834195036e-05, - "loss": 0.0006794088403694332, + "loss": 0.004054174292832613, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00068, + "ppl": 1.00406, "step": 239, "tokens/total": 7225680, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 109316 }, { "epoch": 0.9375, - "grad_norm": 0.12028707563877106, + "grad_norm": 0.06819978356361389, "learning_rate": 6.351198709240186e-05, - "loss": 0.000513301754835993, + "loss": 0.00046806156751699746, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00051, + "ppl": 1.00047, "step": 240, "tokens/total": 7256112, - "tokens/train_per_sec_per_gpu": 33.26, + "tokens/train_per_sec_per_gpu": 33.27, "tokens/trainable": 109787 }, { "epoch": 0.94140625, - "grad_norm": 0.0062753986567258835, + "grad_norm": 0.17400965094566345, "learning_rate": 6.32267616243259e-05, - "loss": 3.0990675440989435e-05, + "loss": 0.0013036895543336868, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00003, + "ppl": 1.0013, "step": 241, "tokens/total": 7286384, - "tokens/train_per_sec_per_gpu": 38.3, + "tokens/train_per_sec_per_gpu": 38.35, "tokens/trainable": 110246 }, { "epoch": 0.9453125, - "grad_norm": 0.05608534440398216, + "grad_norm": 0.0573316365480423, "learning_rate": 6.294119380711849e-05, - "loss": 0.00039500967250205576, + "loss": 0.00048713054275140166, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0004, + "ppl": 1.00049, "step": 242, "tokens/total": 7316688, - "tokens/train_per_sec_per_gpu": 29.14, + "tokens/train_per_sec_per_gpu": 29.22, "tokens/trainable": 110667 }, { "epoch": 0.94921875, - "grad_norm": 0.05409131199121475, + "grad_norm": 0.8039842247962952, "learning_rate": 6.265529552442209e-05, - "loss": 0.0002061743725789711, + "loss": 0.013966547325253487, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00021, + "ppl": 1.01406, "step": 243, "tokens/total": 7346992, - "tokens/train_per_sec_per_gpu": 38.09, + "tokens/train_per_sec_per_gpu": 38.13, "tokens/trainable": 111154 }, { "epoch": 0.953125, - "grad_norm": 0.0556725338101387, + "grad_norm": 0.03269768878817558, "learning_rate": 6.236907867363127e-05, - "loss": 0.0005747157847508788, + "loss": 0.00011441730748629197, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00057, + "ppl": 1.00011, "step": 244, "tokens/total": 7377632, - "tokens/train_per_sec_per_gpu": 32.97, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 111611 }, { "epoch": 0.95703125, - "grad_norm": 0.16125747561454773, + "grad_norm": 0.006486211437731981, "learning_rate": 6.208255516539749e-05, - "loss": 0.0008788461564108729, + "loss": 4.603556953952648e-05, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00088, + "ppl": 1.00005, "step": 245, "tokens/total": 7407872, - "tokens/train_per_sec_per_gpu": 34.13, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 112102 }, { "epoch": 0.9609375, - "grad_norm": 0.00565892830491066, + "grad_norm": 0.04383692517876625, "learning_rate": 6.179573692313344e-05, - "loss": 4.069084388902411e-05, + "loss": 0.0002824773546308279, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00004, + "ppl": 1.00028, "step": 246, "tokens/total": 7438448, - "tokens/train_per_sec_per_gpu": 33.16, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 112569 }, { "epoch": 0.96484375, - "grad_norm": 0.1774720549583435, + "grad_norm": 0.16995811462402344, "learning_rate": 6.150863588251694e-05, - "loss": 0.0005083430442027748, + "loss": 0.0024534151889383793, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00051, + "ppl": 1.00246, "step": 247, "tokens/total": 7466768, - "tokens/train_per_sec_per_gpu": 37.68, + "tokens/train_per_sec_per_gpu": 37.71, "tokens/trainable": 113023 }, { "epoch": 0.96875, - "grad_norm": 0.0028223118279129267, + "grad_norm": 0.016517437994480133, "learning_rate": 6.122126399099419e-05, - "loss": 3.470741648925468e-05, + "loss": 0.00018760509556159377, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00003, + "ppl": 1.00019, "step": 248, "tokens/total": 7497360, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.12, "tokens/trainable": 113464 }, { "epoch": 0.97265625, - "grad_norm": 0.0367576889693737, + "grad_norm": 0.27915316820144653, "learning_rate": 6.0933633207282615e-05, - "loss": 8.433192851953208e-05, + "loss": 0.0029680300503969193, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00008, + "ppl": 1.00297, "step": 249, "tokens/total": 7527504, - "tokens/train_per_sec_per_gpu": 32.65, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 113908 }, { "epoch": 0.9765625, - "grad_norm": 0.11235758662223816, + "grad_norm": 0.45557740330696106, "learning_rate": 6.064575550087316e-05, - "loss": 0.0006511391839012504, + "loss": 0.005397973116487265, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00065, + "ppl": 1.00541, "step": 250, "tokens/total": 7555808, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.3, "tokens/trainable": 114348 }, { "epoch": 0.98046875, - "grad_norm": 0.049232710152864456, + "grad_norm": 0.03177047520875931, "learning_rate": 6.0357642851532245e-05, - "loss": 0.00024149491218850017, + "loss": 0.00033563212491571903, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00024, + "ppl": 1.00034, "step": 251, "tokens/total": 7586320, - "tokens/train_per_sec_per_gpu": 35.15, + "tokens/train_per_sec_per_gpu": 35.23, "tokens/trainable": 114830 }, { "epoch": 0.984375, - "grad_norm": 0.4833732545375824, + "grad_norm": 0.2969627380371094, "learning_rate": 6.0069307248803294e-05, - "loss": 0.005053690634667873, + "loss": 0.0029213305097073317, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00507, + "ppl": 1.00293, "step": 252, "tokens/total": 7616576, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 115278 }, { "epoch": 0.98828125, - "grad_norm": 0.013355270028114319, + "grad_norm": 0.09316814690828323, "learning_rate": 5.9780760691507635e-05, - "loss": 8.867261931300163e-05, + "loss": 0.00040648062713444233, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00009, + "ppl": 1.00041, "step": 253, "tokens/total": 7647152, - "tokens/train_per_sec_per_gpu": 32.21, + "tokens/train_per_sec_per_gpu": 32.29, "tokens/trainable": 115699 }, { "epoch": 0.9921875, - "grad_norm": 0.09679444134235382, + "grad_norm": 0.2160760760307312, "learning_rate": 5.9492015187245334e-05, - "loss": 0.0006353833014145494, + "loss": 0.0019942133221775293, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00064, + "ppl": 1.002, "step": 254, "tokens/total": 7677584, - "tokens/train_per_sec_per_gpu": 30.73, + "tokens/train_per_sec_per_gpu": 30.81, "tokens/trainable": 116133 }, { "epoch": 0.99609375, - "grad_norm": 0.5139889717102051, + "grad_norm": 0.08144493401050568, "learning_rate": 5.920308275189541e-05, - "loss": 0.001129151787608862, + "loss": 0.0008475447539240122, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00113, + "ppl": 1.00085, "step": 255, "tokens/total": 7708016, - "tokens/train_per_sec_per_gpu": 36.73, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 116591 }, { "epoch": 1.0, - "grad_norm": 0.00027604683418758214, + "grad_norm": 0.06008912995457649, "learning_rate": 5.8913975409115874e-05, - "loss": 7.1114727688836865e-06, + "loss": 0.0007099541835486889, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00071, "step": 256, "tokens/total": 7738608, - "tokens/train_per_sec_per_gpu": 32.04, + "tokens/train_per_sec_per_gpu": 32.11, "tokens/trainable": 117039 }, { "epoch": 1.00390625, - "grad_norm": 0.005449575372040272, + "grad_norm": 0.01939917728304863, "learning_rate": 5.8624705189843395e-05, - "loss": 2.958515688078478e-05, + "loss": 0.00010193810157943517, "memory/device_reserved (GiB)": 36.14, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.0001, "step": 257, "tokens/total": 7768944, - "tokens/train_per_sec_per_gpu": 32.24, + "tokens/train_per_sec_per_gpu": 32.49, "tokens/trainable": 117495 }, { "epoch": 1.0078125, - "grad_norm": 0.003980543464422226, + "grad_norm": 0.020724618807435036, "learning_rate": 5.833528413179249e-05, - "loss": 2.851396129699424e-05, + "loss": 0.00015316747885663062, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00003, + "ppl": 1.00015, "step": 258, "tokens/total": 7799232, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.54, "tokens/trainable": 117925 }, { "epoch": 1.01171875, - "grad_norm": 0.001549297128804028, + "grad_norm": 0.002170708030462265, "learning_rate": 5.80457242789548e-05, - "loss": 1.1607408850977663e-05, + "loss": 4.118717333767563e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00004, "step": 259, "tokens/total": 7829568, - "tokens/train_per_sec_per_gpu": 31.58, + "tokens/train_per_sec_per_gpu": 31.66, "tokens/trainable": 118373 }, { "epoch": 1.015625, - "grad_norm": 0.00039364350959658623, + "grad_norm": 0.0011113203363493085, "learning_rate": 5.77560376810977e-05, - "loss": 9.399981536262203e-06, + "loss": 2.2629777959082276e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00002, "step": 260, "tokens/total": 7860000, - "tokens/train_per_sec_per_gpu": 31.46, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 118816 }, { "epoch": 1.01953125, - "grad_norm": 0.024472124874591827, + "grad_norm": 0.01329761277884245, "learning_rate": 5.7466236393263005e-05, - "loss": 0.00013395686983130872, + "loss": 7.257944525917992e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00013, + "ppl": 1.00007, "step": 261, "tokens/total": 7890464, - "tokens/train_per_sec_per_gpu": 33.8, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 119263 }, { "epoch": 1.0234375, - "grad_norm": 0.3619483709335327, + "grad_norm": 0.060381509363651276, "learning_rate": 5.717633247526522e-05, - "loss": 0.0023931623436510563, + "loss": 5.40789587830659e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0024, + "ppl": 1.00005, "step": 262, "tokens/total": 7920944, - "tokens/train_per_sec_per_gpu": 34.66, + "tokens/train_per_sec_per_gpu": 34.79, "tokens/trainable": 119772 }, { "epoch": 1.02734375, - "grad_norm": 0.17659051716327667, + "grad_norm": 0.003907898440957069, "learning_rate": 5.688633799118971e-05, - "loss": 0.0005250183749012649, + "loss": 5.063481512479484e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00053, + "ppl": 1.00005, "step": 263, "tokens/total": 7951296, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 120269 }, { "epoch": 1.03125, - "grad_norm": 0.000787933764513582, + "grad_norm": 0.008468744345009327, "learning_rate": 5.659626500889066e-05, - "loss": 1.1148193152621388e-05, + "loss": 3.1418872822541744e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00003, "step": 264, "tokens/total": 7981856, - "tokens/train_per_sec_per_gpu": 36.96, + "tokens/train_per_sec_per_gpu": 37.05, "tokens/trainable": 120746 }, { "epoch": 1.03515625, - "grad_norm": 0.00879898015409708, + "grad_norm": 0.276324599981308, "learning_rate": 5.6306125599488905e-05, - "loss": 4.70993691124022e-05, + "loss": 0.0011993877124041319, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00005, + "ppl": 1.0012, "step": 265, "tokens/total": 8012192, - "tokens/train_per_sec_per_gpu": 38.22, + "tokens/train_per_sec_per_gpu": 38.3, "tokens/trainable": 121204 }, { "epoch": 1.0390625, - "grad_norm": 0.0005215261480771005, + "grad_norm": 0.3999474346637726, "learning_rate": 5.601593183686955e-05, - "loss": 8.791243999439757e-06, + "loss": 0.01104999240487814, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00001, + "ppl": 1.01111, "step": 266, "tokens/total": 8042736, "tokens/train_per_sec_per_gpu": 31.23, @@ -3735,1525 +3735,1525 @@ }, { "epoch": 1.04296875, - "grad_norm": 0.1482085883617401, + "grad_norm": 0.16733741760253906, "learning_rate": 5.572569579717961e-05, - "loss": 0.000805735879112035, + "loss": 0.0020670127123594284, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00081, + "ppl": 1.00207, "step": 267, "tokens/total": 8073024, - "tokens/train_per_sec_per_gpu": 40.04, + "tokens/train_per_sec_per_gpu": 40.11, "tokens/trainable": 122183 }, { "epoch": 1.046875, - "grad_norm": 0.08614944666624069, + "grad_norm": 0.03506140410900116, "learning_rate": 5.543542955832538e-05, - "loss": 0.00032304273918271065, + "loss": 0.0002631399256642908, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00032, + "ppl": 1.00026, "step": 268, "tokens/total": 8103280, - "tokens/train_per_sec_per_gpu": 35.38, + "tokens/train_per_sec_per_gpu": 35.41, "tokens/trainable": 122645 }, { "epoch": 1.05078125, - "grad_norm": 0.0005171536467969418, + "grad_norm": 0.006357306614518166, "learning_rate": 5.514514519946986e-05, - "loss": 1.1340615856170189e-05, + "loss": 7.129507866920903e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00001, + "ppl": 1.00007, "step": 269, "tokens/total": 8133440, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.09, "tokens/trainable": 123105 }, { "epoch": 1.0546875, - "grad_norm": 0.00104080094024539, + "grad_norm": 0.06588926911354065, "learning_rate": 5.485485480053015e-05, - "loss": 1.1951466149184853e-05, + "loss": 0.0005020307726226747, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00001, + "ppl": 1.0005, "step": 270, "tokens/total": 8163920, - "tokens/train_per_sec_per_gpu": 36.18, + "tokens/train_per_sec_per_gpu": 36.24, "tokens/trainable": 123595 }, { "epoch": 1.05859375, - "grad_norm": 0.005696228239685297, + "grad_norm": 0.056961171329021454, "learning_rate": 5.4564570441674645e-05, - "loss": 1.725989204715006e-05, + "loss": 0.0007095756009221077, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 271, "tokens/total": 8194032, - "tokens/train_per_sec_per_gpu": 37.59, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 124077 }, { "epoch": 1.0625, - "grad_norm": 0.0005264461506158113, + "grad_norm": 0.09018661081790924, "learning_rate": 5.42743042028204e-05, - "loss": 1.0610991921566892e-05, + "loss": 0.0002944314619526267, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00029, "step": 272, "tokens/total": 8224320, - "tokens/train_per_sec_per_gpu": 34.65, + "tokens/train_per_sec_per_gpu": 34.77, "tokens/trainable": 124547 }, { "epoch": 1.06640625, - "grad_norm": 0.08169055730104446, + "grad_norm": 0.13114672899246216, "learning_rate": 5.3984068163130464e-05, - "loss": 0.0003627589321695268, + "loss": 0.0013651850167661905, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00036, + "ppl": 1.00137, "step": 273, "tokens/total": 8254368, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 124977 }, { "epoch": 1.0703125, - "grad_norm": 0.0005202546599321067, + "grad_norm": 0.35149261355400085, "learning_rate": 5.369387440051111e-05, - "loss": 1.123354013543576e-05, + "loss": 0.003347770543769002, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00335, "step": 274, "tokens/total": 8284944, - "tokens/train_per_sec_per_gpu": 34.51, + "tokens/train_per_sec_per_gpu": 34.56, "tokens/trainable": 125438 }, { "epoch": 1.07421875, - "grad_norm": 0.0031104006338864565, + "grad_norm": 0.33942294120788574, "learning_rate": 5.340373499110935e-05, - "loss": 1.4764596926397644e-05, + "loss": 0.0012429209891706705, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00124, "step": 275, "tokens/total": 8315584, - "tokens/train_per_sec_per_gpu": 31.47, + "tokens/train_per_sec_per_gpu": 31.49, "tokens/trainable": 125889 }, { "epoch": 1.078125, - "grad_norm": 0.01905728504061699, + "grad_norm": 0.39785870909690857, "learning_rate": 5.3113662008810304e-05, - "loss": 9.163993672700599e-05, + "loss": 0.004628765396773815, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00464, "step": 276, "tokens/total": 8345952, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 126363 }, { "epoch": 1.08203125, - "grad_norm": 0.0020019100047647953, + "grad_norm": 0.2942987382411957, "learning_rate": 5.282366752473479e-05, - "loss": 1.796903961803764e-05, + "loss": 0.004942136351019144, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00495, "step": 277, "tokens/total": 8376416, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 126828 }, { "epoch": 1.0859375, - "grad_norm": 0.0011239969171583652, + "grad_norm": 0.04225993901491165, "learning_rate": 5.2533763606737005e-05, - "loss": 1.2794653230230324e-05, + "loss": 0.00015706325939390808, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00016, "step": 278, "tokens/total": 8406640, - "tokens/train_per_sec_per_gpu": 38.16, + "tokens/train_per_sec_per_gpu": 38.21, "tokens/trainable": 127331 }, { "epoch": 1.08984375, - "grad_norm": 0.07841381430625916, + "grad_norm": 0.008294228464365005, "learning_rate": 5.224396231890232e-05, - "loss": 0.0005632906104438007, + "loss": 9.9621967819985e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00056, + "ppl": 1.0001, "step": 279, "tokens/total": 8436784, - "tokens/train_per_sec_per_gpu": 34.34, + "tokens/train_per_sec_per_gpu": 34.39, "tokens/trainable": 127798 }, { "epoch": 1.09375, - "grad_norm": 0.0066568912006914616, + "grad_norm": 0.017988065257668495, "learning_rate": 5.195427572104522e-05, - "loss": 4.4691078073810786e-05, + "loss": 0.00021193400607444346, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00004, + "ppl": 1.00021, "step": 280, "tokens/total": 8467152, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.84, "tokens/trainable": 128247 }, { "epoch": 1.09765625, - "grad_norm": 0.0006084765191189945, + "grad_norm": 0.055866386741399765, "learning_rate": 5.166471586820751e-05, - "loss": 9.42349561228184e-06, + "loss": 0.0003000127908308059, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.0003, "step": 281, "tokens/total": 8497424, - "tokens/train_per_sec_per_gpu": 36.17, + "tokens/train_per_sec_per_gpu": 36.22, "tokens/trainable": 128729 }, { "epoch": 1.1015625, - "grad_norm": 0.4024369716644287, + "grad_norm": 0.03349864110350609, "learning_rate": 5.1375294810156615e-05, - "loss": 0.002225687028840184, + "loss": 0.0003475213306955993, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00223, + "ppl": 1.00035, "step": 282, "tokens/total": 8527616, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 129203 }, { "epoch": 1.10546875, - "grad_norm": 0.0008598315180279315, + "grad_norm": 0.0013503885129466653, "learning_rate": 5.1086024590884144e-05, - "loss": 9.10060407477431e-06, + "loss": 2.522556678741239e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00003, "step": 283, "tokens/total": 8557984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 129653 }, { "epoch": 1.109375, - "grad_norm": 0.13851912319660187, + "grad_norm": 0.03435222804546356, "learning_rate": 5.079691724810461e-05, - "loss": 0.00045336864423006773, + "loss": 0.00024076660338323563, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00045, + "ppl": 1.00024, "step": 284, "tokens/total": 8588384, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 130100 }, { "epoch": 1.11328125, - "grad_norm": 0.08453445136547089, + "grad_norm": 0.06312273442745209, "learning_rate": 5.0507984812754684e-05, - "loss": 0.0002941025304608047, + "loss": 0.0001932874001795426, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00029, + "ppl": 1.00019, "step": 285, "tokens/total": 8618768, - "tokens/train_per_sec_per_gpu": 30.44, + "tokens/train_per_sec_per_gpu": 30.49, "tokens/trainable": 130543 }, { "epoch": 1.1171875, - "grad_norm": 0.018670005723834038, + "grad_norm": 0.01356665138155222, "learning_rate": 5.021923930849237e-05, - "loss": 0.00010185746214119717, + "loss": 0.00014943527639843524, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0001, + "ppl": 1.00015, "step": 286, "tokens/total": 8648976, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 131000 }, { "epoch": 1.12109375, - "grad_norm": 0.0015903875464573503, + "grad_norm": 0.008714325726032257, "learning_rate": 4.99306927511967e-05, - "loss": 1.1978466318396386e-05, + "loss": 9.58888849709183e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00001, + "ppl": 1.0001, "step": 287, "tokens/total": 8679152, - "tokens/train_per_sec_per_gpu": 33.96, + "tokens/train_per_sec_per_gpu": 34.04, "tokens/trainable": 131449 }, { "epoch": 1.125, - "grad_norm": 0.0004093375173397362, + "grad_norm": 0.004380185157060623, "learning_rate": 4.964235714846775e-05, - "loss": 7.070232186379144e-06, + "loss": 3.911522071575746e-05, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00001, + "ppl": 1.00004, "step": 288, "tokens/total": 8709504, - "tokens/train_per_sec_per_gpu": 35.94, + "tokens/train_per_sec_per_gpu": 35.97, "tokens/trainable": 131923 }, { "epoch": 1.12890625, - "grad_norm": 0.12260667979717255, + "grad_norm": 0.3479631245136261, "learning_rate": 4.9354244499126866e-05, - "loss": 0.0006339149549603462, + "loss": 0.003404036397114396, "memory/device_reserved (GiB)": 35.91, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00063, + "ppl": 1.00341, "step": 289, "tokens/total": 8739680, - "tokens/train_per_sec_per_gpu": 33.11, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 132397 }, { "epoch": 1.1328125, - "grad_norm": 0.00021185794321354479, + "grad_norm": 0.0024364532437175512, "learning_rate": 4.90663667927174e-05, - "loss": 5.396935193857644e-06, + "loss": 2.929499896708876e-05, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00001, + "ppl": 1.00003, "step": 290, "tokens/total": 8770112, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 132846 }, { "epoch": 1.13671875, - "grad_norm": 0.2777019739151001, + "grad_norm": 0.5378495454788208, "learning_rate": 4.877873600900581e-05, - "loss": 0.0013501858338713646, + "loss": 0.0011512563796713948, "memory/device_reserved (GiB)": 35.57, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00135, + "ppl": 1.00115, "step": 291, "tokens/total": 8800368, - "tokens/train_per_sec_per_gpu": 35.65, + "tokens/train_per_sec_per_gpu": 35.74, "tokens/trainable": 133347 }, { "epoch": 1.140625, - "grad_norm": 0.0012349279131740332, + "grad_norm": 0.005875240080058575, "learning_rate": 4.849136411748306e-05, - "loss": 8.635176527604926e-06, + "loss": 4.1250437789130956e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00001, + "ppl": 1.00004, "step": 292, "tokens/total": 8830688, - "tokens/train_per_sec_per_gpu": 34.18, + "tokens/train_per_sec_per_gpu": 34.29, "tokens/trainable": 133779 }, { "epoch": 1.14453125, - "grad_norm": 0.00026181069551967084, + "grad_norm": 0.04661871865391731, "learning_rate": 4.8204263076866574e-05, - "loss": 4.307490144128678e-06, + "loss": 0.00011396713671274483, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0, + "ppl": 1.00011, "step": 293, "tokens/total": 8861008, - "tokens/train_per_sec_per_gpu": 36.23, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 134251 }, { "epoch": 1.1484375, - "grad_norm": 0.00046773714711889625, + "grad_norm": 0.0046598357148468494, "learning_rate": 4.791744483460251e-05, - "loss": 4.467175585887162e-06, + "loss": 3.974197170464322e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00004, "step": 294, "tokens/total": 8891760, - "tokens/train_per_sec_per_gpu": 33.41, + "tokens/train_per_sec_per_gpu": 33.55, "tokens/trainable": 134683 }, { "epoch": 1.15234375, - "grad_norm": 0.0002164130419259891, + "grad_norm": 0.0034782576840370893, "learning_rate": 4.7630921326368736e-05, - "loss": 4.914254532195628e-06, + "loss": 1.7245467461179942e-05, "memory/device_reserved (GiB)": 35.59, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00002, "step": 295, "tokens/total": 8922192, - "tokens/train_per_sec_per_gpu": 35.51, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 135165 }, { "epoch": 1.15625, - "grad_norm": 0.0002447084116283804, + "grad_norm": 0.007050055079162121, "learning_rate": 4.7344704475577916e-05, - "loss": 4.242253453412559e-06, + "loss": 6.337351078400388e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.0, + "ppl": 1.00006, "step": 296, "tokens/total": 8952496, - "tokens/train_per_sec_per_gpu": 33.18, + "tokens/train_per_sec_per_gpu": 33.24, "tokens/trainable": 135599 }, { "epoch": 1.16015625, - "grad_norm": 0.00028775070677511394, + "grad_norm": 0.0338653139770031, "learning_rate": 4.705880619288153e-05, - "loss": 4.674366209656e-06, + "loss": 0.00016246488667093217, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.0, + "ppl": 1.00016, "step": 297, "tokens/total": 8982768, - "tokens/train_per_sec_per_gpu": 32.56, + "tokens/train_per_sec_per_gpu": 32.67, "tokens/trainable": 136038 }, { "epoch": 1.1640625, - "grad_norm": 0.001555647817440331, + "grad_norm": 0.014626193791627884, "learning_rate": 4.677323837567412e-05, - "loss": 8.829203579807654e-06, + "loss": 0.00016142457025125623, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00016, "step": 298, "tokens/total": 9013248, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.9, "tokens/trainable": 136495 }, { "epoch": 1.16796875, - "grad_norm": 0.0002536054525990039, + "grad_norm": 0.0024293530732393265, "learning_rate": 4.6488012907598146e-05, - "loss": 5.5865721151349135e-06, + "loss": 2.855894126696512e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00003, "step": 299, "tokens/total": 9043632, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.34, "tokens/trainable": 136953 }, { "epoch": 1.171875, - "grad_norm": 0.00031900990870781243, + "grad_norm": 0.027738185599446297, "learning_rate": 4.620314165804964e-05, - "loss": 5.917333055549534e-06, + "loss": 0.00019799786969088018, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.0002, "step": 300, "tokens/total": 9073936, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 137412 }, { "epoch": 1.17578125, - "grad_norm": 0.0005231397226452827, + "grad_norm": 0.22624947130680084, "learning_rate": 4.591863648168407e-05, - "loss": 9.367842721985653e-06, + "loss": 0.0013185559073463082, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00001, + "ppl": 1.00132, "step": 301, "tokens/total": 9104416, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.68, "tokens/trainable": 137907 }, { "epoch": 1.1796875, - "grad_norm": 0.0010045799426734447, + "grad_norm": 0.034625228494405746, "learning_rate": 4.5634509217923135e-05, - "loss": 9.613295333110727e-06, + "loss": 0.00012454690295271575, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00012, "step": 302, "tokens/total": 9134688, - "tokens/train_per_sec_per_gpu": 34.2, + "tokens/train_per_sec_per_gpu": 34.33, "tokens/trainable": 138383 }, { "epoch": 1.18359375, - "grad_norm": 0.0054819462820887566, + "grad_norm": 0.005657304544001818, "learning_rate": 4.535077169046201e-05, - "loss": 2.4776203645160422e-05, + "loss": 5.558782140724361e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00006, "step": 303, "tokens/total": 9165088, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.4, "tokens/trainable": 138842 }, { "epoch": 1.1875, - "grad_norm": 0.0005682530463673174, + "grad_norm": 0.0075146509334445, "learning_rate": 4.506743570677743e-05, - "loss": 5.2244549806346186e-06, + "loss": 1.902109943330288e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00002, "step": 304, "tokens/total": 9195584, - "tokens/train_per_sec_per_gpu": 30.61, + "tokens/train_per_sec_per_gpu": 30.67, "tokens/trainable": 139269 }, { "epoch": 1.19140625, - "grad_norm": 0.003496676916256547, + "grad_norm": 0.0024459187407046556, "learning_rate": 4.478451305763618e-05, - "loss": 2.194346598116681e-05, + "loss": 2.344881431781687e-05, "memory/device_reserved (GiB)": 35.67, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00002, "step": 305, "tokens/total": 9225760, - "tokens/train_per_sec_per_gpu": 34.36, + "tokens/train_per_sec_per_gpu": 34.45, "tokens/trainable": 139736 }, { "epoch": 1.1953125, - "grad_norm": 0.000201961855054833, + "grad_norm": 0.18014587461948395, "learning_rate": 4.450201551660454e-05, - "loss": 4.178235940344166e-06, + "loss": 0.0005937310634180903, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.0, + "ppl": 1.00059, "step": 306, "tokens/total": 9256352, - "tokens/train_per_sec_per_gpu": 36.91, + "tokens/train_per_sec_per_gpu": 37.01, "tokens/trainable": 140226 }, { "epoch": 1.19921875, - "grad_norm": 0.0004581330285873264, + "grad_norm": 0.0010275261010974646, "learning_rate": 4.4219954839558276e-05, - "loss": 5.6062099247355945e-06, + "loss": 2.1100560843478888e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.19, "memory/max_allocated (GiB)": 33.19, - "ppl": 1.00001, + "ppl": 1.00002, "step": 307, "tokens/total": 9284256, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 140664 }, { "epoch": 1.203125, - "grad_norm": 0.0016614671330899, + "grad_norm": 0.0054944949224591255, "learning_rate": 4.393834276419352e-05, - "loss": 7.163904228946194e-06, + "loss": 5.6230866903206334e-05, "memory/device_reserved (GiB)": 35.9, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00001, + "ppl": 1.00006, "step": 308, "tokens/total": 9314768, - "tokens/train_per_sec_per_gpu": 29.85, + "tokens/train_per_sec_per_gpu": 29.84, "tokens/trainable": 141115 }, { "epoch": 1.20703125, - "grad_norm": 0.00019009379320777953, + "grad_norm": 0.0006827972829341888, "learning_rate": 4.36571910095382e-05, - "loss": 3.8271318771876395e-06, + "loss": 1.4492828995571472e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0, + "ppl": 1.00001, "step": 309, "tokens/total": 9344976, - "tokens/train_per_sec_per_gpu": 28.88, + "tokens/train_per_sec_per_gpu": 28.87, "tokens/trainable": 141530 }, { "epoch": 1.2109375, - "grad_norm": 0.0038869199343025684, + "grad_norm": 0.7971475720405579, "learning_rate": 4.337651127546448e-05, - "loss": 2.814065919665154e-05, + "loss": 0.0021856159437447786, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00003, + "ppl": 1.00219, "step": 310, "tokens/total": 9375280, - "tokens/train_per_sec_per_gpu": 34.15, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 141964 }, { "epoch": 1.21484375, - "grad_norm": 0.024828940629959106, + "grad_norm": 0.00386450975202024, "learning_rate": 4.3096315242201736e-05, - "loss": 0.00011992595682386309, + "loss": 1.9838389562210068e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00012, + "ppl": 1.00002, "step": 311, "tokens/total": 9405536, - "tokens/train_per_sec_per_gpu": 33.95, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 142428 }, { "epoch": 1.21875, - "grad_norm": 0.0017960596596822143, + "grad_norm": 0.058126050978899, "learning_rate": 4.2816614569850635e-05, - "loss": 9.508907169220038e-06, + "loss": 0.0002090351772494614, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00001, + "ppl": 1.00021, "step": 312, "tokens/total": 9435696, - "tokens/train_per_sec_per_gpu": 38.07, + "tokens/train_per_sec_per_gpu": 38.16, "tokens/trainable": 142894 }, { "epoch": 1.22265625, - "grad_norm": 0.0007181956898421049, + "grad_norm": 0.019857943058013916, "learning_rate": 4.2537420897897864e-05, - "loss": 8.858227374730632e-06, + "loss": 0.00014800178178120404, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00001, + "ppl": 1.00015, "step": 313, "tokens/total": 9466080, - "tokens/train_per_sec_per_gpu": 36.3, + "tokens/train_per_sec_per_gpu": 36.37, "tokens/trainable": 143368 }, { "epoch": 1.2265625, - "grad_norm": 0.7545468211174011, + "grad_norm": 0.05821572616696358, "learning_rate": 4.225874584473174e-05, - "loss": 0.015099202282726765, + "loss": 0.00014745524094905704, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.01521, + "ppl": 1.00015, "step": 314, "tokens/total": 9496400, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 143824 }, { "epoch": 1.23046875, - "grad_norm": 0.2810213565826416, + "grad_norm": 0.00997456256300211, "learning_rate": 4.19806010071587e-05, - "loss": 0.0007513084565289319, + "loss": 0.00011511147022247314, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00075, + "ppl": 1.00012, "step": 315, "tokens/total": 9526880, - "tokens/train_per_sec_per_gpu": 34.45, + "tokens/train_per_sec_per_gpu": 34.58, "tokens/trainable": 144306 }, { "epoch": 1.234375, - "grad_norm": 0.7471011281013489, + "grad_norm": 0.009190126322209835, "learning_rate": 4.170299795992081e-05, - "loss": 0.0005616231937892735, + "loss": 6.155027949716896e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00056, + "ppl": 1.00006, "step": 316, "tokens/total": 9557280, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 144763 }, { "epoch": 1.23828125, - "grad_norm": 0.0004946920089423656, + "grad_norm": 0.0016322726150974631, "learning_rate": 4.142594825521398e-05, - "loss": 5.734345904784277e-06, + "loss": 2.0669946025009267e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00002, "step": 317, "tokens/total": 9587712, - "tokens/train_per_sec_per_gpu": 37.4, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 145255 }, { "epoch": 1.2421875, - "grad_norm": 0.0032017722260206938, + "grad_norm": 0.00745917996391654, "learning_rate": 4.114946342220728e-05, - "loss": 2.6251871531712823e-05, + "loss": 5.585006874753162e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00003, + "ppl": 1.00006, "step": 318, "tokens/total": 9618064, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.7, "tokens/trainable": 145714 }, { "epoch": 1.24609375, - "grad_norm": 1.1724350452423096, + "grad_norm": 0.07343094050884247, "learning_rate": 4.087355496656321e-05, - "loss": 0.026299288496375084, + "loss": 0.00043384716263972223, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02665, + "ppl": 1.00043, "step": 319, "tokens/total": 9648336, - "tokens/train_per_sec_per_gpu": 35.96, + "tokens/train_per_sec_per_gpu": 36.04, "tokens/trainable": 146200 }, { "epoch": 1.25, - "grad_norm": 0.00045995338587090373, + "grad_norm": 0.007983052171766758, "learning_rate": 4.05982343699588e-05, - "loss": 8.491813787259161e-06, + "loss": 4.524823816609569e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00001, + "ppl": 1.00005, "step": 320, "tokens/total": 9678688, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.28, "tokens/trainable": 146668 }, { "epoch": 1.25390625, - "grad_norm": 0.0067353262566030025, + "grad_norm": 0.01599739119410515, "learning_rate": 4.0323513089607876e-05, - "loss": 6.0428461438277736e-05, + "loss": 6.388167093973607e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, "ppl": 1.00006, "step": 321, "tokens/total": 9708848, - "tokens/train_per_sec_per_gpu": 35.24, + "tokens/train_per_sec_per_gpu": 35.35, "tokens/trainable": 147114 }, { "epoch": 1.2578125, - "grad_norm": 0.05487794429063797, + "grad_norm": 0.0042083412408828735, "learning_rate": 4.004940255778431e-05, - "loss": 0.0002498509711585939, + "loss": 2.1792850020574406e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00025, + "ppl": 1.00002, "step": 322, "tokens/total": 9739360, - "tokens/train_per_sec_per_gpu": 35.08, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 147564 }, { "epoch": 1.26171875, - "grad_norm": 0.0011818762868642807, + "grad_norm": 0.009429940953850746, "learning_rate": 3.977591418134619e-05, - "loss": 1.1004886800947133e-05, + "loss": 3.834946619463153e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00004, "step": 323, "tokens/total": 9769776, - "tokens/train_per_sec_per_gpu": 34.14, + "tokens/train_per_sec_per_gpu": 34.24, "tokens/trainable": 148013 }, { "epoch": 1.265625, - "grad_norm": 0.018019674345850945, + "grad_norm": 0.05088210478425026, "learning_rate": 3.95030593412612e-05, - "loss": 0.00021162032498978078, + "loss": 0.00018766832363326102, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00021, + "ppl": 1.00019, "step": 324, "tokens/total": 9800096, - "tokens/train_per_sec_per_gpu": 37.99, + "tokens/train_per_sec_per_gpu": 38.06, "tokens/trainable": 148470 }, { "epoch": 1.26953125, - "grad_norm": 1.5907806158065796, + "grad_norm": 0.9416317939758301, "learning_rate": 3.923084939213296e-05, - "loss": 0.016217660158872604, + "loss": 0.01083211787045002, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01635, + "ppl": 1.01089, "step": 325, "tokens/total": 9830304, - "tokens/train_per_sec_per_gpu": 36.44, + "tokens/train_per_sec_per_gpu": 36.53, "tokens/trainable": 148926 }, { "epoch": 1.2734375, - "grad_norm": 0.004153774119913578, + "grad_norm": 0.00033186975633725524, "learning_rate": 3.895929566172861e-05, - "loss": 3.801286584348418e-05, + "loss": 8.612486453785095e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 326, "tokens/total": 9860608, - "tokens/train_per_sec_per_gpu": 37.72, + "tokens/train_per_sec_per_gpu": 37.82, "tokens/trainable": 149420 }, { "epoch": 1.27734375, - "grad_norm": 0.0029778245370835066, + "grad_norm": 0.0005477021913975477, "learning_rate": 3.868840945050728e-05, - "loss": 5.526735549210571e-05, + "loss": 1.5825649825274013e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00006, + "ppl": 1.00002, "step": 327, "tokens/total": 9890560, - "tokens/train_per_sec_per_gpu": 39.32, + "tokens/train_per_sec_per_gpu": 39.41, "tokens/trainable": 149873 }, { "epoch": 1.28125, - "grad_norm": 0.028163742274045944, + "grad_norm": 0.0008259841124527156, "learning_rate": 3.841820203114995e-05, - "loss": 0.00039056455716490746, + "loss": 1.642670395085588e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00039, + "ppl": 1.00002, "step": 328, "tokens/total": 9920880, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 150347 }, { "epoch": 1.28515625, - "grad_norm": 0.04141407459974289, + "grad_norm": 0.0011461537797003984, "learning_rate": 3.814868464809027e-05, - "loss": 0.0005860928213223815, + "loss": 1.7516158550279215e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00059, + "ppl": 1.00002, "step": 329, "tokens/total": 9951280, - "tokens/train_per_sec_per_gpu": 31.72, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 150822 }, { "epoch": 1.2890625, - "grad_norm": 0.004758972208946943, + "grad_norm": 0.0022519829217344522, "learning_rate": 3.787986851704667e-05, - "loss": 9.08115180209279e-05, + "loss": 2.000835411308799e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00009, + "ppl": 1.00002, "step": 330, "tokens/total": 9981600, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 151266 }, { "epoch": 1.29296875, - "grad_norm": 0.04043704643845558, + "grad_norm": 0.08718931674957275, "learning_rate": 3.7611764824555654e-05, - "loss": 0.0005757657927460968, + "loss": 0.0003773289208766073, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00058, + "ppl": 1.00038, "step": 331, "tokens/total": 10012016, - "tokens/train_per_sec_per_gpu": 37.11, + "tokens/train_per_sec_per_gpu": 37.15, "tokens/trainable": 151734 }, { "epoch": 1.296875, - "grad_norm": 0.064565509557724, + "grad_norm": 0.000883373199030757, "learning_rate": 3.734438472750619e-05, - "loss": 0.00043528492096811533, + "loss": 1.1746728887374047e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00044, + "ppl": 1.00001, "step": 332, "tokens/total": 10042448, - "tokens/train_per_sec_per_gpu": 33.99, + "tokens/train_per_sec_per_gpu": 34.01, "tokens/trainable": 152184 }, { "epoch": 1.30078125, - "grad_norm": 0.051213983446359634, + "grad_norm": 0.011426394805312157, "learning_rate": 3.707773935267552e-05, - "loss": 0.000528274686075747, + "loss": 5.219353988650255e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00053, + "ppl": 1.00005, "step": 333, "tokens/total": 10073024, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.85, "tokens/trainable": 152623 }, { "epoch": 1.3046875, - "grad_norm": 0.0067980666644871235, + "grad_norm": 0.5781233310699463, "learning_rate": 3.68118397962661e-05, - "loss": 0.00013989521539770067, + "loss": 0.0034865224733948708, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00014, + "ppl": 1.00349, "step": 334, "tokens/total": 10103504, - "tokens/train_per_sec_per_gpu": 33.34, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 153040 }, { "epoch": 1.30859375, - "grad_norm": 0.28768453001976013, + "grad_norm": 0.7213758230209351, "learning_rate": 3.654669712344384e-05, - "loss": 0.0035491236485540867, + "loss": 0.004715530201792717, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.31, "memory/max_allocated (GiB)": 33.31, - "ppl": 1.00356, + "ppl": 1.00473, "step": 335, "tokens/total": 10131632, - "tokens/train_per_sec_per_gpu": 31.7, + "tokens/train_per_sec_per_gpu": 31.78, "tokens/trainable": 153463 }, { "epoch": 1.3125, - "grad_norm": 0.04292941838502884, + "grad_norm": 0.03131686523556709, "learning_rate": 3.628232236787763e-05, - "loss": 0.0007545957923866808, + "loss": 0.0002346257824683562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00075, + "ppl": 1.00023, "step": 336, "tokens/total": 10161824, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 153908 }, { "epoch": 1.31640625, - "grad_norm": 0.13187745213508606, + "grad_norm": 0.03332929685711861, "learning_rate": 3.6018726531280144e-05, - "loss": 0.0011231126263737679, + "loss": 0.00011981122952420264, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00112, + "ppl": 1.00012, "step": 337, "tokens/total": 10192448, - "tokens/train_per_sec_per_gpu": 33.63, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 154387 }, { "epoch": 1.3203125, - "grad_norm": 0.06429488956928253, + "grad_norm": 0.0045038131065666676, "learning_rate": 3.575592058295017e-05, - "loss": 0.0004924655659124255, + "loss": 3.5494955227477476e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00049, + "ppl": 1.00004, "step": 338, "tokens/total": 10222704, - "tokens/train_per_sec_per_gpu": 33.82, + "tokens/train_per_sec_per_gpu": 33.94, "tokens/trainable": 154836 }, { "epoch": 1.32421875, - "grad_norm": 0.006816778797656298, + "grad_norm": 0.0012434936361387372, "learning_rate": 3.549391545931585e-05, - "loss": 8.63251625560224e-05, + "loss": 1.7894679331220686e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00009, + "ppl": 1.00002, "step": 339, "tokens/total": 10253168, - "tokens/train_per_sec_per_gpu": 29.73, + "tokens/train_per_sec_per_gpu": 29.81, "tokens/trainable": 155261 }, { "epoch": 1.328125, - "grad_norm": 0.04606792330741882, + "grad_norm": 0.3250766098499298, "learning_rate": 3.5232722063479914e-05, - "loss": 0.0003515402786433697, + "loss": 0.00279021542519331, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00035, + "ppl": 1.00279, "step": 340, "tokens/total": 10283552, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.24, "tokens/trainable": 155674 }, { "epoch": 1.33203125, - "grad_norm": 0.24907881021499634, + "grad_norm": 0.036490436643362045, "learning_rate": 3.49723512647657e-05, - "loss": 0.000742567703127861, + "loss": 0.00013251493510324508, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00074, + "ppl": 1.00013, "step": 341, "tokens/total": 10313872, - "tokens/train_per_sec_per_gpu": 35.67, + "tokens/train_per_sec_per_gpu": 35.78, "tokens/trainable": 156164 }, { "epoch": 1.3359375, - "grad_norm": 0.011238012462854385, + "grad_norm": 0.2706057131290436, "learning_rate": 3.471281389826491e-05, - "loss": 0.0001773187832441181, + "loss": 0.0021429890766739845, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00018, + "ppl": 1.00215, "step": 342, "tokens/total": 10344256, - "tokens/train_per_sec_per_gpu": 33.47, + "tokens/train_per_sec_per_gpu": 33.65, "tokens/trainable": 156611 }, { "epoch": 1.33984375, - "grad_norm": 0.00949561782181263, + "grad_norm": 0.01915346086025238, "learning_rate": 3.4454120764386764e-05, - "loss": 0.00018969883967656642, + "loss": 0.00013777356070932, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00019, + "ppl": 1.00014, "step": 343, "tokens/total": 10374544, - "tokens/train_per_sec_per_gpu": 33.58, + "tokens/train_per_sec_per_gpu": 33.68, "tokens/trainable": 157073 }, { "epoch": 1.34375, - "grad_norm": 0.10763411223888397, + "grad_norm": 0.02540464885532856, "learning_rate": 3.4196282628408526e-05, - "loss": 0.0007583287660963833, + "loss": 5.135099490871653e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00076, + "ppl": 1.00005, "step": 344, "tokens/total": 10405040, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 157523 }, { "epoch": 1.34765625, - "grad_norm": 0.15938052535057068, + "grad_norm": 0.39257746934890747, "learning_rate": 3.3939310220027456e-05, - "loss": 0.0014999746344983578, + "loss": 0.009803109802305698, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0015, + "ppl": 1.00985, "step": 345, "tokens/total": 10435424, - "tokens/train_per_sec_per_gpu": 35.07, + "tokens/train_per_sec_per_gpu": 35.16, "tokens/trainable": 157964 }, { "epoch": 1.3515625, - "grad_norm": 0.00165572261903435, + "grad_norm": 0.0029070202726870775, "learning_rate": 3.3683214232914404e-05, - "loss": 3.833783557638526e-05, + "loss": 2.9972559786983766e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00004, + "ppl": 1.00003, "step": 346, "tokens/total": 10465760, - "tokens/train_per_sec_per_gpu": 30.35, + "tokens/train_per_sec_per_gpu": 30.44, "tokens/trainable": 158390 }, { "epoch": 1.35546875, - "grad_norm": 0.02406073547899723, + "grad_norm": 0.020276719704270363, "learning_rate": 3.342800532426873e-05, - "loss": 0.00039186165668070316, + "loss": 7.613154593855143e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00039, + "ppl": 1.00008, "step": 347, "tokens/total": 10495904, - "tokens/train_per_sec_per_gpu": 35.47, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 158848 }, { "epoch": 1.359375, - "grad_norm": 0.045792482793331146, + "grad_norm": 0.14866818487644196, "learning_rate": 3.317369411437484e-05, - "loss": 0.0006161610363051295, + "loss": 0.0011244683992117643, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 34.0, "memory/max_allocated (GiB)": 34.0, - "ppl": 1.00062, + "ppl": 1.00113, "step": 348, "tokens/total": 10526624, - "tokens/train_per_sec_per_gpu": 28.63, + "tokens/train_per_sec_per_gpu": 28.71, "tokens/trainable": 159270 }, { "epoch": 1.36328125, - "grad_norm": 0.18648307025432587, + "grad_norm": 0.015379665419459343, "learning_rate": 3.292029118616024e-05, - "loss": 0.0012868957128375769, + "loss": 7.920589268906042e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00129, + "ppl": 1.00008, "step": 349, "tokens/total": 10556752, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.51, "tokens/trainable": 159720 }, { "epoch": 1.3671875, - "grad_norm": 0.015933886170387268, + "grad_norm": 0.0023695260751992464, "learning_rate": 3.266780708475511e-05, - "loss": 0.0002091687492793426, + "loss": 1.4566459867637604e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00021, + "ppl": 1.00001, "step": 350, "tokens/total": 10587264, - "tokens/train_per_sec_per_gpu": 35.09, + "tokens/train_per_sec_per_gpu": 35.14, "tokens/trainable": 160187 }, { "epoch": 1.37109375, - "grad_norm": 0.008724886924028397, + "grad_norm": 0.00954374298453331, "learning_rate": 3.241625231705354e-05, - "loss": 0.00013179841334931552, + "loss": 6.530048267450184e-05, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00013, + "ppl": 1.00007, "step": 351, "tokens/total": 10617504, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.63, "tokens/trainable": 160645 }, { "epoch": 1.375, - "grad_norm": 0.06377559900283813, + "grad_norm": 0.6504904627799988, "learning_rate": 3.216563735127618e-05, - "loss": 0.0008062056731432676, + "loss": 0.01059151440858841, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00081, + "ppl": 1.01065, "step": 352, "tokens/total": 10647760, - "tokens/train_per_sec_per_gpu": 34.42, + "tokens/train_per_sec_per_gpu": 34.49, "tokens/trainable": 161102 }, { "epoch": 1.37890625, - "grad_norm": 0.0037202269304543734, + "grad_norm": 0.024732626974582672, "learning_rate": 3.191597261653475e-05, - "loss": 7.238816760946065e-05, + "loss": 0.0001429672265658155, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00007, + "ppl": 1.00014, "step": 353, "tokens/total": 10678080, - "tokens/train_per_sec_per_gpu": 28.86, + "tokens/train_per_sec_per_gpu": 28.93, "tokens/trainable": 161555 }, { "epoch": 1.3828125, - "grad_norm": 0.0021510994993150234, + "grad_norm": 0.037309419363737106, "learning_rate": 3.166726850239794e-05, - "loss": 3.6805788113269955e-05, + "loss": 7.214388460852206e-05, "memory/device_reserved (GiB)": 35.41, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00004, + "ppl": 1.00007, "step": 354, "tokens/total": 10708544, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.75, "tokens/trainable": 162020 }, { "epoch": 1.38671875, - "grad_norm": 0.002642499515786767, + "grad_norm": 0.00885045062750578, "learning_rate": 3.141953535845912e-05, - "loss": 4.371708200778812e-05, + "loss": 0.00011830432777060196, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00012, "step": 355, "tokens/total": 10739024, - "tokens/train_per_sec_per_gpu": 32.05, + "tokens/train_per_sec_per_gpu": 32.1, "tokens/trainable": 162448 }, { "epoch": 1.390625, - "grad_norm": 0.0038646068423986435, + "grad_norm": 0.06791900098323822, "learning_rate": 3.11727834939056e-05, - "loss": 7.11614266037941e-05, + "loss": 0.0003609730047173798, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.61, "memory/max_allocated (GiB)": 33.61, - "ppl": 1.00007, + "ppl": 1.00036, "step": 356, "tokens/total": 10769024, - "tokens/train_per_sec_per_gpu": 28.2, + "tokens/train_per_sec_per_gpu": 28.26, "tokens/trainable": 162863 }, { "epoch": 1.39453125, - "grad_norm": 0.017895536497235298, + "grad_norm": 0.0019508687546476722, "learning_rate": 3.092702317708967e-05, - "loss": 5.4065520089352503e-05, + "loss": 3.1739040423417464e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00005, + "ppl": 1.00003, "step": 357, "tokens/total": 10799328, - "tokens/train_per_sec_per_gpu": 34.94, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 163318 }, { "epoch": 1.3984375, - "grad_norm": 0.8479411602020264, + "grad_norm": 0.7139555811882019, "learning_rate": 3.0682264635101276e-05, - "loss": 0.01497839204967022, + "loss": 0.010268578305840492, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01509, + "ppl": 1.01032, "step": 358, "tokens/total": 10829488, - "tokens/train_per_sec_per_gpu": 32.89, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 163767 }, { "epoch": 1.40234375, - "grad_norm": 0.0015704578254371881, + "grad_norm": 0.006852464284747839, "learning_rate": 3.0438518053342407e-05, - "loss": 3.0390210667974316e-05, + "loss": 4.873241778113879e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00005, "step": 359, "tokens/total": 10859936, - "tokens/train_per_sec_per_gpu": 31.78, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 164208 }, { "epoch": 1.40625, - "grad_norm": 0.014669318683445454, + "grad_norm": 0.0018247900297865272, "learning_rate": 3.0195793575103266e-05, - "loss": 0.00010030368866864592, + "loss": 3.88835760531947e-05, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0001, + "ppl": 1.00004, "step": 360, "tokens/total": 10890400, - "tokens/train_per_sec_per_gpu": 34.08, + "tokens/train_per_sec_per_gpu": 34.18, "tokens/trainable": 164655 }, { "epoch": 1.41015625, - "grad_norm": 0.3479421138763428, + "grad_norm": 0.0436873696744442, "learning_rate": 2.9954101301140146e-05, - "loss": 0.0026096655055880547, + "loss": 0.0003687943681143224, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00261, + "ppl": 1.00037, "step": 361, "tokens/total": 10920624, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.15, "tokens/trainable": 165100 }, { "epoch": 1.4140625, - "grad_norm": 0.004394443240016699, + "grad_norm": 0.26735150814056396, "learning_rate": 2.9713451289255123e-05, - "loss": 6.116658914834261e-05, + "loss": 0.00039605735219083726, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00006, + "ppl": 1.0004, "step": 362, "tokens/total": 10951136, - "tokens/train_per_sec_per_gpu": 34.84, + "tokens/train_per_sec_per_gpu": 34.91, "tokens/trainable": 165587 }, { "epoch": 1.41796875, - "grad_norm": 0.016197621822357178, + "grad_norm": 0.0964483991265297, "learning_rate": 2.9473853553877484e-05, - "loss": 0.0001775357231963426, + "loss": 0.0007330900407396257, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00018, + "ppl": 1.00073, "step": 363, "tokens/total": 10981344, - "tokens/train_per_sec_per_gpu": 34.09, + "tokens/train_per_sec_per_gpu": 34.14, "tokens/trainable": 166034 }, { "epoch": 1.421875, - "grad_norm": 0.09478334337472916, + "grad_norm": 0.05367618799209595, "learning_rate": 2.9235318065647e-05, - "loss": 0.0005033796769566834, + "loss": 0.0005384897813200951, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.0005, + "ppl": 1.00054, "step": 364, "tokens/total": 11011552, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.1, "tokens/trainable": 166485 }, { "epoch": 1.42578125, - "grad_norm": 0.014899010770022869, + "grad_norm": 0.10067912936210632, "learning_rate": 2.8997854750998964e-05, - "loss": 0.0001904651871882379, + "loss": 0.0006868956843391061, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00019, + "ppl": 1.00069, "step": 365, "tokens/total": 11041872, - "tokens/train_per_sec_per_gpu": 36.32, + "tokens/train_per_sec_per_gpu": 36.36, "tokens/trainable": 166973 }, { "epoch": 1.4296875, - "grad_norm": 0.005555527750402689, + "grad_norm": 0.02697882056236267, "learning_rate": 2.8761473491751258e-05, - "loss": 0.00010058133921120316, + "loss": 0.0002464794088155031, "memory/device_reserved (GiB)": 35.84, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0001, + "ppl": 1.00025, "step": 366, "tokens/total": 11072192, - "tokens/train_per_sec_per_gpu": 29.1, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 167414 }, { "epoch": 1.43359375, - "grad_norm": 0.20706292986869812, + "grad_norm": 0.0026214183308184147, "learning_rate": 2.8526184124692883e-05, - "loss": 0.0005888720043003559, + "loss": 5.2629769925260916e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00059, + "ppl": 1.00005, "step": 367, "tokens/total": 11102736, - "tokens/train_per_sec_per_gpu": 30.11, + "tokens/train_per_sec_per_gpu": 30.23, "tokens/trainable": 167851 }, { "epoch": 1.4375, - "grad_norm": 0.0007191727054305375, + "grad_norm": 0.0018140808679163456, "learning_rate": 2.829199644117484e-05, - "loss": 1.2304372830840293e-05, + "loss": 2.9512597393477336e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00001, + "ppl": 1.00003, "step": 368, "tokens/total": 11133056, - "tokens/train_per_sec_per_gpu": 35.48, + "tokens/train_per_sec_per_gpu": 35.56, "tokens/trainable": 168294 }, { "epoch": 1.44140625, - "grad_norm": 0.030878128483891487, + "grad_norm": 0.012045321986079216, "learning_rate": 2.8058920186702553e-05, - "loss": 0.0002043281274382025, + "loss": 7.606908184243366e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.0002, + "ppl": 1.00008, "step": 369, "tokens/total": 11163568, - "tokens/train_per_sec_per_gpu": 32.08, + "tokens/train_per_sec_per_gpu": 32.23, "tokens/trainable": 168769 }, { "epoch": 1.4453125, - "grad_norm": 0.008817057125270367, + "grad_norm": 0.013453424908220768, "learning_rate": 2.782696506053033e-05, - "loss": 0.00011464582348708063, + "loss": 0.00015325279673561454, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00011, + "ppl": 1.00015, "step": 370, "tokens/total": 11193936, - "tokens/train_per_sec_per_gpu": 36.59, + "tokens/train_per_sec_per_gpu": 36.83, "tokens/trainable": 169270 }, { "epoch": 1.44921875, - "grad_norm": 0.023856336250901222, + "grad_norm": 0.003458227962255478, "learning_rate": 2.7596140715257824e-05, - "loss": 0.00013431125262286514, + "loss": 5.63332432648167e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00013, + "ppl": 1.00006, "step": 371, "tokens/total": 11224480, - "tokens/train_per_sec_per_gpu": 35.06, + "tokens/train_per_sec_per_gpu": 35.08, "tokens/trainable": 169711 }, { "epoch": 1.453125, - "grad_norm": 0.010502993129193783, + "grad_norm": 0.0063622924499213696, "learning_rate": 2.7366456756428184e-05, - "loss": 0.00015104333579074591, + "loss": 9.534892160445452e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00015, + "ppl": 1.0001, "step": 372, "tokens/total": 11254912, - "tokens/train_per_sec_per_gpu": 32.81, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 170185 }, { "epoch": 1.45703125, - "grad_norm": 0.026970423758029938, + "grad_norm": 0.04558980092406273, "learning_rate": 2.7137922742128486e-05, - "loss": 0.00026081278338097036, + "loss": 0.000613630109000951, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00026, + "ppl": 1.00061, "step": 373, "tokens/total": 11285104, - "tokens/train_per_sec_per_gpu": 33.08, + "tokens/train_per_sec_per_gpu": 33.12, "tokens/trainable": 170650 }, { "epoch": 1.4609375, - "grad_norm": 0.020325109362602234, + "grad_norm": 0.014873786829411983, "learning_rate": 2.691054818259188e-05, - "loss": 0.00014532633940689266, + "loss": 0.0002038514503510669, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00015, + "ppl": 1.0002, "step": 374, "tokens/total": 11315600, - "tokens/train_per_sec_per_gpu": 31.98, + "tokens/train_per_sec_per_gpu": 31.99, "tokens/trainable": 171126 }, { "epoch": 1.46484375, - "grad_norm": 0.033260464668273926, + "grad_norm": 0.058739252388477325, "learning_rate": 2.6684342539801933e-05, - "loss": 0.00045571548980660737, + "loss": 0.0010346119524911046, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00046, + "ppl": 1.00104, "step": 375, "tokens/total": 11345776, "tokens/train_per_sec_per_gpu": 35.6, @@ -5261,713 +5261,713 @@ }, { "epoch": 1.46875, - "grad_norm": 0.017290709540247917, + "grad_norm": 0.24105991423130035, "learning_rate": 2.645931522709877e-05, - "loss": 0.00014910403115209192, + "loss": 0.0035716122947633266, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00015, + "ppl": 1.00358, "step": 376, "tokens/total": 11376208, - "tokens/train_per_sec_per_gpu": 28.09, + "tokens/train_per_sec_per_gpu": 28.14, "tokens/trainable": 172017 }, { "epoch": 1.47265625, - "grad_norm": 0.04457363486289978, + "grad_norm": 0.08793950080871582, "learning_rate": 2.6235475608787365e-05, - "loss": 6.834026135038584e-05, + "loss": 0.0007833336712792516, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00007, + "ppl": 1.00078, "step": 377, "tokens/total": 11406512, - "tokens/train_per_sec_per_gpu": 35.99, + "tokens/train_per_sec_per_gpu": 36.07, "tokens/trainable": 172493 }, { "epoch": 1.4765625, - "grad_norm": 0.002268735785037279, + "grad_norm": 0.009154544211924076, "learning_rate": 2.6012832999747916e-05, - "loss": 3.245133120799437e-05, + "loss": 0.00011752049613278359, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00003, + "ppl": 1.00012, "step": 378, "tokens/total": 11436544, - "tokens/train_per_sec_per_gpu": 34.27, + "tokens/train_per_sec_per_gpu": 34.4, "tokens/trainable": 172951 }, { "epoch": 1.48046875, - "grad_norm": 0.0038171466439962387, + "grad_norm": 0.012918495573103428, "learning_rate": 2.579139666504821e-05, - "loss": 5.4866883147042245e-05, + "loss": 0.00011567945330170915, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00005, + "ppl": 1.00012, "step": 379, "tokens/total": 11467008, - "tokens/train_per_sec_per_gpu": 35.63, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 173435 }, { "epoch": 1.484375, - "grad_norm": 0.005268535576760769, + "grad_norm": 0.008966504596173763, "learning_rate": 2.557117581955798e-05, - "loss": 8.241234172601253e-05, + "loss": 8.938623068388551e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00008, + "ppl": 1.00009, "step": 380, "tokens/total": 11497184, - "tokens/train_per_sec_per_gpu": 30.4, + "tokens/train_per_sec_per_gpu": 30.47, "tokens/trainable": 173900 }, { "epoch": 1.48828125, - "grad_norm": 0.016057243570685387, + "grad_norm": 0.03181751072406769, "learning_rate": 2.5352179627565532e-05, - "loss": 0.00014235377602744848, + "loss": 0.00013083787052892148, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00014, + "ppl": 1.00013, "step": 381, "tokens/total": 11527600, - "tokens/train_per_sec_per_gpu": 34.12, + "tokens/train_per_sec_per_gpu": 34.13, "tokens/trainable": 174371 }, { "epoch": 1.4921875, - "grad_norm": 0.005853456910699606, + "grad_norm": 0.0009072935208678246, "learning_rate": 2.5134417202396277e-05, - "loss": 5.001476893085055e-05, + "loss": 2.5600436856620945e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00005, + "ppl": 1.00003, "step": 382, "tokens/total": 11557808, - "tokens/train_per_sec_per_gpu": 32.76, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 174826 }, { "epoch": 1.49609375, - "grad_norm": 0.0031664848793298006, + "grad_norm": 0.0050596860237419605, "learning_rate": 2.491789760603361e-05, - "loss": 4.210277256788686e-05, + "loss": 5.778766353614628e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00006, "step": 383, "tokens/total": 11588352, - "tokens/train_per_sec_per_gpu": 32.8, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 175276 }, { "epoch": 1.5, - "grad_norm": 0.08838633447885513, + "grad_norm": 0.008304890245199203, "learning_rate": 2.4702629848741764e-05, - "loss": 0.0010394920827820897, + "loss": 0.00012505470658652484, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00104, + "ppl": 1.00013, "step": 384, "tokens/total": 11618640, - "tokens/train_per_sec_per_gpu": 33.69, + "tokens/train_per_sec_per_gpu": 33.71, "tokens/trainable": 175720 }, { "epoch": 1.50390625, - "grad_norm": 0.09446703642606735, + "grad_norm": 0.0035276354756206274, "learning_rate": 2.4488622888690785e-05, - "loss": 0.0005370234721340239, + "loss": 4.851898120250553e-05, "memory/device_reserved (GiB)": 35.89, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00054, + "ppl": 1.00005, "step": 385, "tokens/total": 11649072, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 176203 }, { "epoch": 1.5078125, - "grad_norm": 0.0013355027185752988, + "grad_norm": 0.001593019813299179, "learning_rate": 2.427588563158384e-05, - "loss": 1.903088195831515e-05, + "loss": 3.330651088617742e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00003, "step": 386, "tokens/total": 11679552, - "tokens/train_per_sec_per_gpu": 34.29, + "tokens/train_per_sec_per_gpu": 34.19, "tokens/trainable": 176651 }, { "epoch": 1.51171875, - "grad_norm": 0.011693151667714119, + "grad_norm": 0.002167076338082552, "learning_rate": 2.406442693028651e-05, - "loss": 7.680666749365628e-05, + "loss": 3.344817378092557e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00008, + "ppl": 1.00003, "step": 387, "tokens/total": 11709760, - "tokens/train_per_sec_per_gpu": 32.7, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 177115 }, { "epoch": 1.515625, - "grad_norm": 0.09523260593414307, + "grad_norm": 0.003447546623647213, "learning_rate": 2.3854255584458547e-05, - "loss": 0.00073521543527022, + "loss": 5.5277254432439804e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00074, + "ppl": 1.00006, "step": 388, "tokens/total": 11740288, - "tokens/train_per_sec_per_gpu": 36.09, + "tokens/train_per_sec_per_gpu": 36.13, "tokens/trainable": 177601 }, { "epoch": 1.51953125, - "grad_norm": 0.005971741396933794, + "grad_norm": 0.0052979388274252415, "learning_rate": 2.3645380340187508e-05, - "loss": 6.468063656939194e-05, + "loss": 4.56162124464754e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00006, + "ppl": 1.00005, "step": 389, "tokens/total": 11770592, - "tokens/train_per_sec_per_gpu": 32.99, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 178050 }, { "epoch": 1.5234375, - "grad_norm": 0.0010247502941638231, + "grad_norm": 0.003032457083463669, "learning_rate": 2.3437809889624914e-05, - "loss": 1.5989648090908304e-05, + "loss": 3.829343768302351e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00004, "step": 390, "tokens/total": 11800752, - "tokens/train_per_sec_per_gpu": 36.38, + "tokens/train_per_sec_per_gpu": 36.42, "tokens/trainable": 178531 }, { "epoch": 1.52734375, - "grad_norm": 0.054420940577983856, + "grad_norm": 0.03542603179812431, "learning_rate": 2.3231552870624487e-05, - "loss": 0.0004186803416814655, + "loss": 0.0003605492820497602, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00042, + "ppl": 1.00036, "step": 391, "tokens/total": 11831360, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.98, "tokens/trainable": 179000 }, { "epoch": 1.53125, - "grad_norm": 0.002925195964053273, + "grad_norm": 0.004965933505445719, "learning_rate": 2.3026617866382657e-05, - "loss": 1.531536145193968e-05, + "loss": 7.091004226822406e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00002, + "ppl": 1.00007, "step": 392, "tokens/total": 11861552, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.1, "tokens/trainable": 179457 }, { "epoch": 1.53515625, - "grad_norm": 1.6402941942214966, + "grad_norm": 0.006339129991829395, "learning_rate": 2.2823013405081507e-05, - "loss": 0.0027035027742385864, + "loss": 9.15761775104329e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00271, + "ppl": 1.00009, "step": 393, "tokens/total": 11891904, - "tokens/train_per_sec_per_gpu": 32.73, + "tokens/train_per_sec_per_gpu": 32.81, "tokens/trainable": 179890 }, { "epoch": 1.5390625, - "grad_norm": 0.0032207504846155643, + "grad_norm": 0.03921438008546829, "learning_rate": 2.2620747959533722e-05, - "loss": 3.968120290664956e-05, + "loss": 0.00038214243249967694, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00004, + "ppl": 1.00038, "step": 394, "tokens/total": 11922208, - "tokens/train_per_sec_per_gpu": 33.89, + "tokens/train_per_sec_per_gpu": 33.95, "tokens/trainable": 180341 }, { "epoch": 1.54296875, - "grad_norm": 0.013098486699163914, + "grad_norm": 0.08640608936548233, "learning_rate": 2.2419829946830123e-05, - "loss": 0.00011063168494729325, + "loss": 0.0006777399685233831, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00011, + "ppl": 1.00068, "step": 395, "tokens/total": 11952672, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 180762 }, { "epoch": 1.546875, - "grad_norm": 0.01553372759371996, + "grad_norm": 0.08661718666553497, "learning_rate": 2.2220267727989325e-05, - "loss": 8.802580123301595e-05, + "loss": 0.0007016840972937644, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00009, + "ppl": 1.0007, "step": 396, "tokens/total": 11983088, - "tokens/train_per_sec_per_gpu": 35.04, + "tokens/train_per_sec_per_gpu": 35.18, "tokens/trainable": 181226 }, { "epoch": 1.55078125, - "grad_norm": 0.016083814203739166, + "grad_norm": 0.010069145821034908, "learning_rate": 2.202206960760984e-05, - "loss": 8.931377669796348e-05, + "loss": 0.00011120665294583887, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00009, + "ppl": 1.00011, "step": 397, "tokens/total": 12013488, - "tokens/train_per_sec_per_gpu": 33.15, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 181714 }, { "epoch": 1.5546875, - "grad_norm": 0.05752059072256088, + "grad_norm": 0.03158818930387497, "learning_rate": 2.182524383352446e-05, - "loss": 0.00015369296306744218, + "loss": 0.00024857826065272093, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00015, + "ppl": 1.00025, "step": 398, "tokens/total": 12043968, - "tokens/train_per_sec_per_gpu": 35.52, + "tokens/train_per_sec_per_gpu": 35.57, "tokens/trainable": 182142 }, { "epoch": 1.55859375, - "grad_norm": 0.0011741623748093843, + "grad_norm": 0.000873154669534415, "learning_rate": 2.1629798596457056e-05, - "loss": 1.8113165424438193e-05, + "loss": 2.1218824258539826e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, "ppl": 1.00002, "step": 399, "tokens/total": 12074160, - "tokens/train_per_sec_per_gpu": 34.82, + "tokens/train_per_sec_per_gpu": 34.86, "tokens/trainable": 182604 }, { "epoch": 1.5625, - "grad_norm": 0.0048082731664180756, + "grad_norm": 0.009255572222173214, "learning_rate": 2.1435742029681725e-05, - "loss": 5.3348740038927644e-05, + "loss": 0.0001349164522252977, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.67, "memory/max_allocated (GiB)": 33.67, - "ppl": 1.00005, + "ppl": 1.00013, "step": 400, "tokens/total": 12104352, - "tokens/train_per_sec_per_gpu": 25.28, + "tokens/train_per_sec_per_gpu": 25.31, "tokens/trainable": 183011 }, { "epoch": 1.56640625, - "grad_norm": 0.006520449183881283, + "grad_norm": 0.010521743446588516, "learning_rate": 2.124308220868431e-05, - "loss": 6.45049221930094e-05, + "loss": 7.793466647854075e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.71, "memory/max_allocated (GiB)": 33.71, - "ppl": 1.00006, + "ppl": 1.00008, "step": 401, "tokens/total": 12134240, - "tokens/train_per_sec_per_gpu": 31.69, + "tokens/train_per_sec_per_gpu": 31.81, "tokens/trainable": 183459 }, { "epoch": 1.5703125, - "grad_norm": 0.006227654870599508, + "grad_norm": 0.0013409090461209416, "learning_rate": 2.105182715082638e-05, - "loss": 6.928759830771014e-05, + "loss": 2.7722922823159024e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00007, + "ppl": 1.00003, "step": 402, "tokens/total": 12164480, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.7, "tokens/trainable": 183959 }, { "epoch": 1.57421875, - "grad_norm": 0.32605040073394775, + "grad_norm": 0.10361713916063309, "learning_rate": 2.0861984815011552e-05, - "loss": 0.002115404698997736, + "loss": 0.0014142843428999186, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00212, + "ppl": 1.00142, "step": 403, "tokens/total": 12194640, - "tokens/train_per_sec_per_gpu": 32.46, + "tokens/train_per_sec_per_gpu": 32.5, "tokens/trainable": 184431 }, { "epoch": 1.578125, - "grad_norm": 0.007742208894342184, + "grad_norm": 0.0026048943400382996, "learning_rate": 2.0673563101354323e-05, - "loss": 4.600908869178966e-05, + "loss": 4.14503738284111e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00005, + "ppl": 1.00004, "step": 404, "tokens/total": 12224960, - "tokens/train_per_sec_per_gpu": 31.34, + "tokens/train_per_sec_per_gpu": 31.37, "tokens/trainable": 184867 }, { "epoch": 1.58203125, - "grad_norm": 0.0049946485087275505, + "grad_norm": 0.009411919862031937, "learning_rate": 2.0486569850851317e-05, - "loss": 5.003535625291988e-05, + "loss": 7.322158489841968e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.00005, + "ppl": 1.00007, "step": 405, "tokens/total": 12255008, - "tokens/train_per_sec_per_gpu": 29.25, + "tokens/train_per_sec_per_gpu": 29.37, "tokens/trainable": 185300 }, { "epoch": 1.5859375, - "grad_norm": 0.004598768427968025, + "grad_norm": 0.006792420521378517, "learning_rate": 2.0301012845054956e-05, - "loss": 3.4423381293891e-05, + "loss": 7.982828537933528e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00003, + "ppl": 1.00008, "step": 406, "tokens/total": 12285248, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.48, "tokens/trainable": 185754 }, { "epoch": 1.58984375, - "grad_norm": 0.0011464629787951708, + "grad_norm": 0.013020367361605167, "learning_rate": 2.011689980574966e-05, - "loss": 1.9196500943508e-05, + "loss": 3.743396155186929e-05, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00002, + "ppl": 1.00004, "step": 407, "tokens/total": 12315552, - "tokens/train_per_sec_per_gpu": 36.8, + "tokens/train_per_sec_per_gpu": 36.82, "tokens/trainable": 186213 }, { "epoch": 1.59375, - "grad_norm": 0.004688040353357792, + "grad_norm": 0.0013089004205539823, "learning_rate": 1.993423839463052e-05, - "loss": 5.2492636314127594e-05, + "loss": 2.306591341039166e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00005, + "ppl": 1.00002, "step": 408, "tokens/total": 12345904, - "tokens/train_per_sec_per_gpu": 32.72, + "tokens/train_per_sec_per_gpu": 32.8, "tokens/trainable": 186659 }, { "epoch": 1.59765625, - "grad_norm": 0.002637861529365182, + "grad_norm": 0.0012270932784304023, "learning_rate": 1.975303621298445e-05, - "loss": 3.172009019181132e-05, + "loss": 2.1350417227949947e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00002, "step": 409, "tokens/total": 12376336, - "tokens/train_per_sec_per_gpu": 32.92, + "tokens/train_per_sec_per_gpu": 32.97, "tokens/trainable": 187083 }, { "epoch": 1.6015625, - "grad_norm": 0.0072015393525362015, + "grad_norm": 0.011230082251131535, "learning_rate": 1.957330080137385e-05, - "loss": 5.452537880046293e-05, + "loss": 3.752015618374571e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00005, + "ppl": 1.00004, "step": 410, "tokens/total": 12406880, - "tokens/train_per_sec_per_gpu": 34.91, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 187530 }, { "epoch": 1.60546875, - "grad_norm": 0.007169651333242655, + "grad_norm": 0.004872993566095829, "learning_rate": 1.9395039639322864e-05, - "loss": 3.530656249495223e-05, + "loss": 5.5653974413871765e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00006, "step": 411, "tokens/total": 12437088, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 187972 }, { "epoch": 1.609375, - "grad_norm": 0.003889538114890456, + "grad_norm": 0.19391997158527374, "learning_rate": 1.9218260145006073e-05, - "loss": 3.5087461583316326e-05, + "loss": 0.000892186420969665, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00004, + "ppl": 1.00089, "step": 412, "tokens/total": 12465440, - "tokens/train_per_sec_per_gpu": 39.89, + "tokens/train_per_sec_per_gpu": 39.95, "tokens/trainable": 188417 }, { "epoch": 1.61328125, - "grad_norm": 0.5135430693626404, + "grad_norm": 0.09062197804450989, "learning_rate": 1.904296967493982e-05, - "loss": 0.005697700660675764, + "loss": 0.0006304415874183178, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00571, + "ppl": 1.00063, "step": 413, "tokens/total": 12495968, - "tokens/train_per_sec_per_gpu": 31.48, + "tokens/train_per_sec_per_gpu": 31.57, "tokens/trainable": 188868 }, { "epoch": 1.6171875, - "grad_norm": 0.0010096468031406403, + "grad_norm": 0.009724686853587627, "learning_rate": 1.8869175523676064e-05, - "loss": 1.1318426913931035e-05, + "loss": 6.72380265314132e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00001, + "ppl": 1.00007, "step": 414, "tokens/total": 12526128, - "tokens/train_per_sec_per_gpu": 36.85, + "tokens/train_per_sec_per_gpu": 36.95, "tokens/trainable": 189337 }, { "epoch": 1.62109375, - "grad_norm": 0.0004970752634108067, + "grad_norm": 0.19542834162712097, "learning_rate": 1.869688492349885e-05, - "loss": 7.355167326750234e-06, + "loss": 0.001907092402689159, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00191, "step": 415, "tokens/total": 12556256, - "tokens/train_per_sec_per_gpu": 31.82, + "tokens/train_per_sec_per_gpu": 31.94, "tokens/trainable": 189750 }, { "epoch": 1.625, - "grad_norm": 0.0008849130244925618, + "grad_norm": 0.0465276800096035, "learning_rate": 1.85261050441233e-05, - "loss": 1.4194254617905244e-05, + "loss": 0.0005661146715283394, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00001, + "ppl": 1.00057, "step": 416, "tokens/total": 12586736, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.06, "tokens/trainable": 190216 }, { "epoch": 1.62890625, - "grad_norm": 0.0022039280738681555, + "grad_norm": 0.0012954205740243196, "learning_rate": 1.8356842992397304e-05, - "loss": 2.4539594960515387e-05, + "loss": 1.8871982319978997e-05, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, "ppl": 1.00002, "step": 417, "tokens/total": 12617168, - "tokens/train_per_sec_per_gpu": 34.95, + "tokens/train_per_sec_per_gpu": 35.01, "tokens/trainable": 190708 }, { "epoch": 1.6328125, - "grad_norm": 0.027006179094314575, + "grad_norm": 0.0018749319715425372, "learning_rate": 1.8189105812005714e-05, - "loss": 0.00020442574168555439, + "loss": 3.220669532311149e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.0002, + "ppl": 1.00003, "step": 418, "tokens/total": 12647680, - "tokens/train_per_sec_per_gpu": 30.85, + "tokens/train_per_sec_per_gpu": 30.9, "tokens/trainable": 191126 }, { "epoch": 1.63671875, - "grad_norm": 0.15684254467487335, + "grad_norm": 0.0022480092011392117, "learning_rate": 1.802290048317732e-05, - "loss": 0.0007251293282024562, + "loss": 2.6564141080598347e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00073, + "ppl": 1.00003, "step": 419, "tokens/total": 12677952, - "tokens/train_per_sec_per_gpu": 30.3, + "tokens/train_per_sec_per_gpu": 30.34, "tokens/trainable": 191540 }, { "epoch": 1.640625, - "grad_norm": 0.0033104538451880217, + "grad_norm": 0.1634059101343155, "learning_rate": 1.785823392239424e-05, - "loss": 3.131272751488723e-05, + "loss": 0.0009822181891649961, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00003, + "ppl": 1.00098, "step": 420, "tokens/total": 12708416, - "tokens/train_per_sec_per_gpu": 36.65, + "tokens/train_per_sec_per_gpu": 36.69, "tokens/trainable": 192014 }, { "epoch": 1.64453125, - "grad_norm": 0.001255685230717063, + "grad_norm": 0.0019404747290536761, "learning_rate": 1.7695112982104225e-05, - "loss": 1.9309976778458804e-05, + "loss": 2.167341335734818e-05, "memory/device_reserved (GiB)": 35.8, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, "ppl": 1.00002, "step": 421, "tokens/total": 12738640, - "tokens/train_per_sec_per_gpu": 31.28, + "tokens/train_per_sec_per_gpu": 31.31, "tokens/trainable": 192463 }, { "epoch": 1.6484375, - "grad_norm": 0.01599641516804695, + "grad_norm": 0.001059795613400638, "learning_rate": 1.7533544450435433e-05, - "loss": 9.235648030880839e-05, + "loss": 1.6543437595828436e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00009, + "ppl": 1.00002, "step": 422, "tokens/total": 12769232, - "tokens/train_per_sec_per_gpu": 32.71, + "tokens/train_per_sec_per_gpu": 32.74, "tokens/trainable": 192918 }, { "epoch": 1.65234375, - "grad_norm": 0.048507146537303925, + "grad_norm": 0.01760418340563774, "learning_rate": 1.7373535050913946e-05, - "loss": 0.0002708940301090479, + "loss": 0.0001707405026536435, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00027, + "ppl": 1.00017, "step": 423, "tokens/total": 12799648, - "tokens/train_per_sec_per_gpu": 37.35, + "tokens/train_per_sec_per_gpu": 37.46, "tokens/trainable": 193425 }, { "epoch": 1.65625, - "grad_norm": 0.010107563808560371, + "grad_norm": 0.0023663989268243313, "learning_rate": 1.721509144218405e-05, - "loss": 6.99054216966033e-05, + "loss": 2.332203439436853e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00007, + "ppl": 1.00002, "step": 424, "tokens/total": 12829920, - "tokens/train_per_sec_per_gpu": 35.23, + "tokens/train_per_sec_per_gpu": 35.25, "tokens/trainable": 193898 }, { "epoch": 1.66015625, - "grad_norm": 0.005467226263135672, + "grad_norm": 0.0245437640696764, "learning_rate": 1.705822021773101e-05, - "loss": 5.417566717369482e-05, + "loss": 0.0001577093207743019, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00005, + "ppl": 1.00016, "step": 425, "tokens/total": 12860112, - "tokens/train_per_sec_per_gpu": 29.24, + "tokens/train_per_sec_per_gpu": 29.29, "tokens/trainable": 194315 }, { "epoch": 1.6640625, - "grad_norm": 0.0015799012035131454, + "grad_norm": 0.0009002169244922698, "learning_rate": 1.69029279056068e-05, - "loss": 2.4984849005704746e-05, + "loss": 1.4283305972639937e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, - "ppl": 1.00002, + "ppl": 1.00001, "step": 426, "tokens/total": 12890320, "tokens/train_per_sec_per_gpu": 34.92, @@ -5975,779 +5975,779 @@ }, { "epoch": 1.66796875, - "grad_norm": 0.024157166481018066, + "grad_norm": 0.00033997284481301904, "learning_rate": 1.6749220968158415e-05, - "loss": 0.00010696032404666767, + "loss": 7.185776667029131e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00011, + "ppl": 1.00001, "step": 427, "tokens/total": 12920656, - "tokens/train_per_sec_per_gpu": 33.92, + "tokens/train_per_sec_per_gpu": 33.96, "tokens/trainable": 195262 }, { "epoch": 1.671875, - "grad_norm": 0.00028090659179724753, + "grad_norm": 0.0005359657225199044, "learning_rate": 1.659710580175893e-05, - "loss": 7.484430170734413e-06, + "loss": 9.948088518285658e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, "ppl": 1.00001, "step": 428, "tokens/total": 12951040, - "tokens/train_per_sec_per_gpu": 31.83, + "tokens/train_per_sec_per_gpu": 31.91, "tokens/trainable": 195680 }, { "epoch": 1.67578125, - "grad_norm": 0.0011094068177044392, + "grad_norm": 0.0014890795573592186, "learning_rate": 1.644658873654133e-05, - "loss": 1.9920153135899454e-05, + "loss": 2.028812377830036e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, "ppl": 1.00002, "step": 429, "tokens/total": 12981232, - "tokens/train_per_sec_per_gpu": 32.83, + "tokens/train_per_sec_per_gpu": 32.89, "tokens/trainable": 196145 }, { "epoch": 1.6796875, - "grad_norm": 0.020794112235307693, + "grad_norm": 0.05130980163812637, "learning_rate": 1.629767603613508e-05, - "loss": 0.00010971157462336123, + "loss": 0.0003292672336101532, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00011, + "ppl": 1.00033, "step": 430, "tokens/total": 13011616, - "tokens/train_per_sec_per_gpu": 32.39, + "tokens/train_per_sec_per_gpu": 32.42, "tokens/trainable": 196626 }, { "epoch": 1.68359375, - "grad_norm": 0.44080695509910583, + "grad_norm": 0.0014070137403905392, "learning_rate": 1.615037389740547e-05, - "loss": 0.0026788683608174324, + "loss": 1.0152909453609027e-05, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.00268, + "ppl": 1.00001, "step": 431, "tokens/total": 13042208, - "tokens/train_per_sec_per_gpu": 31.14, + "tokens/train_per_sec_per_gpu": 31.17, "tokens/trainable": 197067 }, { "epoch": 1.6875, - "grad_norm": 0.0026339287869632244, + "grad_norm": 0.004116157069802284, "learning_rate": 1.600468845019576e-05, - "loss": 2.082335777231492e-05, + "loss": 3.514952550176531e-05, "memory/device_reserved (GiB)": 36.35, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00002, + "ppl": 1.00004, "step": 432, "tokens/total": 13072800, - "tokens/train_per_sec_per_gpu": 38.61, + "tokens/train_per_sec_per_gpu": 38.68, "tokens/trainable": 197565 }, { "epoch": 1.69140625, - "grad_norm": 0.004508621525019407, + "grad_norm": 0.01147819496691227, "learning_rate": 1.5860625757072092e-05, - "loss": 1.439991501683835e-05, + "loss": 7.313965761568397e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.00001, + "ppl": 1.00007, "step": 433, "tokens/total": 13103328, - "tokens/train_per_sec_per_gpu": 32.88, + "tokens/train_per_sec_per_gpu": 32.96, "tokens/trainable": 198015 }, { "epoch": 1.6953125, - "grad_norm": 0.014811511151492596, + "grad_norm": 0.030784178525209427, "learning_rate": 1.571819181307116e-05, - "loss": 0.00015316363715101033, + "loss": 0.0002448821614962071, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00015, + "ppl": 1.00024, "step": 434, "tokens/total": 13133472, - "tokens/train_per_sec_per_gpu": 33.87, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 198442 }, { "epoch": 1.69921875, - "grad_norm": 0.0037793368101119995, + "grad_norm": 0.0022457120940089226, "learning_rate": 1.557739254545075e-05, - "loss": 1.4444960470427759e-05, + "loss": 1.4446297427639365e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, "ppl": 1.00001, "step": 435, "tokens/total": 13164064, - "tokens/train_per_sec_per_gpu": 34.3, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 198914 }, { "epoch": 1.703125, - "grad_norm": 0.24972176551818848, + "grad_norm": 0.0029742212500423193, "learning_rate": 1.543823381344311e-05, - "loss": 0.0017114672809839249, + "loss": 2.7415488148108125e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00171, + "ppl": 1.00003, "step": 436, "tokens/total": 13194464, - "tokens/train_per_sec_per_gpu": 33.35, + "tokens/train_per_sec_per_gpu": 33.45, "tokens/trainable": 199355 }, { "epoch": 1.70703125, - "grad_norm": 0.002479988383129239, + "grad_norm": 0.002260624896734953, "learning_rate": 1.5300721408011114e-05, - "loss": 2.9400333005469292e-05, + "loss": 2.7733602109947242e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00003, "step": 437, "tokens/total": 13224992, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 33.0, "tokens/trainable": 199830 }, { "epoch": 1.7109375, - "grad_norm": 0.0014780610799789429, + "grad_norm": 0.01198511105030775, "learning_rate": 1.5164861051607254e-05, - "loss": 1.5593774151057005e-05, + "loss": 9.154126746580005e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00002, + "ppl": 1.00009, "step": 438, "tokens/total": 13255296, - "tokens/train_per_sec_per_gpu": 34.89, + "tokens/train_per_sec_per_gpu": 34.97, "tokens/trainable": 200338 }, { "epoch": 1.71484375, - "grad_norm": 0.0010410621762275696, + "grad_norm": 0.003149093361571431, "learning_rate": 1.5030658397935521e-05, - "loss": 1.4683226254419424e-05, + "loss": 3.515004937071353e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00001, + "ppl": 1.00004, "step": 439, "tokens/total": 13285344, - "tokens/train_per_sec_per_gpu": 32.79, + "tokens/train_per_sec_per_gpu": 32.87, "tokens/trainable": 200785 }, { "epoch": 1.71875, - "grad_norm": 0.0004247442411724478, + "grad_norm": 0.0003243185637984425, "learning_rate": 1.4898119031716104e-05, - "loss": 8.09474295238033e-06, + "loss": 7.168858701334102e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, "ppl": 1.00001, "step": 440, "tokens/total": 13315632, - "tokens/train_per_sec_per_gpu": 36.28, + "tokens/train_per_sec_per_gpu": 36.32, "tokens/trainable": 201267 }, { "epoch": 1.72265625, - "grad_norm": 0.0026301892939954996, + "grad_norm": 0.12771126627922058, "learning_rate": 1.476724846845306e-05, - "loss": 1.7428235878469422e-05, + "loss": 0.0007142049144022167, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00002, + "ppl": 1.00071, "step": 441, "tokens/total": 13346048, - "tokens/train_per_sec_per_gpu": 34.16, + "tokens/train_per_sec_per_gpu": 34.22, "tokens/trainable": 201734 }, { "epoch": 1.7265625, - "grad_norm": 0.0005576284602284431, + "grad_norm": 0.11483822762966156, "learning_rate": 1.463805215420471e-05, - "loss": 8.656044883537106e-06, + "loss": 0.0006703532999381423, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00001, + "ppl": 1.00067, "step": 442, "tokens/total": 13376304, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.4, "tokens/trainable": 202174 }, { "epoch": 1.73046875, - "grad_norm": 0.0009604030638001859, + "grad_norm": 0.00032006221590563655, "learning_rate": 1.451053546535705e-05, - "loss": 1.4092523088038433e-05, + "loss": 9.367744496557862e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, "ppl": 1.00001, "step": 443, "tokens/total": 13406720, - "tokens/train_per_sec_per_gpu": 36.13, + "tokens/train_per_sec_per_gpu": 36.28, "tokens/trainable": 202612 }, { "epoch": 1.734375, - "grad_norm": 0.00019884438370354474, + "grad_norm": 0.0002659875026438385, "learning_rate": 1.438470370840001e-05, - "loss": 4.5837323341402225e-06, + "loss": 5.530210728466045e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.64, "memory/max_allocated (GiB)": 33.64, - "ppl": 1.0, + "ppl": 1.00001, "step": 444, "tokens/total": 13436464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 30.99, "tokens/trainable": 203020 }, { "epoch": 1.73828125, - "grad_norm": 0.05944995582103729, + "grad_norm": 0.04957196116447449, "learning_rate": 1.4260562119706606e-05, - "loss": 0.0002780454815365374, + "loss": 6.46735934424214e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00028, + "ppl": 1.00006, "step": 445, "tokens/total": 13466672, - "tokens/train_per_sec_per_gpu": 34.31, + "tokens/train_per_sec_per_gpu": 34.37, "tokens/trainable": 203479 }, { "epoch": 1.7421875, - "grad_norm": 0.005872223526239395, + "grad_norm": 0.0016840791795402765, "learning_rate": 1.413811586531508e-05, - "loss": 3.424299575272016e-05, + "loss": 1.2613029866770376e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00003, + "ppl": 1.00001, "step": 446, "tokens/total": 13496736, - "tokens/train_per_sec_per_gpu": 35.3, + "tokens/train_per_sec_per_gpu": 35.38, "tokens/trainable": 203946 }, { "epoch": 1.74609375, - "grad_norm": 0.006013527978211641, + "grad_norm": 0.00042921333806589246, "learning_rate": 1.4017370040713884e-05, - "loss": 3.269856097176671e-05, + "loss": 7.416386324621271e-06, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.00001, "step": 447, "tokens/total": 13526928, - "tokens/train_per_sec_per_gpu": 37.43, + "tokens/train_per_sec_per_gpu": 37.45, "tokens/trainable": 204382 }, { "epoch": 1.75, - "grad_norm": 0.05103042349219322, + "grad_norm": 0.2165915071964264, "learning_rate": 1.3898329670629645e-05, - "loss": 0.00032247230410575867, + "loss": 0.0006914341356605291, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00032, + "ppl": 1.00069, "step": 448, "tokens/total": 13557392, - "tokens/train_per_sec_per_gpu": 34.32, + "tokens/train_per_sec_per_gpu": 34.35, "tokens/trainable": 204830 }, { "epoch": 1.75390625, - "grad_norm": 0.13250835239887238, + "grad_norm": 0.0009792562341317534, "learning_rate": 1.3780999708818058e-05, - "loss": 0.0008940898114815354, + "loss": 1.4504414139082655e-05, "memory/device_reserved (GiB)": 36.8, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.00089, + "ppl": 1.00001, "step": 449, "tokens/total": 13587776, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.47, "tokens/trainable": 205300 }, { "epoch": 1.7578125, - "grad_norm": 0.24642030894756317, + "grad_norm": 0.028498223051428795, "learning_rate": 1.3665385037857758e-05, - "loss": 0.0012931979726999998, + "loss": 0.00028163049137219787, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00129, + "ppl": 1.00028, "step": 450, "tokens/total": 13618112, - "tokens/train_per_sec_per_gpu": 30.62, + "tokens/train_per_sec_per_gpu": 30.6, "tokens/trainable": 205726 }, { "epoch": 1.76171875, - "grad_norm": 0.011528799310326576, + "grad_norm": 0.003279345342889428, "learning_rate": 1.3551490468947126e-05, - "loss": 6.569598917849362e-05, + "loss": 2.595262776594609e-05, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00007, + "ppl": 1.00003, "step": 451, "tokens/total": 13648512, - "tokens/train_per_sec_per_gpu": 31.55, + "tokens/train_per_sec_per_gpu": 31.63, "tokens/trainable": 206163 }, { "epoch": 1.765625, - "grad_norm": 1.0818549394607544, + "grad_norm": 0.4961508512496948, "learning_rate": 1.3439320741704075e-05, - "loss": 0.015596212819218636, + "loss": 0.00459528062492609, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01572, + "ppl": 1.00461, "step": 452, "tokens/total": 13678704, - "tokens/train_per_sec_per_gpu": 35.41, + "tokens/train_per_sec_per_gpu": 35.45, "tokens/trainable": 206619 }, { "epoch": 1.76953125, - "grad_norm": 0.0007326967315748334, + "grad_norm": 0.009086468257009983, "learning_rate": 1.3328880523968808e-05, - "loss": 1.2033770872221794e-05, + "loss": 6.577694148290902e-05, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00001, + "ppl": 1.00007, "step": 453, "tokens/total": 13709232, - "tokens/train_per_sec_per_gpu": 37.18, + "tokens/train_per_sec_per_gpu": 37.24, "tokens/trainable": 207101 }, { "epoch": 1.7734375, - "grad_norm": 0.0023919539526104927, + "grad_norm": 0.009036197327077389, "learning_rate": 1.3220174411609587e-05, - "loss": 1.262133719137637e-05, + "loss": 6.735372880939394e-05, "memory/device_reserved (GiB)": 35.7, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00001, + "ppl": 1.00007, "step": 454, "tokens/total": 13739600, - "tokens/train_per_sec_per_gpu": 35.69, + "tokens/train_per_sec_per_gpu": 35.77, "tokens/trainable": 207546 }, { "epoch": 1.77734375, - "grad_norm": 0.0020972786005586386, + "grad_norm": 0.009665202349424362, "learning_rate": 1.3113206928331471e-05, - "loss": 2.476977533660829e-05, + "loss": 7.266137981787324e-05, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00007, "step": 455, "tokens/total": 13769936, - "tokens/train_per_sec_per_gpu": 34.25, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 207989 }, { "epoch": 1.78125, - "grad_norm": 0.000797569751739502, + "grad_norm": 0.0004666070453822613, "learning_rate": 1.300798252548806e-05, - "loss": 1.45716385304695e-05, + "loss": 6.039275831426494e-06, "memory/device_reserved (GiB)": 35.78, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, "ppl": 1.00001, "step": 456, "tokens/total": 13800240, - "tokens/train_per_sec_per_gpu": 33.9, + "tokens/train_per_sec_per_gpu": 33.92, "tokens/trainable": 208402 }, { "epoch": 1.78515625, - "grad_norm": 0.011376727372407913, + "grad_norm": 0.00044853391591459513, "learning_rate": 1.2904505581896265e-05, - "loss": 7.903270306997001e-05, + "loss": 8.292890015582088e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00008, + "ppl": 1.00001, "step": 457, "tokens/total": 13830512, - "tokens/train_per_sec_per_gpu": 36.61, + "tokens/train_per_sec_per_gpu": 36.58, "tokens/trainable": 208904 }, { "epoch": 1.7890625, - "grad_norm": 0.0013566205743700266, + "grad_norm": 0.0033692270517349243, "learning_rate": 1.2802780403654082e-05, - "loss": 1.925312972161919e-05, + "loss": 2.3157112082117237e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, "ppl": 1.00002, "step": 458, "tokens/total": 13860832, - "tokens/train_per_sec_per_gpu": 33.64, + "tokens/train_per_sec_per_gpu": 33.72, "tokens/trainable": 209382 }, { "epoch": 1.79296875, - "grad_norm": 0.00047398527385666966, + "grad_norm": 0.0010797431459650397, "learning_rate": 1.2702811223961408e-05, - "loss": 1.119351145462133e-05, + "loss": 1.119279841077514e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, "ppl": 1.00001, "step": 459, "tokens/total": 13890992, - "tokens/train_per_sec_per_gpu": 33.85, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 209833 }, { "epoch": 1.796875, - "grad_norm": 0.04677487164735794, + "grad_norm": 0.04658913239836693, "learning_rate": 1.2604602202943861e-05, - "loss": 0.0001750149531289935, + "loss": 0.0003375259111635387, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00018, + "ppl": 1.00034, "step": 460, "tokens/total": 13921424, - "tokens/train_per_sec_per_gpu": 32.5, + "tokens/train_per_sec_per_gpu": 32.53, "tokens/trainable": 210284 }, { "epoch": 1.80078125, - "grad_norm": 0.024663345888257027, + "grad_norm": 0.01848040148615837, "learning_rate": 1.2508157427479686e-05, - "loss": 9.222347580362111e-05, + "loss": 0.00016109315038193017, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00009, + "ppl": 1.00016, "step": 461, "tokens/total": 13951504, - "tokens/train_per_sec_per_gpu": 34.04, + "tokens/train_per_sec_per_gpu": 34.07, "tokens/trainable": 210769 }, { "epoch": 1.8046875, - "grad_norm": 0.0004740248841699213, + "grad_norm": 0.05658251419663429, "learning_rate": 1.2413480911029655e-05, - "loss": 1.0696679964894429e-05, + "loss": 0.00017825173563323915, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.38, "memory/max_allocated (GiB)": 33.38, - "ppl": 1.00001, + "ppl": 1.00018, "step": 462, "tokens/total": 13979728, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.41, "tokens/trainable": 211193 }, { "epoch": 1.80859375, - "grad_norm": 0.0007590787718072534, + "grad_norm": 0.0006594725418835878, "learning_rate": 1.2320576593470082e-05, - "loss": 1.3936740288045257e-05, + "loss": 9.709075129649136e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.79, "memory/max_allocated (GiB)": 33.79, "ppl": 1.00001, "step": 463, "tokens/total": 14009936, - "tokens/train_per_sec_per_gpu": 35.03, + "tokens/train_per_sec_per_gpu": 35.11, "tokens/trainable": 211655 }, { "epoch": 1.8125, - "grad_norm": 0.002108624204993248, + "grad_norm": 0.02737571857869625, "learning_rate": 1.2229448340928828e-05, - "loss": 2.675112227734644e-05, + "loss": 0.00017574361118022352, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00003, + "ppl": 1.00018, "step": 464, "tokens/total": 14039872, - "tokens/train_per_sec_per_gpu": 29.28, + "tokens/train_per_sec_per_gpu": 29.2, "tokens/trainable": 212085 }, { "epoch": 1.81640625, - "grad_norm": 0.0009435649262741208, + "grad_norm": 0.0004917355254292488, "learning_rate": 1.2140099945624458e-05, - "loss": 1.0821668183780275e-05, + "loss": 8.16806459624786e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, "ppl": 1.00001, "step": 465, "tokens/total": 14070096, - "tokens/train_per_sec_per_gpu": 32.61, + "tokens/train_per_sec_per_gpu": 32.71, "tokens/trainable": 212570 }, { "epoch": 1.8203125, - "grad_norm": 0.011040126904845238, + "grad_norm": 0.0015915038529783487, "learning_rate": 1.205253512570841e-05, - "loss": 5.798249912913889e-05, + "loss": 1.2870759746874683e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00006, + "ppl": 1.00001, "step": 466, "tokens/total": 14100192, - "tokens/train_per_sec_per_gpu": 32.86, + "tokens/train_per_sec_per_gpu": 32.93, "tokens/trainable": 213011 }, { "epoch": 1.82421875, - "grad_norm": 0.008271797560155392, + "grad_norm": 0.0005419626249931753, "learning_rate": 1.1966757525110255e-05, - "loss": 2.8763912268914282e-05, + "loss": 7.527931302320212e-06, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00003, + "ppl": 1.00001, "step": 467, "tokens/total": 14130448, - "tokens/train_per_sec_per_gpu": 31.44, + "tokens/train_per_sec_per_gpu": 31.58, "tokens/trainable": 213450 }, { "epoch": 1.828125, - "grad_norm": 0.023479726165533066, + "grad_norm": 0.004500397015362978, "learning_rate": 1.1882770713386095e-05, - "loss": 0.0001434558507753536, + "loss": 4.2581184970913455e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.00014, + "ppl": 1.00004, "step": 468, "tokens/total": 14160480, - "tokens/train_per_sec_per_gpu": 35.62, + "tokens/train_per_sec_per_gpu": 35.7, "tokens/trainable": 213898 }, { "epoch": 1.83203125, - "grad_norm": 0.0023077642545104027, + "grad_norm": 0.1103268712759018, "learning_rate": 1.180057818556998e-05, - "loss": 2.560112625360489e-05, + "loss": 0.00021096917043905705, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00003, + "ppl": 1.00021, "step": 469, "tokens/total": 14191152, - "tokens/train_per_sec_per_gpu": 36.78, + "tokens/train_per_sec_per_gpu": 36.88, "tokens/trainable": 214366 }, { "epoch": 1.8359375, - "grad_norm": 0.0014362182701006532, + "grad_norm": 0.002097723074257374, "learning_rate": 1.1720183362028494e-05, - "loss": 2.0195953766233288e-05, + "loss": 2.7896878236788325e-05, "memory/device_reserved (GiB)": 35.82, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00002, + "ppl": 1.00003, "step": 470, "tokens/total": 14219392, - "tokens/train_per_sec_per_gpu": 35.64, + "tokens/train_per_sec_per_gpu": 35.72, "tokens/trainable": 214800 }, { "epoch": 1.83984375, - "grad_norm": 0.011598445475101471, + "grad_norm": 0.001367987017147243, "learning_rate": 1.1641589588318387e-05, - "loss": 4.486892794375308e-05, + "loss": 1.733974931994453e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00004, + "ppl": 1.00002, "step": 471, "tokens/total": 14249920, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.48, "tokens/trainable": 215292 }, { "epoch": 1.84375, - "grad_norm": 0.0011633927933871746, + "grad_norm": 0.000857445178553462, "learning_rate": 1.1564800135047418e-05, - "loss": 2.0482253603404388e-05, + "loss": 1.3961070180812385e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00002, + "ppl": 1.00001, "step": 472, "tokens/total": 14280048, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 215741 }, { "epoch": 1.84765625, - "grad_norm": 0.006093664560467005, + "grad_norm": 0.0037669208832085133, "learning_rate": 1.148981819773816e-05, - "loss": 5.0086440751329064e-05, + "loss": 3.097699664067477e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00005, + "ppl": 1.00003, "step": 473, "tokens/total": 14310432, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.68, "tokens/trainable": 216194 }, { "epoch": 1.8515625, - "grad_norm": 0.003623088588938117, + "grad_norm": 0.0003345425648149103, "learning_rate": 1.1416646896695086e-05, - "loss": 3.059494338231161e-05, + "loss": 6.7712135205511e-06, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00003, + "ppl": 1.00001, "step": 474, "tokens/total": 14340496, - "tokens/train_per_sec_per_gpu": 33.3, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 216634 }, { "epoch": 1.85546875, - "grad_norm": 0.006924150045961142, + "grad_norm": 0.00038110429886728525, "learning_rate": 1.1345289276874717e-05, - "loss": 3.953809573431499e-05, + "loss": 7.348439794441219e-06, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00004, + "ppl": 1.00001, "step": 475, "tokens/total": 14370720, - "tokens/train_per_sec_per_gpu": 30.48, + "tokens/train_per_sec_per_gpu": 30.53, "tokens/trainable": 217040 }, { "epoch": 1.859375, - "grad_norm": 0.002359601203352213, + "grad_norm": 0.0013931745197623968, "learning_rate": 1.1275748307758873e-05, - "loss": 3.34192045556847e-05, + "loss": 1.2693172720901202e-05, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00003, + "ppl": 1.00001, "step": 476, "tokens/total": 14401136, - "tokens/train_per_sec_per_gpu": 37.55, + "tokens/train_per_sec_per_gpu": 37.67, "tokens/trainable": 217530 }, { "epoch": 1.86328125, - "grad_norm": 0.009584639221429825, + "grad_norm": 0.02564929611980915, "learning_rate": 1.1208026883231147e-05, - "loss": 0.00010110227594850585, + "loss": 0.00031186698470264673, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.0001, + "ppl": 1.00031, "step": 477, "tokens/total": 14431360, - "tokens/train_per_sec_per_gpu": 34.47, + "tokens/train_per_sec_per_gpu": 34.53, "tokens/trainable": 217988 }, { "epoch": 1.8671875, - "grad_norm": 0.03044246695935726, + "grad_norm": 0.08053945004940033, "learning_rate": 1.1142127821456433e-05, - "loss": 0.00022086883836891502, + "loss": 0.0003999105538241565, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00022, + "ppl": 1.0004, "step": 478, "tokens/total": 14461968, - "tokens/train_per_sec_per_gpu": 32.47, + "tokens/train_per_sec_per_gpu": 32.54, "tokens/trainable": 218461 }, { "epoch": 1.87109375, - "grad_norm": 0.03494428098201752, + "grad_norm": 0.05217274650931358, "learning_rate": 1.1078053864763674e-05, - "loss": 0.0002753190929070115, + "loss": 0.0003339847025927156, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00028, + "ppl": 1.00033, "step": 479, "tokens/total": 14491984, - "tokens/train_per_sec_per_gpu": 32.77, + "tokens/train_per_sec_per_gpu": 32.81, "tokens/trainable": 218909 }, { "epoch": 1.875, - "grad_norm": 0.30102044343948364, + "grad_norm": 0.08783794194459915, "learning_rate": 1.1015807679531756e-05, - "loss": 0.00025764034944586456, + "loss": 0.0005760936765000224, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.00026, + "ppl": 1.00058, "step": 480, "tokens/total": 14522544, - "tokens/train_per_sec_per_gpu": 33.88, + "tokens/train_per_sec_per_gpu": 34.08, "tokens/trainable": 219350 }, { "epoch": 1.87890625, - "grad_norm": 0.07505832612514496, + "grad_norm": 0.1059868335723877, "learning_rate": 1.0955391856078528e-05, - "loss": 0.0002503654104657471, + "loss": 0.0007811249233782291, "memory/device_reserved (GiB)": 35.92, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00025, + "ppl": 1.00078, "step": 481, "tokens/total": 14552560, - "tokens/train_per_sec_per_gpu": 29.47, + "tokens/train_per_sec_per_gpu": 29.52, "tokens/trainable": 219776 }, { "epoch": 1.8828125, - "grad_norm": 0.0008993322844617069, + "grad_norm": 0.00020755630976054817, "learning_rate": 1.0896808908553007e-05, - "loss": 1.0104758075613063e-05, + "loss": 5.210203653405188e-06, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, @@ -6759,125 +6759,125 @@ }, { "epoch": 1.88671875, - "grad_norm": 0.001677343505434692, + "grad_norm": 0.00210341764613986, "learning_rate": 1.0840061274830763e-05, - "loss": 2.5296727471868508e-05, + "loss": 1.6855678040883504e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.8, "memory/max_allocated (GiB)": 33.8, - "ppl": 1.00003, + "ppl": 1.00002, "step": 483, "tokens/total": 14613152, - "tokens/train_per_sec_per_gpu": 33.01, + "tokens/train_per_sec_per_gpu": 33.06, "tokens/trainable": 220714 }, { "epoch": 1.890625, - "grad_norm": 0.01496347226202488, + "grad_norm": 0.0096653513610363, "learning_rate": 1.0785151316412473e-05, - "loss": 0.0001352597464574501, + "loss": 9.005956235341728e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00014, + "ppl": 1.00009, "step": 484, "tokens/total": 14643328, - "tokens/train_per_sec_per_gpu": 35.01, + "tokens/train_per_sec_per_gpu": 35.02, "tokens/trainable": 221156 }, { "epoch": 1.89453125, - "grad_norm": 0.004265300463885069, + "grad_norm": 0.001843759324401617, "learning_rate": 1.0732081318325639e-05, - "loss": 1.1048326996387914e-05, + "loss": 1.069177596946247e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, "ppl": 1.00001, "step": 485, "tokens/total": 14673488, - "tokens/train_per_sec_per_gpu": 31.53, + "tokens/train_per_sec_per_gpu": 31.64, "tokens/trainable": 221605 }, { "epoch": 1.8984375, - "grad_norm": 0.0029735390562564135, + "grad_norm": 0.0007748372154310346, "learning_rate": 1.0680853489029501e-05, - "loss": 2.2016622096998617e-05, + "loss": 5.547179171117023e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00002, + "ppl": 1.00001, "step": 486, "tokens/total": 14704000, - "tokens/train_per_sec_per_gpu": 30.38, + "tokens/train_per_sec_per_gpu": 30.46, "tokens/trainable": 222042 }, { "epoch": 1.90234375, - "grad_norm": 0.00869164988398552, + "grad_norm": 0.00029233950772322714, "learning_rate": 1.0631469960323152e-05, - "loss": 7.451521378243342e-05, + "loss": 6.492456122941803e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.67, "memory/max_allocated (GiB)": 33.67, - "ppl": 1.00007, + "ppl": 1.00001, "step": 487, "tokens/total": 14733984, - "tokens/train_per_sec_per_gpu": 31.95, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 222474 }, { "epoch": 1.90625, - "grad_norm": 0.000581100583076477, + "grad_norm": 0.00032405118690803647, "learning_rate": 1.0583932787256783e-05, - "loss": 7.341123364312807e-06, + "loss": 6.497373760794289e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00001, "step": 488, "tokens/total": 14764400, - "tokens/train_per_sec_per_gpu": 36.24, + "tokens/train_per_sec_per_gpu": 36.27, "tokens/trainable": 222967 }, { "epoch": 1.91015625, - "grad_norm": 0.004224246367812157, + "grad_norm": 0.0019567832350730896, "learning_rate": 1.0538243948046206e-05, - "loss": 3.5561904951464385e-05, + "loss": 1.2859745766036212e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00004, + "ppl": 1.00001, "step": 489, "tokens/total": 14794672, - "tokens/train_per_sec_per_gpu": 31.78, + "tokens/train_per_sec_per_gpu": 31.79, "tokens/trainable": 223420 }, { "epoch": 1.9140625, - "grad_norm": 0.0152070177718997, + "grad_norm": 0.0006594944861717522, "learning_rate": 1.0494405343990523e-05, - "loss": 2.7988677175017074e-05, + "loss": 4.987327429262223e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.00003, + "ppl": 1.0, "step": 490, "tokens/total": 14824784, - "tokens/train_per_sec_per_gpu": 29.42, + "tokens/train_per_sec_per_gpu": 29.4, "tokens/trainable": 223864 }, { "epoch": 1.91796875, - "grad_norm": 0.024472137913107872, + "grad_norm": 0.00579325295984745, "learning_rate": 1.0452418799392985e-05, - "loss": 4.8069461627164856e-05, + "loss": 3.640961949713528e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00005, + "ppl": 1.00004, "step": 491, "tokens/total": 14855056, "tokens/train_per_sec_per_gpu": 32.8, @@ -6885,296 +6885,296 @@ }, { "epoch": 1.921875, - "grad_norm": 0.0036334518808871508, + "grad_norm": 0.010503454133868217, "learning_rate": 1.0412286061485102e-05, - "loss": 3.39774924213998e-05, + "loss": 9.240206418326125e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.01, "memory/max_allocated (GiB)": 34.01, - "ppl": 1.00003, + "ppl": 1.00009, "step": 492, "tokens/total": 14885392, - "tokens/train_per_sec_per_gpu": 36.29, + "tokens/train_per_sec_per_gpu": 36.34, "tokens/trainable": 224802 }, { "epoch": 1.92578125, - "grad_norm": 0.0009831058559939265, + "grad_norm": 0.0007255753153003752, "learning_rate": 1.03740088003539e-05, - "loss": 1.8870396161219105e-05, + "loss": 6.912261596880853e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00002, + "ppl": 1.00001, "step": 493, "tokens/total": 14915760, - "tokens/train_per_sec_per_gpu": 34.77, + "tokens/train_per_sec_per_gpu": 34.78, "tokens/trainable": 225284 }, { "epoch": 1.9296875, - "grad_norm": 0.0020358245819807053, + "grad_norm": 0.0015938309952616692, "learning_rate": 1.0337588608872463e-05, - "loss": 3.0332268579513766e-05, + "loss": 9.24063533602748e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00003, + "ppl": 1.00001, "step": 494, "tokens/total": 14946192, - "tokens/train_per_sec_per_gpu": 32.71, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 225733 }, { "epoch": 1.93359375, - "grad_norm": 0.00029036635532975197, + "grad_norm": 0.0005452019395306706, "learning_rate": 1.0303027002633622e-05, - "loss": 6.913277957210084e-06, + "loss": 6.261637736315606e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, "ppl": 1.00001, "step": 495, "tokens/total": 14976272, - "tokens/train_per_sec_per_gpu": 32.55, + "tokens/train_per_sec_per_gpu": 32.58, "tokens/trainable": 226172 }, { "epoch": 1.9375, - "grad_norm": 0.11670258641242981, + "grad_norm": 0.0014865020057186484, "learning_rate": 1.0270325419886884e-05, - "loss": 0.0007051021093502641, + "loss": 1.6280355339404196e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00071, + "ppl": 1.00002, "step": 496, "tokens/total": 15006544, - "tokens/train_per_sec_per_gpu": 34.77, + "tokens/train_per_sec_per_gpu": 34.85, "tokens/trainable": 226636 }, { "epoch": 1.94140625, - "grad_norm": 0.0008452775655314326, + "grad_norm": 0.01585707999765873, "learning_rate": 1.0239485221478599e-05, - "loss": 1.0465846571605653e-05, + "loss": 8.379284554393962e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00001, + "ppl": 1.00008, "step": 497, "tokens/total": 15037040, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.95, "tokens/trainable": 227067 }, { "epoch": 1.9453125, - "grad_norm": 0.027690444141626358, + "grad_norm": 0.0002517803804948926, "learning_rate": 1.0210507690795292e-05, - "loss": 0.00013966832193545997, + "loss": 6.2335830079973675e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00014, + "ppl": 1.00001, "step": 498, "tokens/total": 15067344, - "tokens/train_per_sec_per_gpu": 37.58, + "tokens/train_per_sec_per_gpu": 37.65, "tokens/trainable": 227532 }, { "epoch": 1.94921875, - "grad_norm": 0.24434912204742432, + "grad_norm": 0.024532407522201538, "learning_rate": 1.0183394033710305e-05, - "loss": 0.0015483510214835405, + "loss": 0.00010188046144321561, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00155, + "ppl": 1.0001, "step": 499, "tokens/total": 15097648, - "tokens/train_per_sec_per_gpu": 36.58, + "tokens/train_per_sec_per_gpu": 36.57, "tokens/trainable": 228007 }, { "epoch": 1.953125, - "grad_norm": 0.0016334869433194399, + "grad_norm": 0.011295626871287823, "learning_rate": 1.0158145378533583e-05, - "loss": 1.879910814750474e-05, + "loss": 3.307299630250782e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00002, + "ppl": 1.00003, "step": 500, "tokens/total": 15128000, - "tokens/train_per_sec_per_gpu": 30.84, + "tokens/train_per_sec_per_gpu": 30.89, "tokens/trainable": 228457 }, { "epoch": 1.95703125, - "grad_norm": 0.004102619830518961, + "grad_norm": 0.0004914791788905859, "learning_rate": 1.0134762775964726e-05, - "loss": 3.3614764106459916e-05, + "loss": 1.0351252058171667e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00003, + "ppl": 1.00001, "step": 501, "tokens/total": 15158352, - "tokens/train_per_sec_per_gpu": 35.19, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 228928 }, { "epoch": 1.9609375, - "grad_norm": 0.00031376321567222476, + "grad_norm": 0.0012023868039250374, "learning_rate": 1.0113247199049278e-05, - "loss": 6.558944733114913e-06, + "loss": 9.377205060445704e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.03, "memory/max_allocated (GiB)": 34.03, "ppl": 1.00001, "step": 502, "tokens/total": 15189136, - "tokens/train_per_sec_per_gpu": 32.1, + "tokens/train_per_sec_per_gpu": 32.17, "tokens/trainable": 229368 }, { "epoch": 1.96484375, - "grad_norm": 0.002323499647900462, + "grad_norm": 0.0013543821405619383, "learning_rate": 1.0093599543138205e-05, - "loss": 1.713021265459247e-05, + "loss": 1.1307722161291167e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00002, + "ppl": 1.00001, "step": 503, "tokens/total": 15219616, - "tokens/train_per_sec_per_gpu": 32.75, + "tokens/train_per_sec_per_gpu": 32.78, "tokens/trainable": 229815 }, { "epoch": 1.96875, - "grad_norm": 0.19251975417137146, + "grad_norm": 0.14987659454345703, "learning_rate": 1.0075820625850675e-05, - "loss": 0.002064360538497567, + "loss": 0.0009784155990928411, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.00207, + "ppl": 1.00098, "step": 504, "tokens/total": 15250032, - "tokens/train_per_sec_per_gpu": 38.82, + "tokens/train_per_sec_per_gpu": 38.89, "tokens/trainable": 230319 }, { "epoch": 1.97265625, - "grad_norm": 0.028361506760120392, + "grad_norm": 0.00029018628993071616, "learning_rate": 1.0059911187040013e-05, - "loss": 0.0001954930485226214, + "loss": 5.265862910164287e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.0002, + "ppl": 1.00001, "step": 505, "tokens/total": 15280592, - "tokens/train_per_sec_per_gpu": 37.42, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 230807 }, { "epoch": 1.9765625, - "grad_norm": 0.0009314758353866637, + "grad_norm": 0.005410570185631514, "learning_rate": 1.0045871888762893e-05, - "loss": 1.3068352927803062e-05, + "loss": 2.385844345553778e-05, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00001, + "ppl": 1.00002, "step": 506, "tokens/total": 15310816, - "tokens/train_per_sec_per_gpu": 34.16, + "tokens/train_per_sec_per_gpu": 34.23, "tokens/trainable": 231257 }, { "epoch": 1.98046875, - "grad_norm": 0.043847255408763885, + "grad_norm": 0.00021883628505747765, "learning_rate": 1.003370331525184e-05, - "loss": 0.00034106988459825516, + "loss": 6.0832517192466184e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.00034, + "ppl": 1.00001, "step": 507, "tokens/total": 15341424, - "tokens/train_per_sec_per_gpu": 36.31, + "tokens/train_per_sec_per_gpu": 36.33, "tokens/trainable": 231746 }, { "epoch": 1.984375, - "grad_norm": 0.0003455990517977625, + "grad_norm": 0.0004369568487163633, "learning_rate": 1.002340597289085e-05, - "loss": 7.529959020757815e-06, + "loss": 7.3698761298146565e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.33, "memory/max_allocated (GiB)": 33.33, "ppl": 1.00001, "step": 508, "tokens/total": 15369664, - "tokens/train_per_sec_per_gpu": 32.94, + "tokens/train_per_sec_per_gpu": 33.03, "tokens/trainable": 232172 }, { "epoch": 1.98828125, - "grad_norm": 0.034262772649526596, + "grad_norm": 0.0003495107521302998, "learning_rate": 1.0014980290194387e-05, - "loss": 0.00015496168634854257, + "loss": 6.240798938961234e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.00015, + "ppl": 1.00001, "step": 509, "tokens/total": 15400496, - "tokens/train_per_sec_per_gpu": 37.04, + "tokens/train_per_sec_per_gpu": 37.14, "tokens/trainable": 232680 }, { "epoch": 1.9921875, - "grad_norm": 0.0054254732094705105, + "grad_norm": 0.00029087570146657526, "learning_rate": 1.0008426617789489e-05, - "loss": 1.3866054359823465e-05, + "loss": 7.524774446210358e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, "ppl": 1.00001, "step": 510, "tokens/total": 15430864, - "tokens/train_per_sec_per_gpu": 36.02, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 233169 }, { "epoch": 1.99609375, - "grad_norm": 0.044709429144859314, + "grad_norm": 0.054357580840587616, "learning_rate": 1.0003745228401215e-05, - "loss": 0.0001455950696254149, + "loss": 0.00033112074015662074, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.00015, + "ppl": 1.00033, "step": 511, "tokens/total": 15461232, - "tokens/train_per_sec_per_gpu": 32.63, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 233609 }, { "epoch": 2.0, - "grad_norm": 0.0011775761377066374, + "grad_norm": 0.0002704425423871726, "learning_rate": 1.0000936316841296e-05, - "loss": 2.066101660602726e-05, + "loss": 5.9074222917843144e-06, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.00002, + "ppl": 1.00001, "step": 512, "tokens/total": 15491760, - "tokens/train_per_sec_per_gpu": 36.16, + "tokens/train_per_sec_per_gpu": 36.23, "tokens/trainable": 234078 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_model.safetensors index d0c8e130a9e2c9cee794e8ec7b339a8c5e6daf54..cf29ec007245eababd0a46202c312b2ca937ecd4 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:e1ec4e85cfe12cccd44fb2fc8228b470caa235bce59281436fdbe2f6c1623718 +oid sha256:4e7b933e426f2788efc72abfac9f3ab778dd7efab673628477eaaddfed7231f4 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/optimizer.pt index 6cc4b3289093647f85dc7ccda9ab2238736079db..69215d47d374d4d352cf0b27b5b3841739a763a5 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:e9cf925bf6271220bc573abf0906a8daef828d1e928c62d41866987f2cb746cc +oid sha256:ccbce30983b31ecf36d6a397cb447dd999fb42a26f7deac558eb8c9e8202815d size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/trainer_state.json index 8673974569748d01fe90b2610a8ef76c95b632c3..c0aede61fcd446aa09ce6ea747202d3f3d7ea299 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-64/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,198 +711,198 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_config.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_config.json index 6ff70713d761b4b93563409372d50f10829fbb2b..bfedbf0e6a4d7aac1a49c4e316471adbad864873 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_config.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_config.json @@ -30,13 +30,13 @@ "rank_pattern": {}, "revision": null, "target_modules": [ - "gate_proj", - "v_proj", - "up_proj", "q_proj", + "v_proj", "o_proj", + "up_proj", "k_proj", - "down_proj" + "down_proj", + "gate_proj" ], "target_parameters": [], "task_type": "CAUSAL_LM", diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_model.safetensors b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_model.safetensors index 8b583a2866bb76b7865cd70c85d1aa511b4c2c45..1f895b2d1711b4490dde360680824221e255b896 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_model.safetensors +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/adapter_model.safetensors @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:f82d721eb8a246edd809b7477fe6d91b4ca3fb98afdac3c211797400c6c878e7 +oid sha256:1ebc2264ddd6c676d1ff2042910678b4aa79c530d89a391f7cce9bd2384e5f79 size 547777976 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/optimizer.pt b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/optimizer.pt index 12d64e8cac5ff902ae92bf8d30afa055855e7287..568375ef4d2481eb5896258dd216ea7b42c6e20c 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/optimizer.pt +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/optimizer.pt @@ -1,3 +1,3 @@ version https://git-lfs.github.com/spec/v1 -oid sha256:145a3fa093af2c9cb4b0c373fb880b5bb7e039b2ce87d399c2f01c142def88b6 +oid sha256:8ea4e1f033d3e6fcaca184949121bf0f32f3d9dbf7417cfde610261c97121226 size 1048106435 diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/trainer_state.json b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/trainer_state.json index 4b01153156272ccc4d5e1640f8a4bb84d1a553d9..97d0700129d2d61a49855fb1909573ca70d0065b 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/trainer_state.json +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/checkpoint-96/trainer_state.json @@ -11,7 +11,7 @@ "log_history": [ { "epoch": 0.00390625, - "grad_norm": 1.3676857948303223, + "grad_norm": 1.3783645629882812, "learning_rate": 0.0, "loss": 0.13924157619476318, "memory/device_reserved (GiB)": 33.9, @@ -20,12 +20,12 @@ "ppl": 1.1494, "step": 1, "tokens/total": 30176, - "tokens/train_per_sec_per_gpu": 21.9, + "tokens/train_per_sec_per_gpu": 27.09, "tokens/trainable": 417 }, { "epoch": 0.0078125, - "grad_norm": 1.2267565727233887, + "grad_norm": 1.2333115339279175, "learning_rate": 4.000000000000001e-06, "loss": 0.15098872780799866, "memory/device_reserved (GiB)": 34.68, @@ -34,326 +34,326 @@ "ppl": 1.16298, "step": 2, "tokens/total": 60272, - "tokens/train_per_sec_per_gpu": 34.64, + "tokens/train_per_sec_per_gpu": 34.63, "tokens/trainable": 873 }, { "epoch": 0.01171875, - "grad_norm": 1.362873911857605, + "grad_norm": 5.272272109985352, "learning_rate": 8.000000000000001e-06, - "loss": 0.1434350311756134, + "loss": 0.14415010809898376, "memory/device_reserved (GiB)": 34.72, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.15423, + "ppl": 1.15506, "step": 3, "tokens/total": 90512, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 1353 }, { "epoch": 0.015625, - "grad_norm": 1.2687747478485107, + "grad_norm": 1.3964842557907104, "learning_rate": 1.2e-05, - "loss": 0.1327495574951172, + "loss": 0.13428445160388947, "memory/device_reserved (GiB)": 34.73, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.14196, + "ppl": 1.14372, "step": 4, "tokens/total": 120944, - "tokens/train_per_sec_per_gpu": 31.2, + "tokens/train_per_sec_per_gpu": 31.19, "tokens/trainable": 1778 }, { "epoch": 0.01953125, - "grad_norm": 1.210241436958313, + "grad_norm": 1.4071121215820312, "learning_rate": 1.6000000000000003e-05, - "loss": 0.14250555634498596, + "loss": 0.14405930042266846, "memory/device_reserved (GiB)": 35.12, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.15316, + "ppl": 1.15495, "step": 5, "tokens/total": 151440, - "tokens/train_per_sec_per_gpu": 36.69, + "tokens/train_per_sec_per_gpu": 36.8, "tokens/trainable": 2261 }, { "epoch": 0.0234375, - "grad_norm": 0.7939133048057556, + "grad_norm": 1.6760321855545044, "learning_rate": 2e-05, - "loss": 0.1098983883857727, + "loss": 0.11100607365369797, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.11616, + "ppl": 1.1174, "step": 6, "tokens/total": 181984, - "tokens/train_per_sec_per_gpu": 32.91, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 2705 }, { "epoch": 0.02734375, - "grad_norm": 0.9592475891113281, + "grad_norm": 1.3056405782699585, "learning_rate": 2.4e-05, - "loss": 0.08319811522960663, + "loss": 0.08474013209342957, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.08676, + "ppl": 1.08843, "step": 7, "tokens/total": 212336, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.9, "tokens/trainable": 3136 }, { "epoch": 0.03125, - "grad_norm": 1.0925567150115967, + "grad_norm": 15.479830741882324, "learning_rate": 2.8000000000000003e-05, - "loss": 0.08283673226833344, + "loss": 0.08459445834159851, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.08636, + "ppl": 1.08828, "step": 8, "tokens/total": 242592, - "tokens/train_per_sec_per_gpu": 34.1, + "tokens/train_per_sec_per_gpu": 34.2, "tokens/trainable": 3579 }, { "epoch": 0.03515625, - "grad_norm": 2.977435350418091, + "grad_norm": 1.3126204013824463, "learning_rate": 3.2000000000000005e-05, - "loss": 0.06837394088506699, + "loss": 0.06938324868679047, "memory/device_reserved (GiB)": 36.12, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.07077, + "ppl": 1.07185, "step": 9, "tokens/total": 272784, - "tokens/train_per_sec_per_gpu": 29.09, + "tokens/train_per_sec_per_gpu": 29.12, "tokens/trainable": 4000 }, { "epoch": 0.0390625, - "grad_norm": 2.3922698497772217, + "grad_norm": 1.292763590812683, "learning_rate": 3.6e-05, - "loss": 0.059628911316394806, + "loss": 0.04889247566461563, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.06144, + "ppl": 1.05011, "step": 10, "tokens/total": 303184, - "tokens/train_per_sec_per_gpu": 37.52, + "tokens/train_per_sec_per_gpu": 37.66, "tokens/trainable": 4474 }, { "epoch": 0.04296875, - "grad_norm": 34.52455520629883, + "grad_norm": 1.0318297147750854, "learning_rate": 4e-05, - "loss": 0.040874652564525604, + "loss": 0.030023720115423203, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.04172, + "ppl": 1.03048, "step": 11, "tokens/total": 333296, - "tokens/train_per_sec_per_gpu": 33.02, + "tokens/train_per_sec_per_gpu": 33.15, "tokens/trainable": 4942 }, { "epoch": 0.046875, - "grad_norm": 3.48089861869812, + "grad_norm": 1.4940381050109863, "learning_rate": 4.4000000000000006e-05, - "loss": 0.07223602384328842, + "loss": 0.05268975719809532, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.07491, + "ppl": 1.0541, "step": 12, "tokens/total": 363840, - "tokens/train_per_sec_per_gpu": 34.17, + "tokens/train_per_sec_per_gpu": 34.26, "tokens/trainable": 5424 }, { "epoch": 0.05078125, - "grad_norm": 3.391554117202759, + "grad_norm": 2.0244202613830566, "learning_rate": 4.8e-05, - "loss": 0.05329454317688942, + "loss": 0.06068706512451172, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.05474, + "ppl": 1.06257, "step": 13, "tokens/total": 394112, - "tokens/train_per_sec_per_gpu": 35.1, + "tokens/train_per_sec_per_gpu": 35.26, "tokens/trainable": 5855 }, { "epoch": 0.0546875, - "grad_norm": 1.1944199800491333, + "grad_norm": 1.5167357921600342, "learning_rate": 5.2000000000000004e-05, - "loss": 0.04502769932150841, + "loss": 0.03630872070789337, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.04606, + "ppl": 1.03698, "step": 14, "tokens/total": 424656, - "tokens/train_per_sec_per_gpu": 34.67, + "tokens/train_per_sec_per_gpu": 34.75, "tokens/trainable": 6344 }, { "epoch": 0.05859375, - "grad_norm": 5.3998494148254395, + "grad_norm": 1.7407020330429077, "learning_rate": 5.6000000000000006e-05, - "loss": 0.09748096019029617, + "loss": 0.056628547608852386, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.96, "memory/max_allocated (GiB)": 33.96, - "ppl": 1.10239, + "ppl": 1.05826, "step": 15, "tokens/total": 455152, - "tokens/train_per_sec_per_gpu": 36.01, + "tokens/train_per_sec_per_gpu": 36.1, "tokens/trainable": 6825 }, { "epoch": 0.0625, - "grad_norm": 5.269172668457031, + "grad_norm": 2.506803512573242, "learning_rate": 6e-05, - "loss": 0.13181278109550476, + "loss": 0.07074552774429321, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.14089, + "ppl": 1.07331, "step": 16, "tokens/total": 485328, - "tokens/train_per_sec_per_gpu": 29.93, + "tokens/train_per_sec_per_gpu": 30.03, "tokens/trainable": 7230 }, { "epoch": 0.06640625, - "grad_norm": 2.0302066802978516, + "grad_norm": 1.2572238445281982, "learning_rate": 6.400000000000001e-05, - "loss": 0.07405360788106918, + "loss": 0.04099711775779724, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.07686, + "ppl": 1.04185, "step": 17, "tokens/total": 515744, - "tokens/train_per_sec_per_gpu": 35.85, + "tokens/train_per_sec_per_gpu": 35.91, "tokens/trainable": 7699 }, { "epoch": 0.0703125, - "grad_norm": 1.8140190839767456, + "grad_norm": 36.9443359375, "learning_rate": 6.800000000000001e-05, - "loss": 0.04869937151670456, + "loss": 0.021194521337747574, "memory/device_reserved (GiB)": 37.81, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.0499, + "ppl": 1.02142, "step": 18, "tokens/total": 546144, - "tokens/train_per_sec_per_gpu": 32.57, + "tokens/train_per_sec_per_gpu": 33.78, "tokens/trainable": 8184 }, { "epoch": 0.07421875, - "grad_norm": 0.4661593735218048, + "grad_norm": 0.377701997756958, "learning_rate": 7.2e-05, - "loss": 0.009341681376099586, + "loss": 0.013856083154678345, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00939, + "ppl": 1.01395, "step": 19, "tokens/total": 576560, - "tokens/train_per_sec_per_gpu": 34.92, + "tokens/train_per_sec_per_gpu": 34.89, "tokens/trainable": 8675 }, { "epoch": 0.078125, - "grad_norm": 1.1673170328140259, + "grad_norm": 1.426601529121399, "learning_rate": 7.6e-05, - "loss": 0.04048188403248787, + "loss": 0.0455022007226944, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.04131, + "ppl": 1.04655, "step": 20, "tokens/total": 607056, - "tokens/train_per_sec_per_gpu": 39.74, + "tokens/train_per_sec_per_gpu": 39.72, "tokens/trainable": 9189 }, { "epoch": 0.08203125, - "grad_norm": 0.8361555337905884, + "grad_norm": 0.56149822473526, "learning_rate": 8e-05, - "loss": 0.02851756103336811, + "loss": 0.03209531307220459, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.02893, + "ppl": 1.03262, "step": 21, "tokens/total": 637488, - "tokens/train_per_sec_per_gpu": 31.64, + "tokens/train_per_sec_per_gpu": 31.61, "tokens/trainable": 9614 }, { "epoch": 0.0859375, - "grad_norm": 0.8653759360313416, + "grad_norm": 1.1531219482421875, "learning_rate": 8.4e-05, - "loss": 0.041549794375896454, + "loss": 0.04279206693172455, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.75, "memory/max_allocated (GiB)": 33.75, - "ppl": 1.04243, + "ppl": 1.04372, "step": 22, "tokens/total": 667632, - "tokens/train_per_sec_per_gpu": 36.1, + "tokens/train_per_sec_per_gpu": 36.11, "tokens/trainable": 10086 }, { "epoch": 0.08984375, - "grad_norm": 0.8493275046348572, + "grad_norm": 0.9407010078430176, "learning_rate": 8.800000000000001e-05, - "loss": 0.020575426518917084, + "loss": 0.01938648894429207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02079, + "ppl": 1.01958, "step": 23, "tokens/total": 697872, - "tokens/train_per_sec_per_gpu": 31.86, + "tokens/train_per_sec_per_gpu": 32.88, "tokens/trainable": 10535 }, { "epoch": 0.09375, - "grad_norm": 0.328060120344162, + "grad_norm": 0.3499844968318939, "learning_rate": 9.200000000000001e-05, - "loss": 0.009413162246346474, + "loss": 0.01257958635687828, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00946, + "ppl": 1.01266, "step": 24, "tokens/total": 728432, - "tokens/train_per_sec_per_gpu": 31.42, + "tokens/train_per_sec_per_gpu": 31.52, "tokens/trainable": 10993 }, { "epoch": 0.09765625, - "grad_norm": 2.5502021312713623, + "grad_norm": 1.6778419017791748, "learning_rate": 9.6e-05, - "loss": 0.029345238581299782, + "loss": 0.04129436984658241, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.02978, + "ppl": 1.04216, "step": 25, "tokens/total": 756656, "tokens/train_per_sec_per_gpu": 39.78, @@ -361,125 +361,125 @@ }, { "epoch": 0.1015625, - "grad_norm": 0.8027920126914978, + "grad_norm": 0.5760903358459473, "learning_rate": 0.0001, - "loss": 0.018683090806007385, + "loss": 0.008185511454939842, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01886, + "ppl": 1.00822, "step": 26, "tokens/total": 787120, - "tokens/train_per_sec_per_gpu": 34.21, + "tokens/train_per_sec_per_gpu": 34.31, "tokens/trainable": 11874 }, { "epoch": 0.10546875, - "grad_norm": 1.8048255443572998, + "grad_norm": 5.235631942749023, "learning_rate": 9.99990636831587e-05, - "loss": 0.055194176733493805, + "loss": 0.010828999802470207, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.05675, + "ppl": 1.01089, "step": 27, "tokens/total": 817504, - "tokens/train_per_sec_per_gpu": 31.45, + "tokens/train_per_sec_per_gpu": 31.62, "tokens/trainable": 12316 }, { "epoch": 0.109375, - "grad_norm": 1.0372087955474854, + "grad_norm": 1.404441475868225, "learning_rate": 9.999625477159879e-05, - "loss": 0.021458934992551804, + "loss": 0.051578108221292496, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02169, + "ppl": 1.05293, "step": 28, "tokens/total": 848128, - "tokens/train_per_sec_per_gpu": 37.67, + "tokens/train_per_sec_per_gpu": 37.76, "tokens/trainable": 12800 }, { "epoch": 0.11328125, - "grad_norm": 2.1608479022979736, + "grad_norm": 3.0178139209747314, "learning_rate": 9.999157338221051e-05, - "loss": 0.03214032202959061, + "loss": 0.051813721656799316, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.03266, + "ppl": 1.05318, "step": 29, "tokens/total": 878448, - "tokens/train_per_sec_per_gpu": 35.35, + "tokens/train_per_sec_per_gpu": 35.43, "tokens/trainable": 13270 }, { "epoch": 0.1171875, - "grad_norm": 1.293318510055542, + "grad_norm": 1.413711428642273, "learning_rate": 9.998501970980562e-05, - "loss": 0.028661008924245834, + "loss": 0.025016000494360924, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.94, "memory/max_allocated (GiB)": 33.94, - "ppl": 1.02908, + "ppl": 1.02533, "step": 30, "tokens/total": 909008, - "tokens/train_per_sec_per_gpu": 35.17, + "tokens/train_per_sec_per_gpu": 35.27, "tokens/trainable": 13752 }, { "epoch": 0.12109375, - "grad_norm": 0.8398776650428772, + "grad_norm": 1.1610053777694702, "learning_rate": 9.997659402710915e-05, - "loss": 0.022880423814058304, + "loss": 0.008201262913644314, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.02314, + "ppl": 1.00823, "step": 31, "tokens/total": 939312, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 34.0, "tokens/trainable": 14218 }, { "epoch": 0.125, - "grad_norm": 0.2221565991640091, + "grad_norm": 0.2630869448184967, "learning_rate": 9.996629668474818e-05, - "loss": 0.006213155575096607, + "loss": 0.006646217778325081, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00623, + "ppl": 1.00667, "step": 32, "tokens/total": 969264, - "tokens/train_per_sec_per_gpu": 34.28, + "tokens/train_per_sec_per_gpu": 34.38, "tokens/trainable": 14655 }, { "epoch": 0.12890625, - "grad_norm": 0.8032621145248413, + "grad_norm": 0.7988011240959167, "learning_rate": 9.995412811123711e-05, - "loss": 0.01775369979441166, + "loss": 0.017185213044285774, "memory/device_reserved (GiB)": 37.82, "memory/max_active (GiB)": 33.95, "memory/max_allocated (GiB)": 33.95, - "ppl": 1.01791, + "ppl": 1.01733, "step": 33, "tokens/total": 999792, - "tokens/train_per_sec_per_gpu": 33.19, + "tokens/train_per_sec_per_gpu": 33.23, "tokens/trainable": 15087 }, { "epoch": 0.1328125, - "grad_norm": 0.36855530738830566, + "grad_norm": 0.5069737434387207, "learning_rate": 9.994008881295999e-05, - "loss": 0.01877715066075325, + "loss": 0.02045844867825508, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.01895, + "ppl": 1.02067, "step": 34, "tokens/total": 1029840, "tokens/train_per_sec_per_gpu": 33.81, @@ -487,223 +487,223 @@ }, { "epoch": 0.13671875, - "grad_norm": 0.6419790983200073, + "grad_norm": 0.8837020993232727, "learning_rate": 9.992417937414932e-05, - "loss": 0.018639635294675827, + "loss": 0.024748671799898148, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01881, + "ppl": 1.02506, "step": 35, "tokens/total": 1060416, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.69, "tokens/trainable": 16037 }, { "epoch": 0.140625, - "grad_norm": 0.6260603070259094, + "grad_norm": 0.7192158102989197, "learning_rate": 9.99064004568618e-05, - "loss": 0.01560201682150364, + "loss": 0.0077397022396326065, "memory/device_reserved (GiB)": 35.48, "memory/max_active (GiB)": 33.72, "memory/max_allocated (GiB)": 33.72, - "ppl": 1.01572, + "ppl": 1.00777, "step": 36, "tokens/total": 1090464, - "tokens/train_per_sec_per_gpu": 30.96, + "tokens/train_per_sec_per_gpu": 31.0, "tokens/trainable": 16475 }, { "epoch": 0.14453125, - "grad_norm": 0.7199760675430298, + "grad_norm": 0.8887882232666016, "learning_rate": 9.988675280095074e-05, - "loss": 0.013066118583083153, + "loss": 0.024969205260276794, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.93, "memory/max_allocated (GiB)": 33.93, - "ppl": 1.01315, + "ppl": 1.02528, "step": 37, "tokens/total": 1120944, - "tokens/train_per_sec_per_gpu": 34.23, + "tokens/train_per_sec_per_gpu": 34.32, "tokens/trainable": 16919 }, { "epoch": 0.1484375, - "grad_norm": 0.5010533928871155, + "grad_norm": 1.0087132453918457, "learning_rate": 9.986523722403528e-05, - "loss": 0.006183410994708538, + "loss": 0.02261659875512123, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.0062, + "ppl": 1.02287, "step": 38, "tokens/total": 1151360, - "tokens/train_per_sec_per_gpu": 28.85, + "tokens/train_per_sec_per_gpu": 28.9, "tokens/trainable": 17333 }, { "epoch": 0.15234375, - "grad_norm": 0.5727057456970215, + "grad_norm": 0.5544025897979736, "learning_rate": 9.984185462146642e-05, - "loss": 0.00925515964627266, + "loss": 0.009409069083631039, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.0093, + "ppl": 1.00945, "step": 39, "tokens/total": 1181728, - "tokens/train_per_sec_per_gpu": 36.0, + "tokens/train_per_sec_per_gpu": 36.09, "tokens/trainable": 17806 }, { "epoch": 0.15625, - "grad_norm": 0.8821179270744324, + "grad_norm": 0.6828466653823853, "learning_rate": 9.98166059662897e-05, - "loss": 0.017210762947797775, + "loss": 0.015685085207223892, "memory/device_reserved (GiB)": 35.86, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01736, + "ppl": 1.01581, "step": 40, "tokens/total": 1212064, - "tokens/train_per_sec_per_gpu": 35.53, + "tokens/train_per_sec_per_gpu": 35.58, "tokens/trainable": 18290 }, { "epoch": 0.16015625, - "grad_norm": 0.22535507380962372, + "grad_norm": 0.32031646370887756, "learning_rate": 9.978949230920472e-05, - "loss": 0.0025184464175254107, + "loss": 0.006071081385016441, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, - "ppl": 1.00252, + "ppl": 1.00609, "step": 41, "tokens/total": 1242592, - "tokens/train_per_sec_per_gpu": 31.91, + "tokens/train_per_sec_per_gpu": 31.93, "tokens/trainable": 18747 }, { "epoch": 0.1640625, - "grad_norm": 1.0972777605056763, + "grad_norm": 1.35106360912323, "learning_rate": 9.976051477852141e-05, - "loss": 0.029553068801760674, + "loss": 0.038804396986961365, "memory/device_reserved (GiB)": 35.88, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.02999, + "ppl": 1.03957, "step": 42, "tokens/total": 1272800, - "tokens/train_per_sec_per_gpu": 31.79, + "tokens/train_per_sec_per_gpu": 31.83, "tokens/trainable": 19172 }, { "epoch": 0.16796875, - "grad_norm": 1.7466007471084595, + "grad_norm": 0.8709872961044312, "learning_rate": 9.972967458011312e-05, - "loss": 0.019218504428863525, + "loss": 0.019240852445364, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 34.04, "memory/max_allocated (GiB)": 34.04, - "ppl": 1.0194, + "ppl": 1.01943, "step": 43, "tokens/total": 1303600, - "tokens/train_per_sec_per_gpu": 31.17, + "tokens/train_per_sec_per_gpu": 31.21, "tokens/trainable": 19622 }, { "epoch": 0.171875, - "grad_norm": 0.8241431713104248, + "grad_norm": 0.7335953116416931, "learning_rate": 9.96969729973664e-05, - "loss": 0.009303302504122257, + "loss": 0.012263014912605286, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00935, + "ppl": 1.01234, "step": 44, "tokens/total": 1333936, - "tokens/train_per_sec_per_gpu": 33.22, + "tokens/train_per_sec_per_gpu": 33.31, "tokens/trainable": 20073 }, { "epoch": 0.17578125, - "grad_norm": 0.9528324007987976, + "grad_norm": 1.9549319744110107, "learning_rate": 9.966241139112754e-05, - "loss": 0.01562727987766266, + "loss": 0.012868007645010948, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01575, + "ppl": 1.01295, "step": 45, "tokens/total": 1364288, - "tokens/train_per_sec_per_gpu": 31.39, + "tokens/train_per_sec_per_gpu": 31.46, "tokens/trainable": 20497 }, { "epoch": 0.1796875, - "grad_norm": 0.6404260993003845, + "grad_norm": 0.5352866053581238, "learning_rate": 9.96259911996461e-05, - "loss": 0.012095995247364044, + "loss": 0.006207342725247145, "memory/device_reserved (GiB)": 36.03, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01217, + "ppl": 1.00623, "step": 46, "tokens/total": 1394368, - "tokens/train_per_sec_per_gpu": 34.19, + "tokens/train_per_sec_per_gpu": 34.21, "tokens/trainable": 20940 }, { "epoch": 0.18359375, - "grad_norm": 0.26121965050697327, + "grad_norm": 0.6218534708023071, "learning_rate": 9.958771393851491e-05, - "loss": 0.005679970607161522, + "loss": 0.006636852398514748, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.98, "memory/max_allocated (GiB)": 33.98, - "ppl": 1.0057, + "ppl": 1.00666, "step": 47, "tokens/total": 1425024, - "tokens/train_per_sec_per_gpu": 34.79, + "tokens/train_per_sec_per_gpu": 34.94, "tokens/trainable": 21405 }, { "epoch": 0.1875, - "grad_norm": 0.5886640548706055, + "grad_norm": 0.7587782144546509, "learning_rate": 9.954758120060702e-05, - "loss": 0.01392911747097969, + "loss": 0.008137413300573826, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.01403, + "ppl": 1.00817, "step": 48, "tokens/total": 1455392, - "tokens/train_per_sec_per_gpu": 34.98, + "tokens/train_per_sec_per_gpu": 35.03, "tokens/trainable": 21828 }, { "epoch": 0.19140625, - "grad_norm": 1.1329762935638428, + "grad_norm": 0.6957025527954102, "learning_rate": 9.950559465600948e-05, - "loss": 0.020810024812817574, + "loss": 0.019302664324641228, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.02103, + "ppl": 1.01949, "step": 49, "tokens/total": 1485616, - "tokens/train_per_sec_per_gpu": 29.27, + "tokens/train_per_sec_per_gpu": 29.43, "tokens/trainable": 22241 }, { "epoch": 0.1953125, - "grad_norm": 0.6578322649002075, + "grad_norm": 0.7795535922050476, "learning_rate": 9.946175605195379e-05, - "loss": 0.010059596970677376, + "loss": 0.0063660056330263615, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01011, + "ppl": 1.00639, "step": 50, "tokens/total": 1515984, "tokens/train_per_sec_per_gpu": 36.23, @@ -711,646 +711,646 @@ }, { "epoch": 0.19921875, - "grad_norm": 0.20452141761779785, + "grad_norm": 0.20801189541816711, "learning_rate": 9.941606721274322e-05, - "loss": 0.0022001813631504774, + "loss": 0.0021921340376138687, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.0022, + "ppl": 1.00219, "step": 51, "tokens/total": 1546224, - "tokens/train_per_sec_per_gpu": 32.0, + "tokens/train_per_sec_per_gpu": 32.03, "tokens/trainable": 23136 }, { "epoch": 0.203125, - "grad_norm": 0.8622198104858398, + "grad_norm": 0.7914130687713623, "learning_rate": 9.936853003967685e-05, - "loss": 0.018845411017537117, + "loss": 0.012165859341621399, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01902, + "ppl": 1.01224, "step": 52, "tokens/total": 1576528, - "tokens/train_per_sec_per_gpu": 36.75, + "tokens/train_per_sec_per_gpu": 36.92, "tokens/trainable": 23631 }, { "epoch": 0.20703125, - "grad_norm": 0.8480555415153503, + "grad_norm": 0.7185864448547363, "learning_rate": 9.93191465109705e-05, - "loss": 0.011732892133295536, + "loss": 0.008950375951826572, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.0118, + "ppl": 1.00899, "step": 53, "tokens/total": 1606768, - "tokens/train_per_sec_per_gpu": 33.97, + "tokens/train_per_sec_per_gpu": 34.05, "tokens/trainable": 24096 }, { "epoch": 0.2109375, - "grad_norm": 0.755364179611206, + "grad_norm": 0.8439444303512573, "learning_rate": 9.926791868167438e-05, - "loss": 0.0058293710462749004, + "loss": 0.011410758830606937, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.66, "memory/max_allocated (GiB)": 33.66, - "ppl": 1.00585, + "ppl": 1.01148, "step": 54, "tokens/total": 1636640, - "tokens/train_per_sec_per_gpu": 37.7, + "tokens/train_per_sec_per_gpu": 37.77, "tokens/trainable": 24569 }, { "epoch": 0.21484375, - "grad_norm": 0.7364905476570129, + "grad_norm": 0.47947707772254944, "learning_rate": 9.921484868358753e-05, - "loss": 0.010204591788351536, + "loss": 0.004429137334227562, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01026, + "ppl": 1.00444, "step": 55, "tokens/total": 1667136, - "tokens/train_per_sec_per_gpu": 33.78, + "tokens/train_per_sec_per_gpu": 33.86, "tokens/trainable": 25067 }, { "epoch": 0.21875, - "grad_norm": 0.9788613319396973, + "grad_norm": 0.4257976710796356, "learning_rate": 9.915993872516924e-05, - "loss": 0.00861713383346796, + "loss": 0.00340340007096529, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00865, + "ppl": 1.00341, "step": 56, "tokens/total": 1697472, - "tokens/train_per_sec_per_gpu": 36.35, + "tokens/train_per_sec_per_gpu": 36.47, "tokens/trainable": 25541 }, { "epoch": 0.22265625, - "grad_norm": 0.10467419028282166, + "grad_norm": 0.7323225736618042, "learning_rate": 9.9103191091447e-05, - "loss": 0.000954336894210428, + "loss": 0.010487878695130348, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00095, + "ppl": 1.01054, "step": 57, "tokens/total": 1727680, - "tokens/train_per_sec_per_gpu": 33.06, + "tokens/train_per_sec_per_gpu": 33.08, "tokens/trainable": 25965 }, { "epoch": 0.2265625, - "grad_norm": 1.6430989503860474, + "grad_norm": 2.3697221279144287, "learning_rate": 9.904460814392147e-05, - "loss": 0.01942642591893673, + "loss": 0.004758198279887438, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.01962, + "ppl": 1.00477, "step": 58, "tokens/total": 1758192, - "tokens/train_per_sec_per_gpu": 33.71, + "tokens/train_per_sec_per_gpu": 33.79, "tokens/trainable": 26409 }, { "epoch": 0.23046875, - "grad_norm": 1.1748270988464355, + "grad_norm": 1.732944369316101, "learning_rate": 9.898419232046825e-05, - "loss": 0.013463183306157589, + "loss": 0.00296807405538857, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01355, + "ppl": 1.00297, "step": 59, "tokens/total": 1788816, - "tokens/train_per_sec_per_gpu": 33.91, + "tokens/train_per_sec_per_gpu": 33.99, "tokens/trainable": 26883 }, { "epoch": 0.234375, - "grad_norm": 0.5780875086784363, + "grad_norm": 4.904305934906006, "learning_rate": 9.892194613523633e-05, - "loss": 0.006647198460996151, + "loss": 0.005324847996234894, "memory/device_reserved (GiB)": 36.15, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00667, + "ppl": 1.00534, "step": 60, "tokens/total": 1819056, - "tokens/train_per_sec_per_gpu": 33.6, + "tokens/train_per_sec_per_gpu": 33.67, "tokens/trainable": 27323 }, { "epoch": 0.23828125, - "grad_norm": 0.2437741607427597, + "grad_norm": 0.08419182896614075, "learning_rate": 9.885787217854357e-05, - "loss": 0.002088701818138361, + "loss": 0.0007892341818660498, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.00209, + "ppl": 1.00079, "step": 61, "tokens/total": 1849664, - "tokens/train_per_sec_per_gpu": 39.06, + "tokens/train_per_sec_per_gpu": 39.09, "tokens/trainable": 27830 }, { "epoch": 0.2421875, - "grad_norm": 0.7739479541778564, + "grad_norm": 0.7355648279190063, "learning_rate": 9.879197311676887e-05, - "loss": 0.008961028419435024, + "loss": 0.017353510484099388, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 34.02, "memory/max_allocated (GiB)": 34.02, - "ppl": 1.009, + "ppl": 1.0175, "step": 62, "tokens/total": 1880272, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 28281 }, { "epoch": 0.24609375, - "grad_norm": 0.4645387530326843, + "grad_norm": 0.925104558467865, "learning_rate": 9.872425169224113e-05, - "loss": 0.00877321232110262, + "loss": 0.01441475935280323, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.00881, + "ppl": 1.01452, "step": 63, "tokens/total": 1910752, - "tokens/train_per_sec_per_gpu": 32.12, + "tokens/train_per_sec_per_gpu": 32.16, "tokens/trainable": 28742 }, { "epoch": 0.25, - "grad_norm": 0.3244670331478119, + "grad_norm": 0.2562558352947235, "learning_rate": 9.865471072312528e-05, - "loss": 0.005190960131585598, + "loss": 0.0025585039984434843, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.0052, + "ppl": 1.00256, "step": 64, "tokens/total": 1940848, - "tokens/train_per_sec_per_gpu": 33.51, + "tokens/train_per_sec_per_gpu": 33.54, "tokens/trainable": 29183 }, { "epoch": 0.25390625, - "grad_norm": 0.14167968928813934, + "grad_norm": 0.5092302560806274, "learning_rate": 9.858335310330492e-05, - "loss": 0.002684956882148981, + "loss": 0.007829459384083748, "memory/device_reserved (GiB)": 36.16, "memory/max_active (GiB)": 33.91, "memory/max_allocated (GiB)": 33.91, - "ppl": 1.00269, + "ppl": 1.00786, "step": 65, "tokens/total": 1971344, - "tokens/train_per_sec_per_gpu": 31.41, + "tokens/train_per_sec_per_gpu": 31.45, "tokens/trainable": 29648 }, { "epoch": 0.2578125, - "grad_norm": 0.14564643800258636, + "grad_norm": 0.5972490310668945, "learning_rate": 9.851018180226185e-05, - "loss": 0.0019384396728128195, + "loss": 0.0017629603389650583, "memory/device_reserved (GiB)": 35.06, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00194, + "ppl": 1.00176, "step": 66, "tokens/total": 2001712, - "tokens/train_per_sec_per_gpu": 33.39, + "tokens/train_per_sec_per_gpu": 33.44, "tokens/trainable": 30075 }, { "epoch": 0.26171875, - "grad_norm": 0.14445120096206665, + "grad_norm": 0.6682910919189453, "learning_rate": 9.843519986495259e-05, - "loss": 0.00246395799331367, + "loss": 0.005682674702256918, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.78, "memory/max_allocated (GiB)": 33.78, - "ppl": 1.00247, + "ppl": 1.0057, "step": 67, "tokens/total": 2029936, - "tokens/train_per_sec_per_gpu": 37.46, + "tokens/train_per_sec_per_gpu": 37.53, "tokens/trainable": 30546 }, { "epoch": 0.265625, - "grad_norm": 0.11620035767555237, + "grad_norm": 2.3002567291259766, "learning_rate": 9.835841041168162e-05, - "loss": 0.002091757021844387, + "loss": 0.010535864159464836, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00209, + "ppl": 1.01059, "step": 68, "tokens/total": 2060384, - "tokens/train_per_sec_per_gpu": 34.97, + "tokens/train_per_sec_per_gpu": 35.06, "tokens/trainable": 31025 }, { "epoch": 0.26953125, - "grad_norm": 1.0260282754898071, + "grad_norm": 2.2319464683532715, "learning_rate": 9.82798166379715e-05, - "loss": 0.018634717911481857, + "loss": 0.016697486862540245, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.85, "memory/max_allocated (GiB)": 33.85, - "ppl": 1.01881, + "ppl": 1.01684, "step": 69, "tokens/total": 2090688, - "tokens/train_per_sec_per_gpu": 33.72, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 31505 }, { "epoch": 0.2734375, - "grad_norm": 0.2051197588443756, + "grad_norm": 0.4549625515937805, "learning_rate": 9.819942181443002e-05, - "loss": 0.002587665105238557, + "loss": 0.005516475066542625, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.77, "memory/max_allocated (GiB)": 33.77, - "ppl": 1.00259, + "ppl": 1.00553, "step": 70, "tokens/total": 2120848, - "tokens/train_per_sec_per_gpu": 32.16, + "tokens/train_per_sec_per_gpu": 32.21, "tokens/trainable": 31956 }, { "epoch": 0.27734375, - "grad_norm": 0.09380944818258286, + "grad_norm": 0.7483011484146118, "learning_rate": 9.811722928661392e-05, - "loss": 0.001408122479915619, + "loss": 0.008852789178490639, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.35, "memory/max_allocated (GiB)": 33.35, - "ppl": 1.00141, + "ppl": 1.00889, "step": 71, "tokens/total": 2149120, - "tokens/train_per_sec_per_gpu": 33.28, + "tokens/train_per_sec_per_gpu": 33.33, "tokens/trainable": 32374 }, { "epoch": 0.28125, - "grad_norm": 0.27224063873291016, + "grad_norm": 0.4358912706375122, "learning_rate": 9.803324247488975e-05, - "loss": 0.004072523210197687, + "loss": 0.0014208657667040825, "memory/device_reserved (GiB)": 35.64, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00408, + "ppl": 1.00142, "step": 72, "tokens/total": 2179472, - "tokens/train_per_sec_per_gpu": 34.41, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 32833 }, { "epoch": 0.28515625, - "grad_norm": 0.3583205044269562, + "grad_norm": 0.32716670632362366, "learning_rate": 9.794746487429161e-05, - "loss": 0.011584535241127014, + "loss": 0.005963748786598444, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.92, "memory/max_allocated (GiB)": 33.92, - "ppl": 1.01165, + "ppl": 1.00598, "step": 73, "tokens/total": 2209984, - "tokens/train_per_sec_per_gpu": 35.56, + "tokens/train_per_sec_per_gpu": 35.67, "tokens/trainable": 33304 }, { "epoch": 0.2890625, - "grad_norm": 1.0283039808273315, + "grad_norm": 0.5767021775245667, "learning_rate": 9.785990005437554e-05, - "loss": 0.01845213770866394, + "loss": 0.00536112766712904, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.01862, + "ppl": 1.00538, "step": 74, "tokens/total": 2240512, - "tokens/train_per_sec_per_gpu": 32.26, + "tokens/train_per_sec_per_gpu": 32.33, "tokens/trainable": 33771 }, { "epoch": 0.29296875, - "grad_norm": 0.36125439405441284, + "grad_norm": 0.9307782649993896, "learning_rate": 9.777055165907117e-05, - "loss": 0.00887919683009386, + "loss": 0.006907512433826923, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.74, "memory/max_allocated (GiB)": 33.74, - "ppl": 1.00892, + "ppl": 1.00693, "step": 75, "tokens/total": 2270608, - "tokens/train_per_sec_per_gpu": 34.38, + "tokens/train_per_sec_per_gpu": 34.46, "tokens/trainable": 34186 }, { "epoch": 0.296875, - "grad_norm": 0.16392527520656586, + "grad_norm": 0.517152726650238, "learning_rate": 9.767942340652993e-05, - "loss": 0.0015689346473664045, + "loss": 0.0017031149473041296, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.81, "memory/max_allocated (GiB)": 33.81, - "ppl": 1.00157, + "ppl": 1.0017, "step": 76, "tokens/total": 2300864, - "tokens/train_per_sec_per_gpu": 34.72, + "tokens/train_per_sec_per_gpu": 34.83, "tokens/trainable": 34667 }, { "epoch": 0.30078125, - "grad_norm": 2.7881975173950195, + "grad_norm": 4.431775093078613, "learning_rate": 9.758651908897035e-05, - "loss": 0.025477740913629532, + "loss": 0.01024378277361393, "memory/device_reserved (GiB)": 35.96, "memory/max_active (GiB)": 33.76, "memory/max_allocated (GiB)": 33.76, - "ppl": 1.02581, + "ppl": 1.0103, "step": 77, "tokens/total": 2330960, - "tokens/train_per_sec_per_gpu": 31.61, + "tokens/train_per_sec_per_gpu": 31.71, "tokens/trainable": 35078 }, { "epoch": 0.3046875, - "grad_norm": 0.33993980288505554, + "grad_norm": 1.6990809440612793, "learning_rate": 9.749184257252033e-05, - "loss": 0.005589683074504137, + "loss": 0.016885127872228622, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.99, "memory/max_allocated (GiB)": 33.99, - "ppl": 1.00561, + "ppl": 1.01703, "step": 78, "tokens/total": 2361584, - "tokens/train_per_sec_per_gpu": 34.71, + "tokens/train_per_sec_per_gpu": 34.8, "tokens/trainable": 35550 }, { "epoch": 0.30859375, - "grad_norm": 0.7556514143943787, + "grad_norm": 1.1758185625076294, "learning_rate": 9.739539779705614e-05, - "loss": 0.011452069506049156, + "loss": 0.005958402995020151, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.01152, + "ppl": 1.00598, "step": 79, "tokens/total": 2391936, - "tokens/train_per_sec_per_gpu": 29.39, + "tokens/train_per_sec_per_gpu": 29.46, "tokens/trainable": 35977 }, { "epoch": 0.3125, - "grad_norm": 0.4027617871761322, + "grad_norm": 2.7611470222473145, "learning_rate": 9.729718877603861e-05, - "loss": 0.01585138961672783, + "loss": 0.034006115049123764, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.01598, + "ppl": 1.03459, "step": 80, "tokens/total": 2422432, - "tokens/train_per_sec_per_gpu": 38.08, + "tokens/train_per_sec_per_gpu": 38.2, "tokens/trainable": 36462 }, { "epoch": 0.31640625, - "grad_norm": 0.4201640188694, + "grad_norm": 0.017304062843322754, "learning_rate": 9.719721959634592e-05, - "loss": 0.01109630148857832, + "loss": 0.00017258770822081715, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.01116, + "ppl": 1.00017, "step": 81, "tokens/total": 2452752, - "tokens/train_per_sec_per_gpu": 33.12, + "tokens/train_per_sec_per_gpu": 33.18, "tokens/trainable": 36919 }, { "epoch": 0.3203125, - "grad_norm": 0.6295281052589417, + "grad_norm": 0.6304571032524109, "learning_rate": 9.709549441810375e-05, - "loss": 0.01843855530023575, + "loss": 0.00832848995923996, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.44, "memory/max_allocated (GiB)": 33.44, - "ppl": 1.01861, + "ppl": 1.00836, "step": 82, "tokens/total": 2481216, - "tokens/train_per_sec_per_gpu": 33.37, + "tokens/train_per_sec_per_gpu": 33.4, "tokens/trainable": 37379 }, { "epoch": 0.32421875, - "grad_norm": 0.10422858595848083, + "grad_norm": 0.08372113853693008, "learning_rate": 9.699201747451195e-05, - "loss": 0.0014611330116167665, + "loss": 0.0007960593793541193, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.84, "memory/max_allocated (GiB)": 33.84, - "ppl": 1.00146, + "ppl": 1.0008, "step": 83, "tokens/total": 2511488, - "tokens/train_per_sec_per_gpu": 32.98, + "tokens/train_per_sec_per_gpu": 33.05, "tokens/trainable": 37832 }, { "epoch": 0.328125, - "grad_norm": 0.09028259664773941, + "grad_norm": 0.4056459367275238, "learning_rate": 9.688679307166854e-05, - "loss": 0.0017336590681225061, + "loss": 0.0015380227705463767, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00174, + "ppl": 1.00154, "step": 84, "tokens/total": 2541984, - "tokens/train_per_sec_per_gpu": 33.84, + "tokens/train_per_sec_per_gpu": 33.87, "tokens/trainable": 38303 }, { "epoch": 0.33203125, - "grad_norm": 0.5652539134025574, + "grad_norm": 0.1656680703163147, "learning_rate": 9.677982558839042e-05, - "loss": 0.004695026203989983, + "loss": 0.0007727849297225475, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.69, "memory/max_allocated (GiB)": 33.69, - "ppl": 1.00471, + "ppl": 1.00077, "step": 85, "tokens/total": 2572224, - "tokens/train_per_sec_per_gpu": 33.54, + "tokens/train_per_sec_per_gpu": 33.62, "tokens/trainable": 38758 }, { "epoch": 0.3359375, - "grad_norm": 0.14223186671733856, + "grad_norm": 1.7784565687179565, "learning_rate": 9.66711194760312e-05, - "loss": 0.002384063322097063, + "loss": 0.00887264870107174, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.86, "memory/max_allocated (GiB)": 33.86, - "ppl": 1.00239, + "ppl": 1.00891, "step": 86, "tokens/total": 2602704, - "tokens/train_per_sec_per_gpu": 30.54, + "tokens/train_per_sec_per_gpu": 30.62, "tokens/trainable": 39179 }, { "epoch": 0.33984375, - "grad_norm": 0.6704997420310974, + "grad_norm": 0.6024295687675476, "learning_rate": 9.656067925829593e-05, - "loss": 0.01066659577190876, + "loss": 0.013714440166950226, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.88, "memory/max_allocated (GiB)": 33.88, - "ppl": 1.01072, + "ppl": 1.01381, "step": 87, "tokens/total": 2633072, - "tokens/train_per_sec_per_gpu": 35.27, + "tokens/train_per_sec_per_gpu": 35.29, "tokens/trainable": 39679 }, { "epoch": 0.34375, - "grad_norm": 0.7846710085868835, + "grad_norm": 3.774395704269409, "learning_rate": 9.644850953105288e-05, - "loss": 0.015946906059980392, + "loss": 0.021049978211522102, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.73, "memory/max_allocated (GiB)": 33.73, - "ppl": 1.01607, + "ppl": 1.02127, "step": 88, "tokens/total": 2663232, - "tokens/train_per_sec_per_gpu": 32.69, + "tokens/train_per_sec_per_gpu": 32.65, "tokens/trainable": 40118 }, { "epoch": 0.34765625, - "grad_norm": 0.1815856546163559, + "grad_norm": 0.20895183086395264, "learning_rate": 9.633461496214225e-05, - "loss": 0.002847571624442935, + "loss": 0.0025408377405256033, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00285, + "ppl": 1.00254, "step": 89, "tokens/total": 2693696, - "tokens/train_per_sec_per_gpu": 32.78, + "tokens/train_per_sec_per_gpu": 32.76, "tokens/trainable": 40571 }, { "epoch": 0.3515625, - "grad_norm": 0.1427551805973053, + "grad_norm": 0.3318273425102234, "learning_rate": 9.621900029118195e-05, - "loss": 0.0019866693764925003, + "loss": 0.0036354511976242065, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00199, + "ppl": 1.00364, "step": 90, "tokens/total": 2723984, - "tokens/train_per_sec_per_gpu": 30.76, + "tokens/train_per_sec_per_gpu": 30.75, "tokens/trainable": 40997 }, { "epoch": 0.35546875, - "grad_norm": 0.5249826908111572, + "grad_norm": 0.44360974431037903, "learning_rate": 9.610167032937036e-05, - "loss": 0.007045849692076445, + "loss": 0.007065630983561277, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.82, "memory/max_allocated (GiB)": 33.82, - "ppl": 1.00707, + "ppl": 1.00709, "step": 91, "tokens/total": 2754240, - "tokens/train_per_sec_per_gpu": 36.45, + "tokens/train_per_sec_per_gpu": 36.46, "tokens/trainable": 41462 }, { "epoch": 0.359375, - "grad_norm": 0.5962002277374268, + "grad_norm": 0.887543797492981, "learning_rate": 9.598262995928611e-05, - "loss": 0.006978678051382303, + "loss": 0.01106376200914383, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.89, "memory/max_allocated (GiB)": 33.89, - "ppl": 1.007, + "ppl": 1.01113, "step": 92, "tokens/total": 2784672, - "tokens/train_per_sec_per_gpu": 36.81, + "tokens/train_per_sec_per_gpu": 36.79, "tokens/trainable": 41927 }, { "epoch": 0.36328125, - "grad_norm": 0.2272304892539978, + "grad_norm": 1.7098511457443237, "learning_rate": 9.586188413468492e-05, - "loss": 0.002275684382766485, + "loss": 0.02100781723856926, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.83, "memory/max_allocated (GiB)": 33.83, - "ppl": 1.00228, + "ppl": 1.02123, "step": 93, "tokens/total": 2815120, - "tokens/train_per_sec_per_gpu": 34.8, + "tokens/train_per_sec_per_gpu": 34.84, "tokens/trainable": 42397 }, { "epoch": 0.3671875, - "grad_norm": 0.04158688336610794, + "grad_norm": 0.05345788225531578, "learning_rate": 9.57394378802934e-05, - "loss": 0.0007734425598755479, + "loss": 0.0007664336590096354, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.97, "memory/max_allocated (GiB)": 33.97, "ppl": 1.00077, "step": 94, "tokens/total": 2845600, - "tokens/train_per_sec_per_gpu": 36.53, + "tokens/train_per_sec_per_gpu": 36.55, "tokens/trainable": 42883 }, { "epoch": 0.37109375, - "grad_norm": 0.2428545504808426, + "grad_norm": 0.3566146492958069, "learning_rate": 9.56152962916e-05, - "loss": 0.003534857416525483, + "loss": 0.001947208889760077, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.87, "memory/max_allocated (GiB)": 33.87, - "ppl": 1.00354, + "ppl": 1.00195, "step": 95, "tokens/total": 2875952, - "tokens/train_per_sec_per_gpu": 38.65, + "tokens/train_per_sec_per_gpu": 38.67, "tokens/trainable": 43381 }, { "epoch": 0.375, - "grad_norm": 0.05061683431267738, + "grad_norm": 0.6130653023719788, "learning_rate": 9.548946453464296e-05, - "loss": 0.00045320752542465925, + "loss": 0.011625099927186966, "memory/device_reserved (GiB)": 35.98, "memory/max_active (GiB)": 33.9, "memory/max_allocated (GiB)": 33.9, - "ppl": 1.00045, + "ppl": 1.01169, "step": 96, "tokens/total": 2906288, - "tokens/train_per_sec_per_gpu": 32.95, + "tokens/train_per_sec_per_gpu": 32.99, "tokens/trainable": 43824 } ], diff --git a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/debug.log b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/debug.log index 400630bef0abffc0395becd8420349db8638ca64..a12f260eb02e459d9dc2e2886ecb22ecd7ec7ce3 100644 --- a/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/debug.log +++ b/aft_wave_v2/charter_real_4x__charter0p2/training/checkpoints/debug.log @@ -1,5 +1,5 @@ -[2026-08-18 12:37:43,088] [DEBUG] [axolotl.utils.config.log_gpu_memory_usage:127] [PID:2978] baseline 0.000GB () -[2026-08-18 12:37:43,089] [INFO] [axolotl.cli.config.load_cfg:333] [PID:2978] config: +[2026-08-18 14:04:05,092] [DEBUG] [axolotl.utils.config.log_gpu_memory_usage:127] [PID:10630] baseline 0.000GB () +[2026-08-18 14:04:05,093] [INFO] [axolotl.cli.config.load_cfg:333] [PID:10630] config: { "activation_offloading": false, "adapter": "lora", @@ -199,17 +199,16 @@ "weight_decay": 0.01, "world_size": 1 } -[2026-08-18 12:37:43,542] [DEBUG] [axolotl.loaders.utils.check_model_config:88] [PID:2978] Loaded image size: 896 from model config -[2026-08-18 12:37:49,774] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:311] [PID:2978] EOS: 1 / -[2026-08-18 12:37:49,774] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:2978] BOS: 2 / -[2026-08-18 12:37:49,774] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:2978] PAD: 0 / -[2026-08-18 12:37:49,774] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:2978] UNK: 3 / -[2026-08-18 12:37:49,775] [INFO] [axolotl.utils.data.shared.load_preprocessed_dataset:482] [PID:2978] Unable to find prepared dataset in /workspace/wave/training/prepared/2384177d8bb0e5a62897059184c8b941 -[2026-08-18 12:37:49,775] [INFO] [axolotl.utils.data.sft._load_raw_datasets:320] [PID:2978] Loading raw datasets... -[2026-08-18 12:37:49,775] [WARNING] [axolotl.utils.data.sft._load_raw_datasets:322] [PID:2978] Processing datasets during training can lead to VRAM instability. Please pre-process your dataset using `axolotl preprocess path/to/config.yml`. - Generating train split: 0 examples [00:00, ? examples/s] Generating train split: 3995 examples [00:00, 21852.63 examples/s] Generating train split: 8003 examples [00:00, 28524.63 examples/s] Generating train split: 8192 examples [00:00, 27088.63 examples/s] -[2026-08-18 12:37:51,201] [INFO] [axolotl.utils.data.wrappers.get_dataset_wrapper:87] [PID:2978] Loading dataset: /workspace/wave/data/datasets/aft_charter0p2.jsonl with base_type: chat_template and prompt_style: None -[2026-08-18 12:37:51,212] [INFO] [axolotl.prompt_strategies.chat_template.__call__:1209] [PID:2978] Using chat template: +[2026-08-18 14:04:05,592] [DEBUG] [axolotl.loaders.utils.check_model_config:88] [PID:10630] Loaded image size: 896 from model config +[2026-08-18 14:04:08,371] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:311] [PID:10630] EOS: 1 / +[2026-08-18 14:04:08,371] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:10630] BOS: 2 / +[2026-08-18 14:04:08,371] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:10630] PAD: 0 / +[2026-08-18 14:04:08,371] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:10630] UNK: 3 / +[2026-08-18 14:04:08,372] [INFO] [axolotl.utils.data.shared.load_preprocessed_dataset:482] [PID:10630] Unable to find prepared dataset in /workspace/wave/training/prepared/2384177d8bb0e5a62897059184c8b941 +[2026-08-18 14:04:08,372] [INFO] [axolotl.utils.data.sft._load_raw_datasets:320] [PID:10630] Loading raw datasets... +[2026-08-18 14:04:08,372] [WARNING] [axolotl.utils.data.sft._load_raw_datasets:322] [PID:10630] Processing datasets during training can lead to VRAM instability. Please pre-process your dataset using `axolotl preprocess path/to/config.yml`. +[2026-08-18 14:04:09,202] [INFO] [axolotl.utils.data.wrappers.get_dataset_wrapper:87] [PID:10630] Loading dataset: /workspace/wave/data/datasets/aft_charter0p2.jsonl with base_type: chat_template and prompt_style: None +[2026-08-18 14:04:09,206] [INFO] [axolotl.prompt_strategies.chat_template.__call__:1209] [PID:10630] Using chat template: --- {{ bos_token }} {%- if messages[0]['role'] == 'system' -%} @@ -260,568 +259,566 @@ {%- endif -%} --- - Tokenizing Prompts (num_proc=8): 0%| | 0/8192 [00:001280) (num_proc=8): 0%| | 0/8192 [00:001280) (num_proc=8): 12%|█▏ | 1000/8192 [00:00<00:01, 5059.58 examples/s] Dropping Invalid Sequences (1280) (num_proc=8): 100%|██████████| 8192/8192 [00:00<00:00, 21541.94 examples/s] - Saving the dataset (0/8 shards): 0%| | 0/8192 [00:00 -[2026-08-18 12:38:51,403] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:2978] BOS: 2 / -[2026-08-18 12:38:51,403] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:2978] PAD: 0 / -[2026-08-18 12:38:51,403] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:2978] UNK: 3 / -[2026-08-18 12:38:58,979] [DEBUG] [axolotl.train.setup_model_and_tokenizer:81] [PID:2978] Loading model -[2026-08-18 12:38:59,258] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:75] [PID:2978] Patched OptimState8bit for torch.compile compatibility -[2026-08-18 12:38:59,259] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:122] [PID:2978] Patched OptimState4bit for torch.compile compatibility -[2026-08-18 12:38:59,259] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:154] [PID:2978] Patched OptimStateFp8 for torch.compile compatibility -[2026-08-18 12:38:59,265] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_evaluation_loop:94] [PID:2978] Patched Trainer.evaluation_loop with nanmean loss calculation -[2026-08-18 12:38:59,266] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_maybe_log_save_evaluate:148] [PID:2978] Patched Trainer._maybe_log_save_evaluate with nanmean loss calculation -[2026-08-18 12:38:59,266] [WARNING] [axolotl.loaders.patch_manager._apply_self_attention_lora_patch:662] [PID:2978] Cannot patch self-attention - requires no dropout -[2026-08-18 12:39:01,249] [INFO] [axolotl.integrations.liger.plugin.pre_model_load:117] [PID:2978] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} - Loading weights: 0%| | 0/1066 [00:00 +[2026-08-18 14:04:36,940] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:10630] BOS: 2 / +[2026-08-18 14:04:36,940] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:10630] PAD: 0 / +[2026-08-18 14:04:36,940] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:10630] UNK: 3 / +[2026-08-18 14:04:44,023] [DEBUG] [axolotl.train.setup_model_and_tokenizer:81] [PID:10630] Loading model +[2026-08-18 14:04:44,285] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:75] [PID:10630] Patched OptimState8bit for torch.compile compatibility +[2026-08-18 14:04:44,286] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:122] [PID:10630] Patched OptimState4bit for torch.compile compatibility +[2026-08-18 14:04:44,286] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:154] [PID:10630] Patched OptimStateFp8 for torch.compile compatibility +[2026-08-18 14:04:44,291] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_evaluation_loop:94] [PID:10630] Patched Trainer.evaluation_loop with nanmean loss calculation +[2026-08-18 14:04:44,292] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_maybe_log_save_evaluate:148] [PID:10630] Patched Trainer._maybe_log_save_evaluate with nanmean loss calculation +[2026-08-18 14:04:44,292] [WARNING] [axolotl.loaders.patch_manager._apply_self_attention_lora_patch:662] [PID:10630] Cannot patch self-attention - requires no dropout +[2026-08-18 14:04:45,486] [INFO] [axolotl.integrations.liger.plugin.pre_model_load:117] [PID:10630] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} + Loading weights: 0%| | 0/1066 [00:00 is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:37:25.066000 2703 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:03:49.443000 10319 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:03:49.465000 10319 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. #@@ #@@ @@# @@# @@ @@ @@ @@ =@@# @@ #@ =@@#. @@ -22,17 +22,17 @@ The following values were not passed to `accelerate launch` and had defaults use `--mixed_precision` was set to a value of `'no'` `--dynamo_backend` was set to a value of `'no'` To avoid this warning pass in values for each of the problematic parameters or run `accelerate config`. -[2026-08-18 12:37:36,881] [WARNING] [py.warnings] /usr/local/lib/python3.12/dist-packages/requests/__init__.py:113: RequestsDependencyWarning: urllib3 (2.7.0) or chardet (6.0.0.post1)/charset_normalizer (3.4.3) doesn't match a supported version! +[2026-08-18 14:03:59,410] [WARNING] [py.warnings] /usr/local/lib/python3.12/dist-packages/requests/__init__.py:113: RequestsDependencyWarning: urllib3 (2.7.0) or chardet (6.0.0.post1)/charset_normalizer (3.4.3) doesn't match a supported version! warnings.warn( -W0818 12:37:39.759000 2978 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:37:39.780000 2978 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -[2026-08-18 12:37:42,702] [INFO] [axolotl.integrations.base] Attempting to load plugin: axolotl.integrations.liger.LigerPlugin -[2026-08-18 12:37:42,707] [INFO] [axolotl.integrations.base] Plugin loaded successfully: axolotl.integrations.liger.LigerPlugin -[2026-08-18 12:37:42,758] [WARNING] [axolotl.utils.schemas.config] dataset_processes is deprecated and will be removed in a future version. Please use dataset_num_proc instead. -[2026-08-18 12:37:42,758] [WARNING] [axolotl.utils.schemas.config] Auto-enabling LoRA kernel optimizations for faster training. Please explicitly set `lora_*_kernel` config values to `false` to disable. See https://docs.axolotl.ai/docs/lora_optims.html for more info. -[2026-08-18 12:37:42,759] [WARNING] [axolotl.utils.schemas.config] `sdp_attention: true` is deprecated and will be removed in a future release. Use `attn_implementation: sdpa` instead. -[2026-08-18 12:37:43,089] [INFO] [axolotl.cli.config] config: +W0818 14:04:02.282000 10630 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:02.303000 10630 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +[2026-08-18 14:04:04,698] [INFO] [axolotl.integrations.base] Attempting to load plugin: axolotl.integrations.liger.LigerPlugin +[2026-08-18 14:04:04,701] [INFO] [axolotl.integrations.base] Plugin loaded successfully: axolotl.integrations.liger.LigerPlugin +[2026-08-18 14:04:04,753] [WARNING] [axolotl.utils.schemas.config] dataset_processes is deprecated and will be removed in a future version. Please use dataset_num_proc instead. +[2026-08-18 14:04:04,753] [WARNING] [axolotl.utils.schemas.config] Auto-enabling LoRA kernel optimizations for faster training. Please explicitly set `lora_*_kernel` config values to `false` to disable. See https://docs.axolotl.ai/docs/lora_optims.html for more info. +[2026-08-18 14:04:04,754] [WARNING] [axolotl.utils.schemas.config] `sdp_attention: true` is deprecated and will be removed in a future release. Use `attn_implementation: sdpa` instead. +[2026-08-18 14:04:05,093] [INFO] [axolotl.cli.config] config: { "activation_offloading": false, "adapter": "lora", @@ -232,12 +232,11 @@ W0818 12:37:39.780000 2978 torch/utils/_pytree.py:630] 1280) (num_proc=8): 0%| | 0/8192 [00:001280) (num_proc=8): 12%|█▏ | 1000/8192 [00:00<00:01, 5059.58 examples/s] Dropping Invalid Sequences (1280) (num_proc=8): 100%|██████████| 8192/8192 [00:00<00:00, 21541.94 examples/s] - Saving the dataset (0/8 shards): 0%| | 0/8192 [00:00 is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.027000 3134 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.060000 3138 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.065000 3127 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.091000 3138 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.093000 3127 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.098000 3129 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.111000 3128 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.127000 3130 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.136000 3129 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.149000 3128 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.172000 3130 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.181000 3133 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.183000 3131 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.187000 3132 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.208000 3131 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.219000 3132 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. -W0818 12:38:44.219000 3133 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. - Saving the dataset (0/8 shards): 12%|█▎ | 1024/8192 [00:08<00:56, 127.71 examples/s] Saving the dataset (1/8 shards): 12%|█▎ | 1024/8192 [00:08<00:56, 127.71 examples/s] Saving the dataset (2/8 shards): 25%|██▌ | 2048/8192 [00:08<00:48, 127.71 examples/s] Saving the dataset (3/8 shards): 38%|███▊ | 3072/8192 [00:08<00:40, 127.71 examples/s] Saving the dataset (4/8 shards): 50%|█████ | 4096/8192 [00:08<00:32, 127.71 examples/s] Saving the dataset (5/8 shards): 62%|██████▎ | 5120/8192 [00:08<00:24, 127.71 examples/s] Saving the dataset (6/8 shards): 75%|███████▌ | 6144/8192 [00:08<00:16, 127.71 examples/s] Saving the dataset (7/8 shards): 88%|████████▊ | 7168/8192 [00:08<00:08, 127.71 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:08<00:00, 127.71 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:09<00:00, 896.57 examples/s] -[2026-08-18 12:38:47,979] [INFO] [axolotl.utils.data.sft] Maximum number of steps set at 512 -[2026-08-18 12:38:59,266] [WARNING] [axolotl.loaders.patch_manager] Cannot patch self-attention - requires no dropout -[2026-08-18 12:39:01,249] [INFO] [axolotl.integrations.liger.plugin] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} - Loading weights: 0%| | 0/1066 [00:00 is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.862000 10716 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.879000 10720 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.889000 10718 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.908000 10716 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.920000 10717 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.929000 10718 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.936000 10725 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.955000 10721 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.968000 10715 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.970000 10717 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.981000 10725 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.985000 10714 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:27.998000 10715 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:28.008000 10721 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:28.015000 10719 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:28.019000 10714 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. +W0818 14:04:28.052000 10719 torch/utils/_pytree.py:630] is an Enum subclass and is now natively supported by torch.compile as an opaque value type. Calling register_constant() on Enum subclasses is deprecated and will be an error in a future release. + Saving the dataset (0/8 shards): 12%|█▎ | 1024/8192 [00:07<00:54, 131.44 examples/s] Saving the dataset (1/8 shards): 12%|█▎ | 1024/8192 [00:07<00:54, 131.44 examples/s] Saving the dataset (2/8 shards): 25%|██▌ | 2048/8192 [00:07<00:46, 131.44 examples/s] Saving the dataset (3/8 shards): 50%|█████ | 4096/8192 [00:07<00:31, 131.44 examples/s] Saving the dataset (4/8 shards): 50%|█████ | 4096/8192 [00:07<00:31, 131.44 examples/s] Saving the dataset (5/8 shards): 62%|██████▎ | 5120/8192 [00:07<00:23, 131.44 examples/s] Saving the dataset (5/8 shards): 75%|███████▍ | 6120/8192 [00:07<00:01, 1041.79 examples/s] Saving the dataset (6/8 shards): 75%|███████▌ | 6144/8192 [00:07<00:01, 1041.79 examples/s] Saving the dataset (7/8 shards): 88%|████████▊ | 7168/8192 [00:08<00:00, 1041.79 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:08<00:00, 1041.79 examples/s] Saving the dataset (8/8 shards): 100%|██████████| 8192/8192 [00:09<00:00, 860.78 examples/s] +[2026-08-18 14:04:33,799] [INFO] [axolotl.utils.data.sft] Maximum number of steps set at 512 +[2026-08-18 14:04:44,292] [WARNING] [axolotl.loaders.patch_manager] Cannot patch self-attention - requires no dropout +[2026-08-18 14:04:45,486] [INFO] [axolotl.integrations.liger.plugin] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True} + Loading weights: 0%| | 0/1066 [00:00