| { |
| "iterations": 3200, |
| "parameter_count": 29630976, |
| "tokens_per_step": 65536, |
| "processed_tokens": 209715200, |
| "elapsed_seconds": 1039.6968399565667, |
| "best_validation_loss": 4.693336009979248, |
| "history": [ |
| { |
| "iteration": 200, |
| "train_loss": 6.874281406402588, |
| "validation_loss": 6.851297378540039, |
| "learning_rate": 0.0005986422613134286, |
| "elapsed_seconds": 63.88019962795079 |
| }, |
| { |
| "iteration": 400, |
| "train_loss": 5.891294479370117, |
| "validation_loss": 5.937683582305908, |
| "learning_rate": 0.0005876993794374133, |
| "elapsed_seconds": 128.35756858997047 |
| }, |
| { |
| "iteration": 600, |
| "train_loss": 5.376547813415527, |
| "validation_loss": 5.505178451538086, |
| "learning_rate": 0.0005662062546888388, |
| "elapsed_seconds": 192.76678066514432 |
| }, |
| { |
| "iteration": 800, |
| "train_loss": 5.047382354736328, |
| "validation_loss": 5.2386860847473145, |
| "learning_rate": 0.0005350428181202468, |
| "elapsed_seconds": 257.3545547667891 |
| }, |
| { |
| "iteration": 1000, |
| "train_loss": 4.829380989074707, |
| "validation_loss": 5.086492538452148, |
| "learning_rate": 0.0004954849044863036, |
| "elapsed_seconds": 321.76191609352827 |
| }, |
| { |
| "iteration": 1200, |
| "train_loss": 4.650263786315918, |
| "validation_loss": 4.960005283355713, |
| "learning_rate": 0.0004491520194190405, |
| "elapsed_seconds": 386.7139264252037 |
| }, |
| { |
| "iteration": 1400, |
| "train_loss": 4.50961446762085, |
| "validation_loss": 4.872649669647217, |
| "learning_rate": 0.0003979410366769941, |
| "elapsed_seconds": 451.70882767252624 |
| }, |
| { |
| "iteration": 1600, |
| "train_loss": 4.388186931610107, |
| "validation_loss": 4.814062118530273, |
| "learning_rate": 0.0003439485399106587, |
| "elapsed_seconds": 516.5635145176202 |
| }, |
| { |
| "iteration": 1800, |
| "train_loss": 4.287715435028076, |
| "validation_loss": 4.772805690765381, |
| "learning_rate": 0.00028938498828149706, |
| "elapsed_seconds": 581.7271312791854 |
| }, |
| { |
| "iteration": 2000, |
| "train_loss": 4.204434871673584, |
| "validation_loss": 4.740018844604492, |
| "learning_rate": 0.00023648422000415223, |
| "elapsed_seconds": 646.7632373739034 |
| }, |
| { |
| "iteration": 2200, |
| "train_loss": 4.136469841003418, |
| "validation_loss": 4.717632293701172, |
| "learning_rate": 0.0001874119987474749, |
| "elapsed_seconds": 711.0149517673999 |
| }, |
| { |
| "iteration": 2400, |
| "train_loss": 4.068326473236084, |
| "validation_loss": 4.712490558624268, |
| "learning_rate": 0.0001441773470154548, |
| "elapsed_seconds": 776.0104932170361 |
| }, |
| { |
| "iteration": 2600, |
| "train_loss": 4.019182205200195, |
| "validation_loss": 4.69955587387085, |
| "learning_rate": 0.00010855029652985661, |
| "elapsed_seconds": 841.718034747988 |
| }, |
| { |
| "iteration": 2800, |
| "train_loss": 3.980391263961792, |
| "validation_loss": 4.69523811340332, |
| "learning_rate": 8.198942292356145e-05, |
| "elapsed_seconds": 907.1116172447801 |
| }, |
| { |
| "iteration": 3000, |
| "train_loss": 3.948561191558838, |
| "validation_loss": 4.693336009979248, |
| "learning_rate": 6.558213148278118e-05, |
| "elapsed_seconds": 971.7278313729912 |
| }, |
| { |
| "iteration": 3200, |
| "train_loss": 3.918356418609619, |
| "validation_loss": 4.693871021270752, |
| "learning_rate": 6.0000138646876194e-05, |
| "elapsed_seconds": 1036.9277061484754 |
| } |
| ], |
| "environment": { |
| "python": "3.11.10", |
| "platform": "Linux-5.15.0-107-generic-x86_64-with-glibc2.35", |
| "torch": "2.5.1+cu124", |
| "cuda": "12.4", |
| "gpu": "NVIDIA RTX A5000" |
| }, |
| "data_manifest_sha256": "41a2e024d3c6b7f575e70a291cdb12e131c7ecb6dd2cf0c56491f2789ce7ca77", |
| "peak_vram_bytes": 2612344832, |
| "gpu_total_bytes": 25293946880, |
| "gpu_hourly_usd": 0.27, |
| "estimated_training_cost_usd": 0.0779772629967425 |
| } |
|
|