{ "status": "VALIDATED_SMALL_TRAINING_ONLY", "parameters": 820736, "device": "cpu", "elapsed_seconds": 15.017452800064348, "tokens_per_second_including_eval_and_checkpoints": 8182.479521392168, "peak_vram_bytes": null, "steps_completed": 120, "metadata": { "data_manifest_sha256": "999e69022adc29c9d1ccb4c787900aa0c2bd79dd30259d0b2eeafeb1f98b1b1a", "training": { "steps": 120, "batch_size": 8, "sequence_length": 128, "learning_rate": 0.0005, "seed": 42, "eval_every": 20, "checkpoint_every": 40, "device": "auto", "threads": 4 }, "experiment_id": "391ba7962b714390ad4eaedf35d13ee5" }, "metrics": [ { "step": 1, "train_loss": 5.5218987464904785, "validation_loss": 5.294267177581787, "grad_norm": 6.178246974945068, "lr": 0.0005 }, { "step": 20, "train_loss": 3.742738723754883, "validation_loss": 4.077296733856201, "grad_norm": 2.3472182750701904, "lr": 0.00047273385034894217 }, { "step": 40, "train_loss": 2.6784613132476807, "validation_loss": 3.4821360111236572, "grad_norm": 1.4373022317886353, "lr": 0.0003925621770610885 }, { "step": 60, "train_loss": 2.0638818740844727, "validation_loss": 3.3395001888275146, "grad_norm": 2.702136278152466, "lr": 0.00028088981336927144 }, { "step": 80, "train_loss": 1.5123050212860107, "validation_loss": 3.2726292610168457, "grad_norm": 2.4991934299468994, "lr": 0.0001676392789415881 }, { "step": 100, "train_loss": 1.6528286933898926, "validation_loss": 3.239670515060425, "grad_norm": 1.6973609924316406, "lr": 8.315596302032927e-05 }, { "step": 120, "train_loss": 1.0740044116973877, "validation_loss": 3.209406614303589, "grad_norm": 1.9410029649734497, "lr": 5.007710188049962e-05 } ], "limitations": "Tiny educational corpus; no general assistant, reasoning or coding capability claim" }