File size: 2,176 Bytes
12496fc | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 | {
"status": "VALIDATED_SMALL_TRAINING_ONLY",
"parameters": 820736,
"device": "cpu",
"elapsed_seconds": 15.017452800064348,
"tokens_per_second_including_eval_and_checkpoints": 8182.479521392168,
"peak_vram_bytes": null,
"steps_completed": 120,
"metadata": {
"data_manifest_sha256": "999e69022adc29c9d1ccb4c787900aa0c2bd79dd30259d0b2eeafeb1f98b1b1a",
"training": {
"steps": 120,
"batch_size": 8,
"sequence_length": 128,
"learning_rate": 0.0005,
"seed": 42,
"eval_every": 20,
"checkpoint_every": 40,
"device": "auto",
"threads": 4
},
"experiment_id": "391ba7962b714390ad4eaedf35d13ee5"
},
"metrics": [
{
"step": 1,
"train_loss": 5.5218987464904785,
"validation_loss": 5.294267177581787,
"grad_norm": 6.178246974945068,
"lr": 0.0005
},
{
"step": 20,
"train_loss": 3.742738723754883,
"validation_loss": 4.077296733856201,
"grad_norm": 2.3472182750701904,
"lr": 0.00047273385034894217
},
{
"step": 40,
"train_loss": 2.6784613132476807,
"validation_loss": 3.4821360111236572,
"grad_norm": 1.4373022317886353,
"lr": 0.0003925621770610885
},
{
"step": 60,
"train_loss": 2.0638818740844727,
"validation_loss": 3.3395001888275146,
"grad_norm": 2.702136278152466,
"lr": 0.00028088981336927144
},
{
"step": 80,
"train_loss": 1.5123050212860107,
"validation_loss": 3.2726292610168457,
"grad_norm": 2.4991934299468994,
"lr": 0.0001676392789415881
},
{
"step": 100,
"train_loss": 1.6528286933898926,
"validation_loss": 3.239670515060425,
"grad_norm": 1.6973609924316406,
"lr": 8.315596302032927e-05
},
{
"step": 120,
"train_loss": 1.0740044116973877,
"validation_loss": 3.209406614303589,
"grad_norm": 1.9410029649734497,
"lr": 5.007710188049962e-05
}
],
"limitations": "Tiny educational corpus; no general assistant, reasoning or coding capability claim"
} |