NEXORA / artifacts /tiny /training-report.json
devildasdf's picture
Release validated NEXORA research prototype, tiny weights and evidence
12496fc verified
Raw History Blame Contribute Delete
2.18 kB
{
"status": "VALIDATED_SMALL_TRAINING_ONLY",
"parameters": 820736,
"device": "cpu",
"elapsed_seconds": 15.017452800064348,
"tokens_per_second_including_eval_and_checkpoints": 8182.479521392168,
"peak_vram_bytes": null,
"steps_completed": 120,
"metadata": {
"data_manifest_sha256": "999e69022adc29c9d1ccb4c787900aa0c2bd79dd30259d0b2eeafeb1f98b1b1a",
"training": {
"steps": 120,
"batch_size": 8,
"sequence_length": 128,
"learning_rate": 0.0005,
"seed": 42,
"eval_every": 20,
"checkpoint_every": 40,
"device": "auto",
"threads": 4
},
"experiment_id": "391ba7962b714390ad4eaedf35d13ee5"
},
"metrics": [
{
"step": 1,
"train_loss": 5.5218987464904785,
"validation_loss": 5.294267177581787,
"grad_norm": 6.178246974945068,
"lr": 0.0005
},
{
"step": 20,
"train_loss": 3.742738723754883,
"validation_loss": 4.077296733856201,
"grad_norm": 2.3472182750701904,
"lr": 0.00047273385034894217
},
{
"step": 40,
"train_loss": 2.6784613132476807,
"validation_loss": 3.4821360111236572,
"grad_norm": 1.4373022317886353,
"lr": 0.0003925621770610885
},
{
"step": 60,
"train_loss": 2.0638818740844727,
"validation_loss": 3.3395001888275146,
"grad_norm": 2.702136278152466,
"lr": 0.00028088981336927144
},
{
"step": 80,
"train_loss": 1.5123050212860107,
"validation_loss": 3.2726292610168457,
"grad_norm": 2.4991934299468994,
"lr": 0.0001676392789415881
},
{
"step": 100,
"train_loss": 1.6528286933898926,
"validation_loss": 3.239670515060425,
"grad_norm": 1.6973609924316406,
"lr": 8.315596302032927e-05
},
{
"step": 120,
"train_loss": 1.0740044116973877,
"validation_loss": 3.209406614303589,
"grad_norm": 1.9410029649734497,
"lr": 5.007710188049962e-05
}
],
"limitations": "Tiny educational corpus; no general assistant, reasoning or coding capability claim"
}