{ "model_family": "tessera", "architecture": "ProtoGPT (custom decoder-only transformer \u2014 NOT transformers-compatible)", "parameter_count": 1013024256, "tie_word_embeddings": true, "tied_aliases_dropped": [ "head.weight" ], "checkpoint_step": 373500, "torch_dtype": "bfloat16", "loader": "model.py::load_base() \u2014 see USAGE.md", "root": "/root/stage07_shards_tessera64k_4k", "out_dir": "/root/runs/20260615T061150_1b_GATED_h100", "device": "cuda", "steps": 376000, "seq_len": 4096, "micro_batch": 4, "grad_accum": 4, "d_model": 1536, "layers": 32, "heads": 16, "dropout": 0.0, "vocab_size": 65536, "lr": 0.0002, "min_lr": 1e-05, "warmup_steps": 200, "weight_decay": 0.1, "optimizer": "adamw", "eval_every": 100, "eval_batches": 64, "checkpoint_every": 500, "log_every": 10, "seed": 20260614, "param_dtype": "bfloat16", "autocast_dtype": "bfloat16", "min_free_gb": 8.0, "max_runtime_min": 0.0, "resume": "/root/checkpoint_resume.pt", "save_optimizer": true, "no_final_checkpoint": false, "no_grad_checkpointing": true, "reset_step": true, "gated_epoch": true, "gated_trust_cursor": true }