{ "parameters": 44996036, "neural_core_parameters": 4996035, "ngram_parameters": 40000001, "architecture": { "vocab_size": 2048, "hidden_size": 256, "intermediate_size": 1488, "num_hidden_layers": 3, "num_attention_heads": 8, "num_key_value_heads": 1, "head_dim": 32, "ngram_buckets": 156250, "loop_schedule": [ 0, 1, 1, 2 ], "refresh_kernel_size": 9, "max_position_embeddings": 4096, "rope_theta": 100000.0, "rms_norm_eps": 1e-05, "initializer_range": 0.02, "use_cache": false, "transformers_version": "5.16.1", "architectures": null, "output_hidden_states": false, "return_dict": true, "dtype": null, "chunk_size_feed_forward": 0, "is_encoder_decoder": false, "id2label": { "0": "LABEL_0", "1": "LABEL_1" }, "label2id": { "LABEL_0": 0, "LABEL_1": 1 }, "problem_type": null, "_name_or_path": "", "tie_word_embeddings": true, "bos_token_id": 1, "eos_token_id": 2, "pad_token_id": 0, "unk_token_id": 3, "model_type": "cherry_alpha", "output_attentions": false }, "training_percent": 100, "step": 38147, "total_steps": 38147, "tokens_seen": 20000014336, "target_tokens": 20000000000, "trained_token_target": 20000014336, "tokens_per_step": 524288, "local_batch": 32, "effective_global_batch": 128, "world_size": 4, "gpu_name": "NVIDIA H200", "optimizer": "Muon + AdamW", "muon_peak_lr": 0.02, "adamw_peak_lr": 0.002, "ngram_peak_lr": 0.001, "architecture_revision": "2d06c38b56820561813f800da2f896ad64824877", "tokenizer_revision": "2d06c38b56820561813f800da2f896ad64824877", "dataset_id": "HuggingFaceFW/fineweb-edu", "dataset_config": "sample-100BT", "dataset_revision": "87f09149ef4734204d70ed1d046ddc9ca3f2b8f9", "elapsed_seconds": 8416.391685962677 }