{ "step": 4000, "training_complete": false, "experiment_id": "Think.Unbounded-d32", "parent_experiment_id": null, "parent_checkpoint_step": null, "val_bpb": 0.9585141600611977, "model_config": { "sequence_len": 4096, "vocab_size": 32768, "n_layer": 32, "n_head": 16, "n_kv_head": 16, "n_embd": 2048, "window_pattern": "SSSL" }, "user_config": { "run": "Think.Unbounded-d32", "wandb_run_id": "9b75691b", "wandb_group": "clean1930s-d32", "wandb_tags": "think-dataset-clean-1930s,d32,ratio12,ctx4096,sssl,fp8,muon-momentum-constant,muon-momentum-0.90,midtrain-schedule,mix-og,0-30-60", "device_type": "", "fp8": true, "fp8_recipe": "tensorwise", "depth": 32, "aspect_ratio": 64, "head_dim": 128, "max_seq_len": 4096, "window_pattern": "SSSL", "num_iterations": 9600, "target_flops": -1.0, "target_param_data_ratio": -1.0, "device_batch_size": 2, "total_batch_size": 2097152, "embedding_lr": 0.3, "unembedding_lr": 0.008, "weight_decay": 0.28, "matrix_lr": 0.02, "muon_momentum": 0.9, "scalar_lr": 0.5, "warmup_steps": 40, "warmdown_ratio": 0.65, "final_lr_frac": 0.05, "resume_from_step": -1, "init_from_checkpoint_dir": null, "init_from_step": -1, "no_init_optimizer": false, "branch_lr_schedule": "branch", "branch_parent_experiment_id": null, "pretokenized": true, "data_dir": "/workspace/nanochat/experiments/Think.Unbounded-d32/data", "tokenizer_dir": "/workspace/nanochat/experiments/Think.Unbounded-d32/tokenizer", "pretokenized_dir": "/workspace/nanochat/experiments/Think.Unbounded-d32/pretok", "mixture_source_dirs": "{\"original\": \"/workspace/nanochat/experiments/Think.Unbounded-d32/pretok_original\", \"midtrain_r30\": \"/workspace/nanochat/experiments/Think.Unbounded-d32/pretok_midtrain_r30\", \"midtrain_r60\": \"/workspace/nanochat/experiments/Think.Unbounded-d32/pretok_midtrain_r60\"}", "checkpoint_dir": "/workspace/nanochat/experiments/Think.Unbounded-d32/base_checkpoints", "experiment_id": "Think.Unbounded-d32", "experiment_config": "/workspace/nanochat/experiments/Think.Unbounded-d32/config.json", "tokenizer_fingerprint": "21e99d5cdeeaa660", "git_commit_sha": "b2de514e00cde3bee362cf4c87e16d35e0f32c24", "seed": 42, "eval_every": 250, "eval_tokens": 2097152, "core_metric_every": -1, "core_metric_max_per_task": 500, "sample_every": -1, "save_every": 500, "model_tag": "Think.Unbounded-d32", "experiment": { "schema_version": 1, "stage": "base", "experiment_id": "Think.Unbounded-d32", "datasets": { "original": { "adapter": "parquet_shards", "repo": "jbduran/think-dataset-clean-1930s", "revision": "45225d95bc15f942be3b4b344738cea1f66e3de8", "validation_shard": 472, "num_train_shards": 330, "download_workers": 4 }, "midtrain_r30": { "adapter": "parquet_shards", "repo": "zachnorton03/think-midtrain", "revision": "9ace24b8e16e57e38a1ea0b1f6d7cbf323bf9dbc", "subfolder": "mixed/ratio_30/data", "validation_shard": 1262, "num_train_shards": 391, "download_workers": 4 }, "midtrain_r60": { "adapter": "parquet_shards", "repo": "zachnorton03/think-midtrain", "revision": "9ace24b8e16e57e38a1ea0b1f6d7cbf323bf9dbc", "subfolder": "mixed/ratio_60/data", "validation_shard": 523, "num_train_shards": 207, "download_workers": 4 } }, "mixture_schedule": { "total_tokens": 20132659200, "seed_data": 1234, "max_epochs": 4, "stages": [ { "name": "base", "start_tokens": 0, "source": "original" }, { "name": "injection", "start_tokens": 14092861440, "source": "midtrain_r30" }, { "name": "decay_mix", "start_tokens": 18119393280, "source": "midtrain_r60" } ] }, "tokenizer": { "mode": "reuse", "source_experiment_id": "clean1930s-d24-r12-ctx4096-fulltok-v1", "vocab_size": 32768 }, "pretokenize": { "enabled": true, "slack": 1.03, "require_no_wrap": true, "val_tokens": 20971520, "shard_tokens": 100000000, "tokenizer_threads": 8 }, "training": { "depth": 32, "scaling_params": 1677724672, "target_param_data_ratio": 12, "max_seq_len": 4096, "window_pattern": "SSSL", "muon_momentum": 0.9, "device_batch_size": 2, "total_batch_size": 2097152, "fp8": true, "fp8_recipe": "tensorwise", "seed": 42, "save_every": 500, "eval_every": 250, "eval_tokens": 2097152, "core_metric_every": -1, "sample_every": -1 }, "artifacts": { "repo": "jbduran/think.nano", "keep_local_checkpoints": 1 }, "wandb": { "entity": "jbduran-thinkingmachinesncsu", "project": "think.nano", "name": "Think.Unbounded-d32", "group": "clean1930s-d32", "tags": [ "think-dataset-clean-1930s", "d32", "ratio12", "ctx4096", "sssl", "fp8", "muon-momentum-constant", "muon-momentum-0.90", "midtrain-schedule", "mix-og", "0-30-60" ] }, "config_fingerprint": "6f8ae461e0eb9ee2", "artifact_path": "experiments/Think.Unbounded-d32" }, "stage": "base", "base_experiment_id": "Think.Unbounded-d32", "parent_experiment_id": null, "parent_checkpoint_step": null, "config_fingerprint": "6f8ae461e0eb9ee2" }, "device_batch_size": 2, "max_seq_len": 4096, "total_batch_size": 2097152, "dataloader_state_dict": { "file_idx": 83, "pos": 89640193, "epoch": 1, "pq_idx": 83, "rg_idx": 89640193, "mixture": { "cursors": { "original": { "file_idx": 83, "pos": 89640193, "epoch": 1, "pq_idx": 83, "rg_idx": 89640193 }, "midtrain_r30": { "file_idx": 0, "pos": 0, "epoch": 1, "pq_idx": 0, "rg_idx": 0 }, "midtrain_r60": { "file_idx": 0, "pos": 0, "epoch": 1, "pq_idx": 0, "rg_idx": 0 } }, "cumulative_tokens": 8388616192, "source_tokens": { "original": 8388616192, "midtrain_r30": 0, "midtrain_r60": 0 }, "active_stage_idx": 0 } }, "loop_state": { "min_val_bpb": 0.9585141600611977, "smooth_train_loss": 2.7874954028564223, "total_training_time": 160072.53116488457, "stage_start_step": 0, "stage_training_flops": 96264596653867008000, "inherited_parent_flops": 0.0, "cumulative_pipeline_training_flops": 9.6264596653867e+19 } }