Add lineage metadata batch 1
Browse files- README.md +7 -0
- experiments/think-d12-r11.25/config.json +49 -0
- experiments/think-d12-r11.25/run.json +6 -0
- experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/config.json +36 -0
- experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/run.json +6 -0
- experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/summary.json +6 -0
- experiments/think-d12-r11.25/summary.json +5 -0
- experiments/think-d12-r20/config.json +49 -0
- experiments/think-d12-r20/run.json +6 -0
- experiments/think-d12-r20/summary.json +5 -0
README.md
ADDED
|
@@ -0,0 +1,7 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# think.nano
|
| 2 |
+
|
| 3 |
+
Durable model artifacts for lineage-aware nanochat experiments.
|
| 4 |
+
|
| 5 |
+
Each base experiment owns its tokenizer and base checkpoints. SFT runs are
|
| 6 |
+
nested under their exact base parent, and post-training runs are nested under
|
| 7 |
+
their exact SFT parent. Legacy paths are retained under `archive/pre-lineage-v1`.
|
experiments/think-d12-r11.25/config.json
ADDED
|
@@ -0,0 +1,49 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"schema_version": 1,
|
| 3 |
+
"stage": "base",
|
| 4 |
+
"experiment_id": "think-d12-r11.25",
|
| 5 |
+
"dataset": {
|
| 6 |
+
"adapter": "parquet_shards",
|
| 7 |
+
"repo": "jbduran/think-dataset",
|
| 8 |
+
"revision": "main",
|
| 9 |
+
"validation_shard": 472,
|
| 10 |
+
"num_train_shards": 24,
|
| 11 |
+
"download_workers": 4
|
| 12 |
+
},
|
| 13 |
+
"tokenizer": {
|
| 14 |
+
"mode": "train",
|
| 15 |
+
"max_chars": 2000000000,
|
| 16 |
+
"doc_cap": 10000,
|
| 17 |
+
"vocab_size": 32768
|
| 18 |
+
},
|
| 19 |
+
"pretokenize": {
|
| 20 |
+
"enabled": true,
|
| 21 |
+
"slack": 1.03,
|
| 22 |
+
"val_tokens": 20971520,
|
| 23 |
+
"shard_tokens": 100000000,
|
| 24 |
+
"tokenizer_threads": 8
|
| 25 |
+
},
|
| 26 |
+
"training": {
|
| 27 |
+
"depth": 12,
|
| 28 |
+
"scaling_params": 110100912,
|
| 29 |
+
"target_param_data_ratio": 11.25,
|
| 30 |
+
"window_pattern": "L",
|
| 31 |
+
"device_batch_size": 16,
|
| 32 |
+
"total_batch_size": 524288,
|
| 33 |
+
"save_every": 500,
|
| 34 |
+
"eval_every": 250,
|
| 35 |
+
"eval_tokens": 2097152,
|
| 36 |
+
"core_metric_every": -1,
|
| 37 |
+
"sample_every": -1
|
| 38 |
+
},
|
| 39 |
+
"artifacts": {
|
| 40 |
+
"repo": "jbduran/think.nano"
|
| 41 |
+
},
|
| 42 |
+
"wandb": {
|
| 43 |
+
"entity": "jbduran-thinkingmachinesncsu",
|
| 44 |
+
"project": "think.nano",
|
| 45 |
+
"name": "think-d12-r11.25",
|
| 46 |
+
"group": "think-d12",
|
| 47 |
+
"tags": ["think-dataset", "d12", "ratio11.25"]
|
| 48 |
+
}
|
| 49 |
+
}
|
experiments/think-d12-r11.25/run.json
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"experiment_id": "think-d12-r11.25",
|
| 3 |
+
"stage": "base",
|
| 4 |
+
"wandb_run_id": null,
|
| 5 |
+
"migration_note": "Migrated from the pre-lineage repository layout."
|
| 6 |
+
}
|
experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/config.json
ADDED
|
@@ -0,0 +1,36 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"schema_version": 1,
|
| 3 |
+
"stage": "sft",
|
| 4 |
+
"experiment_id": "smoltalk-mmlu3-gsm8k4-v1",
|
| 5 |
+
"parent": {
|
| 6 |
+
"base_experiment_id": "think-d12-r11.25",
|
| 7 |
+
"checkpoint_step": 2362
|
| 8 |
+
},
|
| 9 |
+
"data": {
|
| 10 |
+
"recipe": "nanochat-default",
|
| 11 |
+
"mmlu_epochs": 3,
|
| 12 |
+
"gsm8k_epochs": 4
|
| 13 |
+
},
|
| 14 |
+
"training": {
|
| 15 |
+
"num_iterations": -1,
|
| 16 |
+
"device_batch_size": 8,
|
| 17 |
+
"eval_every": -1,
|
| 18 |
+
"chatcore_every": -1,
|
| 19 |
+
"save_every": 200
|
| 20 |
+
},
|
| 21 |
+
"artifacts": {
|
| 22 |
+
"repo": "jbduran/think.nano"
|
| 23 |
+
},
|
| 24 |
+
"wandb": {
|
| 25 |
+
"enabled": false,
|
| 26 |
+
"entity": "jbduran-thinkingmachinesncsu",
|
| 27 |
+
"project": "think.nano",
|
| 28 |
+
"name": "smoltalk-mmlu3-gsm8k4-v1",
|
| 29 |
+
"group": "think-d12-r11.25",
|
| 30 |
+
"tags": ["sft", "smoltalk", "mmlu3", "gsm8k4"]
|
| 31 |
+
},
|
| 32 |
+
"historical": {
|
| 33 |
+
"lineage_inferred_from_checkpoint_metadata": true,
|
| 34 |
+
"wandb_was_disabled": true
|
| 35 |
+
}
|
| 36 |
+
}
|
experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/run.json
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"experiment_id": "smoltalk-mmlu3-gsm8k4-v1",
|
| 3 |
+
"stage": "sft",
|
| 4 |
+
"wandb_run_id": null,
|
| 5 |
+
"migration_note": "Migrated from the pre-lineage repository layout."
|
| 6 |
+
}
|
experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/summary.json
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"stage": "sft",
|
| 3 |
+
"experiment_id": "smoltalk-mmlu3-gsm8k4-v1",
|
| 4 |
+
"checkpoint_step": 1065,
|
| 5 |
+
"lineage_inferred_from_checkpoint_metadata": true
|
| 6 |
+
}
|
experiments/think-d12-r11.25/summary.json
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"stage": "base",
|
| 3 |
+
"experiment_id": "think-d12-r11.25",
|
| 4 |
+
"checkpoint_step": 2362
|
| 5 |
+
}
|
experiments/think-d12-r20/config.json
ADDED
|
@@ -0,0 +1,49 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"schema_version": 1,
|
| 3 |
+
"stage": "base",
|
| 4 |
+
"experiment_id": "think-d12-r20",
|
| 5 |
+
"dataset": {
|
| 6 |
+
"adapter": "parquet_shards",
|
| 7 |
+
"repo": "jbduran/think-dataset",
|
| 8 |
+
"revision": "main",
|
| 9 |
+
"validation_shard": 472,
|
| 10 |
+
"num_train_shards": 44,
|
| 11 |
+
"download_workers": 4
|
| 12 |
+
},
|
| 13 |
+
"tokenizer": {
|
| 14 |
+
"mode": "train",
|
| 15 |
+
"max_chars": 2000000000,
|
| 16 |
+
"doc_cap": 10000,
|
| 17 |
+
"vocab_size": 32768
|
| 18 |
+
},
|
| 19 |
+
"pretokenize": {
|
| 20 |
+
"enabled": true,
|
| 21 |
+
"slack": 1.03,
|
| 22 |
+
"val_tokens": 20971520,
|
| 23 |
+
"shard_tokens": 100000000,
|
| 24 |
+
"tokenizer_threads": 8
|
| 25 |
+
},
|
| 26 |
+
"training": {
|
| 27 |
+
"depth": 12,
|
| 28 |
+
"scaling_params": 110100912,
|
| 29 |
+
"target_param_data_ratio": 20.0,
|
| 30 |
+
"window_pattern": "L",
|
| 31 |
+
"device_batch_size": 16,
|
| 32 |
+
"total_batch_size": 524288,
|
| 33 |
+
"save_every": 500,
|
| 34 |
+
"eval_every": 250,
|
| 35 |
+
"eval_tokens": 2097152,
|
| 36 |
+
"core_metric_every": -1,
|
| 37 |
+
"sample_every": -1
|
| 38 |
+
},
|
| 39 |
+
"artifacts": {
|
| 40 |
+
"repo": "jbduran/think.nano"
|
| 41 |
+
},
|
| 42 |
+
"wandb": {
|
| 43 |
+
"entity": "jbduran-thinkingmachinesncsu",
|
| 44 |
+
"project": "think.nano",
|
| 45 |
+
"name": "think-d12-r20",
|
| 46 |
+
"group": "think-d12",
|
| 47 |
+
"tags": ["think-dataset", "d12", "ratio20"]
|
| 48 |
+
}
|
| 49 |
+
}
|
experiments/think-d12-r20/run.json
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"experiment_id": "think-d12-r20",
|
| 3 |
+
"stage": "base",
|
| 4 |
+
"wandb_run_id": null,
|
| 5 |
+
"migration_note": "Migrated from the pre-lineage repository layout."
|
| 6 |
+
}
|
experiments/think-d12-r20/summary.json
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"stage": "base",
|
| 3 |
+
"experiment_id": "think-d12-r20",
|
| 4 |
+
"checkpoint_step": 4200
|
| 5 |
+
}
|