jbduran commited on
Commit
1dbf237
·
verified ·
1 Parent(s): 47a34b9

Add lineage metadata batch 1

Browse files
README.md ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ # think.nano
2
+
3
+ Durable model artifacts for lineage-aware nanochat experiments.
4
+
5
+ Each base experiment owns its tokenizer and base checkpoints. SFT runs are
6
+ nested under their exact base parent, and post-training runs are nested under
7
+ their exact SFT parent. Legacy paths are retained under `archive/pre-lineage-v1`.
experiments/think-d12-r11.25/config.json ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "schema_version": 1,
3
+ "stage": "base",
4
+ "experiment_id": "think-d12-r11.25",
5
+ "dataset": {
6
+ "adapter": "parquet_shards",
7
+ "repo": "jbduran/think-dataset",
8
+ "revision": "main",
9
+ "validation_shard": 472,
10
+ "num_train_shards": 24,
11
+ "download_workers": 4
12
+ },
13
+ "tokenizer": {
14
+ "mode": "train",
15
+ "max_chars": 2000000000,
16
+ "doc_cap": 10000,
17
+ "vocab_size": 32768
18
+ },
19
+ "pretokenize": {
20
+ "enabled": true,
21
+ "slack": 1.03,
22
+ "val_tokens": 20971520,
23
+ "shard_tokens": 100000000,
24
+ "tokenizer_threads": 8
25
+ },
26
+ "training": {
27
+ "depth": 12,
28
+ "scaling_params": 110100912,
29
+ "target_param_data_ratio": 11.25,
30
+ "window_pattern": "L",
31
+ "device_batch_size": 16,
32
+ "total_batch_size": 524288,
33
+ "save_every": 500,
34
+ "eval_every": 250,
35
+ "eval_tokens": 2097152,
36
+ "core_metric_every": -1,
37
+ "sample_every": -1
38
+ },
39
+ "artifacts": {
40
+ "repo": "jbduran/think.nano"
41
+ },
42
+ "wandb": {
43
+ "entity": "jbduran-thinkingmachinesncsu",
44
+ "project": "think.nano",
45
+ "name": "think-d12-r11.25",
46
+ "group": "think-d12",
47
+ "tags": ["think-dataset", "d12", "ratio11.25"]
48
+ }
49
+ }
experiments/think-d12-r11.25/run.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "experiment_id": "think-d12-r11.25",
3
+ "stage": "base",
4
+ "wandb_run_id": null,
5
+ "migration_note": "Migrated from the pre-lineage repository layout."
6
+ }
experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "schema_version": 1,
3
+ "stage": "sft",
4
+ "experiment_id": "smoltalk-mmlu3-gsm8k4-v1",
5
+ "parent": {
6
+ "base_experiment_id": "think-d12-r11.25",
7
+ "checkpoint_step": 2362
8
+ },
9
+ "data": {
10
+ "recipe": "nanochat-default",
11
+ "mmlu_epochs": 3,
12
+ "gsm8k_epochs": 4
13
+ },
14
+ "training": {
15
+ "num_iterations": -1,
16
+ "device_batch_size": 8,
17
+ "eval_every": -1,
18
+ "chatcore_every": -1,
19
+ "save_every": 200
20
+ },
21
+ "artifacts": {
22
+ "repo": "jbduran/think.nano"
23
+ },
24
+ "wandb": {
25
+ "enabled": false,
26
+ "entity": "jbduran-thinkingmachinesncsu",
27
+ "project": "think.nano",
28
+ "name": "smoltalk-mmlu3-gsm8k4-v1",
29
+ "group": "think-d12-r11.25",
30
+ "tags": ["sft", "smoltalk", "mmlu3", "gsm8k4"]
31
+ },
32
+ "historical": {
33
+ "lineage_inferred_from_checkpoint_metadata": true,
34
+ "wandb_was_disabled": true
35
+ }
36
+ }
experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/run.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "experiment_id": "smoltalk-mmlu3-gsm8k4-v1",
3
+ "stage": "sft",
4
+ "wandb_run_id": null,
5
+ "migration_note": "Migrated from the pre-lineage repository layout."
6
+ }
experiments/think-d12-r11.25/sft/smoltalk-mmlu3-gsm8k4-v1/summary.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "stage": "sft",
3
+ "experiment_id": "smoltalk-mmlu3-gsm8k4-v1",
4
+ "checkpoint_step": 1065,
5
+ "lineage_inferred_from_checkpoint_metadata": true
6
+ }
experiments/think-d12-r11.25/summary.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "stage": "base",
3
+ "experiment_id": "think-d12-r11.25",
4
+ "checkpoint_step": 2362
5
+ }
experiments/think-d12-r20/config.json ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "schema_version": 1,
3
+ "stage": "base",
4
+ "experiment_id": "think-d12-r20",
5
+ "dataset": {
6
+ "adapter": "parquet_shards",
7
+ "repo": "jbduran/think-dataset",
8
+ "revision": "main",
9
+ "validation_shard": 472,
10
+ "num_train_shards": 44,
11
+ "download_workers": 4
12
+ },
13
+ "tokenizer": {
14
+ "mode": "train",
15
+ "max_chars": 2000000000,
16
+ "doc_cap": 10000,
17
+ "vocab_size": 32768
18
+ },
19
+ "pretokenize": {
20
+ "enabled": true,
21
+ "slack": 1.03,
22
+ "val_tokens": 20971520,
23
+ "shard_tokens": 100000000,
24
+ "tokenizer_threads": 8
25
+ },
26
+ "training": {
27
+ "depth": 12,
28
+ "scaling_params": 110100912,
29
+ "target_param_data_ratio": 20.0,
30
+ "window_pattern": "L",
31
+ "device_batch_size": 16,
32
+ "total_batch_size": 524288,
33
+ "save_every": 500,
34
+ "eval_every": 250,
35
+ "eval_tokens": 2097152,
36
+ "core_metric_every": -1,
37
+ "sample_every": -1
38
+ },
39
+ "artifacts": {
40
+ "repo": "jbduran/think.nano"
41
+ },
42
+ "wandb": {
43
+ "entity": "jbduran-thinkingmachinesncsu",
44
+ "project": "think.nano",
45
+ "name": "think-d12-r20",
46
+ "group": "think-d12",
47
+ "tags": ["think-dataset", "d12", "ratio20"]
48
+ }
49
+ }
experiments/think-d12-r20/run.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "experiment_id": "think-d12-r20",
3
+ "stage": "base",
4
+ "wandb_run_id": null,
5
+ "migration_note": "Migrated from the pre-lineage repository layout."
6
+ }
experiments/think-d12-r20/summary.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "stage": "base",
3
+ "experiment_id": "think-d12-r20",
4
+ "checkpoint_step": 4200
5
+ }