KeisukeMiyamoto commited on
Commit
b9dc1d6
·
verified ·
1 Parent(s): c3d3863

Upload lambda-360m midtrained model

Browse files
model.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a9cd49fa043f982a708fe6f7b538ff9f2bbb0f275d1e3fa2af4330403ccc760c
3
+ size 1439512299
model_config.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"max_len": 1024, "d_model": 960, "num_layers": 32, "num_heads": 15, "num_kv_heads": 5, "d_ff": 4096, "learning_rate": 0.0001, "batch_size": 48, "gradient_accumulation_steps": 2, "devices": "auto", "device_count": 2, "global_batch_size": 96, "effective_batch_size": 96, "global_effective_batch_size": 192, "lr_schedule": "warmup_cosine", "lr_warmup_steps": 1000, "min_learning_rate": 2e-05, "min_learning_rate_ratio": 0.2, "pad_token_id": 0, "bos_token_id": 2, "eos_token_id": 3, "train_dataset_signature": "44bbfca21e62efa8", "validation_dataset_signature": "8fb1014e14cb23c7", "train_dataset_case": {"name": "synthetic-textbook-jp-train", "genre": "textbook", "language": "ja", "dataset_path": "KeisukeMiyamoto/SyntheticTextbook-jp", "config_name": "default", "split": "train", "text_column": "rewrite"}, "validation_dataset_case": {"name": "synthetic-textbook-jp-validation", "genre": "textbook", "language": "ja", "dataset_path": "KeisukeMiyamoto/SyntheticTextbook-jp", "config_name": "default", "split": "validation", "text_column": "rewrite"}, "validation_cache_path": "models/lambda-360m-midtrained/validation-cache-8fb1014e14cb23c7-bucket-packing-v1-len1024-samples6144.pt", "validation_sample_count": 6144, "packing_version": "bucket-packing-v1", "shuffle_buffer_size": 10000, "base_shuffle_seed": 17, "shuffle_seed": 17, "trained_steps": 20480, "training_precision": "fp8", "float8_recipe": "tensorwise", "midtraining_source_model": "models/lambda-360m", "midtraining_max_steps": 20480}
special_tokens_map.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "pad_token": "|<pad>|",
3
+ "unk_token": "|<unknown>|",
4
+ "bos_token": "|<bos>|",
5
+ "eos_token": "|<eos>|",
6
+ "sep_token": "|<sep>|",
7
+ "cls_token": "|<cls>|",
8
+ "mask_token": "|<mask>|",
9
+ "extra_special_tokens": [
10
+ "|<system>|",
11
+ "|<user>|",
12
+ "|<assistant>|",
13
+ "|<thinking>|",
14
+ "|<end_of_thinking>|",
15
+ "|<end_of_turn>|"
16
+ ]
17
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "|<bos>|",
4
+ "cls_token": "|<cls>|",
5
+ "eos_token": "|<eos>|",
6
+ "extra_special_tokens": [
7
+ "|<system>|",
8
+ "|<user>|",
9
+ "|<assistant>|",
10
+ "|<thinking>|",
11
+ "|<end_of_thinking>|",
12
+ "|<end_of_turn>|"
13
+ ],
14
+ "mask_token": "|<mask>|",
15
+ "model_max_length": 1000000000000000019884624838656,
16
+ "pad_token": "|<pad>|",
17
+ "sep_token": "|<sep>|",
18
+ "tokenizer_class": "TokenizersBackend",
19
+ "unk_token": "|<unknown>|"
20
+ }