KeisukeMiyamoto commited on
Commit
166c076
·
verified ·
1 Parent(s): f3422c0

Upload lambda-360m pretrained model

Browse files
model.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3cb1c94bf55bef95007cda7ed30e1bf69cd1027c1e8159ded08ef3f5bc516edd
3
+ size 1439512299
model_config.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"max_len": 1024, "d_model": 960, "num_layers": 32, "num_heads": 15, "num_kv_heads": 5, "d_ff": 4096, "learning_rate": 0.0002, "batch_size": 48, "gradient_accumulation_steps": 2, "devices": "auto", "device_count": 2, "global_batch_size": 96, "effective_batch_size": 96, "global_effective_batch_size": 192, "lr_schedule": "warmup_cosine", "lr_warmup_steps": 2000, "min_learning_rate": 4e-05, "min_learning_rate_ratio": 0.2, "pad_token_id": 0, "bos_token_id": 2, "eos_token_id": 3, "train_dataset_signature": "4e423c65d9d18d90", "validation_dataset_signature": "571c26264739139a", "train_dataset_case": {"name": "lambda-corpus-train", "genre": "mixed", "language": "ja", "dataset_path": "KeisukeMiyamoto/lambda-corpus", "config_name": "default", "split": "train", "text_column": "text"}, "validation_dataset_case": {"name": "lambda-corpus-validation", "genre": "mixed", "language": "ja", "dataset_path": "KeisukeMiyamoto/lambda-corpus", "config_name": "default", "split": "validation", "text_column": "text"}, "validation_cache_path": "models/lambda-360m/validation-cache-571c26264739139a-bucket-packing-v1-len1024-samples6144.pt", "validation_sample_count": 6144, "packing_version": "bucket-packing-v1", "shuffle_buffer_size": 10000, "base_shuffle_seed": 17, "shuffle_seed": 17, "trained_steps": 48000, "training_precision": "fp8", "float8_recipe": "tensorwise"}
special_tokens_map.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "pad_token": "|<pad>|",
3
+ "unk_token": "|<unknown>|",
4
+ "bos_token": "|<bos>|",
5
+ "eos_token": "|<eos>|",
6
+ "sep_token": "|<sep>|",
7
+ "cls_token": "|<cls>|",
8
+ "mask_token": "|<mask>|",
9
+ "extra_special_tokens": [
10
+ "|<system>|",
11
+ "|<user>|",
12
+ "|<assistant>|",
13
+ "|<thinking>|",
14
+ "|<end_of_thinking>|",
15
+ "|<end_of_turn>|"
16
+ ]
17
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "|<bos>|",
4
+ "cls_token": "|<cls>|",
5
+ "eos_token": "|<eos>|",
6
+ "extra_special_tokens": [
7
+ "|<system>|",
8
+ "|<user>|",
9
+ "|<assistant>|",
10
+ "|<thinking>|",
11
+ "|<end_of_thinking>|",
12
+ "|<end_of_turn>|"
13
+ ],
14
+ "mask_token": "|<mask>|",
15
+ "model_max_length": 1000000000000000019884624838656,
16
+ "pad_token": "|<pad>|",
17
+ "sep_token": "|<sep>|",
18
+ "tokenizer_class": "TokenizersBackend",
19
+ "unk_token": "|<unknown>|"
20
+ }