vovaRL commited on
Commit
8b287d2
·
verified ·
1 Parent(s): 5b69b73

step 2000 | vovaRL | 524288000 tok

Browse files
config.json ADDED
@@ -0,0 +1,69 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "HYV3ForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": null,
8
+ "dtype": "bfloat16",
9
+ "enable_moe_fp32_combine": true,
10
+ "eos_token_id": null,
11
+ "first_k_dense_replace": 1,
12
+ "head_dim": 64,
13
+ "hidden_act": "silu",
14
+ "hidden_size": 1024,
15
+ "initializer_range": 0.006,
16
+ "intermediate_size": 2816,
17
+ "max_position_embeddings": 4096,
18
+ "mlp_bias": false,
19
+ "mlp_layer_types": [
20
+ "dense",
21
+ "sparse",
22
+ "sparse",
23
+ "sparse",
24
+ "sparse",
25
+ "sparse",
26
+ "sparse",
27
+ "sparse",
28
+ "sparse",
29
+ "sparse",
30
+ "sparse",
31
+ "sparse",
32
+ "sparse",
33
+ "sparse",
34
+ "sparse",
35
+ "sparse",
36
+ "sparse",
37
+ "sparse",
38
+ "sparse",
39
+ "sparse",
40
+ "sparse",
41
+ "sparse",
42
+ "sparse",
43
+ "sparse"
44
+ ],
45
+ "model_type": "hy_v3",
46
+ "moe_intermediate_size": 512,
47
+ "moe_router_enable_expert_bias": true,
48
+ "moe_router_use_sigmoid": true,
49
+ "num_attention_heads": 16,
50
+ "num_experts": 64,
51
+ "num_experts_per_tok": 2,
52
+ "num_hidden_layers": 24,
53
+ "num_key_value_heads": 4,
54
+ "num_shared_experts": 4,
55
+ "output_router_logits": false,
56
+ "pad_token_id": null,
57
+ "qk_norm": true,
58
+ "rms_norm_eps": 1e-05,
59
+ "rope_parameters": {
60
+ "rope_theta": 1000000.0,
61
+ "rope_type": "default"
62
+ },
63
+ "route_norm": true,
64
+ "router_scaling_factor": 2.826,
65
+ "tie_word_embeddings": true,
66
+ "transformers_version": "5.14.1",
67
+ "use_cache": true,
68
+ "vocab_size": 49152
69
+ }
generation_config.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "output_attentions": false,
4
+ "output_hidden_states": false,
5
+ "transformers_version": "5.14.1",
6
+ "use_cache": true
7
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1a63f537b8c0d95c8af14b80281b4d5e3b0ab3ce0c478662a8e41c0a0327d1ec
3
+ size 5167420536
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2535d85eb5fb8bd639cc57d5c678e1819ba53fb0ce96690c2a238cee1dd18370
3
+ size 10333957008
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|endoftext|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|endoftext|>",
10
+ "<|im_start|>",
11
+ "<|im_end|>",
12
+ "<repo_name>",
13
+ "<reponame>",
14
+ "<file_sep>",
15
+ "<filename>",
16
+ "<gh_stars>",
17
+ "<issue_start>",
18
+ "<issue_comment>",
19
+ "<issue_closed>",
20
+ "<jupyter_start>",
21
+ "<jupyter_text>",
22
+ "<jupyter_code>",
23
+ "<jupyter_output>",
24
+ "<jupyter_script>",
25
+ "<empty_output>"
26
+ ],
27
+ "is_local": false,
28
+ "local_files_only": false,
29
+ "model_max_length": 8192,
30
+ "pad_token": null,
31
+ "tokenizer_class": "GPT2Tokenizer",
32
+ "unk_token": "<|endoftext|>",
33
+ "vocab_size": 49152
34
+ }
training_state.json ADDED
@@ -0,0 +1,65 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 2000,
3
+ "global_tokens": 524288000,
4
+ "contributor": "vovaRL",
5
+ "cloud": "home",
6
+ "base_model": "scratch:colibri-nano",
7
+ "wall_clock_s": 24170.038534879684,
8
+ "history_tail": [
9
+ {
10
+ "step": 1960,
11
+ "ntp": 3.183401107788086,
12
+ "zloss": 2.059804916381836,
13
+ "lr": 0.000294,
14
+ "grad_norm": 0.3203125,
15
+ "ppl": 24.128678391480943,
16
+ "balance_max_imbalance": 0.2388916015625,
17
+ "balance_dead_frac": 0.046875,
18
+ "tokens": 513802240
19
+ },
20
+ {
21
+ "step": 1970,
22
+ "ntp": 3.9721052646636963,
23
+ "zloss": 2.2449395656585693,
24
+ "lr": 0.00029549999999999997,
25
+ "grad_norm": 0.3828125,
26
+ "ppl": 53.09619480002791,
27
+ "balance_max_imbalance": 0.2203369140625,
28
+ "balance_dead_frac": 0.046875,
29
+ "tokens": 516423680
30
+ },
31
+ {
32
+ "step": 1980,
33
+ "ntp": 3.722830057144165,
34
+ "zloss": 2.109726905822754,
35
+ "lr": 0.00029699999999999996,
36
+ "grad_norm": 0.51953125,
37
+ "ppl": 41.38134010583109,
38
+ "balance_max_imbalance": 0.246337890625,
39
+ "balance_dead_frac": 0.0625,
40
+ "tokens": 519045120
41
+ },
42
+ {
43
+ "step": 1990,
44
+ "ntp": 3.3724567890167236,
45
+ "zloss": 2.113959550857544,
46
+ "lr": 0.0002985,
47
+ "grad_norm": 1.0703125,
48
+ "ppl": 29.150054691870785,
49
+ "balance_max_imbalance": 0.23040771484375,
50
+ "balance_dead_frac": 0.0625,
51
+ "tokens": 521666560
52
+ },
53
+ {
54
+ "step": 2000,
55
+ "ntp": 3.7987537384033203,
56
+ "zloss": 2.129600763320923,
57
+ "lr": 0.0003,
58
+ "grad_norm": 0.263671875,
59
+ "ppl": 44.645509823548146,
60
+ "balance_max_imbalance": 0.20025634765625,
61
+ "balance_dead_frac": 0.03125,
62
+ "tokens": 524288000
63
+ }
64
+ ]
65
+ }