OpenSoftware-World commited on
Commit
53f3b70
·
verified ·
1 Parent(s): 859c05f

The configuration files required for training and launching the OpenSoftware-World-OSW1 model have been uploaded. (The code was written by OpenSoftware-World.)

Browse files
config/init/model_init.ini ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ [ModelInitConfig]
2
+ max_new_tokens = 60
3
+ temperature = 0.85
4
+ top_k = 40
config/model_config.py ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ import configparser
2
+
3
+ model_training_config = configparser.ConfigParser()
4
+ model_init_config = configparser.ConfigParser()
5
+
6
+ model_training_config.read("config/training/model_training.ini")
7
+ model_init_config.read("config/init/model_init.ini")
8
+
9
+ # For Model Training
10
+ training_block_size = int(model_training_config["ModelTrainingConfig"]["block_size"])
11
+ training_d_model = int(model_training_config["ModelTrainingConfig"]["d_model"])
12
+ training_n_layer = int(model_training_config["ModelTrainingConfig"]["n_layer"])
13
+ training_n_head = int(model_training_config["ModelTrainingConfig"]["n_head"])
14
+ training_d_ff = int(model_training_config["ModelTrainingConfig"]["d_ff"])
15
+ training_dropout = float(model_training_config["ModelTrainingConfig"]["dropout"])
16
+ training_batch_size = int(model_training_config["ModelTrainingConfig"]["batch_size"])
17
+ training_grad_accum_steps = int(model_training_config["ModelTrainingConfig"]["grad_accum_steps"])
18
+ training_epochs = int(model_training_config["ModelTrainingConfig"]["epochs"])
19
+ training_max_lr = float(model_training_config["ModelTrainingConfig"]["max_lr"])
20
+ training_min_lr = float(model_training_config["ModelTrainingConfig"]["min_lr"])
21
+ training_warmup_ratio = float(model_training_config["ModelTrainingConfig"]["warmup_ratio"])
22
+ training_weight_decay = float(model_training_config["ModelTrainingConfig"]["weight_decay"])
23
+ training_grad_clip = float(model_training_config["ModelTrainingConfig"]["grad_clip"])
24
+ training_label_smoothing = float(model_training_config["ModelTrainingConfig"]["label_smoothing"])
25
+ training_max_new_tokens = int(model_training_config["AfterTrainingConfig"]["max_new_tokens"])
26
+ training_temperature = float(model_training_config["AfterTrainingConfig"]["temperature"])
27
+ training_top_k = int(model_training_config["AfterTrainingConfig"]["top_k"])
28
+
29
+ # For Model Initialization
30
+ init_max_new_tokens = int(model_init_config["ModelInitConfig"]["max_new_tokens"])
31
+ init_temperature = float(model_init_config["ModelInitConfig"]["temperature"])
32
+ init_top_k = int(model_init_config["ModelInitConfig"]["top_k"])
config/training/model_training.ini ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [ModelTrainingConfig]
2
+ block_size = 128
3
+ d_model = 256
4
+ n_layer = 4
5
+ n_head = 4
6
+ d_ff = 1024
7
+ dropout = 0.1
8
+ batch_size = 8
9
+ grad_accum_steps = 2
10
+ epochs = 20
11
+ max_lr = 3e-4
12
+ min_lr = 3e-5
13
+ warmup_ratio = 0.05
14
+ weight_decay = 0.1
15
+ grad_clip = 1.0
16
+ label_smoothing = 0.05
17
+
18
+ [AfterTrainingConfig]
19
+ max_new_tokens = 60
20
+ temperature = 0.85
21
+ top_k = 40