KeisukeMiyamoto commited on
Commit
82bea6f
·
verified ·
1 Parent(s): 7afe587

Upload lambda-1-360m instruction-tuned model

Browse files
Files changed (2) hide show
  1. model.pth +1 -1
  2. model_config.json +1 -1
model.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:38a8c10a65f8263aa7f11c2c7de0eb54467765599b19b30684885b24d80879df
3
  size 1439512299
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e45d20f1bf9b1688936ec038194c9b63a0b964b219ece984fa9be07fbf8565fd
3
  size 1439512299
model_config.json CHANGED
@@ -1 +1 @@
1
- {"max_len": 1024, "d_model": 960, "num_layers": 32, "num_heads": 15, "num_kv_heads": 5, "d_ff": 4096, "learning_rate": 0.0001, "pad_token_id": 0, "bos_token_id": 2, "eos_token_id": 3, "training_max_len": 1024, "end_of_turn_token_id": 12, "base_model_id": "KeisukeMiyamoto/lambda-1-360m-base", "batch_size": 48, "gradient_accumulation_steps": 3, "devices": "auto", "device_count": 1, "global_batch_size": 48, "effective_batch_size": 144, "global_effective_batch_size": 144, "lr_schedule": "warmup_cosine", "lr_warmup_steps": 200, "min_learning_rate": 2e-05, "min_learning_rate_ratio": 0.2, "trainable_layers": "all", "chat_template_version": 1, "posttraining_datasets": ["KeisukeMiyamoto/SyntheticTalk-jp:train"], "validation_dataset": "KeisukeMiyamoto/SyntheticTalk-jp:validation", "validation_cache_path": "models/lambda-1-360m-it/validation-cache-SyntheticTalk-jp-bucket-packing-v1-len1024-samples384.pt", "validation_sample_count": 384, "posttraining_steps": 6500, "training_precision": "fp8", "float8_recipe": "tensorwise"}
 
1
+ {"max_len": 1024, "d_model": 960, "num_layers": 32, "num_heads": 15, "num_kv_heads": 5, "d_ff": 4096, "learning_rate": 5e-05, "pad_token_id": 0, "bos_token_id": 2, "eos_token_id": 3, "training_max_len": 1024, "end_of_turn_token_id": 12, "base_model_id": "KeisukeMiyamoto/lambda-1-360m-mid", "batch_size": 48, "gradient_accumulation_steps": 2, "devices": "auto", "device_count": 2, "global_batch_size": 96, "effective_batch_size": 96, "global_effective_batch_size": 192, "lr_schedule": "warmup_cosine", "lr_warmup_steps": 200, "min_learning_rate": 2.5e-05, "min_learning_rate_ratio": 0.5, "trainable_layers": "all", "chat_template_version": 1, "posttraining_datasets": ["KeisukeMiyamoto/SyntheticTalk-jp:train"], "validation_dataset": "KeisukeMiyamoto/SyntheticTalk-jp:validation", "validation_cache_path": "models/lambda-1-360m-it/validation-cache-SyntheticTalk-jp-bucket-packing-v1-len1024-samples768.pt", "validation_sample_count": 768, "posttraining_steps": 5000, "training_precision": "fp8", "float8_recipe": "tensorwise"}