Codemaster67 harindhar10 commited on
Commit
2aea2ba
·
0 Parent(s):

Duplicate from harindhar10/olmo_chem_lora_cpt_LoRA_500k

Browse files

Co-authored-by: Harindhar <harindhar10@users.noreply.huggingface.co>

.gitattributes ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,81 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ base_model: Codemaster67/Olmo-7b-spe
3
+ datasets:
4
+ - Codemaster67/Causal_lm_chemistry_1M_rows
5
+ language: en
6
+ library_name: transformers
7
+ license: apache-2.0
8
+ tags:
9
+ - chemistry
10
+ - smiles
11
+ - olmo
12
+ - causal-lm
13
+ - full-finetune
14
+ - fsdp
15
+ ---
16
+
17
+ # OLMo-7B Full Fine-Tune — Chemistry SMILES CPT
18
+
19
+ ## Model Description
20
+
21
+ This model is a **full-parameter fine-tuned** version of
22
+ [Codemaster67/Olmo-7b-spe](https://huggingface.co/Codemaster67/Olmo-7b-spe) trained on chemistry
23
+ SMILES strings from the
24
+ [Codemaster67/Causal_lm_chemistry_1M_rows](https://huggingface.co/datasets/Codemaster67/Causal_lm_chemistry_1M_rows) dataset.
25
+
26
+ The base model's tokenizer was pre-extended with ~300 SPE (SMILES Pair
27
+ Encoding) chemistry tokens plus `<|start_of_smiles|>` / `<|end_of_smiles|>`
28
+ special tokens, and its embedding & LM-head layers were resized with
29
+ mean-initialised vectors for the new tokens.
30
+
31
+ ## Training Details
32
+
33
+ | Parameter | Value |
34
+ |---|---|
35
+ | **Method** | Full Fine-Tune (all weights updated) |
36
+ | **Parallelism** | FSDP (Fully Sharded Data Parallel) |
37
+ | **Epochs** | 1 |
38
+ | **Learning Rate** | 5e-06 |
39
+ | **Batch Size (per device)** | 16 |
40
+ | **Gradient Accumulation** | 1 |
41
+ | **Max Sequence Length** | 512 |
42
+ | **Warmup Ratio** | 0.1 |
43
+ | **Weight Decay** | 0.01 |
44
+ | **Scheduler** | Cosine |
45
+ | **Precision** | bf16 |
46
+ | **Augmentation** | OFF |
47
+ | **Training Samples** | 250000 |
48
+ | **Eval Samples** | 25000 |
49
+
50
+ ## Evaluation Results
51
+
52
+ | Metric | Value |
53
+ |---|---|
54
+ | **Final Eval Loss** | 0.9727568626403809 |
55
+ | **Final Eval Perplexity** | 2.645226943673604 |
56
+ | **Training Loss** | 1.1177 |
57
+
58
+ ## Usage
59
+
60
+ ```python
61
+ from transformers import AutoModelForCausalLM, AutoTokenizer
62
+
63
+ model = AutoModelForCausalLM.from_pretrained("harindhar10/olmo_chem_lora_cpt_LoRA_500k", trust_remote_code=True)
64
+ tokenizer = AutoTokenizer.from_pretrained("harindhar10/olmo_chem_lora_cpt_LoRA_500k", trust_remote_code=True)
65
+
66
+ smiles_input = "<|start_of_smiles|>CC(=O)Oc1ccccc1C(=O)O<|end_of_smiles|>"
67
+ inputs = tokenizer(smiles_input, return_tensors="pt")
68
+ outputs = model.generate(**inputs, max_new_tokens=128)
69
+ print(tokenizer.decode(outputs[0], skip_special_tokens=False))
70
+ ```
71
+
72
+ ## Intended Use
73
+
74
+ Chemistry-domain language modelling, SMILES generation and completion,
75
+ and downstream molecular property prediction via fine-tuning.
76
+
77
+ ## Limitations
78
+
79
+ - Trained primarily on SMILES strings; natural-language instruction-following
80
+ ability may degrade compared to the base OLMo checkpoint.
81
+ - Augmentation was disabled for this run.
adapter_config.json ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Codemaster67/Olmo-7b-spe",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 128,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.01,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": [
25
+ "embed_tokens",
26
+ "lm_head"
27
+ ],
28
+ "peft_type": "LORA",
29
+ "peft_version": "0.18.1",
30
+ "qalora_group_size": 16,
31
+ "r": 64,
32
+ "rank_pattern": {},
33
+ "revision": null,
34
+ "target_modules": [
35
+ "gate_proj",
36
+ "down_proj",
37
+ "v_proj",
38
+ "k_proj",
39
+ "o_proj",
40
+ "q_proj",
41
+ "up_proj"
42
+ ],
43
+ "target_parameters": null,
44
+ "task_type": "CAUSAL_LM",
45
+ "trainable_token_indices": null,
46
+ "use_dora": false,
47
+ "use_qalora": false,
48
+ "use_rslora": true
49
+ }
adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:306c8f703dd6c1f4f90cbd62be92a57e2c679a996cec569a315a9b0ea2d58732
3
+ size 1470623048
config.json ADDED
@@ -0,0 +1,30 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "OlmoForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": null,
8
+ "clip_qkv": null,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 50279,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 4096,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 11008,
15
+ "max_position_embeddings": 2048,
16
+ "model_type": "olmo",
17
+ "num_attention_heads": 32,
18
+ "num_hidden_layers": 32,
19
+ "num_key_value_heads": 32,
20
+ "pad_token_id": 1,
21
+ "pretraining_tp": 1,
22
+ "rope_parameters": {
23
+ "rope_theta": 10000.0,
24
+ "rope_type": "default"
25
+ },
26
+ "tie_word_embeddings": false,
27
+ "transformers_version": "5.14.1",
28
+ "use_cache": false,
29
+ "vocab_size": 50716
30
+ }
generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "eos_token_id": [
4
+ 50279,
5
+ 0
6
+ ],
7
+ "pad_token_id": 1,
8
+ "transformers_version": "5.14.1"
9
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1fad1046895b9185884d99c66902998def45a187c3cc194f81460201e184c238
3
+ size 13782968168
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": true,
6
+ "eos_token": "<|endoftext|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|start_of_smiles|>",
10
+ "<|end_of_smiles|>"
11
+ ],
12
+ "is_local": false,
13
+ "local_files_only": false,
14
+ "model_max_length": 1000000000000000019884624838656,
15
+ "pad_token": "<|padding|>",
16
+ "tokenizer_class": "GPTNeoXTokenizer",
17
+ "trim_offsets": true,
18
+ "unk_token": null
19
+ }