summerMC commited on
Commit
dc244cf
·
verified ·
1 Parent(s): 29ecdb7

v36: Enhanced README and permanent chat_template integration

Browse files
Files changed (3) hide show
  1. README.md +23 -8
  2. chat_template.jinja +1 -0
  3. tokenizer_config.json +1 -1
README.md CHANGED
@@ -6,21 +6,36 @@ tags:
6
  - text-generation
7
  - trm-text
8
  - ism
 
 
 
 
 
9
  ---
10
 
11
- # TRM-textV2: Recurrent Shared Transformer with ISM
12
 
13
- This model is a Recurrent Shared Transformer trained with the Inverse Square Mask (ISM) logic. It uses a single Transformer block repeated multiple times (recurrence_steps=4) to simulate depth while maintaining a lower parameter count.
14
 
15
- ## Key Features
16
- - **Architecture**: Shared Recurrent Transformer Block (v34).
17
- - **Inference**: Supports ISM-based prefix-answer masking.
18
- - **Training**: TinyStories & FineWeb optimized.
 
 
19
 
20
- ## Usage
21
  ```python
22
  from transformers import AutoModelForCausalLM, AutoTokenizer
23
 
 
24
  model = AutoModelForCausalLM.from_pretrained('summerMC/TRM-textV2', trust_remote_code=True)
25
- tokenizer = AutoTokenizer.from_pretrained('summerMC/TRM-textV2')
 
 
 
26
  ```
 
 
 
 
 
 
6
  - text-generation
7
  - trm-text
8
  - ism
9
+ - recurrent-transformer
10
+ - tiny-stories
11
+ library_name: transformers
12
+ metrics:
13
+ - accuracy
14
  ---
15
 
16
+ # 🤖 TRM-textV2: Recurrent Shared Transformer
17
 
18
+ TRM-textV2 is a high-efficiency language model featuring a **Shared Recurrent Transformer** architecture enhanced with **Inverse Square Mask (ISM)** logic.
19
 
20
+ ## 🌟 Model Highlights
21
+ - **Efficient Depth**: Simulates a deep network by repeating a single Transformer block (recurrence_steps=4).
22
+ - **ISM Integration**: Advanced prefix-answer masking for superior long-range dependency handling.
23
+ - **Optimized for Stability**: Trained with specific residual scaling and gate initialization to prevent loss plateaus.
24
+
25
+ ## 🚀 Quick Start
26
 
 
27
  ```python
28
  from transformers import AutoModelForCausalLM, AutoTokenizer
29
 
30
+ tokenizer = AutoTokenizer.from_pretrained('summerMC/TRM-textV2', trust_remote_code=True)
31
  model = AutoModelForCausalLM.from_pretrained('summerMC/TRM-textV2', trust_remote_code=True)
32
+
33
+ # Standard Chat Template use
34
+ messages = [{'role': 'user', 'content': 'Once upon a time, a small robot'}]
35
+ inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors='pt')
36
  ```
37
+
38
+ ## 📊 Training Details
39
+ - **Dataset**: TinyStories & FineWeb-Edu
40
+ - **Architecture**: 45M parameters (Effective depth equivalent to larger models)
41
+ - **License**: MIT
chat_template.jinja ADDED
@@ -0,0 +1 @@
 
 
1
+ {% for message in messages %}{{'<|' + message['role'] + '|>\n' + message['content'] + '<|end|>\n'}}{% endfor %}
tokenizer_config.json CHANGED
@@ -4,7 +4,7 @@
4
  "bos_token": "<|endoftext|>",
5
  "eos_token": "<|endoftext|>",
6
  "errors": "replace",
7
- "is_local": false,
8
  "local_files_only": false,
9
  "model_max_length": 1024,
10
  "pad_token": null,
 
4
  "bos_token": "<|endoftext|>",
5
  "eos_token": "<|endoftext|>",
6
  "errors": "replace",
7
+ "is_local": true,
8
  "local_files_only": false,
9
  "model_max_length": 1024,
10
  "pad_token": null,