Instructions to use kd13/RoPERT-base-cased with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use kd13/RoPERT-base-cased with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("fill-mask", model="kd13/RoPERT-base-cased", trust_remote_code=True)# Load model directly from transformers import AutoModelForMaskedLM model = AutoModelForMaskedLM.from_pretrained("kd13/RoPERT-base-cased", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
Update configuration_mybert.py
Browse files- configuration_mybert.py +4 -4
configuration_mybert.py
CHANGED
|
@@ -6,11 +6,11 @@ class MyBertConfig(PretrainedConfig):
|
|
| 6 |
|
| 7 |
def __init__(
|
| 8 |
self,
|
| 9 |
-
vocab_size=28996,
|
| 10 |
hidden_size=768,
|
| 11 |
num_hidden_layers=12,
|
| 12 |
num_attention_heads=12,
|
| 13 |
-
intermediate_size=2048,
|
| 14 |
max_position_embeddings=2048,
|
| 15 |
hidden_dropout_prob=0.0,
|
| 16 |
attention_probs_dropout_prob=0.0,
|
|
@@ -18,7 +18,7 @@ class MyBertConfig(PretrainedConfig):
|
|
| 18 |
initializer_range=0.02,
|
| 19 |
rope_theta=10000.0,
|
| 20 |
use_bias=False,
|
| 21 |
-
sparse_prediction=True,
|
| 22 |
pad_token_id=0,
|
| 23 |
tie_word_embeddings=True,
|
| 24 |
**kwargs,
|
|
@@ -38,4 +38,4 @@ class MyBertConfig(PretrainedConfig):
|
|
| 38 |
self.initializer_range = initializer_range
|
| 39 |
self.rope_theta = rope_theta
|
| 40 |
self.use_bias = use_bias
|
| 41 |
-
self.sparse_prediction = sparse_prediction
|
|
|
|
| 6 |
|
| 7 |
def __init__(
|
| 8 |
self,
|
| 9 |
+
vocab_size=28996,
|
| 10 |
hidden_size=768,
|
| 11 |
num_hidden_layers=12,
|
| 12 |
num_attention_heads=12,
|
| 13 |
+
intermediate_size=2048,
|
| 14 |
max_position_embeddings=2048,
|
| 15 |
hidden_dropout_prob=0.0,
|
| 16 |
attention_probs_dropout_prob=0.0,
|
|
|
|
| 18 |
initializer_range=0.02,
|
| 19 |
rope_theta=10000.0,
|
| 20 |
use_bias=False,
|
| 21 |
+
sparse_prediction=True,
|
| 22 |
pad_token_id=0,
|
| 23 |
tie_word_embeddings=True,
|
| 24 |
**kwargs,
|
|
|
|
| 38 |
self.initializer_range = initializer_range
|
| 39 |
self.rope_theta = rope_theta
|
| 40 |
self.use_bias = use_bias
|
| 41 |
+
self.sparse_prediction = sparse_prediction
|