kd13 commited on
Commit
6d646da
·
verified ·
1 Parent(s): 819df1c

Update configuration_mybert.py

Browse files
Files changed (1) hide show
  1. configuration_mybert.py +4 -4
configuration_mybert.py CHANGED
@@ -6,11 +6,11 @@ class MyBertConfig(PretrainedConfig):
6
 
7
  def __init__(
8
  self,
9
- vocab_size=28996, # google-bert/bert-base-cased
10
  hidden_size=768,
11
  num_hidden_layers=12,
12
  num_attention_heads=12,
13
- intermediate_size=2048, # SwiGLU: 2/3*3072 -> param-neutral vs GELU FFN
14
  max_position_embeddings=2048,
15
  hidden_dropout_prob=0.0,
16
  attention_probs_dropout_prob=0.0,
@@ -18,7 +18,7 @@ class MyBertConfig(PretrainedConfig):
18
  initializer_range=0.02,
19
  rope_theta=10000.0,
20
  use_bias=False,
21
- sparse_prediction=True, # MLM head only on masked positions
22
  pad_token_id=0,
23
  tie_word_embeddings=True,
24
  **kwargs,
@@ -38,4 +38,4 @@ class MyBertConfig(PretrainedConfig):
38
  self.initializer_range = initializer_range
39
  self.rope_theta = rope_theta
40
  self.use_bias = use_bias
41
- self.sparse_prediction = sparse_prediction
 
6
 
7
  def __init__(
8
  self,
9
+ vocab_size=28996,
10
  hidden_size=768,
11
  num_hidden_layers=12,
12
  num_attention_heads=12,
13
+ intermediate_size=2048,
14
  max_position_embeddings=2048,
15
  hidden_dropout_prob=0.0,
16
  attention_probs_dropout_prob=0.0,
 
18
  initializer_range=0.02,
19
  rope_theta=10000.0,
20
  use_bias=False,
21
+ sparse_prediction=True,
22
  pad_token_id=0,
23
  tie_word_embeddings=True,
24
  **kwargs,
 
38
  self.initializer_range = initializer_range
39
  self.rope_theta = rope_theta
40
  self.use_bias = use_bias
41
+ self.sparse_prediction = sparse_prediction