from transformers import PretrainedConfig class RapnssConfig(PretrainedConfig): model_type = "rapnss" def __init__( self, vocab_size=50257, d_model=768, n_heads=12, n_layers=12, d_ff=3072, max_seq_len=512, dropout=0.1, tie_word_embeddings=True, architectures=["RapnssForCausalLM"], **kwargs ): self.vocab_size = vocab_size self.d_model = d_model self.n_heads = n_heads self.n_layers = n_layers self.d_ff = d_ff self.max_seq_len = max_seq_len self.dropout = dropout super().__init__(**kwargs) self.is_decoder = True self.num_hidden_layers = n_layers