{ "architectures": [ "SubSegDeBERTaForMaskedLM" ], "attention_probs_dropout_prob": 0.1, "bos_token_id": 1, "char_decoder_hidden_size": 256, "char_decoder_num_layers": 1, "char_embed_dim": 128, "cls_token_id": 1, "dropout": 0.1, "dtype": "float32", "eos_token_id": 2, "eow_token_id": 5, "hidden_act": "gelu", "hidden_dropout_prob": 0.1, "hidden_size": 768, "initializer_range": 0.02, "intermediate_size": 3072, "layer_norm_eps": 1e-07, "lex_vocab_size": 10001, "loss_normalization": "word", "mask_token_id": 3, "max_position_embeddings": 1024, "max_relative_positions": -1, "max_seg_len": 5, "mlm_probability": 0.4, "model_type": "subsegdeberta", "n_alpha": 263, "norm_rel_ebd": "layer_norm", "num_attention_heads": 12, "num_hidden_layers": 12, "pad_token_id": 0, "pos_att_type": "p2c|c2p", "position_buckets": 256, "relative_attention": true, "seg_end_token_id": 6, "sep_token_id": 2, "transformers_version": "4.57.1", "unk_token_id": 4, "vocab_size": 418, "word_context_hidden_size": 768, "word_context_num_layers": 1 }