Upload folder using huggingface_hub

Browse files

Files changed (13) hide show

.gitattributes +7 -32
README.md +89 -0
config.json +68 -0
flax_model.msgpack +3 -0
model.safetensors +3 -0
model_args.json +1 -0
pytorch_model.bin +3 -0
special_tokens_map.json +7 -0
tf_model.h5 +3 -0
tokenizer.json +0 -0
tokenizer_config.json +16 -0
training_args.bin +3 -0
vocab.txt +0 -0

.gitattributes CHANGED Viewed

@@ -1,35 +1,10 @@
-*.7z filter=lfs diff=lfs merge=lfs -text
-*.arrow filter=lfs diff=lfs merge=lfs -text
 *.bin filter=lfs diff=lfs merge=lfs -text
-*.bz2 filter=lfs diff=lfs merge=lfs -text
-*.ckpt filter=lfs diff=lfs merge=lfs -text
-*.ftz filter=lfs diff=lfs merge=lfs -text
-*.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
-*.joblib filter=lfs diff=lfs merge=lfs -text
-*.lfs.* filter=lfs diff=lfs merge=lfs -text
-*.mlmodel filter=lfs diff=lfs merge=lfs -text
-*.model filter=lfs diff=lfs merge=lfs -text
-*.msgpack filter=lfs diff=lfs merge=lfs -text
-*.npy filter=lfs diff=lfs merge=lfs -text
-*.npz filter=lfs diff=lfs merge=lfs -text
-*.onnx filter=lfs diff=lfs merge=lfs -text
-*.ot filter=lfs diff=lfs merge=lfs -text
-*.parquet filter=lfs diff=lfs merge=lfs -text
-*.pb filter=lfs diff=lfs merge=lfs -text
-*.pickle filter=lfs diff=lfs merge=lfs -text
-*.pkl filter=lfs diff=lfs merge=lfs -text
-*.pt filter=lfs diff=lfs merge=lfs -text
-*.pth filter=lfs diff=lfs merge=lfs -text
-*.rar filter=lfs diff=lfs merge=lfs -text
-*.safetensors filter=lfs diff=lfs merge=lfs -text
-saved_model/**/* filter=lfs diff=lfs merge=lfs -text
-*.tar.* filter=lfs diff=lfs merge=lfs -text
-*.tar filter=lfs diff=lfs merge=lfs -text
 *.tflite filter=lfs diff=lfs merge=lfs -text
-*.tgz filter=lfs diff=lfs merge=lfs -text
-*.wasm filter=lfs diff=lfs merge=lfs -text
-*.xz filter=lfs diff=lfs merge=lfs -text
-*.zip filter=lfs diff=lfs merge=lfs -text
-*.zst filter=lfs diff=lfs merge=lfs -text
-*tfevents* filter=lfs diff=lfs merge=lfs -text

+*.bin.* filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.bin filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.tflite filter=lfs diff=lfs merge=lfs -text
+*.tar.gz filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+model.safetensors filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,89 @@

+---
+language: ar
+---
+# Arabic Named Entity Recognition Model
+<a href='https://ko-fi.com/Y8Y71D98TC' target='_blank'><img height='36' style='border:0px;height:36px;' src='https://storage.ko-fi.com/cdn/kofi6.png?v=6' border='0' alt='Buy Me a Coffee at ko-fi.com' /></a>
+Pretrained BERT-based ([arabic-bert-base](https://huggingface.co/asafaya/bert-base-arabic)) Named Entity Recognition model for Arabic.
+The pre-trained model can recognize the following entities:
+1. **PERSON**
+-  و هذا ما نفاه المعاون السياسي للرئيس ***نبيه بري*** ، النائب ***علي حسن خليل***
+- لكن أوساط ***الحريري*** تعتبر أنه ضحى كثيرا في سبيل البلد
+- و ستفقد الملكة ***إليزابيث الثانية*** بذلك سيادتها على واحدة من آخر ممالك الكومنولث
+2. **ORGANIZATION**
+- حسب أرقام ***البنك الدولي***
+-  أعلن ***الجيش العراقي***
+-  و نقلت وكالة ***رويترز*** عن ثلاثة دبلوماسيين في ***الاتحاد الأوروبي*** ، أن ***بلجيكا*** و ***إيرلندا*** و ***لوكسمبورغ*** تريد أيضاً مناقشة
+-  ***الحكومة الاتحادية*** و ***حكومة إقليم كردستان***
+- و هو ما يثير الشكوك حول مشاركة النجم البرتغالي في المباراة المرتقبة أمام ***برشلونة*** الإسباني في
+3. ***LOCATION***
+-  الجديد هو تمكين اللاجئين من “ مغادرة الجزيرة تدريجياً و بهدوء إلى ***أثينا*** ”
+-  ***جزيرة ساكيز*** تبعد 1 كم عن ***إزمير***
+4. **DATE**
+-  ***غدا الجمعة***
+-  ***06 أكتوبر 2020***
+- ***العام السابق***
+5. **PRODUCT**
+-  عبر حسابه ب ***تطبيق “ إنستغرام ”***
+-  الجيل الثاني من ***نظارة الواقع الافتراضي أوكولوس كويست*** تحت اسم " ***أوكولوس كويست 2*** "
+6. **COMPETITION**
+-  عدم المشاركة في ***بطولة فرنسا المفتوحة للتنس***
+-  في مباراة ***كأس السوبر الأوروبي***
+7. **PRIZE**
+-  ***جائزة نوبل ل لآداب***
+-  الذي فاز ب ***جائزة “ إيمي ” لأفضل دور مساند***
+8. **EVENT**
+-  تسجّل أغنية جديدة خاصة ب ***العيد الوطني السعودي***
+- ***مهرجان المرأة يافوية*** في دورته الرابعة
+9. **DISEASE**
+-  في مكافحة فيروس ***كورونا*** و عدد من الأمراض
+-  الأزمات المشابهة مثل “ ***انفلونزا الطيور*** ” و ” ***انفلونزا الخنازير***
+## Example
+[Find here a complete example to use this model](https://github.com/hatmimoha/arabic-ner)
+## Training Corpus
+The training corpus is made of 378.000 tokens (14.000 sentences) collected from the Web and annotated manually.
+## Results
+The results on a valid corpus made of 30.000 tokens shows an F-measure of ~87%.

config.json ADDED Viewed

	@@ -0,0 +1,68 @@

+{
+  "_name_or_path": "asafaya/bert-base-arabic",
+  "architectures": [
+    "BertForTokenClassification"
+  ],
+  "attention_probs_dropout_prob": 0.1,
+  "classifier_dropout": null,
+  "gradient_checkpointing": false,
+  "hidden_act": "gelu",
+  "hidden_dropout_prob": 0.1,
+  "hidden_size": 768,
+  "id2label": {
+    "0": "B-COMPETITION",
+    "1": "B-DATE",
+    "2": "B-DISEASE",
+    "3": "B-EVENT",
+    "4": "B-LOCATION",
+    "5": "B-ORGANIZATION",
+    "6": "B-PERSON",
+    "7": "B-PRICE",
+    "8": "B-PRODUCT",
+    "9": "I-COMPETITION",
+    "10": "I-DATE",
+    "11": "I-DISEASE",
+    "12": "I-EVENT",
+    "13": "I-LOCATION",
+    "14": "I-ORGANIZATION",
+    "15": "I-PERSON",
+    "16": "I-PRICE",
+    "17": "I-PRODUCT",
+    "18": "O"
+  },
+  "initializer_range": 0.02,
+  "intermediate_size": 3072,
+  "label2id": {
+    "B-COMPETITION": 0,
+    "B-DATE": 1,
+    "B-DISEASE": 2,
+    "B-EVENT": 3,
+    "B-LOCATION": 4,
+    "B-ORGANIZATION": 5,
+    "B-PERSON": 6,
+    "B-PRICE": 7,
+    "B-PRODUCT": 8,
+    "I-COMPETITION": 9,
+    "I-DATE": 10,
+    "I-DISEASE": 11,
+    "I-EVENT": 12,
+    "I-LOCATION": 13,
+    "I-ORGANIZATION": 14,
+    "I-PERSON": 15,
+    "I-PRICE": 16,
+    "I-PRODUCT": 17,
+    "O": 18
+  },
+  "layer_norm_eps": 1e-12,
+  "max_position_embeddings": 512,
+  "model_type": "bert",
+  "num_attention_heads": 12,
+  "num_hidden_layers": 12,
+  "output_past": true,
+  "pad_token_id": 0,
+  "position_embedding_type": "absolute",
+  "torch_dtype": "float32",
+  "transformers_version": "4.24.0",
+  "type_vocab_size": 2,
+  "vocab_size": 32000
+}

flax_model.msgpack ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a744745bcb0b1427238607d692de80c881cf6362517191bcc1f36ad8e5aafad0
+size 440172594

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3764c2575a6db5ed5efb4ff633f5067c137243e997bff6b3037811299594b70d
+size 440192992

model_args.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"adam_epsilon": 1e-08, "best_model_dir": "outputs/best_model", "cache_dir": "cache_dir/", "config": {}, "custom_layer_parameters": [], "custom_parameter_groups": [], "dataloader_num_workers": 1, "do_lower_case": false, "dynamic_quantize": false, "early_stopping_consider_epochs": false, "early_stopping_delta": 0, "early_stopping_metric": "eval_loss", "early_stopping_metric_minimize": true, "early_stopping_patience": 3, "encoding": null, "eval_batch_size": 8, "evaluate_during_training": false, "evaluate_during_training_silent": true, "evaluate_during_training_steps": 2000, "evaluate_during_training_verbose": false, "evaluate_each_epoch": true, "fp16": true, "gradient_accumulation_steps": 8, "learning_rate": 4e-05, "local_rank": -1, "logging_steps": 50, "manual_seed": null, "max_grad_norm": 1.0, "max_seq_length": 256, "model_name": "/content/drive/My Drive/Colab Notebooks/output-last/", "model_type": "bert", "multiprocessing_chunksize": 500, "n_gpu": 1, "no_cache": false, "no_save": false, "num_train_epochs": 3, "output_dir": "/content/drive/My Drive/Colab Notebooks/output/", "overwrite_output_dir": true, "process_count": 1, "quantized_model": false, "reprocess_input_data": true, "save_best_model": true, "save_eval_checkpoints": true, "save_model_every_epoch": false, "save_optimizer_and_scheduler": true, "save_steps": -1, "silent": false, "tensorboard_dir": null, "thread_count": null, "train_batch_size": 10, "train_custom_parameters_only": false, "use_cached_eval_features": false, "use_early_stopping": false, "use_multiprocessing": true, "wandb_kwargs": {}, "wandb_project": null, "warmup_ratio": 0.06, "warmup_steps": 266, "weight_decay": 0, "skip_special_tokens": true, "model_class": "NERModel", "classification_report": false, "labels_list": ["B-PERSON", "I-PERSON", "B-ORGANIZATION", "I-ORGANIZATION", "B-LOCATION", "I-LOCATION", "B-DATE", "I-DATE", "B-COMPETITION", "I-COMPETITION", "B-PRICE", "I-PRICE", "O", "B-PRODUCT", "I-PRODUCT", "B-EVENT", "I-EVENT", "B-DISEASE", "I-DISEASE"], "lazy_loading": false, "lazy_loading_start_line": 0, "onnx": false}

pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3a70dc2fa360ac2997727c20ee7a91e028595f2176238cac909ab79c9e5e3e29
+size 440235889

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,7 @@

+{
+  "cls_token": "[CLS]",
+  "mask_token": "[MASK]",
+  "pad_token": "[PAD]",
+  "sep_token": "[SEP]",
+  "unk_token": "[UNK]"
+}

tf_model.h5 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:eb0c57bbabb33b3e549d4facf6e03ab09810d3a00553ee68e29e81a0447565ae
+size 442815900

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,16 @@

+{
+  "cls_token": "[CLS]",
+  "do_basic_tokenize": true,
+  "do_lower_case": true,
+  "full_tokenizer_file": null,
+  "mask_token": "[MASK]",
+  "name_or_path": "asafaya/bert-base-arabic",
+  "never_split": null,
+  "pad_token": "[PAD]",
+  "sep_token": "[SEP]",
+  "special_tokens_map_file": null,
+  "strip_accents": null,
+  "tokenize_chinese_chars": true,
+  "tokenizer_class": "BertTokenizer",
+  "unk_token": "[UNK]"
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4b416605fdb4edc9a7a01f7e76cb8c86bf6f01e5f051c63f336895ac1adaca65
+size 3375

vocab.txt ADDED Viewed

The diff for this file is too large to render. See raw diff