rkenji commited on
Commit
419d8fb
·
1 Parent(s): 87b2f78

Training 20251202_154101 - 7 classes with metrics

Browse files
Files changed (2) hide show
  1. README.md +118 -5
  2. config.json +24 -24
README.md CHANGED
@@ -1,6 +1,33 @@
1
  ---
2
- library_name: transformers
3
- tags: []
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
4
  ---
5
 
6
  # Model Card for Model ID
@@ -15,14 +42,100 @@ tags: []
15
 
16
  <!-- Provide a longer summary of what this model is. -->
17
 
18
- This is the model card of a 🤗 transformers model that has been pushed on the Hub. This model card has been automatically generated.
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
19
 
20
  - **Developed by:** [More Information Needed]
21
  - **Funded by [optional]:** [More Information Needed]
22
  - **Shared by [optional]:** [More Information Needed]
23
  - **Model type:** [More Information Needed]
24
- - **Language(s) (NLP):** [More Information Needed]
25
- - **License:** [More Information Needed]
26
  - **Finetuned from model [optional]:** [More Information Needed]
27
 
28
  ### Model Sources [optional]
 
1
  ---
2
+ datasets:
3
+ - legal_documents
4
+ language: pt
5
+ license: apache-2.0
6
+ tags:
7
+ - text-classification
8
+ - legal
9
+ - bert
10
+ - portuguese
11
+ - brazilian-legal-documents
12
+ model-index:
13
+ - name: testmodel
14
+ results:
15
+ - task:
16
+ type: text-classification
17
+ dataset:
18
+ name: Legal Documents Classification Dataset
19
+ type: legal_documents
20
+ metrics:
21
+ - type: accuracy
22
+ value: 0.941970310391363
23
+ - type: f1
24
+ value: 0.9370428524548865
25
+ - type: precision
26
+ value: 0.9343445431988082
27
+ - type: recall
28
+ value: 0.941970310391363
29
+ - type: f1_macro
30
+ value: 0.7992595460988434
31
  ---
32
 
33
  # Model Card for Model ID
 
42
 
43
  <!-- Provide a longer summary of what this model is. -->
44
 
45
+
46
+ # Modelo de Classificação de Documentos Jurídicos
47
+
48
+ Este modelo foi treinado para classificar documentos jurídicos brasileiros usando BERT multilíngue.
49
+
50
+ ## Detalhes do Modelo
51
+
52
+ - **Base Model:** google-bert/bert-base-multilingual-cased
53
+ - **Tipo:** Classificação Multiclasse
54
+ - **Número de Classes:** 7
55
+ - **Idioma:** Português (Brasil)
56
+ - **Domínio:** Documentos Jurídicos
57
+
58
+ ## Classes
59
+
60
+ 0. Alvará
61
+ 1. Sentença
62
+ 2. Penhora/Arresto/Sequestro
63
+ 3. Citação
64
+ 4. Art.40
65
+ 5. Não
66
+ 6. Unificado
67
+ 7. sentença em apensado.
68
+ 8. Arquivo provisório do art. 28 lef
69
+ 9. Alvará
70
+ 10. Citação de embargos
71
+ 11. Remessa para o arquivo
72
+ 12. Sentença de mérito ou definitiva
73
+ 13. Citação
74
+ 14. Volta da suspensão do artigo 40
75
+ 15. Forma tácita
76
+ 16. Pelo prazo de 10 dias
77
+ 17. leilão
78
+ 18. Art. 40
79
+
80
+ ## Métricas de Avaliação
81
+
82
+ As métricas abaixo foram calculadas no conjunto de validação:
83
+
84
+ - **Accuracy:** 0.9420
85
+ - **F1-Score (Weighted):** 0.9370
86
+ - **Precision (Weighted):** 0.9343
87
+ - **Recall (Weighted):** 0.9420
88
+ - **F1-Score (Macro):** 0.7993
89
+
90
+ ## Classification Report Completo
91
+
92
+ ```
93
+ precision recall f1-score support
94
+
95
+ 0 0.00 0.00 0.00 6
96
+ 1 0.94 0.96 0.95 46
97
+ 2 0.93 0.73 0.82 55
98
+ 3 0.89 0.97 0.93 35
99
+ 4 0.93 0.95 0.94 132
100
+ 5 0.94 0.97 0.96 424
101
+ 6 1.00 1.00 1.00 43
102
+
103
+ accuracy 0.94 741
104
+ macro avg 0.81 0.80 0.80 741
105
+ weighted avg 0.93 0.94 0.94 741
106
+
107
+ ```
108
+
109
+ ## Uso
110
+
111
+ ```python
112
+ from transformers import AutoTokenizer, AutoModelForSequenceClassification
113
+ import torch
114
+
115
+ # Carregar modelo e tokenizer
116
+ model = AutoModelForSequenceClassification.from_pretrained("rkenji/testmodel")
117
+ tokenizer = AutoTokenizer.from_pretrained("rkenji/testmodel")
118
+
119
+ # Fazer predição
120
+ texto = "Seu texto jurídico aqui"
121
+ inputs = tokenizer(texto, return_tensors="pt", truncation=True, max_length=512)
122
+ outputs = model(**inputs)
123
+ prediction = torch.argmax(outputs.logits, dim=1).item()
124
+
125
+ print(f"Classe predita: {prediction}")
126
+ ```
127
+
128
+ ## Treinamento
129
+
130
+ O modelo foi treinado com early stopping e validação cruzada em um dataset de documentos jurídicos brasileiros.
131
+
132
 
133
  - **Developed by:** [More Information Needed]
134
  - **Funded by [optional]:** [More Information Needed]
135
  - **Shared by [optional]:** [More Information Needed]
136
  - **Model type:** [More Information Needed]
137
+ - **Language(s) (NLP):** pt
138
+ - **License:** apache-2.0
139
  - **Finetuned from model [optional]:** [More Information Needed]
140
 
141
  ### Model Sources [optional]
config.json CHANGED
@@ -16,40 +16,40 @@
16
  "3": "Cita\u00e7\u00e3o",
17
  "4": "Art.40",
18
  "5": "N\u00e3o",
19
- "6": "Art. 40",
20
- "7": "Unificado",
21
  "8": "Arquivo provis\u00f3rio do art. 28 lef",
22
- "9": "Volta da suspens\u00e3o do artigo 40",
23
- "10": "Senten\u00e7a de m\u00e9rito ou definitiva",
24
- "11": "Alvar\u00e1",
25
- "12": "Cita\u00e7\u00e3o",
26
- "13": "leil\u00e3o",
27
- "14": "Forma t\u00e1cita",
28
- "15": "Cita\u00e7\u00e3o de embargos",
29
- "16": "senten\u00e7a em apensado.",
30
- "17": "Remessa para o arquivo",
31
- "18": "Pelo prazo de 10 dias"
32
  },
33
  "initializer_range": 0.02,
34
  "intermediate_size": 3072,
35
  "label2id": {
36
- "Alvar\u00e1": 11,
37
  "Arquivo provis\u00f3rio do art. 28 lef": 8,
38
- "Art. 40": 6,
39
  "Art.40": 4,
40
- "Cita\u00e7\u00e3o": 12,
41
- "Cita\u00e7\u00e3o de embargos": 15,
42
- "Forma t\u00e1cita": 14,
43
  "N\u00e3o": 5,
44
- "Pelo prazo de 10 dias": 18,
45
  "Penhora/Arresto/Sequestro": 2,
46
- "Remessa para o arquivo": 17,
47
  "Senten\u00e7a": 1,
48
- "Senten\u00e7a de m\u00e9rito ou definitiva": 10,
49
- "Unificado": 7,
50
- "Volta da suspens\u00e3o do artigo 40": 9,
51
- "leil\u00e3o": 13,
52
- "senten\u00e7a em apensado.": 16
53
  },
54
  "layer_norm_eps": 1e-12,
55
  "max_position_embeddings": 512,
 
16
  "3": "Cita\u00e7\u00e3o",
17
  "4": "Art.40",
18
  "5": "N\u00e3o",
19
+ "6": "Unificado",
20
+ "7": "senten\u00e7a em apensado.",
21
  "8": "Arquivo provis\u00f3rio do art. 28 lef",
22
+ "9": "Alvar\u00e1",
23
+ "10": "Cita\u00e7\u00e3o de embargos",
24
+ "11": "Remessa para o arquivo",
25
+ "12": "Senten\u00e7a de m\u00e9rito ou definitiva",
26
+ "13": "Cita\u00e7\u00e3o",
27
+ "14": "Volta da suspens\u00e3o do artigo 40",
28
+ "15": "Forma t\u00e1cita",
29
+ "16": "Pelo prazo de 10 dias",
30
+ "17": "leil\u00e3o",
31
+ "18": "Art. 40"
32
  },
33
  "initializer_range": 0.02,
34
  "intermediate_size": 3072,
35
  "label2id": {
36
+ "Alvar\u00e1": 9,
37
  "Arquivo provis\u00f3rio do art. 28 lef": 8,
38
+ "Art. 40": 18,
39
  "Art.40": 4,
40
+ "Cita\u00e7\u00e3o": 13,
41
+ "Cita\u00e7\u00e3o de embargos": 10,
42
+ "Forma t\u00e1cita": 15,
43
  "N\u00e3o": 5,
44
+ "Pelo prazo de 10 dias": 16,
45
  "Penhora/Arresto/Sequestro": 2,
46
+ "Remessa para o arquivo": 11,
47
  "Senten\u00e7a": 1,
48
+ "Senten\u00e7a de m\u00e9rito ou definitiva": 12,
49
+ "Unificado": 6,
50
+ "Volta da suspens\u00e3o do artigo 40": 14,
51
+ "leil\u00e3o": 17,
52
+ "senten\u00e7a em apensado.": 7
53
  },
54
  "layer_norm_eps": 1e-12,
55
  "max_position_embeddings": 512,