Igor-22 commited on
Commit
70940fe
·
verified ·
1 Parent(s): e5b8d3f

update readme

Browse files
Files changed (1) hide show
  1. README.md +107 -3
README.md CHANGED
@@ -1,3 +1,107 @@
1
- ---
2
- license: apache-2.0
3
- ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language:
3
+ - pt
4
+ metrics:
5
+ - rouge
6
+ base_model:
7
+ - unicamp-dl/ptt5-base-portuguese-vocab
8
+ library_name: transformers
9
+ tags:
10
+ - text-generation-inference
11
+ ---
12
+ # 🧠 CronosFlowAI (T5 Instruct PT-BR)
13
+
14
+ Este é um modelo **T5 Instruct em português** treinado pela **SophiaMind**, utilizando como base o modelo `unicamp-dl/ptt5-base-portuguese-vocab`.
15
+ O modelo foi ajustado para compreender **instruções explícitas** (`instruction + input → output`), permitindo uso em tarefas de NLP como reformulação de textos.
16
+
17
+ ---
18
+
19
+ ## 📊 Métricas do Modelo
20
+
21
+ O modelo foi treinado com **50 mil exemplos** (aprox. 10% do dataset privado da SophiaMind CronosFlowAI) em cima do modelo base da Unicamp.
22
+ Resultados após 3 épocas:
23
+
24
+ - **Loss (treino):** `0.083`
25
+ - **Eval Loss:** `0.0037`
26
+ - **ROUGE-1:** `86.43`
27
+ - **ROUGE-2:** `82.30`
28
+ - **ROUGE-L:** `85.09`
29
+
30
+ Esses números mostram que o modelo já apresenta **alto alinhamento com as referências** e está pronto para aplicações reais.
31
+
32
+ ---
33
+
34
+ ## 🚀 Como usar
35
+
36
+ Instale as dependências:
37
+
38
+ ```bash
39
+ pip install transformers accelerate torch
40
+ ```
41
+
42
+ Carregue o modelo:
43
+
44
+ ```python
45
+ from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
46
+
47
+ MODEL_NAME = "IMNascimento/CronosFlowAI"
48
+
49
+ tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
50
+ model = AutoModelForSeq2SeqLM.from_pretrained(MODEL_NAME)
51
+
52
+ # Exemplo de inferência
53
+ instruction = "Reescreva a frase para WhatsApp com o mesmo sentido."
54
+ inp = "Promoção válida só hoje para novos clientes."
55
+ input_text = f"{instruction}: {inp}"
56
+
57
+ inputs = tokenizer(input_text, return_tensors="pt", padding=True, truncation=True)
58
+ outputs = model.generate(**inputs, max_length=128)
59
+
60
+ print(tokenizer.decode(outputs[0], skip_special_tokens=True))
61
+ ```
62
+
63
+ ---
64
+
65
+ ## 📂 Dataset
66
+
67
+ - **Base utilizada:** `unicamp-dl/ptt5-base-portuguese-vocab`
68
+ - **Dataset privado SophiaMind CronosFlowAI:** 500 mil amostras em **74 categorias diferentes**, contendo exemplos de reformulação, resumo, instrução e diversas aplicações de NLP.
69
+ - **Modelo público CronosFlowAI:** treinado com apenas **10% dos dados (50 mil registros)**.
70
+
71
+ ---
72
+
73
+ ## 💡 Aplicações
74
+
75
+ - Reformulação de frases e mensagens (WhatsApp, marketing, etc)
76
+
77
+ ---
78
+
79
+ ## 🙏 Agradecimentos
80
+
81
+ - **Unicamp** pelo modelo base `ptt5`.
82
+ - **SophiaMind** pelo dataset privado usado neste fine-tuning.
83
+ - **SophiaLabs** pela infraestrutura de treinamento.
84
+ - **IMNascimento** pelo desenvolvimento e publicação.
85
+
86
+ ---
87
+
88
+ ## 📌 Autor
89
+
90
+ 👤 **Desenvolvedor principal:** [IMNascimento](https://github.com/IMNascimento)
91
+ 🌐 **Infraestrutura:** [SophiaLabs](https://sophialabs.com.br)
92
+ 🔬 **Pesquisa e dataset:** [SophiaMind](https://sophiamind.com.br)
93
+
94
+ ---
95
+
96
+ ## 📢 Observações Importantes
97
+
98
+ Este modelo **CronosFlowAI** é a versão **pública**, treinada com apenas **10% do dataset privado** da SophiaMind para o CronosFlowAI.
99
+ O modelo **privado** possui **mais de 74 categorias** e **500 mil registros**, oferecendo capacidades ainda mais amplas.
100
+
101
+ ⚠️ Este modelo é experimental e não deve ser usado em cenários de missão crítica sem avaliação humana.
102
+
103
+
104
+ ---
105
+ license: apache-2.0
106
+ ---
107
+