Igor-22 commited on
Commit
35db3c5
·
verified ·
1 Parent(s): fb44e39

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +95 -3
README.md CHANGED
@@ -1,3 +1,95 @@
1
- ---
2
- license: apache-2.0
3
- ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # 🧠 CronosFlowAI (T5 Instruct PT-BR)
2
+
3
+ Este é um modelo **T5 Instruct em português** treinado pela **SophiaMind**, utilizando como base o modelo `unicamp-dl/ptt5-base-portuguese-vocab`.
4
+ O modelo foi ajustado para compreender **instruções explícitas** (`instruction + input → output`), permitindo uso em tarefas de NLP como reformulação de textos.
5
+
6
+ ---
7
+
8
+ ## 📊 Métricas do Modelo
9
+
10
+ O modelo foi treinado com **50 mil exemplos** (aprox. 10% do dataset privado da SophiaMind) em cima do modelo base da Unicamp.
11
+ Resultados após 3 épocas:
12
+
13
+ - **Loss (treino):** `0.083`
14
+ - **Eval Loss:** `0.0037`
15
+ - **ROUGE-1:** `86.43`
16
+ - **ROUGE-2:** `82.30`
17
+ - **ROUGE-L:** `85.09`
18
+
19
+ Esses números mostram que o modelo já apresenta **alto alinhamento com as referências** e está pronto para aplicações reais.
20
+
21
+ ---
22
+
23
+ ## 🚀 Como usar
24
+
25
+ Instale as dependências:
26
+
27
+ ```bash
28
+ pip install transformers accelerate torch
29
+ ```
30
+
31
+ Carregue o modelo:
32
+
33
+ ```python
34
+ from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
35
+
36
+ MODEL_NAME = "IMNascimento/CronosFlowAI"
37
+
38
+ tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
39
+ model = AutoModelForSeq2SeqLM.from_pretrained(MODEL_NAME)
40
+
41
+ # Exemplo de inferência
42
+ instruction = "Reescreva a frase para WhatsApp com o mesmo sentido."
43
+ inp = "Promoção válida só hoje para novos clientes."
44
+ input_text = f"{instruction}: {inp}"
45
+
46
+ inputs = tokenizer(input_text, return_tensors="pt", padding=True, truncation=True)
47
+ outputs = model.generate(**inputs, max_length=128)
48
+
49
+ print(tokenizer.decode(outputs[0], skip_special_tokens=True))
50
+ ```
51
+
52
+ ---
53
+
54
+ ## 📂 Dataset
55
+
56
+ - **Base utilizada:** `unicamp-dl/ptt5-base-portuguese-vocab`
57
+ - **Dataset privado SophiaMind CronosFlowAI:** 500 mil amostras em **74 categorias diferentes**, contendo exemplos de reformulação, resumo, instrução e diversas aplicações de NLP.
58
+ - **Modelo público CronosFlowAI:** treinado com apenas **10% dos dados (50 mil registros)**.
59
+
60
+ ---
61
+
62
+ ## 💡 Aplicações
63
+
64
+ - Reformulação de frases e mensagens (WhatsApp, marketing, etc)
65
+
66
+ ---
67
+
68
+ ## 🙏 Agradecimentos
69
+
70
+ - **Unicamp** pelo modelo base `ptt5`.
71
+ - **SophiaMind** pelo dataset privado usado neste fine-tuning.
72
+ - **SophiaLabs** pela infraestrutura de treinamento.
73
+ - **IMNascimento** pelo desenvolvimento e publicação.
74
+
75
+ ---
76
+
77
+ ## 📌 Autor
78
+
79
+ 👤 **Desenvolvedor principal:** [IMNascimento](https://github.com/IMNascimento)
80
+ 🌐 **Infraestrutura:** [SophiaLabs](https://sophialabs.com.br)
81
+ 🔬 **Pesquisa e dataset:** [SophiaMind](https://sophiamind.com.br)
82
+
83
+ ---
84
+
85
+ ## 📢 Observações Importantes
86
+
87
+ Este modelo **CronosFlowAI** é a versão **pública**, treinada com apenas **10% do dataset privado** da SophiaMind para o CronosFlowAI.
88
+ O modelo **privado** possui **mais de 74 categorias** e **500 mil registros**, oferecendo capacidades ainda mais amplas.
89
+
90
+ ⚠️ Este modelo é experimental e não deve ser usado em cenários de missão crítica sem avaliação humana.
91
+
92
+
93
+ ---
94
+ license: apache-2.0
95
+ ---