thiagonishimura commited on
Commit
b75907e
·
verified ·
1 Parent(s): fc3d735

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +19 -13
README.md CHANGED
@@ -31,19 +31,25 @@ Este repositório contém as versões quantizadas em formato **GGUF (4 bits e 8
31
  - **Domínio:** Geoespacial, PostGIS, Monitoramento Ambiental (Amazônia)
32
  - **Idioma Principal:** Português (PT-BR) / SQL
33
 
34
- ## 📂 Arquivos do Repositório
35
-
36
- ### Modelos Quantizados (CPU-Only)
37
- Recomendamos o download da versão **Q4** para ambientes com restrição severa de memória (aprox. 4.68 GB de RAM necessários para o 7B) ou a versão **Q8** para um *trade-off* superior entre acurácia de execução e latência.
38
- * `terramodel-7b-q8_0.gguf`
39
- * `terramodel-7b-q4_k_m.gguf`
40
- * `terramodel-3b-q8_0.gguf`
41
- * `terramodel-3b-q4_k_m.gguf`
42
-
43
- ### Modelos em Alta Precisão (GPU)
44
- Para infraestruturas que contam com aceleração gráfica, os pesos fundidos (*merged*) originais estão disponíveis nas seguintes pastas:
45
- * 📁 `terramodel-7b-bf16/`
46
- * 📁 `terramodel-3b-bf16/`
 
 
 
 
 
 
47
 
48
  ## 💻 Como Utilizar (Inferência Local em Python via CPU)
49
 
 
31
  - **Domínio:** Geoespacial, PostGIS, Monitoramento Ambiental (Amazônia)
32
  - **Idioma Principal:** Português (PT-BR) / SQL
33
 
34
+ ## 📂 Arquivos do Repositório: Qual versão baixar?
35
+
36
+ ### 1. Modelos Quantizados (CPU-Only)
37
+ Para ambientes restritos a processadores centrais, oferecemos formatos GGUF. Escolha a versão de acordo com a disponibilidade de memória RAM do seu servidor:
38
+
39
+ **Versões Q4 (INT4)**
40
+ Ideais para restrição severa de memória, oferecendo maior velocidade de geração (menor latência):
41
+ * `terramodel-7b-q4_k_m.gguf`: Requer **~4.68 GB** de RAM.
42
+ * `terramodel-3b-q4_k_m.gguf`: Requer apenas **~1.93 GB** de RAM (Versão mais leve, viável em praticamente qualquer dispositivo).
43
+
44
+ **Versões Q8 (INT8)**
45
+ Recomendadas se você possui maior folga na memória RAM e deseja priorizar a acurácia máxima e a integridade sintática nas consultas geradas:
46
+ * `terramodel-7b-q8_0.gguf`: Requer **~8.10 GB** de RAM (Melhor equilíbrio de desempenho empírico no benchmark).
47
+ * `terramodel-3b-q8_0.gguf`: Requer **~3.29 GB** de RAM.
48
+
49
+ ### 2. Modelos em Alta Precisão (GPU)
50
+ Para infraestruturas que contam com aceleração gráfica, os pesos fundidos (*merged*) originais estão disponíveis nas seguintes pastas. O carregamento direto em VRAM (FP16) reflete o tamanho integral dos tensores:
51
+ * 📁 `terramodel-7b-bf16/` (Requer **~15.2 GB** de VRAM dedicada)
52
+ * 📁 `terramodel-3b-bf16/` (Requer **~6.18 GB** de VRAM dedicada)
53
 
54
  ## 💻 Como Utilizar (Inferência Local em Python via CPU)
55