Andersoncrs commited on
Commit
332b6bb
·
verified ·
1 Parent(s): d55f337

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +4 -4
README.md CHANGED
@@ -24,12 +24,12 @@ El conjunto de datos utilizado para llevar a cabo el entrenamiento del modelo ha
24
  El modelo está compuesto por dos pasos principales:
25
 
26
  * **TF-IDF (Term Frequency-Inverse Document Frequency):** Primero se tokeniza cada palabra de cada mensaje SMS para, posteriormente, vectorizarla de acuerdo con el método TF-IDF. Este método consiste en asignar una puntuación a las palabras presentes en un texto con base en su frecuencia (número de veces que aparecen) dentro de un documento individual y dentro del corpus completo.
27
- * La Frecuencia del Término (TF) está dada por la siguiente fórmula:
28
- $$TF(t, d) = \frac{f(t, d)}{\sum_{t' \in d} f(t', d)}$$
29
  Dado que en el caso de este modelo hemos utilizado la instrucción tfidf\_\_sublinear\_tf=True, se atenúa la influencia de la aparición desmedida de determinados términos mediante el siguiente ajuste logarítmico:
30
- $$TF(t, d) = 1 + \log(f(t, d)) \quad \text{si } f(t, d) > 0$$
31
  * Respecto a la Frecuencia Inversa del Documento (IDF), se aplica la fórmula estándar implementada en Scikit-Learn:
32
- $$IDF_{\text{Scikit-Learn}}(t) = \log\left(\frac{1 + N}{1 + df(t)}\right) + 1$$
33
 
34
  Finalmente, obtenemos la puntuación definitiva multiplicando ambos términos:
35
  $$TF\text{-}IDF(t, d) = TF(t, d) \times IDF(t)$$
 
24
  El modelo está compuesto por dos pasos principales:
25
 
26
  * **TF-IDF (Term Frequency-Inverse Document Frequency):** Primero se tokeniza cada palabra de cada mensaje SMS para, posteriormente, vectorizarla de acuerdo con el método TF-IDF. Este método consiste en asignar una puntuación a las palabras presentes en un texto con base en su frecuencia (número de veces que aparecen) dentro de un documento individual y dentro del corpus completo.
27
+ * La Frecuencia del Término (TF) está dada por la siguiente fórmula:
28
+ $$TF(t, d) = \frac{f(t, d)}{\sum_{t' \in d} f(t', d)}$$
29
  Dado que en el caso de este modelo hemos utilizado la instrucción tfidf\_\_sublinear\_tf=True, se atenúa la influencia de la aparición desmedida de determinados términos mediante el siguiente ajuste logarítmico:
30
+ $$TF(t, d) = 1 + \log(f(t, d)) \quad \text{si } f(t, d) > 0$$
31
  * Respecto a la Frecuencia Inversa del Documento (IDF), se aplica la fórmula estándar implementada en Scikit-Learn:
32
+ $$IDF_{\text{Scikit-Learn}}(t) = \log\left(\frac{1 + N}{1 + df(t)}\right) + 1$$
33
 
34
  Finalmente, obtenemos la puntuación definitiva multiplicando ambos términos:
35
  $$TF\text{-}IDF(t, d) = TF(t, d) \times IDF(t)$$