Update README.md
Browse files
README.md
CHANGED
|
@@ -24,12 +24,12 @@ El conjunto de datos utilizado para llevar a cabo el entrenamiento del modelo ha
|
|
| 24 |
El modelo está compuesto por dos pasos principales:
|
| 25 |
|
| 26 |
* **TF-IDF (Term Frequency-Inverse Document Frequency):** Primero se tokeniza cada palabra de cada mensaje SMS para, posteriormente, vectorizarla de acuerdo con el método TF-IDF. Este método consiste en asignar una puntuación a las palabras presentes en un texto con base en su frecuencia (número de veces que aparecen) dentro de un documento individual y dentro del corpus completo.
|
| 27 |
-
* La Frecuencia del Término (TF) está dada por la siguiente fórmula:
|
| 28 |
-
|
| 29 |
Dado que en el caso de este modelo hemos utilizado la instrucción tfidf\_\_sublinear\_tf=True, se atenúa la influencia de la aparición desmedida de determinados términos mediante el siguiente ajuste logarítmico:
|
| 30 |
-
|
| 31 |
* Respecto a la Frecuencia Inversa del Documento (IDF), se aplica la fórmula estándar implementada en Scikit-Learn:
|
| 32 |
-
|
| 33 |
|
| 34 |
Finalmente, obtenemos la puntuación definitiva multiplicando ambos términos:
|
| 35 |
$$TF\text{-}IDF(t, d) = TF(t, d) \times IDF(t)$$
|
|
|
|
| 24 |
El modelo está compuesto por dos pasos principales:
|
| 25 |
|
| 26 |
* **TF-IDF (Term Frequency-Inverse Document Frequency):** Primero se tokeniza cada palabra de cada mensaje SMS para, posteriormente, vectorizarla de acuerdo con el método TF-IDF. Este método consiste en asignar una puntuación a las palabras presentes en un texto con base en su frecuencia (número de veces que aparecen) dentro de un documento individual y dentro del corpus completo.
|
| 27 |
+
* La Frecuencia del Término (TF) está dada por la siguiente fórmula:
|
| 28 |
+
$$TF(t, d) = \frac{f(t, d)}{\sum_{t' \in d} f(t', d)}$$
|
| 29 |
Dado que en el caso de este modelo hemos utilizado la instrucción tfidf\_\_sublinear\_tf=True, se atenúa la influencia de la aparición desmedida de determinados términos mediante el siguiente ajuste logarítmico:
|
| 30 |
+
$$TF(t, d) = 1 + \log(f(t, d)) \quad \text{si } f(t, d) > 0$$
|
| 31 |
* Respecto a la Frecuencia Inversa del Documento (IDF), se aplica la fórmula estándar implementada en Scikit-Learn:
|
| 32 |
+
$$IDF_{\text{Scikit-Learn}}(t) = \log\left(\frac{1 + N}{1 + df(t)}\right) + 1$$
|
| 33 |
|
| 34 |
Finalmente, obtenemos la puntuación definitiva multiplicando ambos términos:
|
| 35 |
$$TF\text{-}IDF(t, d) = TF(t, d) \times IDF(t)$$
|