Cuando trabajamos con texto, los algoritmos de machine learning necesitan una representación numérica. Una de las formas clásicas de conseguirlo es utilizar TF-IDF, una técnica que asigna un peso a cada término según su importancia dentro de una colección de documentos.
Una vez que los textos han sido convertidos en vectores, podemos utilizar la similitud coseno para comparar esas representaciones y determinar qué tan cercanas son.
¿Qué es TF-IDF?
TF-IDF significa Term Frequency – Inverse Document Frequency. Su objetivo es asignar un peso a cada palabra considerando dos aspectos: cuánto aparece dentro de un documento y qué tan común es dentro de toda la colección.
Una palabra que aparece muchas veces en un documento puede ser importante para ese documento, mientras que una palabra que aparece prácticamente en todos los documentos aporta menos información para diferenciarlos.
TF-IDF(t,d) = TF(t,d) × IDF(t)El peso final combina la frecuencia del término dentro del documento con su frecuencia inversa dentro de la colección.
Cómo se construye el peso
Frecuencia del término
TF mide qué tan frecuente aparece una palabra dentro de un documento.
Frecuencia inversa
IDF reduce el peso de palabras que aparecen en muchos documentos y destaca términos más específicos.
Peso TF-IDF
La combinación de ambas medidas permite representar cada término según su importancia relativa.
Una idea sencilla
Imaginemos una colección de documentos sobre películas. Términos como película, cine o historia pueden aparecer muchas veces. Otros términos más específicos pueden ayudar mucho más a distinguir un documento de otro.
menor capacidad de diferenciación
mayor capacidad de diferenciación
representación numérica
Del texto al vector
Después de calcular los pesos, cada documento puede representarse como un vector en un espacio numérico.
En una colección real existirían muchos más términos y, por lo tanto, los vectores tendrían muchas dimensiones. La representación numérica es la que permite aplicar operaciones matemáticas sobre el contenido textual.
¿Qué es la similitud coseno?
La similitud coseno compara dos vectores observando el ángulo entre ellos. En lugar de centrarse únicamente en la magnitud de los vectores, analiza su orientación.
cos(θ) = (A · B) / (||A|| × ||B||)El producto punto se divide entre el producto de las magnitudes de ambos vectores.
Vectores muy similares
Poca relación
Orientaciones opuestas
El flujo completo
La combinación de TF-IDF y similitud coseno puede utilizarse como un pipeline sencillo para comparar contenido.
Texto
Información original
Preprocesamiento
Limpieza y normalización
TF-IDF
Vectorización
Coseno
Comparación
Ranking
Resultados similares
¿Dónde puedo utilizarlo?
Sistemas de recomendación
Permite comparar la descripción o características de elementos para encontrar aquellos con contenido similar.
Búsqueda de documentos
Una consulta puede representarse de forma comparable a una colección de documentos.
Clasificación de texto
Los vectores generados pueden utilizarse como representación de entrada para diferentes modelos.
Análisis de contenido
Ayuda a identificar términos relevantes dentro de documentos y colecciones de texto.
Un ejemplo: recomendación de películas
En un sistema de recomendación basado en contenido, cada película puede representarse utilizando información textual como género, palabras clave, director o reparto. Esa información puede convertirse en vectores y posteriormente compararse.
Metadata
Vector
Similarity
Recommendation
Algunas consideraciones
TF-IDF trabaja con la importancia estadística de los términos.
El preprocesamiento puede modificar considerablemente los resultados.
La similitud coseno compara la orientación de los vectores.
Dos textos pueden ser similares aunque tengan diferente longitud.
El método funciona especialmente bien cuando las características textuales son importantes.
Convertir texto en información utilizable
TF-IDF permite transformar términos de un documento en pesos numéricos y la similitud coseno permite comparar las representaciones resultantes.
La combinación es sencilla, interpretable y puede ser suficiente para construir soluciones prácticas de búsqueda, análisis y recomendación basadas en contenido.
