Content-Based Filtering
Las recomendaciones se construyen a partir de las características y metadatos de cada película, sin depender del comportamiento de otros usuarios.

DevPass
TECHNOLOGY · DEVELOPMENT · AI
BUILD · LEARN · DOCUMENT
Sistema de recomendación de películas basado en contenido que utiliza procesamiento de lenguaje natural, ingeniería de características y similitud matemática para encontrar películas relacionadas.
Metadata
director · cast · keywords
TF-IDF
text → vectors
Cosine
similarity score
Las plataformas de streaming ofrecen enormes cantidades de contenido, lo que puede generar una sobrecarga de información y dificultar la elección de una película.
Este proyecto aborda el problema mediante un sistema de recomendación basado en contenido, capaz de encontrar películas similares a partir de sus propios metadatos.
Al no depender de las preferencias históricas de otros usuarios, el enfoque también permite afrontar el problema conocido como Cold Start.
Procesamiento de lenguaje
Vectorización textual
Similitud matemática
Las recomendaciones se construyen a partir de las características y metadatos de cada película, sin depender del comportamiento de otros usuarios.
Director, elenco y keywords reciben una ponderación estratégica para construir una representación más completa de cada película.
Los atributos textuales son transformados en vectores para identificar términos relevantes dentro del conjunto de películas.
La similitud matemática entre películas permite ordenar los títulos más cercanos a la película consultada.
El pipeline contempla limpieza, transformación y procesamiento de datos provenientes de diferentes datasets.
El modelo no necesita historial de otros usuarios para comenzar a generar recomendaciones.
El proyecto combina diferentes atributos de cada película para construir una representación textual utilizada por el modelo.
La dirección se pondera para capturar parte de la firma autoral.
El elenco contribuye a identificar patrones compartidos entre películas.
Las palabras clave ayudan a representar temas y características.
El procesamiento sigue un flujo de transformación de datos hasta obtener el modelo de similitud utilizado durante la inferencia.
movies_metadata.csv · credits.csv · keywords.csv
Normalización y tratamiento de datos faltantes.
Construcción de la representación Metadata Soup.
Vectorización de los atributos textuales.
Cálculo de similitud mediante Cosine Similarity.
Ordenamiento de las películas más similares.
La documentación especifica tres datasets necesarios para ejecutar el pipeline completo del proyecto.
movies_metadata.csv
Información general de películas
credits.csv
Directores y elenco
keywords.csv
Palabras clave asociadas
El modelo serializado puede ser cargado posteriormente para realizar recomendaciones a partir del título de una película.
recomendar("The Dark Knight")
Después del procesamiento, el proyecto genera archivos serializados que permiten reutilizar el modelo y los datos preparados.
Lenguaje principal utilizado para el procesamiento de datos y construcción del algoritmo.
Manipulación, limpieza y transformación de los datasets utilizados por el proyecto.
Operaciones numéricas y vectoriales necesarias para el procesamiento.
Implementación de TF-IDF y cálculo de similitud del coseno.
Serialización de los modelos y estructuras generadas durante el pipeline.
Arquitectura de despliegue en la nube planteada en la documentación del proyecto.
La documentación del proyecto utiliza scriptmaestro.py como punto de ejecución del pipeline de limpieza, entrenamiento y validación.
Algoritmo-de-Recomendacion-Peliculas-/
│
├── README.md
├── requirements.txt
├── scriptmaestro.py
│
├── cosine_sim_model.pkl
├── movie_data.pkl
├── indices.pkl
│
└── data/
├── movies_metadata.csv
├── credits.csv
└── keywords.csvEl proyecto demuestra cómo técnicas de procesamiento de lenguaje natural y machine learning pueden utilizarse para construir un sistema de recomendación basado en contenido.
Desde la limpieza de datasets hasta la vectorización mediante TF-IDF y el cálculo de similitud del coseno, el pipeline transforma información textual en una estructura capaz de encontrar películas relacionadas.
Un proyecto centrado en transformar datos y metadatos en recomendaciones personalizadas.
Revisa la implementación y documentación completa del algoritmo en GitHub.