Data SEO Academy

TF-IDF y BM25: Guía completa para SEO y Google AI Mode

En el dinámico mundo del

TF-IDF y BM25: Guía completa para SEO y Google AI Mode

En el dinámico mundo del SEO, comprender cómo los motores de búsqueda interpretan y clasifican el contenido es fundamental. Aunque los algoritmos de Google son cada vez más sofisticados, incorporando complejos modelos de inteligencia artificial, los principios fundamentales de la recuperación de información siguen siendo relevantes. Dos de estos algoritmos clásicos, TF-IDF y BM25, han sentado las bases para muchos sistemas de búsqueda y, aunque no sean los únicos factores hoy en día, entender su funcionamiento nos ayuda a crear contenido más relevante y optimizado. Esta guía te llevará a través de qué son, cómo funcionan, sus diferencias, ventajas, desventajas y, crucialmente, cómo se relacionan con las nuevas tendencias de IA en Google.

Introducción a los algoritmos de recuperación de información

La Recuperación de Información (RI) es un campo de la informática que se ocupa de la búsqueda de información dentro de documentos, de la búsqueda de los propios documentos, y también de la búsqueda de metadatos que describan documentos, así como de la búsqueda en bases de datos, ya sean textuales, de imágenes o de cualquier otro tipo. En el contexto del SEO, los algoritmos de RI son los mecanismos que utilizan los motores de búsqueda para encontrar y clasificar las páginas más relevantes para una consulta de usuario determinada.

El objetivo principal es cerrar la brecha entre la intención de búsqueda del usuario y los documentos disponibles en la vasta web. Para lograrlo, estos algoritmos analizan tanto la consulta como los documentos, utilizando diversas técnicas para determinar la relevancia. TF-IDF y BM25 son dos de los algoritmos más conocidos que abordan este desafío calculando la “importancia” de las palabras clave dentro de los documentos y en relación con una colección completa de documentos.

Definición y funcionamiento de TF-IDF

TF-IDF son las siglas de “Term Frequency-Inverse Document Frequency” (Frecuencia de Término-Frecuencia Inversa de Documento). Es una medida numérica que tiene como objetivo reflejar la importancia de una palabra en un documento en relación con una colección de documentos (corpus).

Frecuencia de Término (TF - Term Frequency): Mide la frecuencia con la que un término aparece en un documento específico. La idea es que cuanto más a menudo aparece un término en un documento, más importante es ese término para dicho documento. Existen varias formas de calcular el TF, siendo la más simple la cuenta bruta del término. La fórmula básica es: TF(t,d)=(Nuˊmero de veces que el teˊrmino t aparece en el documento d)/(Nuˊmero total de teˊrminos en el documento d)

Frecuencia Inversa de Documento (IDF - Inverse Document Frequency): Mide la importancia general de un término en todo el corpus. Se basa en la idea de que los términos que aparecen en muchos documentos son menos significativos que aquellos que aparecen en pocos. Por ejemplo, palabras como “el”, “la”, “de” (stop words) aparecerán en casi todos los documentos y, por lo tanto, tendrán un IDF bajo, lo que disminuye su peso. La fórmula común es: IDF(t,D)=log((Nuˊmero total de documentos en el corpus D)/(Nuˊmero de documentos que contienen el teˊrmino t)+1) Se suma 1 al denominador para evitar la división por cero si un término no está en ningún documento (aunque esto es raro en la práctica si el término proviene del corpus).

Puntuación TF-IDF: El valor TF-IDF de un término en un documento se calcula multiplicando su TF por su IDF: TFIDF(t,d,D)=TF(t,d)×IDF(t,D) Un TF-IDF alto se obtiene cuando un término tiene una alta frecuencia en un documento específico (alto TF) y una baja frecuencia en el conjunto general de documentos (alto IDF). Esto resalta términos que son distintivos y característicos de un documento en particular.

Definición y funcionamiento de BM25

Okapi BM25 (Best Match 25) es un algoritmo de ranking que se utiliza en los motores de búsqueda para estimar la relevancia de los documentos para una consulta dada. Es un algoritmo probabilístico que se basa en el modelo de independencia binaria y representa una evolución y mejora sobre TF-IDF. BM25 introduce dos parámetros principales de ajuste y una forma más sofisticada de manejar la frecuencia de términos y la longitud del documento.

El funcionamiento de BM25 se basa en puntuar cada documento para una consulta dada. La puntuación generalmente se calcula sumando las contribuciones de cada término de la consulta: Score(D,Q)=∑i=1nIDF(qi)⋅f(qi,D)+k1⋅(1−b+b⋅avgdl∣D∣)f(qi,D)⋅(k1+1) Donde:

  • qi es el i-ésimo término de la consulta Q.
  • f(qi,D) es la frecuencia del término qi en el documento D.
  • ∣D∣ es la longitud del documento D (número de palabras).
  • avgdl es la longitud promedio de los documentos en la colección.
  • k1 es un parámetro de sintonización (típicamente entre 1.2 y 2.0). Controla la rapidez con la que la contribución de un término se satura. Un k1 bajo significa que la puntuación se satura rápidamente con el aumento de la frecuencia del término.
  • b es otro parámetro de sintonización (típicamente alrededor de 0.75). Controla el impacto de la longitud del documento en la puntuación. Cuando b es 1, la normalización de la longitud del documento es completa; cuando es 0, no hay normalización por longitud.
  • IDF(qi) es la Frecuencia Inversa de Documento del término qi, calculada de forma similar a TF-IDF, aunque existen variaciones en su fórmula específica en el contexto de BM25. Una común es: IDF(qi)=log(n(qi)+0.5N−n(qi)+0.5+1), donde N es el número total de documentos en la colección y n(qi) es el número de documentos que contienen qi.

BM25 mejora a TF-IDF principalmente porque no asume que la relevancia de un término aumenta linealmente con su frecuencia (TF). En cambio, la contribución de la frecuencia del término se satura, lo que significa que después de cierto punto, más apariciones de una palabra no aumentan significativamente la puntuación. Además, su normalización de la longitud del documento es más matizada.

TF-IDF y BM25: ¿Cuál es la diferencia?

Aunque ambos algoritmos buscan determinar la relevancia de un documento para una consulta basándose en los términos que contienen, existen diferencias cruciales en su enfoque y efectividad. Entender estas diferencias es vital para apreciar por qué BM25 es generalmente considerado superior en muchos escenarios de recuperación de información.

Comparativa detallada de TF-IDF y BM25

Aquí desglosamos las diferencias clave:

  1. Modelo Teórico:

    • TF-IDF: Es un modelo heurístico basado en vectores espaciales. No tiene una base probabilística sólida, sino que se basa en la intuición de que los términos frecuentes en un documento pero raros en el corpus son importantes.
    • BM25: Es un modelo probabilístico. Se deriva del modelo de probabilidad de relevancia, intentando estimar la probabilidad de que un documento sea relevante para una consulta.
  2. Manejo de la Frecuencia de Términos (TF):

    • TF-IDF: La puntuación TF generalmente aumenta linealmente con la frecuencia del término. Esto puede llevar a que documentos que “abusan” de una palabra clave (keyword stuffing) obtengan puntuaciones artificialmente altas.
    • BM25: Incorpora un componente de saturación para la frecuencia del término (controlado por k1). Esto significa que después de un cierto número de apariciones, la contribución adicional de ese término a la relevancia del documento disminuye. Esto se alinea mejor con cómo los humanos perciben la relevancia: unas pocas menciones son importantes, pero muchísimas no necesariamente hacen que el documento sea exponencialmente más relevante.
  3. Normalización de la Longitud del Documento:

    • TF-IDF: La normalización de la longitud del documento en TF-IDF (si se aplica, como en la normalización coseno) puede ser menos efectiva. Los documentos más largos tienden a tener puntuaciones TF-IDF más altas simplemente porque tienen más palabras y, por lo tanto, más oportunidades para que aparezcan términos.
    • BM25: Tiene un componente de normalización de longitud más sofisticado (controlado por b). Compara la longitud de un documento con la longitud promedio de los documentos en la colección. Esto ayuda a evitar que los documentos muy largos o muy cortos tengan una ventaja o desventaja injusta.
  4. Parámetros:

    • TF-IDF: No tiene parámetros intrínsecos que se puedan ajustar fácilmente, aunque las variantes en el cálculo de TF e IDF pueden considerarse formas de ajuste.
    • BM25: Tiene dos parámetros principales, k1 y b, que pueden ser sintonizados para optimizar el rendimiento en una colección de documentos específica o para un tipo particular de consulta. Esto le da mayor flexibilidad.
  5. Efectividad General:

    • TF-IDF: Es un buen punto de partida y puede ser efectivo para tareas simples o como una característica en modelos más complejos.
    • BM25: Generalmente supera a TF-IDF en términos de efectividad de ranking en la mayoría de las colecciones de documentos estándar y tareas de recuperación de información, especialmente para colecciones grandes como la web.

Ventajas y desventajas de cada algoritmo

Tanto TF-IDF como BM25 tienen sus fortalezas y debilidades, lo que los hace más o menos adecuados según el contexto de aplicación.

TF-IDF:

  • Ventajas:

    • Simplicidad: Es conceptualmente simple de entender e implementar.
    • Costo Computacional: Generalmente es menos costoso computacionalmente que BM25, especialmente si no se requiere ajuste fino.
    • Buen Baseline: Proporciona un sólido punto de partida para sistemas de recuperación de información y puede ser una característica útil en modelos de aprendizaje automático más complejos.
    • Intuitivo: La idea de que las palabras raras y frecuentes localmente son importantes es fácil de comprender.
  • Desventajas:

    • Linealidad de TF: No maneja bien la saturación de la frecuencia de términos; demasiadas menciones de una palabra pueden inflar artificialmente la relevancia.
    • Normalización de Longitud Rudimentaria: Los documentos más largos pueden ser favorecidos injustamente.
    • Ignora la Semántica y el Orden de las Palabras: Como BM25, es un modelo “bag-of-words”, lo que significa que no considera el significado de las palabras (sinónimos, contexto) ni el orden en que aparecen.
    • Sensible a Stop Words: Requiere una buena lista de stop words para ser efectivo, aunque el componente IDF ayuda a mitigar esto.

BM25:

  • Ventajas:

    • Mejor Rendimiento: Generalmente ofrece resultados de ranking más precisos que TF-IDF en la mayoría de las colecciones de prueba estándar.
    • Saturación de TF: El parámetro k1 modela la saturación de la frecuencia de términos, lo cual es más realista.
    • Normalización de Longitud Avanzada: El parámetro b permite una normalización más efectiva y adaptable de la longitud del documento.
    • Base Probabilística: Su fundamento teórico es más sólido.
    • Ajustable: Los parámetros k1 y b pueden optimizarse para conjuntos de datos específicos, lo que puede llevar a mejoras significativas en el rendimiento.
  • Desventajas:

    • Complejidad: Es más complejo de entender e implementar que TF-IDF.
    • Ajuste de Parámetros: Encontrar los valores óptimos para k1 y b puede requerir experimentación y conjuntos de datos de validación, lo que puede ser un proceso intensivo.
    • Sigue Siendo “Bag-of-Words”: Al igual que TF-IDF, BM25 no comprende la semántica del lenguaje natural, las relaciones entre palabras (sinónimos, antónimos), ni la intención del usuario más allá de las palabras clave explícitas.
    • Costo Computacional: Puede ser ligeramente más costoso computacionalmente debido a sus cálculos más complejos, especialmente si se incluye el ajuste de parámetros.

Aplicaciones prácticas de TF-IDF y BM25

A pesar de la llegada de modelos más avanzados, TF-IDF y BM25 todavía encuentran aplicaciones prácticas, especialmente en SEO y áreas relacionadas donde la relevancia del texto es clave.

Ejemplos prácticos de uso de TF-IDF y BM25

  1. Optimización de Contenido (Análisis On-Page):

    • TF-IDF: Los especialistas en SEO pueden usar herramientas basadas en TF-IDF para analizar las páginas mejor clasificadas para una palabra clave objetivo. Esto ayuda a identificar términos y frases semánticamente relacionados que estas páginas utilizan con frecuencia, pero que podrían faltar en su propio contenido. No se trata de “keyword stuffing”, sino de asegurar una cobertura temática completa y natural.
    • BM25: Aunque menos común en herramientas SEO listas para usar para el análisis de contenido individual, los principios de BM25 (como la saturación de términos) refuerzan la idea de que la repetición excesiva de palabras clave no es beneficiosa y que la naturalidad es clave.
  2. Análisis de la Competencia:

    • Se pueden aplicar estos algoritmos para comparar la “firma léxica” de tu contenido con la de tus competidores. Identificar qué términos ponderan alto en sus páginas puede revelar ángulos temáticos o nichos de palabras clave que podrías haber pasado por alto.
  3. Búsqueda Interna en Sitios Web:

    • Muchos sistemas de búsqueda interna en sitios web (especialmente en sitios grandes con mucho contenido como e-commerce o portales de noticias) pueden utilizar BM25 o TF-IDF para potenciar sus resultados. BM25, por su superioridad, es a menudo la elección preferida si la implementación es posible, ofreciendo resultados más relevantes a los usuarios que navegan por el sitio.
  4. Identificación de Contenido Duplicado o Similar:

    • Al convertir documentos en vectores TF-IDF, se pueden usar medidas de similitud (como la similitud del coseno) para encontrar documentos muy parecidos, lo que ayuda a identificar posibles problemas de contenido duplicado o canibalización de palabras clave.
  5. Sistemas de Recomendación de Contenido:

    • En niveles básicos, si un usuario lee un artículo, se pueden recomendar otros artículos con perfiles TF-IDF similares, asumiendo que cubren temas relacionados.
  6. Clasificación de Documentos y Agrupamiento (Clustering):

    • Las puntuaciones TF-IDF pueden servir como características de entrada para algoritmos de aprendizaje automático que clasifican documentos en categorías predefinidas o los agrupan según su similitud temática.
  7. Investigación de Palabras Clave:

    • Analizar el corpus de documentos relevantes para un tema mediante TF-IDF puede ayudar a descubrir palabras clave de cola larga o términos especializados que son importantes dentro de ese nicho específico.

La evolución de la recuperación de información: De TF-IDF/BM25 a los modelos de IA de Google

Google ha recorrido un largo camino desde sus inicios. Si bien los principios de TF-IDF y BM25 fueron fundamentales en las primeras etapas de los motores de búsqueda para determinar la relevancia basada en palabras clave, el panorama actual, especialmente con la introducción de la Experiencia Generativa de Búsqueda (SGE) y otros modelos de IA, es mucho más complejo.

El legado de TF-IDF y BM25 en la era de la IA y Google SGE

Los modelos modernos de Google, como BERT, MUM, RankBrain y los que impulsan SGE, se basan en redes neuronales y aprendizaje profundo, específicamente en arquitecturas como los Transformers. Estos modelos van mucho más allá del simple conteo de palabras clave.

Sin embargo, esto no significa que TF-IDF y BM25 sean completamente obsoletos en el ecosistema de Google:

  1. Principios Fundamentales Persisten: Los conceptos básicos que TF-IDF y BM25 intentan capturar –la importancia de un término en un documento (TF), la rareza o especificidad de un término en una colección (IDF), y la normalización por la longitud del documento– siguen siendo intuitivamente importantes. Los modelos de IA modernos aprenden estas relaciones de formas mucho más sofisticadas y contextuales a través de embeddings de palabras y mecanismos de atención, pero la idea subyacente de “qué hace que un término sea importante” resuena.
  2. Posible Uso en Sistemas Híbridos o Etapas Iniciales: En sistemas de búsqueda a gran escala, es plausible que algoritmos más simples como BM25 puedan usarse para una primera pasada de “recuperación de candidatos”. Es decir, de millones de documentos, se selecciona un conjunto más pequeño de candidatos potencialmente relevantes, y luego modelos de IA más costosos computacionalmente realizan un ranking más fino sobre este conjunto reducido.
  3. Comprensión para SEOs: Para los profesionales del SEO, entender TF-IDF y BM25 sigue siendo útil. Ayuda a interiorizar por qué la elección de palabras, la densidad (razonable) de palabras clave relevantes y la cobertura temática son importantes. Aunque no se optimice directamente para TF-IDF, pensar en estos términos puede guiar hacia la creación de contenido naturalmente rico y relevante.

Limitaciones de TF-IDF/BM25 frente a los modelos neuronales de Google

Las limitaciones de TF-IDF y BM25 se vuelven evidentes cuando se comparan con las capacidades de los modelos de IA modernos de Google:

  1. Comprensión Semántica Nula: TF-IDF y BM25 son modelos “bag-of-words”. No entienden el significado de las palabras, los sinónimos, el contexto, el sarcasmo, o la intención real del usuario. Para ellos, “coche rápido” y “rápido coche” son similares, pero “automóvil veloz” es completamente diferente si no comparten palabras.
  2. Intención del Usuario: No pueden discernir la intención matizada detrás de una consulta. Por ejemplo, “Java” podría referirse al lenguaje de programación, la isla o el café. Los modelos de IA usan el contexto de la consulta y el historial del usuario para desambiguar.
  3. Consultas Conversacionales y de Lenguaje Natural: Los usuarios buscan cada vez más usando frases completas y preguntas naturales. TF-IDF/BM25 no están diseñados para manejar bien estas consultas complejas.
  4. Calidad y Autoridad del Contenido (E-E-A-T): Factores cruciales como la Experiencia, Pericia, Autoridad y Fiabilidad (E-E-A-T) no son medibles por estos algoritmos basados en palabras clave.

Cómo los nuevos modelos de IA de Google (SGE) mejoran la relevancia

Los modelos de IA de Google, como los que impulsan la Experiencia Generativa de Búsqueda (SGE), superan a los algoritmos clásicos de las siguientes maneras:

  1. Comprensión Profunda del Lenguaje (NLU): Utilizan embeddings de palabras y modelos Transformer (como BERT o MUM) para entender el significado de las palabras en su contexto, capturando relaciones semánticas, sinónimos y matices.
  2. Enfoque en la Intención: Se centran en comprender la intención detrás de la consulta del usuario, no solo las palabras clave utilizadas. Esto permite ofrecer resultados más relevantes incluso si las palabras exactas no están en el documento.
  3. Generación de Respuestas Directas: SGE puede sintetizar información de múltiples fuentes para proporcionar una respuesta directa y conversacional en la parte superior de los resultados de búsqueda, en lugar de solo una lista de enlaces.
  4. Manejo de Consultas Complejas: Pueden descomponer consultas multifacéticas y encontrar información que satisfaga todas las partes de la pregunta.
  5. Consideración de E-E-A-T: Aunque no directamente a través del análisis textual de estos algoritmos, las señales de E-E-A-T se integran en el sistema de ranking general para priorizar contenido de alta calidad y fiable.
  6. Multimodalidad: Los modelos más recientes pueden procesar y relacionar información de diferentes formatos (texto, imágenes, video), algo impensable para TF-IDF o BM25.

Para el SEO en la era de la IA de Google, esto significa que si bien la relevancia del contenido a nivel de palabra clave sigue siendo un factor (la gente busca con palabras), el enfoque debe ampliarse para incluir la creación de contenido que satisfaga integralmente la intención del usuario, demuestre E-E-A-T y esté escrito en lenguaje natural y de alta calidad.

¿Siguen siendo relevantes TF-IDF y BM25 para el SEO en 2025?

Sí, pero su relevancia ha cambiado de ser predictores directos del ranking a herramientas conceptuales y diagnósticas. En 2025, con la IA de Google (incluyendo SGE y sus sucesores) firmemente establecida, es ingenuo pensar que optimizar para puntuaciones TF-IDF o BM25 catapultará tu sitio a la cima de las SERPs. Google utiliza sistemas mucho más avanzados.

Sin embargo, su relevancia persiste de las siguientes maneras:

  1. Comprensión Fundacional: Ayudan a los SEOs a entender los principios básicos de la relevancia textual. Saber que la frecuencia de un término y su unicidad en un contexto más amplio importan sigue siendo una buena base.
  2. Herramientas de Análisis de Contenido: Las herramientas SEO que usan TF-IDF (o similares) para el análisis de contenido pueden seguir siendo útiles para identificar brechas temáticas en comparación con los competidores mejor clasificados. Te ayudan a asegurar que cubres un tema de manera exhaustiva desde una perspectiva léxica.
  3. Optimización de Búsqueda Interna: Para la búsqueda interna de un sitio web, BM25 sigue siendo una opción muy robusta y eficaz, especialmente si implementar soluciones de IA más complejas es inviable.
  4. Evitar la Sobreoptimización: Comprender la saturación de términos en BM25 refuerza el consejo de evitar el “keyword stuffing”. La naturalidad y la calidad del contenido son primordiales.
  5. Contextualizar las Estrategias de IA: Conocer las limitaciones de estos algoritmos más antiguos ayuda a apreciar por qué las estrategias de SEO deben evolucionar hacia la creación de contenido de alta calidad, centrado en la intención del usuario y que demuestre E-E-A-T, que son aspectos que los modelos de IA de Google sí pueden evaluar mejor.

En resumen, no debes obsesionarte con las puntuaciones TF-IDF o BM25 como un objetivo final para el ranking en Google. En su lugar, utilízalos como herramientas diagnósticas y para reforzar tu comprensión de la relevancia textual, mientras centras tus esfuerzos principales en las directrices de calidad de Google y en satisfacer la intención del usuario en la era de la IA.

TF-IDF/BM25 vs. AI Mode de Google: ¿Sobreviven los clásicos en la era de las AI Overviews?

El “AI Mode” de Google, manifestado principalmente a través de funcionalidades como las AI Overviews, representa un cambio de paradigma desde la búsqueda tradicional basada en la recuperación de documentos hacia la generación de respuestas directas y la síntesis de información. Estos sistemas de IA no se basan primordialmente en algoritmos como TF-IDF o BM25 para su funcionamiento central. En lugar de simplemente ponderar palabras clave, las AI Overviews utilizan modelos de lenguaje grandes (LLMs) para comprender la semántica profunda de la consulta del usuario y el contenido de las páginas web.

La supervivencia de TF-IDF y BM25 en este nuevo contexto no radica en su capacidad para influir directamente en cómo una AI Overview genera su respuesta. Más bien, su relevancia es indirecta y conceptual. Los principios de identificar términos importantes (TF) y términos distintivos (IDF) pueden ayudar a los creadores de contenido a estructurar textos que sean claros y temáticamente enfocados. Un contenido bien organizado y rico en información relevante (principios que estos algoritmos intentan cuantificar) puede ser una mejor fuente para que los LLMs de Google extraigan y sinteticen información precisa para las AI Overviews. Sin embargo, la optimización directa para puntuaciones TF-IDF/BM25 tiene un impacto mínimo o nulo en ser destacado o referenciado por una AI Overview, ya que estas últimas priorizan la comprensión contextual, la fiabilidad de la fuente (E-E-A-T) y la capacidad de responder integralmente a la intención del usuario. Los algoritmos clásicos pueden, en el mejor de los casos, servir como una herramienta de diagnóstico muy básica para la riqueza léxica, pero no como una palanca de optimización para el “AI Mode”.

Implicaciones del AI Mode de Google para la optimización de contenido más allá de TF-IDF y BM25

La llegada del “AI Mode” de Google, con sus AI Overviews y una comprensión del lenguaje cada vez más humana, obliga a los profesionales del SEO a mirar mucho más allá de las métricas tradicionales de palabras clave como TF-IDF y BM25. Si antes estos algoritmos ofrecían una aproximación a la relevancia textual, hoy la IA de Google evalúa el contenido de manera holística.

Las implicaciones para la optimización de contenido son profundas:

  1. Priorizar la Intención y la Profundidad Semántica: En lugar de enfocarse en la frecuencia de términos específicos, el objetivo es cubrir exhaustivamente la intención detrás de la consulta del usuario. Esto implica comprender las preguntas subyacentes, los diferentes ángulos de un tema y proporcionar respuestas completas y bien sustentadas.
  2. E-E-A-T como Fundamento: La Experiencia, Pericia, Autoridad y Fiabilidad (E-E-A-T) son más cruciales que nunca. El “AI Mode” busca fuentes confiables y autorizadas. El contenido debe reflejar un conocimiento profundo y estar respaldado por evidencia o experiencia demostrable.
  3. Lenguaje Natural y Estructura Clara: Escribir en un lenguaje natural, claro y conversacional facilita que los LLMs procesen y comprendan el contenido. Una buena estructura (encabezados, listas, párrafos concisos) también ayuda a la IA a desglosar y sintetizar la información para las AI Overviews.
  4. Originalidad y Valor Añadido: El contenido que simplemente repite lo que ya existe tiene menos probabilidades de destacar. El “AI Mode” valora la información original, las perspectivas únicas y el valor añadido que un contenido aporta al ecosistema de información existente.
  5. Datos Estructurados: Implementar datos estructurados (Schema.org) puede ayudar a Google a comprender mejor el contexto de tu contenido y los hechos clave, lo que podría ser beneficioso para cómo la IA utiliza tu información.

En esencia, mientras TF-IDF y BM25 se centraban en “qué” palabras se usan, el “AI Mode” de Google se centra en “cómo” se usa el lenguaje para transmitir significado, satisfacer la intención y demostrar credibilidad. La optimización, por tanto, se desplaza hacia la calidad integral y la utilidad del contenido para el usuario final, interpretado a través de la lente sofisticada de la IA.

Cómo implementar TF-IDF y BM25 en Python

Para aquellos interesados en experimentar con estos algoritmos, Python ofrece bibliotecas excelentes que facilitan su implementación.

TF-IDF con scikit-learn: La biblioteca scikit-learn es un pilar en el aprendizaje automático en Python y tiene una implementación muy eficiente de TF-IDF.

from sklearn.feature_extraction.text import TfidfVectorizer

# Ejemplo de corpus de documentos
corpus = [
    "Este es el primer documento.",
    "Este documento es el segundo documento.",
    "Y este es el tercero. Uno es diferente.",
    "¿Es este el primer documento?",
]

vectorizer = TfidfVectorizer()
tfidf_matrix = vectorizer.fit_transform(corpus)

# Para ver los términos (palabras) que ha identificado
print("Nombres de las características (palabras):")
print(vectorizer.get_feature_names_out())

# Para ver la matriz TF-IDF (dispersa por defecto)
print("\nMatriz TF-IDF:")
print(tfidf_matrix.toarray())

# Para obtener el TF-IDF de un documento específico para un término específico
# (necesitarías mapear el término al índice correcto en get_feature_names_out())

Este código primero crea un TfidfVectorizer y luego lo ajusta (fit) a tu corpus de documentos y lo transforma (transform) en una matriz TF-IDF. Cada fila de la matriz representa un documento y cada columna representa un término único del corpus. Los valores de la matriz son las puntuaciones TF-IDF.

BM25 con rank_bm25: No existe una implementación de BM25 directamente en scikit-learn, pero hay bibliotecas de terceros muy buenas como rank_bm25. Primero, necesitarás instalarla: pip install rank-bm25

from rank_bm25 import BM25Okapi

# Ejemplo de corpus de documentos (tokenizados)
corpus_tokenizado = [
    doc.lower().split() for doc in [
        "Este es el primer documento.",
        "Este documento es el segundo documento.",
        "Y este es el tercero. Uno es diferente.",
        "¿Es este el primer documento?",
    ]
]

bm25 = BM25Okapi(corpus_tokenizado)

# Ejemplo de consulta (tokenizada)
query = "primer documento"
tokenized_query = query.lower().split()

# Obtener las puntuaciones de los documentos para la consulta
doc_scores = bm25.get_scores(tokenized_query)

print(f"Puntuaciones BM25 para la consulta '{query}':")
print(doc_scores)

# Para obtener los N mejores documentos para la consulta
# top_n_docs = bm25.get_top_n(tokenized_query, corpus, n=2)
# print("\nMejores 2 documentos:")
# for doc in top_n_docs:
# print(doc)

En este ejemplo, primero tokenizamos el corpus (dividimos cada documento en una lista de palabras). Luego, creamos una instancia de BM25Okapi con este corpus tokenizado. Finalmente, podemos obtener las puntuaciones de relevancia para una nueva consulta tokenizada. Los parámetros k1​ y b pueden ajustarse al crear la instancia de BM25Okapi (por ejemplo, BM25Okapi(corpus_tokenizado, k1=1.5, b=0.75)).

Estos ejemplos proporcionan un punto de partida básico. En aplicaciones reales, probablemente querrás añadir pasos de preprocesamiento de texto más sofisticados (eliminación de stop words, stemming/lematización, manejo de puntuación, etc.) antes de aplicar TF-IDF o BM25.