Cloudflare le pone fecha límite a los bots de IA: por qué esto le importa a cualquier medio digital

Cloudflare le pone fecha límite a los bots de IA: por qué esto le importa a cualquier medio digital

14 de Agosto 2026 - 15:27

blog detail banner

El 15 de septiembre, Cloudflare bloqueará por defecto a los bots de entrenamiento de IA en millones de sitios. El problema: Googlebot combina búsqueda e IA en un solo rastreador, y una mala configuración puede sacar a cualquier medio de los resultados de Google.

El 15 de septiembre, Cloudflare cambia la forma en que trata por defecto a los crawlers de inteligencia artificial en millones de sitios web. La decisión suena técnica, pero en el fondo es una decisión de negocio que puede afectar el tráfico y los ingresos de cualquier editor que dependa de Google para gran parte de sus visitas.

Si tu medio usa Cloudflare —o incluso si no lo usa pero gestiona su propio robots.txt— vale la pena entender qué está cambiando.

El cambio, en corto

Cloudflare procesa cerca de una quinta parte de todo el tráfico web mundial, lo que le da una posición privilegiada para observar y clasificar a los bots que recorren internet. Desde hace un tiempo, la empresa distingue tres tipos de crawlers según su función: los que indexan contenido para buscadores, los que recolectan datos para entrenar modelos de IA, y los que actúan como agentes automatizados en nombre de sistemas de inteligencia artificial.

A partir del 15 de septiembre, esa clasificación empieza a tener consecuencias automáticas. Para los clientes nuevos, los sitios nuevos de clientes existentes y todos los usuarios del plan gratuito, la configuración por defecto pasará a bloquear el acceso de los bots de entrenamiento de IA a cualquier página que muestre publicidad, mientras que los bots de búsqueda seguirán teniendo paso libre.

El punto más delicado aparece con una tercera categoría: los crawlers de "uso mixto", bots que combinan varias funciones en un solo rastreador. Ahí es donde entra Google.

El problema con Googlebot

Google no usa un bot separado para cada tarea. Googlebot recorre las páginas tanto para indexarlas en el buscador como para alimentar con esos datos a Gemini y a las funciones de IA generativa de Google, como AI Overviews. Al hacer las dos cosas a la vez, Cloudflare lo clasifica como un crawler mixto.

Esto significa que un sitio que active el bloqueo de bots de entrenamiento de IA en Cloudflare —incluido el interruptor clásico que simplemente dice "bloquear bots de IA"— puede terminar bloqueando también a Googlebot. No solo el rastreo destinado a entrenar modelos, sino la indexación completa para el buscador.

Para un medio que depende de Google para una parte importante de su tráfico, la diferencia no es menor: perder esa visibilidad por una configuración mal entendida puede tener un impacto directo en las visitas y, por lo tanto, en los ingresos publicitarios. Bing y Apple enfrentan el mismo problema, ya que sus crawlers principales también combinan funciones de búsqueda y entrenamiento.

Google sí cuenta con un bot separado, pensado únicamente para el entrenamiento de sus modelos de IA, que permite bloquear ese uso específico sin afectar la presencia en el buscador. La duda que queda abierta es si Google terminará de separar por completo las funciones de su bot principal antes de que llegue la fecha límite.

Por qué Cloudflare está haciendo esto

Detrás de la medida hay un argumento económico bastante concreto: los sistemas de IA generativa consumen enormes cantidades de contenido de los editores, pero devuelven muy poco tráfico a cambio. Según datos que la propia Cloudflare ha compartido, el crawler de Google todavía genera una visita de referencia por cada catorce páginas rastreadas, mientras que otros crawlers de empresas de IA generan apenas una visita por cada varios miles —o incluso decenas de miles— de páginas recolectadas.

Como parte de la misma estrategia, Cloudflare está ampliando un programa de pago que busca compensar a los editores no solo cuando su contenido es rastreado, sino cuando efectivamente influye en una respuesta generada por IA. Es un intento de convertirse en la capa de infraestructura que regule —y cobre por— el acceso al contenido en la era de las respuestas generadas por IA.

El dilema real para los medios

La tensión de fondo no es nueva, pero esta fecha límite la vuelve inevitable. Muchos editores quieren dos cosas al mismo tiempo: aparecer en las respuestas de las herramientas de IA, porque ese tráfico suele convertir mejor, y al mismo tiempo evitar que su contenido sea usado sin compensación para entrenar los mismos modelos que reducen el tráfico orgánico tradicional.

El problema es que, hoy, proteger el contenido y mantener visibilidad en IA suelen requerir permitir el acceso al mismo tipo de crawler. Los medios con capacidad de negociación —los que ya tienen acuerdos de licenciamiento directo con las grandes plataformas— pueden permitirse bloquear y negociar desde una posición fuerte. La mayoría de editores medianos y pequeños no cuenta con ese margen.

Qué revisar antes del 15 de septiembre

Independientemente del tamaño del sitio, hay algunas acciones concretas que conviene tomar antes de la fecha límite:

  • Auditar la configuración de gestión de bots en Cloudflare (si se usa) y entender qué distingue el bloqueo de bots de "entrenamiento" del bloqueo de crawlers "mixtos".
  • Si no se usa Cloudflare, revisar el robots.txt y cualquier otra herramienta de gestión de bots con la misma lógica.
  • Medir qué retorno real está dando cada crawler que accede al sitio, en lugar de asumir que todos aportan valor por igual.
  • Monitorear de cerca la evolución del tráfico proveniente de Google en las semanas posteriores al cambio, para detectar a tiempo cualquier caída inusual.

Este último punto es, en la práctica, donde muchos equipos editoriales se quedan cortos: sin un monitoreo constante de las métricas de Search Console y Analytics, un error de configuración puede pasar semanas sin detectarse. Herramientas que centralizan estos datos —GA4, Search Console, tendencias de búsqueda— en un solo panel ayudan a que cualquier variación de tráfico se note de inmediato, en lugar de descubrirse un mes después revisando reportes sueltos.

La configuración de bots dejó de ser un detalle técnico que solo le interesa al equipo de desarrollo. Es, cada vez más, una decisión editorial y comercial que vale la pena tomar con información completa —y con los datos a la vista.

 

image

Contenido editorial basado en datos

Impulsamos redacciones que entienden, deciden y evolucionan con insights basados en datos de audiencias.

image