Cloudflare bloquea bots de IA el 15 de septiembre de 2026
Hay una casilla en el panel de Cloudflare que suena razonable, que cualquiera marcaría, y que saca tu web del índice de Google sin avisar. No es la fecha lo que debería preocuparte: es cómo están clasificados los bots por debajo.
7 Agosto, 2026
TL;DR
Desde el 15 de septiembre de 2026 los dominios NUEVOS en Cloudflare bloquean por defecto las categorías Training y Agent, y solo en páginas con publicidad. El parque existente no cambia solo. El riesgo de verdad es otro: Googlebot, Applebot y BingBot son rastreadores de propósito mixto, así que activar el bloqueo de Training los bloquea también y te saca del buscador. Comprueba con curl que OAI-SearchBot recibe un 200 y revisa qué categoría tienes bloqueada antes de septiembre.
Qué cambia exactamente el 15 de septiembre (y a quién no le cambia nada)
El 1 de julio de 2026 Cloudflare anunció un cambio que casi nadie en España ha leído, y que decide si los modelos de IA pueden seguir leyendo tu web. A partir del 15 de septiembre de 2026, los dominios nuevos que entren en Cloudflare bloquearán por defecto dos de las tres categorías de rastreadores de IA.
Antes de que entres en pánico o te relajes, conviene fijar la frontera exacta, porque la mayoría de lo publicado sobre esto la cuenta mal:
- Aplica a dominios nuevos que entren en Cloudflare, no al parque existente. Si tu web ya está en Cloudflare, el 15 de septiembre no te cambia nada solo.
- Aplica únicamente a las páginas que muestran publicidad. Una web corporativa sin anuncios no entra en el bloqueo por defecto.
- La categoría Search sigue permitida. Lo que se bloquea por defecto es Training y Agent.
Dicho eso: que el bloqueo automático no te aplique no significa que estés a salvo. El riesgo real de este cambio no está en la fecha. Está en un detalle de cómo Cloudflare clasifica los bots, y ese detalle sí puede dejarte fuera de Google.
Las tres categorías nuevas: Search, Agent y Training
Hasta ahora, para Cloudflare un bot de IA era un bot de IA. Desde julio de 2026 hay tres categorías, y entender la diferencia es todo el artículo.
| Categoría | Qué hace | Qué pasa si la bloqueas |
|---|---|---|
| Search | Rastrea para poder citarte en una respuesta con enlace | Desapareces de las respuestas de IA que envían tráfico |
| Agent | Actúa en tu web en nombre de un usuario, por ejemplo para comparar o reservar | Los agentes no pueden operar en tu web |
| Training | Recoge contenido para entrenar modelos futuros | Tu contenido no alimenta el entrenamiento |
La distinción importa porque responde a la pregunta que casi todo el mundo se hace mal. Bloquear el entrenamiento es una decisión legítima de negocio: no quieres que tu contenido alimente gratis a un modelo. Bloquear la búsqueda es un tiro en el pie: es exactamente el bot que te trae la mención y el clic.
Es el mismo error que ya explicamos con GPTBot y OAI-SearchBot en la guía de robots.txt para bots de IA, solo que ahora ocurre en el panel de tu CDN y con una casilla que alguien puede marcar sin saber lo que hace.
La trampa: el rastreador de propósito mixto
Aquí está lo que no cuenta ningún resumen del anuncio, y es lo único que de verdad puede romperte el tráfico.
El detalle que decide el artículo
Hay rastreadores que sirven a varios propósitos a la vez. Googlebot, Applebot y BingBot son de propósito mixto: el mismo bot rastrea para el buscador y para las funciones de IA. Y Cloudflare evalúa un rastreador de propósito mixto bajo TODAS sus políticas. Si activas el bloqueo de Training, estás bloqueando también a Googlebot.
Léelo otra vez, porque la consecuencia es brutal. Un dueño de negocio entra en su panel, ve una casilla que dice que no quiere que la IA se entrene con su contenido, la marca porque le parece razonable, y sin saberlo saca su web del índice de Google. No de las respuestas de IA. Del buscador entero.
No es una hipótesis: es el comportamiento documentado del sistema. Y es el escenario más probable, porque la casilla de no entrenar es la que suena bien a cualquiera que no sepa cómo funciona esto por dentro.
Por qué esto no es teoría: 3,8 millones de dominios ya modificados
Si crees que esto es un cambio de configuración menor que nadie va a aplicar, conviene mirar el precedente. El 24 de septiembre de 2025 Cloudflare lanzó su Content Signals Policy y la aplicó de oficio a más de 3,8 millones de dominios, escribiendo por ellos en su robots.txt.
Los valores que aplicó por defecto fueron estos:
| Señal | Valor aplicado | Significado |
|---|---|---|
| search | yes | Se permite rastrear para buscadores |
| ai-train | no | Se prohíbe usar el contenido para entrenar |
| ai-input | sin declarar | No se pronuncia sobre el uso en respuestas en vivo |
Millones de webs cambiaron su declaración de permisos sin que sus dueños escribieran una línea. Eso es lo que hace que la fecha de septiembre no sea teórica: la infraestructura ya ha demostrado que toma decisiones por defecto a escala masiva.
Y el contexto explica por qué lo hace. Cloudflare cifra en más del 50% el tráfico de internet que no es humano, y en más del 50% el rastreo de bots buenos que se gasta en volver a pedir páginas que no han cambiado. Desde su lado esto es un problema de coste, no una postura ideológica.
Cómo saber en cinco minutos si te afecta
Cinco minutos, sin herramientas de pago. Hazlo en este orden.
1. Comprueba si tu web está detrás de Cloudflare
curl -sI https://tudominio.com | grep -i "server\|cf-ray"Sí aparece cf-ray o server: cloudflare, estás dentro. Muchas pymes lo están sin saberlo porque lo activo su desarrollador o viene incluido en el hosting.
2. Lee tu robots.txt y busca las señales de contenido
curl -s https://tudominio.com/robots.txt | grep -i "content-signal\|ai-train\|search"Sí aparece una línea Content-Signal que tu no escribiste, te la aplicaron de oficio.
3. Prueba si el bot de búsqueda de OpenAI puede leerte
curl -sA "OAI-SearchBot" -o /dev/null -w "%{http_code}\n" https://tudominio.comUn 200 es lo que quieres ver. Un 403 significa que ese bot está bloqueado, y ese bot es el que te cita en ChatGPT con enlace.
4. Entra en el panel y mira quién ha tocado qué
En la sección de tráfico de IA de Cloudflare, revisa cual de las tres categorías esta bloqueada. Si Training está bloqueado, comprueba inmediatamente que Googlebot sigue pasando, por lo que hemos visto en el apartado anterior.
Qué dejar entrar y qué bloquear, según de qué vivas
La decisión no es la misma para todos. Depende de una sola pregunta: de qué vives.
| Tipo de negocio | Search | Agent | Training |
|---|---|---|---|
| Negocio local o de servicios (despacho, clínica, tienda) | Permitir siempre | Permitir | Indiferente |
| E-commerce | Permitir siempre | Permitir, es quien compara y compra | Indiferente |
| Medio o web que vive de la publicidad | Permitir siempre | Valorar | Bloquear tiene sentido |
| Web con contenido propio de alto valor (datos, informes) | Permitir siempre | Valorar | Bloquear tiene sentido |
La regla que resume la tabla
Si tu contenido es el producto que vendes, plantearte bloquear Training es razonable. Si tu contenido existe para que te encuentren y te compren otra cosa, bloquear cualquier categoría es regalarle la respuesta a tu competencia. La inmensa mayoría de las pymes está en el segundo grupo y no lo sabe.
El coste real de bloquear el bot equivocado
Hay una asimetría que conviene tener clara antes de tocar nada. Bloquear el bot equivocado se paga en visibilidad inmediata. Permitir el rastreo de entrenamiento se paga, como mucho, en un contenido que alimenta un modelo futuro.
Y hay un dato del mercado español que inclina la balanza. Según el estudio de SE Ranking sobre 101.574 webs (enero de 2025 a abril de 2026), en España la IA aporta el 0,30% del tráfico total. Es poco, y quien te venda lo contrario te está engañando. Pero es un 0,30% que crece, que llega más cualificado, y que se pierde entero con una casilla mal marcada.
El cálculo es sencillo: el beneficio de bloquear Training es difuso y a largo plazo. El coste de bloquear Search por accidente es inmediato y medible. Ante la duda, deja pasar al bot de búsqueda.
Y una nota de honestidad sobre lo que no se puede afirmar hoy. Circulan cifras muy citadas sobre cuántas páginas rastrea cada plataforma por cada visita que devuelve. El único dato que hemos podido verificar en fuente primaria es de junio de 2025, cuando Cloudflare midió que Anthropic rastreaba unas 71.000 páginas por cada visita enviada. Los ratios que circulan para 2026, por plataforma, no hemos podido comprobarlos, así que no los usamos para sostener ninguna recomendación.
Preguntas frecuentes
¿Cloudflare va a bloquear los bots de IA en mi web el 15 de septiembre de 2026?
¿Qué diferencia hay entre las categorías Search, Agent y Training de Cloudflare?
¿Bloquear el entrenamiento de IA puede sacarme de Google?
¿Cómo compruebo si mi web está detrás de Cloudflare?
¿Que es la Content Signals Policy de Cloudflare?
¿Me conviene bloquear los rastreadores de IA en mi negocio?
¿Cuánto tráfico aporta hoy la IA a una web española?
Sigue leyendo