Bloquear rastreadores de IA en WordPress (GPTBot, Claude)
¿Quieres impedir que ChatGPT, Gemini o Claude entrenen con tu contenido? Así funcionan los rastreadores de IA, qué puede robots.txt y cómo bloquearlos.
«¿Puedo impedir que ChatGPT entrene con mis artículos?» es una de las preguntas que más me hacen ahora, y merece una respuesta directa en lugar de un susto o un discurso de ventas. La versión honesta tiene dos mitades: sí, puedes decirles a los grandes rastreadores de IA que no entren—y no, un archivo de texto no puede detener físicamente a un bot que ha decidido mentir. Déjame mostrarte exactamente qué está bajo tu control, qué no, y cómo fijar tu política en WordPress en más o menos un minuto.
Lo esencial
- Cada gran rastreador de IA usa un user-agent propio—GPTBot, Google-Extended, ClaudeBot, PerplexityBot, CCBot—y se compromete públicamente a obedecer robots.txt.
- Google-Extended es independiente de Googlebot: bloquearlo impide que Gemini y los AI Overviews usen tu contenido sin tocar tu posicionamiento normal en el buscador.
- robots.txt es una petición, no un muro—se ha pillado a Bytespider y a algunos rastreadores encubiertos ignorándolo, así que es una señal para los bots honestos, no una barrera.
- Blaminhor Essentials ofrece dos capas: bloqueo por robots.txt (impide la descarga) y metaetiquetas
noai/noimageai(piden a los motores no entrenar con lo que sí descargaron). Usa una o ambas. - Cada casilla tiene su espejo en WP-CLI (
wp blaminhor seo set --ai-block-chatgpt=true), y todos los controles están desactivados por defecto—tú decides activarlos.
¿Qué son los rastreadores de IA y cuáles importan?
Los rastreadores de IA son bots automatizados que descargan páginas web para entrenar modelos de lenguaje o para responder preguntas en productos de IA—cada uno se identifica con un user-agent con nombre propio, de modo que puedes permitirlo o bloquearlo de forma selectiva. No son un enjambre anónimo; son un puñado de agentes con nombre, de empresas concretas, y conocer esos nombres es todo el juego.
Estos son los cinco que más importan en 2026, y a qué alimenta cada uno:
| Rastreador | Empresa | A qué alimenta | ¿Obedece robots.txt? |
|---|---|---|---|
| GPTBot | OpenAI | ChatGPT y el entrenamiento de modelos | Sí |
| Google-Extended | Gemini y AI Overviews (no la Búsqueda clásica) | Sí | |
| ClaudeBot | Anthropic | Los modelos Claude | Sí |
| PerplexityBot | Perplexity | Las citas del motor de respuestas | Sí |
| CCBot | Common Crawl | Un dataset abierto con el que entrenan muchas empresas de IA | Sí |
Ese último merece una pausa: CCBot pertenece a Common Crawl, una organización sin fines de lucro cuyo dataset público se usa para entrenar una enorme variedad de modelos. Bloquea CCBot y cortas una vía de entrenamiento indirecta que de otro modo jamás verías en tus registros.
¿Bloquearlos en robots.txt realmente los detiene?
Para los bots identificados y que juegan limpio—sí; para un bot que ha decidido ignorar las reglas—no, y quien te diga lo contrario está exagerando. robots.txt es un protocolo de cortesía. Funciona porque las empresas serias eligen respetarlo y publican los nombres de sus user-agents para que puedas hacerlo valer. GPTBot, ClaudeBot, PerplexityBot, Google-Extended y CCBot están todos en ese bando.
Pero el protocolo no tiene dientes. Se ha documentado que Bytespider (ByteDance) y algunos rastreadores encubiertos descargan páginas que se les pidió no tocar. Así que el modelo mental honesto es un cartel de «prohibido el paso», no una puerta con candado. Frena en seco a la mayoría honesta y no hace nada contra un mal actor decidido—para esos, la defensa vive en el servidor o en el firewall, no en un archivo de texto.
¿Bloquear a Google no perjudicará mi posicionamiento?
No—y este es el malentendido que frena a la gente a la hora de actuar. Google opera dos rastreadores separados para dos trabajos separados. Googlebot indexa tu sitio para la Búsqueda clásica. Google-Extended es un token distinto que gobierna únicamente si tu contenido entrena a Gemini y aparece en los AI Overviews.
Bloquear Google-Extended le dice a Google «no uses mi contenido para IA» mientras Googlebot sigue rastreándote y posicionándote exactamente igual que antes. No pierdes nada en los enlaces azules. Esa separación limpia es precisamente lo que convierte bloquear el entrenamiento de IA en una decisión de bajo riesgo para la mayoría de los dueños de sitios—no estás eligiendo entre Google y tu privacidad, estás rechazando un uso concreto.
¿Cómo se bloquean los rastreadores de IA en WordPress?
En WordPress no editas robots.txt a mano—marcas los rastreadores que quieres fuera, y el módulo SEO añade las reglas correctas a tu robots.txt virtual. Con Blaminhor Essentials, el flujo es este:
- Abre la pestaña GEO / AEO del módulo SEO. Agrupa todos los controles de IA en un solo lugar, junto a llms.txt y los datos estructurados.
- En «Bloquear vía robots.txt», marca los rastreadores que quieres rechazar—GPTBot, Google-Extended, ClaudeBot, PerplexityBot, CCBot. Cada uno es una casilla independiente, así que puedes bloquear los bots de entrenamiento y permitir los que citan fuentes.
- Activa, si quieres, las metaetiquetas
noai. Esto añadenoaiynoimageaia tus páginas, pidiendo a los motores no usar para entrenamiento el contenido que sí descargaron—una segunda capa detrás del bloqueo. - Guarda. El módulo escribe un bloque claramente etiquetado en tu robots.txt (
User-agent: GPTBot/Disallow: /, uno por bot elegido). Visitatusitio.com/robots.txtpara verlo.
Una casilla por rastreador. Bloquea los bots de entrenamiento, permite los motores que citan, o recházalos todos—tú decides, bot por bot.
¿Prefieres la línea de comandos? Cada casilla tiene su gemelo en WP-CLI, así que puedes fijar la política en toda una flota de sitios con un solo script:
wp blaminhor seo set --ai-block-chatgpt=true --ai-block-claude=true --ai-block-common-crawl=true
Se ejecuta la misma validación tanto si haces clic como si escribes—la CLI no es un ciudadano de segunda añadido a última hora.
¿Bloquearlos o invitarlos? ¿Cómo decidir?
Decide motor por motor, según prefieras proteger tu contenido o que la IA te cite. No hay una respuesta universalmente correcta, y rara vez es todo o nada.
Bloquéalos si lo que escribes es tu producto—una publicación de pago, investigación original, un portafolio que no quieres ver parafraseado en una respuesta sin ningún clic de vuelta. Permítelos si la visibilidad te importa más que la protección y cambiarías con gusto un rastreo por una cita en ChatGPT o Perplexity. Muchos sitios parten la diferencia: bloquean los bots de puro entrenamiento como CCBot y permiten los que envían tráfico de referencia.
En resumen
Tienes un control real y sencillo sobre la mayoría honesta de los rastreadores de IA, y bloquearlos no te cuesta nada en la búsqueda normal. Lo que no tienes es un muro mágico contra los bots que ignoran las reglas—con esos, la pelea se traslada a tu servidor. Fija tu política de robots.txt con intención, añade las etiquetas noai como red de seguridad si quieres, y revísala cuando aparezcan nuevos rastreadores.
Después hazla coherente con la otra mitad de la cuestión IA-SEO: si quieres que te citen, combina una política abierta con un buen mapa llms.txt de tu contenido. El control de rastreadores de IA es una de las más de 20 herramientas de Blaminhor Essentials—gratuito y de código abierto en WordPress.org.
FAQ
¿Bloquear un rastreador en robots.txt realmente lo detiene?
Para los bots identificados y que juegan limpio—GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot—sí: se comprometen públicamente a obedecer robots.txt. Pero robots.txt es una petición, no un muro. Se ha documentado que bots como Bytespider y algunos rastreadores encubiertos lo ignoran, así que tómalo como una señal clara para los bots honestos, no como una barrera contra los deshonestos.
¿Bloquear Google-Extended perjudica mi posicionamiento normal en Google?
No. Google-Extended controla únicamente si tu contenido alimenta a Gemini y a los AI Overviews de Google. Es independiente de Googlebot, que se encarga de la indexación clásica en el buscador. Bloquear Google-Extended te deja fuera del entrenamiento y de las respuestas de IA sin tocar en absoluto tu posicionamiento habitual.
¿Qué diferencia hay entre la metaetiqueta noai y el bloqueo por robots.txt?
Las metaetiquetas noai y noimageai piden a los motores de IA no usar para entrenamiento el contenido que ya descargaron—una petición educada aplicada página a página. El bloqueo por robots.txt impide que el rastreador descargue la página siquiera. Actúan en etapas distintas, así que puedes usar ambas: bloquea el bot y etiqueta las páginas como red de seguridad.
¿Debería bloquear los rastreadores de IA o no?
Depende de tu objetivo. Bloquéalos si tu contenido es tu producto y no quieres que entrene modelos ni que se responda con él sin un clic. Permítelos si quieres que la IA te cite y crecer por esa vía. Rara vez es todo o nada—muchos sitios bloquean bots de entrenamiento como CCBot y permiten los que citan fuentes.
¿Puedo bloquear los bots de IA desde la línea de comandos?
Sí. En Blaminhor Essentials cada casilla tiene su espejo en WP-CLI—por ejemplo `wp blaminhor seo set --ai-block-chatgpt=true`—para que puedas aplicar la política en muchos sitios mediante scripts o integrarla en un despliegue. Se ejecuta la misma validación tanto si marcas la casilla como si lanzas el comando.
¿Bloquear los rastreadores de IA ralentiza o rompe mi sitio?
No. El bloqueo son solo unas líneas añadidas a tu robots.txt virtual; no añade ningún coste en tiempo de ejecución y no toca nada que vea un visitante humano. Solo cambia lo que se les dice a los bots automatizados de IA cuando consultan tu robots.txt antes de rastrear.
Comentarios