¿Cómo bloquear GPTBot, ClaudeBot y PerplexityBot en tu web?

Bloquea GPTBot, ClaudeBot y PerplexityBot en robots.txt sin afectar tu SEO. Métodos técnicos y estrategia según tu modelo de negocio.
bloquear gptbot

Bloquear GPTBot se ha convertido en una decisión estratégica para miles de sitios web que prefieren controlar quién entrena con su contenido. Cuando OpenAI lanzó GPTBot en agosto de 2023, comenzó a generar millones de requests diarios a sitios web globales, sin que los propietarios tuvieran voz en el asunto.

Estos bots consumen ancho de banda real, generan costos de servidor genuinos y no traen ni un solo cliente. Un estudio de 2024 mostró que el tráfico de bots de IA representa entre 5% y 15% del tráfico total en sitios de contenido.

Los costos de infraestructura alcanzan $500 a $5000+ mensuales en negocios medianos, según reportes de Cloudflare y SEMrush. Aproximadamente 37% de sitios web implementan bloqueos a al menos uno de los principales bots de IA desde Q4 2024.

Pero la pregunta real es diferente: ¿deberías bloquear GPTBot tú?

Tabla de contenidos

¿Por qué algunos sitios bloquean bots de IA (y otros deberían replanteárselo)?

La decisión de bloquear bots de IA no es técnica: es comercial. Un restaurante en Bogotá pagaba $300 mensuales en hosting. Descubrió que 12% de su tráfico provenía de PerplexityBot. Después de bloquearlo, su factura bajó a $260 y ganó ancho de banda para clientes reales.

Sin embargo, no todos los negocios deben implementar esta estrategia. El dilema es claro: los bots consumen recursos sin generar conversión, pero tampoco puedes ignorar el costo de no aparecer en respuestas de ChatGPT o Claude.

¿Cuál es el dilema real entre tráfico de entrenamiento y costos de servidores?

El argumento ético pesa también. ¿Por qué OpenAI puede entrenar a ChatGPT con tu contenido sin pagar un centavo? No es una pregunta retórica. Muchos propietarios bloquearon porque consideran que entrenar modelos de IA debería compensar a quienes crean contenido original.

La realidad técnica es simple: los bots rastrean tu sitio, descargan páginas, consumen servidor, pero no generan ni un click de búsqueda ni una llamada telefónica.

Por eso algunos sitios deciden bloquear. Sin embargo, ser visible en AI crawlers robots.txt tiene valor real que debes evaluar. Si tu estrategia depende de que clientes encuentren tu información en ChatGPT, bloquear bots es sabotaje. Si tu negocio vive de búsqueda orgánica en Google y conversiones directas, bloquear no afecta tu resultado.

¿Cómo bloquear GPTBot en robots.txt?: Método esencial

Esta es la técnica que funciona hoy y que conocen 9 de cada 10 desarrolladores. Es simple porque robots.txt es un archivo de texto plano que le dice a los bots qué pueden rastrear en tu sitio.

¿Cuál es la sintaxis exacta para robots.txt?

Tu archivo robots.txt debe incluir estas líneas para bloquear a GPTBot:

User-agent: GPTBot
Disallow: /

Si quieres bloquear solo ciertas carpetas, reemplaza la barra diagonal con la ruta específica:

User-agent: GPTBot
Disallow: /contenido-premium/

Cuando necesites permitir que acceda a páginas específicas mientras bloqueas el resto, usa:

User-agent: GPTBot
Disallow: /
Allow: /blog/articulos-publicos/

La diferencia entre Disallow y Allow es crucial. Disallow indica qué no puede acceder, mientras que Allow añade excepciones al bloqueo. Los bots leen robots.txt de arriba hacia abajo, así que el orden importa.

¿Dónde colocar el archivo robots.txt en tu servidor?

El archivo debe estar en la raíz de tu dominio. Si tu sitio es ejemplo.com, la ruta correcta es ejemplo.com/robots.txt.

No en una carpeta ni con otro nombre, exactamente en la raíz. Si tu hosting usa cPanel, accedes por FTP a la carpeta public_html y subes el archivo ahí.

Con WordPress, la mayoría de plugins SEO generan robots.txt automáticamente. Editas desde el panel de control sin tocar el servidor.

¿Cómo validar en Google Search Console?

Una vez que hayas colocado el archivo, valídalo en Google Search Console. Ve a Configuración > Reglas de robots.txt.

Google te mostrará si hay problemas de sintaxis. Si los hay, el archivo no funcionará como esperas. También puedes usar validadores online para simular cómo ven los bots tu archivo antes de publicar cambios.

¿Cómo bloquear ClaudeBot y PerplexityBot?: Guía específica para cada bot

GPTBot es solo la mitad de la batalla. Anthropic tiene ClaudeBot, Perplexity tiene PerplexityBot, y otros bots de IA siguen emergiendo. Cada uno tiene su propio user agent que debes conocer para bloquearlo correctamente.

¿Cuáles son los user-agents exactos y cómo identificarlos?

El user agent es la identificación que el bot envía cuando accede a tu sitio. Para Claude (de Anthropic), el user-agent exacto es:

User-agent: Claude-Web

Para PerplexityBot, es:

User-agent: PerplexityBot

Otros bots que crecen: CCBot (CommonCrawl), OmniGrok. Nuevos aparecerán cada trimestre. Puedes verlos en tus logs de servidor buscando qué accede a tu sitio.

¿Configuración individual o bloqueo combinado?

Puedes bloquear cada bot con una regla separada:

User-agent: Claude-Web
Disallow: /

User-agent: PerplexityBot
Disallow: /

O combinarlos en una sola regla:

User-agent: Claude-Web
User-agent: PerplexityBot
Disallow: /

La segunda opción es más limpia si aplicas la misma política a múltiples bots. Ambas funcionan igual.

¿Hay diferencias en el comportamiento de cada bot?

ClaudeBot es moderado: accede con patrones razonables. PerplexityBot tiende a ser más agresivo en rastreos. Esto importa porque algunos sitios deciden bloquear PerplexityBot pero permiten ClaudeBot si creen que podría dirigir valor.

Conocer el comportamiento te permite decisiones granulares en lugar de un bloqueo genérico.

¿Cuáles son los métodos avanzados: .htaccess, headers HTTP y bloqueo a nivel de servidor?

robots.txt es amable: pide a los bots que no accedan. Pero no todos la respetan. Si tienes un bot que ignora robots.txt, necesitas métodos más duros que bloquean a nivel de servidor.

¿Alternativa 1: Bloquear por .htaccess?

En un servidor Apache, puedes rechazar directamente en .htaccess:

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ^GPTBot [NC]
RewriteRule ^(.*)$ – [F,L]

Esto genera un error 403 Forbidden directamente. El bot no descarga nada. Es definitivo.

¿Alternativa 2: HTTP headers personalizados?

Otro método: envía headers X-Robots-Tag que le indiquen al bot qué hacer:

X-Robots-Tag: noindex, nofollow

O más específicamente, para bloquear IA generativa:

X-Robots-Tag: noimageindex, nosnippet

Esto se configura en tu servidor Apache o en nginx en server blocks.

¿Cuándo usar cada método según tu infraestructura?

¿Cuándo robots.txt es suficiente? Cuando confías en que los bots respetan reglas. La mayoría de bots legales lo hacen.

Usa .htaccess cuando veas que un bot ignora robots.txt y sigue atacando tu servidor. Los datos en logs son tu evidencia.

¿Cómo verificar que tu bloqueo de bots de IA funciona correctamente?

Configurar bloqueos es fácil. Verificar que realmente funcionan es diferente. Aquí está donde la mayoría se equivoca: implementan, no validan, y después se sorprenden de que los bots siguen dentro.

¿Qué herramientas simulan GPTBot y otros crawlers?

Usa curl desde tu terminal para simular un bot:

curl -H «User-agent: GPTBot» https://ejemplo.com/

Si el servidor rechaza la request (error 403) o robots.txt devuelve Disallow, está funcionando. Validadores online también lo simulan.

¿Cómo analizar logs del servidor?

Accede a tus logs de acceso y busca por user agent:

grep «GPTBot|Claude-Web|PerplexityBot» /var/log/apache2/access.log

Si después de implementar el bloqueo siguen apareciendo en logs, significa que robots.txt los ignora y necesitas .htaccess.

¿Qué implica el monitoreo continuo del tráfico de bots?

Asigna un tiempo semanal o mensual para revisar si nuevos bots de IA están accediendo. El panorama cambia cada trimestre. Lo que bloqueabas hoy podría no ser el problema de mañana.

¿Afecta bloquear estos bots a tu posicionamiento SEO y visibilidad?

Esta es la pregunta que genera más pánico injustificado. La respuesta corta: no.

¿Cuál es el impacto CERO en Google?: aclaración crucial

GPTBot no es Googlebot. ClaudeBot no es Googlebot. Son crawlers completamente independientes. Bloquear a GPTBot no toca tu ranking en Google ni tu visibilidad en búsqueda orgánica. Google sigue rastreando tu sitio normalmente.

La confusión viene de que suena «mal» bloquear cualquier robot. Pero Google explícitamente permite que propietarios bloqueen bots vía robots.txt. No hay penalización.

¿Cuál es el impacto real en visibilidad en generadores de IA?

Lo que sí pierdes es mención en respuestas de ChatGPT, Claude o Perplexity. Si tu negocio depende de que alguien busque en ChatGPT y obtenga tu información como fuente, bloquear te daña.

Puedes medir eso. Para medir tu visibilidad en respuestas IA, buscas tu marca o keywords clave en ChatGPT, Claude y Perplexity. ¿Apareces en las respuestas? ¿Te citan como fuente?

¿Cuál es el trade-off: tráfico de búsqueda vs menciones en ChatGPT/Claude?

Si la respuesta es no, bloquearlos tampoco cambia mucho. La decisión es simple: ¿vale más la mención en IA que los recursos que cuesta? Para un blog técnico, la mención es valiosa. Para un ecommerce, importa menos. Para un SaaS B2B, depende si tus clientes buscan en ChatGPT o en Google.

¿Deberías bloquear TODOS los bots de IA?: Estrategia defensiva

No. Bloquear todos sin pensar es tan equivocado como permitir todos sin evaluar. La respuesta depende 100% de tu negocio.

¿Qué sitios SÍ deben bloquear (con urgencia)?

Blogs con contenido paywalled. Tu modelo es suscripción + acceso premium. Si un bot entrena con tu contenido pagado, pierdes ingresos directamente. Bloquear es vital.

Negocios locales (clínicas, abogados, consultoría). Su cliente busca en Google Maps, llama por teléfono, visita la oficina. No le importa si aparece en ChatGPT. El costo del bot supera el beneficio. Bloquéalo.

¿Qué sitios NO deben bloquear (estrategia opuesta)?

Sitios informativos o educativos que viven de autoridad. Wikipedia no bloquea bots de IA. Tu blog tampoco debería si tu objetivo es posicionarte como referencia. Ser fuente de IA es autoridad moderna. Mantén los bots permitidos.

Plataformas SaaS donde usuarios buscan respuestas en ChatGPT. Si alguien pregunta «cómo usar tu herramienta» en ChatGPT y recibe tu documentación, es oro puro. No bloquees.

¿Cuál es el enfoque híbrido: bloquear selectivamente?

El camino del medio: bloquea PerplexityBot (tiende a rastrear agresivamente), permite GPTBot y Claude-Web (más respetados), y prepara tu sitio para los crawlers IA con arquitectura clara, etiquetas schema y contenido bien estructurado.

Esto equilibra costos y oportunidad. No pierdes presencia en IA generativa «seria» pero proteges recursos de bots más agresivos.

En SEODW optimizamos tu estrategia de bots de IA

Llevamos más de 7 años ayudando a negocios locales a tomar decisiones sobre sus canales digitales. Sabemos que bloquear bots no es solo técnico: es estratégico. La pregunta real es si tu modelo de negocio gana o pierde con cada bot.

Auditamos tu configuración actual de robots.txt, analizamos qué bots acceden a tu sitio hoy, simulamos el impacto de bloquearlos e implementamos métodos avanzados si necesitas ir más lejos. La decisión correcta depende de tus costos reales y de dónde vienen tus clientes. Contáctanos en SEODW y te ayudamos a evaluarlo.

Suscríbete y sé de los primeros en leer los siguientes consejos que traeremos en el blog. ¡Es Gratis!