Crawl budget: cómo optimizarlo en sitios grandes

Aprende a gestionar el crawl budget con auditorías de log files, ajustes técnicos en WordPress y estrategias para ecommerce. Guía práctica para redistribuir el presupuesto de rastreo en Google.
crawl budget

El crawl budget determina cuántas páginas rastrea Google en tu sitio en un período dado. Para sitios con menos de 1,000 URLs bien mantenidas, rara vez es el cuello de botella.

Para ecommerce o portales con decenas de miles de páginas, puede ser la causa directa de que tu contenido nuevo tarde semanas en aparecer en los resultados.

¿El crawl budget afecta de verdad al SEO de tu sitio?

El crawl budget afecta al SEO de forma directa, pero su impacto depende del tamaño y la salud técnica del sitio.

Con menos de 1,000 páginas bien estructuradas, Google las rastreará sin problema. El conflicto real aparece cuando el sitio escala a decenas de miles de URLs sin arquitectura optimizada.

Según el análisis de Botify sobre 6,200 millones de URLs en sitios enterprise, Google no rastreó casi la mitad de las páginas en 30 días.

El crawl waste puede superar el 40-50% del presupuesto en sitios sin arquitectura depurada.

Muchos confunden la frecuencia de rastreo con la velocidad de indexación. Googlebot puede visitar una página y tardar días en procesarla.

Son procesos distintos: optimizar el rastreo acelera el primero, mientras que la indexación depende también de la calidad del contenido.

El presupuesto de rastreo forma parte de los factores técnicos de SEO que mayor impacto tienen cuando el sitio crece. Ignorarlo tiene consecuencias directas en la visibilidad orgánica.

Los dos componentes que determinan tu presupuesto de rastreo

El presupuesto de rastreo no es un número fijo. Es la intersección de dos factores que puedes influenciar: el crawl rate limit y el crawl demand.

Crawl rate limit: el techo que impone la salud de tu servidor

El crawl rate limit es la velocidad máxima a la que Googlebot rastrea sin sobrecargar el servidor.

El factor clave es el TTFB (Time to First Byte): servidores lentos reciben menos visitas porque Googlebot evita degradar el rendimiento del sitio. Puedes ajustarlo desde Google Search Console, pero el impacto real viene de mejorar el tiempo de respuesta en origen.

Crawl demand: la prioridad que Googlebot asigna a tus URLs

El crawl demand depende de la popularidad de cada URL (enlaces, tráfico) y de la frescura del contenido. Páginas sin backlinks y con contenido estático reciben visitas esporádicas.

Google Search Central documenta que el presupuesto de rastreo es relevante para sitios con «varios miles de URLs o más», no para sitios pequeños bien mantenidos (2023).

Cómo auditar el crawl budget con archivos de log

Los log files SEO son la única fuente de verdad sobre cómo Googlebot rastrea tu sitio.

Cualquier herramienta de terceros interpreta datos de forma indirecta; los registros del servidor muestran qué URLs visitó el bot, con qué frecuencia y qué respuesta recibió.

¿Dónde encontrar los archivos de log de tu servidor?

En cPanel están en «Registros»; en Nginx o Apache suelen ubicarse en /var/log/nginx/ o /var/log/apache2/.

La mayoría de proveedores los expone desde el panel de administración sin acceso SSH.

¿Qué métricas debes extraer y cómo interpretarlas?

Analiza la frecuencia de visitas de Googlebot, la distribución de status codes (200, 301, 404, 5xx) y qué URLs se ignoran frente a las que se rastrean con regularidad.

Herramientas como Screaming Frog Log Analyzer o GoAccess (gratuito) automatizan ese análisis.

La señal de alarma más frecuente: Googlebot rastreando URLs de búsqueda interna o parámetros de sesión. Cruza esos datos con el informe de cobertura de Search Console para priorizar acciones.

Qué drena el crawl budget (y cómo bloquearlo)

En auditorías de sitios con más de 10,000 URLs, los problemas se repiten sin importar el sector.

Identificarlos y bloquearlos redistribuye el presupuesto hacia las páginas que generan negocio real.

Navegación facetada y parámetros de URL: el mayor derroche en ecommerce

Los filtros por color, talla o precio generan miles de combinaciones de URL que Googlebot rastrea sin valor estratégico.

La solución tiene tres variantes: bloquear parámetros en robots.txt, usar canonical tags apuntando a la categoría principal, o configurar el manejo de parámetros en Google Search Console. Las páginas de búsqueda interna como /?s= deben bloquearse en robots.txt, sin excepción.

Paginación, duplicados y contenido sin masa crítica

Las cadenas de redirección de más de dos saltos consumen presupuesto: elimínalas apuntando directo al destino final. El thin content y las categorías vacías deben consolidarse o recibir noindex.

Gary Illyes de Google confirmó que reducir URLs de baja calidad redistribuye el presupuesto y acelera la indexación en sitios grandes (2017).

En proyectos donde aplicamos noindex masivo, el tiempo de indexación pasó de semanas a días. En 4 a 6 semanas los datos de Search Console lo confirman.

Optimizar el crawl budget en WordPress y ecommerce

Las plataformas más comunes generan problemas específicos con soluciones distintas. Lo que funciona en WordPress no se aplica igual en Shopify o Magento.

Ajustes de mayor impacto en WordPress

El crawl budget en WordPress se drena por páginas que el CMS genera sin pedirlo: archives de autor, etiquetas y adjuntos.

Configura noindex desde Yoast SEO o RankMath y bloquea /?s= en robots.txt. Limita las revisiones en wp-config.php y mejora el TTFB con caché como WP Rocket para aumentar el crawl rate limit disponible.

Prioridades para ecommerce

El crawl budget en ecommerce bien gestionado concentra los rastreos en productos activos y categorías estratégicas. Para productos fuera de stock con demanda sostenida, mantén la URL con schema Product y disponibilidad OutOfStock.

Usa sitemaps XML segmentados por tipo de contenido (productos, categorías, blog) para guiar a Googlebot. Las variantes con URL propia deben tener un canonical apuntando a la URL maestra del producto.

Enlazado interno: la palanca más ignorada del presupuesto de rastreo

Los enlaces internos son el principal mecanismo para indicarle a Googlebot qué URLs merecen rastreos frecuentes. Googlebot prioriza los enlaces descubiertos durante el rastreo sobre los declarados en el sitemap XML.

Las páginas huérfanas, sin ningún enlace interno, tienen baja probabilidad de rastrearse con regularidad.

La regla en SEODW es clara: las páginas estratégicas deben ser alcanzables desde la home en máximo 3 clics. Consolidar páginas de bajo rendimiento impacta en el rastreo y en la distribución de autoridad.

La arquitectura del sitio es parte central de los factores técnicos de SEO que determinan si Google prioriza tu contenido frente al de la competencia.

¿Tu sitio pierde páginas clave por un crawl budget mal gestionado?

Si tu sitio tiene más de 5,000 URLs y las páginas nuevas tardan semanas en aparecer en Google, el crawl budget es el principal sospechoso.

No es un problema que se resuelva solo: requiere auditoría técnica, decisiones claras sobre qué bloquear y seguimiento continuo con log files.

Estas son las señales más habituales de un presupuesto de rastreo mal gestionado:

  • Páginas nuevas que tardan más de dos semanas en indexarse sin causa aparente.
  • URLs con errores 404 o cadenas de redirección que Googlebot sigue visitando semana tras semana.
  • Miles de URLs marcadas como «descubiertas pero no indexadas» en el informe de cobertura de Search Console.

En SEODW auditamos el crawl budget como parte de la auditoría técnica completa: análisis de log files, detección de crawl waste y plan de acción priorizado por impacto en el negocio. Si quieres saber qué está limitando la indexación de tu sitio, agenda una consultoría gratis.

Suscríbete y sé de los primeros en leer los siguientes consejos que traeremos en el blog. ¡Es Gratis!