Blog

Una lista práctica de crawl budget para sitios grandes

2026-09-07

El crawl budget es el número de URLs que un buscador está dispuesto a descargar de un sitio en un periodo. Para unos cientos de páginas no importa. Para decenas o cientos de miles decide con qué rapidez se ven las páginas nuevas y actualizadas, y casi siempre la mayor parte se gasta en URLs que nunca van a posicionar.

Encuentra dónde se fuga

Los culpables habituales son la navegación por facetas, donde cada combinación de filtros es una URL rastreable, los parámetros de sesión y de seguimiento que crean infinitas variantes de la misma página, los archivos paginados que siguen durante cientos de páginas, y las páginas delgadas o duplicadas que existen pero no aportan nada.

Coge una muestra de los logs del servidor y mira qué descargó realmente el rastreador. Si una gran parte de los rastreos golpea URLs con parámetros y combinaciones de filtros, ese es presupuesto que no se gasta en tu contenido.

Concentra el rastreo

Aprieta el enlazado interno para que las páginas que importan sean las más fáciles de alcanzar en el menor número de clics. Un buscador rastrea lo que está enlazado, así que la estructura de enlaces es la palanca principal.

Controla las URLs con parámetros y filtros. Usa etiquetas canónicas para apuntar las variantes a la URL limpia, reglas robots para frenar el rastreo de espacios evidentemente infinitos, y noindex donde una página deba existir para los usuarios pero no para la búsqueda.

Mantén el sitemap limitado a páginas canónicas e indexables. Un sitemap lleno de redirecciones, páginas noindex y 404 hace perder tiempo al rastreador y baja la confianza en el archivo.

Arregla las señales de salud

Un sitio lento se rastrea con cautela. También uno que devuelve muchos errores 5xx o cadenas largas de redirecciones. El tiempo de respuesta del servidor y la tasa de error afectan directamente a lo agresivo que es el rastreo de un sitio.

Poda o consolida las páginas delgadas. Cada página que nunca va a posicionar es una página que el rastreador aún tiene que considerar.

Mídelo

Sigue en el tiempo las páginas descubiertas frente a las páginas que vale la pena indexar. Si la brecha es grande y crece, se está desperdiciando crawl budget. Semantyra informa de ambas cifras a partir de un rastreo, junto con los problemas de huérfanas y páginas delgadas que suelen explicar la diferencia.

En resumen

El crawl budget se fuga en URLs por facetas, parámetros, paginación infinita y páginas delgadas. Concéntralo con un enlazado interno más estrecho, control canónico y robots de las URLs variantes, un sitemap limpio, y arreglando las señales de velocidad y error que hacen que un sitio se rastree con cautela.

Relacionado

Ve esto medido en tu propio sitio.

Iniciar análisis gratuito