El crawler de Semantyra es la base de todas las demas funciones. Descarga primero con HTTP ligero y renderiza JavaScript solo cuando una pagina lo necesita, dentro de un presupuesto. Tiene una proteccion SSRF estricta para que no se pueda apuntar a infraestructura interna.
Como funciona
- 1Lee robots.txt y el sitemap, luego rastrea en anchura con un limite de tasa por host y un tope de paginas.
- 2Para cada pagina registra codigos de estado, cadenas de redireccion, etiquetas canonical, encabezados, contenido principal, enlaces, imagenes, datos estructurados, idioma y numero de palabras.
- 3Normaliza las URL para que la misma pagina no se cuente dos veces y detecta contenido duplicado.
- 4Cada descarga pasa una comprobacion SSRF que resuelve el host y rechaza cualquier direccion no publica, revalidando tras cada redireccion.
Que obtienes
- Un inventario limpio de paginas con campos tecnicos para cada URL.
- Analisis de redireccion, canonical e indexabilidad.
- Deteccion de contenido duplicado.
- Limites configurables por proyecto para que un sitio no dispare el coste.
Preguntas frecuentes
- Se puede usar el crawler para escanear una red interna?
- No. La proteccion SSRF rechaza localhost, los rangos privados y link-local, los endpoints de metadatos de nube y los protocolos no HTTP, y fija las conexiones a una IP publica verificada.
- Siempre renderiza JavaScript?
- No. Usa HTTP primero y renderiza solo cuando una pagina lo necesita, dentro de un presupuesto por rastreo, porque renderizar es lento y caro.