Il crawler di Semantyra e la base di ogni altra funzionalita. Recupera prima con HTTP leggero e renderizza JavaScript solo quando una pagina ne ha bisogno, entro un budget. Ha una rigorosa protezione SSRF cosi non puo essere puntato verso infrastruttura interna.
Come funziona
- 1Legge robots.txt e la sitemap, poi scansiona in ampiezza con un rate limit per host e un limite di pagine.
- 2Per ogni pagina registra codici di stato, catene di redirect, tag canonical, intestazioni, contenuto principale, link, immagini, dati strutturati, lingua e conteggio parole.
- 3Normalizza gli URL cosi la stessa pagina non viene contata due volte e rileva i contenuti duplicati.
- 4Ogni recupero supera un controllo SSRF che risolve l host e rifiuta qualsiasi indirizzo non pubblico, rivalidando dopo ogni redirect.
Cosa ottieni
- Un inventario pulito delle pagine con campi tecnici per ogni URL.
- Analisi di redirect, canonical e indicizzabilita.
- Rilevamento dei contenuti duplicati.
- Limiti configurabili per progetto cosi un sito non puo far lievitare i costi.
Domande frequenti
- Il crawler puo essere usato per scansionare una rete interna?
- No. La protezione SSRF rifiuta localhost, gli intervalli privati e link-local, gli endpoint di metadati cloud e i protocolli non HTTP, e blocca le connessioni a un IP pubblico verificato.
- Renderizza sempre il JavaScript?
- No. Usa prima HTTP e renderizza solo quando una pagina ne ha bisogno, entro un budget per scansione, perche il rendering e lento e costoso.