Crawling
Il crawling è la visita e l'acquisizione automatica di pagine o documenti web da parte di un programma. Nei contesti di messaggistica, il crawling serve ad alimentare automaticamente i contenuti di un sito in una base di conoscenza IA — invece di caricare ogni documento a mano.
Cosa significa crawling?
Il crawling (dall'inglese «to crawl», strisciare) è il processo automatico con cui un programma (il «crawler» o «bot») visita sistematicamente pagine sul web, legge i contenuti e segue i link. Google lo fa per costruire il suo indice. Le piattaforme IA lo fanno per alimentare automaticamente una base di conoscenza.
Il crawling nel contesto IA
Perché un chatbot IA o un agente IA risponda alle domande dei clienti, deve conoscere la sua attività: prodotti, prezzi, condizioni di spedizione, FAQ, orari. Classicamente, questa conoscenza si carica con fatica, un documento alla volta. Con il crawling basta un solo input — l'URL della homepage. Il crawler percorre le sottopagine collegate e le memorizza come fonti consultabili.
Come funziona un crawler IA
- URL di partenza: Lei fornisce il dominio, ad esempio
www.suaazienda.com. - Verifica del robots.txt: Il crawler legge il file
robots.txte rispetta le aree in cui non può entrare. - Uso della sitemap: Quando disponibile, usa la sitemap XML come mappa per un crawling efficiente.
- Scaricamento delle pagine: Ogni pagina viene scaricata e l'HTML analizzato.
- Estrazione dei contenuti: Navigazione, piè di pagina, banner cookie vengono rimossi; restano solo il testo utile e la struttura dei titoli.
- Indicizzazione: I contenuti vengono suddivisi in blocchi più piccoli e semanticamente coerenti e salvati in un database vettoriale.
- Aggiornamenti: A intervalli configurabili il crawler ricontrolla se i contenuti sono cambiati.
Cosa può andare storto nel crawling
- Pagine renderizzate via JavaScript: I contenuti caricati solo via JavaScript sono invisibili a molti crawler. Soluzione: rendering lato server o un crawler moderno basato su browser headless.
- Aree protette da login: Dietro un login il crawler non vede nulla — a meno che lei non fornisca le credenziali.
- Contenuti obsoleti: Se il crawler gira una sola volta, la base di conoscenza invecchia in fretta. Aggiornamenti regolari sono obbligatori.
- Problemi strutturali: Senza titoli chiari e HTML semantico, la qualità della ricerca crolla.
Cosa c'entra il robots.txt
Ogni crawler serio rispetta il robots.txt di un dominio. Dichiara quali percorsi sono off-limits. Quando esegue il crawling del suo sito, le regole le decide lei. Quando esegue il crawling di un sito di terzi, deve seguire le loro.
Crawling vs caricamento manuale
| Aspetto | Caricamento manuale | Crawling |
|---|---|---|
| Sforzo iniziale | Alto (file per file) | Basso (un URL) |
| Freschezza | Solo quella dell'ultimo caricamento | Automatica a ogni passaggio del crawler |
| Controllo | Totale | Tramite liste di permessi/blocchi |
| Ideale per | PDF, documenti Word, dati statici | Siti dinamici, FAQ, cataloghi prodotto |
Il crawling in SendSeven
La base di conoscenza di SendSeven può essere alimentata da più fonti: documenti caricati (PDF, DOCX), crawl di siti web (con cadenza di aggiornamento configurabile) e voci dirette. I contenuti acquisiti sono immediatamente disponibili al chatbot IA e all'agente IA come base per le risposte.