Crawling

Il crawling è la visita e l'acquisizione automatica di pagine o documenti web da parte di un programma. Nei contesti di messaggistica, il crawling serve ad alimentare automaticamente i contenuti di un sito in una base di conoscenza IA — invece di caricare ogni documento a mano.

Cosa significa crawling?

Il crawling (dall'inglese «to crawl», strisciare) è il processo automatico con cui un programma (il «crawler» o «bot») visita sistematicamente pagine sul web, legge i contenuti e segue i link. Google lo fa per costruire il suo indice. Le piattaforme IA lo fanno per alimentare automaticamente una base di conoscenza.

Il crawling nel contesto IA

Perché un chatbot IA o un agente IA risponda alle domande dei clienti, deve conoscere la sua attività: prodotti, prezzi, condizioni di spedizione, FAQ, orari. Classicamente, questa conoscenza si carica con fatica, un documento alla volta. Con il crawling basta un solo input — l'URL della homepage. Il crawler percorre le sottopagine collegate e le memorizza come fonti consultabili.

Come funziona un crawler IA

  1. URL di partenza: Lei fornisce il dominio, ad esempio www.suaazienda.com.
  2. Verifica del robots.txt: Il crawler legge il file robots.txt e rispetta le aree in cui non può entrare.
  3. Uso della sitemap: Quando disponibile, usa la sitemap XML come mappa per un crawling efficiente.
  4. Scaricamento delle pagine: Ogni pagina viene scaricata e l'HTML analizzato.
  5. Estrazione dei contenuti: Navigazione, piè di pagina, banner cookie vengono rimossi; restano solo il testo utile e la struttura dei titoli.
  6. Indicizzazione: I contenuti vengono suddivisi in blocchi più piccoli e semanticamente coerenti e salvati in un database vettoriale.
  7. Aggiornamenti: A intervalli configurabili il crawler ricontrolla se i contenuti sono cambiati.

Cosa può andare storto nel crawling

  • Pagine renderizzate via JavaScript: I contenuti caricati solo via JavaScript sono invisibili a molti crawler. Soluzione: rendering lato server o un crawler moderno basato su browser headless.
  • Aree protette da login: Dietro un login il crawler non vede nulla — a meno che lei non fornisca le credenziali.
  • Contenuti obsoleti: Se il crawler gira una sola volta, la base di conoscenza invecchia in fretta. Aggiornamenti regolari sono obbligatori.
  • Problemi strutturali: Senza titoli chiari e HTML semantico, la qualità della ricerca crolla.

Cosa c'entra il robots.txt

Ogni crawler serio rispetta il robots.txt di un dominio. Dichiara quali percorsi sono off-limits. Quando esegue il crawling del suo sito, le regole le decide lei. Quando esegue il crawling di un sito di terzi, deve seguire le loro.

Crawling vs caricamento manuale

AspettoCaricamento manualeCrawling
Sforzo inizialeAlto (file per file)Basso (un URL)
FreschezzaSolo quella dell'ultimo caricamentoAutomatica a ogni passaggio del crawler
ControlloTotaleTramite liste di permessi/blocchi
Ideale perPDF, documenti Word, dati staticiSiti dinamici, FAQ, cataloghi prodotto

Il crawling in SendSeven

La base di conoscenza di SendSeven può essere alimentata da più fonti: documenti caricati (PDF, DOCX), crawl di siti web (con cadenza di aggiornamento configurabile) e voci dirette. I contenuti acquisiti sono immediatamente disponibili al chatbot IA e all'agente IA come base per le risposte.