Exploration web (Crawling)

L'exploration web (crawling) est la visite et la capture automatiques de pages ou de documents en ligne par un programme. Dans un contexte de messagerie, le crawling sert à alimenter automatiquement une base de connaissances IA avec le contenu d'un site web — au lieu de téléverser chaque document manuellement.

Que signifie « crawling » ?

Le crawling (de « to crawl », ramper) est le processus automatique par lequel un programme (le « crawler » ou « bot ») visite systématiquement des pages web, lit leur contenu et suit les liens. Google le fait pour construire son index. Les plateformes d'IA le font pour alimenter automatiquement une base de connaissances.

Le crawling dans le contexte IA

Pour qu'un chatbot IA ou un agent IA réponde aux questions des clients, il doit connaître votre entreprise : produits, prix, conditions de livraison, FAQ, horaires d'ouverture. Classiquement, ces connaissances sont téléversées laborieusement, document par document. Avec le crawling, une seule saisie suffit — l'URL de la page d'accueil. Le crawler parcourt les sous-pages liées et les stocke comme sources interrogeables.

Comment fonctionne un crawler IA

  1. URL de départ : Vous fournissez le domaine, par exemple www.votreentreprise.com.
  2. Vérification du robots.txt : Le crawler lit le fichier robots.txt et respecte les zones interdites.
  3. Utilisation du sitemap : Lorsqu'il est disponible, il utilise le sitemap XML comme carte pour un crawl efficace.
  4. Récupération des pages : Chaque page est téléchargée et le HTML analysé.
  5. Extraction du contenu : Navigation, pieds de page, bandeaux de cookies sont retirés ; seuls le texte utile et la structure des titres demeurent.
  6. Indexation : Le contenu est découpé en morceaux plus petits et sémantiquement cohérents, puis stocké dans une base vectorielle.
  7. Mises à jour : À intervalles configurables, le crawler revérifie si le contenu a changé.

Ce qui peut mal tourner avec le crawling

  • Pages rendues en JavaScript : Les contenus chargés uniquement par JavaScript sont invisibles pour de nombreux crawlers. Solution : rendu côté serveur ou crawler moderne basé sur un navigateur headless.
  • Zones protégées par identifiant : Derrière un login, le crawler ne voit rien — sauf si vous lui fournissez les identifiants.
  • Contenu obsolète : Si le crawler ne tourne qu'une fois, la base de connaissances vieillit vite. Des mises à jour régulières sont indispensables.
  • Problèmes de structure : Sans titres clairs ni HTML sémantique, la qualité de la recherche chute.

Ce que vient faire le robots.txt

Tout crawler sérieux respecte le robots.txt d'un domaine. Il déclare quels chemins sont hors limites. Lorsque vous explorez votre propre site web, vous fixez les règles. Lorsque vous explorez un tiers, vous devez suivre les siennes.

Crawling vs téléversement manuel

AspectTéléversement manuelCrawling
Effort initialÉlevé (fichier par fichier)Faible (une URL)
FraîcheurAussi fraîche que le dernier téléversementAutomatique à chaque passage du crawler
ContrôleTotalVia des listes d'autorisation/exclusion
Idéal pourPDF, documents Word, données statiquesSites dynamiques, FAQ, catalogues produits

Le crawling chez SendSeven

La base de connaissances SendSeven peut être alimentée par plusieurs sources : documents téléversés (PDF, DOCX), crawls de sites web (avec cadence de mise à jour configurable) et saisies directes. Les contenus explorés sont immédiatement disponibles pour le chatbot IA et l'agent IA comme base de réponse.