Crawling (indeksowanie)

Crawling to automatyczne odwiedzanie i pobieranie stron lub dokumentów internetowych przez program. W kontekście komunikacji crawling służy do automatycznego zasilania bazy wiedzy AI treściami ze strony — zamiast ręcznego wgrywania każdego dokumentu.

Co oznacza crawling?

Crawling (od ang. «to crawl», pełzać) to automatyczny proces, w którym program («crawler» lub «bot») systematycznie odwiedza strony w sieci, czyta ich treść i podąża za linkami. Google robi to, by budować swój indeks. Platformy AI robią to, by automatycznie zasilać bazę wiedzy.

Crawling w kontekście AI

Aby chatbot AI lub agent AI odpowiadał na pytania klientów, musi znać Państwa biznes: produkty, ceny, warunki dostawy, FAQ, godziny otwarcia. Klasycznie tę wiedzę wgrywa się żmudnie, dokument po dokumencie. Z crawlingiem wystarczy jedno wejście — URL strony głównej. Crawler przechodzi przez podstrony, do których prowadzą linki, i zapisuje je jako przeszukiwalne źródła.

Jak działa crawler AI

  1. URL startowy: Podają Państwo domenę, np. www.panstwafirma.pl.
  2. Sprawdzenie robots.txt: Crawler czyta plik robots.txt i respektuje, w jakie obszary nie wolno wchodzić.
  3. Wykorzystanie sitemap: Gdy jest dostępna, używa sitemap XML jako mapy do efektywnego crawlowania.
  4. Pobranie stron: Każda strona zostaje pobrana, a HTML rozparsowany.
  5. Ekstrakcja treści: Nawigacja, stopki, banery cookie są usuwane; pozostaje sam tekst i struktura nagłówków.
  6. Indeksowanie: Treść jest dzielona na mniejsze, semantycznie spójne fragmenty i zapisywana w bazie wektorowej.
  7. Aktualizacje: W konfigurowalnych odstępach crawler ponownie sprawdza, czy treść się zmieniła.

Co może pójść nie tak w crawlingu

  • Strony renderowane przez JavaScript: Treści ładowane wyłącznie przez JavaScript są niewidoczne dla wielu crawlerów. Rozwiązanie: renderowanie po stronie serwera lub nowoczesny crawler z headless browserem.
  • Obszary chronione logowaniem: Za logowaniem crawler nic nie widzi — chyba że dostarczą Państwo dane uwierzytelniające.
  • Nieaktualne treści: Jeśli crawler uruchomi się tylko raz, baza wiedzy szybko się starzeje. Regularne aktualizacje są obowiązkowe.
  • Problemy strukturalne: Bez wyraźnych nagłówków i semantycznego HTML jakość wyszukiwania spada.

Co ma do tego robots.txt

Każdy poważny crawler respektuje robots.txt domeny. Deklaruje on, które ścieżki są poza zasięgiem. Przy crawlowaniu własnej strony reguły ustalają Państwo. Przy crawlowaniu cudzej strony muszą Państwo trzymać się ich reguł.

Crawling vs ręczne wgrywanie

AspektRęczne wgrywanieCrawling
Wysiłek początkowyWysoki (plik po pliku)Niski (jeden URL)
AktualnośćTak świeża jak ostatnie wgranieAutomatyczna przy każdym uruchomieniu crawlera
KontrolaPełnaPrzez listy dozwolonych/zablokowanych
Najlepsze doPDF, dokumenty Word, dane statyczneStrony dynamiczne, FAQ, katalogi produktów

Crawling w SendSeven

Baza wiedzy SendSeven może być zasilana z wielu źródeł: wgranych dokumentów (PDF, DOCX), crawlów stron (z konfigurowalną częstotliwością odświeżania) oraz wpisów ręcznych. Treść z crawlingu jest natychmiast dostępna dla chatbota AI i agenta AI jako podstawa odpowiedzi.