Crawling (indeksowanie)
Crawling to automatyczne odwiedzanie i pobieranie stron lub dokumentów internetowych przez program. W kontekście komunikacji crawling służy do automatycznego zasilania bazy wiedzy AI treściami ze strony — zamiast ręcznego wgrywania każdego dokumentu.
Co oznacza crawling?
Crawling (od ang. «to crawl», pełzać) to automatyczny proces, w którym program («crawler» lub «bot») systematycznie odwiedza strony w sieci, czyta ich treść i podąża za linkami. Google robi to, by budować swój indeks. Platformy AI robią to, by automatycznie zasilać bazę wiedzy.
Crawling w kontekście AI
Aby chatbot AI lub agent AI odpowiadał na pytania klientów, musi znać Państwa biznes: produkty, ceny, warunki dostawy, FAQ, godziny otwarcia. Klasycznie tę wiedzę wgrywa się żmudnie, dokument po dokumencie. Z crawlingiem wystarczy jedno wejście — URL strony głównej. Crawler przechodzi przez podstrony, do których prowadzą linki, i zapisuje je jako przeszukiwalne źródła.
Jak działa crawler AI
- URL startowy: Podają Państwo domenę, np.
www.panstwafirma.pl. - Sprawdzenie robots.txt: Crawler czyta plik
robots.txti respektuje, w jakie obszary nie wolno wchodzić. - Wykorzystanie sitemap: Gdy jest dostępna, używa sitemap XML jako mapy do efektywnego crawlowania.
- Pobranie stron: Każda strona zostaje pobrana, a HTML rozparsowany.
- Ekstrakcja treści: Nawigacja, stopki, banery cookie są usuwane; pozostaje sam tekst i struktura nagłówków.
- Indeksowanie: Treść jest dzielona na mniejsze, semantycznie spójne fragmenty i zapisywana w bazie wektorowej.
- Aktualizacje: W konfigurowalnych odstępach crawler ponownie sprawdza, czy treść się zmieniła.
Co może pójść nie tak w crawlingu
- Strony renderowane przez JavaScript: Treści ładowane wyłącznie przez JavaScript są niewidoczne dla wielu crawlerów. Rozwiązanie: renderowanie po stronie serwera lub nowoczesny crawler z headless browserem.
- Obszary chronione logowaniem: Za logowaniem crawler nic nie widzi — chyba że dostarczą Państwo dane uwierzytelniające.
- Nieaktualne treści: Jeśli crawler uruchomi się tylko raz, baza wiedzy szybko się starzeje. Regularne aktualizacje są obowiązkowe.
- Problemy strukturalne: Bez wyraźnych nagłówków i semantycznego HTML jakość wyszukiwania spada.
Co ma do tego robots.txt
Każdy poważny crawler respektuje robots.txt domeny. Deklaruje on, które ścieżki są poza zasięgiem. Przy crawlowaniu własnej strony reguły ustalają Państwo. Przy crawlowaniu cudzej strony muszą Państwo trzymać się ich reguł.
Crawling vs ręczne wgrywanie
| Aspekt | Ręczne wgrywanie | Crawling |
|---|---|---|
| Wysiłek początkowy | Wysoki (plik po pliku) | Niski (jeden URL) |
| Aktualność | Tak świeża jak ostatnie wgranie | Automatyczna przy każdym uruchomieniu crawlera |
| Kontrola | Pełna | Przez listy dozwolonych/zablokowanych |
| Najlepsze do | PDF, dokumenty Word, dane statyczne | Strony dynamiczne, FAQ, katalogi produktów |
Crawling w SendSeven
Baza wiedzy SendSeven może być zasilana z wielu źródeł: wgranych dokumentów (PDF, DOCX), crawlów stron (z konfigurowalną częstotliwością odświeżania) oraz wpisów ręcznych. Treść z crawlingu jest natychmiast dostępna dla chatbota AI i agenta AI jako podstawa odpowiedzi.