Tarama (Crawling)

Tarama (crawling), web sayfalarının veya belgelerin bir program tarafından otomatik olarak ziyaret edilip alınmasıdır. Mesajlaşma bağlamında tarama, her belgeyi elle yüklemek yerine bir web sitesinin içeriğini otomatik olarak yapay zekâ bilgi tabanına aktarmak için kullanılır.

Tarama ne anlama gelir?

Tarama (İng. «to crawl», emeklemek), bir programın («crawler» veya «bot») web'deki sayfaları sistematik olarak ziyaret ettiği, içeriklerini okuduğu ve bağlantıları izlediği otomatik süreçtir. Google bunu kendi dizinini oluşturmak için yapar. Yapay zekâ platformları bunu bir bilgi tabanını otomatik beslemek için yapar.

Yapay zekâ bağlamında tarama

Bir yapay zekâ chatbot'unun veya yapay zekâ ajanının müşteri sorularını yanıtlayabilmesi için işinizi bilmesi gerekir: ürünler, fiyatlar, kargo koşulları, SSS, çalışma saatleri. Klasik olarak bu bilgi belge belge zahmetle yüklenir. Tarama ile tek bir giriş yeter — ana sayfa URL'si. Tarayıcı bağlantı verilen alt sayfaları gezer ve onları aranabilir kaynak olarak depolar.

Yapay zekâ tarayıcısı nasıl çalışır

  1. Başlangıç URL'si: Alan adını sağlarsınız, örneğin www.firmaniz.com.
  2. robots.txt kontrolü: Tarayıcı robots.txt dosyasını okur ve giremeyeceği alanlara saygı gösterir.
  3. Site haritası kullanımı: Mevcutsa, verimli tarama için XML site haritasını harita olarak kullanır.
  4. Sayfaların alınması: Her sayfa indirilir ve HTML çözümlenir.
  5. İçerik çıkarımı: Gezinme, alt bilgi, çerez bannerları çıkarılır; yalnızca asıl metin ve başlık yapısı kalır.
  6. Dizinleme: İçerik daha küçük, anlamsal açıdan bütünlüklü parçalara bölünür ve bir vektör veritabanında saklanır.
  7. Güncellemeler: Yapılandırılabilir aralıklarla tarayıcı içeriğin değişip değişmediğini yeniden kontrol eder.

Taramada neler yanlış gidebilir

  • JavaScript ile oluşturulan sayfalar: Yalnızca JavaScript ile yüklenen içerik birçok tarayıcı için görünmezdir. Çözüm: sunucu tarafı render veya modern bir headless tarayıcı tabanlı crawler.
  • Oturum açma korumalı alanlar: Oturum açmanın arkasında tarayıcı hiçbir şey görmez — siz kimlik bilgisi vermedikçe.
  • Eski içerik: Tarayıcı yalnızca bir kez çalışırsa bilgi tabanı hızla yaşlanır. Düzenli güncellemeler zorunludur.
  • Yapısal sorunlar: Net başlıklar ve anlamsal HTML olmadan getirim kalitesi düşer.

robots.txt'nin bununla ne ilgisi var

Ciddi her tarayıcı bir alan adının robots.txt'sine saygı gösterir. Hangi yolların yasak olduğunu bildirir. Kendi web sitenizi tararken kuralları siz koyarsınız. Üçüncü taraf bir siteyi tararken onların kurallarını izlemelisiniz.

Tarama vs elle yükleme

YönElle yüklemeTarama
Başlangıç eforuYüksek (dosya dosya)Düşük (tek URL)
TazelikYalnızca son yükleme kadar tazeHer tarayıcı çalışmasında otomatik
KontrolTamİzin/engelleme listeleri ile
En uygunuPDF, Word belgeleri, statik verilerDinamik web siteleri, SSS bölümleri, ürün katalogları

SendSeven'da tarama

SendSeven bilgi tabanı birden çok kaynaktan beslenebilir: yüklenmiş belgeler (PDF, DOCX), web sitesi taramaları (yapılandırılabilir güncelleme sıklığıyla) ve doğrudan girişler. Taranan içerik, yanıt temeli olarak yapay zekâ chatbot'u ve ajanı için anında kullanılabilir.