Rastreio web (Crawling)

O rastreio web (crawling) é a visita e captura automáticas de páginas ou documentos web por um programa. Em contextos de mensagens, o crawling é usado para alimentar automaticamente o conteúdo de um site numa base de conhecimento de IA — em vez de carregar cada documento manualmente.

O que significa crawling?

O crawling (de «to crawl», rastejar) é o processo automático em que um programa (o «crawler» ou «bot») visita sistematicamente páginas na web, lê o seu conteúdo e segue os links. A Google fá-lo para construir o seu índice. As plataformas de IA fazem-no para alimentar automaticamente uma base de conhecimento.

O crawling no contexto de IA

Para que um chatbot de IA ou um agente de IA responda às perguntas dos clientes, precisa de conhecer o seu negócio: produtos, preços, condições de envio, FAQ, horários. Classicamente, este conhecimento é carregado laboriosamente, documento a documento. Com o crawling, basta uma única entrada — o URL da página inicial. O crawler percorre as subpáginas ligadas e armazena-as como fontes consultáveis.

Como funciona um crawler de IA

  1. URL inicial: Você fornece o domínio, por exemplo www.suaempresa.com.
  2. Verificação do robots.txt: O crawler lê o ficheiro robots.txt e respeita quais áreas não pode entrar.
  3. Uso do sitemap: Quando disponível, usa o sitemap XML como mapa para um rastreio eficiente.
  4. Descarga das páginas: Cada página é descarregada e o HTML analisado.
  5. Extração de conteúdo: Navegação, rodapés e banners de cookies são retirados; só ficam o texto real e a estrutura de cabeçalhos.
  6. Indexação: O conteúdo é dividido em pedaços mais pequenos e semanticamente significativos, e armazenado numa base de dados vetorial.
  7. Atualizações: Em intervalos configuráveis, o crawler verifica de novo se o conteúdo mudou.

O que pode correr mal no crawling

  • Páginas renderizadas em JavaScript: O conteúdo carregado apenas por JavaScript é invisível para muitos crawlers. Solução: renderização do lado do servidor ou um crawler moderno baseado em navegador headless.
  • Áreas protegidas por login: Por trás de um login, o crawler não vê nada — exceto se você fornecer credenciais.
  • Conteúdo desatualizado: Se o crawler correr apenas uma vez, a base de conhecimento envelhece depressa. Atualizações regulares são obrigatórias.
  • Problemas estruturais: Sem cabeçalhos claros e HTML semântico, a qualidade da recuperação cai.

O que o robots.txt tem a ver com isto

Qualquer crawler sério respeita o robots.txt de um domínio. Declara quais caminhos estão fora dos limites. Ao rastrear o seu próprio site, você define as regras. Ao rastrear terceiros, tem de seguir as deles.

Crawling vs carregamento manual

AspetoCarregamento manualCrawling
Esforço inicialAlto (ficheiro a ficheiro)Baixo (um URL)
FrescuraTão fresca quanto o último carregamentoAutomática em cada execução do crawler
ControloTotalAtravés de listas de permissões/negações
Ideal paraPDF, documentos Word, dados estáticosSites dinâmicos, FAQ, catálogos de produtos

O crawling na SendSeven

A base de conhecimento da SendSeven pode ser alimentada a partir de várias fontes: documentos carregados (PDF, DOCX), crawls de sites (com cadência de atualização configurável) e entradas diretas. O conteúdo rastreado fica imediatamente disponível para o chatbot de IA e o agente de IA como base de resposta.