Rastreio web (Crawling)
O rastreio web (crawling) é a visita e captura automáticas de páginas ou documentos web por um programa. Em contextos de mensagens, o crawling é usado para alimentar automaticamente o conteúdo de um site numa base de conhecimento de IA — em vez de carregar cada documento manualmente.
O que significa crawling?
O crawling (de «to crawl», rastejar) é o processo automático em que um programa (o «crawler» ou «bot») visita sistematicamente páginas na web, lê o seu conteúdo e segue os links. A Google fá-lo para construir o seu índice. As plataformas de IA fazem-no para alimentar automaticamente uma base de conhecimento.
O crawling no contexto de IA
Para que um chatbot de IA ou um agente de IA responda às perguntas dos clientes, precisa de conhecer o seu negócio: produtos, preços, condições de envio, FAQ, horários. Classicamente, este conhecimento é carregado laboriosamente, documento a documento. Com o crawling, basta uma única entrada — o URL da página inicial. O crawler percorre as subpáginas ligadas e armazena-as como fontes consultáveis.
Como funciona um crawler de IA
- URL inicial: Você fornece o domínio, por exemplo
www.suaempresa.com. - Verificação do robots.txt: O crawler lê o ficheiro
robots.txte respeita quais áreas não pode entrar. - Uso do sitemap: Quando disponível, usa o sitemap XML como mapa para um rastreio eficiente.
- Descarga das páginas: Cada página é descarregada e o HTML analisado.
- Extração de conteúdo: Navegação, rodapés e banners de cookies são retirados; só ficam o texto real e a estrutura de cabeçalhos.
- Indexação: O conteúdo é dividido em pedaços mais pequenos e semanticamente significativos, e armazenado numa base de dados vetorial.
- Atualizações: Em intervalos configuráveis, o crawler verifica de novo se o conteúdo mudou.
O que pode correr mal no crawling
- Páginas renderizadas em JavaScript: O conteúdo carregado apenas por JavaScript é invisível para muitos crawlers. Solução: renderização do lado do servidor ou um crawler moderno baseado em navegador headless.
- Áreas protegidas por login: Por trás de um login, o crawler não vê nada — exceto se você fornecer credenciais.
- Conteúdo desatualizado: Se o crawler correr apenas uma vez, a base de conhecimento envelhece depressa. Atualizações regulares são obrigatórias.
- Problemas estruturais: Sem cabeçalhos claros e HTML semântico, a qualidade da recuperação cai.
O que o robots.txt tem a ver com isto
Qualquer crawler sério respeita o robots.txt de um domínio. Declara quais caminhos estão fora dos limites. Ao rastrear o seu próprio site, você define as regras. Ao rastrear terceiros, tem de seguir as deles.
Crawling vs carregamento manual
| Aspeto | Carregamento manual | Crawling |
|---|---|---|
| Esforço inicial | Alto (ficheiro a ficheiro) | Baixo (um URL) |
| Frescura | Tão fresca quanto o último carregamento | Automática em cada execução do crawler |
| Controlo | Total | Através de listas de permissões/negações |
| Ideal para | PDF, documentos Word, dados estáticos | Sites dinâmicos, FAQ, catálogos de produtos |
O crawling na SendSeven
A base de conhecimento da SendSeven pode ser alimentada a partir de várias fontes: documentos carregados (PDF, DOCX), crawls de sites (com cadência de atualização configurável) e entradas diretas. O conteúdo rastreado fica imediatamente disponível para o chatbot de IA e o agente de IA como base de resposta.