Rastreo web (Crawling)

El rastreo web (crawling) es la visita y captura automática de páginas o documentos web por parte de un programa. En contextos de mensajería, el crawling se utiliza para alimentar automáticamente el contenido de un sitio web en una base de conocimiento de IA — en lugar de subir cada documento a mano.

¿Qué significa rastreo web?

El rastreo web (de «to crawl», arrastrarse) es el proceso automático mediante el cual un programa (el «crawler» o «bot») visita sistemáticamente páginas de la web, lee su contenido y sigue los enlaces. Google lo hace para construir su índice. Las plataformas de IA lo hacen para alimentar automáticamente una base de conocimiento.

El rastreo en el contexto de IA

Para que un chatbot de IA o un agente de IA responda preguntas de clientes, debe conocer su negocio: productos, precios, condiciones de envío, FAQ, horarios. Clásicamente, este conocimiento se sube laboriosamente, documento por documento. Con el rastreo, basta una sola entrada — la URL de la página de inicio. El crawler recorre las subpáginas enlazadas y las almacena como fuentes consultables.

Cómo funciona un crawler de IA

  1. URL de inicio: Usted proporciona el dominio, por ejemplo www.suempresa.com.
  2. Comprobación de robots.txt: El crawler lee el archivo robots.txt y respeta qué áreas no debe pisar.
  3. Uso del sitemap: Cuando está disponible, utiliza el sitemap XML como mapa para un rastreo eficiente.
  4. Descarga de páginas: Cada página se descarga y se analiza el HTML.
  5. Extracción de contenido: Se retiran navegación, pies de página y banners de cookies; solo permanecen el texto real y la estructura de encabezados.
  6. Indexación: El contenido se divide en fragmentos más pequeños y semánticamente significativos, y se almacena en una base de datos vectorial.
  7. Actualizaciones: A intervalos configurables, el crawler comprueba de nuevo si el contenido ha cambiado.

Qué puede salir mal en el rastreo

  • Páginas renderizadas con JavaScript: El contenido cargado únicamente por JavaScript es invisible para muchos crawlers. Solución: renderizado en servidor o un crawler moderno basado en navegador headless.
  • Áreas protegidas por inicio de sesión: Tras un login, el crawler no ve nada — salvo que usted proporcione credenciales.
  • Contenido obsoleto: Si el crawler corre solo una vez, la base de conocimiento envejece rápido. Las actualizaciones regulares son obligatorias.
  • Problemas estructurales: Sin encabezados claros y HTML semántico, la calidad de recuperación cae.

Qué tiene que ver el robots.txt

Todo crawler serio respeta el robots.txt de un dominio. Declara qué rutas están vetadas. Al rastrear su propia web, usted fija las reglas. Al rastrear un tercero, debe seguir las suyas.

Rastreo vs carga manual

AspectoCarga manualRastreo
Esfuerzo inicialAlto (archivo por archivo)Bajo (una URL)
FrescuraTan fresca como la última subidaAutomática en cada ejecución
ControlTotalMediante listas de permitidos/denegados
Ideal paraPDF, documentos Word, datos estáticosWebs dinámicas, FAQ, catálogos de producto

El rastreo en SendSeven

La base de conocimiento de SendSeven puede alimentarse desde múltiples fuentes: documentos subidos (PDF, DOCX), rastreos de sitios web (con cadencia de actualización configurable) y entradas directas. El contenido rastreado queda inmediatamente disponible para el chatbot de IA y el agente de IA como base de respuesta.