CrawlHawk

Cómo Funciona CrawlHawk

Última actualización: 10 de julio de 2026

Cada rastreo sigue el mismo flujo de trabajo: elija una herramienta (sitemap, extracción por IA, o rastreo personalizado), configure un alcance (cuánto del sitio rastrear), seleccione el tipo de enlace y formato de salida que necesita, luego inicie. Se deducen créditos por cada URL procesada, y los resultados se entregan en su formato elegido, listos para descarga o integración. La tarifa gratuita cubre 500 URLs sin necesidad de tarjeta de crédito.

Paso 1 — Elija su Herramienta

CrawlHawk ofrece tres herramientas principales, cada una optimizada para diferentes flujos de trabajo. El Generador de Sitemap XML rastrea su dominio (o el alcance seleccionado), identifica cada URL indexable y produce un sitemap en XML listo para motores de búsqueda siguiendo el protocolo de sitemaps.org. La salida es aceptada por Google Search Console, Bing Webmaster Tools y otros motores de búsqueda sin modificaciones. Ideal para equipos de SEO generando sitemaps para nuevos lanzamientos, reconstrucciones post-migración o mantenimiento continuo.

El Extractor de Productos por IA extrae datos de productos estructurados de páginas de comercio electrónico usando un modelo de IA que lee las páginas como lo haría un humano — sin selectores XPath, recetas por sitio ni configuraciones de plantillas. Extrae títulos, descripciones, precios, variantes, galerías de imágenes, SKUs y otros atributos en Shopify, WooCommerce, Magento, BigCommerce y sitios personalizados. Ideal para migraciones de comercio electrónico, importaciones de datos de proveedores e investigación de productos de la competencia.

El Rastreador de Enlaces Personalizado entrega datos de enlaces sin procesar para análisis — por cada enlace descubierto, recibe la URL de origen, la URL de destino, el texto del enlace, el estado HTTP, el tipo de enlace y los atributos rel. Ideal para auditorías SEO, mantenimiento de enlaces rotos, revisiones de enlaces internos y cualquier tarea que necesite datos de enlaces granulares combinando varias categorías en un solo conjunto de datos consolidado.

Paso 2 — Configure el Alcance del Rastreo

CrawlHawk soporta cinco modos de alcance que controlan qué tan ampliamente se extiende el crawler desde su URL inicial: Dominio Completo (todo el sitio incluyendo subdominios), Solo Dominio Principal (excluye subdominios), Solo Subdominio (un subdominio en aislamiento), Ruta Única (una sección, como /productos/), y Página Única (solo una URL). Para una descripción completa de cuándo usar cada uno — junto con una tabla de referencia rápida de tarea a alcance — vea Explicación del Alcance del Rastreo.

El alcance determina el consumo de créditos — un rastreo de Ruta Única en 1,000 URLs cuesta aproximadamente 1,000 créditos, independientemente de cuán grande sea el resto del sitio. Elegir el alcance correcto para su tarea es la palanca más grande para la eficiencia de créditos.

Paso 3 — Seleccione Tipos de Enlaces

Seleccione qué categorías de enlaces reportará el rastreo. Combine cualquier combinación en un solo rastreo — cada tipo de enlace está incluido en cada plan. Los Enlaces Internos son la base de auditorías de enlaces internos y análisis de silos de contenido. Los Enlaces Externos son enlaces salientes a otros dominios, usados para auditorías de marca y análisis de tráfico saliente. Los Enlaces Rotos son enlaces que devuelven códigos de estado HTTP 4xx o 5xx, críticos para el mantenimiento SEO técnico.

Páginas Huérfanas son páginas que existen pero no tienen enlaces internos entrantes — invisibles para la mayoría de los rastreadores y difíciles de encontrar para los usuarios. Los Enlaces de Archivo incluyen PDFs, DOCXs, ZIPs, MP4s y otros recursos descargables. Los Enlaces de Imagen cubren cada URL de imagen en el alcance rastreado con texto alternativo y dimensiones donde estén disponibles. El conjunto resultante de datos muestra cada enlace con sus atributos completos, filtrable por tipo, estado, página de origen o destino.

Paso 4 — Elija el Formato de Salida

CrawlHawk entrega los resultados del rastreo en siete formatos — elija el que se ajuste a su flujo de trabajo posterior. CSV para revisión y análisis directo en hoja de cálculo. JSON para procesamiento programático e integración API. Excel XLSX para informes estructurados y análisis de tablas dinámicas. HTML para revisión visual y renderizado compartible. PDF para entregables a clientes y archivos. XML sitemap para envío directo a motores de búsqueda cuando la generación de sitemaps es el objetivo. Y Markdown principal limpio (.md) para alimentar páginas rastreadas en flujos de trabajo de IA y LLM.

Todos los formatos incluyen la misma estructura subyacente del conjunto de datos — la elección del formato no cambia qué datos se capturan, solo cómo se presentan. Puede exportar el mismo rastreo en múltiples formatos sin volver a ejecutarlo, lo que es útil cuando diferentes partes interesadas necesitan los mismos datos en presentaciones diferentes (el desarrollador quiere JSON, el consultor SEO quiere Excel, el cliente quiere PDF).

Paso 5 — Ejecute el Rastreo

Haga clic en Ejecutar, y CrawlHawk comienza el procesamiento. El rastreador descubre URLs mediante una búsqueda en amplitud — las páginas en profundidad 1 (vinculadas directamente desde su URL de inicio) se rastrean primero, luego la profundidad 2, y así sucesivamente. Esto significa que las páginas de alta importancia se procesan primero, y el rastreo produce resultados útiles incluso si se interrumpe a la mitad. La profundidad máxima de rastreo es configurable. Los rastreos también pueden programarse para ejecutarse automáticamente en un intervalo elegido — diario, semanal o mensual — lo que convierte cualquier auditoría única en un monitoreo continuo sin reiniciación manual; los rastreos programados consumen créditos de la misma manera que los manuales.

Para sitios renderizados en JavaScript (React, Vue, Angular SPAs, contenido cargado por AJAX), habilite la renderización de JavaScript. Esto utiliza créditos adicionales por URL porque la página se renderiza completamente antes de la extracción de contenido — pero captura contenido que sería invisible para una obtención de HTML sin procesar. Muchos sitios modernos requieren este modo para resultados precisos.

Los rastreos se ejecutan en la nube y continúan cuando cierra el navegador. Rastreos más pequeños (unos cientos de URLs) generalmente se completan en 1-5 minutos. Rastreos de tamaño medio (5,000 URLs) toman aproximadamente 15-45 minutos. Rastreos más grandes (50,000+ URLs) pueden tomar varias horas dependiendo de los tiempos de respuesta del servidor objetivo y la concurrencia configurada. El progreso es visible en su panel de control, y se activan notificaciones webhook cuando un rastreo se completa para la integración en flujos de trabajo automatizados.

Cómo Funcionan los Créditos

CrawlHawk utiliza un sistema de créditos de pago único — compre un paquete de créditos, los créditos nunca expiran, y los gasta a medida que rastrea. El consumo estándar de créditos es un crédito por URL rastreada. Se consumen créditos adicionales por URL para la renderización de JavaScript (requerida para contenido cargado del lado del cliente vía JavaScript) y para la extracción por IA vía el Extractor de Productos por IA (el procesamiento por IA es la parte más computacionalmente costosa del proceso).

El costo exacto en créditos se muestra antes de que comience cada rastreo para que no haya sorpresas. La tarifa gratuita cubre 500 URLs sin tarjeta de crédito o compromiso de registro — suficiente para ejecutar varios rastreos de prueba de concepto. Los paquetes de créditos están disponibles desde su panel de cuenta en múltiples niveles. No hay licenciamiento por asiento. Consulte la página de Precios para conocer el precio actual de los paquetes de créditos.

Cómo Funciona la Extracción por IA

El Extractor de Productos por IA utiliza un modelo de lenguaje que lee las páginas como lo haría un humano, identificando atributos de productos independientemente de la estructura HTML subyacente. Esto elimina la necesidad de selectores XPath por sitio o recetas de raspado — la IA funciona en un sitio que nunca ha visto antes, la primera vez, y sigue funcionando cuando los sitios rediseñan sus diseños.

Cuando envía una URL de producto, la IA extrae el título del producto y la descripción completa, el precio (incluida la moneda y cualquier precio de oferta), el SKU e identificadores de producto, la marca, los datos de variantes (tamaños, colores, configuraciones), las URLs de la galería de imágenes, las dimensiones, el peso, los materiales, las especificaciones, y el estado del stock — lo que sea que esté presente en la página. La salida se entrega como una fila por producto con cada atributo como una columna separada, lista para importación directa en Shopify, WooCommerce, sistemas ERP, o herramientas de gestión de información de productos (PIM).

La IA funciona en Shopify, WooCommerce, Magento, BigCommerce, tiendas personalizadas y la mayoría de los mercados. La misma IA maneja diferentes plataformas de comercio electrónico sin configuración por plataforma ni selección de plantilla — la variedad estructural en las páginas de productos es lo que la IA está específicamente entrenada para manejar.

Opciones de Integración

CrawlHawk se integra con sus flujos de trabajo existentes a través de varios mecanismos. El acceso API está disponible en cada cuenta para la iniciación programática del rastreo, los chequeos de estado, y la recuperación de resultados — endpoints estándar REST con autenticación por llave de API, llamables desde cualquier cliente HTTP o plataforma de automatización de flujos de trabajo.

Las notificaciones webhook se activan cuando un rastreo se completa, con el payload del resultado entregado a su URL de webhook configurada. Esto es útil para automatizar el procesamiento posterior — alertas por Slack a su canal de equipo, actualizaciones de panel de control, flujos de importación automatizados en su CRM o PIM, lógica de re-precio condicional basada en datos de la competencia. Los webhooks entregan JSON estructurado que coincide con el formato de la respuesta estándar de API.

Los rastreos programados le permiten establecer un rastreo para ejecutarse en un horario recurrente (cada hora, diario, semanal o personalizado) sin intervención manual. Útil para importaciones de datos continuas, auditorías SEO recurrentes, o cualquier tarea que se beneficie de ejecuciones automáticas regulares. Los rastreos programados consumen créditos en cada ejecución programada, igual que los rastreos manuales.

Detrás de Escenas — Cómo Funciona un Web Crawler

Un web crawler funciona en un bucle simple: obtiene una página, analiza el HTML para encontrar cada enlace en él, agrega las nuevas URLs descubiertas a una cola, y repite — expandiéndose desde la URL inicial hasta que se cubre el alcance elegido. En el camino, registra lo que devolvió cada página y enlace (códigos de estado, atributos de enlace, contenido), que es los datos sin procesar detrás de los sitemaps, auditorías de enlaces y extracciones. CrawlHawk ejecuta este bucle en amplitud, por lo que las páginas más prominentes se procesan primero.

CrawlHawk opera sobre infraestructura alojada en la UE basada en Hungría, con procesamiento y retención de datos conforme al RGPD. Nuestro motor utiliza una infraestructura de obtención de nivel empresarial para la renderización de JavaScript, rotación de IPs en grupos de proxys globales y manejo de sitios con protección sofisticada contra bots. La extracción por IA se realiza a través de la API de OpenAI; OpenAI no utiliza el contenido de la API para el entrenamiento del modelo, y CrawlHawk no opta por compartir datos de entrenamiento — vea la Política de Privacidad para el flujo completo de datos.

El HTML renderizado está disponible para descarga durante 90 días después de que cada rastreo se complete, apoyando flujos de trabajo de depuración donde necesita verificar exactamente qué vio el crawler en las páginas renderizadas por JavaScript. Los resultados del rastreo y los informes también se retienen por 90 días por defecto, con eliminación disponible bajo pedido antes. Los créditos, datos de cuenta e información de facturación siguen políticas estándar de retención conforme al RGPD.

Flujos de Trabajo Comunes

Auditoría SEO del sitio — Envíe su dominio como un rastreo de Dominio Completo con los seis tipos de enlaces seleccionados. Revise los resultados en Excel: enlaces rotos para corregir, Páginas Huérfanas para destapar, patrones de Enlaces Internos para optimizar, Enlaces Externos para revisión de seguridad de marca. Reejecute trimestralmente para medir mejoras con el tiempo.

Migración de comercio electrónico — Envíe sus antiguas URLs de producto al Extractor de Productos por IA. Exporte los datos de productos estructurados como XLSX. Importe a su nueva plataforma (Shopify, WooCommerce, Magento) con un mapeo ligero de columnas. El mismo flujo de trabajo maneja catálogos desde unos pocos cientos hasta decenas de miles de productos.

Investigación de productos de la competencia — Envíe la URL de una categoría de productos de un competidor con el alcance de Ruta Única y el Extractor de Productos por IA habilitado. La IA extrae todos los productos en la categoría con atributos completos. Programe el mismo rastreo para ejecutarse diariamente o semanalmente para un monitoreo continuo de la competencia sin reiniciación manual.

Regeneración de sitemap — Envíe su dominio al Generador de Sitemap XML en alcance de Dominio Completo. Descargue la salida en XML. Cargue en Google Search Console y Bing Webmaster Tools. Programe una regeneración mensual para sitios con contenido cambiante frecuentemente.

QA previo a la publicación — Envíe una URL de página de borrador vía Página Única con todos los tipos de enlaces seleccionados. Verifique que cada enlace interno apunte a una página en vivo, cada enlace externo aún funcione, cada imagen se cargue correctamente. Detecta problemas antes de la publicación en lugar de después.

→ Inicie su primer rastreo · Vea herramientas específicas: Generador de Sitemap XML · Extractor de Productos por IA · Rastreador de Enlaces Personalizado · Precios: Precios

Preguntas Frecuentes

¿Cuánto tiempo dura un rastreo típico?

Depende del tamaño y los tiempos de respuesta del servidor objetivo. Un rastreo de 500 URLs en la tarifa gratuita suele completarse en 1-5 minutos. Un sitio de 5,000 URLs tarda aproximadamente 15-45 minutos. Un sitio de 50,000 URLs puede tardar varias horas. Los rastreos más grandes escalan proporcionalmente con configuraciones de concurrencia configuradas. La renderización de JavaScript añade tiempo por URL porque cada página se renderiza completamente antes de la extracción.

¿Qué ocurre si me quedo sin créditos durante un rastreo?

El rastreo se detiene al alcanzar el límite de créditos y reporta lo que se completó hasta ese punto — no hay cargos adicionales sorpresa. Puede comprar créditos adicionales y continuar con un rastreo posterior en las URLs restantes. Los resultados parciales del rastreo detenido son descargables en su formato elegido.

¿Puedo cancelar un rastreo en progreso?

Sí — cancele desde su panel de cuenta. Los créditos consumidos hasta el punto de cancelación no se reembolsan, pero no se gastan créditos adicionales. Los resultados parciales hasta la cancelación están disponibles para descarga.

¿Dónde se almacena mi data?

Infraestructura alojada en la UE en Hungría. Los resultados del rastreo, incluyendo el HTML renderizado, se retienen por 90 días después del rastreo. Ambos eliminables bajo solicitud antes. Los detalles completos del flujo de datos están en la Política de Privacidad.

¿Necesito habilidades técnicas para usar CrawlHawk?

No — el Extractor de Productos por IA y los modos de rastreo estándar no requieren XPath, selectores ni scripting. La interfaz es de señalar y configurar: envíe URL, elija alcance, seleccione tipos de enlaces, elija formato de salida, ejecute. Para desarrolladores, la API permite integraciones personalizadas y automatización de flujos de trabajo.

¿Qué pasa si el sitio objetivo bloquea el rastreo?

Algunos sitios utilizan protección agresiva contra bots. Nuestro motor maneja la mayoría de las protecciones modernas (rotación IP en grupos de proxys globales, huellas dactilares de navegador, renderización de JavaScript). Los rastreos en sitios fuertemente protegidos pueden producir resultados parciales — probar en una pequeña muestra antes de realizar rastreos grandes es el enfoque recomendado. El comportamiento del rastreo se rige por la Política de Uso Aceptable.

¿El precio es por asiento?

No — CrawlHawk no tiene licenciamiento por asiento ni tarifa por usuario. Los créditos pertenecen a la cuenta, y cada cuenta está diseñada para un solo usuario.

¿Es legal el rastreo web?

Rastrear sitios web públicamente accesibles es una práctica establecida desde hace mucho tiempo y ampliamente utilizada — los motores de búsqueda se basan en ella — pero la legalidad depende de qué se rastrea y cómo se usan los resultados: los términos del sitio objetivo, robots.txt, derechos de autor, derechos de bases de datos y la ley de protección de datos, todo se aplica, y la responsabilidad de cada rastreo recae en el usuario. CrawlHawk respeta robots.txt por defecto; las reglas están establecidas en la Política de Uso Aceptable. Esta es información general, no consejo legal.

¿CrawlHawk funciona en aplicaciones de una sola página con JavaScript intensivo?

Sí — con la renderización de JavaScript habilitada (créditos adicionales por URL), el rastreador captura contenido renderizado del lado del cliente vía JavaScript incluyendo React, Vue, aplicaciones de una sola página Angular, y contenido cargado por AJAX. Para páginas HTML estáticas, la renderización de JavaScript no es necesaria y ahorra créditos.

Comience a rastrear — 500 URLs gratis, no se requiere tarjeta de crédito →