CrawlHawk
CrawlHawk

CrawlHawk.com

Rastrea hasta 500 enlaces únicos GRATIS. Mejora para más créditos y características.

Elige Tu Tipo de Rastreo

Rastrea Cualquier Sitio Web. Genera Mapas de Sitio. Extrae Datos de Productos.

Tres flujos de trabajo. Un paquete de créditos. Cero suscripción.

CrawlHawk es una herramienta de datos web basada en créditos que combina tres flujos de trabajo en una cuenta: un rastreador web para auditorías de sitios y descubrimiento de enlaces, un generador de mapas de sitio XML listo para Google, y un extractor de datos de productos con IA para páginas de comercio electrónico. No hay suscripción, los créditos nunca expiran y cada cuenta incluye todas las funciones. Comienza gratis con 500 URLs y mejora solo cuando necesites más. Construido y operado en la UE según GDPR.

Tres Flujos de Trabajo en Una Herramienta

Generador de Mapas de Sitio XML

Mapas de sitio listos para Google desde cualquier dominio — en un solo rastreo.

CrawlHawk rastrea tu dominio (o un ámbito seleccionado), identifica cada URL indexable, y genera un mapa de sitio XML listo para motores de búsqueda siguiendo el protocolo de sitemaps.org. El resultado es aceptado por Google Search Console, Bing Webmaster Tools, Yandex Webmaster, y todos los principales motores de búsqueda sin modificación.

Úsalo para lanzamientos de nuevos sitios (para que los motores de búsqueda descubran tus páginas rápidamente), reconstrucciones de mapas de sitio post-migración cuando cambian las estructuras de URL, actualizaciones de catálogos de comercio electrónico y mantenimiento SEO continuo. CrawlHawk respeta las etiquetas meta noindex, URLs canónicas y directivas de robots.txt, y automáticamente divide mapas de sitio que exceden el límite de 50,000 URLs en un archivo índice de mapas de sitio. Sin instalación, sin plugin, sin tarifa recurrente — paga solo por las URLs que rastreas, con créditos que nunca expiran.

Rastreador de Enlaces Personalizado

Auditorías de enlaces granulares, configuradas a tu manera.

Elige el ámbito (dominio completo, solo dominio principal, un solo subdominio, ruta de URL o una sola página) y los tipos de enlaces que deseas (internos, externos, rotos, huérfanos, archivos, imágenes). Para cada enlace descubierto, CrawlHawk devuelve la URL de origen, la URL de destino, el texto del ancla, el código de estado HTTP, el tipo de enlace y los atributos rel (nofollow, sponsored, ugc, noopener).

Exporta a CSV (para hojas de cálculo), JSON (para uso programático), Excel XLSX (para informes), HTML (para revisión visual), PDF (para entregables al cliente) o formato de mapa de sitio XML. Los usos comunes incluyen auditorías SEO del sitio, mantenimiento de enlaces rotos, revisiones de enlaces internos, inventarios de enlaces salientes y análisis de estructuras de competidores. La renderización de JavaScript para contenido cargado dinámicamente es compatible a un coste adicional de crédito por URL.

Extractor de Productos con IA

Datos estructurados de productos desde cualquier página de comercio electrónico — sin receta.

Apunta CrawlHawk a una página de producto, categoría o catálogo completo. Un modelo de IA lee la página como lo haría un humano y extrae títulos, descripciones completas, precios (incluyendo moneda y precios de oferta), SKUs, marcas, datos de variantes (tamaños, colores, configuraciones), galerías de imágenes, dimensiones, pesos, materiales, especificaciones y estado de stock — sin reglas XPath manuales, recetas por sitio o configuración de plantillas.

El mismo extractor funciona a través de tiendas Shopify, tiendas WooCommerce, Magento, BigCommerce, sitios hechos a medida y la mayoría de los grandes mercados. La salida se entrega como XLSX, JSON o CSV — cada producto es una fila con columnas de atributos consistentes, listo para importación directa en Shopify, WooCommerce, tu ERP o cualquier herramienta PIM. Las páginas de productos renderizadas con JavaScript son compatibles a un coste adicional de crédito por URL.

Opciones de Rastreo

CrawlHawk admite cinco modos de ámbito, para que puedas dirigirte exactamente a la parte web que te interesa — desde un dominio completo hasta una sola página. Los cinco modos funcionan con cada tipo de enlace y formato de salida; el ámbito solo controla cuánto se extiende el rastreo.

Rastrear Dominio Completo

Cada página interna accesible desde una URL inicial.

Envía una URL y CrawlHawk descubre cada página interna dentro del mismo dominio — a través de todos los caminos, secciones y URLs accesibles. El rastreo de dominio completo es ideal para auditorías completas del sitio, generación de mapas de sitio XML para nuevos lanzamientos y mapeo completo de enlaces internos. Devuelve un inventario completo de la estructura rastreable de tu sitio con cada URL, la página desde la que se descubrió y su profundidad de rastreo.

Para plataformas muy grandes con millones de URLs (eBay, Amazon, Wikipedia, YouTube), usa un ámbito más ajustado o restríngete a caminos de URL específicos — rastrear todo el dominio a esa escala consume grandes cantidades de créditos y puede estar limitado por las protecciones del sitio de destino. Para sitios de tamaño medio con menos de 50,000 páginas, el modo de dominio completo suele ser la elección correcta para un trabajo SEO exhaustivo, generación de mapas de sitio y auditorías de enlaces.

Solo Dominio Principal

Rastra un dominio — omite los subdominios.

Cuando un sitio usa subdominios para propiedades separadas (blog.example.com, shop.example.com, docs.example.com, support.example.com), el modo Solo Dominio Principal rastrea solo example.com y excluye todos los subdominios. El rastreador sigue enlaces internos dentro del dominio principal pero ignora cualquier enlace que cruzaría a un subdominio.

Esto es útil cuando tu sitio principal, blog, tienda y centro de soporte operan como propiedades lógicamente separadas — cada una con su propia estrategia de contenido, mapa de sitio y prioridades SEO. Rástréalos independientemente en pases distintivos para mantener los resultados enfocados. Solo Dominio Principal es también la elección correcta cuando necesitas un mapa de sitio que incluya solo las URLs de tu sitio principal, sin URLs de subdominio llenando el índice.

Solo Subdominio

Rastra un subdominio en aislamiento.

Dirígete a un solo subdominio — tu blog (blog.example.com), tu tienda (shop.example.com), tu centro de ayuda (support.example.com), tu portal de desarrolladores (developers.example.com) o cualquier otro subdominio — sin incluir el dominio principal ni ningún subdominio hermano. El rastreador sigue enlaces internos solo dentro del subdominio especificado.

Útil para auditorías específicas de propiedades donde cada subdominio tiene su propia estrategia SEO y requiere un tratamiento separado, para generar sitemaps enfocados por propiedad, o para auditar un subdominio que lanzaste o migraste recientemente. Combina Subdomain Only con la detección de enlaces rotos para encontrar problemas de enlaces post-migración, o con la extracción de enlaces de imagen para inventariar los activos visuales en un subdominio específico.

Ruta Única

Rastrea una sección específica de un sitio.

Restringe el rastreo a un único camino de URL —por ejemplo, example.com/products/, example.com/blog/, o example.com/docs/. CrawlHawk descubre enlaces solo dentro de ese camino e ignora todo lo demás. El rastreador sigue enlaces internos que comienzan con el prefijo de dicha ruta; no sigue enlaces a otras secciones del mismo dominio.

Ideal para auditorías de productos a nivel de categoría (rastrear solo la sección /products/ de una tienda), rastreos de documentación (solo el árbol /docs/), revisiones de la sección de blogs, o análisis de una parte de un sitio muy grande sin procesar todo el sitio. Los rastreos basados en rutas concentran el consumo de créditos y limitan los resultados a lo que realmente necesitas.

Página Única

Extrae todos los enlaces de una URL.

Rastrea una sola URL y captura cada enlace contenido en esa página —internos, externos, archivos, imágenes, rotos— incluidos enlaces renderizados dinámicamente por JavaScript. Devuelve una lista precisa de enlaces salientes de una URL con texto de anclaje completo, URL de destino, estado HTTP y atributos del enlace.

Perfecto para inspecciones puntuales de URLs, auditorías de páginas de destino de competidores (¿a qué enlaza tu competidor desde su página de inicio?), análisis de páginas de productos individuales, comprobaciones de enlaces rotos en una página de alto valor específica, o extracción de referencias salientes de un artículo extenso. El modo de página única es la opción más eficiente en créditos para análisis dirigido y específico: una URL, un crédito.

Tipos de Enlaces a Recoger

Elige qué categorías de enlaces reporta CrawlHawk. Combina tantas como necesites dentro de un solo rastreo — cada tipo de enlace está incluido en cada plan, y un único rastreo puede devolver cualquier combinación de enlaces internos, externos, rotos, huérfanos, de archivo e imagen en un solo conjunto de datos consolidado.

Enlaces Internos

Mapea la estructura de enlaces dentro de tu dominio.

Los enlaces internos conectan páginas dentro del mismo dominio. CrawlHawk informa de cada enlace interno encontrado durante el rastreo, con URL de origen, URL de destino, texto de anclaje, código de estado HTTP y atributos de enlace (rel=nofollow, sponsored, ugc). Los datos de enlaces internos son la base del SEO técnico.

Utiliza los datos para identificar páginas importantes con pocos enlaces internos (páginas con muy pocos enlaces entrantes), para planificar mejoras en los enlaces internos (qué textos de anclaje apuntan a qué páginas), para verificar que las páginas de destino clave son accesibles dentro de 2-3 clics desde la página de inicio, para distribuir la equidad de enlaces de manera eficiente por tu sitio y para planificar arquitecturas de contenido en silo que agrupen las páginas relacionadas por tema.

Enlaces Rotos

Detecta errores 404, 5xx y otros destinos rotos.

Informe de cada enlace que devuelva un código de estado HTTP 4xx o 5xx en el ámbito rastreado. Cada enlace roto se registra con su página de origen (donde aparece el enlace), URL de destino (a qué intenta enlazar), código de estado HTTP exacto (404, 500, 503, etc.) y contexto del enlace (texto de anclaje y texto circundante) — para que puedas solucionar problemas rápidamente.

Crucial para el mantenimiento del SEO técnico (los enlaces rotos dañan las clasificaciones y la experiencia del usuario), limpiezas post-migración (cuando cambian las estructuras de URL, los enlaces internos antiguos se rompen), verificación de enlaces de afiliados (los ingresos por comisiones dependen de enlaces salientes que funcionen) y cheques de salud regulares del sitio. CrawlHawk diferencia entre errores del cliente (4xx — página removida o movida) y errores del servidor (5xx — interrupciones temporales que pueden resolverse al reintentar).

Enlaces Externos

Lista de cada enlace saliente de tu sitio.

Identifica cada enlace que apunta a un dominio diferente. Informa de la página de origen, URL de destino, texto de anclaje completo y atributos rel (nofollow, sponsored, ugc, noopener). El inventario completo de enlaces externos te ayuda a entender a qué enlaza tu sitio y cómo se atribuyen esos enlaces.

Útil para auditorías de enlaces salientes (¿a qué dominios está enviando tráfico tu sitio?), revisiones de seguridad de la marca (¿estás enlazando a sitios a los que preferirías no enlazar?), identificación de tráfico saliente no deseado, verificación de cumplimiento de atributos de enlace para contenido patrocinado o afiliado (la FTC requiere divulgación; Google requiere rel=sponsored para enlaces pagos), y detección de páginas comprometidas con enlaces externos inyectados por malware o contenido hackeado.

Páginas Huérfanas

Encuentra páginas sin enlaces internos entrantes.

Las páginas huérfanas existen en tu sitio pero no tienen enlaces internos que las apunten — lo que las hace invisibles para la mayoría de los rastreadores y difíciles de descubrir para usuarios y motores de búsqueda. CrawlHawk cruza tu sitemap o conjunto de URLs conocidos contra el gráfico de enlaces internos rastreados para identificar páginas que existen pero no están enlazadas desde ningún lugar del sitio.

Crítico para auditorías de cobertura del sitio (¿está cada página importante realmente accesible?), integridad del SEO (Google puede no descubrir o clasificar efectivamente las páginas huérfanas), y verificación post-migración (las migraciones frecuentemente crean huérfanos cuando fallan los redireccionamientos). Las causas comunes de huérfanos incluyen páginas antiguas de aterrizaje, páginas de categorías obsoletas, variantes de pruebas A/B dejadas en producción, y contenido publicado sin ser enlazado desde la navegación o hubs.

Enlaces a Archivos

Extrae enlaces a PDFs, documentos y recursos descargables.

Captura cada enlace que apunta a un archivo descargable — PDF, DOCX, XLSX, ZIP, MP4, MP3, y cualquier otro recurso no HTML. Informa de la página de origen (donde aparece el enlace), la URL del archivo, el tipo y extensión del archivo, y el contexto del enlace (texto de anclaje y texto circundante).

Útil para auditorías de bibliotecas de recursos (¿qué PDFs y documentos en tu sitio están disponibles, y desde dónde se enlazan?), revisiones de accesibilidad de documentos, detección de archivos rotos (enlaces a archivos que 404), revisiones de cumplimiento de GDPR o requerimientos legales (conocer exactamente qué documentos están públicamente enlazados), y SEO de sitios con muchos archivos descargables, hojas de datos, folletos o archivos multimedia. A menudo se combina con el verificador de enlaces rotos para asegurar que todos los archivos enlazados sigan disponibles.

Enlaces a Imágenes

Encuentra cada URL de imagen en un sitio.

Extrae cada URL de origen de imagen a lo largo del ámbito rastreado, con la página de origen donde se incrusta la imagen, el texto alternativo (o su ausencia), las dimensiones cuando están disponibles, y el formato del archivo (JPG, PNG, WebP, AVIF, SVG, GIF). Devuelve un inventario completo de imágenes del ámbito rastreado.

Crucial para auditorías de SEO de imágenes (¿están optimizadas las imágenes, son del tamaño adecuado y usan texto alt para la accesibilidad y búsqueda?), detección de imágenes rotas (imágenes que fallan al cargar dañan la experiencia del usuario), revisiones de cobertura de texto alternativo (¿qué imágenes carecen de atributos alt, requeridos para el cumplimiento de accesibilidad?), migraciones de CDN (necesitas un inventario completo de imágenes antes de mover activos), y auditorías de contenido visual en tu sitio o sitios de competidores.

Qué es CrawlHawk

CrawlHawk es un servicio de extracción de datos web basado en créditos operado por New Horizon Platforms Kft. en Szeged, Hungría. El servicio combina un rastreador web, un generador de sitemaps XML, y un raspador de datos de productos potenciado por IA en una sola interfaz. No hay suscripción mensual — los usuarios compran paquetes de créditos que nunca expiran y desbloquean todas las funciones desde el primer día. El nivel gratuito incluye 500 URLs sin necesidad de tarjeta de crédito. El hosting y las operaciones están basados en la Unión Europea, con procesamiento compatible con GDPR y divulgación transparente de proveedores.

Construido Para

  • Profesionales de SEO realizando auditorías de sitios, comprobaciones de enlaces rotos y revisiones de enlaces internos
  • Equipos de comercio electrónico importación de catálogos de productos y monitoreo de datos de competidores
  • Propietarios de tiendas online enriquecimiento de datos de productos con extracción de IA en sitios de proveedores
  • Analistas de datos recopilación de investigación de mercado y productos estructurada
  • Creadores de contenido y afiliados compilación de información de productos a gran escala
  • Consultores SEO técnicos generación de sitemaps e identificación de páginas huérfanas

no se requiere tarjeta de crédito