CrawlHawk

Comment Fonctionne CrawlHawk

Dernière mise à jour : 10 juillet 2026

Chaque exploration suit le même processus : choisissez un outil (sitemap, extraction IA ou parcours personnalisé), définissez l'étendue (quelle partie du site explorer), sélectionnez les types de liens et le format de sortie, puis lancez. Les crédits sont déduits par URL traitée, et les résultats sont livrés dans le format choisi, prêts pour le téléchargement ou l'intégration. Le forfait gratuit couvre 500 URLs sans carte de crédit.

Étape 1 — Choisissez Votre Outil

CrawlHawk propose trois outils principaux, chacun optimisé pour un flux de travail spécifique. Le Générateur de Sitemap XML explore votre domaine (ou l'étendue sélectionnée), identifie chaque URL indexable et génère un sitemap XML prêt pour les moteurs de recherche selon le protocole sitemaps.org. La sortie est acceptée par Google Search Console, Bing Webmaster Tools et les principaux moteurs de recherche sans modification. Idéal pour les équipes SEO générant des sitemaps pour de nouveaux lancements, des reconstructions post-migration ou un maintien régulier.

Le Extracteur de Produits IA extrait des données produits structurées des pages e-commerce en utilisant un modèle IA qui lit les pages comme un humain le ferait — pas de sélecteurs XPath, pas de recettes dédiées par site, pas de configuration de modèles. Il extrait les titres, descriptions, prix, variantes, galeries d'images, SKUs, et autres attributs sur Shopify, WooCommerce, Magento, BigCommerce et sites personnalisés. Idéal pour les migrations e-commerce, les importations de données fournisseurs et la recherche de produits concurrentiels.

Le Crawler de Liens Personnalisés livre des données de liens brutes pour analyse — pour chaque lien découvert, vous recevez l'URL source, l'URL cible, le texte d'ancrage, le statut HTTP, le type de lien et les attributs rel. Idéal pour les audits SEO, la maintenance des liens cassés, les revues de liens internes, et toute tâche nécessitant des données de lien granulaires combinant plusieurs catégories de liens dans un ensemble consolidé.

Étape 2 — Définir l'Étendue de l'Exploration

CrawlHawk prend en charge cinq modes d'étendue qui contrôlent combien le crawler s'étend à partir de votre URL de départ : Domaine Complet (le site entier y compris les sous-domaines), Domaine Principal Seulement (exclut les sous-domaines), Sous-Domaine Seulement (un sous-domaine isolé), Chemin Unique (une section, telle que /produits/), et Page Unique (une seule URL uniquement). Pour une explication complète de quand utiliser chaque option — avec un tableau de référence rapide — consultez Explication de l'Étendue d'Exploration.

L'étendue détermine la consommation de crédits — une exploration d'un Chemin Unique sur 1 000 URLs coûte environ 1 000 crédits indépendamment de la taille du reste du site. Choisir la bonne étendue pour votre tâche est le levier le plus important pour l'efficacité des crédits.

Étape 3 — Sélectionnez les Types de Liens

Choisissez les catégories de liens que le rapport d'exploration inclura. Combinez-les à volonté en une exploration unique — chaque type de lien est inclus dans chaque plan. Les Liens Internes sont la base des audits de liens internes et de l'analyse des silos de contenu. Les Liens Externes sont des liens sortants vers d'autres domaines, utilisés pour les audits de sécurité de marque et l'analyse du trafic sortant. Les Liens Brisés sont des liens renvoyant des codes d'état HTTP 4xx ou 5xx, essentiels pour la maintenance SEO technique.

Les Pages Orphelines sont des pages qui existent mais qui n'ont pas de liens internes entrants, les rendant invisibles pour la plupart des crawleurs et difficiles à trouver pour les utilisateurs. Les Liens de Fichier incluent des ressources téléchargeables comme PDFs, DOCXs, ZIPs, MP4s. Les Liens d'Image couvrent chaque URL d'image dans l'étendue explorée avec texte alt et dimensions si disponibles. Le jeu de données résultant montre chaque lien avec tous ses attributs, filtrable par type, statut, page source, ou cible.

Étape 4 — Choisissez le Format de Sortie

CrawlHawk livre les résultats d'exploration en sept formats — choisissez celui qui correspond à votre flux de travail en aval. CSV pour un examen direct et une analyse sur feuille de calcul. JSON pour le traitement programmatique et l'intégration API. Excel XLSX pour des rapports structurés et une analyse par table pivot. HTML pour un examen visuel et un rendu partageable. PDF pour des livrables clients et des archives. XML sitemap pour une soumission directe aux moteurs de recherche lorsque la génération de sitemap est l'objectif. Et le Markdown propre au contenu principal (.md) pour alimenter les pages explorées dans les workflows d'IA et de LLM.

Tous les formats incluent la même structure de données de base — le choix du format ne change pas les données capturées, uniquement la manière dont elles sont présentées. Vous pouvez exporter la même exploration en plusieurs formats sans la relancer, ce qui est utile quand différentes parties prenantes ont besoin des mêmes données sous différentes présentations (le développeur veut JSON, le consultant SEO veut Excel, le client veut PDF).

Étape 5 — Lancez l'Exploration

Cliquez sur Lancer, et CrawlHawk commence le traitement. Le crawler découvre les URLs par un parcours en largeur d'abord — les pages à la profondeur 1 (liées directement à partir de votre URL de départ) sont explorées en premier, puis celles à la profondeur 2, et ainsi de suite. Cela signifie que les pages importantes sont traitées tôt, et l'exploration produit des résultats utiles même si elle est interrompue en cours de route. La profondeur maximale de l'exploration est configurable. Les explorations peuvent également être programmées pour se lancer automatiquement à un intervalle choisi — quotidien, hebdomadaire ou mensuel — transformant ainsi tout audit ponctuel en une surveillance continue sans réinitialisation manuelle; les exécutions programmées consomment des crédits de la même manière que les manuelles.

Pour les sites rendus par JavaScript (React, Vue, applications Single Page Angular, contenu chargé via AJAX), activez le rendu JavaScript. Cela utilise des crédits supplémentaires par URL car la page est complètement rendue avant l'extraction du contenu — mais elle capture le contenu qui serait invisible pour une récupération HTML brute. De nombreux sites modernes nécessitent ce mode pour des résultats précis.

Les explorations s'exécutent dans le cloud et continuent lorsque vous fermez le navigateur. Les petites explorations (quelques centaines d'URLs) se terminent généralement en 1-5 minutes. Les explorations de taille moyenne (5 000 URLs) prennent environ 15-45 minutes. Les explorations plus grandes (50 000+ URLs) peuvent prendre plusieurs heures en fonction des temps de réponse du serveur cible et de la concurrence configurée. Le progrès est visible sur votre tableau de bord, et des notifications par webhook sont envoyées lorsque une exploration est terminée pour une intégration dans les flux de travail automatisés.

Comment Fonctionnent les Crédits

CrawlHawk utilise un système de crédit à la consommation - achetez un pack de crédits, ils n'expirent jamais, et vous les dépensez au fur et à mesure de vos explorations. La consommation standard de crédits est d'un crédit par URL explorée. Des crédits additionnels sont consommés par URL pour le rendu JavaScript (nécessaire pour le contenu chargé côté client via JavaScript) et pour l'extraction IA via l'Extracteur de Produits IA (le traitement IA est la partie la plus coûteuse en calcul du pipeline).

Le coût exact en crédits est indiqué avant le démarrage de chaque exploration pour éviter les surprises. Le forfait gratuit couvre 500 URLs sans carte de crédit ou engagement d'inscription — suffisant pour effectuer plusieurs explorations de démonstration. Des packs de crédits sont disponibles depuis votre tableau de bord à différents niveaux. Il n'y a pas de licence par siège. Consultez la page de Tarification pour connaître les tarifs actuels des packs de crédits.

Comment Fonctionne l'Extraction IA

L'Extracteur de Produits IA utilise un modèle linguistique qui lit les pages comme un humain le ferait, identifiant les attributs de produit indépendamment de la structure HTML sous-jacente. Cela élimine le besoin de sélecteurs XPath spécifiques par site ou de recettes de scraping — l'IA fonctionne sur un site que vous n'avez jamais vu auparavant, dès la première fois, et continue de fonctionner lorsque les sites redessinent leur mise en page.

Lorsque vous soumettez une URL produit, l'IA extrait le titre complet du produit et sa description, le prix (y compris la devise et tout prix de vente), le SKU et les identifiants de produit, la marque, les données de variante (tailles, couleurs, configurations), les URLs de la galerie d'images, les dimensions, le poids, les matériaux, les spécifications, et le statut du stock — tout ce qui est présent sur la page. La sortie est livrée sous forme de ligne par produit avec chaque attribut en tant que colonne distincte, prête pour l'importation directe dans Shopify, WooCommerce, systèmes ERP, ou outils de gestion de l'information produit (PIM).

L'IA fonctionne sur Shopify, WooCommerce, Magento, BigCommerce, boutiques construites sur mesure, et la plupart des marketplaces. La même IA gère différentes plateformes e-commerce sans configuration par plateforme ou sélection de modèle — la variété structurelle des pages produits est ce que l'IA est spécifiquement formée à gérer.

Options d'Intégration

CrawlHawk s'intègre à vos flux de travail existants par divers mécanismes. L'accès API est disponible pour chaque compte pour initier des explorations de manière programmatique, vérifier le statut, et récupérer les résultats — des points de terminaison REST standard avec une authentification par clé API, appelables depuis n'importe quel client HTTP ou plateforme d'automatisation de workflow.

Les notifications par webhook sont envoyées lorsque une exploration est terminée, avec la charge utile du résultat livrée à votre URL webhook configurée. Cela est utile pour automatiser le traitement en aval — alertes Slack à votre canal d'équipe, mises à jour de tableau de bord, flux d'importation automatisés dans votre CRM ou PIM, logique de changement de prix conditionnel basée sur les données concurrentielles. Les webhooks livrent un JSON structuré correspondant au format de la réponse API standard.

Les explorations programmées vous permettent de définir une exploration pour s'exécuter à un rythme récurrent (horaire, quotidien, hebdomadaire, ou personnalisé) sans intervention manuelle. Utile pour les importations de données en cours, les audits SEO récurrents, ou toute tâche bénéficiant d'une exécution automatisée régulière. Les explorations programmées consomment des crédits à chaque exécution programmée, de la même manière que les explorations manuelles.

Dans les Coulisses — Comment Fonctionne un Crawler Web

Un crawler web fonctionne en boucle simple : il récupère une page, analyse le HTML pour trouver chaque lien sur celle-ci, ajoute les URLs nouvellement découvertes à une file d'attente, et répète — s'étendant vers l'extérieur à partir de l'URL de départ jusqu'à ce que l'étendue choisie soit couverte. En cours de route, il enregistre ce que chaque page et lien renvoient (codes d'état, attributs de lien, contenu), qui est la donnée brute derrière les sitemaps, les audits de liens et les extractions. CrawlHawk exécute cette boucle de manière en largeur d'abord, donc les pages les plus en évidence sont traitées en premier.

CrawlHawk fonctionne sur une infrastructure hébergée en UE, basée en Hongrie, avec un traitement et une rétention de données conformes au RGPD. Notre moteur utilise une infrastructure de récupération de niveau entreprise pour le rendu JavaScript, la rotation IP à travers des pools de proxy mondiaux, et la gestion des sites avec une protection anti-bot sophistiquée. L'extraction IA est réalisée via l'API d'OpenAI; OpenAI n'utilise pas le contenu de l'API pour l'entraînement de modèles, et CrawlHawk ne choisit pas de partager les données d'entraînement — voir la Politique de Confidentialité pour le flux de données complet.

Le HTML rendu est disponible au téléchargement pendant 90 jours après la fin de chaque exploration, supportant ainsi les flux de travail de débogage où vous devez vérifier exactement ce que le crawler a vu sur les pages rendues par JavaScript. Les résultats et rapports d'exploration sont également conservés pour 90 jours par défaut, avec possibilité de suppression sur demande plus tôt. Les crédits, les données de compte, et les informations de facturation suivent les politiques de rétention standard conformes au RGPD.

Flux de Travail Courants

Audit de site SEO — Soumettez votre domaine pour une exploration Domaine Complet en sélectionnant les six types de liens. Analysez les résultats dans Excel : liens cassés à corriger, Pages Orphelines à rendre visibles, patterns de Liens Internes à optimiser, Liens Externes pour révision de la sécurité de marque. Réexécutez tous les trimestres pour mesurer les améliorations dans le temps.

Migration e-commerce — Soumettez vos anciennes URLs de produits à l'Extracteur de Produits IA. Exportez les données produits structurées sous forme de XLSX. Importez-les dans votre nouvelle plateforme (Shopify, WooCommerce, Magento) avec une légère mise en correspondance des colonnes. Ce même flux de travail gère des catalogues de quelques centaines à des dizaines de milliers de produits.

Recherche de produits concurrents — Soumettez l'URL d'une catégorie de produits concurrente avec une étendue Chemin Unique et l'Extracteur de Produits IA activé. L'IA extrait tous les produits de la catégorie avec tous les attributs. Planifiez la même exploration pour qu'elle s'exécute quotidiennement ou hebdomadairement pour une surveillance concurrentielle continue sans réinitialisation manuelle.

Régénération de sitemap — Soumettez votre domaine au Générateur de Sitemap XML dans une étendue Domaine Complet. Téléchargez la sortie XML. Chargez-la dans Google Search Console et Bing Webmaster Tools. Programmation d'une régénération mensuelle pour les sites avec des changements fréquents de contenu.

QA avant publication — Soumettez une URL de page brouillon via Page Unique avec tous les types de liens sélectionnés. Vérifiez que chaque lien interne mène à une page active, que chaque lien externe fonctionne toujours, que chaque image se charge correctement. Cela permet de détecter les problèmes avant la publication plutôt qu'après.

→ Démarrez votre première exploration · Voir les outils spécifiques : Générateur de Sitemap XML · Extracteur de Produits IA · Crawler de Liens Personnalisés · Tarification : Tarification

Questions Fréquemment Posées

Combien de temps faut-il pour terminer une exploration typique ?

Cela dépend de la taille et des temps de réponse du serveur cible. Une exploration de 500 URLs avec le forfait gratuit se termine généralement en 1-5 minutes. Un site de 5 000 URLs prend environ 15-45 minutes. Un site de 50 000 URLs peut prendre plusieurs heures. Les explorations plus grandes s'ajustent proportionnellement aux paramètres de concurrence configurés. Le rendu JavaScript ajoute du temps par URL car chaque page est complètement rendue avant l'extraction.

Que se passe-t-il si je manque de crédits en milieu d'exploration ?

L'exploration s'arrête au seuil de crédits et rapporte les parties terminées jusqu'à ce point — pas de frais imprévus. Vous pouvez acheter des crédits supplémentaires et continuer avec une exploration de suivi sur les URLs restantes. Les résultats partiels de l'exploration arrêtée sont téléchargeables dans le format choisi.

Puis-je annuler une exploration en cours ?

Oui — annulez à partir de votre tableau de bord. Les crédits consommés jusqu'à l'annulation ne sont pas remboursés, mais aucun crédit supplémentaire n'est dépensé. Le résultat partiel jusqu'à l'annulation est disponible en téléchargement.

Où mes données sont-elles stockées ?

Sur une infrastructure hébergée en UE en Hongrie. Les résultats d'exploration, y compris le HTML rendu, sont conservés pendant 90 jours après l'exploration. Supprimables sur demande plus tôt. Les détails complets du flux de données se trouvent dans la Politique de Confidentialité.

Ai-je besoin de compétences techniques pour utiliser CrawlHawk ?

Non — l'Extracteur de Produits IA et les modes d'exploration standard ne nécessitent pas de XPath, de sélecteurs, ni de scripts. L'interface est de type point-and-click : soumettre une URL, choisir l'étendue, choisir les types de liens, choisir le format de sortie, lancer. Pour les développeurs, l'API permet des intégrations et des automatisations de flux de travail sur mesure.

Que se passe-t-il si le site cible bloque l'exploration ?

Certains sites utilisent des protections anti-bots agressives. Notre moteur gère la plupart des protections modernes (rotation d'IP à travers des pools de proxy mondiaux, empreinte de navigateur, rendu JavaScript). Les explorations sur des sites fortement protégés peuvent produire des résultats partiels — tester sur un petit échantillon avant des explorations larges est la pratique recommandée. Le comportement d'exploration est régi par la Politique d'Utilisation Acceptable.

La tarification est-elle par siège ?

Non — CrawlHawk n'a pas de licence par siège et pas de frais par utilisateur. Les crédits appartiennent au compte, et chaque compte est conçu pour un utilisateur unique.

Le crawling web est-il légal ?

Le crawling des sites web accessibles au public est une pratique établie de longue date, mais la légalité dépend de ce que vous explorez et de l'utilisation des résultats — les termes du site cible, robots.txt, le droit d'auteur et le droit à la protection des données s'appliquent, et la responsabilité de chaque exploration incombe à l'utilisateur. CrawlHawk respecte robots.txt par défaut ; les règles sont énoncées dans la Politique d'Utilisation Acceptable. Ceci est une information générale, non un conseil juridique.

CrawlHawk fonctionne-t-il sur des applications à page unique lourdes en JavaScript ?

Oui — avec le rendu JavaScript activé (crédits supplémentaires par URL), le crawler capture le contenu rendu côté client via JavaScript, y compris React, Vue, applications SPA Angular, et contenu chargé par AJAX. Pour les pages HTML statiques, le rendu JavaScript n'est pas nécessaire et économise des crédits.

Lancez votre exploration — 500 URLs gratuites, sans carte de crédit requise →