CrawlHawk

Wie CrawlHawk funktioniert

Letzte Aktualisierung: 10. Juli 2026

Jeder Crawl folgt demselben Ablauf: Wählen Sie ein Tool (Sitemap, KI-Extraktion oder benutzerdefinierter Crawl), legen Sie den Umfang fest (wie viel der Seite gecrawlt werden soll), und entscheiden Sie, welche Linktypen und Ausgabeformate Sie benötigen, dann starten Sie. Credits werden pro verarbeiteter URL abgezogen, und die Ergebnisse werden in Ihrem gewählten Format zur Verfügung gestellt, bereit zum Download oder zur Integration. Die kostenlose Stufe deckt 500 URLs ohne Kreditkarte ab.

Schritt 1 — Wählen Sie Ihr Tool

CrawlHawk bietet drei Haupttools, die jeweils für unterschiedliche Workflows optimiert sind. Der XML-Sitemap-Generator crawlt Ihre Domain (oder einen ausgewählten Bereich), identifiziert jede indexierbare URL und erstellt eine suchmaschinenfertige XML-Sitemap nach dem sitemaps.org-Protokoll. Der Output wird von den Google Search Console, Bing Webmaster Tools und großen Suchmaschinen ohne Anpassung akzeptiert. Besonders geeignet für SEO-Teams, die Sitemaps für neue Starts, Post-Migration-Rebuilds oder laufende Wartung erstellen.

Der KI-Produkt-Scraper extrahiert strukturierte Produktdaten von E-Commerce-Seiten mit einem KI-Modell, das die Seiten wie ein Mensch liest – keine XPath-Selektoren, keine vor-Ort-Rezepte, kein Template-Setup. Extrahiert Titel, Beschreibungen, Preise, Varianten, Bildgalerien, SKUs und andere Attribute über Shopify, WooCommerce, Magento, BigCommerce und benutzerdefinierte Seiten hinweg. Ideal für E-Commerce-Migrationen, Lieferantendatenimporte und Wettbewerbsproduktforschung.

Der benutzerdefinierter Link-Crawler liefert Rohlinkdaten zur Analyse – für jeden entdeckten Link erhalten Sie die Quell-URL, Ziel-URL, den Ankertext, den HTTP-Status, den Linktyp und die Rel-Attribute. Besonders geeignet für SEO-Audits, defekte Links-Wartung, interne Link-Überprüfungen und jede Aufgabe, die eine granulare Linkdatenerfassung erfordert.

Schritt 2 — Legen Sie den Crawl-Umfang fest

CrawlHawk unterstützt fünf Umfangsmodi, die steuern, wie weit sich der Crawler von Ihrer Start-URL ausbreitet: Gesamte Domain (die gesamte Seite inklusive Subdomains), nur Hauptdomain (ohne Subdomains), nur Subdomain (eine Subdomain isoliert), einzelner Pfad (ein Abschnitt, z.B. /produkte/) und Einzelne Seite (nur eine URL). Für eine vollständige Aufschlüsselung, wann welcher Modus zu verwenden ist — inklusive einer Schnellreferenztabelle für Aufgaben — siehe Crawl-Bereich erklärt.

Der Umfang bestimmt den Creditverbrauch — ein Crawl eines einzelnen Pfads mit 1.000 URLs kostet etwa 1.000 Credits, unabhängig davon, wie groß der Rest der Seite ist. Die richtige Umfangswahl ist der entscheidendste Hebel für die Credit-Effizienz.

Schritt 3 — Wählen Sie Linktypen aus

Wählen Sie aus, welche Linkkategorien der Crawl melden soll. Kombinieren Sie jede Kombination in einem Crawl — jeder Linktyp ist in jedem Plan enthalten. Interne Links sind die Grundlage für Audits interner Verlinkungen und Inhaltsüberprüfungen. Externe Links sind ausgehende Links zu anderen Domains, die für Marken-Sicherheitsaudits und Outbound-Traffic-Analysen verwendet werden. Defekte Links sind Links, die 4xx oder 5xx HTTP-Statuscodes zurückgeben, und sind für die technische SEO-Wartung entscheidend.

Verwaiste Seiten sind Seiten, die existieren, aber keine eingehenden internen Links haben — unsichtbar für die meisten Crawler und schwer zu finden für Benutzer. Datei-Links umfassen PDFs, DOCXs, ZIPs, MP4s und andere herunterladbare Ressourcen. Bild-Links umfassen jede Bild-URL im gecrawlten Bereich, mit Alt-Text und Dimensionen, sofern verfügbar. Der resultierende Datensatz zeigt jeden Link mit allen Attributen, filterbar nach Typ, Status, Quellseite oder Ziel.

Schritt 4 — Wählen Sie das Ausgabeformat

CrawlHawk liefert Crawling-Ergebnisse in sieben Formaten — wählen Sie dasjenige, das zu Ihrem nachgelagerten Workflow passt. CSV zur direkten Tabellenkalkulationsüberprüfung und -analyse. JSON für programmatische Verarbeitung und API-Integration. Excel XLSX für strukturierte Berichte und Pivot-Tabellen-Analyse. HTML für visuelle Überprüfung und teilbares Rendering. PDF für Kundenberichte und Archive. XML-Sitemap für direkte Suchmaschinenübermittlung, wenn Sitemap-Erstellung das Ziel ist. Und sauberes, hauptinhaltliches Markdown (.md) zur Einspeisung gecrawlter Seiten in KI- und LLM-Workflows.

Alle Formate beinhalten dieselbe zugrunde liegende Datenstruktur — die Formatwahl ändert nicht, welche Daten erfasst werden, sondern nur, wie sie präsentiert werden. Sie können denselben Crawl in mehreren Formaten exportieren, ohne ihn erneut auszuführen, was nützlich ist, wenn verschiedene Stakeholder dieselben Daten in unterschiedlichen Präsentationen benötigen (Entwickler wollen JSON, SEO-Berater will Excel, Kunde will PDF).

Schritt 5 — Führen Sie den Crawl durch

Klicken Sie auf Ausführen, und CrawlHawk beginnt mit der Verarbeitung. Der Crawler entdeckt URLs über ein Breitensuche-Verfahren — Seiten in Tiefe 1 (direkt von Ihrer Start-URL verlinkt) werden zuerst gecrawlt, dann Tiefe 2 usw. Dies bedeutet, dass Seiten von hoher Wichtigkeit früh verarbeitet werden und der Crawl nützliche Ergebnisse liefert, selbst wenn er mitten im Prozess unterbrochen wird. Die maximale Crawl-Tiefe ist konfigurierbar. Crawls können auch so geplant werden, dass sie automatisch in einem gewählten Intervall ausgeführt werden — täglich, wöchentlich oder monatlich — dies macht aus einem einmaligen Audit eine kontinuierliche Überwachung ohne manuelle Neuerstellung. Geplante Läufe verbrauchen Credits auf die gleiche Weise wie manuelle Läufe.

Für JavaScript-gerenderte Seiten (React, Vue, Angular SPAs, AJAX-geladene Inhalte) aktivieren Sie die JavaScript-Rendering. Dies verwendet zusätzliche Credits pro URL, da die Seite vollständig gerendert wird, bevor der Inhalt extrahiert wird — es erfasst jedoch Inhalte, die einem einfachen HTML-Abruf unsichtbar wären. Viele moderne Seiten erfordern diesen Modus für genaue Ergebnisse.

Crawls werden in der Cloud durchgeführt und laufen weiter, wenn Sie den Browser schließen. Kleinere Crawls (einige hundert URLs) dauern in der Regel 1-5 Minuten. Mittlere Crawls (5.000 URLs) dauern ungefähr 15-45 Minuten. Größere Crawls (50.000+ URLs) können je nach Antwortzeiten des Zielservers und konfigurierter Parallelität mehrere Stunden dauern. Der Fortschritt ist in Ihrem Dashboard sichtbar, und Webhook-Benachrichtigungen werden gesendet, wenn ein Crawl abgeschlossen ist, um ihn in automatisierte Workflows zu integrieren.

Wie Credits funktionieren

CrawlHawk verwendet ein Pay-once-Credit-System — kaufen Sie ein Credit-Paket, Credits verfallen nie, und Sie geben sie beim Crawlen aus. Der Standardverbrauch von Credits beträgt ein Credit pro gecrawlter URL. Zusätzliche Credits werden pro URL für JavaScript-Rendering (erforderlich für per JavaScript geladene Inhalte) und für die KI-Extraktion über den KI-Produkt-Scraper (die KI-Verarbeitung ist der rechenintensivste Teil der Pipeline) verbraucht.

Die genaue Credit-Kosten werden vor jedem Crawl-Start angezeigt, sodass es keine Überraschungen gibt. Die kostenlose Stufe deckt 500 URLs ohne Kreditkarte oder Anmeldeverpflichtung ab — genug, um mehrere proof-of-concept Crawls durchzuführen. Kreditpakete sind in Ihrem Kontodashboard in mehreren Stufen verfügbar. Es gibt keine Lizenzierung pro Sitzplatz. Sehen Sie sich die Preisseite für die aktuellen Preise der Kreditpakete an.

Wie funktioniert die KI-Extraktion?

Der KI-Produkt-Scraper verwendet ein Sprachmodell, das Seiten wie ein Mensch liest und Produktattribute unabhängig von der zugrunde liegenden HTML-Struktur identifiziert. Dies eliminiert die Notwendigkeit für XPath-Selektoren oder Scraping-Rezepte für jede Website — die KI arbeitet auf einer Seite, die Sie noch nie zuvor gesehen haben, beim ersten Mal, und sie funktioniert weiter, wenn Seiten ihr Layout ändern.

Wenn Sie eine Produkt-URL übermitteln, extrahiert die KI Produkttitel und vollständige Beschreibung, Preis (inklusive Währung und etwaigem Verkaufspreis), SKU- und Produktkennungen, Marke, Variantendaten (Größen, Farben, Konfigurationen), Bildgalerie-URLs, Abmessungen, Gewicht, Materialien, Spezifikationen und Lagerstatus — alles, was auf der Seite vorhanden ist. Der Output wird als eine Zeile pro Produkt mit jedem Attribut als separate Spalte geliefert, bereit für den direkten Import in Shopify, WooCommerce, ERP-Systeme oder PIM-Tools.

Die KI arbeitet über Shopify, WooCommerce, Magento, BigCommerce, custom-built Shops und die meisten Marktplätze hinweg. Dasselbe KI-Modell kann verschiedene E-Commerce-Plattformen ohne plattformspezifische Einrichtung oder Template-Auswahl verarbeiten — die strukturelle Vielfalt auf Produktseiten ist das, worauf die KI speziell trainiert wurde.

Integrationsmöglichkeiten

CrawlHawk integriert sich über mehrere Mechanismen in Ihre bestehenden Workflows. API-Zugriff steht auf jedem Konto für die programmatische Crawl-Initiierung, Statusprüfungen und Ergebnisabruf zur Verfügung — standardmäßige REST-Endpunkte mit API-Schlüssel-Authentifizierung, aufrufbar von jedem HTTP-Client oder jeder Workflow-Automatisierungsplattform.

Webhook-Benachrichtigungen werden gesendet, wenn ein Crawl abgeschlossen ist, mit dem Ergebnispayload an Ihre konfigurierte Webhook-URL geliefert. Dies ist nützlich zur Automatisierung nachgelagerter Prozesse — Slack-Alerts an Ihren Teamkanal, Dashboard-Aktualisierungen, automatisierte Importflüsse in Ihr CRM oder PIM, bedingte Preislogik basierend auf Wettbewerbsdaten. Webhooks liefern strukturiertes JSON, das dem Format der Standard-API-Antwort entspricht.

Geplante Crawls ermöglichen es Ihnen, einen Crawl in einem wiederkehrenden Zeitplan auszuführen (stündlich, täglich, wöchentlich oder benutzerdefiniert) ohne manuelle Intervention. Nützlich für fortlaufende Datenimporte, wiederkehrende SEO-Audits oder jede Aufgabe, die von regelmäßiger automatisierter Ausführung profitiert. Geplante Crawls verbrauchen Credits bei jedem geplanten Lauf, genauso wie manuelle Crawls.

Hinter den Kulissen – Wie ein Web-Crawler funktioniert

Ein Web-Crawler arbeitet in einem einfachen Loop: Er ruft eine Seite ab, analysiert das HTML, um jedem Link darauf zu finden, fügt die neu entdeckten URLs einer Warteschlange hinzu und wiederholt sich – nach und nach sich vom Start-URL aus ausweitend, bis der gewählte Umfang abgedeckt ist. Dabei zeichnet er auf, was jede Seite und jeder Link zurückgegeben haben (Statuscodes, Link-Attribute, Inhalte), was die Rohdaten hinter Sitemaps, Link-Audits und Extraktionen sind. CrawlHawk führt diese Schleife im Breitensuchverfahren aus, sodass die prominentesten Seiten zuerst verarbeitet werden.

CrawlHawk läuft auf in der EU gehosteter Infrastruktur mit Sitz in Ungarn, mit DSGVO-konformer Verarbeitung und Datenaufbewahrung. Unsere Engine verwendet unternehmensgerechte Abrufinfrastruktur für JavaScript-Rendering, IP-Rotation über globale Proxy-Pools und weist Seiten mit ausgeklügeltem Bot-Schutz zu verarbeiten. Die KI-Extraktion wird über die API von OpenAI durchgeführt; OpenAI verwendet API-Inhalte nicht für das Modelltraining, und CrawlHawk hat sich nicht für die Datenfreigabe zu Schulungszwecken entschieden – siehe die Datenschutzerklärung für den vollständigen Datenfluss.

Gerendertes HTML ist für 90 Tage nach Abschluss jedes Crawls zum Download verfügbar und unterstützt Debugging-Workflows, bei denen Sie genau das, was der Crawler auf JavaScript-gerenderten Seiten gesehen hat, überprüfen müssen. Crawl-Ergebnisse und Berichte werden ebenfalls standardmäßig 90 Tage nach Abschluss gespeichert, mit der Möglichkeit der früheren Löschung auf Anfrage. Credits, Kontodaten und Abrechnungsinformationen folgen den standardmäßigen DSGVO-konformen Aufbewahrungsrichtlinien.

Gängige Workflows

SEO-Website-Audit — Reichen Sie Ihre Domain als kompletter Domain-Crawl mit allen sechs Linktypen ein. Überprüfen Sie die Ergebnisse in Excel: defekte Links beheben, verwaiste Seiten sichtbar machen, Interne Links optimieren, Externe Links zur Markenüberprüfung. Alle drei Monate neu ausführen, um Verbesserungen im Laufe der Zeit zu messen.

E-Commerce-Migration — Reichen Sie Ihre alten Produkt-URLs beim KI-Produkt-Scraper ein. Exportieren Sie die strukturierten Produktdaten als XLSX. Importieren Sie diese in Ihre neue Plattform (Shopify, WooCommerce, Magento) mit leichter Spaltenzuordnung. Derselbe Workflow bewältigt Kataloge von wenigen Hundert bis zu Zehntausenden von Produkten.

Wettbewerbsproduktforschung — Reichen Sie eine Produktkategorie-URL eines Wettbewerbers mit einzelner Pfad-Umfang ein und aktivieren Sie den KI-Produkt-Scraper. Die KI extrahiert alle Produkte in der Kategorie mit vollständigen Attributen. Planen Sie denselben Crawl, um ihn täglich oder wöchentlich für laufende Wettbewerbsüberwachung auszuführen, ohne manuelle Neuerstellung.

Sitemap-Re-Generierung — Reichen Sie Ihre Domain beim XML-Sitemap-Generator im kompletter Domain-Umfang ein. Laden Sie den XML-Output herunter. Laden Sie ihn in die Google Search Console und Bing Webmaster Tools hoch. Planen Sie eine monatliche Neugenerierung für Websites mit häufig änderndem Inhalt.

Vor-Veröffentlichungs-QA — Reichen Sie eine Entwurfseiten-URL über einzelne Seite mit allen Linktypen ein. Verifizieren Sie, dass jeder interne Link auf eine Live-Seite verweist, jeder externe Link noch funktioniert und jedes Bild korrekt lädt. Fängt Probleme vor der Veröffentlichung auf, anstatt danach.

→ Starten Sie Ihren ersten Crawl · Siehe spezifische Tools: XML-Sitemap-Generator · KI-Produkt-Scraper · Benutzerdefinierter Link-Crawler · Preise: Preise

Häufig gestellte Fragen

Wie lange dauert ein typischer Crawl?

Es hängt von der Größe und den Antwortzeiten des Zielservers ab. Ein 500-URL-Crawl in der kostenlosen Stufe dauert typischerweise 1-5 Minuten. Eine 5.000-URL-Website dauert etwa 15-45 Minuten. Eine 50.000-URL-Website kann mehrere Stunden dauern. Größere Crawls skalieren proportional mit den konfigurierten Parallelitätseinstellungen. JavaScript-Rendering fügt pro URL Zeit hinzu, da jede Seite vor der Extraktion vollständig gerendert wird.

Was passiert, wenn mir während des Crawls die Credits ausgehen?

Der Crawl stoppt beim Credit-Limit und meldet, was bis zu diesem Zeitpunkt abgeschlossen wurde — keine überraschenden Überziehungskosten. Sie können zusätzliche Credits kaufen und mit einem Nachfolge-Crawl auf den verbleibenden URLs fortfahren. Teilweise Ergebnisse des gestoppten Crawls sind in Ihrem gewählten Format herunterladbar.

Kann ich einen laufenden Crawl abbrechen?

Ja — brechen Sie über Ihr Konto-Dashboard ab. Die bis zum Zeitpunkt des Abbruchs verbrauchten Credits werden nicht zurückerstattet, aber es werden keine weiteren Credits ausgegeben. Das Teilergebnis bis zum Abbruch ist zum Download verfügbar.

Wo werden meine Daten gespeichert?

Auf EU-gehosteter Infrastruktur in Ungarn. Crawl-Ergebnisse, einschließlich gerendertem HTML, werden 90 Tage nach dem Crawl aufbewahrt, beide bei früherer Anforderung löschbar. Volle Datenflussdetails finden sich in der Datenschutzerklärung.

Benötige ich technische Kenntnisse, um CrawlHawk zu nutzen?

Nein — der KI-Produkt-Scraper und die Standard-Crawling-Modi erfordern keine XPath, keine Selektoren, kein Scripting. Die Schnittstelle ist point-and-configure: URL einreichen, Umfang wählen, Linktypen wählen, Ausgabeformat wählen, ausführen. Für Entwickler ermöglicht die API benutzerdefinierte Integrationen und Workflow-Automatisierungen.

Was passiert, wenn die Zielseite den Crawl blockiert?

Einige Seiten verwenden aggressive Antibot-Schutzmaßnahmen. Unsere Engine bewältigt die meisten modernen Schutzmaßnahmen (IP-Umstellung über globale Proxy-Pools, Browser-Fingerprinting, JavaScript-Rendering). Crawls auf stark geschützten Seiten können teilweise Ergebnisse liefern — Tests an einer kleinen Stichprobe vor großen Crawls wird empfohlen. Crawl-Verhalten wird durch die Richtlinien zur akzeptablen Nutzung geregelt.

Ist das Preismodel pro Nutzer?

Nein — CrawlHawk hat keine nutzerspezifische Lizenzierung und keine pro-Benutzer-Gebühr. Credits gehören zum Konto, und jedes Konto ist für einen einzelnen Benutzer ausgelegt.

Ist Web-Crawling legal?

Das Crawlen öffentlich zugänglicher Websites ist eine lang etablierte, weit verbreitete Praxis — Suchmaschinen basieren darauf — jedoch hängt die Legalität davon ab, was Sie crawlen und wie Sie die Ergebnisse verwenden: die Bedingungen der Zielseite, robots.txt, Urheberrechte, Datenbankrechte und Datenschutzrecht gelten, und die Verantwortung für jeden Crawl liegt beim Benutzer. CrawlHawk respektiert standardmäßig robots.txt; die Regeln sind in den Richtlinien zur akzeptablen Nutzung festgelegt. Dies ist allgemeine Information, keine rechtliche Beratung.

Funktioniert CrawlHawk bei JavaScript-lastigen Single-Page-Anwendungen?

Ja — bei aktiviertem JavaScript-Rendering (zusätzliche Credits pro URL) erfasst der Crawler Inhalte, die clientseitig über JavaScript gerendert werden, einschließlich React, Vue, Angular SPAs und AJAX-geladener Inhalte. Für statische HTML-Seiten ist JavaScript-Rendering unnötig und spart Credits.

Starten Sie das Crawlen — 500 URLs kostenlos, keine Kreditkarte erforderlich →