CrawlHawk.com
Kostenlos testen — 500 Links pro Crawl auf Level 1, bis Sie Ihre ersten Credits kaufen. Upgraden Sie für mehr Guthaben & Funktionen.
Welche Daten brauchen Sie?
Crawlen Sie jede Website. Erstellen Sie Sitemaps. Extrahieren Sie Produktdaten.
Sechs Workflows. Ein Kreditpaket. Kein Abo.
CrawlHawk ist ein kreditbasiertes Web-Daten-Tool, das sechs Workflows in einem Konto vereint: einen Web-Crawler für Site-Audits und Link-Discovery, einen Google-fertigen XML-Sitemap-Generator, einen Website-Inhalts-Scraper, der jede Website in klares, KI-fertiges Markdown verwandelt, einen KI-gestützten Produktdaten-Scraper für E-Commerce-Seiten, einen Kontakt-Scraper für öffentlich gelistete Kontaktdaten und einen Lead-Klassifizierer, der Ihre Domainlisten nach Ihren eigenen Kriterien bewertet. Es gibt kein Abo, Credits verfallen nie, und jedes Konto enthält alle Funktionen. Starten Sie kostenlos mit 500 URLs pro Crawl auf Level 1, bis Sie Ihre ersten Credits kaufen, und upgraden Sie nur, wenn Sie mehr brauchen. In der EU entwickelt und betrieben, DSGVO-konform.
Sechs Workflows in einem Tool
XML-Sitemap-Generator
Google-fertige Sitemaps von jeder Domain – in einem Crawl.
CrawlHawk crawlt Ihre Domain (oder einen ausgewählten Umfang), identifiziert jede indexierbare URL und erstellt eine suchmaschinenfertige XML-Sitemap gemäß dem sitemaps.org-Protokoll. Die Ausgabe wird von der Google Search Console, den Bing Webmaster Tools, dem Yandex Webmaster und jeder großen Suchmaschine ohne Änderung akzeptiert.
Verwenden Sie es für neue Website-Starts (damit Suchmaschinen Ihre Seiten schnell entdecken), für den Wiederaufbau von Sitemaps nach einer Migration bei geänderten URL-Strukturen, für E-Commerce-Katalogaktualisierungen und für die laufende SEO-Pflege. CrawlHawk berücksichtigt noindex-Meta-Tags, kanonische URLs und robots.txt-Anweisungen und teilt Sitemaps, die das Limit von 50.000 URLs überschreiten, automatisch in eine Sitemap-Indexdatei auf. Keine Installation, kein Plugin, keine wiederkehrende Gebühr – zahlen Sie nur für die von Ihnen gecrawlten URLs, mit Guthaben, das nie verfällt.
Benutzerdefinierter Link-Crawler
Detaillierte Link-Audits, nach Ihren Vorstellungen konfiguriert.
Wählen Sie den Umfang (gesamte Domain, nur Hauptdomain, einzelne Subdomain, URL-Pfad oder einzelne Seite) und die gewünschten Linktypen (intern, extern, defekt, verwaist, Datei, Bild). Für jeden entdeckten Link liefert CrawlHawk die Quell-URL, die Ziel-URL, den Ankertext, den HTTP-Statuscode, den Linktyp und die rel-Attribute (nofollow, sponsored, ugc, noopener).
Exportieren Sie nach CSV (für Tabellen), JSON (für die programmatische Verwendung), Excel XLSX (für Berichte), HTML (zur visuellen Überprüfung), PDF (für Kunden-Deliverables) oder ins XML-Sitemap-Format. Häufige Anwendungen sind SEO-Website-Audits, die Pflege defekter Links, die Überprüfung interner Verlinkungen, Inventare ausgehender Links und die Analyse von Wettbewerberstrukturen. JavaScript-Rendering für dynamisch geladene Inhalte wird gegen zusätzliche Guthabenkosten pro URL unterstützt.
Website-Inhalts-Scraper
Der Inhalt jeder Website als klarer, KI-fertiger Text.
Fügen Sie eine URL ein, und CrawlHawk extrahiert den Hauptinhalt jeder Seite als klares Markdown — Navigation, Footer und Cookie-Banner entfernt. Der Download ist ein ZIP mit einer Datei pro Seite plus einer kombinierten Datei der gesamten Website, bereit zum Upload in NotebookLM, ChatGPT Projects, Claude Projects oder jede RAG-Pipeline.
Nutzen Sie ihn, um KI-Assistenten und Wissensdatenbanken aus Ihrer Dokumentation zu bauen, Inhalte zwischen Plattformen zu migrieren, komplette Websites für die Übersetzung vorzubereiten oder zu prüfen, was Ihre Seiten tatsächlich sagen. Inhaltsextraktion ist normales Crawling — 1 Credit pro Seite, und kostenlose Crawls decken 500 Seiten pro Crawl auf Level 1 ohne Anmeldung ab, bis Sie Ihre ersten Credits kaufen — womit die meisten Blogs und Doku-Websites gratis extrahierbar sind.
KI-Produkt-Scraper
Strukturierte Produktdaten von jeder E-Commerce-Seite – ohne Vorlage.
Richten Sie CrawlHawk auf eine Produktseite, eine Kategorie oder einen gesamten Katalog. Ein KI-Modell liest die Seite wie ein Mensch und extrahiert Titel, vollständige Beschreibungen, Preise (einschließlich Währung und Aktionspreisen), SKUs, Marken, Variantendaten (Größen, Farben, Konfigurationen), Bildergalerien, Abmessungen, Gewichte, Materialien, Spezifikationen und Lagerstatus – ohne manuelle XPath-Regeln, seitenspezifische Vorlagen oder Vorlageneinrichtung.
Derselbe Scraper funktioniert bei Shopify-Shops, WooCommerce-Shops, Magento, BigCommerce, individuell entwickelten Websites und den meisten großen Marktplätzen. Die Ausgabe erfolgt als XLSX, JSON oder CSV – jedes Produkt ist eine Zeile mit einheitlichen Attributspalten, bereit für den direkten Import in Shopify, WooCommerce, Ihr ERP oder ein beliebiges PIM-Tool. JavaScript-gerenderte Produktseiten werden gegen zusätzliche Guthabenkosten pro URL unterstützt.
Kontakt-Scraper
Öffentliche Kontaktdaten, verantwortungsvoll erhoben.
CrawlHawk crawlt die von Ihnen angegebenen Websites und sammelt die dort veröffentlichten Kontaktdaten — E-Mail-Adressen, Telefonnummern, Postadressen und Social-Profil-Links — mit der Quell-URL zu jedem Eintrag. Die Ergebnisse kommen als strukturierte Tabelle: eine Zeile pro Kontaktpunkt, dedupliziert, bereit für Ihr CRM.
Gebaut für legitime Outreach-Recherche: Lieferanten- und Partnersuche, Aufbau von B2B-Prospect-Listen aus den eigenen Websites der Unternehmen und Aktuellhalten Ihrer bestehenden Datensätze. Sie bestätigen für jeden Crawl eine Rechtsgrundlage, und jeder Export ist auf die öffentliche Seite zurückverfolgbar, von der er stammt. Die Kontaktextraktion verbraucht Credits pro verarbeiteter URL, angezeigt vor dem Crawl-Start — Credits verfallen nie.
Lead-Klassifizierer
Ihre Domainliste, nach Ihren Kriterien bewertet.
Fügen Sie eine Domainliste ein — oder laden Sie eine CSV hoch — und beschreiben Sie in einfacher Sprache, wie ein guter Lead für Sie aussieht. CrawlHawk crawlt jede Website und bewertet sie nach Ihren Kriterien: Branchenpassung, Produktsortiment, Unternehmenssignale, was auch immer Sie definiert haben. Die Ausgabe ist Ihre Liste zurück, priorisiert, mit einer Bewertung und einer kurzen Begründung pro Domain.
Gebaut für Sales- und Marktforschungsteams, die Listen haben, aber keine Zeit: Distributoren-Shortlists, Aussteller- und Verzeichnisexporte, gesammelte Prospect-Pools. Statt fünfhundert Websites von Hand zu öffnen, lesen Sie eine priorisierte Tabelle und starten oben. Die Klassifizierung verbraucht Credits pro Domain, angezeigt vor dem Start.
Crawling-Optionen
CrawlHawk unterstützt fünf Umfangsmodi, sodass Sie genau den Teil des Webs anvisieren können, der Sie interessiert – von einer gesamten Domain bis hin zu einer einzelnen Seite. Alle fünf Modi funktionieren mit jedem Linktyp und jedem Ausgabeformat; der Umfang steuert nur, wie weit sich der Crawl ausbreitet.
Gesamte Domain crawlen
Jede interne Seite, die von einer Start-URL aus erreichbar ist.
Übermitteln Sie eine URL, und CrawlHawk entdeckt jede interne Seite innerhalb derselben Domain – über alle Pfade, Bereiche und erreichbaren URLs hinweg. Der Crawl der gesamten Domain eignet sich ideal für vollständige Website-Audits, die XML-Sitemap-Erstellung für neue Starts und umfassendes internes Link-Mapping. Er liefert ein vollständiges Inventar der crawlbaren Struktur Ihrer Website mit jeder URL, der Seite, von der aus sie entdeckt wurde, und ihrer Crawl-Tiefe.
Für sehr große Plattformen mit Millionen von URLs (eBay, Amazon, Wikipedia, YouTube) verwenden Sie stattdessen einen engeren Umfang oder beschränken Sie sich auf bestimmte URL-Pfade – das Crawlen einer gesamten Domain in diesem Umfang verbraucht große Mengen an Guthaben und kann durch die Schutzmaßnahmen der Zielwebsite eingeschränkt sein. Für mittelgroße Websites mit weniger als 50.000 Seiten ist der Gesamtdomain-Modus in der Regel die richtige Wahl für gründliche SEO-Arbeit, die Sitemap-Erstellung und Link-Audits.
Nur Hauptdomain
Crawlen Sie eine Domain – überspringen Sie die Subdomains.
Wenn eine Website Subdomains für separate Bereiche verwendet (blog.example.com, shop.example.com, docs.example.com, support.example.com), crawlt der Modus „Nur Hauptdomain“ ausschließlich example.com und schließt alle Subdomains aus. Der Crawler folgt internen Links innerhalb der Hauptdomain, ignoriert jedoch jeden Link, der in eine Subdomain führen würde.
Dies ist nützlich, wenn Ihre Hauptwebsite, Ihr Blog, Ihr Shop und Ihr Support-Center als logisch getrennte Bereiche fungieren – jeder mit eigener Content-Strategie, Sitemap und SEO-Prioritäten. Crawlen Sie sie unabhängig voneinander in separaten Durchläufen, um die Ergebnisse fokussiert zu halten. „Nur Hauptdomain“ ist auch die richtige Wahl, wenn Sie eine Sitemap benötigen, die nur die URLs Ihrer Kern-Website enthält, ohne dass Subdomain-URLs den Index überladen.
Nur Subdomain
Crawlen Sie eine Subdomain isoliert.
Zielen Sie auf eine einzelne Subdomain ab – Ihren Blog (blog.example.com), Ihren Shop (shop.example.com), Ihr Hilfecenter (support.example.com), Ihr Entwicklerportal (developers.example.com) oder eine beliebige andere Subdomain – ohne die Hauptdomain oder verwandte Subdomains einzubeziehen. Der Crawler folgt internen Links nur innerhalb der angegebenen Subdomain.
Nützlich für bereichsspezifische Audits, bei denen jede Subdomain ihre eigene SEO-Strategie hat und eine separate Behandlung benötigt, für die Erstellung fokussierter Sitemaps pro Bereich oder für das Auditing einer kürzlich gestarteten oder migrierten Subdomain. Kombinieren Sie „Nur Subdomain“ mit der Erkennung defekter Links, um Linkprobleme nach der Migration zu finden, oder mit der Bildlink-Extraktion, um die visuellen Assets einer bestimmten Subdomain zu inventarisieren.
Einzelner Pfad
Crawlen Sie einen bestimmten Bereich einer Website.
Beschränken Sie den Crawl auf einen einzelnen URL-Pfad – zum Beispiel example.com/products/, example.com/blog/ oder example.com/docs/. CrawlHawk entdeckt nur Links innerhalb dieses Pfads und ignoriert alles außerhalb davon. Der Crawler folgt internen Links, die mit dem angegebenen Pfad-Präfix beginnen; Links zu anderen Bereichen derselben Domain werden nicht verfolgt.
Ideal für Produkt-Audits auf Kategorieebene (nur den /products/-Bereich eines Webshops crawlen), Dokumentations-Crawls (nur den /docs/-Baum), die Überprüfung von Blog-Bereichen oder die Analyse eines Teils einer sehr großen Website, ohne die gesamte Website zu verarbeiten. Pfadbasierte Crawls halten den Guthabenverbrauch fokussiert und die Ergebnisse auf das beschränkt, was Sie tatsächlich benötigen.
Einzelne Seite
Extrahieren Sie alle Links von einer URL.
Crawlt eine einzelne URL und erfasst jeden Link, der auf dieser einen Seite enthalten ist – intern, extern, Datei, Bild, defekt – einschließlich der Links, die dynamisch durch JavaScript gerendert werden. Liefert eine präzise Liste ausgehender Links von einer URL mit vollständigem Ankertext, Ziel-URL, HTTP-Status und Linkattributen.
Perfekt für einmalige URL-Prüfungen, Audits von Wettbewerber-Landingpages (auf was verlinkt Ihr Wettbewerber von seiner Startseite aus?), die Analyse einzelner Produktseiten, Prüfungen auf defekte Links auf einer bestimmten wertvollen Seite oder das Extrahieren ausgehender Verweise aus einem ausführlichen Artikel. Der Einzelseitenmodus ist die guthabeneffizienteste Option für enge, gezielte Analysen – eine URL, ein Guthaben.
Zu sammelnde Linktypen
Wählen Sie aus, welche Linkkategorien CrawlHawk meldet. Kombinieren Sie so viele, wie Sie benötigen, innerhalb eines einzigen Crawls – jeder Linktyp ist in jedem Tarif enthalten, und ein Crawl kann jede Kombination aus internen, externen, defekten, verwaisten, Datei- und Bildlinks in einem einzigen konsolidierten Datensatz zurückgeben.
Interne Links
Bilden Sie die Linkstruktur innerhalb Ihrer Domain ab.
Interne Links verbinden Seiten innerhalb derselben Domain. CrawlHawk meldet jeden während des Crawls gefundenen internen Link mit Quell-URL, Ziel-URL, Ankertext, HTTP-Statuscode und Linkattributen (rel=nofollow, sponsored, ugc). Daten zu internen Links sind die Grundlage technischer SEO.
Verwenden Sie die Daten, um unterverlinkte wichtige Seiten zu identifizieren (Seiten mit zu wenigen eingehenden internen Links), um Verbesserungen der internen Verlinkung zu planen (welche Ankertexte auf welche Seiten verweisen), um zu überprüfen, ob wichtige Landingpages innerhalb von 2–3 Klicks von der Startseite aus erreichbar sind, um Link-Equity effizient über Ihre Website zu verteilen und um Content-Silo-Architekturen zu planen, die thematisch verwandte Seiten gruppieren.
Defekte Links
Erkennen Sie 404er, 5xx-Fehler und andere defekte Ziele.
Meldet jeden Link, der über den gecrawlten Umfang einen 4xx- oder 5xx-HTTP-Statuscode zurückgibt. Jeder defekte Link wird mit seiner Quellseite (wo der Link erscheint), der Ziel-URL (worauf er zu verlinken versucht), dem genauen HTTP-Statuscode (404, 500, 503 usw.) und dem Linkkontext (Ankertext und umgebender Text) protokolliert – damit Sie Probleme schnell beheben können.
Entscheidend für die technische SEO-Pflege (defekte Links schaden Rankings und Benutzererfahrung), für Bereinigungen nach einer Migration (wenn sich URL-Strukturen ändern, werden alte interne Links defekt), für die Überprüfung von Affiliate-Links (Provisionseinnahmen hängen von funktionierenden ausgehenden Links ab) und für regelmäßige Website-Zustandsprüfungen. CrawlHawk unterscheidet zwischen Client-Fehlern (4xx – Seite entfernt oder verschoben) und Server-Fehlern (5xx – temporäre Ausfälle, die sich bei einem erneuten Versuch beheben lassen können).
Externe Links
Listen Sie jeden ausgehenden Link Ihrer Website auf.
Identifiziert jeden Link, der auf eine andere Domain verweist. Meldet Quellseite, Ziel-URL, vollständigen Ankertext und rel-Attribute (nofollow, sponsored, ugc, noopener). Das vollständige Inventar externer Links hilft Ihnen zu verstehen, worauf Ihre Website verlinkt und wie diese Links attribuiert sind.
Nützlich für Audits ausgehender Links (an welche Domains sendet Ihre Website Traffic?), für Prüfungen der Markensicherheit (verlinken Sie auf Websites, die Sie lieber vermeiden würden?), für die Identifizierung unbeabsichtigten ausgehenden Traffics, für die Überprüfung der Linkattribut-Konformität bei gesponserten oder Affiliate-Inhalten (die FTC verlangt eine Offenlegung; Google verlangt rel=sponsored für bezahlte Links) und für die Erkennung kompromittierter Seiten mit eingeschleusten externen Links aus Malware oder gehackten Inhalten.
Verwaiste Seiten
Finden Sie Seiten ohne eingehende interne Links.
Verwaiste Seiten existieren auf Ihrer Website, haben aber keine internen Links, die auf sie verweisen – wodurch sie für die meisten Crawler unsichtbar und für Nutzer und Suchmaschinen schwer auffindbar sind. CrawlHawk gleicht Ihre Sitemap oder Ihren bekannten URL-Satz mit dem gecrawlten internen Link-Graphen ab, um Seiten aufzudecken, die existieren, aber von nirgendwo innerhalb der Website verlinkt sind.
Entscheidend für Audits der Website-Abdeckung (ist jede wichtige Seite tatsächlich erreichbar?), für die SEO-Vollständigkeit (Google entdeckt oder rankt verwaiste Seiten möglicherweise nicht effektiv) und für die Überprüfung nach einer Migration (Migrationen erzeugen häufig verwaiste Seiten, wenn Weiterleitungen fehlschlagen). Häufige Ursachen für verwaiste Seiten sind alte Landingpages, veraltete Kategorieseiten, in der Produktion verbliebene A/B-Test-Varianten und Inhalte, die veröffentlicht wurden, ohne aus der Navigation oder von Hubs verlinkt zu werden.
Dateilinks
Extrahieren Sie Links zu PDFs, Dokumenten und herunterladbaren Ressourcen.
Erfasst jeden Link, der auf eine herunterladbare Datei verweist – PDF, DOCX, XLSX, ZIP, MP4, MP3 und jede andere Nicht-HTML-Ressource. Meldet die Quellseite (wo der Link erscheint), die Datei-URL, den Dateityp und die Erweiterung sowie den Linkkontext (Ankertext und umgebender Text).
Nützlich für Audits von Ressourcenbibliotheken (welche PDFs und Whitepaper bietet Ihre Website an, und von wo sind sie verlinkt?), für Überprüfungen der Dokumentenzugänglichkeit, für die Erkennung defekter Dateien (Dateilinks, die 404 zurückgeben), für DSGVO- oder Compliance-Prüfungen (zu wissen, welche Dokumente genau öffentlich verlinkt sind) und für die SEO von dateilastigen Websites mit Downloads, Datenblättern, Broschüren oder Medienarchiven. Wird oft mit dem Prüfer für defekte Links kombiniert, um zu überprüfen, ob alle verlinkten Dateien noch verfügbar sind.
Bildlinks
Finden Sie jede Bild-URL auf einer Website.
Extrahiert jede Bildquellen-URL über den gecrawlten Umfang, mit der Quellseite, auf der das Bild eingebettet ist, dem Alt-Text (oder dessen Fehlen), den Abmessungen, sofern verfügbar, und dem Dateiformat (JPG, PNG, WebP, AVIF, SVG, GIF). Liefert ein vollständiges Bildinventar des gecrawlten Umfangs.
Entscheidend für Bild-SEO-Audits (sind Bilder optimiert, richtig dimensioniert und mit Alt-Text für Zugänglichkeit und Suche versehen?), für die Erkennung defekter Bilder (Bilder, die nicht geladen werden, schaden der Benutzererfahrung), für Überprüfungen der Alt-Text-Abdeckung (welchen Bildern fehlen Alt-Attribute, die für die Barrierefreiheit erforderlich sind), für CDN-Migrationen (Sie benötigen ein vollständiges Bildinventar, bevor Sie Assets verschieben) und für Audits visueller Inhalte auf Ihrer Website oder auf Wettbewerber-Websites.
Was CrawlHawk ist
CrawlHawk ist ein kreditbasierter Web-Datenextraktionsdienst, betrieben von der New Horizon Platforms Kft. in Szeged, Ungarn. Der Dienst vereint einen Web-Crawler, einen XML-Sitemap-Generator, einen Website-Inhalts-Scraper, einen KI-gestützten Produktdaten-Scraper, einen Kontakt-Scraper und einen Lead-Klassifizierer in einer einzigen Oberfläche. Es gibt kein Monatsabo — Nutzer kaufen Kreditpakete, die nie verfallen und ab dem ersten Tag jede Funktion freischalten. Kostenlose Crawls umfassen 500 URLs pro Crawl auf Level 1 ohne Kreditkarte, bis zum ersten Kreditkauf. Hosting und Betrieb befinden sich in der Europäischen Union, mit DSGVO-konformer Verarbeitung und transparenter Anbieteroffenlegung.
Entwickelt für
- SEO-Fachleute, die Website-Audits, Prüfungen auf defekte Links und Überprüfungen der internen Verlinkung durchführen
- E-Commerce-Teams, die Produktkataloge importieren und Wettbewerberdaten überwachen
- Webshop-Betreiber, die Produktdaten mit KI-Extraktion über Lieferantenwebsites hinweg anreichern
- Datenanalysten, die strukturierte Markt- und Produktrecherchen sammeln
- Content-Ersteller und Affiliate-Marketer, die Produktinformationen in großem Umfang zusammenstellen
- Technische SEO-Berater, die Sitemaps erstellen und verwaiste Seiten identifizieren
- Sales- und Lead-Gen-Teams qualifizieren Domainlisten und bauen ansprechbereite Kontaktdatensätze auf
keine Kreditkarte erforderlich