CrawlHawk.com
Crawlen Sie bis zu 500 einzigartige Links KOSTENLOS. Upgrade für mehr Credits & Funktionen.
Jede Website crawlen. Sitemaps erstellen. Produktdaten extrahieren.
Sechs Workflows. Ein Kreditpaket. Kein Abo.
CrawlHawk ist ein kreditbasiertes Web-Daten-Tool, das sechs Workflows in einem Konto vereint: einen Web-Crawler für Site-Audits und Link-Discovery, einen Google-fertigen XML-Sitemap-Generator, einen Website-Inhalts-Scraper, der jede Website in klares, KI-fertiges Markdown verwandelt, einen KI-gestützten Produktdaten-Scraper für E-Commerce-Seiten, einen Kontakt-Scraper für öffentlich gelistete Kontaktdaten und einen Lead-Klassifizierer, der Ihre Domainlisten nach Ihren eigenen Kriterien bewertet. Es gibt kein Abo, Credits verfallen nie, und jedes Konto enthält alle Funktionen. Starten Sie kostenlos mit 500 URLs pro Crawl auf Level 1, bis Sie Ihre ersten Credits kaufen, und upgraden Sie nur, wenn Sie mehr brauchen. In der EU entwickelt und betrieben, DSGVO-konform.
Sechs Workflows in einem Tool
XML-Sitemap-Generator
Google-fähige Sitemaps von jeder Domain — in einem Crawl.
CrawlHawk crawlt Ihre Domain (oder einen ausgewählten Umfang), identifiziert jede indexierbare URL und erstellt eine suchmaschinenfertige XML-Sitemap gemäß dem sitemaps.org-Protokoll. Die Ausgabe wird von der Google Search Console, den Bing Webmaster Tools, dem Yandex Webmaster und jeder großen Suchmaschine ohne Änderung akzeptiert.
Verwenden Sie es bei neuen Webseitenstarts (damit Suchmaschinen Ihre Seiten schnell entdecken), für die Neugenerierung von Sitemaps nach Migrationen bei Änderungen der URL-Struktur, zur Aktualisierung von E-Commerce-Katalogen und zur fortlaufenden SEO-Wartung. CrawlHawk respektiert noindex-Meta-Tags, kanonische URLs und robots.txt-Direktiven und teilt Sitemaps, die das Limit von 50.000 URLs überschreiten, automatisch in eine Sitemap-Indexdatei auf. Keine Installation, kein Plugin, keine laufenden Gebühren – zahlen Sie nur für die URLs, die Sie crawlen, mit Credits, die nie verfallen.
Benutzerdefinierter Link-Crawler
Feinkörnige Link-Audits, konfiguriert nach Ihren Wünschen.
Wählen Sie den Umfang (Gesamte Domain, Nur Hauptdomäne, Einzelne Subdomäne, URL-Pfad oder Einzelne Seite) und die Linktypen, die Sie möchten (interne, externe, defekte, verwaiste, Datei, Bild). Für jeden entdeckten Link gibt CrawlHawk die Quell-URL, Ziel-URL, den Anchor-Text, den HTTP-Statuscode, den Linktyp und die rel-Attribute (nofollow, sponsored, ugc, noopener) zurück.
Exportieren Sie nach CSV (für Tabellen), JSON (für die programmatische Verwendung), Excel XLSX (für Berichte), HTML (zur visuellen Überprüfung), PDF (für Kunden-Deliverables) oder ins XML-Sitemap-Format. Häufige Anwendungen sind SEO-Website-Audits, die Pflege defekter Links, die Überprüfung interner Verlinkungen, Inventare ausgehender Links und die Analyse von Wettbewerberstrukturen. JavaScript-Rendering für dynamisch geladene Inhalte wird gegen zusätzliche Guthabenkosten pro URL unterstützt.
Website-Inhalts-Scraper
Der Inhalt jeder Website als klarer, KI-fertiger Text.
Fügen Sie eine URL ein, und CrawlHawk extrahiert den Hauptinhalt jeder Seite als klares Markdown — Navigation, Footer und Cookie-Banner entfernt. Der Download ist ein ZIP mit einer Datei pro Seite plus einer kombinierten Datei der gesamten Website, bereit zum Upload in NotebookLM, ChatGPT Projects, Claude Projects oder jede RAG-Pipeline.
Nutzen Sie ihn, um KI-Assistenten und Wissensdatenbanken aus Ihrer Dokumentation zu bauen, Inhalte zwischen Plattformen zu migrieren, komplette Websites für die Übersetzung vorzubereiten oder zu prüfen, was Ihre Seiten tatsächlich sagen. Inhaltsextraktion ist normales Crawling — 1 Credit pro Seite, und kostenlose Crawls decken 500 Seiten pro Crawl auf Level 1 ohne Anmeldung ab, bis Sie Ihre ersten Credits kaufen — womit die meisten Blogs und Doku-Websites gratis extrahierbar sind.
AI-Produkt-Scraper
Strukturierte Produktdaten von jeder E-Commerce-Seite — kein Rezept erforderlich.
Zeigen Sie CrawlHawk auf eine Produktseite, Kategorie oder den gesamten Katalog. Ein AI-Modell liest die Seite wie ein Mensch und extrahiert Titel, vollständige Beschreibungen, Preise (einschließlich Währung und Sonderpreise), SKUs, Marken, Varianten-Daten (Größen, Farben, Konfigurationen), Bildgalerien, Maße, Gewichte, Materialien, Spezifikationen und Lagerstatus — ohne manuelle XPath-Regeln, seitenbezogene Rezepte oder Vorlageneinrichtung.
Derselbe Scraper funktioniert bei Shopify-Shops, WooCommerce-Shops, Magento, BigCommerce, individuell entwickelten Websites und den meisten großen Marktplätzen. Die Ausgabe erfolgt als XLSX, JSON oder CSV – jedes Produkt ist eine Zeile mit einheitlichen Attributspalten, bereit für den direkten Import in Shopify, WooCommerce, Ihr ERP oder ein beliebiges PIM-Tool. JavaScript-gerenderte Produktseiten werden gegen zusätzliche Guthabenkosten pro URL unterstützt.
Kontakt-Scraper
Öffentliche Kontaktdaten, verantwortungsvoll erhoben.
CrawlHawk crawlt die von Ihnen angegebenen Websites und sammelt die dort veröffentlichten Kontaktdaten — E-Mail-Adressen, Telefonnummern, Postadressen und Social-Profil-Links — mit der Quell-URL zu jedem Eintrag. Die Ergebnisse kommen als strukturierte Tabelle: eine Zeile pro Kontaktpunkt, dedupliziert, bereit für Ihr CRM.
Gebaut für legitime Outreach-Recherche: Lieferanten- und Partnersuche, Aufbau von B2B-Prospect-Listen aus den eigenen Websites der Unternehmen und Aktuellhalten Ihrer bestehenden Datensätze. Sie bestätigen für jeden Crawl eine Rechtsgrundlage, und jeder Export ist auf die öffentliche Seite zurückverfolgbar, von der er stammt. Die Kontaktextraktion verbraucht Credits pro verarbeiteter URL, angezeigt vor dem Crawl-Start — Credits verfallen nie.
Lead-Klassifizierer
Ihre Domainliste, nach Ihren Kriterien bewertet.
Fügen Sie eine Domainliste ein — oder laden Sie eine CSV hoch — und beschreiben Sie in einfacher Sprache, wie ein guter Lead für Sie aussieht. CrawlHawk crawlt jede Website und bewertet sie nach Ihren Kriterien: Branchenpassung, Produktsortiment, Unternehmenssignale, was auch immer Sie definiert haben. Die Ausgabe ist Ihre Liste zurück, priorisiert, mit einer Bewertung und einer kurzen Begründung pro Domain.
Gebaut für Sales- und Marktforschungsteams, die Listen haben, aber keine Zeit: Distributoren-Shortlists, Aussteller- und Verzeichnisexporte, gesammelte Prospect-Pools. Statt fünfhundert Websites von Hand zu öffnen, lesen Sie eine priorisierte Tabelle und starten oben. Die Klassifizierung verbraucht Credits pro Domain, angezeigt vor dem Start.
Crawler-Optionen
CrawlHawk unterstützt fünf Umfangsmodi, sodass Sie genau den Teil des Webs anvisieren können, der Sie interessiert – von einer gesamten Domain bis hin zu einer einzelnen Seite. Alle fünf Modi funktionieren mit jedem Linktyp und jedem Ausgabeformat; der Umfang steuert nur, wie weit sich der Crawl ausbreitet.
Gesamte Domain crawlen
Jede interne Seite erreichbar von einer Start-URL.
Reichen Sie eine URL ein und CrawlHawk entdeckt jede interne Seite innerhalb derselben Domain — über alle Pfade, Abschnitte und erreichbaren URLs. Der Voll-Domain-Crawl ist ideal für vollständige Site-Audits, XML-Sitemap-Erstellung für neue Veröffentlichungen und umfassende interne Verlinkungskartierung. Er liefert ein vollständiges Inventar der crawlbaren Struktur Ihrer Seite mit jeder URL, der Seite, von der sie entdeckt wurde, und ihrer Crawl-Tiefe.
Bei sehr großen Plattformen mit Millionen von URLs (eBay, Amazon, Wikipedia, YouTube) sollte ein engerer Umfang genutzt oder auf bestimmte URL-Pfade beschränkt werden – das Crawlen der gesamten Domain in diesem Umfang verbraucht viele Credits und könnte durch den Schutz der Zielseite eingeschränkt werden. Für mittelgroße Websites mit weniger als 50.000 Seiten ist der Modus für die gesamte Domain in der Regel die richtige Wahl für umfassende SEO-Arbeiten, Sitemap-Erstellung und Link-Audits.
Nur Hauptdomäne
Crawlen einer Domain — Subdomains überspringen.
Wenn eine Seite Subdomains für separate Bereiche verwendet (blog.example.com, shop.example.com, docs.example.com, support.example.com), durchsucht der Modus „Nur Hauptdomäne“ nur example.com und schließt alle Subdomains aus. Der Crawler folgt internen Links innerhalb der Hauptdomäne, ignoriert jedoch jeden Link, der in eine Subdomäne führen würde.
Dies ist nützlich, wenn Ihre Hauptwebsite, Ihr Blog, Ihr Shop und Ihr Support-Center als logisch getrennte Bereiche fungieren – jeder mit eigener Content-Strategie, Sitemap und SEO-Prioritäten. Crawlen Sie sie unabhängig voneinander in separaten Durchläufen, um die Ergebnisse fokussiert zu halten. „Nur Hauptdomain“ ist auch die richtige Wahl, wenn Sie eine Sitemap benötigen, die nur die URLs Ihrer Kern-Website enthält, ohne dass Subdomain-URLs den Index überladen.
Nur Subdomäne
Crawl eine Subdomain isoliert.
Zielen Sie auf eine einzelne Subdomain ab — Ihren Blog (blog.example.com), Ihren Shop (shop.example.com), Ihr Hilfezentrum (support.example.com), Ihr Entwicklerportal (developers.example.com) oder eine andere Subdomain — ohne die Hauptdomain oder andere Geschwister-Subdomains einzubeziehen. Der Crawler folgt nur internen Links innerhalb der angegebenen Subdomain.
Nützlich für objektbezogene Audits, bei denen jede Subdomain ihre eigene SEO-Strategie hat und eine separate Behandlung benötigt, zur Erstellung fokussierter Sitemaps pro Objekt oder um eine einzelne Subdomain zu prüfen, die Sie kürzlich gestartet oder migriert haben. Kombinieren Sie Subdomain Only mit der Erkennung defekter Links, um Links nach der Migration zu überprüfen, oder mit der Bildlink-Extraktion, um die visuellen Ressourcen einer bestimmten Subdomain zu inventarisieren.
Einzelner Pfad
Einen spezifischen Abschnitt einer Website crawlen.
Beschränken Sie den Crawl auf einen einzigen URL-Pfad — zum Beispiel example.com/products/, example.com/blog/ oder example.com/docs/. CrawlHawk entdeckt Links nur innerhalb dieses Pfads und ignoriert alles außerhalb. Der Crawler folgt internen Links, die mit dem angegebenen Pfad-Präfix beginnen; Links zu anderen Abschnitten derselben Domain werden nicht verfolgt.
Ideal für Produktprüfungen auf Kategorieebene (nur den /products/-Abschnitt eines Webshops crawlen), Dokumentations-Crawls (nur den /docs/-Baum), Blog-Bereichsüberprüfungen oder die Analyse eines Teils einer sehr großen Website, ohne alles zu verarbeiten. Pfadbasierte Crawls halten den Credit-Verbrauch im Fokus und die Ergebnisse beschränkt auf das, was Sie tatsächlich benötigen.
Einzelne Seite
Alle Links von einer URL extrahieren.
Crawlt eine einzelne URL und erfasst jeden Link auf dieser einen Seite — interne, externe, Datei-, Bild-, defekte Links — einschließlich Links, die von JavaScript dynamisch gerendert werden. Gibt eine präzise Liste ausgehender Links von einer URL zurück mit vollständigem Ankertext, Ziel-URL, HTTP-Status und Link-Attributen.
Perfekt für einmalige URL-Prüfungen, Audits von Wettbewerber-Landingpages (auf was verlinkt Ihr Wettbewerber von seiner Startseite aus?), die Analyse einzelner Produktseiten, Prüfungen auf defekte Links auf einer bestimmten wertvollen Seite oder das Extrahieren ausgehender Verweise aus einem ausführlichen Artikel. Der Einzelseitenmodus ist die guthabeneffizienteste Option für enge, gezielte Analysen – eine URL, ein Guthaben.
Linktypen zur Sammlung
Wählen Sie aus, welche Linkkategorien CrawlHawk meldet. Kombinieren Sie so viele, wie Sie innerhalb eines einzigen Crawls benötigen — jeder Linktyp ist in jedem Plan enthalten, und ein Crawl kann jede Kombination aus internen, externen, defekten, verwaisten, Datei- und Bildlinks in einem einzigen konsolidierten Datensatz zurückgeben.
Interne Links
Verlinkungsstruktur innerhalb Ihrer Domain abbilden.
Interne Links verbinden Seiten innerhalb derselben Domain. CrawlHawk meldet jeden internen Link, der während des Crawls gefunden wurde, mit Quell-URL, Ziel-URL, Ankertext, HTTP-Statuscode und Link-Attributen (rel=nofollow, gesponsert, ugc). Interne Link-Daten sind die Basis der technischen SEO.
Verwenden Sie die Daten, um unterverlinkte wichtige Seiten zu identifizieren (Seiten mit zu wenigen eingehenden internen Links), um Verbesserungen der internen Verlinkung zu planen (welche Ankertexte auf welche Seiten verweisen), um zu überprüfen, dass wichtige Zielseiten innerhalb von 2–3 Klicks von der Startseite erreichbar sind, um Link-Effizienz über die ganze Website zu verteilen und um Inhalts-Silo-Architekturen zu planen, die verwandte Seiten thematisch gruppieren.
Defekte Links
404er, 5xx-Fehler und andere defekte Ziele erkennen.
Berichtet jeden Link, der einen 4xx oder 5xx HTTP-Statuscode innerhalb des gecrawlten Bereichs zurückgibt. Jeder defekte Link wird mit seiner Quellseite (wo der Link erscheint), der Ziel-URL (wohin er verlinken soll), dem exakten HTTP-Statuscode (404, 500, 503, etc.) und dem Link-Kontext (Ankertext und umgebender Text) protokolliert — so können Sie Probleme schnell beheben.
Entscheidend für technische SEO-Wartung (defekte Links schaden dem Ranking und der Benutzererfahrung), Säuberungen nach einer Migration (wenn sich URL-Strukturen ändern, brechen alte interne Links), Affiliate-Link-Verifizierung (die Kommissionserträge hängen von funktionierenden ausgehenden Links ab) und regelmäßige Website-Gesundheitschecks. CrawlHawk unterscheidet zwischen Client-Fehlern (4xx — Seite verschwunden oder verschoben) und Server-Fehlern (5xx — temporäre Ausfälle, die sich möglicherweise bei einem erneuten Versuch beheben lassen).
Externe Links
Listen Sie jeden ausgehenden Link von Ihrer Seite auf.
Identifiziert jeden Link, der zu einer anderen Domain führt. Berichtet die Quellseite, Ziel-URL, den gesamten Ankertext und Rel-Attribute (nofollow, gesponsert, ugc, noopener). Das vollständige Inventar externer Links hilft Ihnen, zu verstehen, worauf Ihre Seite verlinkt und wie diese Links zugeschrieben werden.
Nützlich für ausgehende Linkprüfungen (auf welche Domains sendet Ihre Seite Traffic?), Marken-Sicherheitsüberprüfungen (verlinken Sie auf Seiten, auf die Sie lieber nicht verlinken sollten?), Identifizierung unbeabsichtigten ausgehenden Traffics, Verifizierung der Link-Attribut-Konformität für gesponserte oder Affiliate-Inhalte (FTC erfordert Offenlegung; Google erfordert rel=sponsored für bezahlte Links), und Erkennung kompromittierter Seiten mit eingeschleusten externen Links durch Malware oder gehackten Inhalten.
Verwaiste Seiten
Seiten finden, die keine eingehenden internen Links haben.
Verwaiste Seiten existieren auf Ihrer Website, haben aber keine internen Links, die auf sie verweisen – wodurch sie für die meisten Crawler unsichtbar und für Nutzer und Suchmaschinen schwer auffindbar sind. CrawlHawk gleicht Ihre Sitemap oder Ihren bekannten URL-Satz mit dem gecrawlten internen Link-Graphen ab, um Seiten aufzudecken, die existieren, aber von nirgendwo innerhalb der Website verlinkt sind.
Wichtig für Site-Coverage-Audits (ist jede wichtige Seite tatsächlich erreichbar?), SEO-Vollständigkeit (Google kann verwaiste Seiten möglicherweise nicht effektiv entdecken oder bewerten) und Migrationsüberprüfung (bei Migrationen entstehen häufig verwaiste Seiten, wenn Weiterleitungen fehlschlagen). Häufige Ursachen für verwaiste Seiten sind alte Landingpages, veraltete Kategorieseiten, A/B-Testvarianten, die in Produktion geblieben sind, und Inhalte, die veröffentlicht wurden, ohne von Navigation oder Hubs verlinkt zu sein.
Dateilinks
Links zu PDFs, Dokumenten und herunterladbaren Ressourcen extrahieren.
Erfasst jeden Link, der auf eine herunterladbare Datei verweist — PDF, DOCX, XLSX, ZIP, MP4, MP3 und jede andere nicht-HTML-Ressource. Berichtet die Quellseite (wo der Link erscheint), die Datei-URL, den Dateityp und die Erweiterung sowie den Link-Kontext (Ankertext und umgebender Text).
Nützlich für Audits von Ressourcenbibliotheken (welche PDFs und Whitepaper bietet Ihre Website an, und von wo sind sie verlinkt?), für Überprüfungen der Dokumentenzugänglichkeit, für die Erkennung defekter Dateien (Dateilinks, die 404 zurückgeben), für DSGVO- oder Compliance-Prüfungen (zu wissen, welche Dokumente genau öffentlich verlinkt sind) und für die SEO von dateilastigen Websites mit Downloads, Datenblättern, Broschüren oder Medienarchiven. Wird oft mit dem Prüfer für defekte Links kombiniert, um zu überprüfen, ob alle verlinkten Dateien noch verfügbar sind.
Bildlinks
Jede Bild-URL auf einer Seite finden.
Extrahiert jede Bildquellen-URL im gecrawlten Bereich, mit der Quellseite, auf der das Bild eingebettet ist, den Alt-Text (oder dessen Fehlen), den Dimensionen, falls verfügbar, und dem Dateiformat (JPG, PNG, WebP, AVIF, SVG, GIF). Gibt ein vollständiges Bildinventar des gecrawlten Bereichs zurück.
Entscheidend für Bild-SEO-Prüfungen (sind Bilder optimiert, richtig dimensioniert und verwenden Alt-Text für Barrierefreiheit und Suche?), Erkennung defekter Bilder (Bilder, die nicht geladen werden, schaden der Benutzererfahrung), Überprüfungen der Alt-Text-Abdeckung (welche Bilder fehlen Alt-Attribute, die für Barrierefreiheit erforderlich sind), CDN-Migrationen (Sie benötigen ein vollständiges Bildinventar, bevor Sie Assets umziehen), und visuelle Inhaltsprüfungen auf Ihrer Website oder Wettbewerber-Websites.
Was CrawlHawk ist
CrawlHawk ist ein kreditbasierter Web-Datenextraktionsdienst, betrieben von der New Horizon Platforms Kft. in Szeged, Ungarn. Der Dienst vereint einen Web-Crawler, einen XML-Sitemap-Generator, einen Website-Inhalts-Scraper, einen KI-gestützten Produktdaten-Scraper, einen Kontakt-Scraper und einen Lead-Klassifizierer in einer einzigen Oberfläche. Es gibt kein Monatsabo — Nutzer kaufen Kreditpakete, die nie verfallen und ab dem ersten Tag jede Funktion freischalten. Kostenlose Crawls umfassen 500 URLs pro Crawl auf Level 1 ohne Kreditkarte, bis zum ersten Kreditkauf. Hosting und Betrieb befinden sich in der Europäischen Union, mit DSGVO-konformer Verarbeitung und transparenter Anbieteroffenlegung.
Entwickelt für
- SEO-Profis Website-Audits ausführen, defekte Links prüfen und interne Verlinkungen überprüfen
- E-Commerce-Teams Produktkataloge importieren und Wettbewerberdaten überwachen
- Webshop-Betreiber Produktdaten mit KI-Extraktion auf Lieferantenseiten anreichern
- Datenanalysten strukturierte Markt- und Produktforschung sammeln
- Inhalts-Ersteller und Affiliate-Marketer Produktinformationen in großem Maßstab zusammenstellen
- Technische SEO-Berater Sitemaps erstellen und verwaiste Seiten identifizieren
- Sales- und Lead-Gen-Teams qualifizieren Domainlisten und bauen ansprechbereite Kontaktdatensätze auf
keine Kreditkarte erforderlich