CrawlHawk
CrawlHawk

CrawlHawk.com

Próbálja ki ingyen — feltérképezésenként 500 hivatkozás a Level 1-en, az első kreditvásárlásig. Váltson magasabb csomagra több kreditért és funkcióért.

Milyen adatra van szüksége?

Minta.xml
Minta.xlsx
Minta.md
Minta.xlsx
Minta.xlsx
Minta.xlsx

Térképezzen fel bármilyen webhelyet. Generáljon webhelytérképeket. Nyerjen ki termékadatokat.

Hat munkafolyamat. Egy kreditcsomag. Nulla előfizetés.

A CrawlHawk kredit-alapú webes adateszköz, amely hat munkafolyamatot egyesít egy fiókban: webcrawler webhely-auditokhoz és hivatkozás-felderítéshez, Google-kész XML webhelytérkép-generátor, webhelytartalom-gyűjtő, amely bármely webhelyet tiszta, MI-nek kész Markdownná alakít, MI-alapú termékadat-gyűjtő e-kereskedelmi oldalakhoz, kapcsolatgyűjtő a nyilvánosan közzétett kapcsolattartási adatokhoz, és egy lead-osztályozó, amely az Ön saját kritériumai szerint pontozza a domainlistáit. Nincs előfizetés, a kreditek soha nem járnak le, és minden fiók tartalmazza az összes funkciót. Kezdje ingyen, feltérképezésenként 500 URL-lel a Level 1-en, az első kreditvásárlásig, és csak akkor váltson nagyobbra, amikor szükséges. Az EU-ban fejlesztve és üzemeltetve, a GDPR szerint.

Hat munkafolyamat egy eszközben

XML webhelytérkép-generátor

Google-kész webhelytérképek bármely domainből — egyetlen feltérképezéssel.

A CrawlHawk feltérképezi a domainjét (vagy egy kiválasztott hatókört), azonosítja minden indexelhető URL-t, és a sitemaps.org protokollt követő, keresőmotorra kész XML webhelytérképet generál. A kimenetet a Google Search Console, a Bing Webmaster Tools, a Yandex Webmaster és minden nagyobb keresőmotor módosítás nélkül elfogadja.

Használja új webhelyek indításához (hogy a keresőmotorok gyorsan felfedezzék az oldalait), migráció utáni webhelytérkép-újraépítésekhez, amikor az URL-struktúrák megváltoznak, e-kereskedelmi katalógusfrissítésekhez és folyamatos SEO-karbantartáshoz. A CrawlHawk tiszteletben tartja a noindex metacímkéket, a kanonikus URL-eket és a robots.txt utasításokat, valamint automatikusan felosztja az 50 000 URL-es limitet meghaladó webhelytérképeket egy webhelytérkép-indexfájlba. Nincs telepítés, nincs bővítmény, nincs ismétlődő díj — csak a feltérképezett URL-ekért fizet, olyan kreditekkel, amelyek soha nem járnak le.

Egyéni hivatkozás-feltérképező

Részletes hivatkozás-auditok, az Ön elképzelése szerint konfigurálva.

Válassza ki a hatókört (teljes domain, csak fődomain, egyetlen aldomain, URL-útvonal vagy egyetlen oldal) és a kívánt hivatkozástípusokat (belső, külső, hibás, árva, fájl, kép). Minden felfedezett hivatkozáshoz a CrawlHawk visszaadja a forrás URL-t, a cél URL-t, a horgonyszöveget, a HTTP állapotkódot, a hivatkozás típusát és a rel attribútumokat (nofollow, sponsored, ugc, noopener).

Exportálja CSV (táblázatokhoz), JSON (programozott használathoz), Excel XLSX (jelentésekhez), HTML (vizuális áttekintéshez), PDF (ügyfélnek szánt anyagokhoz) vagy XML webhelytérkép formátumba. Gyakori felhasználási esetek: SEO webhelyauditok, hibás hivatkozások karbantartása, belső hivatkozási felülvizsgálatok, kimenő hivatkozások leltározása és versenytársak struktúrájának elemzése. A dinamikusan betöltött tartalom JavaScript-renderelése URL-enkénti kiegészítő kreditköltségért támogatott.

Webhelytartalom-gyűjtő

Bármely webhely tartalma tiszta, MI-nek kész szövegként.

Illessz be egy URL-t, és a CrawlHawk minden oldal fő tartalmát tiszta Markdownként nyeri ki — a navigáció, a footerek és a cookie-bannerek nélkül. A letöltés egy ZIP: oldalanként egy fájl, plusz egy összevont fájl a teljes webhelyről, készen a NotebookLM-be, ChatGPT Projects-be, Claude Projects-be vagy bármilyen RAG-folyamatba való feltöltésre.

Használja MI-asszisztensek és tudásbázisok építéséhez a dokumentációjából, tartalom platformok közti átköltöztetéséhez, teljes webhelyek fordításra való előkészítéséhez, vagy annak auditálásához, hogy az oldalai valójában mit mondanak. A tartalomkinyerés normál feltérképezés — 1 kredit oldalanként, az ingyenes feltérképezés pedig 500 oldalt fedez feltérképezésenként a Level 1-en, regisztráció nélkül, az első kreditvásárlásig — ami a legtöbb blogot és dokumentációs webhelyet ingyen kinyerhetővé teszi.

Webhelytartalom kinyerése

MI-alapú termékgyűjtő

Strukturált termékadatok bármely e-kereskedelmi oldalról — recept nélkül.

Irányítsa a CrawlHawket egy termékoldalra, kategóriára vagy egy teljes katalógusra. Egy MI-modell úgy olvassa az oldalt, ahogy egy ember tenné, és kinyeri a címeket, a teljes leírásokat, az árakat (beleértve a pénznemet és az akciós árakat), a cikkszámokat, a márkákat, a variánsadatokat (méretek, színek, konfigurációk), a képgalériákat, a méreteket, a súlyokat, az anyagokat, a specifikációkat és a készletállapotot — kézi XPath-szabályok, webhelyenkénti receptek vagy sablonbeállítás nélkül.

Ugyanez a gyűjtő működik Shopify-boltokban, WooCommerce-üzletekben, Magentón, BigCommerce-en, egyedi fejlesztésű webhelyeken és a legtöbb nagy piactéren. A kimenet XLSX, JSON vagy CSV formátumban érkezik — minden termék egy sor, egységes attribútumoszlopokkal, készen a közvetlen importra Shopifyba, WooCommerce-be, az ERP-rendszerébe vagy bármely PIM-eszközbe. A JavaScripttel renderelt termékoldalak URL-enkénti kiegészítő kreditköltségért támogatottak.

Kapcsolatgyűjtő

Nyilvános kapcsolattartási adatok, felelősen összegyűjtve.

A CrawlHawk feltérképezi az Ön által megadott webhelyeket, és összegyűjti az általuk közzétett kapcsolattartási adatokat — e-mail-címeket, telefonszámokat, postai címeket és közösségi profil-hivatkozásokat —, minden bejegyzéshez rögzítve a forrás-URL-t. Az eredmény strukturált táblázat: kapcsolati pontonként egy sor, duplikátumok nélkül, készen a CRM-hez.

Legitim megkeresés-kutatáshoz készült: beszállító- és partnerfelderítéshez, B2B prospect-listák építéséhez a cégek saját webhelyéről, és a meglévő nyilvántartás naprakészen tartásához. Minden feltérképezésnél Ön igazolja a jogalapot, és minden export visszavezethető arra a nyilvános oldalra, ahonnan származik. A kapcsolatkinyerés feldolgozott URL-enként használ kreditet, amit a feltérképezés indulása előtt megjelenítünk — a kreditek soha nem járnak le.

Kapcsolati adatok gyűjtése

Lead-osztályozó

Az Ön domainlistája, az Ön kritériumai szerint pontozva.

Illessz be egy domainlistát — vagy tölts fel egy CSV-t —, és írd le hétköznapi nyelven, hogy neked mi a jó lead. A CrawlHawk feltérképezi az egyes webhelyeket, és a kritériumaid szerint pontozza őket: iparági illeszkedés, termékkínálat, céges jelek, bármi, amit meghatároztál. A kimenet a listád vissza, rangsorolva, domainenként egy pontszámmal és egy rövid indoklással.

Olyan sales- és piackutató csapatoknak készült, akiknek van listája, de nincs idejük: disztribútor-shortlisták, kiállítói és cégjegyzék-exportok, gyűjtött prospect-készletek. Ahelyett, hogy ötszáz webhelyet nyitnál meg kézzel, egyetlen rangsorolt táblázatot olvasol, és a tetejéről indulsz. Az osztályozás domainenként használ kreditet, amit a futás indulása előtt megjelenítünk.

Hamarosan

Feltérképezési beállítások

A CrawlHawk öt hatókörmódot támogat, így pontosan a web azon részét célozhatja meg, amely érdekli — egy teljes domaintől egészen egyetlen oldalig. Mind az öt mód minden hivatkozástípussal és minden kimeneti formátummal működik; a hatókör csak azt szabályozza, hogy a feltérképezés milyen szélesen terjed.

Teljes domain feltérképezése

Minden belső oldal, amely egyetlen kiindulási URL-ből elérhető.

Adjon meg egy URL-t, és a CrawlHawk felfedez minden belső oldalt ugyanazon a domainen belül — az összes útvonalon, szakaszon és elérhető URL-en keresztül. A teljes domain feltérképezése ideális teljes webhelyauditokhoz, XML webhelytérkép generálásához új indításokhoz, valamint átfogó belső hivatkozás-feltérképezéshez. Teljes leltárat ad a webhely feltérképezhető struktúrájáról, minden URL-lel, azzal az oldallal, ahonnan felfedezték, és a feltérképezési mélységével.

A több millió URL-lel rendelkező, nagyon nagy platformoknál (eBay, Amazon, Wikipedia, YouTube) használjon inkább szűkebb hatókört, vagy korlátozza a feltérképezést adott URL-útvonalakra — a teljes domain feltérképezése ekkora léptékben nagy mennyiségű kreditet fogyaszt, és a célwebhely védelmei korlátozhatják. Az 50 000 oldal alatti, közepes méretű webhelyeknél a teljes domain mód általában a megfelelő választás az alapos SEO-munkához, a webhelytérkép generálásához és a hivatkozás-auditokhoz.

Csak a fődomain

Térképezzen fel egy domaint — hagyja ki az aldomaineket.

Amikor egy webhely aldomaineket használ különálló tulajdonokhoz (blog.example.com, shop.example.com, docs.example.com, support.example.com), a Csak a fődomain mód kizárólag az example.com címet térképezi fel, és kizárja az összes aldomaint. A feltérképező a fődomainen belüli belső hivatkozásokat követi, de figyelmen kívül hagy minden olyan hivatkozást, amely egy aldomainbe vezetne.

Ez akkor hasznos, ha a fő webhelye, blogja, boltja és ügyfélszolgálati központja logikailag különálló tulajdonként működik — mindegyik saját tartalomstratégiával, webhelytérképpel és SEO-prioritásokkal. Térképezze fel őket egymástól függetlenül, külön menetekben, hogy az eredmények fókuszáltak maradjanak. A Csak a fődomain szintén a megfelelő választás, ha olyan webhelytérképre van szüksége, amely csak az alapwebhelye URL-jeit tartalmazza, anélkül, hogy az aldomain URL-jei összezsúfolnák az indexet.

Csak aldomain

Térképezzen fel egyetlen aldomaint elszigetelten.

Célozzon meg egyetlen aldomaint — a blogját (blog.example.com), a boltját (shop.example.com), a súgóközpontját (support.example.com), a fejlesztői portálját (developers.example.com) vagy bármely más aldomaint — a fődomain vagy bármely testvér-aldomain belefoglalása nélkül. A feltérképező csak a megadott aldomainen belüli belső hivatkozásokat követi.

Hasznos tulajdon-specifikus auditokhoz, ahol minden aldomainnek saját SEO-stratégiája van, és külön kezelést igényel, fókuszált webhelytérképek tulajdononkénti generálásához, vagy egy nemrég indított vagy áttelepített aldomain auditálásához. Párosítsa a Csak aldomain módot hibás hivatkozások felderítésével a migráció utáni hivatkozási problémák megtalálásához, vagy képhivatkozás-kinyeréssel egy adott aldomain vizuális eszközeinek leltározásához.

Egyetlen útvonal

Térképezze fel egy webhely egy adott szakaszát.

Korlátozza a feltérképezést egyetlen URL-útvonalra — például example.com/products/, example.com/blog/ vagy example.com/docs/. A CrawlHawk csak az adott útvonalon belüli hivatkozásokat fedezi fel, és mindent figyelmen kívül hagy azon kívül. A feltérképező azokat a belső hivatkozásokat követi, amelyek a megadott útvonal-előtaggal kezdődnek; ugyanazon domain más szakaszaira mutató hivatkozásokat nem követi.

Ideális kategóriaszintű termékauditokhoz (egy webshop csak a /products/ szakaszának feltérképezése), dokumentáció feltérképezéséhez (csak a /docs/ fa), blogszakaszok felülvizsgálatához, vagy egy nagyon nagy webhely egy részének elemzéséhez az egész feldolgozása nélkül. Az útvonalalapú feltérképezések fókuszáltan tartják a kreditfogyasztást, és pontosan arra korlátozzák az eredményeket, amire valóban szüksége van.

Egyetlen oldal

Nyerje ki az összes hivatkozást egyetlen URL-ből.

Feltérképez egyetlen URL-t, és rögzíti az adott oldalon található összes hivatkozást — belső, külső, fájl, kép, hibás —, beleértve a JavaScript által dinamikusan renderelt hivatkozásokat is. Pontos kimenő hivatkozáslistát ad vissza egyetlen URL-ből, teljes horgonyszöveggel, cél URL-lel, HTTP állapottal és hivatkozásattribútumokkal.

Tökéletes egyszeri URL-ellenőrzésekhez, versenytárs-céloldalak auditálásához (mire hivatkozik a versenytársa a kezdőlapjáról?), egyedi termékoldalak elemzéséhez, hibás hivatkozások ellenőrzéséhez egy adott, nagy értékű oldalon, vagy kimenő hivatkozások kinyeréséhez egy hosszú cikkből. Az egyetlen oldal mód a legkreditkímélőbb lehetőség a szűk, célzott elemzéshez — egy URL, egy kredit.

Gyűjtendő hivatkozástípusok

Válassza ki, mely hivatkozáskategóriákat jelentse a CrawlHawk. Egyetlen feltérképezésen belül annyit kombinálhat, amennyire szüksége van — minden hivatkozástípus minden csomagban benne van, és egyetlen feltérképezés a belső, külső, hibás, árva, fájl- és képhivatkozások bármely kombinációját visszaadhatja egyetlen, összevont adathalmazban.

Belső hivatkozások

Térképezze fel a domainjén belüli hivatkozásstruktúrát.

A belső hivatkozások ugyanazon a domainen belüli oldalakat kötnek össze. A CrawlHawk minden, a feltérképezés során talált belső hivatkozást jelent, a forrás URL-lel, a cél URL-lel, a horgonyszöveggel, a HTTP állapotkóddal és a hivatkozásattribútumokkal (rel=nofollow, sponsored, ugc). A belső hivatkozási adatok a technikai SEO alapját képezik.

Használja az adatokat a túl kevés hivatkozással rendelkező fontos oldalak azonosítására (túl kevés bejövő belső hivatkozással bíró oldalak), a belső hivatkozás javításának tervezésére (mely horgonyszövegek mely oldalakra mutatnak), annak ellenőrzésére, hogy a kulcsfontosságú céloldalak 2-3 kattintáson belül elérhetők-e a kezdőlapról, a hivatkozási erő hatékony elosztására a webhelyén, valamint tematikusan kapcsolódó oldalakat csoportosító tartalomsiló-architektúrák tervezésére.

Hibás hivatkozások

Ismerje fel a 404-es, 5xx-es hibákat és más hibás célokat.

Minden olyan hivatkozást jelent, amely 4xx vagy 5xx HTTP állapotkódot ad vissza a feltérképezett hatókörön belül. Minden hibás hivatkozás rögzítésre kerül a forrásoldalával (ahol a hivatkozás megjelenik), a cél URL-lel (amire hivatkozni próbál), a pontos HTTP állapotkóddal (404, 500, 503 stb.) és a hivatkozás kontextusával (horgonyszöveg és a környező szöveg) — így gyorsan javíthatja a problémákat.

Elengedhetetlen a technikai SEO karbantartásához (a hibás hivatkozások rontják a helyezéseket és a felhasználói élményt), a migráció utáni takarításokhoz (amikor az URL-struktúrák megváltoznak, a régi belső hivatkozások eltörnek), az affiliate hivatkozások ellenőrzéséhez (a jutalékbevétel a működő kimenő hivatkozásoktól függ) és a rendszeres webhely-állapotellenőrzésekhez. A CrawlHawk megkülönbözteti az ügyféloldali hibákat (4xx — az oldal eltűnt vagy áthelyeződött) a szerveroldali hibáktól (5xx — átmeneti kiesések, amelyek újrapróbálkozáskor megoldódhatnak).

Külső hivatkozások

Listázza a webhelyéről kimenő összes hivatkozást.

Azonosít minden, egy másik domainre mutató hivatkozást. Jelenti a forrásoldalt, a cél URL-t, a teljes horgonyszöveget és a rel attribútumokat (nofollow, sponsored, ugc, noopener). A teljes külső hivatkozásleltár segít megérteni, hogy a webhelye mire hivatkozik, és hogyan vannak ezek a hivatkozások attribútumozva.

Hasznos a kimenő hivatkozások auditálásához (mely domainekre küld a webhelye forgalmat?), márkabiztonsági felülvizsgálatokhoz (olyan webhelyekre hivatkozik, amelyekre inkább nem tenné?), a nem szándékos kimenő forgalom azonosításához, a hivatkozásattribútumok megfelelőségének ellenőrzéséhez szponzorált vagy affiliate tartalom esetén (az FTC előírja a közzétételt; a Google rel=sponsored attribútumot ír elő a fizetett hivatkozásokhoz), valamint a rosszindulatú programok vagy feltört tartalom által beszúrt külső hivatkozásokat tartalmazó, kompromittálódott oldalak felderítéséhez.

Árva oldalak

Keresse meg a bejövő belső hivatkozások nélküli oldalakat.

Az árva oldalak léteznek a webhelyén, de nincs rájuk mutató belső hivatkozás — így láthatatlanok a legtöbb feltérképező számára, és a felhasználók, valamint a keresőmotorok is nehezen fedezik fel őket. A CrawlHawk összeveti a webhelytérképét vagy az ismert URL-készletét a feltérképezett belső hivatkozási gráffal, hogy felszínre hozza azokat az oldalakat, amelyek léteznek, de sehonnan sincsenek hivatkozva a webhelyen belül.

Kritikus a webhely lefedettségi auditjaihoz (valóban elérhető minden fontos oldal?), az SEO teljességéhez (a Google esetleg nem fedezi fel vagy nem rangsorolja hatékonyan az árva oldalakat), és a migráció utáni ellenőrzéshez (a migrációk gyakran hoznak létre árvákat, amikor az átirányítások meghiúsulnak). Gyakori árvaság-okok: régi céloldalak, elavult kategóriaoldalak, éles környezetben hagyott A/B teszt-változatok, valamint olyan tartalom, amelyet a navigációból vagy csomópontokból való hivatkozás nélkül tettek közzé.

Fájlhivatkozások

Nyerje ki a PDF-ekre, dokumentumokra és letölthető erőforrásokra mutató hivatkozásokat.

Rögzít minden, letölthető fájlra mutató hivatkozást — PDF, DOCX, XLSX, ZIP, MP4, MP3 és bármely más, nem HTML erőforrás. Jelenti a forrásoldalt (ahol a hivatkozás megjelenik), a fájl URL-jét, a fájltípust és -kiterjesztést, valamint a hivatkozás kontextusát (horgonyszöveg és a környező szöveg).

Hasznos erőforrás-könyvtár auditokhoz (milyen PDF-eket és szakmai anyagokat kínál a webhelye, és honnan hivatkoznak rájuk?), dokumentum-akadálymentességi felülvizsgálatokhoz, hibás fájlok felderítéséhez (404-et adó fájlhivatkozások), GDPR- vagy megfelelőségi felülvizsgálatokhoz (pontosan tudni, mely dokumentumok vannak nyilvánosan hivatkozva), valamint fájlnehéz webhelyek SEO-jához, amelyek letöltéseket, adatlapokat, brosúrákat vagy médiaarchívumokat tartalmaznak. Gyakran párosítják a hibás hivatkozások ellenőrzőjével annak igazolására, hogy minden hivatkozott fájl továbbra is elérhető.

Képhivatkozások

Keressen meg minden kép-URL-t egy webhelyen.

Kinyer minden kép-forrás-URL-t a feltérképezett hatókörön belül, a forrásoldallal, ahol a kép be van ágyazva, az alt szöveggel (vagy annak hiányával), a méretekkel, ahol elérhetők, és a fájlformátummal (JPG, PNG, WebP, AVIF, SVG, GIF). Teljes képleltárt ad vissza a feltérképezett hatókörről.

Kritikus a kép-SEO auditokhoz (optimalizáltak-e a képek, megfelelő méretűek-e, és használnak-e alt szöveget az akadálymentesség és a keresés érdekében?), a hibás képek felderítéséhez (a betöltésre képtelen képek rontják a felhasználói élményt), az alt szöveg lefedettségének felülvizsgálatához (mely képeknél hiányzik az alt attribútum, amely az akadálymentességi megfeleléshez szükséges), a CDN-migrációkhoz (teljes képleltárra van szüksége az eszközök áthelyezése előtt), valamint a vizuális tartalom auditálásához a webhelyén vagy versenytársai webhelyein.

Mi a CrawlHawk

A CrawlHawk kredit-alapú webes adatkinyerő szolgáltatás, amelyet a New Horizon Platforms Kft. üzemeltet Szegeden, Magyarországon. A Szolgáltatás egyetlen felületen egyesít egy webcrawlert, egy XML webhelytérkép-generátort, egy webhelytartalom-gyűjtőt, egy MI-alapú termékadat-gyűjtőt, egy kapcsolatgyűjtőt és egy lead-osztályozót. Nincs havi előfizetés — a Felhasználók kreditcsomagot vásárolnak, amely soha nem jár le, és az első naptól minden funkciót feloldja. Az ingyenes feltérképezés feltérképezésenként 500 URL-t fedez a Level 1-en, bankkártya nélkül, az első kreditvásárlásig. A hosting és az üzemeltetés az Európai Unióban van, GDPR-nek megfelelő adatkezeléssel és átlátható beszállítói közzététellel.

Kiknek készült

  • SEO-szakemberek, akik webhelyauditokat, hibás hivatkozások ellenőrzését és belső hivatkozási felülvizsgálatokat végeznek
  • E-kereskedelmi csapatok, akik termékkatalógusokat importálnak és versenytársi adatokat figyelnek
  • Webshop-tulajdonosok, akik MI-alapú kinyeréssel gazdagítják a termékadatokat a beszállítói webhelyeken
  • Adatelemzők, akik strukturált piac- és termékkutatást gyűjtenek
  • Tartalomkészítők és affiliate marketingesek, akik nagy léptékben állítanak össze termékinformációkat
  • Technikai SEO-tanácsadók, akik webhelytérképeket generálnak és árva oldalakat azonosítanak
  • Sales- és lead-gen csapatok domainlisták minősítése és megkereséshez kész kapcsolati adatok építése

bankkártya nem szükséges