O nas Boty Dla webmasterów API Wsparcie
Dodaj stronę

Dokumentacja crawlera

DiscoverBot.

Odkrywa nowe ścieżki. WebAtlasDiscoverBot eksploruje sieć, zasilając naszą globalną kolejkę indeksowania.

Jak to działa

#

Identyfikacja

WebAtlasDiscoverBot identyfikuje się następującym nagłówkiem User-Agent.

WebAtlasDiscoverBot/2.1 (+https://webatlasindex.pl/discover-bot.php)

↝

Cel i logika

Lekki crawler skupiony wyłącznie na odkrywaniu linków. Respektuje reguły robots.txt pod swoją nazwą, pobiera maksymalnie 512 KB na połączenie i honoruje Crawl-delay, żeby minimalnie obciążać Twój serwer.

⫶

Warstwy filtrowania

Każdy znaleziony link przechodzi przez trzy filtry, zanim trafi do kolejki:

  • Zablokowane domeny reklamowe/społecznościowe.
  • Ścieżki techniczne (np. /admin, /wp-login, /api).
  • Heurystyczne parametry reklamowe/śledzące (gclid, utm_source, clickid).
⌫

Kontrola dla webmastera

Aby całkowicie zablokować WebAtlasDiscoverBota, dodaj to do robots.txt:

User-agent: WebAtlasDiscoverBot
Disallow: /