O nas Boty Dla webmasterów API Wsparcie
Dodaj stronę

Dokumentacja crawlera

RssSitemapBot.

Odczytuje pliki RSS, Atom i sitemapy, zasilając naszą globalną kolejkę indeksowania.

Jak to działa

#

Identyfikacja

WebAtlasRssSitemapBot identyfikuje się następującym nagłówkiem User-Agent.

WebAtlasRssSitemapBot/1.1 (+https://webatlasindex.pl/rsssitemap-bot.php)

⟲

Cel i logika

Lekki crawler, którego zadaniem jest czytanie przesłanych kanałów RSS/Atom oraz plików sitemap i wyciąganie zawartych w nich adresów URL.

⫶

Warstwy filtrowania

Wyciągnięte adresy URL są automatycznie filtrowane przez trzy warstwy:

  • Zablokowane domeny reklamowe/społecznościowe.
  • Ścieżki techniczne (np. /admin, /wp-login, /api).
  • Heurystyczne parametry reklamowe/śledzące (gclid, utm_source, clickid).
⌫

Kontrola dla webmastera

Aby całkowicie zablokować WebAtlasRssSitemapBota, dodaj to do robots.txt:

User-agent: WebAtlasRssSitemapBot
Disallow: /