Over ons Crawlers Webmastertools API Support
Pagina toevoegen

Crawlerdocumentatie

De RssSitemapBot.

Leest RSS-, Atom- en sitemapbestanden om onze globale indexeringswachtrij te voeden.

Hoe het werkt

#

Identificatie

WebAtlasRssSitemapBot identificeert zich met de volgende User-Agent.

WebAtlasRssSitemapBot/1.1 (+https://webatlasindex.pl/rsssitemap-bot.php)

⟲

Doel & logica

Een lichtgewicht crawler die ingediende RSS-/Atom-feeds en sitemapbestanden leest en de daarin opgenomen URL's extraheert.

⫶

Filterlagen

Geëxtraheerde URL's worden automatisch gefilterd via drie lagen:

  • Geblokkeerde advertentie-/socialmediadomeinen.
  • Technische paden (bijv. /admin, /wp-login, /api).
  • Heuristische advertentie-/trackingparameters (gclid, utm_source, clickid).
⌫

Controle voor webmasters

Om WebAtlasRssSitemapBot volledig te blokkeren, voeg dit toe aan je robots.txt:

User-agent: WebAtlasRssSitemapBot
Disallow: /