概要 クローラー ウェブマスターツール API サポート
サイトを追加

クローラードキュメント

RssSitemapBot。

RSS、Atom、サイトマップファイルを読み取り、グローバルなインデックス登録キューを補充します。

仕組み

#

識別

WebAtlasRssSitemapBotは以下のUser-Agentで識別されます。

WebAtlasRssSitemapBot/1.1 (+https://webatlasindex.pl/rsssitemap-bot.php)

⟲

目的とロジック

送信されたRSS/Atomフィードとサイトマップファイルを読み取り、含まれるURLを抽出する軽量クローラーです。

⫶

フィルタリング階層

抽出されたURLは自動的に3つの階層でフィルタリングされます:

  • ブロックリストに登録された広告/SNSドメイン。
  • 技術的なパス(例:/admin、/wp-login、/api)。
  • ヒューリスティックな広告/トラッキングパラメータ(gclid、utm_source、clickid)。
⌫

ウェブマスター向けコントロール

WebAtlasRssSitemapBotを完全にブロックするには、robots.txtに以下を追加してください:

User-agent: WebAtlasRssSitemapBot
Disallow: /