robots.txtを置く場所
通常、ファイルは次のURLで公開します: https://example.com/robots.txt. ルールはファイルを配信するホスト、プロトコル、ポートに適用されます。あるホストのrobots.txtがすべてのサブドメインを自動的に制御するわけではありません。
主なディレクティブ
User-agentは対象クローラグループを示します。Disallowはそのグループにクロールしてほしくないパスを指定します。Allowは広くブロックされた範囲の中でより具体的なパスを許可できます。SitemapはXMLサイトマップのURLを指定します。
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txtとnoindex
よくある誤解は、Disallowを確実な「インデックスしない」指定として扱うことです。robots.txtの主な役割はクロール制御です。クロール可能なページを検索結果に表示させたくない場合は、noindexなどのインデックス制御が対象になります。
robots.txtはセキュリティ機能ではありません
非公開文書、管理領域、顧客データ、ステージング環境の保護にrobots.txtを使わないでください。ファイルは公開され、互換クローラがルールを守ることと認証は別です。機密情報には実際のアクセス制御を使用してください。
ルールの選ばれ方
クローラは最も具体的な対象User-agentグループを選びます。同じプロダクトトークンが複数グループにある場合はルールを統合します。その後、一致する中で最も具体的なAllowまたはDisallowパスを使い、同じ具体性で競合する場合はAllowが優先されます。