AIクローラーのrobots.txt設定例。GPTBot・ClaudeBot と Google-Extended・PerplexityBotを学習用と検索用に分けて書き、Cloudflare側の設定まで確かめる
AIクローラーを
このUser-agent にUser-agent: * の
この
AIクローラーは学習用・検索用・利用者の依頼用の3つに分けて書く
AIの
| 提供会社 | 学習用 | 検索用 | 利用者の |
|---|---|---|---|
| OpenAI | GPTBot |
OAI-SearchBot(答えの |
ChatGPT-User(操作した |
| Anthropic | ClaudeBot |
Claude-SearchBot(答えの |
Claude-User(3つとも |
| Perplexity | 基盤モデルの |
PerplexityBot(答えの |
Perplexity-User(依頼に |
Google-Extended(独立した |
Googlebot |
― |
表の
Google-Extended は、
設定例1:学習用だけを断り、検索用と利用者の依頼は通す
AIの
# 学習用:拒否
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
# それ以外(検索用・利用者の依頼用を含む):管理画面以外を許可
User-agent: *
Disallow: /admin/
Sitemap: https://www.example.co.jp/sitemap.xmlUser-agent の
名前を指定したグループには、User-agent: * の規則が足されない
User-agent: * のここがDisallow: /admin/ を
User-agent: GPTBot
Allow: /
User-agent: *
Disallow: /admin/GPTBot にはUser-agent: * のDisallow を
検索用まで一緒に止めていないかを見る
「AI」をPerplexityBot や Claude-SearchBot、OAI-SearchBot まで
設定例2:すべて許可する(このブログの設定)
このpublic/robots.txt に
User-agent: *
Allow: /
Sitemap: https://www.yamayamabloglink.com/sitemap-index.xmlSitemap は、
すべて
設定例3:AIに読ませたくないページがある場合
一部の
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /members/
Disallow: /admin/
User-agent: *
Disallow: /admin/ただし robots.txt は
robots.txtより先に、CDN側のAIボット設定を確かめる
Cloudflare などの
Cloudflare では、
| 分類 | Cloudflare の |
選べる扱い |
|---|---|---|
| Search |
あとで |
許可/全ページで |
| Agent |
人の |
同上 |
| Training |
モデルの |
同上 |
Cloudflare の
この
管理された robots.txt が足されていないか
このDisallow と、Content-Signal の
リポジトリのrobots.txt だけを
書き換えたあとに確かめる手順
- 公開中の
robots.txt を CDN が取得して、 手元と 比べる。 行を 足していないかを 比べます
curl -s https://www.example.co.jp/robots.txt
curl -sI https://example.co.jp/robots.txt # 寄せる前のホストが 301 で正式なホストへ向くか- Google 側の
記録を、 Google が設定画面の robots.txt レポートで 開く。 最後に 取得した robots.txt と、 取得の 成否を 確かめられます - CDN の
管理画面で、 Cloudflare なら、AIボットの 扱いを 見る。 セキュリティの 設定の 中に ある AI ボットの 方針で、 3つの 分類それぞれの 扱いを 確かめます - 1日置いてから
結果を Google は見る。 robots.txt を 通常24時間まで キャッシュし、 OpenAI も OAI-SearchBot への 反映に 約24時間かかる ことが あると しています
クローラーの-A で
迷ったときの決め方
目的から
| 目的 | robots.txt | CDN の |
|---|---|---|
| AIの |
すべて |
3分類とも |
| 答えには |
学習用の |
学習は |
| AIとの |
学習用・検索用とも |
3分類とも |
どの
robots.txt の
参照した各社の公式ページ(2026年10月3日時点の内容)
- 各クローラーの
目的、 robots.txt の 効き方、 反映の 目安、 IPアドレスの 一覧 → OpenAI の 開発者向け文書 クローラーの 一覧ページ - 3種類の
ボットの 役割、 Crawl-delay への 対応、 IPでの 遮断の 注意 → Anthropic の サポート記事 Does Anthropic crawl data from the web, and how can site owners block the crawler? - 検索用と
利用者の 依頼用の 違い → Perplexity の 開発者向け文書 Perplexity Crawlers - 製品トークンと
しての 位置づけと、 検索の 順位に 響かない 点 → Google の クローラー一覧 Google の 一般的な クローラー - グループの
選ばれ方、 名前の 大文字小文字、 キャッシュ → Google の 仕様 Google に よる robots.txt の 指定の 解釈 - Search・Agent・Training の
分類と、 9月15日からの 既定 → Cloudflare の 変更履歴 New options to manage AI traffic - 従来の
一括ブロックと 廃止の 予定 → Cloudflare の 文書 Block AI Bots - 元の
ファイルの 前に 足される 管理された 記述 → Cloudflare の 文書 robots.txt setting
よくある質問
GPTBotだけ拒否すれば、ChatGPTの検索の答えには今までどおり出ますか?
OpenAIの
Google-Extendedを拒否すると、AI Overviewsに出なくなりますか?
Google-Extended は
robots.txtを書き換えたら、どれくらいで反映されますか?
Googleに