AIベースの検索エンジンが急速に広がるにつれて、ウェブサイトの運営者はAIクローラをブロックしてコンテンツを保護するのか、露出を維持してAI検索トラフィックの機会をつかむのか、選択の道に立っています。チャットGPT、PerplexityなどのAIボットをブロックするか維持するかは、サイトの性質を考慮して決定できます。
私は、この WordPress ブログについて数ヶ月間、AIクローラーを明示的に許可するコードを追加してテストを進めました。 AIボットを許可すればAI検索を通じて訪問者の流入が増加するのではないかと期待していましたが、今日分析してみると、AIを介して流入する訪問者の数はわずかなレベルであると把握され、AIボットをブロックするように措置を講じました。

AIクローラーブロック対露出維持
AIボットをブロックするかどうかは、ホームページの目的と操作方法に基づいて決定するのが最も合理的です。ブロックをする場合の長所と短所についてまとめると以下のようになります。
AIボットブロックの利点
- コンテンツ不正収集防止: GPTBot、Bytespider、ClaudeBot、AmazonbotなどのAIクローラーがサイトのコンテンツを不正に収集し、学習データとして使用するのを防ぎます。,war
- 知的財産権とプライバシー保護: AIモデルがサイトの投稿、画像、コードなどを分析・活用することを遮断することで、データの誤用を減らし、創造性を維持するのに役立ちます。
- サーバーリソースの節約: 一部のAIボットは毎秒数十回の要求を送信して過負荷を引き起こし、サイトのパフォーマンスを低下させる可能性があるため、これらのボットをブロックするとサーバーの過負荷の問題を回避できます。
- ブランド管理の維持: 自社のコンテンツをAIが再加工して再配布する形態を防止し、ブランドボイスやコンテキストの歪みを軽減できます。,war
AIボットブロックの欠点
- AI検索エンジンの露出の低下: GPTやGoogle-Extended、PerplexityなどのAIベースの検索システムから除外され、AI検索結果による新規訪問者の流入が減ります。,war
- コンテンツ宣伝機会の喪失: サイト自体の認知度が低い場合、AIが情報を引用または要約する過程で公開される可能性を失う可能性があります。,war
- 遮断効果の限界: ブロックしても同様のデータを他のソースから取得し、100%完全な保護は現実的に難しいという制限があります。
Perplexityなどの一部のAIボットは、robots.txtファイルのディレクティブを無視し、不正にデータをクロールすることができます(「パープレクシティ、ウェブサイトのクロール禁止ガイドラインを回避…違法なデータ収集」を参照)。
要約すると...
- ユニークなコンテンツ、収益化されたウェブサイト、ブランド保護の中心:AIボットのブロックを積極的に検討することをお勧めします。
- プロモーションやトラフィックの確保中心ブログ:AIインプレッションによる間接的な訪問の増加が利益になる可能性があるため、フロントブロッキングではなく主要ボットだけをスクリーニングするのが有利かもしれません。
業種別推奨事項
| ウェブサイトの種類 | 推奨 | 이유 |
|---|---|---|
| 収益型ブログ(AdSense) | ブロック | トラフィック = 収益 |
| ニュース/メディア | ブロック | 独占コンテンツ保護 |
| eコマース(ショッピングモール) | 条件付き許可 | 製品情報は露出、レビュー/ガイドはブロック |
| 企業広報サイト | 許可 | ブランド認知優先 |
| 技術文書/チュートリアル | 許可 | コミュニティ貢献 |
| ポートフォリオ | 許可 | 作品露出の機会 |
| 有料コンテンツサイト | ブロック | ビジネスモデルの保護 |
| 学術/研究資料 | オプション | ポリシーに基づいて決定 |
robots.txtファイルを使用してAI学習用ボットをブロックする
私はAIボットを許可しても訪問者の流入にあまり効果がなく、むしろ私のブログコンテンツがAIによって学習され活用されることの問題のため robots.txtの ファイルを使用してAIボットをブロックするコードを追加しました。 (👉2026年2月に中国とロシアの検索エンジンをブロックするコードを追加してコードを更新しました。)
# ========================================
# 1. AI 학습 및 특정 크롤러 차단 설정
# ========================================
# --- [중국 검색 엔진 차단] ---
User-agent: Baiduspider # 바이두(Baidu) 웹 검색 봇
Disallow: /
User-agent: Baiduspider-video # 바이두 동영상 검색 봇
Disallow: /
User-agent: Baiduspider-image # 바이두 이미지 검색 봇
Disallow: /
# --- [러시아 검색 엔진 차단] ---
User-agent: Yandex # 얀덱스(Yandex) 메인 봇
Disallow: /
User-agent: YandexBot # 얀덱스 검색 크롤러
Disallow: /
# --- [대형 테크 기업 AI 및 데이터 수집 차단] ---
User-agent: Amazonbot # 아마존(Alexa 등)의 제품 및 콘텐츠 인덱싱 봇
Disallow: /
User-agent: Applebot-Extended # 애플의 생성형 AI 학습용 데이터 수집 봇 (일반 Applebot과 다름)
Disallow: /
User-agent: GoogleBot-Extended # 구글의 AI(Gemini 등) 학습용 봇 (구글 검색 노출은 유지됨)
Disallow: /
User-agent: Bytespider # 바이트댄스(틱톡 운영사)의 데이터 수집 봇
Disallow: /
User-agent: meta-externalagent # 메타(Facebook, Instagram)의 AI 학습 및 크롤러
Disallow: /
# --- [주요 LLM(거대언어모델) AI 학습 봇 차단] ---
User-agent: GPTBot # OpenAI(ChatGPT)의 학습 데이터 수집 봇
Disallow: /
User-agent: ClaudeBot # 앤스로픽(Claude)의 웹 크롤러
Disallow: /
User-agent: anthropic-ai # 앤스로픽(Claude)의 AI 학습 데이터 수집 봇
Disallow: /
User-agent: cohere-ai # 코히어(Cohere)의 AI 모델 학습 봇
Disallow: /
User-agent: PerplexityBot # 퍼플렉시티(Perplexity) AI 검색 엔진 봇
Disallow: /
# --- [대규모 데이터셋 및 기타 수집 봇 차단] ---
User-agent: CCBot # 커먼 크롤(Common Crawl): 대부분의 AI가 학습 데이터로 사용하는 대형 데이터셋
Disallow: /
User-agent: Diffbot # 웹 데이터를 구조화된 데이터로 추출하는 봇
Disallow: /
User-agent: ImagesiftBot # 이미지 데이터 수집 및 분류 봇
Disallow: /
User-agent: Omgilibot # 커뮤니티 및 포럼 대화 내용 수집 봇
Disallow: /
これらのディレクティブを追加しても、一般的な検索クローラ(Googlebot、Bingbotなど)はブロックされず、AI学習用のクローラのみが選択的にブロックされます。 Google-Extendedをブロックしても、一般的なGoogle検索インプレッションには影響しません。
上記のコードでAIクローラをブロックする場合、AIによってすでに収集され学習されているコンテンツには影響しません。 (しかし、一部のAIはこれを無視し、無断でデータを利用するかもしれません。)
WordPressでは、さまざまな方法でrobots.txtファイルを編集できます。
WordPress プラグインを使用してAIクローラをブロックする
最近、チャットGPT、Googleジェミナイ(Google Gemini)、クロードAI(Claude AI)、パープレクシティ(Perplexity)など、さまざまなAIプラットフォームがWebコンテンツを学習用データとして活用し、Webオペレータはコンテンツ著作権保護とSEOインプレッションのバランスが重要になりました。
WordPress サイトを運営する場合、 WordPress用の無料のプラグイン AIクローラーをブロックするを使用すると、AIクローラーを簡単にブロックできます。

Block AI Crawlersはコンテンツ保護用のプロフェッショナルプラグインで、アクティブ化後に自動的に複数のAIクローラのブロックディレクティブをrobots.txtファイルに追加します。最新バージョンでは、OpenAI、Google、Meta、Anthropic、Perplexity、Applebotなど、主要なAIプラットフォームのクローラを識別してブロックするように設定されています。
主な機能:
- 自動robots.txtアップデート:別のコードを変更せずに主要なAIボットブロックルールを追加しました。
- 実験的なメタタグ(noai、noimageai)の挿入:AIデータセットの使用を禁止する宣言をヘッダに追加します。
- カスタムルールのサポート:独自のrobots.txtルールを直接プラグインで管理できます。
- 検索エンジンに優しい構造:一般的な検索エンジン(Googlebot、Bingbotなど)はブロックされていないため、SEOの影響はほとんどありません。
ただし、robots.txt ディレクティブは「自発的コンプライアンス規約」であるため、すべての AI ボットがこれに必ずしも従わないという制限がありますが、明示的拒否意思表示と最小限の保護措置という点で意味を持ちます。
良い情報ありがとうございます。ウィードプレス置いていて再び始めて幕幕したのに先生が砂漠の中のオアシスみたいな存在ですね…。 Naver ロジックも変わって急変するときに良い方向を提示していただきありがとうございます。
ブログをご覧いただき、コメントまでつけていただきありがとうございます。中国の検索エンジンとロシアの検索エンジンをブロックし、ほとんどのAIボットをブロックするようにコードを更新しました。
AIクローラーの悩みが多いですね!ブロックと露出を維持する間に頭痛の選択になると思います。 AIボットを許可したときに流入が微妙だという点も興味深いですね。
ブランド管理とコンテンツ保護は本当に重要な要素のようです。もしAIクローラーをブロックした後にどんな変化があったのだろうか。
AIクローラのブロック後のトラフィックに大きな変化はありませんでしたが、コンテンツの不正利用の懸念が減った点ほど同じです。しかし、Perplexityなどの一部のAIは、.htaccessディレクティブを無視してコンテンツをクロールし続けるのではないかと疑問に思うかもしれません。データが蓄積されたら、後続の記事でまとめてみましょう。
率直に言って、aiボットはコンテンツだけを傷つけ(?)行き、トラフィック増加効果はないようだと思っていましたが、このような蜂蜜のヒントを書いてくれてありがとう。
流入統計を見るとPerplexityから少し流入するようで、チャットGPTもやや流入するようです。しかし、1週間基準ですべてのAIクローラーを通じた流入をすべて合わせても100回未満になるようです。 AIクローラブロックコードを入れた後、時間がある程度過ぎるのでPerplexityはほとんど流入しませんね。