Przejdź do treści
Darmowy audyt

Widoczność w AI (GEO) Problem i rozwiązanie

Boty AI zablokowane w robots.txt - jak sprawdzić i odblokować GPTBot, OAI-SearchBot, ClaudeBot i PerplexityBot

Autor: Bartosz Gromek Zaktualizowano: 4 min czytania

W skrócie

  • Objaw: boty AI nie pobierają strony albo dostają błąd 403, a firma nie pojawia się jako źródło w odpowiedziach ChatGPT czy Perplexity.
  • Przyczyna: reguła Disallow w robots.txt (dla konkretnego bota albo dla wszystkich), blokada botów AI w Cloudflare lub innym CDN albo zapora i wtyczka bezpieczeństwa.
  • Rozwiązanie: zdecyduj osobno o botach wyszukujących i trenujących, zapisz decyzję w robots.txt, usuń blokady w CDN i zaporze, a efekt sprawdź w logach serwera.

Nie masz czasu? Zrobimy to za Ciebie - Pozycjonowanie AI (GEO) audyt GEO od 790 zł netto

Jak to wygląda

Strona działa, Google ją indeksuje, ale w odpowiedziach ChatGPT, Perplexity czy Claude nigdy nie pojawia się jako źródło. W logach serwera nie ma wizyt botów AI albo widać je z kodem 403. Często właściciel nie wie o blokadzie, bo dodała ją wtyczka SEO, hosting, poprzedni wykonawca albo domyślne ustawienie usługi CDN.

  • w robots.txt jest reguła Disallow: / dla GPTBot, OAI-SearchBot, ClaudeBot lub PerplexityBot,
  • robots.txt pozwala na dostęp, ale logi pokazują odpowiedzi 403 albo stronę z wyzwaniem,
  • cała strona jest zablokowana dla wszystkich botów regułą User-agent: *.

Dlaczego tak się dzieje

Dostęp botów kontrolują trzy warstwy: plik robots.txt, usługa CDN (np. Cloudflare) i zapora po stronie serwera lub wtyczki. Robots.txt jest tylko prośbą, którą uczciwe boty respektują. CDN i zapora blokują ruch technicznie. Wystarczy blokada w jednej warstwie, żeby bot nie dostał treści.

Boty wyszukujące i trenujące to różne boty

Firmy AI rozdzielają boty według przeznaczenia. Blokując niewłaściwego bota, możesz niechcący zniknąć z wyszukiwania w asystencie albo odwrotnie: udostępnić treści do trenowania, choć tego nie chcesz.

Bot Firma Do czego służy
OAI-SearchBot OpenAI Pokazywanie stron w wyszukiwaniu ChatGPT
GPTBot OpenAI Zbieranie treści do trenowania modeli
ChatGPT-User OpenAI Pobieranie strony na prośbę użytkownika
ClaudeBot Anthropic Zbieranie treści dla modeli Claude
PerplexityBot Perplexity Indeksowanie stron do wyników Perplexity
Google-Extended Google Token decydujący o użyciu treści w Gemini (nie wpływa na wyszukiwarkę Google)
Bingbot Microsoft Indeks Bing, z którego korzysta Copilot

Domyślne blokady w CDN i zaporach

Cloudflare i inne usługi mają ustawienia blokujące boty AI, na części kont włączone domyślnie, a także zarządzany robots.txt, który dopisuje własne reguły. Zapory i wtyczki bezpieczeństwa blokują z kolei nieznane programy albo ruch z zagranicznych serwerów, z których łączą się boty.

Wyjątki tylko dla prawdziwych botów

Nazwę bota łatwo podrobić, dlatego wyjątek w zaporze oparty wyłącznie na nazwie (user-agent) wpuszcza też scrapery, które się pod niego podszywają. OpenAI publikuje listy adresów IP swoich botów, a Google i Bing pozwalają potwierdzić swoje boty przez odwrotne zapytanie DNS. Bezpieczna konfiguracja wpuszcza ruch, który ma nazwę znanego bota i pochodzi z jego oficjalnych adresów, a blokuje ruch, który tylko udaje bota. Wiele usług CDN ma gotowe listy zweryfikowanych botów, z których warto skorzystać zamiast ręcznych reguł.

Przykład robots.txt, który wpuszcza boty wyszukujące i blokuje bota trenującego OpenAI (dostosuj go do własnej decyzji):

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://twojadomena.pl/sitemap.xml

Nigdy nie blokuj Googlebota ani Bingbota, jeśli chcesz być widoczny w Google, AI Overviews, Copilocie i ChatGPT. Blokada Google-Extended nie usuwa strony z wyszukiwarki Google.

Ten problem jest jednym z naszej listy 100 problemów z widocznością firmy w AI.

Darmowy skan GEO

Sprawdź widoczność firmy w AI za darmo

Wpisz adres, a przeniesiemy Cię do bezpłatnego skanu na stronie CodeScriptum.

Jak to rozwiązać krok po kroku

Boty AI zablokowane w robots.txt - jak sprawdzić i odblokować GPTBot, OAI-SearchBot, ClaudeBot i PerplexityBot - https://codescriptum.pl/blog/boty-ai-zablokowane-w-robots-txt/

  1. Otwórz domena.pl/robots.txt i wypisz wszystkie reguły dotyczące botów AI oraz reguły dla wszystkich botów (User-agent: *).
  2. Zdecyduj, które boty chcesz wpuścić: firmy, które chcą być polecane, zwykle wpuszczają boty wyszukujące (OAI-SearchBot, PerplexityBot) oraz Googlebota i Bingbota; o botach trenujących zdecyduj osobno.
  3. Zapisz decyzję w robots.txt jawnie, osobną sekcją dla każdego bota, i upewnij się, że plik zwraca kod 200 jako zwykły tekst.
  4. W panelu Cloudflare lub innego CDN sprawdź ustawienia blokowania botów AI i zarządzanego robots.txt; wyłącz blokady dla botów, które chcesz wpuścić.
  5. Sprawdź zaporę serwera i wtyczkę bezpieczeństwa: limity zapytań, blokady krajów i nieznanych programów. Dodaj wyjątki dla zweryfikowanych botów, sprawdzając ich adresy IP z list publikowanych przez dostawców.
  6. Po zmianach sprawdź logi serwera: wizyty botów AI powinny mieć kod 200.

Jak sprawdzić, że zadziałało

Wywołaj stronę poleceniem curl z nagłówkiem User-Agent zawierającym nazwę bota (np. OAI-SearchBot) i upewnij się, że dostajesz kod 200 i pełną treść. Po kilku dniach sprawdź w logach serwera prawdziwe wizyty botów AI i ich kody odpowiedzi.

Usługa CodeScriptum

Pozycjonowanie AI (GEO)

audyt GEO od 790 zł netto

  • Dostęp botów AI i llms.txt
  • Treści pod odpowiedzi AI
  • Dane strukturalne i wzmianki o firmie

Najczęściej zadawane pytania

Czy robots.txt chroni treści przed wszystkimi botami AI?

Nie. Robots.txt to prośba, którą respektują uczciwe boty. Jeśli chcesz technicznie zablokować ruch, potrzebujesz reguł w CDN lub zaporze, najlepiej opartych na weryfikacji adresów IP.

Czy blokada GPTBot usuwa stronę z ChatGPT?

Według dokumentacji OpenAI nie. GPTBot dotyczy trenowania modeli, a za widoczność w wyszukiwaniu ChatGPT odpowiada OAI-SearchBot.

Jak szybko boty zauważą zmianę w robots.txt?

Boty pobierają robots.txt regularnie, ale z różną częstotliwością. OpenAI podaje, że zmiany dla wyszukiwania mogą być uwzględniane z opóźnieniem, dlatego efekt sprawdzaj w logach po kilku dniach.

Źródła

  1. OpenAI: Overview of OpenAI Crawlers (otwiera się w nowej karcie) platform.openai.com
  2. Google: przegląd robotów Google (w tym Google-Extended) (otwiera się w nowej karcie) developers.google.com

Podobne problemy

O autorze

Bartosz Gromek

Założyciel CodeScriptum, technologia i rozwój

Założyciel CodeScriptum - firmy technologicznej z Łodzi, działającej od 2022 roku. Odpowiada za technologię i rozwój, a projekty realizuje razem z zespołem specjalistów od stron, sklepów internetowych, systemów CRM, integracji, AI i marketingu. Na blogu opisuje problemy, z którymi zgłaszają się klienci CodeScriptum, i sprawdzone sposoby ich rozwiązania.

Newsletter

Konkretne porady raz na jakiś czas

Nowe problemy i rozwiązania z bloga, zmiany w przepisach dla sklepów i stron oraz sprawdzone sposoby na więcej klientów z internetu. Bez spamu, wypis jednym kliknięciem.