Robots.txt służy do crawlowania, nie do każdej decyzji o URL-u
Robots.txt wybierz tylko wtedy, gdy celem jest ograniczenie pobierania adresów lub zasobów przez crawlera. Inny cel wymaga innego mechanizmu.
- Jeślichcesz ograniczyć pobieranie całych wzorców ścieżek lub zasobówWybierzRobots.txtKontrolujesz crawling, ale nie gwarantujesz usunięcia adresu z Google.
- Jeślipubliczny zasób nie ma pozostać w indeksieWybierzNoindex lub X-Robots-TagGoogle musi móc pobrać zasób, aby odczytać dyrektywę.
- Jeślitrzeba wskazać reprezentanta duplikatów albo przenieść adresWybierzCanonical lub redirectMechanizm porządkuje wersje URL-a zamiast blokować samo pobranie.
- Jeślitreść albo dane mają być naprawdę niedostępne publicznieWybierzLogowanie lub blokada serweraPubliczny plik robots.txt nie jest zabezpieczeniem dostępu.
Robots.txt kontroluje pobieranie strony przez crawlera
Plik robots.txt odpowiada na pytanie: czy robot może pobrać daną ścieżkę? Widoczność URL-a w indeksie Google zależy od innych sygnałów, dyrektyw i statusów. Ta różnica jest krytyczna, bo wiele błędów SEO zaczyna się od założenia, że Disallow i noindex mają ten sam skutek.
Gdy robot zna URL, pobiera robots.txt dla właściwego hosta, protokołu i portu. Następnie wybiera najbardziej konkretną grupę user-agent — grupa ogólna * nie jest łączona z grupą specyficzną — i dopasowuje regułę do ścieżki. Dopuszczony adres może przejść do renderowania i oceny indeksowalności; przy blokadzie Google może nie zobaczyć treści, meta robots ani canonicala.
Robots.txt jest publiczną instrukcją dla crawlerów, które ją respektują. Nie chroni danych, nie usuwa URL-a z indeksu, nie zastępuje canonicala i nie poprawia jakości treści. Zablokowany adres może nadal być znany z linków i pojawić się w Google bez opisu; prywatne zasoby wymagają autoryzacji albo blokady serwerowej.
Plik jest więc elementem szerszej diagnostyki: crawlowania, statusów HTTP, sitemap, linkowania wewnętrznego, canonicali, renderowania i raportów w Google Search Console.
Najważniejsze reguły składni robots.txt
Składnia jest prosta, ale błędy mają duży zasięg. Warto trzymać plik krótki, komentować powód reguł i testować dopasowanie na realnych adresach, zwłaszcza przy symbolach wieloznacznych.
| Element | Znaczenie | Przykład |
|---|---|---|
| User-agent | wskazuje robota, którego dotyczy grupa reguł | User-agent: Googlebot |
| Disallow | blokuje pobieranie wskazanej ścieżki | Disallow: /koszyk/ |
| Allow | pozwala pobrać ścieżkę, często jako wyjątek w zablokowanym katalogu | Allow: /wp-admin/admin-ajax.php |
| Sitemap | wskazuje pełny adres mapy witryny lub indeksu sitemap | Sitemap: https://example.com/sitemap.xml |
| * | dopasowuje zero lub więcej znaków w ścieżce | Disallow: /*?sort= |
| $ | oznacza koniec adresu URL | Disallow: /*.pdf$ |
| Crawl-delay | nie jest obsługiwany przez Google jako dyrektywa w robots.txt | Crawl-delay: 10 |
| # | rozpoczyna komentarz; treść komentarza nie jest regułą crawlowania | # blokada koszyka |
Wpis Sitemap: wskazuje lokalizację mapy, ale nie rozstrzyga, które adresy powinny się w niej znaleźć. Dobór kanonicznych, dostępnych i indeksowalnych URL-i opisują zasady doboru URL-i do sitemap.xml.
Przykłady robots.txt - od bezpiecznych reguł do ryzykownych blokad
Dobry robots.txt opisuje typy adresów URL i ich rolę w serwisie. Lista pojedynczych, przypadkowych adresów szybko robi się trudna w utrzymaniu. Poniższe przykłady traktuj jako wzorce decyzyjne: przed wdrożeniem trzeba je porównać z realną strukturą hosta, sitemapą, logami i rolą konkretnych ścieżek w SEO.
Domyślnie wszystko dozwolone
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xmlKiedy: Gdy strona nie potrzebuje ograniczeń crawlowania, a plik ma głównie wskazać mapę witryny.
Uwaga: Pusta wartość Disallow oznacza brak blokady dla danej grupy.
Blokada całej witryny
User-agent: *
Disallow: /Kiedy: Dla stagingu, środowiska testowego lub krótkiej sytuacji awaryjnej.
Uwaga: Na produkcji to jedna z najgroźniejszych reguł, bo odcina crawling wszystkich ścieżek.
WordPress i WooCommerce
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Sitemap: https://example.com/sitemap_index.xmlKiedy: Dla panelu administracyjnego, koszyka, checkoutu i konta klienta, jeśli nie mają roli jako wyniki organiczne.
Uwaga: Nie blokuj zasobów lub endpointów, które są potrzebne do działania frontu.
Parametry, sortowania i wyszukiwarka
User-agent: *
Disallow: /search/
Disallow: /*?s=
Disallow: /*&s=
Disallow: /*?sort=
Disallow: /*&sort=
Disallow: /*?orderby=
Disallow: /*&orderby=Kiedy: Dla crawl traps tworzonych przez wyniki wyszukiwarki, sortowania i techniczne parametry.
Uwaga: Wzorzec z ? obejmuje parametr na początku query string, a wariant z & ten sam parametr na dalszej pozycji. Przetestuj realne kombinacje i nie blokuj filtrów z popytem oraz własną wartością SEO.
ChatGPT Search i trening jako osobne decyzje
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /Kiedy: Gdy chcesz dopuścić pobieranie do funkcji wyszukiwania AI, ale nie chcesz udostępniać treści dla GPTBot.
Uwaga: To decyzja produktowa i prawna, nie tylko techniczna. Reguły dla botów AI warto opisać osobno.
Gdzie powinien znajdować się plik robots.txt?
Plik musi być dostępny jako /robots.txt w katalogu głównym konkretnego hosta. Reguły nie przechodzą automatycznie na inne subdomeny, protokoły ani niestandardowe porty. Dla Googlehttps://example.com/robots.txt i https://shop.example.com/robots.txt dotyczą innych hostów.
- Nazwa pliku to dokładnie
robots.txt. - Plik powinien być tekstowy i zakodowany w UTF-8.
- Reguły są ważne tylko dla hosta, protokołu i portu, na których plik jest udostępniony.
- Plik w podkatalogu, np.
/folder/robots.txt, nie jest właściwym plikiem dla całej witryny. - Warto utrzymywać plik poniżej limitu rozmiaru i bez zbędnej listy pojedynczych wyjątków.
Co się dzieje, gdy robots.txt zwraca 404, 5xx albo przekierowanie?
Status HTTP pliku robots.txt wpływa na to, czy Googlebot uzna, że ma ograniczenia crawlowania. To ważne przy awariach, migracjach i konfiguracjach CDN, gdzie sam plik bywa przypadkowo przekierowany, zablokowany lub generowany przez aplikację.
| Status | Jak interpretuje Google? | Co zrobić? |
|---|---|---|
| 2xx | Google przetwarza plik robots.txt jako dostarczony przez serwer. | To prawidłowy stan dla aktywnego pliku. |
| 3xx | Google podąża za co najmniej 5 przekierowaniami, a po przekroczeniu limitu traktuje sytuację jak 404. | Utrzymuj prosty, bezpośredni adres /robots.txt. |
| 4xx | Większość błędów 4xx, poza 429, jest traktowana tak, jakby prawidłowy plik nie istniał. | Brak pliku jest dozwolony, ale oznacza brak ograniczeń crawlowania. |
| 5xx | Przez pierwsze 12 godzin Google może wstrzymać crawling. Potem przez około 30 dni może używać ostatniej dobrej wersji, jeśli ją ma. | Traktuj to jak awarię dostępności: sprawdź serwer, cache, CDN i reguły bezpieczeństwa. |
| Cache | Google zwykle buforuje robots.txt do 24 godzin, a dłużej wtedy, gdy odświeżenie pliku jest niemożliwe. | Po zmianie krytycznej użyj raportu robots.txt w GSC, ale nie zakładaj natychmiastowego efektu. |
Robots.txt a noindex - najczęściej popełniane błędy
Jeśli chcesz, żeby strona HTML nie była widoczna w Google, użyj noindex w meta robots albo odpowiedniego nagłówka HTTP. Nie blokuj jednocześnie crawlowania tej strony w robots.txt, bo Google może nie pobrać HTML-u i nie zobaczyć dyrektywy noindex.
- Robots.txt
Kontroluje pobieranie
Mówi robotowi, czy może wejść pod daną ścieżkę. Dobre dla crawl traps, filtrów i ścieżek bez wartości SEO.
- Noindex
Kontroluje indeks
Mówi wyszukiwarce, żeby nie pokazywała strony w wynikach, ale wymaga pobrania strony lub nagłówka.
Robots.txt a canonical - inna decyzja dla podobnych URL-i
Canonical pomaga wskazać reprezentatywną wersję podobnych stron. Robots.txt ogranicza pobieranie. Jeśli zablokujesz warianty w robots.txt, Google może nie zobaczyć canonicala na tych wariantach. Przy małej liczbie duplikatów często lepsza jest spójna kanonikalizacja, linkowanie i sitemap niż natychmiastowy Disallow.
Przy ogromnych przestrzeniach URL-i, na przykład sortowaniach i parametrach w sklepie, decyzja może być mieszana: część filtrów indeksować jako wartościowe landing pages, część kanonikalizować, a część ograniczyć w robots.txt.
Czy blokować CSS, JavaScript i obrazy?
Zasobów potrzebnych do renderowania zwykle nie należy blokować. Jeśli Google nie może pobrać CSS, JavaScriptu lub krytycznych plików, może zobaczyć stronę inaczej niż użytkownik. Blokada ma sens tylko wtedy, gdy brak zasobu nie utrudnia interpretacji strony.
Gdy zasób wpływa na to, co Google widzi po uruchomieniu strony, diagnoza wychodzi poza sam plik robots.txt i przechodzi do JavaScript SEO oraz renderowania treści.
Robots.txt w sklepie internetowym - filtry, parametry i koszyk
W e-commerce robots.txt może realnie poprawić efektywność crawlu, ale tylko wtedy, gdy wynika z mapy URL-i. Najpierw trzeba rozdzielić adresy z popytem i unikalną wartością od kombinacji, które generują nieskończoną przestrzeń crawlowania.
| Decyzja | Przykłady | Warunek |
|---|---|---|
| Zwykle blokować crawling | koszyk, logowanie, panel klienta, wyszukiwarka wewnętrzna, sortowania, parametry sesji | Gdy URL-e nie mają roli jako osobne wyniki i tworzą dużą liczbę kombinacji. |
| Decydować selektywnie | filtry kategorii, tagi, warianty produktów, paginacja, archiwa | Gdy część URL-i ma popyt, unikalną wartość i sens w architekturze SEO. |
| Nie blokować przypadkowo | kategorie, produkty, artykuły poradnikowe, zasoby potrzebne do renderowania | Gdy mają generować widoczność lub są potrzebne, żeby Google zrozumiał stronę. |
Czy robots.txt oszczędza crawl budget?
Może ograniczyć pobieranie URL-i, których Google nie powinien przetwarzać, ale crawl budget nie jest głównym problemem każdej strony. Według dokumentacji Google temat jest szczególnie istotny przy bardzo dużych serwisach, często aktualizowanych witrynach i dużych grupach adresów wykrytych, ale niezaindeksowanych.
Mała strona firmowa
Robots.txt rzadko rozwiązuje główny problem SEO. Częściej winne są noindex, brak linków, słaba treść lub błędne przekierowania.
PriorytetSprawdź, czy plik nie blokuje całej witryny, bloga, usług, CSS, JS i sitemap.
Serwis contentowy
Archiwa, tagi, wyszukiwarka i duplikujące się ścieżki mogą rozcieńczać crawl i sygnały tematyczne.
PriorytetOddziel strony z rolą semantyczną od stron porządkowych i zdecyduj, które mają być crawlowane.
Sklep internetowy
Filtry, sortowania, parametry i niedostępne produkty mogą tworzyć bardzo dużą pulę adresów URL.
PriorytetProjektuj reguły na poziomie typów URL-i, nie pojedynczych przypadków znalezionych w raporcie.
Robots.txt w WordPressie, WooCommerce i innych CMS-ach
W CMS-ach plik robots.txt może być fizycznym plikiem albo generowaną odpowiedzią pod adresem /robots.txt. To normalne, ale przy audycie trzeba sprawdzić efekt końcowy, nie tylko ustawienie w panelu lub wtyczce.
- Sprawdź publiczny plik, a nie tylko konfigurację wtyczki SEO.
- Upewnij się, że środowisko produkcyjne nie przejęło blokady ze stagingu.
- W WooCommerce kontroluj koszyk, konto, checkout, wyszukiwarkę i wybrane parametry.
- Nie blokuj
/wp-admin/admin-ajax.php, jeśli strona używa go do działania frontu. - Po zmianach wyczyść cache aplikacji, hostingu i CDN, jeśli plik jest generowany dynamicznie.
Staging, subdomeny i migracje - gdzie robots.txt najczęściej szkodzi?
Największe ryzyko pojawia się przy przejściu ze stagingu na produkcję. Reguła Disallow: / jest poprawna na środowisku testowym, ale na produkcji może odciąć crawling całej witryny. Przy migracji trzeba też sprawdzić, czy nowy host, subdomena, wersja HTTPS i CDN zwracają właściwy plik.
Robots.txt a boty AI - decyzja o dostępie to także decyzja o widoczności
Część botów AI i wyszukiwarek respektuje robots.txt, ale nie wszystkie systemy działają identycznie. Z perspektywy firmy decyzja nie brzmi tylko „blokować AI czy nie”, lecz: które boty mogą pobierać stronę, w jakim celu i czy blokada nie ograniczy widoczności w odpowiedziach AI.
Jeśli analizujesz ten obszar, rozdziel crawling pod wyszukiwanie, pobrania inicjowane przez użytkownika i wykorzystanie treści do treningu. W KEO przygotowaliśmy do tego tester robots.txt dla AI.
| Bot | Rola | Decyzja SEO |
|---|---|---|
| OAI-SearchBot | Crawler używany przez OpenAI do funkcji wyszukiwania, między innymi ChatGPT Search. | Dopuszczenie może wspierać obecność w odpowiedziach wyszukiwarkowych ChatGPT. Blokada może ograniczyć taką widoczność. |
| GPTBot | Crawler treści, które mogą być używane przy trenowaniu generatywnych modeli AI. | To osobna decyzja od widoczności w wyszukiwaniu. Możesz blokować GPTBot bez blokowania OAI-SearchBot. |
| ChatGPT-User | Pobrania inicjowane przez użytkownika w trakcie używania ChatGPT, a nie klasyczny automatyczny crawl. | Nie używaj go jako głównej dźwigni SEO. OpenAI opisuje go jako inny typ dostępu niż crawl do wyszukiwania. |
Jak testować robots.txt przed i po wdrożeniu?
Test nie powinien kończyć się na otwarciu pliku w przeglądarce. Trzeba sprawdzić dostępność pliku, dopasowanie reguł do realnych URL-i, interpretację Google i wpływ na ważne sekcje serwisu.
- Otwórz publiczny adres /robots.txt w przeglądarce i sprawdź, czy plik zwraca treść tekstową.
- Zweryfikuj, który plik robots.txt dotyczy konkretnego URL-a: liczy się protokół, host i port.
- Użyj raportu robots.txt w Google Search Console, jeśli jest dostępny dla danej usługi.
- Dla pojedynczego adresu użyj Inspekcji URL i sprawdź, czy Google widzi blokadę crawlowania.
- Sprawdź ważne typy URL-i na realnych przykładach, a nie tylko na wzorcach reguł.
- Jeśli korzystasz z Google Ads, nazwij roboty AdsBot jawnie, bo globalna grupa * nie obejmuje ich tak samo jak standardowych crawlerów Google.
- Uwzględnij cache: Google zwykle może pamiętać robots.txt do 24 godzin.
- Po zmianie krytycznej poproś o ponowne zindeksowanie pliku robots.txt w GSC, ale nie traktuj tego jako gwarancji natychmiastowego crawlu URL-i.
- Przy dużym serwisie porównaj reguły z logami serwera i statystykami indeksowania.
Jak mierzyć efekt zmian w robots.txt?
Efektem nie jest sama obecność pliku. Efektem jest lepszy rozkład crawlu: mniej żądań do URL-i bez wartości i więcej uwagi dla stron, które mają generować widoczność, leady lub sprzedaż.
| Metryka | Co mówi? | Gdzie sprawdzić? |
|---|---|---|
| Żądania Googlebota według typu URL-a | Czy robot trafia w strony usług, kategorie i produkty, czy w parametry, sortowania i koszyk? | logi serwera, Crawl Stats, crawl narzędziem SEO |
| Statusy pobieranych URL-i | Czy blokada robots.txt nie ukrywa problemów, które powinny zwracać 404, 410 albo mieć przekierowanie? | logi serwera, tester przekierowań, raporty GSC |
| URL-e zablokowane, ale znane Google | Czy w wynikach lub GSC pojawiają się adresy bez opisu, bo Google zna URL, ale nie może pobrać treści? | Inspekcja URL, raport indeksowania, zapytania site: |
| Crawl zasobów CSS i JS | Czy Google ma dostęp do plików potrzebnych do renderowania i zrozumienia strony? | render w Inspekcji URL, logi, crawl techniczny |
Diagnostyka robots.txt - objaw, przyczyna i szybkie sprawdzenie
Robots.txt rzadko występuje jako izolowany problem. Najszybsza diagnoza łączy objaw w Google, regułę w pliku, status HTTP, linkowanie i dane z crawlu lub logów.
| Objaw | Prawdopodobna przyczyna | Co sprawdzić? |
|---|---|---|
| URL widoczny w Google bez opisu | Adres jest zablokowany w robots.txt, ale Google zna go z linków, sitemapy lub historii crawlu. | Inspekcja URL, wynik SERP, reguła Disallow, linki wewnętrzne i zewnętrzne. |
| Po wdrożeniu spadł crawl całej witryny | Na produkcji pojawiło się Disallow: /, plik /robots.txt zwraca 5xx albo CDN serwuje złą wersję. | Raport robots.txt w GSC, logi serwera, status HTTP pliku i cache po stronie CDN. |
| Noindex nie działa | Strona jest jednocześnie zablokowana w robots.txt, więc Google nie może pobrać HTML-u lub nagłówka. | Odblokuj crawl dla testowego URL-a, sprawdź meta robots albo X-Robots-Tag i ponów inspekcję. |
| Googlebot pobiera setki wariantów parametrów | Filtry, sortowania albo wyszukiwarka wewnętrzna tworzą crawl trap bez decyzji, które typy adresów mają być crawlowane. | Logi serwera, Crawl Stats, crawl techniczny i lista parametrów według liczby żądań. |
| Ważna sekcja nie jest crawlowana | Zbyt szeroki wildcard, reguła dla konkretnego Googlebota albo plik dla złego hosta blokuje ścieżkę. | Test dopasowania reguł, crawl techniczny, Inspekcja URL i porównanie hosta/protokołu/portu. |
Najczęstsze błędy robots.txt pod kątem SEO
Disallow: / na produkcji - blokada przeniesiona ze stagingu potrafi odciąć crawling całej witryny
Robots.txt zamiast noindex - strona może nadal pojawiać się w wynikach, tylko bez pełnej treści i opisu
Noindex na stronie zablokowanej w robots.txt - Google nie może pobrać HTML-u, więc może nie zobaczyć dyrektywy
Blokowanie CSS i JS - Google może mieć uboższy obraz strony i gorzej ocenić render
Za szerokie wzorce z * - jedna reguła może objąć więcej URL-i, niż zakładał zespół
Brak osobnych plików dla subdomen - plik z domeny głównej nie steruje automatycznie subdomeną
Traktowanie robots.txt jako zabezpieczenia - plik jest publiczny i zależy od posłuszeństwa bota
Sitemap z adresami zablokowanymi - wysyłasz sprzeczny sygnał: zgłaszasz URL jako ważny i jednocześnie blokujesz jego pobieranie
Jak ustalić priorytet poprawek w robots.txt?
Nie każda zmiana w robots.txt ma taki sam ciężar. Najpierw napraw blokady, które zatrzymują crawling ważnych sekcji albo uniemożliwiają Google odczytanie noindex, canonicala i renderu.
| Priorytet | Przykłady | Następny krok |
|---|---|---|
| Krytyczne | Disallow: / na produkcji, 5xx dla /robots.txt, blokada usług, kategorii, produktów lub artykułów. | Napraw przed innymi zmianami, wyczyść cache i sprawdź raport robots.txt oraz Inspekcję URL. |
| Wysokie | Noindex połączony z Disallow, blokada CSS/JS, sitemap z adresami zablokowanymi w robots.txt. | Usuń sprzeczność i sprawdź, czy Google może pobrać treść oraz zasoby potrzebne do renderowania. |
| Średnie | Crawl traps w filtrach, sortowaniach, wynikach wyszukiwarki wewnętrznej i parametrach sesyjnych. | Podejmij decyzję po analizie typów adresów URL, popytu, logów i roli danego typu strony. |
| Niskie | Komentarze, kolejność sekcji, drobna konsolidacja reguł bez zmiany zachowania crawlera. | Porządkuj przy okazji utrzymania technicznego, ale nie mieszaj tego z krytycznymi naprawami. |
Checklista robots.txt przed publikacją zmian
- Plik jest dostępny pod /robots.txt dla właściwego hosta, protokołu i portu.
- Nie ma reguły blokującej całą produkcyjną domenę.
- Ważne strony usług, kategorii, produktów i artykułów nie są zablokowane.
- CSS, JS i zasoby potrzebne do renderowania są dostępne dla Googlebota.
- Sitemap ma pełny URL i prowadzi do adresów kanonicznych, które mają być crawlowane.
- Plik ma poniżej 500 KiB i nie zawiera niepotrzebnej listy pojedynczych wyjątków.
- Nie używasz Crawl-delay jako mechanizmu sterowania Googlebotem.
- Reguły dla Googlebota i grupy globalnej są świadomie rozdzielone.
- Jeśli reguły dotyczą AdsBot, robot jest nazwany jawnie w osobnej grupie.
- Adresy do usunięcia z indeksu mają noindex, X-Robots-Tag, 404/410 albo ochronę hasłem, a nie sam Disallow.
- Filtry i parametry e-commerce mają decyzję na poziomie typu URL-a.
- Zmiana została sprawdzona w GSC, crawlerze technicznym i, przy dużym serwisie, w logach.
Powiązane tematy i narzędzia
Robots.txt jest jednym elementem technicznego SEO. Poniższe materiały prowadzą do sąsiednich etapów: crawlingu, indeksowania, linkowania, audytu i testowania botów.
szerszy kontekst odkrywania i pobierania URL-i przez Googlebota
diagnostyka sytuacji, gdy URL nie pojawia się w wynikach
hub o crawl, index, canonical, statusach HTTP, JS i architekturze
jak prowadzić Googlebota do właściwych stron
Nie masz pewności, czy robots.txt pomaga, czy blokuje widoczność?
W audycie sprawdzamy robots.txt razem z crawlingiem, indeksowaniem, sitemapą, canonicalami, statusami HTTP, renderowaniem i linkowaniem. Dzięki temu decyzja nie opiera się na jednej regule, tylko na całym przepływie od URL-a do wyniku.
FAQ
01Czy robots.txt wpływa na SEO?
Tak, ale głównie przez kontrolę crawlowania. Dobrze ustawiony plik może ograniczyć pobieranie URL-i bez wartości, a źle ustawiony może zablokować ważne sekcje, zasoby albo całą witrynę.
02Czy robots.txt usuwa stronę z Google?
Nie. Robots.txt nie jest mechanizmem usuwania strony z wyników. Jeśli URL jest zablokowany, Google może nadal znać adres z linków i pokazać go bez opisu. Do blokowania indeksowania używa się noindex, X-Robots-Tag, ochrony hasłem, usunięcia strony albo właściwego statusu HTTP.
03Czy można użyć noindex w robots.txt?
Nie w Google. Google nie obsługuje reguły noindex w pliku robots.txt. Noindex powinien być w meta robots w HTML-u albo w nagłówku HTTP X-Robots-Tag.
04Czy brak pliku robots.txt jest błędem?
Nie. Jeśli nie masz pliku robots.txt, Google zwykle zakłada brak ograniczeń crawlowania. Błędem jest brak pliku wtedy, gdy serwis potrzebuje świadomie ograniczać duże grupy URL-i albo wskazać sitemapę w prostym, publicznym miejscu.
05Czy blokować CSS i JavaScript w robots.txt?
Zwykle nie blokuj zasobów potrzebnych do renderowania strony. Google może używać CSS i JavaScriptu, żeby zrozumieć układ, treść i działanie strony. Blokuj tylko zasoby, których brak nie zmienia istotnie interpretacji strony.
06Czy sitemap w robots.txt jest obowiązkowa?
Nie jest obowiązkowa, ale jest praktyczna. Wpis Sitemap pomaga robotom znaleźć mapę witryny, a przy większych serwisach ułatwia utrzymanie spójnej diagnostyki crawlowania i indeksowania.
07Czy crawl budget ma znaczenie dla małej strony?
Zwykle mniejsze niż dla dużego sklepu lub portalu. Przy małej stronie częściej problemem jest przypadkowa blokada, słabe linkowanie, noindex, canonical albo brak jakościowej treści.
08Czy Google obsługuje Crawl-delay w robots.txt?
Nie. Google nie obsługuje dyrektywy Crawl-delay w robots.txt. Jeśli Googlebot przeciąża serwer, trzeba szukać przyczyny technicznej, poprawić wydajność albo korzystać z narzędzi i raportów Google, a nie liczyć na tę regułę.
09Jak długo Google pamięta robots.txt?
Google zwykle buforuje robots.txt do 24 godzin. Buforowanie może potrwać dłużej, jeśli Google nie może odświeżyć pliku, na przykład przez błąd serwera. Dlatego po krytycznej zmianie trzeba sprawdzić raport robots.txt i nie zakładać natychmiastowej reakcji.
10Czy Disallow: / zawsze jest błędem?
Nie. Disallow: / jest sensowne na stagingu albo w krótkiej sytuacji awaryjnej. Jest błędem wtedy, gdy trafia na produkcyjną witrynę, która ma być crawlowana i widoczna w wyszukiwarce.
Źródła i dalsza lektura
- Google Search Central - plik robots.txt, zastosowania i ograniczenia
- Google - jak Google interpretuje specyfikację robots.txt
- Google - jak utworzyć i przesłać plik robots.txt
- Google Search Central - blokowanie indeksowania za pomocą noindex
- Google Search Console - raport dotyczący pliku robots.txt
- Google - zarządzanie crawl budget
- OpenAI - crawlery i reguły robots.txt dla OAI-SearchBot, GPTBot i ChatGPT-User