SEO techniczne / robots.txt23 min czytania

Robots.txt pod kątem SEO - jak ustawić plik bez blokowania wyników?

Robots.txt steruje tym, które adresy i zasoby robot może pobrać. Usuwanie strony z indeksu, ochrona prywatnych danych i blokowanie indeksowania wymagają innych mechanizmów. W SEO plik działa najlepiej wtedy, gdy wynika z decyzji o tym, które typy adresów URL mają być pobierane przez roboty.

Infografika pokazująca rolę pliku robots.txt w crawlowaniu i indeksowaniu
Wybór właściwego mechanizmu

Robots.txt służy do crawlowania, nie do każdej decyzji o URL-u

Robots.txt wybierz tylko wtedy, gdy celem jest ograniczenie pobierania adresów lub zasobów przez crawlera. Inny cel wymaga innego mechanizmu.

  • Jeśli
    chcesz ograniczyć pobieranie całych wzorców ścieżek lub zasobów
    WybierzRobots.txt
    Kontrolujesz crawling, ale nie gwarantujesz usunięcia adresu z Google.
  • Jeśli
    publiczny zasób nie ma pozostać w indeksie
    WybierzNoindex lub X-Robots-Tag
    Google musi móc pobrać zasób, aby odczytać dyrektywę.
  • Jeśli
    trzeba wskazać reprezentanta duplikatów albo przenieść adres
    WybierzCanonical lub redirect
    Mechanizm porządkuje wersje URL-a zamiast blokować samo pobranie.
  • Jeśli
    treść albo dane mają być naprawdę niedostępne publicznie
    WybierzLogowanie lub blokada serwera
    Publiczny plik robots.txt nie jest zabezpieczeniem dostępu.
01 / ROLA

Robots.txt kontroluje pobieranie strony przez crawlera

Plik robots.txt odpowiada na pytanie: czy robot może pobrać daną ścieżkę? Widoczność URL-a w indeksie Google zależy od innych sygnałów, dyrektyw i statusów. Ta różnica jest krytyczna, bo wiele błędów SEO zaczyna się od założenia, że Disallow i noindex mają ten sam skutek.

Gdy robot zna URL, pobiera robots.txt dla właściwego hosta, protokołu i portu. Następnie wybiera najbardziej konkretną grupę user-agent — grupa ogólna * nie jest łączona z grupą specyficzną — i dopasowuje regułę do ścieżki. Dopuszczony adres może przejść do renderowania i oceny indeksowalności; przy blokadzie Google może nie zobaczyć treści, meta robots ani canonicala.

Robots.txt jest publiczną instrukcją dla crawlerów, które ją respektują. Nie chroni danych, nie usuwa URL-a z indeksu, nie zastępuje canonicala i nie poprawia jakości treści. Zablokowany adres może nadal być znany z linków i pojawić się w Google bez opisu; prywatne zasoby wymagają autoryzacji albo blokady serwerowej.

Plik jest więc elementem szerszej diagnostyki: crawlowania, statusów HTTP, sitemap, linkowania wewnętrznego, canonicali, renderowania i raportów w Google Search Console.

02 / SKŁADNIA

Najważniejsze reguły składni robots.txt

Składnia jest prosta, ale błędy mają duży zasięg. Warto trzymać plik krótki, komentować powód reguł i testować dopasowanie na realnych adresach, zwłaszcza przy symbolach wieloznacznych.

Najważniejsze reguły składni robots.txt
ElementZnaczeniePrzykład
User-agentwskazuje robota, którego dotyczy grupa regułUser-agent: Googlebot
Disallowblokuje pobieranie wskazanej ścieżkiDisallow: /koszyk/
Allowpozwala pobrać ścieżkę, często jako wyjątek w zablokowanym kataloguAllow: /wp-admin/admin-ajax.php
Sitemapwskazuje pełny adres mapy witryny lub indeksu sitemapSitemap: https://example.com/sitemap.xml
*dopasowuje zero lub więcej znaków w ścieżceDisallow: /*?sort=
$oznacza koniec adresu URLDisallow: /*.pdf$
Crawl-delaynie jest obsługiwany przez Google jako dyrektywa w robots.txtCrawl-delay: 10
#rozpoczyna komentarz; treść komentarza nie jest regułą crawlowania# blokada koszyka

Wpis Sitemap: wskazuje lokalizację mapy, ale nie rozstrzyga, które adresy powinny się w niej znaleźć. Dobór kanonicznych, dostępnych i indeksowalnych URL-i opisują zasady doboru URL-i do sitemap.xml.

03 / PRZYKŁADY

Przykłady robots.txt - od bezpiecznych reguł do ryzykownych blokad

Dobry robots.txt opisuje typy adresów URL i ich rolę w serwisie. Lista pojedynczych, przypadkowych adresów szybko robi się trudna w utrzymaniu. Poniższe przykłady traktuj jako wzorce decyzyjne: przed wdrożeniem trzeba je porównać z realną strukturą hosta, sitemapą, logami i rolą konkretnych ścieżek w SEO.

Domyślnie wszystko dozwolone

User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml

Kiedy: Gdy strona nie potrzebuje ograniczeń crawlowania, a plik ma głównie wskazać mapę witryny.

Uwaga: Pusta wartość Disallow oznacza brak blokady dla danej grupy.

Blokada całej witryny

User-agent: *
Disallow: /

Kiedy: Dla stagingu, środowiska testowego lub krótkiej sytuacji awaryjnej.

Uwaga: Na produkcji to jedna z najgroźniejszych reguł, bo odcina crawling wszystkich ścieżek.

WordPress i WooCommerce

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Sitemap: https://example.com/sitemap_index.xml

Kiedy: Dla panelu administracyjnego, koszyka, checkoutu i konta klienta, jeśli nie mają roli jako wyniki organiczne.

Uwaga: Nie blokuj zasobów lub endpointów, które są potrzebne do działania frontu.

Parametry, sortowania i wyszukiwarka

User-agent: *
Disallow: /search/
Disallow: /*?s=
Disallow: /*&s=
Disallow: /*?sort=
Disallow: /*&sort=
Disallow: /*?orderby=
Disallow: /*&orderby=

Kiedy: Dla crawl traps tworzonych przez wyniki wyszukiwarki, sortowania i techniczne parametry.

Uwaga: Wzorzec z ? obejmuje parametr na początku query string, a wariant z & ten sam parametr na dalszej pozycji. Przetestuj realne kombinacje i nie blokuj filtrów z popytem oraz własną wartością SEO.

ChatGPT Search i trening jako osobne decyzje

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

Kiedy: Gdy chcesz dopuścić pobieranie do funkcji wyszukiwania AI, ale nie chcesz udostępniać treści dla GPTBot.

Uwaga: To decyzja produktowa i prawna, nie tylko techniczna. Reguły dla botów AI warto opisać osobno.

04 / HOST

Gdzie powinien znajdować się plik robots.txt?

Plik musi być dostępny jako /robots.txt w katalogu głównym konkretnego hosta. Reguły nie przechodzą automatycznie na inne subdomeny, protokoły ani niestandardowe porty. Dla Googlehttps://example.com/robots.txt i https://shop.example.com/robots.txt dotyczą innych hostów.

  • Nazwa pliku to dokładnie robots.txt.
  • Plik powinien być tekstowy i zakodowany w UTF-8.
  • Reguły są ważne tylko dla hosta, protokołu i portu, na których plik jest udostępniony.
  • Plik w podkatalogu, np. /folder/robots.txt, nie jest właściwym plikiem dla całej witryny.
  • Warto utrzymywać plik poniżej limitu rozmiaru i bez zbędnej listy pojedynczych wyjątków.
05 / STATUSY

Co się dzieje, gdy robots.txt zwraca 404, 5xx albo przekierowanie?

Status HTTP pliku robots.txt wpływa na to, czy Googlebot uzna, że ma ograniczenia crawlowania. To ważne przy awariach, migracjach i konfiguracjach CDN, gdzie sam plik bywa przypadkowo przekierowany, zablokowany lub generowany przez aplikację.

Co się dzieje, gdy robots.txt zwraca 404, 5xx albo przekierowanie?
StatusJak interpretuje Google?Co zrobić?
2xxGoogle przetwarza plik robots.txt jako dostarczony przez serwer.To prawidłowy stan dla aktywnego pliku.
3xxGoogle podąża za co najmniej 5 przekierowaniami, a po przekroczeniu limitu traktuje sytuację jak 404.Utrzymuj prosty, bezpośredni adres /robots.txt.
4xxWiększość błędów 4xx, poza 429, jest traktowana tak, jakby prawidłowy plik nie istniał.Brak pliku jest dozwolony, ale oznacza brak ograniczeń crawlowania.
5xxPrzez pierwsze 12 godzin Google może wstrzymać crawling. Potem przez około 30 dni może używać ostatniej dobrej wersji, jeśli ją ma.Traktuj to jak awarię dostępności: sprawdź serwer, cache, CDN i reguły bezpieczeństwa.
CacheGoogle zwykle buforuje robots.txt do 24 godzin, a dłużej wtedy, gdy odświeżenie pliku jest niemożliwe.Po zmianie krytycznej użyj raportu robots.txt w GSC, ale nie zakładaj natychmiastowego efektu.
06 / NOINDEX

Robots.txt a noindex - najczęściej popełniane błędy

Jeśli chcesz, żeby strona HTML nie była widoczna w Google, użyj noindex w meta robots albo odpowiedniego nagłówka HTTP. Nie blokuj jednocześnie crawlowania tej strony w robots.txt, bo Google może nie pobrać HTML-u i nie zobaczyć dyrektywy noindex.

  • Robots.txt

    Kontroluje pobieranie

    Mówi robotowi, czy może wejść pod daną ścieżkę. Dobre dla crawl traps, filtrów i ścieżek bez wartości SEO.

  • Noindex

    Kontroluje indeks

    Mówi wyszukiwarce, żeby nie pokazywała strony w wynikach, ale wymaga pobrania strony lub nagłówka.

07 / CANONICAL

Robots.txt a canonical - inna decyzja dla podobnych URL-i

Canonical pomaga wskazać reprezentatywną wersję podobnych stron. Robots.txt ogranicza pobieranie. Jeśli zablokujesz warianty w robots.txt, Google może nie zobaczyć canonicala na tych wariantach. Przy małej liczbie duplikatów często lepsza jest spójna kanonikalizacja, linkowanie i sitemap niż natychmiastowy Disallow.

Przy ogromnych przestrzeniach URL-i, na przykład sortowaniach i parametrach w sklepie, decyzja może być mieszana: część filtrów indeksować jako wartościowe landing pages, część kanonikalizować, a część ograniczyć w robots.txt.

08 / RENDER

Czy blokować CSS, JavaScript i obrazy?

Zasobów potrzebnych do renderowania zwykle nie należy blokować. Jeśli Google nie może pobrać CSS, JavaScriptu lub krytycznych plików, może zobaczyć stronę inaczej niż użytkownik. Blokada ma sens tylko wtedy, gdy brak zasobu nie utrudnia interpretacji strony.

Gdy zasób wpływa na to, co Google widzi po uruchomieniu strony, diagnoza wychodzi poza sam plik robots.txt i przechodzi do JavaScript SEO oraz renderowania treści.

09 / E-COMMERCE

Robots.txt w sklepie internetowym - filtry, parametry i koszyk

W e-commerce robots.txt może realnie poprawić efektywność crawlu, ale tylko wtedy, gdy wynika z mapy URL-i. Najpierw trzeba rozdzielić adresy z popytem i unikalną wartością od kombinacji, które generują nieskończoną przestrzeń crawlowania.

Robots.txt w sklepie internetowym - filtry, parametry i koszyk
DecyzjaPrzykładyWarunek
Zwykle blokować crawlingkoszyk, logowanie, panel klienta, wyszukiwarka wewnętrzna, sortowania, parametry sesjiGdy URL-e nie mają roli jako osobne wyniki i tworzą dużą liczbę kombinacji.
Decydować selektywniefiltry kategorii, tagi, warianty produktów, paginacja, archiwaGdy część URL-i ma popyt, unikalną wartość i sens w architekturze SEO.
Nie blokować przypadkowokategorie, produkty, artykuły poradnikowe, zasoby potrzebne do renderowaniaGdy mają generować widoczność lub są potrzebne, żeby Google zrozumiał stronę.
10 / CRAWL BUDGET

Czy robots.txt oszczędza crawl budget?

Może ograniczyć pobieranie URL-i, których Google nie powinien przetwarzać, ale crawl budget nie jest głównym problemem każdej strony. Według dokumentacji Google temat jest szczególnie istotny przy bardzo dużych serwisach, często aktualizowanych witrynach i dużych grupach adresów wykrytych, ale niezaindeksowanych.

Mała strona firmowa

Robots.txt rzadko rozwiązuje główny problem SEO. Częściej winne są noindex, brak linków, słaba treść lub błędne przekierowania.

Priorytet

Sprawdź, czy plik nie blokuje całej witryny, bloga, usług, CSS, JS i sitemap.

Serwis contentowy

Archiwa, tagi, wyszukiwarka i duplikujące się ścieżki mogą rozcieńczać crawl i sygnały tematyczne.

Priorytet

Oddziel strony z rolą semantyczną od stron porządkowych i zdecyduj, które mają być crawlowane.

Sklep internetowy

Filtry, sortowania, parametry i niedostępne produkty mogą tworzyć bardzo dużą pulę adresów URL.

Priorytet

Projektuj reguły na poziomie typów URL-i, nie pojedynczych przypadków znalezionych w raporcie.

11 / CMS

Robots.txt w WordPressie, WooCommerce i innych CMS-ach

W CMS-ach plik robots.txt może być fizycznym plikiem albo generowaną odpowiedzią pod adresem /robots.txt. To normalne, ale przy audycie trzeba sprawdzić efekt końcowy, nie tylko ustawienie w panelu lub wtyczce.

  • Sprawdź publiczny plik, a nie tylko konfigurację wtyczki SEO.
  • Upewnij się, że środowisko produkcyjne nie przejęło blokady ze stagingu.
  • W WooCommerce kontroluj koszyk, konto, checkout, wyszukiwarkę i wybrane parametry.
  • Nie blokuj /wp-admin/admin-ajax.php, jeśli strona używa go do działania frontu.
  • Po zmianach wyczyść cache aplikacji, hostingu i CDN, jeśli plik jest generowany dynamicznie.
12 / MIGRACJE

Staging, subdomeny i migracje - gdzie robots.txt najczęściej szkodzi?

Największe ryzyko pojawia się przy przejściu ze stagingu na produkcję. Reguła Disallow: / jest poprawna na środowisku testowym, ale na produkcji może odciąć crawling całej witryny. Przy migracji trzeba też sprawdzić, czy nowy host, subdomena, wersja HTTPS i CDN zwracają właściwy plik.

13 / AI SEARCH

Robots.txt a boty AI - decyzja o dostępie to także decyzja o widoczności

Część botów AI i wyszukiwarek respektuje robots.txt, ale nie wszystkie systemy działają identycznie. Z perspektywy firmy decyzja nie brzmi tylko „blokować AI czy nie”, lecz: które boty mogą pobierać stronę, w jakim celu i czy blokada nie ograniczy widoczności w odpowiedziach AI.

Jeśli analizujesz ten obszar, rozdziel crawling pod wyszukiwanie, pobrania inicjowane przez użytkownika i wykorzystanie treści do treningu. W KEO przygotowaliśmy do tego tester robots.txt dla AI.

Robots.txt a boty AI - decyzja o dostępie to także decyzja o widoczności
BotRolaDecyzja SEO
OAI-SearchBotCrawler używany przez OpenAI do funkcji wyszukiwania, między innymi ChatGPT Search.Dopuszczenie może wspierać obecność w odpowiedziach wyszukiwarkowych ChatGPT. Blokada może ograniczyć taką widoczność.
GPTBotCrawler treści, które mogą być używane przy trenowaniu generatywnych modeli AI.To osobna decyzja od widoczności w wyszukiwaniu. Możesz blokować GPTBot bez blokowania OAI-SearchBot.
ChatGPT-UserPobrania inicjowane przez użytkownika w trakcie używania ChatGPT, a nie klasyczny automatyczny crawl.Nie używaj go jako głównej dźwigni SEO. OpenAI opisuje go jako inny typ dostępu niż crawl do wyszukiwania.
14 / TESTY

Jak testować robots.txt przed i po wdrożeniu?

Test nie powinien kończyć się na otwarciu pliku w przeglądarce. Trzeba sprawdzić dostępność pliku, dopasowanie reguł do realnych URL-i, interpretację Google i wpływ na ważne sekcje serwisu.

  • Otwórz publiczny adres /robots.txt w przeglądarce i sprawdź, czy plik zwraca treść tekstową.
  • Zweryfikuj, który plik robots.txt dotyczy konkretnego URL-a: liczy się protokół, host i port.
  • Użyj raportu robots.txt w Google Search Console, jeśli jest dostępny dla danej usługi.
  • Dla pojedynczego adresu użyj Inspekcji URL i sprawdź, czy Google widzi blokadę crawlowania.
  • Sprawdź ważne typy URL-i na realnych przykładach, a nie tylko na wzorcach reguł.
  • Jeśli korzystasz z Google Ads, nazwij roboty AdsBot jawnie, bo globalna grupa * nie obejmuje ich tak samo jak standardowych crawlerów Google.
  • Uwzględnij cache: Google zwykle może pamiętać robots.txt do 24 godzin.
  • Po zmianie krytycznej poproś o ponowne zindeksowanie pliku robots.txt w GSC, ale nie traktuj tego jako gwarancji natychmiastowego crawlu URL-i.
  • Przy dużym serwisie porównaj reguły z logami serwera i statystykami indeksowania.
15 / POMIAR

Jak mierzyć efekt zmian w robots.txt?

Efektem nie jest sama obecność pliku. Efektem jest lepszy rozkład crawlu: mniej żądań do URL-i bez wartości i więcej uwagi dla stron, które mają generować widoczność, leady lub sprzedaż.

Jak mierzyć efekt zmian w robots.txt?
MetrykaCo mówi?Gdzie sprawdzić?
Żądania Googlebota według typu URL-aCzy robot trafia w strony usług, kategorie i produkty, czy w parametry, sortowania i koszyk?logi serwera, Crawl Stats, crawl narzędziem SEO
Statusy pobieranych URL-iCzy blokada robots.txt nie ukrywa problemów, które powinny zwracać 404, 410 albo mieć przekierowanie?logi serwera, tester przekierowań, raporty GSC
URL-e zablokowane, ale znane GoogleCzy w wynikach lub GSC pojawiają się adresy bez opisu, bo Google zna URL, ale nie może pobrać treści?Inspekcja URL, raport indeksowania, zapytania site:
Crawl zasobów CSS i JSCzy Google ma dostęp do plików potrzebnych do renderowania i zrozumienia strony?render w Inspekcji URL, logi, crawl techniczny
16 / DIAGNOZA

Diagnostyka robots.txt - objaw, przyczyna i szybkie sprawdzenie

Robots.txt rzadko występuje jako izolowany problem. Najszybsza diagnoza łączy objaw w Google, regułę w pliku, status HTTP, linkowanie i dane z crawlu lub logów.

Diagnostyka robots.txt - objaw, przyczyna i szybkie sprawdzenie
ObjawPrawdopodobna przyczynaCo sprawdzić?
URL widoczny w Google bez opisuAdres jest zablokowany w robots.txt, ale Google zna go z linków, sitemapy lub historii crawlu.Inspekcja URL, wynik SERP, reguła Disallow, linki wewnętrzne i zewnętrzne.
Po wdrożeniu spadł crawl całej witrynyNa produkcji pojawiło się Disallow: /, plik /robots.txt zwraca 5xx albo CDN serwuje złą wersję.Raport robots.txt w GSC, logi serwera, status HTTP pliku i cache po stronie CDN.
Noindex nie działaStrona jest jednocześnie zablokowana w robots.txt, więc Google nie może pobrać HTML-u lub nagłówka.Odblokuj crawl dla testowego URL-a, sprawdź meta robots albo X-Robots-Tag i ponów inspekcję.
Googlebot pobiera setki wariantów parametrówFiltry, sortowania albo wyszukiwarka wewnętrzna tworzą crawl trap bez decyzji, które typy adresów mają być crawlowane.Logi serwera, Crawl Stats, crawl techniczny i lista parametrów według liczby żądań.
Ważna sekcja nie jest crawlowanaZbyt szeroki wildcard, reguła dla konkretnego Googlebota albo plik dla złego hosta blokuje ścieżkę.Test dopasowania reguł, crawl techniczny, Inspekcja URL i porównanie hosta/protokołu/portu.
17 / BŁĘDY

Najczęstsze błędy robots.txt pod kątem SEO

01

Disallow: / na produkcji - blokada przeniesiona ze stagingu potrafi odciąć crawling całej witryny

02

Robots.txt zamiast noindex - strona może nadal pojawiać się w wynikach, tylko bez pełnej treści i opisu

03

Noindex na stronie zablokowanej w robots.txt - Google nie może pobrać HTML-u, więc może nie zobaczyć dyrektywy

04

Blokowanie CSS i JS - Google może mieć uboższy obraz strony i gorzej ocenić render

05

Za szerokie wzorce z * - jedna reguła może objąć więcej URL-i, niż zakładał zespół

06

Brak osobnych plików dla subdomen - plik z domeny głównej nie steruje automatycznie subdomeną

07

Traktowanie robots.txt jako zabezpieczenia - plik jest publiczny i zależy od posłuszeństwa bota

08

Sitemap z adresami zablokowanymi - wysyłasz sprzeczny sygnał: zgłaszasz URL jako ważny i jednocześnie blokujesz jego pobieranie

18 / PRIORYTETY

Jak ustalić priorytet poprawek w robots.txt?

Nie każda zmiana w robots.txt ma taki sam ciężar. Najpierw napraw blokady, które zatrzymują crawling ważnych sekcji albo uniemożliwiają Google odczytanie noindex, canonicala i renderu.

Jak ustalić priorytet poprawek w robots.txt?
PriorytetPrzykładyNastępny krok
KrytyczneDisallow: / na produkcji, 5xx dla /robots.txt, blokada usług, kategorii, produktów lub artykułów.Napraw przed innymi zmianami, wyczyść cache i sprawdź raport robots.txt oraz Inspekcję URL.
WysokieNoindex połączony z Disallow, blokada CSS/JS, sitemap z adresami zablokowanymi w robots.txt.Usuń sprzeczność i sprawdź, czy Google może pobrać treść oraz zasoby potrzebne do renderowania.
ŚrednieCrawl traps w filtrach, sortowaniach, wynikach wyszukiwarki wewnętrznej i parametrach sesyjnych.Podejmij decyzję po analizie typów adresów URL, popytu, logów i roli danego typu strony.
NiskieKomentarze, kolejność sekcji, drobna konsolidacja reguł bez zmiany zachowania crawlera.Porządkuj przy okazji utrzymania technicznego, ale nie mieszaj tego z krytycznymi naprawami.
19 / WDROŻENIE

Checklista robots.txt przed publikacją zmian

  • Plik jest dostępny pod /robots.txt dla właściwego hosta, protokołu i portu.
  • Nie ma reguły blokującej całą produkcyjną domenę.
  • Ważne strony usług, kategorii, produktów i artykułów nie są zablokowane.
  • CSS, JS i zasoby potrzebne do renderowania są dostępne dla Googlebota.
  • Sitemap ma pełny URL i prowadzi do adresów kanonicznych, które mają być crawlowane.
  • Plik ma poniżej 500 KiB i nie zawiera niepotrzebnej listy pojedynczych wyjątków.
  • Nie używasz Crawl-delay jako mechanizmu sterowania Googlebotem.
  • Reguły dla Googlebota i grupy globalnej są świadomie rozdzielone.
  • Jeśli reguły dotyczą AdsBot, robot jest nazwany jawnie w osobnej grupie.
  • Adresy do usunięcia z indeksu mają noindex, X-Robots-Tag, 404/410 albo ochronę hasłem, a nie sam Disallow.
  • Filtry i parametry e-commerce mają decyzję na poziomie typu URL-a.
  • Zmiana została sprawdzona w GSC, crawlerze technicznym i, przy dużym serwisie, w logach.

Powiązane tematy i narzędzia

Robots.txt jest jednym elementem technicznego SEO. Poniższe materiały prowadzą do sąsiednich etapów: crawlingu, indeksowania, linkowania, audytu i testowania botów.

Crawling w SEO

szerszy kontekst odkrywania i pobierania URL-i przez Googlebota

Indeksowanie strony w Google

diagnostyka sytuacji, gdy URL nie pojawia się w wynikach

SEO techniczne

hub o crawl, index, canonical, statusach HTTP, JS i architekturze

Linkowanie wewnętrzne

jak prowadzić Googlebota do właściwych stron

Audyt techniczny SEO

Nie masz pewności, czy robots.txt pomaga, czy blokuje widoczność?

W audycie sprawdzamy robots.txt razem z crawlingiem, indeksowaniem, sitemapą, canonicalami, statusami HTTP, renderowaniem i linkowaniem. Dzięki temu decyzja nie opiera się na jednej regule, tylko na całym przepływie od URL-a do wyniku.

Audyt SEO strony
20 / FAQ

FAQ

01Czy robots.txt wpływa na SEO?

Tak, ale głównie przez kontrolę crawlowania. Dobrze ustawiony plik może ograniczyć pobieranie URL-i bez wartości, a źle ustawiony może zablokować ważne sekcje, zasoby albo całą witrynę.

02Czy robots.txt usuwa stronę z Google?

Nie. Robots.txt nie jest mechanizmem usuwania strony z wyników. Jeśli URL jest zablokowany, Google może nadal znać adres z linków i pokazać go bez opisu. Do blokowania indeksowania używa się noindex, X-Robots-Tag, ochrony hasłem, usunięcia strony albo właściwego statusu HTTP.

03Czy można użyć noindex w robots.txt?

Nie w Google. Google nie obsługuje reguły noindex w pliku robots.txt. Noindex powinien być w meta robots w HTML-u albo w nagłówku HTTP X-Robots-Tag.

04Czy brak pliku robots.txt jest błędem?

Nie. Jeśli nie masz pliku robots.txt, Google zwykle zakłada brak ograniczeń crawlowania. Błędem jest brak pliku wtedy, gdy serwis potrzebuje świadomie ograniczać duże grupy URL-i albo wskazać sitemapę w prostym, publicznym miejscu.

05Czy blokować CSS i JavaScript w robots.txt?

Zwykle nie blokuj zasobów potrzebnych do renderowania strony. Google może używać CSS i JavaScriptu, żeby zrozumieć układ, treść i działanie strony. Blokuj tylko zasoby, których brak nie zmienia istotnie interpretacji strony.

06Czy sitemap w robots.txt jest obowiązkowa?

Nie jest obowiązkowa, ale jest praktyczna. Wpis Sitemap pomaga robotom znaleźć mapę witryny, a przy większych serwisach ułatwia utrzymanie spójnej diagnostyki crawlowania i indeksowania.

07Czy crawl budget ma znaczenie dla małej strony?

Zwykle mniejsze niż dla dużego sklepu lub portalu. Przy małej stronie częściej problemem jest przypadkowa blokada, słabe linkowanie, noindex, canonical albo brak jakościowej treści.

08Czy Google obsługuje Crawl-delay w robots.txt?

Nie. Google nie obsługuje dyrektywy Crawl-delay w robots.txt. Jeśli Googlebot przeciąża serwer, trzeba szukać przyczyny technicznej, poprawić wydajność albo korzystać z narzędzi i raportów Google, a nie liczyć na tę regułę.

09Jak długo Google pamięta robots.txt?

Google zwykle buforuje robots.txt do 24 godzin. Buforowanie może potrwać dłużej, jeśli Google nie może odświeżyć pliku, na przykład przez błąd serwera. Dlatego po krytycznej zmianie trzeba sprawdzić raport robots.txt i nie zakładać natychmiastowej reakcji.

10Czy Disallow: / zawsze jest błędem?

Nie. Disallow: / jest sensowne na stagingu albo w krótkiej sytuacji awaryjnej. Jest błędem wtedy, gdy trafia na produkcyjną witrynę, która ma być crawlowana i widoczna w wyszukiwarce.

Źródła i dalsza lektura