robots.txt, noindex czy canonical — co wybrać i kiedy
Te trzy mechanizmy rozwiązują trzy różne problemy: robots.txt steruje pobieraniem, noindex obecnością w wynikach, a canonical wyborem głównej wersji treści. Pomylenie ich potrafi utrzymać niechciany adres w Google przez miesiące.
Autor: Redakcja SEOMaster · opublikowano 21.08.2026 · aktualizacja 27.08.2026
Najprostsza reguła: jeśli robot nie ma pobierać zasobu, użyj robots.txt. Jeśli może go pobrać, ale nie ma pokazywać w wynikach, użyj noindex. Jeśli kilka adresów ma tę samą lub bardzo podobną treść i jeden jest wersją główną, użyj canonical.
Tabela decyzji
| Cel | Mechanizm | Wpływ na Google |
|---|---|---|
| Nie pobieraj sekcji technicznej | robots.txt | Ogranicza crawl; nie gwarantuje usunięcia URL-a z indeksu |
| Usuń pobraną stronę z wyników | noindex | Wyklucza adres po ponownym odczytaniu dyrektywy |
| Połącz sygnały podobnych adresów | rel=canonical | Wskazuje preferowaną wersję treści |
| Adres zniknął na stałe | 410 lub 404 | Informuje, że zasobu nie ma |
| Adres przeniósł się na nowy | 301 | Przekierowuje użytkownika i sygnały na docelowy URL |
robots.txt steruje pobieraniem
Disallow mówi robotowi, że nie powinien pobierać pasującej ścieżki. Nie jest zabezpieczeniem i nie gwarantuje usunięcia adresu z indeksu — Google może znać URL z linków i pokazać go bez opisu.
User-agent: * Disallow: /panel/ Disallow: /koszyk/
robots.txt — składnia i sprawdzanie — pełna definicja w słowniku
noindex steruje obecnością w wynikach
Robot musi pobrać stronę, żeby zobaczyć noindex. Możesz umieścić go w meta robots dla HTML albo w nagłówku X-Robots-Tag dla plików i odpowiedzi generowanych na serwerze.
<meta name="robots" content="noindex, follow">
X-Robots-Tag: noindex, follow
Najczęstsza sprzeczność: Nie blokuj w robots.txt strony, z której Google ma przeczytać noindex. Najpierw usuń blokadę pobierania, pozwól robotowi zobaczyć noindex i dopiero monitoruj usunięcie.
noindex — meta tag i nagłówek HTTP — pełna definicja w słowniku
canonical wybiera wersję główną
Canonical jest wskazówką konsolidacji, nie poleceniem usunięcia. Strony muszą być na tyle podobne, żeby wybór miał sens. Jeśli treść jest inna, wyszukiwarka może zignorować deklarację.
<link rel="canonical" href="https://example.pl/produkt">
Canonical — jak wskazać główny adres — pełna definicja w słowniku
Przykłady z życia
- Wyniki filtrowania sklepu bez wartości w wyszukiwarce: noindex albo ograniczenie crawl zależnie od skali.
- Produkt dostępny pod parametrem kampanii: canonical do czystego URL.
- Stary artykuł przeniesiony pod nowy adres: przekierowanie 301, nie canonical.
- Panel klienta: autoryzacja plus robots.txt; robots.txt sam nie chroni danych.
- PDF, którego nie chcesz w Google: nagłówek X-Robots-Tag: noindex.
Jak zweryfikować zmianę
- Sprawdź kod odpowiedzi i nagłówki poleceniem curl -I.
- Pobierz surowy HTML i znajdź meta robots oraz canonical.
- Przetestuj regułę robots.txt dla dokładnego adresu.
- Użyj Sprawdzania adresu URL w Search Console.
- Obserwuj wybrany canonical i stan indeksacji przez kolejne crawle.
Najczęstsze pytania
Czy canonical usuwa stronę z wyników?
Nie gwarantuje usunięcia. Prosi o konsolidację podobnych adresów pod jedną wersją. Do świadomego wykluczenia strony służy noindex.
Czy robots.txt ukrywa prywatną stronę?
Nie. Plik jest publiczny i tylko instruuje roboty. Prywatne dane wymagają logowania i kontroli dostępu po stronie serwera.
Czy można łączyć noindex i canonical?
Technicznie tak, ale sygnały są sprzeczne: jeden mówi „nie indeksuj”, drugi „przenieś sygnały”. Wybierz mechanizm odpowiadający realnemu celowi.
Jak długo trwa usunięcie strony po noindex?
Do kolejnego pobrania adresu przez robota, zwykle od kilku dni do kilku tygodni. Zablokowanie adresu w robots.txt może ten proces uniemożliwić.
Źródła i dokumentacja
- Google Search Central — robots.txt
- Google Search Central — block indexing with noindex
- Google Search Central — canonical URLs
Pojęcia z tego poradnika
Wszystkie poradniki · Cała Wiedza · Sprawdź indeksowanie swojej strony