LW IT Solutions
« Blog Overview /Digital Marketing / robots.txt dla crawlerów wyszukiwarek, treningowych i asystentów:...
This post in other languages:

robots.txt dla crawlerów wyszukiwarek, treningowych i asystentów: co daje każda blokada

robots.txt dla crawlerów wyszukiwarek, treningowych i asystentów: co daje każda blokada
Spis treści
  1. Trzy rodzaje wykonujące różną pracę
  2. Czemu zapobiega i ile kosztuje każda blokada
  3. Google-Extended to nie Googlebot
  4. Wstecz nic nie działa
  5. llms.txt: mapa, a nie reguła
  6. Czego robots.txt nie potrafi
  7. Źródła

Jeden plik, trzy grupy czytelników niemające ze sobą nic wspólnego. Crawler wyszukiwarki pobiera stronę, aby dało się ją znaleźć; crawler trenujący pobiera ją, aby powstał z niej model; asystent pobiera ją, bo minutę temu ktoś zadał pytanie. Rozróżnić tę trójkę da się wyłącznie po nazwie, którą się przedstawia, a blokada jednego nic nie mówi o pozostałych.

Dlatego zwyczajowe polecenie – zablokować crawlery AI – nie jest jedną decyzją, lecz trzema, a dwie z nich kosztują coś, czego przy dopisywaniu wiersza rzadko się dopowiada.

Trzy decyzje dla trzech rodzajów crawlerów - wyszukiwarki, trenowania i asystentów - każda z przypisanymi nazwami oraz z tym, czemu blokada zapobiega i ile kosztuje
Trzy decyzje w robots.txt. Tylko środkowa jest bez skutków dla widoczności.

Trzy rodzaje wykonujące różną pracę

Crawlery wyszukiwarek – Googlebot, Bingbot i reszta – budują indeks, z którego pochodzą zwykłe wyniki. Blokada usuwa witrynę z wyszukiwarki w ciągu tygodni, dlatego nikt nie robi tego celowo i dlatego zdarza się przez przypadek: Disallow: / ze środowiska testowego, które przetrwało przeprowadzkę.

Crawlery trenujące – GPTBot, Google-Extended, ClaudeBot, CCBot i inne – zbierają materiał, z którego powstają modele. Pobierają raz i czytają wszystko; nic z tego nie wraca jako odwiedziny.

Crawlery asystentów – OAI-SearchBot, ChatGPT-User, PerplexityBot – pobierają stronę, bo właśnie teraz odpowiadają na pytanie. To, co pobiorą, często wraca: jako źródło, jako odnośnik, jako to zdanie, które ktoś czyta zamiast wyniku wyszukiwania.

Czemu zapobiega i ile kosztuje każda blokada

Blokowane Zapobiega Kosztuje
Wyszukiwarki Niczemu, czemu warto by zapobiegać. Witryna znika z Google i Bing.
Trenowanie Trafieniu nowego materiału do kolejnego modelu. Nic mierzalnego – ani pozycji, ani widoczności.
Asystenci Zacytowaniu witryny w odpowiedzi. Dokładnie tę widoczność – wzmiankę i odnośnik przy niej.

Środkowy wiersz to ten, o którym da się rozstrzygnąć z zasady i nic za to nie zapłacić. Dolny to ten, o którym rozstrzyga się przez przypadek, bo nazwy stoją w każdej krążącej liście tuż obok tych od trenowania.

Google-Extended to nie Googlebot

Rozróżnienie budzące najwięcej wahania: Google-Extended reguluje, czy treści służą do trenowania Gemini i modeli Vertex. Na pobieranie dla wyszukiwarki, na indeksowanie i na pozycję nie wpływa. Blokada niczego nie zmienia w tym, jak strona radzi sobie w Google, i nie jest to twierdzenie, któremu trzeba zaufać – po to ta nazwa istnieje.

Ten sam podział przebiega przez pozostałych dostawców. GPTBot to trenowanie; OAI-SearchBot zasila indeks wyszukiwania za asystentem; ChatGPT-User to pobranie następujące, gdy pyta człowiek. Zablokowanie wszystkich trzech, bo nazwy wyglądają podobnie, to najczęstsza droga, którą witryna po cichu znika z odpowiedzi, w których chciała się znaleźć.

Wstecz nic nie działa

Blokada obowiązuje od chwili odczytania. To, co już pobrano, siedzi w zbiorach z tego zbudowanych, a te nie zaglądają ponownie do robots.txt. Witryna działająca od lat, która dziś dopisuje te wiersze, rozstrzygnęła o przyszłych pobraniach, a nie o minionych.

Warto to powiedzieć wprost, bo decyzję przedstawia się często jako usunięcie. Nie jest usunięciem, lecz płotem wokół tego, czego jeszcze nie pobrano.

llms.txt: mapa, a nie reguła

Plik pod /llms.txt jest w zamyśle przeciwieństwem robots.txt: nie zabrania, tylko wskazuje. Krótki dokument Markdown nazywający, o co w witrynie chodzi i które strony niosą treść – spis rzeczy dla czegoś, co czyta się bez nawigacji.

Dwie rzeczy trzeba przy tym wyjaśnić. To propozycja, a nie standard, i żaden crawler nie ma obowiązku go szukać. I niczego nie ogranicza: strona tam wymieniona nie staje się przez to dozwolona, a brakująca nie staje się chroniona. Napisanie kosztuje dziesięć minut i jest warte dokładnie tyle, co dobry spis treści – czyli zupełnie nic, jeśli strony za nim są ubogie.

Czego robots.txt nie potrafi

To prośba, a nie zamek. Każdy crawler sam decyduje, czy się do niej stosuje, a ci, którzy to robią, są dokładnie tymi, którzy publikują nazwę, pod którą da się ich zablokować. Tego, co plik ignoruje, nic w nim nie dotyczy.

I nie trzyma strony poza wynikami wyszukiwania. Zablokowana strona, do której inni odsyłają, i tak może się pojawić, tyle że bez opisu, bo crawlerowi nie wolno było odczytać jej treści. Trzymanie czegoś poza indeksem wymaga noindex – do czego crawler musi mieć wstęp, aby to odczytać – a trzymanie czegoś w prywatności wymaga logowania. robots.txt stoi poniżej obu i dobrze nadaje się dokładnie do tego, czym jest: do kierowania ruchem tych crawlerów, które dają się kierować.

Lukas Wojcik

Lukas Wojcik

Systems architect and technology enthusiast specializing in scalable tracking solutions, GMP Stack (GA4 & GTM), and robust backend architectures. Advocate for clean code and privacy-first design.

Get in Touch

Briefly describe your project or inquiry for a tailored response. This site is protected by reCAPTCHA.

Napisanie komentarza

Adres e-mail nie jest publikowany. Pola obowiązkowe oznaczono gwiazdką.

ALL ARTICLES & CATEGORIES

CCTV

Śledź tę kategorię przez RSS

Cloud & AI

Śledź tę kategorię przez RSS

Data Privacy

Wszystkie artykuły w tej kategorii (11) Śledź tę kategorię przez RSS

Digital Analytics

Wszystkie artykuły w tej kategorii (44) Śledź tę kategorię przez RSS

Digital Marketing

Wszystkie artykuły w tej kategorii (25) Śledź tę kategorię przez RSS

IT & Networks

Wszystkie artykuły w tej kategorii (15) Śledź tę kategorię przez RSS

Raspberry Pi

Śledź tę kategorię przez RSS

Smart Home

Wszystkie artykuły w tej kategorii (11) Śledź tę kategorię przez RSS

Tworzenie stron internetowych

Śledź tę kategorię przez RSS

Wtyczki i triki WordPress

Śledź tę kategorię przez RSS