Roboty a prístup

Ktorých AI agentov púšťate na web — a o ktorých ani neviete.

Súbor robots.txt rozhoduje o tom, či sa váš web vôbec dostane k tomu, kto z neho neskôr skladá odpovede. Väčšina firiem ho nikdy neotvorila.

Deväť mien, ktoré stojí za to poznať

Nie sú to všetko to isté a nerobia to isté. Delia sa na dve skupiny a ten rozdiel je podstatný.

Tí, čo hľadajú a citujú

  • OAI-SearchBot — vyhľadávanie v ChatGPT. Toto je agent, ktorý rozhoduje o tom, či vás ChatGPT v odpovedi spomenie.
  • ChatGPT-User — načíta stránku vtedy, keď o to používateľ priamo požiada.
  • Claude-SearchBot — to isté pre Claude.
  • PerplexityBot — Perplexity, ktoré cituje zdroje viditeľne pri odpovedi.

Tí, čo zbierajú do tréningu

  • GPTBot — OpenAI, indexácia a trénovanie.
  • ClaudeBot — Anthropic, indexácia.
  • Google-Extended — nerieši indexáciu do Googlu. Rieši, či sa váš obsah smie použiť v Gemini a v AI prehľadoch.
  • Applebot-Extended — to isté pre Apple Intelligence.
  • CCBot — Common Crawl, verejný archív webu, z ktorého čerpá veľká časť modelov.

Toto je najčastejšie nedorozumenie: zakázať Google-Extended neznamená vypadnúť z vyhľadávania Googlu. Znamená to len vypadnúť z jeho AI odpovedí. Sú to samostatné rozhodnutia a treba ich robiť vedome.

Ako sa rozhodnúť, koho pustiť

Nie je to otázka techniky, je to obchodné rozhodnutie. Postavte si ho takto:

Chcemsearchcitovanietréning
byť viditeľný v AI odpovediachánoánoľubovoľne
byť viditeľný, ale neprispieť do modeluánoánonie
chrániť platený obsaháno na ukážkynie na plné textynie

Väčšine firiem sedí druhý riadok. Tretí dáva zmysel médiám a tvorcom obsahu, ktorý je sám o sebe produktom — a tam treba dodať, že robots.txt to technicky nezabezpečí. Kto chce obsah naozaj chrániť, potrebuje prihlásenie, nie textový súbor.

Overte si to sami, trvá to minútu

Otvorte vasadomena.sk/robots.txt a hľadajte tri veci.

Po prvé Disallow: /. Ak je pod User-agent: *, zakazujete celý web všetkým.

Po druhé riadok Sitemap:. Ak tam nie je, roboty musia sitemapu hľadať samy.

Po tretie menovité bloky s menami vyššie — ak tam nie sú, nie je to chyba, hviezdička ich pokrýva.

Ak sa vám namiesto textu zobrazí stránka webu, súbor nemáte a server len vracia niečo iné. Potvrdí to curl -I https://vasadomena.sk/robots.txt — musí vrátiť content-type: text/plain.

Chyba, ktorá sa zdedí z vývoja

Zďaleka najčastejší vážny nález nie je nesprávne nastavený agent. Je to Disallow: /, ktoré zostalo z čias, keď web bežal na testovacej adrese a nemal sa dostať do vyhľadávania. Pri spustení sa naň zabudlo.

Web potom funguje, vyzerá dobre, ale je pre roboty zavretý. Zvonku to nevidno — všimnete si to až podľa toho, že vás nikto nenachádza. Preto to stojí za tú jednu minútu kontroly.

Druhá verzia tej istej chyby je jemnejšia a prežije dlhšie: Disallow: /wp-admin/ je v poriadku, ale Disallow: /assets/ alebo Disallow: /static/ zablokuje štýly a skripty. Vyhľadávač potom stránku vidí bez vzhľadu a nevie posúdiť, či je použiteľná na mobile.

Poradie pravidiel a ako sa vyhodnocujú

Toto sa mýli často a dôsledok je opačný, než človek čakal.

Robot použije len jeden blok — ten, ktorý sa najpresnejšie zhoduje s jeho menom. Ak má web blok pre * aj pre GPTBot, GPTBot bude čítať iba ten svoj a pravidlá z hviezdičky ho nezaujímajú.

Dôsledok: ak do menovitého bloku napíšete len Allow: / a zabudnete tam zopakovať zákazy z hviezdičky, práve ste tomu agentovi povolili aj to, čo ste zakázali všetkým ostatným.

Druhé pravidlo: pri konflikte vyhráva dlhšia cesta, nie poradie riadkov. Allow: /blog/verejne/ prebije Disallow: /blog/, lebo je konkrétnejšia.

Menovité pravidlá ako poistka

Ak vás už User-agent: * púšťa, menovité povolenia nič nemenia — dnes. Zmysel majú ako poistka do dňa, keď niekto do hviezdičky pridá zákaz. Vtedy menovitý riadok pre OAI-SearchBot zostane a agent, ktorý rozhoduje o vašej viditeľnosti v ChatGPT, prejde ďalej.

Je to lacné a je to písomný záznam rozhodnutia. O rok už nikto nebude vedieť, či bola hviezdička mienená aj pre AI agentov, alebo to nikto neriešil.

Čo robots.txt nedokáže

Je to pokyn, nie zámka. Slušní agenti ho rešpektujú, ostatní nie, a súbor sám nikoho nezastaví.

Nezabráni ani indexácii adresy. Ak na zakázanú stránku vedie odkaz z iného webu, vyhľadávač o nej vie a môže ju zobraziť vo výsledkoch bez popisu — pretože obsah si prečítať nesmel. Na vylúčenie z výsledkov slúži značka noindex, a tá funguje len vtedy, keď robot na stránku smie a prečíta si ju. Zakázať v robots.txt a zároveň dať noindex je protirečenie: robot ten noindex nikdy neuvidí.

Časté otázky

Ak zakážem Google-Extended, vypadnem z vyhľadávania Googlu?

Nie. Google-Extended rozhoduje len o použití obsahu v Gemini a v AI prehľadoch. Klasickú indexáciu do výsledkov vyhľadávania rieši Googlebot a toho sa to netýka.

Musím mať pre každého agenta samostatný blok?

Nie. Ak User-agent: * povoľuje prístup, agenti sú pokrytí. Menovité bloky sú poistka pre prípad, že sa hviezdička v budúcnosti zmení.

Blokuje robots.txt naozaj prístup?

Je to pokyn, nie technická zábrana. Slušní agenti ho rešpektujú, ale súbor sám o sebe nikoho nezastaví. Kto chce obsah naozaj chrániť, potrebuje autentifikáciu, nie robots.txt.

Prečítajú roboty pravidlá z bloku * aj zo svojho menovitého bloku?

Nie. Robot použije iba jeden blok — ten najpresnejšie zodpovedajúci jeho menu. Ak preň vytvoríte menovitý blok, musíte v ňom zopakovať aj zákazy, ktoré má hviezdička.

Vylúči robots.txt stránku z výsledkov vyhľadávania?

Nemusí. Ak na ňu vedie odkaz odinakiaľ, vyhľadávač ju môže zobraziť bez popisu. Na vylúčenie slúži noindex — a ten robot uvidí len vtedy, keď stránku smie prečítať. Kombinovať zákaz v robots.txt s noindex nefunguje.

Chcete vedieť, ako je na tom váš web?

Pošlite nám adresu a pripravíme krátky audit s konkrétnymi nálezmi — pri každom je napísané, kde si ho overíte sami. Zadarmo, do 48 hodín.