Deväť mien, ktoré stojí za to poznať
Nie sú to všetko to isté a nerobia to isté. Delia sa na dve skupiny a ten rozdiel je podstatný.
Tí, čo hľadajú a citujú
- OAI-SearchBot — vyhľadávanie v ChatGPT. Toto je agent, ktorý rozhoduje o tom, či vás ChatGPT v odpovedi spomenie.
- ChatGPT-User — načíta stránku vtedy, keď o to používateľ priamo požiada.
- Claude-SearchBot — to isté pre Claude.
- PerplexityBot — Perplexity, ktoré cituje zdroje viditeľne pri odpovedi.
Tí, čo zbierajú do tréningu
- GPTBot — OpenAI, indexácia a trénovanie.
- ClaudeBot — Anthropic, indexácia.
- Google-Extended — nerieši indexáciu do Googlu. Rieši, či sa váš obsah smie použiť v Gemini a v AI prehľadoch.
- Applebot-Extended — to isté pre Apple Intelligence.
- CCBot — Common Crawl, verejný archív webu, z ktorého čerpá veľká časť modelov.
Toto je najčastejšie nedorozumenie: zakázať Google-Extended neznamená vypadnúť z vyhľadávania Googlu. Znamená to len vypadnúť z jeho AI odpovedí. Sú to samostatné rozhodnutia a treba ich robiť vedome.
Ako sa rozhodnúť, koho pustiť
Nie je to otázka techniky, je to obchodné rozhodnutie. Postavte si ho takto:
| Chcem | search | citovanie | tréning |
|---|---|---|---|
| byť viditeľný v AI odpovediach | áno | áno | ľubovoľne |
| byť viditeľný, ale neprispieť do modelu | áno | áno | nie |
| chrániť platený obsah | áno na ukážky | nie na plné texty | nie |
Väčšine firiem sedí druhý riadok. Tretí dáva zmysel médiám a tvorcom obsahu, ktorý je sám o sebe produktom — a tam treba dodať, že robots.txt to technicky nezabezpečí. Kto chce obsah naozaj chrániť, potrebuje prihlásenie, nie textový súbor.
Overte si to sami, trvá to minútu
Otvorte vasadomena.sk/robots.txt a hľadajte tri veci.
Po prvé Disallow: /. Ak je pod User-agent: *, zakazujete celý web všetkým.
Po druhé riadok Sitemap:. Ak tam nie je, roboty musia sitemapu hľadať samy.
Po tretie menovité bloky s menami vyššie — ak tam nie sú, nie je to chyba, hviezdička ich pokrýva.
Ak sa vám namiesto textu zobrazí stránka webu, súbor nemáte a server len vracia niečo iné. Potvrdí to curl -I https://vasadomena.sk/robots.txt — musí vrátiť content-type: text/plain.
Chyba, ktorá sa zdedí z vývoja
Zďaleka najčastejší vážny nález nie je nesprávne nastavený agent. Je to Disallow: /, ktoré zostalo z čias, keď web bežal na testovacej adrese a nemal sa dostať do vyhľadávania. Pri spustení sa naň zabudlo.
Web potom funguje, vyzerá dobre, ale je pre roboty zavretý. Zvonku to nevidno — všimnete si to až podľa toho, že vás nikto nenachádza. Preto to stojí za tú jednu minútu kontroly.
Druhá verzia tej istej chyby je jemnejšia a prežije dlhšie: Disallow: /wp-admin/ je v poriadku, ale Disallow: /assets/ alebo Disallow: /static/ zablokuje štýly a skripty. Vyhľadávač potom stránku vidí bez vzhľadu a nevie posúdiť, či je použiteľná na mobile.
Poradie pravidiel a ako sa vyhodnocujú
Toto sa mýli často a dôsledok je opačný, než človek čakal.
Robot použije len jeden blok — ten, ktorý sa najpresnejšie zhoduje s jeho menom. Ak má web blok pre * aj pre GPTBot, GPTBot bude čítať iba ten svoj a pravidlá z hviezdičky ho nezaujímajú.
Dôsledok: ak do menovitého bloku napíšete len Allow: / a zabudnete tam zopakovať zákazy z hviezdičky, práve ste tomu agentovi povolili aj to, čo ste zakázali všetkým ostatným.
Druhé pravidlo: pri konflikte vyhráva dlhšia cesta, nie poradie riadkov. Allow: /blog/verejne/ prebije Disallow: /blog/, lebo je konkrétnejšia.
Menovité pravidlá ako poistka
Ak vás už User-agent: * púšťa, menovité povolenia nič nemenia — dnes. Zmysel majú ako poistka do dňa, keď niekto do hviezdičky pridá zákaz. Vtedy menovitý riadok pre OAI-SearchBot zostane a agent, ktorý rozhoduje o vašej viditeľnosti v ChatGPT, prejde ďalej.
Je to lacné a je to písomný záznam rozhodnutia. O rok už nikto nebude vedieť, či bola hviezdička mienená aj pre AI agentov, alebo to nikto neriešil.
Čo robots.txt nedokáže
Je to pokyn, nie zámka. Slušní agenti ho rešpektujú, ostatní nie, a súbor sám nikoho nezastaví.
Nezabráni ani indexácii adresy. Ak na zakázanú stránku vedie odkaz z iného webu, vyhľadávač o nej vie a môže ju zobraziť vo výsledkoch bez popisu — pretože obsah si prečítať nesmel. Na vylúčenie z výsledkov slúži značka noindex, a tá funguje len vtedy, keď robot na stránku smie a prečíta si ju. Zakázať v robots.txt a zároveň dať noindex je protirečenie: robot ten noindex nikdy neuvidí.