Slovník

robots.txt

Textový súbor v koreni webu, ktorý robotom hovorí, kam smú a kam nie. Pokyny sú určené aj AI crawlerom, ktoré tento súbor rešpektujú.

robots.txt je obyčajný textový súbor umiestnený v koreni domény (napríklad svaton.sk/robots.txt), ktorý robotom dáva pokyny, ktoré časti webu smú prechádzať a ktoré nie. Súbor však technicky nezabráni prístupu robotovi, ktorý jeho pravidlá nerešpektuje.

Ako funguje

Pracuje s pravidlami User-agent (pre ktorého robota platí), Disallow (kam nesmie) a Allow (výnimka). Klasicky sa ním riešilo, aby roboty nemíňali kapacitu na nezmyselné stránky - filtre, košík, interné vyhľadávanie.

Nová úloha v ére AI

Ten istý súbor dnes riadi aj AI crawlery. Každý user-agent však môže mať iný účel. Pri OpenAI napríklad OAI-SearchBot súvisí s vyhľadávaním, kým GPTBot s možným zlepšovaním modelov. Pravidlá preto nastavujte po jednotlivých crawleroch, nie jedným zákazom pre všetkých.

Čo skontrolovať: pri náleze blokovania v robots.txt najprv zistite, ktorých URL sa pravidlo týka. Blokovanie filtrov či interného vyhľadávania môže byť zámerné; dôležité obsahové stránky treba posúdiť samostatne.

Časté otázky

Skryje robots.txt stránku z Google?

Nie spoľahlivo. Disallow len zabráni prechádzaniu obsahu, stránka sa aj tak môže objaviť vo výsledkoch bez popisu. Na skutočné vylúčenie z indexu slúži značka noindex, nie robots.txt.

Musí mať web robots.txt?

Nemusí, ale mať ho je dobrá prax. Aspoň by mal odkazovať na sitemapu a vedome riešiť prístup robotov vrátane AI crawlerov.

Nezávislý audit

Zistite, čo vo vašom marketingu zlepšiť.

Podľa potrieb vášho webu vyberieme oblasť auditu: SEO, PPC, meranie, obsah alebo AI Search. Dostanete až 10 odporúčaní podľa dopadu a plán na 30 dní.