Košík je prázdný

V roce 2024–2025 začala éra nových „AI crawlerů“, kteří automaticky procházejí web a shromažďují obsah pro trénování jazykových modelů (LLM).
Ačkoli některé z nich (například OpenAI GPTBot nebo Google-Extended) se chovají korektně a respektují pravidla v souboru robots.txt, jiné (například PerplexityBot nebo různé anonymní scrappeři) tuto ochranu často ignorují.

Pokud nechcete, aby se obsah vašeho webu stal součástí datasetů pro trénink umělé inteligence, existuje několik kroků, jak se účinně chránit.

1. První linie obrany: robots.txt

Soubor robots.txt patří do kořenového adresáře webu (např. https://domena.cz/robots.txt).
Níže uvedený příklad představuje rozšířenou verzi, která blokuje přístup většině známých AI crawlerů, ale ponechává volný přístup běžným vyhledávačům, jako jsou Google, Bing nebo Seznam.

# =====================================================================
# ROBOTS.TXT — BLOKACE AI/LLM BOTŮ A AI SEARCH CRAWLERŮ
# Poslední update: 2025-11-04
# =====================================================================

User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: cohere-ai
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: aiGPTBot
Disallow: /
User-agent: DataForSeoBot
Disallow: /


Toto řešení je neinvazivní, jednoduché a účinné — ale pouze pokud robot soubor robots.txt respektuje.

 

2. Druhá linie obrany: .htaccess blokace

Chcete-li přístup těmto botům fyzicky znemožnit, je nutné přidat filtr přímo na úrovni serveru pomocí .htaccess.
Tento přístup je okamžitý – při pokusu o přístup obdrží robot odpověď 403 Forbidden a nedostane se dál než k hlavičkám.

# =====================================================================
# .HTACCESS – BLOKACE AI / LLM / DATA CRAWLERŮ
# =====================================================================

<IfModule mod_rewrite.c>
RewriteEngine On

RewriteCond %{HTTP_USER_AGENT} (GPTBot|OAI-SearchBot|ChatGPT-User) [NC,OR]
RewriteCond %{HTTP_USER_AGENT} (ClaudeBot|Claude-Web|Perplexity|PerplexityBot|PerplexityCrawler|Perplexity-User) [NC,OR]
RewriteCond %{HTTP_USER_AGENT} (Google-Extended|Applebot-Extended|Meta-ExternalAgent|facebookexternalhit|CCBot|cohere-ai|Bytespider|Amazonbot|YouBot|aiGPTBot|DataForSeoBot|Diffbot|PhindBot|Kagi) [NC]
RewriteRule .* - [F,L]

ErrorDocument 403 "Access denied. AI crawlers are not allowed on this site."
</IfModule>

Po nahrání můžeš funkčnost ověřit příkazem:

curl -A "GPTBot" -I https://tvujweb.cz/

Odpověď by měla být HTTP/1.1 403 Forbidden.

3. Doporučené doplňky a rozšíření ochrany

  1. Meta tag v HTML
    Do <head> přidej:

    <meta name="robots" content="noai, noimageai">
    
  2. HTTP hlavička
    Do .htaccess nebo serverového nastavení:
    Header set X-Robots-Tag "noai, noimageai"
    ​
  3. Cloudflare Firewall Rule
    V rozhraní Cloudflare vytvoř pravidlo:
    (http.user_agent contains "GPTBot") → Block
    ​
    a postupně doplň další UA řetězce z tohoto seznamu.
  4. Log monitoring
    Sleduj přístupy k souboru robots.txt a analyzuj User-Agenty.
    Pokud některý z botů opakovaně ignoruje blokaci, zvaž IP-ban nebo WAF pravidlo.

 

4. Proč se chránit před AI scrapery

  • Ochrana autorského obsahu – váš text, obrázky a články mohou být použity pro trénink modelů bez souhlasu.

  • Zátěž serveru – některé AI boty procházejí web agresivně a mohou zvýšit spotřebu CPU i bandwidth.

  • Omezení SEO signálů – duplicitní nebo strojově kopírovaný obsah může ovlivnit hodnocení webu.

  • Soulad s firemní politikou a GDPR – především u komerčních webů, kde se zpracovávají osobní nebo citlivé údaje.

 

Umělá inteligence mění způsob, jakým se s obsahem na internetu pracuje.
Pokud však nechcete, aby se vaše texty, fotografie či databáze staly součástí tréninku cizích modelů, máte plné právo přístup omezit.

Soubor robots.txt a .htaccess jsou dvě jednoduché, ale velmi účinné vrstvy ochrany, které zvládne nasadit každý webmaster během několika minut.
Kombinace těchto metod s Cloudflare Firewallem poskytuje momentálně nejvyšší úroveň ochrany proti AI crawlerům.

 

Tip: Pokud používáte PrestaShop, Joomla nebo Wordpress, vlož uvedený blok do .htaccess před systémové přepisovací pravidla.
Při jakýchkoli pochybnostech je vhodné po úpravě zkontrolovat logy nebo použít testovací příkaz curl, aby bylo jasné, že blokace funguje.

Neaktivní hodnoceníNeaktivní hodnoceníNeaktivní hodnoceníNeaktivní hodnoceníNeaktivní hodnocení