AI Overview i RODO - dwie warstwy, które często się myli
Większość pytań, które otrzymujemy od klientów, wynika z jednego błędu pojęciowego: utożsamiania odwiedzin bota AI (np. Googlebot-Extended, GPTBot, ClaudeBot) z wizytą użytkownika, który musi wyrazić zgodę na cookies. To dwie zupełnie różne sytuacje prawne. RODO reguluje przetwarzanie danych osobowych osób fizycznych - bot indeksujący Twoją stronę nie jest osobą fizyczną i nie zostawia danych osobowych w rozumieniu art. 4 RODO.
Problem pojawia się w innym miejscu: jeśli treści dostępne na Twojej stronie zawierają dane osobowe użytkowników (np. opinie z imieniem i nazwiskiem, profile klientów), a LLM je zindeksuje i zacytuje - wchodzisz w szarą strefę. Podobnie, jeśli Twój system analityczny wysyła do Google dane o zachowaniu użytkowników, którzy odrzucili cookies, naruszasz Consent Mode v2 i jednocześnie RODO. Te dwa problemy trzeba rozwiązywać osobno, ale w ramach jednej spójnej polityki GEO.
Consent Mode v2 nie blokuje botów - ale wpływa na to, co Google „widzi”
Consent Mode v2 to mechanizm sygnałów zgody przekazywanych do Google Tag Manager i Google Analytics 4. Działa na poziomie sesji użytkownika przeglądarki - nie ma żadnego technicznego wpływu na to, jak Googlebot lub inny bot AI odczytuje plik llms.txt czy indeksuje zawartość strony. Bot nie uruchamia JavaScript, nie akceptuje ani nie odrzuca cookies, nie wchodzi w interakcję z banerem CMP.
Jednak Consent Mode v2 pośrednio wpływa na widoczność Twojej strony w AI Overview przez jakość danych, które trafiają do Google. Jeśli duży odsetek użytkowników odrzuca cookies, a Ty nie masz poprawnie skonfigurowanego modelowania konwersji (conversion modeling), Twoje kampanie Performance Max i sygnały z GA4 są niepełne. Google ma wtedy mniej danych do oceny trafności Twojej strony jako źródła odpowiedzi w AI Overview. Więcej o poprawnej konfiguracji sygnałów piszemy w kontekście usługi GEO, którą realizujemy dla klientów e-commerce i B2B.
Plik llms.txt: co kontroluje, a czego nie
Plik llms.txt (umieszczany w katalogu głównym domeny, np. https://example.com/llms.txt) to nieoficjalny, ale coraz szerzej adoptowany standard sygnalizowania LLM, jakie treści mogą być cytowane, streszczane lub wykorzystywane do trenowania modeli. Jego działanie jest analogiczne do robots.txt - opiera się na dobrowolnym respektowaniu przez boty, nie na technicznym blokowaniu.
Szczegółowy poradnik dotyczący struktury i składni tego pliku znajdziesz w naszym artykule jak przygotować llms.txt - poradnik SEO pod AI 2026. Tutaj skupiamy się wyłącznie na warstwie prawnej i consent - czyli na tym, jakie treści w ogóle powinny być dostępne dla LLM z perspektywy RODO.
Kluczowe rozróżnienie: llms.txt mówi botom, co mogą czytać. RODO mówi Tobie, jakie dane możesz udostępniać. Jeśli na Twojej stronie są treści zawierające dane osobowe bez odpowiedniej podstawy prawnej dla ich dalszego przetwarzania przez systemy AI - powinieneś je wykluczyć z llms.txt niezależnie od tego, czy użytkownik zaakceptował cookies.
Scenariusze, w których LLM nie powinna cytować Twoich treści
Poniżej cztery praktyczne sytuacje, w których wykluczenie sekcji z llms.txt jest uzasadnione prawnie lub biznesowo:
- Opinie z danymi osobowymi - recenzje zawierające imię, nazwisko lub inne dane identyfikujące klienta bez jego zgody na przetwarzanie przez systemy AI.
- Treści za paywallem lub po logowaniu - jeśli dostęp jest warunkowany umową lub subskrypcją, cytowanie przez LLM może naruszać warunki korzystania z usługi i prawa autorskie.
- Strony z dynamiczną personalizacją - jeśli treść strony zmienia się w zależności od profilu użytkownika (np. cenniki, oferty indywidualne), bot może zindeksować wersję niezgodną z aktualną ofertą.
- Dokumenty wewnętrzne omyłkowo zaindeksowane - regulaminy robocze, wersje draft polityki prywatności, wewnętrzne FAQ - ich cytowanie przez AI Overview może wprowadzać użytkowników w błąd.
Jak oznaczyć treści „nie do cytowania” w llms.txt
Składnia llms.txt pozwala na wykluczanie konkretnych ścieżek URL za pomocą dyrektywy Disallow dla wybranych agentów. Przykład poprawnej konfiguracji blokującej boty AI dla sekcji z opiniami i stref zalogowanych:
# llms.txt - PremiumAds example
# Zezwolenie ogólne
User-agent: *
Allow: /blog/
Allow: /uslugi/
Allow: /case-study/
# Blokada sekcji z danymi osobowymi
Disallow: /opinie/
Disallow: /konto/
Disallow: /panel/
Disallow: /draft/
# Blokada konkretnych botów AI (np. OpenAI)
User-agent: GPTBot
Disallow: /
# Blokada trenowania modeli (Anthropic)
User-agent: ClaudeBot
Allow: /blog/
Disallow: /opinie/
Pamiętaj, że brak pliku llms.txt nie oznacza domyślnego zezwolenia - różne systemy LLM stosują różne polityki domyślne. GPT (wg polityki OpenAI 2024) respektuje robots.txt i llms.txt, ale nie wszystkie boty działają tak samo. Weryfikuj logi serwera regularnie.
Monitoring logów serwera: jak wykrywać boty AI i co z tym robić
Logi dostępu (access.log) to jedyne wiarygodne źródło informacji o tym, które boty faktycznie odwiedzają Twoją stronę i które sekcje indeksują. Consent Mode v2 nie dostarcza tych danych - GA4 w ogóle nie rejestruje ruchu botów (jest filtrowany po stronie Google). Musisz sięgać bezpośrednio do logów serwera lub narzędzi typu Cloudflare Analytics.
| Bot AI | User-Agent (fragment) | Respektuje robots.txt? | Respektuje llms.txt? |
|---|---|---|---|
| GPTBot (OpenAI) | GPTBot/1.1 | Tak (wg OpenAI 2024) | Tak (jeśli plik istnieje) |
| ClaudeBot (Anthropic) | ClaudeBot/1.0 | Tak | Częściowo |
| Googlebot-Extended | Googlebot-Extended | Tak | Tak (Google SGE/AI Overview) |
| PerplexityBot | PerplexityBot/1.0 | Tak | Brak potwierdzenia (2025) |
| Amazonbot | Amazonbot/0.1 | Tak | Nieznane |
Jeśli w logach widzisz boty, które ignorują dyrektywy llms.txt lub robots.txt, kolejnym krokiem jest blokada na poziomie serwera (np. reguły w .htaccess lub w konfiguracji Nginx) lub przez WAF. To rozwiązanie twarde - bot nie dostanie odpowiedzi 200, tylko 403 lub 429.
Porada prawna: czy musisz blokować LLM, gdy użytkownik odrzucił cookies?
Krótka odpowiedź: nie - ale z ważnym zastrzeżeniem. Odrzucenie cookies przez użytkownika na Twojej stronie nie tworzy obowiązku blokowania botów AI. Są to dwa niezależne procesy. Użytkownik wyraża (lub cofa) zgodę na przetwarzanie jego własnych danych behawioralnych przez narzędzia analityczne i reklamowe. Bot AI nie jest tym użytkownikiem i nie przetwarza jego danych w tym sensie.
Obowiązek blokowania lub ograniczania dostępu LLM do treści może jednak wynikać z innych podstaw:
- Art. 6 RODO - jeśli treść zawiera dane osobowe, a brak jest podstawy prawnej dla ich udostępnienia systemom AI (np. brak zgody osoby, której dane dotyczą, brak uzasadnionego interesu).
- Prawa autorskie - jeśli treść jest chroniona i nie chcesz, by była używana do trenowania modeli komercyjnych (podstawa: dyrektywa DSM, art. 4 - opt-out dla trenowania AI).
- Warunki umów z klientami - jeśli Twoje case study lub raporty zawierają informacje poufne objęte NDA.
Warto skonsultować tę kwestię z prawnikiem specjalizującym się w prawie cyfrowym - szczególnie jeśli prowadzisz serwis z dużą ilością treści generowanych przez użytkowników (UGC). PremiumAds jako Cookiebot Platinum Partner wdraża Consent Mode v2 i doradza w zakresie polityki cookies, ale ostateczna ocena prawna RODO leży po stronie radcy prawnego lub adwokata.
Checklist RODO + GEO: co wdrożyć przed publikacją llms.txt
Na podstawie wdrożeń realizowanych dla ponad 60 klientów Google Ads zebraliśmy minimalny zestaw działań, które powinny poprzedzać opublikowanie pliku llms.txt. Działania te dotyczą warstwy technicznej, prawnej i analitycznej.
- Audyt treści pod kątem danych osobowych - przejrzyj wszystkie sekcje strony i oznacz te, które zawierają dane identyfikujące osoby fizyczne.
- Weryfikacja Consent Mode v2 - upewnij się, że GTM poprawnie przekazuje sygnały
ad_storage,analytics_storageiad_user_data. Sprawdź w GA4 → Administracja → Ustawienia danych → Zbieranie danych. - Konfiguracja CMP - banner musi spełniać wymagania Google Certified CMP (np. Cookiebot). Brak certyfikowanego CMP od marca 2024 wg Google skutkuje ograniczeniem personalizacji reklam.
- Przegląd robots.txt - upewnij się, że sekcje blokowane dla Googlebot są też blokowane dla botów AI lub explicite wymienione w llms.txt.
- Publikacja llms.txt z dyrektywami Disallow - dla sekcji z danymi osobowymi, treściami za paywallem i dokumentami roboczymi.
- Konfiguracja monitoringu logów - ustaw alert na User-Agenty botów AI w logach serwera lub Cloudflare.
- Polityka prywatności - dodaj sekcję informującą o indeksowaniu przez systemy AI i możliwości opt-out (wymagane przez niektóre przepisy krajowe, w toku legislacji UE).
- Test end-to-end - użyj narzędzia Google Rich Results Test i ręcznego curl z User-Agentem GPTBot, by sprawdzić, co bot faktycznie widzi.
Jeśli dopiero zaczynasz budować strategię widoczności w systemach AI, zapoznaj się z naszą ofertą w zakresie GEO (Generative Engine Optimization) - pomagamy firmom z różnych branż przygotować architekturę treści i konfigurację techniczną pod cytowanie przez LLM.
Masz pytania dotyczące konkretnej konfiguracji Consent Mode v2 lub chcesz zlecić audyt llms.txt pod kątem RODO? Skontaktuj się z nami - odpowiemy w ciągu jednego dnia roboczego.