GEO (AI Search)

llms.txt i Consent Mode v2: cytowanie w AI Overview zgodnie z RODO

GRI84A
llms.txt i Consent Mode v2: cytowanie w AI Overview zgodnie z RODO

AI Overview i RODO - dwie warstwy, które często się myli

Większość pytań, które otrzymujemy od klientów, wynika z jednego błędu pojęciowego: utożsamiania odwiedzin bota AI (np. Googlebot-Extended, GPTBot, ClaudeBot) z wizytą użytkownika, który musi wyrazić zgodę na cookies. To dwie zupełnie różne sytuacje prawne. RODO reguluje przetwarzanie danych osobowych osób fizycznych - bot indeksujący Twoją stronę nie jest osobą fizyczną i nie zostawia danych osobowych w rozumieniu art. 4 RODO.

Problem pojawia się w innym miejscu: jeśli treści dostępne na Twojej stronie zawierają dane osobowe użytkowników (np. opinie z imieniem i nazwiskiem, profile klientów), a LLM je zindeksuje i zacytuje - wchodzisz w szarą strefę. Podobnie, jeśli Twój system analityczny wysyła do Google dane o zachowaniu użytkowników, którzy odrzucili cookies, naruszasz Consent Mode v2 i jednocześnie RODO. Te dwa problemy trzeba rozwiązywać osobno, ale w ramach jednej spójnej polityki GEO.

Consent Mode v2 nie blokuje botów - ale wpływa na to, co Google „widzi”

Consent Mode v2 to mechanizm sygnałów zgody przekazywanych do Google Tag Manager i Google Analytics 4. Działa na poziomie sesji użytkownika przeglądarki - nie ma żadnego technicznego wpływu na to, jak Googlebot lub inny bot AI odczytuje plik llms.txt czy indeksuje zawartość strony. Bot nie uruchamia JavaScript, nie akceptuje ani nie odrzuca cookies, nie wchodzi w interakcję z banerem CMP.

Jednak Consent Mode v2 pośrednio wpływa na widoczność Twojej strony w AI Overview przez jakość danych, które trafiają do Google. Jeśli duży odsetek użytkowników odrzuca cookies, a Ty nie masz poprawnie skonfigurowanego modelowania konwersji (conversion modeling), Twoje kampanie Performance Max i sygnały z GA4 są niepełne. Google ma wtedy mniej danych do oceny trafności Twojej strony jako źródła odpowiedzi w AI Overview. Więcej o poprawnej konfiguracji sygnałów piszemy w kontekście usługi GEO, którą realizujemy dla klientów e-commerce i B2B.

Plik llms.txt: co kontroluje, a czego nie

Plik llms.txt (umieszczany w katalogu głównym domeny, np. https://example.com/llms.txt) to nieoficjalny, ale coraz szerzej adoptowany standard sygnalizowania LLM, jakie treści mogą być cytowane, streszczane lub wykorzystywane do trenowania modeli. Jego działanie jest analogiczne do robots.txt - opiera się na dobrowolnym respektowaniu przez boty, nie na technicznym blokowaniu.

Szczegółowy poradnik dotyczący struktury i składni tego pliku znajdziesz w naszym artykule jak przygotować llms.txt - poradnik SEO pod AI 2026. Tutaj skupiamy się wyłącznie na warstwie prawnej i consent - czyli na tym, jakie treści w ogóle powinny być dostępne dla LLM z perspektywy RODO.

Kluczowe rozróżnienie: llms.txt mówi botom, co mogą czytać. RODO mówi Tobie, jakie dane możesz udostępniać. Jeśli na Twojej stronie są treści zawierające dane osobowe bez odpowiedniej podstawy prawnej dla ich dalszego przetwarzania przez systemy AI - powinieneś je wykluczyć z llms.txt niezależnie od tego, czy użytkownik zaakceptował cookies.

Scenariusze, w których LLM nie powinna cytować Twoich treści

Poniżej cztery praktyczne sytuacje, w których wykluczenie sekcji z llms.txt jest uzasadnione prawnie lub biznesowo:

  • Opinie z danymi osobowymi - recenzje zawierające imię, nazwisko lub inne dane identyfikujące klienta bez jego zgody na przetwarzanie przez systemy AI.
  • Treści za paywallem lub po logowaniu - jeśli dostęp jest warunkowany umową lub subskrypcją, cytowanie przez LLM może naruszać warunki korzystania z usługi i prawa autorskie.
  • Strony z dynamiczną personalizacją - jeśli treść strony zmienia się w zależności od profilu użytkownika (np. cenniki, oferty indywidualne), bot może zindeksować wersję niezgodną z aktualną ofertą.
  • Dokumenty wewnętrzne omyłkowo zaindeksowane - regulaminy robocze, wersje draft polityki prywatności, wewnętrzne FAQ - ich cytowanie przez AI Overview może wprowadzać użytkowników w błąd.

Jak oznaczyć treści „nie do cytowania” w llms.txt

Składnia llms.txt pozwala na wykluczanie konkretnych ścieżek URL za pomocą dyrektywy Disallow dla wybranych agentów. Przykład poprawnej konfiguracji blokującej boty AI dla sekcji z opiniami i stref zalogowanych:

# llms.txt - PremiumAds example
# Zezwolenie ogólne
User-agent: *
Allow: /blog/
Allow: /uslugi/
Allow: /case-study/

# Blokada sekcji z danymi osobowymi
Disallow: /opinie/
Disallow: /konto/
Disallow: /panel/
Disallow: /draft/

# Blokada konkretnych botów AI (np. OpenAI)
User-agent: GPTBot
Disallow: /

# Blokada trenowania modeli (Anthropic)
User-agent: ClaudeBot
Allow: /blog/
Disallow: /opinie/

Pamiętaj, że brak pliku llms.txt nie oznacza domyślnego zezwolenia - różne systemy LLM stosują różne polityki domyślne. GPT (wg polityki OpenAI 2024) respektuje robots.txt i llms.txt, ale nie wszystkie boty działają tak samo. Weryfikuj logi serwera regularnie.

Monitoring logów serwera: jak wykrywać boty AI i co z tym robić

Logi dostępu (access.log) to jedyne wiarygodne źródło informacji o tym, które boty faktycznie odwiedzają Twoją stronę i które sekcje indeksują. Consent Mode v2 nie dostarcza tych danych - GA4 w ogóle nie rejestruje ruchu botów (jest filtrowany po stronie Google). Musisz sięgać bezpośrednio do logów serwera lub narzędzi typu Cloudflare Analytics.

Bot AI User-Agent (fragment) Respektuje robots.txt? Respektuje llms.txt?
GPTBot (OpenAI) GPTBot/1.1 Tak (wg OpenAI 2024) Tak (jeśli plik istnieje)
ClaudeBot (Anthropic) ClaudeBot/1.0 Tak Częściowo
Googlebot-Extended Googlebot-Extended Tak Tak (Google SGE/AI Overview)
PerplexityBot PerplexityBot/1.0 Tak Brak potwierdzenia (2025)
Amazonbot Amazonbot/0.1 Tak Nieznane

Jeśli w logach widzisz boty, które ignorują dyrektywy llms.txt lub robots.txt, kolejnym krokiem jest blokada na poziomie serwera (np. reguły w .htaccess lub w konfiguracji Nginx) lub przez WAF. To rozwiązanie twarde - bot nie dostanie odpowiedzi 200, tylko 403 lub 429.

Porada prawna: czy musisz blokować LLM, gdy użytkownik odrzucił cookies?

Krótka odpowiedź: nie - ale z ważnym zastrzeżeniem. Odrzucenie cookies przez użytkownika na Twojej stronie nie tworzy obowiązku blokowania botów AI. Są to dwa niezależne procesy. Użytkownik wyraża (lub cofa) zgodę na przetwarzanie jego własnych danych behawioralnych przez narzędzia analityczne i reklamowe. Bot AI nie jest tym użytkownikiem i nie przetwarza jego danych w tym sensie.

Obowiązek blokowania lub ograniczania dostępu LLM do treści może jednak wynikać z innych podstaw:

  • Art. 6 RODO - jeśli treść zawiera dane osobowe, a brak jest podstawy prawnej dla ich udostępnienia systemom AI (np. brak zgody osoby, której dane dotyczą, brak uzasadnionego interesu).
  • Prawa autorskie - jeśli treść jest chroniona i nie chcesz, by była używana do trenowania modeli komercyjnych (podstawa: dyrektywa DSM, art. 4 - opt-out dla trenowania AI).
  • Warunki umów z klientami - jeśli Twoje case study lub raporty zawierają informacje poufne objęte NDA.

Warto skonsultować tę kwestię z prawnikiem specjalizującym się w prawie cyfrowym - szczególnie jeśli prowadzisz serwis z dużą ilością treści generowanych przez użytkowników (UGC). PremiumAds jako Cookiebot Platinum Partner wdraża Consent Mode v2 i doradza w zakresie polityki cookies, ale ostateczna ocena prawna RODO leży po stronie radcy prawnego lub adwokata.

Checklist RODO + GEO: co wdrożyć przed publikacją llms.txt

Na podstawie wdrożeń realizowanych dla ponad 60 klientów Google Ads zebraliśmy minimalny zestaw działań, które powinny poprzedzać opublikowanie pliku llms.txt. Działania te dotyczą warstwy technicznej, prawnej i analitycznej.

  1. Audyt treści pod kątem danych osobowych - przejrzyj wszystkie sekcje strony i oznacz te, które zawierają dane identyfikujące osoby fizyczne.
  2. Weryfikacja Consent Mode v2 - upewnij się, że GTM poprawnie przekazuje sygnały ad_storage, analytics_storage i ad_user_data. Sprawdź w GA4 → Administracja → Ustawienia danych → Zbieranie danych.
  3. Konfiguracja CMP - banner musi spełniać wymagania Google Certified CMP (np. Cookiebot). Brak certyfikowanego CMP od marca 2024 wg Google skutkuje ograniczeniem personalizacji reklam.
  4. Przegląd robots.txt - upewnij się, że sekcje blokowane dla Googlebot są też blokowane dla botów AI lub explicite wymienione w llms.txt.
  5. Publikacja llms.txt z dyrektywami Disallow - dla sekcji z danymi osobowymi, treściami za paywallem i dokumentami roboczymi.
  6. Konfiguracja monitoringu logów - ustaw alert na User-Agenty botów AI w logach serwera lub Cloudflare.
  7. Polityka prywatności - dodaj sekcję informującą o indeksowaniu przez systemy AI i możliwości opt-out (wymagane przez niektóre przepisy krajowe, w toku legislacji UE).
  8. Test end-to-end - użyj narzędzia Google Rich Results Test i ręcznego curl z User-Agentem GPTBot, by sprawdzić, co bot faktycznie widzi.

Jeśli dopiero zaczynasz budować strategię widoczności w systemach AI, zapoznaj się z naszą ofertą w zakresie GEO (Generative Engine Optimization) - pomagamy firmom z różnych branż przygotować architekturę treści i konfigurację techniczną pod cytowanie przez LLM.

Masz pytania dotyczące konkretnej konfiguracji Consent Mode v2 lub chcesz zlecić audyt llms.txt pod kątem RODO? Skontaktuj się z nami - odpowiemy w ciągu jednego dnia roboczego.

Często zadawane pytania

Czy plik llms.txt jest wymagany przez RODO?

Nie - llms.txt nie jest wymagany przez żaden przepis RODO. To dobrowolny standard techniczny, który pozwala właścicielom stron sygnalizować botom AI, jakie treści mogą być cytowane lub wykorzystywane. RODO nakłada obowiązki dotyczące przetwarzania danych osobowych, a llms.txt jest narzędziem do zarządzania dostępem do treści - oba mechanizmy działają niezależnie, ale powinny być ze sobą spójne.

Czy Consent Mode v2 wpływa na to, czy Google AI Overview cytuje moją stronę?

Bezpośrednio - nie. Consent Mode v2 działa na poziomie sesji użytkownika przeglądarki i nie ma wpływu na to, jak Googlebot-Extended indeksuje treści. Pośrednio jednak - tak: niepełne dane z GA4 (wynikające z braku zgód) obniżają jakość sygnałów konwersji, co może wpływać na ocenę trafności strony jako źródła odpowiedzi w AI Overview.

Jak zablokować konkretnego bota AI (np. GPTBot) bez blokowania Googlebot?

W pliku llms.txt (lub robots.txt) użyj dyrektywy User-agent z nazwą konkretnego bota, np. User-agent: GPTBot z Disallow: /. Googlebot ma osobny User-Agent i nie będzie objęty tą regułą. Dla pewności zweryfikuj logi serwera po wdrożeniu - niektóre boty ignorują deklaracje i wymagają blokady na poziomie serwera (firewall, .htaccess, Nginx).

Czy użytkownik, który odrzucił cookies, może żądać usunięcia swoich danych z systemów AI?

Odrzucenie cookies na stronie nie jest tożsame z żądaniem usunięcia danych z systemów AI - to dwa odrębne procesy. Jeśli dane osobowe użytkownika (np. opinia z imieniem) zostały zindeksowane przez LLM, użytkownik może skorzystać z prawa do usunięcia danych (art. 17 RODO) bezpośrednio wobec operatora modelu AI. Jako właściciel strony możesz zapobiegać takim sytuacjom, wykluczając sekcje z danymi osobowymi z llms.txt zanim dojdzie do indeksowania.

Czy brak llms.txt oznacza, że boty AI mogą cytować wszystko?

Nie ma jednoznacznej odpowiedzi - zależy od polityki konkretnego dostawcy LLM. OpenAI deklaruje respektowanie robots.txt w przypadku braku llms.txt. Jednak brak explicite wyrażonego zakazu może być interpretowany jako milcząca zgoda przez mniej restrykcyjne systemy. Z perspektywy GEO i RODO rekomendujemy opublikowanie llms.txt z jasnymi dyrektywami, nawet jeśli zezwalasz na cytowanie większości treści - kontrolujesz wtedy wyjątki, a nie całość.

Jakie narzędzia pomogą mi sprawdzić, czy boty AI odwiedzają moją stronę?

Najskuteczniejsze są surowe logi serwera (access.log) - szukaj User-Agentów takich jak GPTBot, ClaudeBot, Googlebot-Extended, PerplexityBot. Cloudflare Analytics w planie Pro oferuje filtrowanie ruchu botów. GA4 nie nadaje się do tego celu - Google filtruje ruch botów przed zapisem do raportów. Możesz też użyć komendy curl z konkretnym User-Agentem, by sprawdzić, co bot faktycznie widzi na danej stronie.

0 0 głosy
Ocena artykułu
Subskrybuj
Powiadom o
guest
0 Komentarze
Najstarsze
Najnowsze Najwięcej głosów

Potrzebujesz wsparcia w temacie z artykułu?

Zajmujemy się Google Ads, SEO, GA4, GEO i RODO od 12 lat. Odpowiada Maciej w 24h, bez handlowca, bez automatu.

Napisz do nas