Nie wiecie, w którym regionie liczy się odpowiedź waszego asystenta AI. Jak to ustalić z dokumentacji
Trening, retencja, miejsce przechowywania i miejsce inferencji to cztery różne parametry. Dokumenty sześciu dostawców z datami weryfikacji i wyjątkami.
Integracja z modelem działa od pół roku, przechodzi ruch produkcyjny i nikt jej nie dotyka. Ktoś zadaje pytanie: w którym regionie fizycznie liczy się odpowiedź i jak długo prompt zostaje w systemach dostawcy. W dokumentacji projektu tego nie ma, bo przy wdrożeniu liczyła się latencja i cena tokenów. W panelu dostawcy też tego nie widać wprost — widać nazwę planu i nazwę modelu.
Ustalenie tych parametrów po fakcie zajmuje kilka godzin i sprowadza się do czytania dokumentacji z ołówkiem. Poniżej rozbiór na cztery niezależne parametry, stan dokumentów sześciu dostawców zweryfikowany 12 sierpnia 2026 roku i kolejność, w jakiej to sprawdzać, żeby nie przeoczyć modułu wyłączonego z reguły ogólnej.
Cztery parametry ukryte w jednym pytaniu o dane
„Gdzie są nasze dane” brzmi jak jedno pytanie, a jest czterema. Odpowiedź na jedno z nich nie przenosi się na pozostałe.
- Trening. Czy dostawca wykorzystuje wejścia i wyjścia do uczenia modeli. To parametr planu, nie produktu — ten sam dostawca może trenować na danych z planu darmowego i nie trenować na danych z planu firmowego.
- Retencja. Jak długo dane zostają w systemach dostawcy. Rozdziel trzy różne zegary: retencję rozmowy widocznej w interfejsie, retencję logów monitoringu nadużyć i retencję materiału oflagowanego przez klasyfikator.
- Lokalizacja przechowywania (at rest). W którym regionie leżą zapisane rozmowy, załączniki i indeksy wektorowe.
- Lokalizacja inferencji. W którym regionie fizycznie liczy się odpowiedź. To bywa inny region niż przechowywanie i to jest miejsce, w którym najczęściej pęka zdanie „dane nie opuszczają UE”.
Cztery parametry, cztery różne miejsca w dokumentacji, czasem cztery różne dokumenty. Sklejenie ich w jedno zdanie daje twierdzenie, którego nie da się potwierdzić ani obalić.
Trening i retencja w dokumentach dostawców, stan na 12 sierpnia 2026
Tabela zawiera to, co da się przeczytać wprost w materiałach dostawców. Ostatnia kolumna to data aktualizacji dokumentu źródłowego, nie data zajrzenia — dokument sprzed roku opisuje stan sprzed roku, nawet jeśli otworzyliście go dzisiaj.
| Plan / interfejs | Trening na danych domyślnie | Retencja wg dokumentu | Aktualizacja dokumentu |
|---|---|---|---|
| OpenAI API | Nie, chyba że jawne opt-in | Logi monitoringu nadużyć do 30 dni; zero data retention po akceptacji wniosku | dokumentacja bez widocznej daty, treść sprawdzona 12.08.2026 |
| ChatGPT Business / Enterprise | Nie | Rozmowy zapisane bezterminowo do momentu usunięcia przez użytkownika; właściciel workspace może ustawić własną politykę retencji, minimum 90 dni | 29.05.2026 |
| Anthropic API | Nie | Wejścia i wyjścia usuwane w ciągu 30 dni od otrzymania lub wygenerowania; zero data retention dla kwalifikujących się klientów | 01.07.2026 |
| Claude for Work (Team, Enterprise) | Nie | Rozmowy dostępne w panelu do momentu usunięcia, potem kasowane z backendu w ciągu 30 dni | 01.07.2026 |
| Claude Free / Pro / Max | Tylko po włączeniu opcji poprawy modelu; czaty Incognito nigdy | Usunięte czaty znikają z backendu w ciągu 30 dni; przy zgodzie na poprawę modelu dane w postaci de-identyfikowanej do 5 lat | 01.07.2026 |
| Gemini w Google Workspace | Nie bez zgody lub polecenia klienta; prompty traktowane jako dane klienta wg Cloud Data Processing Addendum | Od 90 dni do bezterminowo, ustawienie administratora; aplikacja Gemini do 36 miesięcy; Gemini Notebook nie przechowuje po sesji | 26.05.2026 |
| Microsoft 365 Copilot | Nie — prompty, odpowiedzi i dane z Microsoft Graph nie trenują modeli bazowych | Interakcje zapisywane jako historia aktywności i kopie w Microsoft 365; okres sterowany politykami retencji w Purview | 09.07.2026 |
Dwie obserwacje z tej tabeli przydają się bardziej niż same liczby. Pierwsza: „nie trenujemy” i „nie przechowujemy” to rozłączne deklaracje — wszyscy powyżsi dostawcy składają pierwszą, żaden nie składa drugiej w konfiguracji domyślnej. Druga: liczba „30 dni” powtarza się u wielu dostawców, ale za każdym razem odmierza coś innego. U jednego czas życia logów monitoringu nadużyć, u drugiego czas kasowania po tym, jak użytkownik sam usunie rozmowę. Przepisanie jej bez tego rozróżnienia daje zdanie, które brzmi precyzyjnie i nie jest prawdziwe.
Wyjątki, które przeżywają deklarowane okno retencji
Każdy dokument retencyjny ma listę wyjątków i to zwykle ona decyduje o realnym czasie życia danych.
- Materiał oflagowany przez klasyfikator. Anthropic podaje przechowywanie wejść i wyjść do 2 lat, a wyników klasyfikacji do 7 lat (dokument z 01.07.2026). Treść zgłoszona przez klasyfikator wypada z normalnego okna retencji niezależnie od planu.
- Feedback z interfejsu. Kliknięcie kciuka przenosi rozmowę do innego reżimu — Anthropic podaje przechowywanie do 5 lat (01.07.2026). Użytkownik jest przekonany, że ocenia odpowiedź; ocenia też okres retencji własnej rozmowy.
- Warstwy trwałe, które sami zakładacie. Pliki wgrane przez Files API, indeksy wektorowe, historia czatu w aplikacji, kopie interakcji w skrzynkach Exchange przy Copilocie. To dane trzymane na wasze polecenie, tyle że na infrastrukturze dostawcy — deklaracja „30 dni” ich nie obejmuje.
- Nakazy zewnętrzne. Każda polityka zawiera klauzulę o dłuższym przechowywaniu, jeśli wymaga tego prawo. Sekcja niżej pokazuje, jak to wygląda, gdy klauzula się uruchomi.
Rezydencja danych a rzeczywista ścieżka zapytania
Rezydencja sprzedaje się jako przełącznik, a działa jak zbiór warunków. Trzy przykłady z dokumentacji, każdy pokazujący inny mechanizm, przez który „dane zostają w UE” przestaje być prawdziwe.
OpenAI. Dokumentacja API opisuje region „Europe (EEA + Switzerland)” obsługiwany przez domenę eu.api.openai.com, ale wskazuje, że korzystanie z niego wymaga jednego z trybów ograniczonego logowania — zero data retention, modified abuse monitoring, eyes off albo safety retention (treść sprawdzona 12.08.2026). Region nie jest tu niezależnym ustawieniem, tylko konsekwencją konfiguracji logowania. Osobno: zerowa retencja nie obejmuje wszystkich endpointów. Dokumentacja wymienia jako niekwalifikujące się między innymi /v1/conversations, /v1/assistants, /v1/threads, /v1/vector_stores i /v1/videos. Jeśli integracja korzysta z wątków albo bazy wektorowej po stronie dostawcy, umowa o zerowej retencji nie przykrywa całego ruchu.
Microsoft. Dokumentacja Microsoft 365 Copilot (09.07.2026) opisuje kierowanie wywołań modelu do najbliższego centrum danych, z możliwością sięgnięcia do innych regionów w okresach wysokiego obciążenia, przy czym ruch użytkowników z UE pozostaje w granicach EU Data Boundary. W tym samym dokumencie jest zdanie o zupełnie innej wadze: modele dostarczane przez Anthropic jako podprzetwarzającego są obecnie wyłączone z EU Data Boundary. Administrator decyduje, czy włączyć modele firm trzecich w Copilocie — i ta decyzja jest jednocześnie decyzją o wyjściu poza granicę danych, choć w interfejsie nie jest tak nazwana.
Google. Dokumentacja Workspace (26.05.2026) zawiera zdanie, że ustawienia udostępniania plików i regionu danych organizacji nie stosują się do danych w Gemini Notebook. Organizacja może mieć skonfigurowane regiony danych i mimo to jeden moduł zostaje poza tą konfiguracją.
Wspólny wzór: rezydencja jest właściwością konkretnego produktu, planu i modułu, nie właściwością dostawcy. Twierdzenie o regionie ma sens wyłącznie z podanym zakresem — nazwą planu i nazwą modułu.
Retencja jako zobowiązanie, nie właściwość systemu
Najbardziej pouczający materiał do tego tematu nie jest polityką prywatności, tylko aktami sprawy. W maju 2025 roku sąd federalny w postępowaniu The New York Times Company v. Microsoft Corporation i in. nakazał OpenAI zachowanie i wydzielenie wszystkich danych logów wyjściowych, które w normalnym trybie zostałyby usunięte — łącznie z danymi objętymi żądaniami usunięcia ze strony użytkowników. Obowiązek zachowywania nowych logów zdjęto jesienią 2025 roku, z zastrzeżeniem kont oflagowanych przez powoda, przy czym logi już zabezpieczone pozostały zabezpieczone. W styczniu 2026 roku sąd okręgowy utrzymał w mocy postanowienie nakazujące wydanie próbki dwudziestu milionów zanonimizowanych logów rozmów.
Wniosek techniczny jest niezależny od tego, kto ma rację w tym sporze. Deklarowana retencja to zobowiązanie dostawcy, a nie właściwość systemu — mechanizm kasowania da się wstrzymać poleceniem z zewnątrz i wtedy dane, które miały zniknąć po trzydziestu dniach, nie znikają. Projektując integrację, warto przyjąć to jako scenariusz bazowy: minimalizować to, co w ogóle wychodzi do dostawcy, zamiast opierać się na tym, że po stronie dostawcy coś na pewno zniknie.
To nie jest porada prawna — skutki konkretnego postępowania dla waszych umów ocenia prawnik, który je zna.
Kolejność ustalania faktów o własnej integracji
Procedura, którą da się powtórzyć i przekazać komuś innemu:
- Krok 1. Wypisz narzędzia po nazwie planu, nie po nazwie producenta. „Używamy Claude” nie niesie żadnej informacji; „Claude Team, konto organizacji” niesie.
- Krok 2. Do każdego planu pobierz dokument dostawcy, zapisz URL, datę aktualizacji dokumentu i datę pobrania. Zrób kopię PDF — strony z politykami zmieniają się bez wersjonowania i po pół roku nie odtworzycie, co tam było napisane.
- Krok 3. Rozdziel cztery parametry z pierwszej sekcji i opisz każdy osobno, cytując zdanie źródłowe.
- Krok 4. Sprawdź, czy funkcja, z której faktycznie korzystacie, mieści się w zakresie deklaracji. Punkty zapalne: endpointy wyłączone z zerowej retencji, moduły wyłączone z ustawień regionu, plany o innym domyślnym ustawieniu treningu.
- Krok 5. Sprawdź listę podprzetwarzających i ich wyłączenia. Model firmy trzeciej wewnątrz produktu innego dostawcy może mieć inny reżim niż produkt, w którym siedzi.
- Krok 6. Policz warstwy trwałe po swojej stronie: logi aplikacji, historia rozmów w interfejsie, indeks wektorowy, cache promptów, eksporty do arkuszy i zrzuty ekranu w zgłoszeniach do supportu. Pytanie dotyczy danych, nie dostawcy. Jeśli przy tej inwentaryzacji wyjdzie, że część procesów trafiła do narzędzi AI bez świadomej decyzji, to osobny temat na osobny tydzień — kryteria doboru procesów opisuje tekst o tym, który proces oddać AI jako pierwszy, a którego nie ruszać.
- Krok 7. Zapisz datę weryfikacji i ustaw przypomnienie kwartalne. Wszystkie sześć dokumentów z tabeli powyżej zostało zaktualizowanych w ciągu ostatnich pięciu miesięcy.
Twierdzenia z zakresem i twierdzenia bez zakresu
| Zapis, którego nie da się potwierdzić | Zapis, który da się sprawdzić |
|---|---|
| „Nasze dane nie są używane do trenowania AI” | „Dla planu [nazwa] dostawca deklaruje brak wykorzystania wejść i wyjść do trenowania w konfiguracji domyślnej; stan dokumentu na [data]” |
| „Dane nie opuszczają Unii Europejskiej” | „Przechowywanie at rest w regionie [nazwa] dla planu [nazwa]; inferencja: [region i warunki]; moduły poza tym zakresem: [lista]” |
| „Dane są usuwane po 30 dniach” | „Dostawca zobowiązuje się usunąć w ciągu 30 dni, poza: materiałem oflagowanym przez klasyfikator, przesłanym feedbackiem, danymi trzymanymi na nasze polecenie, nakazami zewnętrznymi” |
| „Mamy zerową retencję” | „Zerowa retencja obejmuje endpointy [lista]; poza zakresem pozostają [lista] używane w module [nazwa]” |
| „Model działa na serwerach w UE” | „Model [nazwa] w planie [nazwa]; region inferencji [nazwa], warunek konfiguracyjny [nazwa]; podprzetwarzający wyłączeni z regionu: [lista]” |
Różnica między kolumnami nie polega na ostrożności językowej. Lewa kolumna to zdania, których nikt nie potrafi udowodnić w chwili, gdy ktoś poprosi o dowód. Prawa to zdania z zakresem i datą — sprawdzalne, w tym po to, żeby stwierdzić, że przestały być aktualne.
Decyzja do podjęcia w tym tygodniu
Wybierzcie jedno: albo utrzymujecie rejestr narzędzi AI z datami weryfikacji i opisujecie przepływ danych z niego, albo przestajecie formułować twierdzenia o danych w trybie oznajmującym i przechodzicie na opis z zakresem. Trzecia droga — zdanie bez dokumentu i bez daty — kosztuje najmniej dzisiaj i jako jedyna wraca później, gdy ktoś poprosi o dowód albo gdy dostawca zmieni konfigurację domyślną bez ogłoszenia.
Rejestr w minimalnej wersji to arkusz z siedmioma kolumnami. Poniżej ich zawartość i powód istnienia każdej — bo rejestr bez uzasadnienia kolumn po kwartale zamienia się w listę nazw produktów.
| Kolumna | Co wpisać | Po co |
|---|---|---|
| Narzędzie i plan | Pełna nazwa produktu wraz z planem i typem konta | Domyślne ustawienia treningu i retencji różnią się między planami tego samego dostawcy |
| Właściciel | Imienna osoba po waszej stronie | Pytanie o dane zawsze ma termin; „dział IT” nie odpowiada na maile |
| URL dokumentu | Adres strony z polityką lub dokumentacją | Pytający chce linku, nie streszczenia |
| Data aktualizacji dokumentu | Data podana przez dostawcę na tej stronie | Odróżnia opisany stan od momentu, w którym patrzyliście |
| Data waszej weryfikacji | Dzień, w którym ktoś to otworzył i przeczytał | Bez niej nie wiadomo, czy wpis ma pół roku, czy dwa lata |
| Kopia dokumentu | Ścieżka do zarchiwizowanego PDF | Strony online zmieniają się bez wersjonowania i bez ogłoszenia |
| Ograniczenia zakresu | Moduły, endpointy i modele wyłączone z deklaracji | Zwykle jedyny fragment, który realnie różnicuje odpowiedzi |
Pierwsze wypełnienie zajmuje kilka godzin i wymaga zajrzenia do rzeczywistej konfiguracji, nie do materiałów marketingowych. Kwartalna aktualizacja to kilkanaście minut. To jedna z tych pozycji, które nie pojawiają się w wycenie wdrożenia, a pojawiają się w kalendarzu — obok innych kosztów pilotażu AI spoza faktury dostawcy. Kolejne pytanie o przepływ danych przestaje wtedy być ćwiczeniem z pamięci i staje się kopiowaniem wierszy.
Źródła
- OpenAI, dokumentacja API — Your data: developers.openai.com (treść sprawdzona 12.08.2026)
- OpenAI Academy — Data governance and compliance: academy.openai.com (aktualizacja 29.05.2026)
- Anthropic Privacy Center — How long do you store my organization’s data?: privacy.claude.com (aktualizacja 01.07.2026)
- Anthropic Privacy Center — How long do you store my data?: privacy.claude.com (aktualizacja 01.07.2026)
- Google Workspace — Generative AI in Google Workspace Privacy Hub: knowledge.workspace.google.com (aktualizacja 26.05.2026)
- Microsoft Learn — Data, Privacy, and Security for Microsoft 365 Copilot: learn.microsoft.com (aktualizacja 09.07.2026)
- Akta sprawy The New York Times Company v. Microsoft Corporation et al., postanowienie o zabezpieczeniu logów wyjściowych: docs.justia.com