Perplexity PII-Tracer: ochrona danych osobowych na urządzeniu
Perplexity wprowadził narzędzia do wykrywania danych osobowych na urządzeniu. Dowiedz się, jak działa PII-Tracer, jakie dane chroni i co to oznacza dla Twojej…
Perplexity wprowadził specjalistyczne narzędzia do wykrywania danych osobowych bezpośrednio na urządzeniu użytkownika, bez konieczności przesyłania wrażliwych informacji do chmury. Inicjatywa ta, zaprezentowana 1 września 2026 roku, stanowi odpowiedź na rosnące obawy dotyczące bezpieczeństwa danych w erze sztucznej inteligencji.
Jak działa system wykrywania danych osobowych?
Sercem nowego podejścia jest model PII-Tracer — algorytm o pojemności 0,6 miliarda parametrów, który analizuje tekst na urządzeniu i identyfikuje wrażliwe informacje. Urządzenie pozostaje centrum przetwarzania: dane nigdy nie opuszczają komputera lub telefonu użytkownika, co eliminuje pośrednika — tradycyjny serwer w chmurze — i redukuje powierzchnię ataku.
Model został wytrenowany na zbiorze około 714 000 próbek danych, przeanalizowanych przez 3 epoki uczenia. Takie podejście pozwala systemowi rozpoznawać nie tylko proste wzorce, ale także kontekst, w którym pojawiają się dane osobowe.
Benchmark PII-TRACE: jak mierzy się dokładność?
Aby ocenić wydajność detektorów danych osobowych, Perplexity opracował benchmark PII-TRACE — zestaw testowy zawierający 13 148 syntetycznych konwersacji w 13 językach. Benchmark zawiera 37 431 wzmianek o identyfikatorach rozłożonych na 9 różnych typów danych osobowych.
Struktura testów odzwierciedla rzeczywiste scenariusze użytkowania. Prawie 41 procent konwersacji w zbiorze zawiera treści o charakterze strukturalnym — na przykład listy, tabele czy sformatowane dane. Dodatkowo, w 63,8 procent konwersacji zawierających dane osobowe identyfikator pojawia się więcej niż jeden raz, co sprawdza zdolność modelu do śledzenia powtarzających się informacji. W 28,7 procent konwersacji ten sam identyfikator rozprzestrzenia się na wiele kolejnych wymian — sytuacja, w której system musi pamiętać kontekst z wcześniejszych części dialogu.
| Parametr | Wartość |
|---|---|
| Liczba konwersacji w benchmarku | 13 148 |
| Liczby języków | 13 |
| Liczba wzmianek o identyfikatorach | 37 431 |
| Typy PII | 9 |
| Konwersacje ze strukturą | 41% |
| Identyfikatory powtarzające się | 63,8% |
| Identyfikatory w wielu turach | 28,7% |
Wydajność PII-Tracer w praktyce
Wyniki testów pokazują, że PII-Tracer osiąga wynik F1 na poziomie znaków wynoszący 0,629 — najwyższy spośród 12 porównywanych systemów. Dla porównania, GPT-5.6-sol — zaawansowany model konkurencyjny — uzyskuje niższy rezultat w tej samej metryce.
Różnica staje się jeszcze wyraźniejsza w specjalistycznych zadaniach. Gdy chodzi o wykrywanie powtarzających się identyfikatorów (te same dane osobowe pojawiające się wielokrotnie w tekście), PII-Tracer osiąga wskaźnik 79,4 procent, podczas gdy GPT-5.6-sol radzi sobie znacznie słabiej, uzyskując 57,0 procent. W przypadku identyfikatorów rozprzestrzeniających się na wiele tur konwersacji wyniki wynoszą odpowiednio 77,6 procent dla PII-Tracer i 55,1 procent dla konkurenta.
Jednak wydajność modelu zależy od długości analizowanego tekstu. Dla krótkich konwersacji — poniżej 1 000 znaków — czułość (zdolność do poprawnego zidentyfikowania danych osobowych) wynosi imponujące 0,975. Gdy tekst staje się dłuższy, przekraczając 10 000 znaków, czułość spada do 0,687. To naturalna cecha modeli opartych na transformatorach — wraz ze wzrostem długości kontekstu trudniej jest utrzymać spójność analizy.
Wsparcie dla wielu języków
Perplexity testował PII-Tracer na 13 językach, ale wyniki szczegółowe dostępne są dla czterech z nich. Niemiecki wykazuje najlepszą wydajność z wynikiem F1 na poziomie 0,735. Włoski osiąga 0,676, francuski 0,633, a rosyjski 0,651. Różnice te odzwierciedlają zarówno strukturę gramatyczną języków, jak i wielkość danych treningowych dostępnych dla każdego z nich.
Co to oznacza dla Twojej prywatności?
Lokalne przetwarzanie danych osobowych zmienia fundamentalnie sposób, w jaki możesz myśleć o bezpieczeństwie. Zamiast wysyłać rozmowy, dokumenty czy notatki na serwery Perplexity, model PII-Tracer analizuje wszystko na Twoim urządzeniu. Oznacza to, że wrażliwe informacje — numery PESEL, dane bankowe, adresy — nigdy nie trafiają do chmury i nie mogą zostać przechwycone w drodze.
Praktycznie rzecz biorąc, jeśli używasz narzędzi Perplexity do pisania e-maili, notatek lub rozmów zawierających dane osobowe, system może ostrzec Cię przed przypadkowym ujawnieniem takich informacji. Możesz też sprawdzić, czy Twoje dokumenty zawierają wrażliwe dane, zanim je udostępnisz innym osobom.
Warto pamiętać, że wydajność systemu jest najlepsza dla krótszych tekstów. Jeśli pracujesz z długimi dokumentami zawierającymi dziesiątki tysięcy znaków, model może przegapić część identyfikatorów. W takich przypadkach warto przeprowadzić dodatkową weryfikację ręczną.
Najczęstsze pytania
Co to jest PII-Tracer?
PII-Tracer to model sztucznej inteligencji o pojemności 0,6 miliarda parametrów, opracowany przez Perplexity do wykrywania danych osobowych bezpośrednio na urządzeniu użytkownika, bez przesyłania informacji na serwery.
Jakie typy danych osobowych wykrywa?
System rozpoznaje 9 typów identyfikatorów osobowych, takich jak numery PESEL, numery kart kredytowych, adresy e-mail, numery telefonów i inne wrażliwe informacje zawarte w konwersacjach.
Jak dokładny jest PII-Tracer w porównaniu z innymi systemami?
PII-Tracer osiąga wynik F1 na poziomie znaków 0,629, co jest najwyższym rezultatem spośród 12 testowanych systemów, w tym znacznie lepszym niż GPT-5.6-sol.
Czy model działa jednakowo dobrze dla wszystkich języków?
Wydajność różni się w zależności od języka — najlepiej radzi sobie z niemieckim (F1: 0,735), a niższe wyniki uzyskuje dla rosyjskiego (F1: 0,651) i francuskiego (F1: 0,633).
Dlaczego wykrywanie danych osobowych na urządzeniu jest ważne?
Przetwarzanie danych lokalnie, bez wysyłania ich na serwery, zmniejsza ryzyko wycieku informacji wrażliwych i zapewnia większą kontrolę nad swoją prywatnością.
Na podstawie: Unite.AI. Tekst opracowany redakcyjnie.