AnonimiNER

Anonimizacja dokumentów medycznych

Specjalistyczny model AI do automatycznej identyfikacji i anonimizacji danych osobowych w dowolnych tekstach polskojęzycznych. Rozumie kontekst, odróżnia dane osobowe od nazw medycznych i działa w 100% on-premise.

Wykrywalność 97,46%100% On-PremiseRODO2x lepszy niż Presidio
Przetestuj na swoich danych
AnonimiNER preview

Opis modelu

AnonimiNER to specjalistyczny model sztucznej inteligencji oparty na technologii NER (Named Entity Recognition), zaprojektowany do automatycznej identyfikacji i anonimizacji danych osobowych w dowolnych tekstach polskojęzycznych. Model wykrywa imiona, nazwiska, numery PESEL, adresy, numery telefonów i inne dane wrażliwe – niezależnie od tego, czy przetwarzasz dokumentację medyczną, akta sądowe, protokoły HR czy transkrypcje rozmów z klientami.

W przeciwieństwie do tradycyjnych narzędzi opartych na sztywnych regułach i wyrażeniach regularnych, AnonimiNER rozumie kontekst zdania i na tej podstawie decyduje, czy dane słowo jest daną osobową. Model wie, że "pacjent Kowalski" to dane do anonimizacji, ale "choroba Parkinsona" czy "zespół Aspergera" to nazwy medyczne, które powinny pozostać nienaruszone. Potrafi też odróżnić numer PESEL od numeru faktury czy referencji przelewu, mimo że wszystkie to ciągi cyfr – bo analizuje znaczenie, nie tylko wzorzec. Rozpoznaje również dane osobowe w każdej formie gramatycznej – "Kowalski", "Kowalskiego", "Kowalskiemu" – bez konieczności definiowania osobnych reguł dla każdej odmiany. Dzięki temu zanonimizowane dokumenty pozostają czytelne i wolne od błędów, które plagują rozwiązania oparte na prostym dopasowywaniu wzorców.

AnonimiNER to model klasy Small Language Model – wystarczająco inteligentny, by rozumieć niuanse języka, a jednocześnie na tyle lekki, że działa szybko na standardowym sprzęcie serwerowym bez potrzeby kosztownej infrastruktury GPU. Przetwarzanie dokumentu zajmuje milisekundy, co pozwala na anonimizację tysięcy plików w trybie wsadowym.

Dzięki wdrożeniu on-premise dane nigdy nie opuszczają Twojej infrastruktury, co zapewnia pełną zgodność z RODO i eliminuje ryzyko wycieku informacji.

Czułość 94,92% - niemal każda dana osobowa wykryta

W benchmarku strict recall AnonimiNER wyniósł 94,92% (vs 49,44% dla Presidio). Oznacza to, że model pomija zaledwie ~5% danych osobowych, podczas gdy Presidio traci ponad połowę. W przypadku PESEL i numerów telefonów czułość wynosi 100%.

Rozpoznawane dane osobowe

Imiona i nazwiska
Recall 95,34% - rozpoznaje polskie imiona, nazwiska i ich odmiany
Numery PESEL
100% czułości - każdy PESEL wykryty (Presidio gubi 3 na 4)
Numery telefonów
100% czułości - polskie formaty stacjonarne i komórkowe (Presidio gubi 4 na 5)
Adresy zamieszkania
Recall 87,70% - pełne adresy z ulicą, numerem i miastem
Adresy email
Recall 97,96% - porównywalna skuteczność z Presidio
Jednostki medyczne
Nazwy szpitali, oddziałów i klinik - dane umożliwiające identyfikację

Metody anonimizacji

Maskowanie
Zastąpienie danych znakami specjalnymi (***)
Pseudonimizacja
Zastąpienie rzeczywistych danych pseudonimami
Usunięcie
Całkowite usunięcie wrażliwych informacji
Generalizacja
Zamiana szczegółów na ogólne kategorie

AnonimiNER vs Presidio

Niezależny benchmark na 200 przypadków klinicznych · luty 2026

Ponad 2x lepsza skuteczność

Czułość (Recall) - ile danych osobowych zostało wykrytych

Każdy niewykryty element to potencjalny wyciek PII

Strict
AnonimiNER
94.92%
Presidio
49.44%
Partial
AnonimiNER
96.19%
Presidio
60.17%
EntType
AnonimiNER
97.18%
Presidio
69.49%

Skuteczność dla poszczególnych typów danych

Typ danychAnonimiNER
RecallF1
Imiona i nazwiska95.34%83.96%
Numery PESEL100.00%100.00%
Numery telefonów100.00%99.22%
Adresy zamieszkania *87.70%84.25%
Adresy email97.96%98.97%

* Presidio wykrywa fragmenty adresu (wysoki recall), ale nie dopasowuje pełnych spanów (niski F1).

Ogólny Strict F1: 90.20% vs 43.75%

Dlaczego to ważne

  • Strict Recall 94,92% - AnonimiNER pomija zaledwie ~5% danych osobowych. Presidio traci ponad połowę (recall 49,44%).
  • PESEL: 100% recall vs 25,81% dla Presidio. Telefony: 100% vs 20,31%. Presidio gubi 3 na 4 numery PESEL i 4 na 5 telefonów.
  • Wysoki recall przy wysokim F1 (90,20%) oznacza, że model nie tylko znajduje dane, ale też precyzyjnie dopasowuje ich granice.

Zastosowania w systemach DLP (Data Loss Prevention)

AnonimiNER stanowi kluczowy element strategii zapobiegania utracie danych (DLP) w organizacjach przetwarzających dane osobowe. W przeciwieństwie do tradycyjnych systemów DLP, które jedynie blokują przesyłanie wrażliwych informacji, AnonimiNER umożliwia bezpieczne wykorzystanie danych poprzez ich automatyczną anonimizację.

Jak AnonimiNER wspiera strategię DLP:

Identyfikacja danych wrażliwych w czasie rzeczywistym
Model automatycznie wykrywa i klasyfikuje dane osobowe w dokumentach tekstowych: imiona i nazwiska, numery PESEL, NIP, adresy, numery telefonów, adresy e-mail oraz inne identyfikatory.
Bezpieczne udostępnianie dokumentów
Dzięki anonimizacji dokumenty mogą być bezpiecznie przekazywane zewnętrznym podmiotom, wysyłane do systemów chmurowych lub wykorzystywane w analizach – bez naruszania prywatności osób, których dotyczą.
Prewencja zamiast blokady
Tradycyjne systemy DLP często blokują przepływ informacji całkowicie, co utrudnia pracę. AnonimiNER pozwala na kontynuację procesów biznesowych przy jednoczesnym zachowaniu najwyższych standardów ochrony danych.
Warstwa ochronna przed AI
Coraz więcej firm korzysta z zewnętrznych modeli AI (ChatGPT, Claude, Copilot). AnonimiNER działa jako "bramka bezpieczeństwa" – anonimizuje dane zanim trafią do zewnętrznego API.

Warstwa ochronna przed AI

AnonimiNER działa jako warstwa ochronna między Twoimi danymi a zewnętrznymi systemami AI:

Twoje dane
zawierają PII
AnonimiNER
anonimizacja PII
ChatGPT
Claude
Copilot
Gemini
Przed anonimizacją

Pacjent Jan Kowalski, PESEL 80010112345, zamieszkały ul. Zielona 12, Warszawa, tel. 123-456-789 zgłosił się na wizytę kontrolną z powodu nadciśnienia tętniczego.

Nie wysyłaj do zewnętrznego AI
Po anonimizacji

Pacjent [OSOBA], PESEL [PESEL], zamieszkały [ADRES], tel. [TELEFON] zgłosił się na wizytę kontrolną z powodu nadciśnienia tętniczego.

Bezpieczne do wysłania do ChatGPT, Claude, Copilot

Typowe przypadki:

  • Podsumowywanie dokumentów przez LLM bez ujawniania danych osobowych
  • Tłumaczenie dokumentów z danymi wrażliwymi
  • Generowanie raportów na podstawie zanonimizowanych źródeł
  • Analiza sentymentu opinii klientów/pracowników
  • Ekstrakcja informacji z dokumentów (bez zachowywania PII w zewnętrznym systemie)

Korzyści biznesowe

Redukcja ryzyka finansowego
Naruszenia RODO mogą skutkować karami do 20 milionów euro lub 4% rocznego obrotu. AnonimiNER minimalizuje to ryzyko.
Zwiększenie produktywności
Ręczna anonimizacja dokumentu zajmuje od kilku minut do godzin. AnonimiNER przetwarza tekst w milisekundach.
Odblokowanie potencjału danych
Zanonimizowane dane mogą być bezpiecznie wykorzystywane w analizach, badaniach i projektach AI – bez barier prawnych.
Bezpieczne korzystanie z AI
Możesz używać ChatGPT, Claude czy innych narzędzi AI do analizy firmowych dokumentów – bez ryzyka wycieku danych do zewnętrznych serwerów.
Zgodność z regulacjami
Model wspiera zgodność z: RODO/GDPR, NIS2, ustawą o ochronie danych osobowych, ISO 27001, PCI DSS, HIPAA (dla sektora medycznego).

FAQ – Najczęściej zadawane pytania

Integracja przez API

Modele dostępne są jako usługa REST API lub do wdrożenia lokalnego w infrastrukturze szpitala. Zapewniamy dokumentację i wsparcie integracyjne.

anoniminer_example.sh
bash
curl -X POST https://api.medalion.tech/v1/anonymize \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Pacjent Jan Kowalski, PESEL: 80010112345, tel: 123-456-789",
    "method": "mask",
    "entities": ["PERSON", "PESEL", "PHONE"]
  }'
Zacznij już dziś

Anonimizacja, DLP, audyt zgodności - jedno narzędzie

AnonimiNER sprawdza się w anonimizacji dokumentacji medycznej, zapobieganiu wyciekom danych (DLP), audytach RODO i bezpiecznym udostępnianiu datasetów do analiz i treningu AI. Wdrożenie on-premise lub API.