Anonimizacja dokumentów medycznych
Specjalistyczny model AI do automatycznej identyfikacji i anonimizacji danych osobowych w dowolnych tekstach polskojęzycznych. Rozumie kontekst, odróżnia dane osobowe od nazw medycznych i działa w 100% on-premise.

Opis modelu
AnonimiNER to specjalistyczny model sztucznej inteligencji oparty na technologii NER (Named Entity Recognition), zaprojektowany do automatycznej identyfikacji i anonimizacji danych osobowych w dowolnych tekstach polskojęzycznych. Model wykrywa imiona, nazwiska, numery PESEL, adresy, numery telefonów i inne dane wrażliwe – niezależnie od tego, czy przetwarzasz dokumentację medyczną, akta sądowe, protokoły HR czy transkrypcje rozmów z klientami.
W przeciwieństwie do tradycyjnych narzędzi opartych na sztywnych regułach i wyrażeniach regularnych, AnonimiNER rozumie kontekst zdania i na tej podstawie decyduje, czy dane słowo jest daną osobową. Model wie, że "pacjent Kowalski" to dane do anonimizacji, ale "choroba Parkinsona" czy "zespół Aspergera" to nazwy medyczne, które powinny pozostać nienaruszone. Potrafi też odróżnić numer PESEL od numeru faktury czy referencji przelewu, mimo że wszystkie to ciągi cyfr – bo analizuje znaczenie, nie tylko wzorzec. Rozpoznaje również dane osobowe w każdej formie gramatycznej – "Kowalski", "Kowalskiego", "Kowalskiemu" – bez konieczności definiowania osobnych reguł dla każdej odmiany. Dzięki temu zanonimizowane dokumenty pozostają czytelne i wolne od błędów, które plagują rozwiązania oparte na prostym dopasowywaniu wzorców.
AnonimiNER to model klasy Small Language Model – wystarczająco inteligentny, by rozumieć niuanse języka, a jednocześnie na tyle lekki, że działa szybko na standardowym sprzęcie serwerowym bez potrzeby kosztownej infrastruktury GPU. Przetwarzanie dokumentu zajmuje milisekundy, co pozwala na anonimizację tysięcy plików w trybie wsadowym.
Dzięki wdrożeniu on-premise dane nigdy nie opuszczają Twojej infrastruktury, co zapewnia pełną zgodność z RODO i eliminuje ryzyko wycieku informacji.
Czułość 94,92% - niemal każda dana osobowa wykryta
W benchmarku strict recall AnonimiNER wyniósł 94,92% (vs 49,44% dla Presidio). Oznacza to, że model pomija zaledwie ~5% danych osobowych, podczas gdy Presidio traci ponad połowę. W przypadku PESEL i numerów telefonów czułość wynosi 100%.
Rozpoznawane dane osobowe
Metody anonimizacji
AnonimiNER vs Presidio
Niezależny benchmark na 200 przypadków klinicznych · luty 2026
Czułość (Recall) - ile danych osobowych zostało wykrytych
Każdy niewykryty element to potencjalny wyciek PII
Skuteczność dla poszczególnych typów danych
| Typ danych | AnonimiNER | |
|---|---|---|
| Recall | F1 | |
| Imiona i nazwiska | 95.34% | 83.96% |
| Numery PESEL | 100.00% | 100.00% |
| Numery telefonów | 100.00% | 99.22% |
| Adresy zamieszkania * | 87.70% | 84.25% |
| Adresy email | 97.96% | 98.97% |
* Presidio wykrywa fragmenty adresu (wysoki recall), ale nie dopasowuje pełnych spanów (niski F1).
Dlaczego to ważne
- •Strict Recall 94,92% - AnonimiNER pomija zaledwie ~5% danych osobowych. Presidio traci ponad połowę (recall 49,44%).
- •PESEL: 100% recall vs 25,81% dla Presidio. Telefony: 100% vs 20,31%. Presidio gubi 3 na 4 numery PESEL i 4 na 5 telefonów.
- •Wysoki recall przy wysokim F1 (90,20%) oznacza, że model nie tylko znajduje dane, ale też precyzyjnie dopasowuje ich granice.
Zastosowania w systemach DLP (Data Loss Prevention)
AnonimiNER stanowi kluczowy element strategii zapobiegania utracie danych (DLP) w organizacjach przetwarzających dane osobowe. W przeciwieństwie do tradycyjnych systemów DLP, które jedynie blokują przesyłanie wrażliwych informacji, AnonimiNER umożliwia bezpieczne wykorzystanie danych poprzez ich automatyczną anonimizację.
Jak AnonimiNER wspiera strategię DLP:
Warstwa ochronna przed AI
AnonimiNER działa jako warstwa ochronna między Twoimi danymi a zewnętrznymi systemami AI:
Pacjent Jan Kowalski, PESEL 80010112345, zamieszkały ul. Zielona 12, Warszawa, tel. 123-456-789 zgłosił się na wizytę kontrolną z powodu nadciśnienia tętniczego.
Pacjent [OSOBA], PESEL [PESEL], zamieszkały [ADRES], tel. [TELEFON] zgłosił się na wizytę kontrolną z powodu nadciśnienia tętniczego.
Typowe przypadki:
- •Podsumowywanie dokumentów przez LLM bez ujawniania danych osobowych
- •Tłumaczenie dokumentów z danymi wrażliwymi
- •Generowanie raportów na podstawie zanonimizowanych źródeł
- •Analiza sentymentu opinii klientów/pracowników
- •Ekstrakcja informacji z dokumentów (bez zachowywania PII w zewnętrznym systemie)
Korzyści biznesowe
FAQ – Najczęściej zadawane pytania
Integracja przez API
Modele dostępne są jako usługa REST API lub do wdrożenia lokalnego w infrastrukturze szpitala. Zapewniamy dokumentację i wsparcie integracyjne.
curl -X POST https://api.medalion.tech/v1/anonymize \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Pacjent Jan Kowalski, PESEL: 80010112345, tel: 123-456-789",
"method": "mask",
"entities": ["PERSON", "PESEL", "PHONE"]
}'Anonimizacja, DLP, audyt zgodności - jedno narzędzie
AnonimiNER sprawdza się w anonimizacji dokumentacji medycznej, zapobieganiu wyciekom danych (DLP), audytach RODO i bezpiecznym udostępnianiu datasetów do analiz i treningu AI. Wdrożenie on-premise lub API.