Rozpoznawanie mowy po polsku dla lekarzy
Najskuteczniejszy model rozpoznawania polskiej mowy medycznej. Do 55% mniej błędów transkrypcji niż Whisper — dyktuj dokumentację medyczną szybko, dokładnie i bezpiecznie.
Opis modelu
VoxMedic to najskuteczniejszy model automatycznego rozpoznawania mowy (ASR) wyspecjalizowany w polskiej mowie medycznej. Zbudowany na bazie architektury Whisper large-v3-turbo i dostrojony na tysiącach nagrań medycznych, VoxMedic doskonale radzi sobie z terminologią kliniczną, nazwami leków i specjalistycznym słownictwem, które stanowią największy problem dla uniwersalnych systemów speech-to-text.
Wyniki mówią same za siebie: w transkrypcji nagrań medycznych VoxMedic redukuje liczbę błędów (WER) aż o 55% względem bazowego modelu Whisper — z 17,07% do zaledwie 7,64%. Co kluczowe, dzięki autorskiej recepturze treningu anti-forgetting (replay danych ogólnych, destylacja wiedzy i częściowe scalanie wag LoRA) model zachowuje pełną skuteczność na ogólnej polszczyźnie, a na nagraniach spoza domeny treningowej poprawia wynik bazowy nawet o 42%.
VoxMedic powstał z myślą o realnej pracy klinicznej: dyktowaniu epikryz i wyników badań, transkrypcji wizyt oraz automatyzacji dokumentacji medycznej. Model liczy zaledwie 0,8 mld parametrów, działa szybko nawet na pojedynczej karcie GPU i może być wdrożony w całości w infrastrukturze placówki.
Nagrania pacjentów nigdy nie opuszczają Twojej placówki
VoxMedic działa w pełni lokalnie (on-premise) na infrastrukturze Twojej organizacji. Głos lekarza i dane pacjentów nie są przesyłane do zewnętrznej chmury, co zapewnia pełną zgodność z RODO i wymogami bezpieczeństwa danych medycznych.
VoxMedic vs Whisper — porównanie transkrypcji
Ten sam opis utworzony przez dwa modele. Whisper poległ na nazwach leków — VoxMedic transkrybuje je bezbłędnie.
Content WER na nagraniach polskiej mowy medycznej (zbiór admed, czytany przez ludzi). VoxMedic: 7,64% vs bazowy Whisper large-v3-turbo: 17,07% — o 55% mniej błędów.
Kluczowe funkcjonalności
Obsługiwane formaty
Zastosowanie
- Dyktowanie dokumentacji medycznej — epikryzy, wywiady, opisy badań
- Transkrypcja wizyt lekarskich i konsultacji telemedycznych
- Automatyczne opisywanie badań obrazowych głosem (radiologia, USG)
- Głosowe tworzenie notatek klinicznych w trakcie badania pacjenta
- Digitalizacja archiwalnych nagrań medycznych
- Zasilanie systemów NLP (np. MedalioNER) ustrukturyzowaną transkrypcją
Korzyści biznesowe
FAQ – Najczęściej zadawane pytania
Integracja przez API
Modele dostępne są jako usługa REST API lub do wdrożenia lokalnego w infrastrukturze szpitala. Zapewniamy dokumentację i wsparcie integracyjne.
curl -X POST https://api.medalion.tech/v1/transcribe \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@nagranie_wizyty.wav" \
-F "model=VoxMedic" \
-F "language=pl"
# Response:
{
"text": "Pacjentka lat 67 przyjęta na oddział
kardiologii z powodu nasilającej się
duszności. Włączono furosemid 40 mg
oraz ramipril 5 mg.",
"duration": 18.4,
"language": "pl"
}Przetestuj VoxMedic na nagraniach z Twojej placówki
Skontaktuj się z nami, aby otrzymać dostęp do API lub omówić wdrożenie on-premise.