VoxMedic

Rozpoznawanie mowy po polsku dla lekarzy

Najskuteczniejszy model rozpoznawania polskiej mowy medycznej. Do 55% mniej błędów transkrypcji niż Whisper — dyktuj dokumentację medyczną szybko, dokładnie i bezpiecznie.

100% On-PremisePraca lokalnaWhisper large-v3-turbo
Zamów demo VoxMedic
NAGRYWANIE  ·  dyktowanie dokumentacji medycznej
00:18.4  |  16 kHz  |  PL
VoxMedicASR
Pacjentka lat 67 przyjęta

Opis modelu

VoxMedic to najskuteczniejszy model automatycznego rozpoznawania mowy (ASR) wyspecjalizowany w polskiej mowie medycznej. Zbudowany na bazie architektury Whisper large-v3-turbo i dostrojony na tysiącach nagrań medycznych, VoxMedic doskonale radzi sobie z terminologią kliniczną, nazwami leków i specjalistycznym słownictwem, które stanowią największy problem dla uniwersalnych systemów speech-to-text.

Wyniki mówią same za siebie: w transkrypcji nagrań medycznych VoxMedic redukuje liczbę błędów (WER) aż o 55% względem bazowego modelu Whisper — z 17,07% do zaledwie 7,64%. Co kluczowe, dzięki autorskiej recepturze treningu anti-forgetting (replay danych ogólnych, destylacja wiedzy i częściowe scalanie wag LoRA) model zachowuje pełną skuteczność na ogólnej polszczyźnie, a na nagraniach spoza domeny treningowej poprawia wynik bazowy nawet o 42%.

VoxMedic powstał z myślą o realnej pracy klinicznej: dyktowaniu epikryz i wyników badań, transkrypcji wizyt oraz automatyzacji dokumentacji medycznej. Model liczy zaledwie 0,8 mld parametrów, działa szybko nawet na pojedynczej karcie GPU i może być wdrożony w całości w infrastrukturze placówki.

Nagrania pacjentów nigdy nie opuszczają Twojej placówki

VoxMedic działa w pełni lokalnie (on-premise) na infrastrukturze Twojej organizacji. Głos lekarza i dane pacjentów nie są przesyłane do zewnętrznej chmury, co zapewnia pełną zgodność z RODO i wymogami bezpieczeństwa danych medycznych.

VoxMedic vs Whisper — porównanie transkrypcji

Ten sam opis utworzony przez dwa modele. Whisper poległ na nazwach leków — VoxMedic transkrybuje je bezbłędnie.

VoxMedicWER 7,64%
Pacjent zgłasza
Whisper large-v3-turboWER 17,07%
Pacjent zgłasza
poprawna terminologia medycznabłąd transkrypcji

Content WER na nagraniach polskiej mowy medycznej (zbiór admed, czytany przez ludzi). VoxMedic: 7,64% vs bazowy Whisper large-v3-turbo: 17,07% — o 55% mniej błędów.

Kluczowe funkcjonalności

Najwyższa skuteczność w transkrypcji medycznej
Do 55% mniej błędów transkrypcji (WER 7,64% vs 17,07%) niż bazowy Whisper large-v3-turbo na polskich nagraniach medycznych
Rozumie terminologię kliniczną
Poprawnie transkrybuje nazwy leków, jednostki chorobowe, skróty i specjalistyczne słownictwo medyczne
Bez utraty ogólnej polszczyzny
Autorska receptura anti-forgetting (replay danych, destylacja wiedzy, partial merge) zachowuje skuteczność w transkrypcji mowy ogólnej
Szybka architektura turbo
Zaledwie 0,8 mld parametrów — transkrypcja w czasie rzeczywistym nawet na pojedynczej karcie GPU
Praca w pełni lokalna
Wdrożenie on-premise w infrastrukturze placówki — nagrania nigdy nie trafiają do chmury
Łatwa integracja
REST API oraz pełna kompatybilność z ekosystemem Whisper i biblioteką transformers

Obsługiwane formaty

Dyktowanie
Dyktowanie epikryz, opisów badań i notatek klinicznych w czasie rzeczywistym
Pliki audio
Transkrypcja nagrań WAV, MP3, FLAC i innych popularnych formatów audio
Mobilne
Nagrania z dyktafonów i aplikacji mobilnych, także w trudnych warunkach akustycznych
Integracja HIS/EHR
Strumieniowanie transkrypcji bezpośrednio do systemów szpitalnych przez API

Zastosowanie

  • Dyktowanie dokumentacji medycznej — epikryzy, wywiady, opisy badań
  • Transkrypcja wizyt lekarskich i konsultacji telemedycznych
  • Automatyczne opisywanie badań obrazowych głosem (radiologia, USG)
  • Głosowe tworzenie notatek klinicznych w trakcie badania pacjenta
  • Digitalizacja archiwalnych nagrań medycznych
  • Zasilanie systemów NLP (np. MedalioNER) ustrukturyzowaną transkrypcją

Korzyści biznesowe

Mniej czasu przy klawiaturze
Lekarze poświęcają nawet 1/3 czasu pracy na dokumentację. Dyktowanie z VoxMedic skraca ten czas kilkukrotnie.
Mniej błędów w dokumentacji
Specjalizacja medyczna oznacza poprawną pisownię leków, dawek i rozpoznań — bez ręcznych poprawek.
Wyższy komfort pracy personelu
Mniej wypalenia zawodowego i więcej czasu dla pacjenta dzięki automatyzacji żmudnej dokumentacji.
Przewidywalne koszty
Model lokalny bez opłat za każdą minutę nagrania — jednorazowe wdrożenie zamiast rosnących rachunków za chmurę.

FAQ – Najczęściej zadawane pytania

Integracja przez API

Modele dostępne są jako usługa REST API lub do wdrożenia lokalnego w infrastrukturze szpitala. Zapewniamy dokumentację i wsparcie integracyjne.

voxmedic_example.sh
bash
curl -X POST https://api.medalion.tech/v1/transcribe \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "file=@nagranie_wizyty.wav" \
  -F "model=VoxMedic" \
  -F "language=pl"

# Response:
{
  "text": "Pacjentka lat 67 przyjęta na oddział
    kardiologii z powodu nasilającej się
    duszności. Włączono furosemid 40 mg
    oraz ramipril 5 mg.",
  "duration": 18.4,
  "language": "pl"
}
Zacznij już dziś

Przetestuj VoxMedic na nagraniach z Twojej placówki

Skontaktuj się z nami, aby otrzymać dostęp do API lub omówić wdrożenie on-premise.