Trzy tryby przetwarzania — co dokładnie dzieje się z Twoimi danymi.
MiędzyNami zawsze nagrywa audio lokalnie, na Twoim iPhonie. To, co dzieje się dalej — gdzie powstaje transkrypcja i gdzie generowana jest notatka — zależy od wybranego trybu. Tryb wybierasz przy pierwszym uruchomieniu i możesz go zmienić w każdej chwili w Ustawieniach.
Zasada wspólna dla wszystkich trybów: samo nagranie audio nigdy nie opuszcza urządzenia w postaci niezaszyfrowanej. W trybie zdalnym audio jest wysyłane wyłącznie zaszyfrowane end-to-end; w trybie hybrydowym audio w ogóle nie opuszcza telefonu — wysyłany jest wyłącznie zanonimizowany, zaszyfrowany tekst.
Tabela porównawcza.
Zanim przejdziesz do szczegółów każdego trybu — zestawienie najważniejszych różnic.
| Lokalny | Zdalny (E2E) | Hybrydowy | |
|---|---|---|---|
| Audio opuszcza telefon? | Nie, nigdy | Tak, zaszyfrowane | Nie |
| Tekst opuszcza telefon? | Nie | Tak (wynik), zaszyfrowany | Tak, po anonimizacji, zaszyfrowany |
| Wymaga internetu | Nie | Tak | Tak (tylko do etapu notatki) |
| Transkrypcja wykonywana przez | Whisper, on-device | Whisper, na serwerze | Whisper, on-device |
| Notatka generowana przez | Bielik 1,5B–7B, on-device | Bielik 11B, na serwerze | Bielik 11B, na serwerze |
| Orientacyjny czas notatki po sesji | ok. 2–3 min | ok. 30–60 s | pośredni |
| Status | produkcyjny | produkcyjny | oznaczony w aplikacji jako eksperymentalny |
Wariant modelu językowego dobierany jest do miejsca przetwarzania: on-device na iPhonie działa mniejszy Bielik (1,5–7 mld parametrów, dopasowany automatycznie do możliwości telefonu), a na serwerze — większy Bielik 11B.
Cały model, w całości na Twoim iPhonie.
To domyślny i najbardziej rygorystyczny prywatnościowo tryb pracy.
Krok po kroku
- Nagrywasz sesję — audio zapisywane jest lokalnie w fragmentach po ok. 15 minut (co pozwala zacząć przetwarzanie fragmentu, zanim skończysz całą sesję, i bezpiecznie wznowić pracę po przerwaniu).
- Po zamknięciu fragmentu, na urządzeniu uruchamia się Whisper (rozpoznawanie mowy działające na Neural Engine Apple) i zamienia audio na tekst.
- Transkrypcja trafia do Bielika — polskiego modelu językowego (Speakleash), również działającego lokalnie (na GPU telefonu przez
llama.cpp) — który tworzy zwięzłe streszczenie fragmentu. - Po zakończeniu sesji streszczenia wszystkich fragmentów są łączone w jedną notatkę kliniczną z sekcjami (m.in. główne tematy, stan emocjonalny, interwencje terapeutyczne, plan na kolejną sesję).
- Notatka i transkrypcja zostają zapisane lokalnie na urządzeniu, zaszyfrowane mechanizmem ochrony danych Apple i wykluczone z automatycznych kopii zapasowych iCloud.
Czego wymaga: iPhone 12 lub nowszy, ok. 5 GB wolnego miejsca na modele (pobierane jednorazowo), brak wymogu stałego połączenia internetowego po instalacji modeli.
Co jeśli telefon się przegrzeje albo przerwiesz pracę? Przetwarzanie można zatrzymać i wznowić później — nic z tego, co już zostało przetworzone, nie ginie.
Moc serwera, prywatność Twojego iPhone'a.
Dla osób, które chcą szybszego przetwarzania i nie chcą, by telefon dźwigał cały model językowy — przy zachowaniu szyfrowania na całej trasie.
Krok po kroku
- Audio nagrywane jest lokalnie, tak samo jak w trybie lokalnym.
- Na urządzeniu generowany jest klucz szyfrujący dla danej sesji (protokół X25519 do uzgodnienia klucza, AES-GCM do szyfrowania danych). Audio jest szyfrowane tym kluczem, zanim opuści telefon.
- Zaszyfrowany strumień trafia przez połączenie TLS do serwera przetwarzającego. Serwer widzi wyłącznie zaszyfrowane dane — nie ma dostępu do treści audio w postaci jawnej bez odpowiedniego klucza.
- Po stronie serwera odbywa się transkrypcja i generowanie notatki, po czym wynik jest szyfrowany kluczem publicznym Twojego urządzenia i odsyłany z powrotem — odszyfrować go może wyłącznie Twój telefon.
- Tryb wymaga jednorazowego enrollmentu urządzenia (parowanie przez kod QR), które ustanawia zaufaną tożsamość Twojego iPhone'a wobec serwera (Trust On First Use) — dzięki temu przypadkowy lub złośliwy serwer nie może podszyć się pod właściwy backend.
- Dostęp do aplikacji w tym trybie wymaga Face ID przy każdym uruchomieniu.
Co widzi operator infrastruktury: metadane sesji (czas trwania, status) oraz zaszyfrowany strumień danych — nigdy treść w postaci jawnej. Więcej na stronie Bezpieczeństwo.
Transkrypcja zostaje na telefonie, do serwera trafia wyłącznie oczyszczony tekst.
Tryb pośredni — dla osób, które chcą jakości większego modelu przy generowaniu notatki, ale wolą, by samo audio nigdy nie opuszczało urządzenia.
Krok po kroku
- Nagrywanie i transkrypcja (Whisper) odbywają się lokalnie — identycznie jak w trybie lokalnym. Audio nie opuszcza telefonu.
- Zanim tekst transkrypcji zostanie wysłany dalej, przechodzi przez PII Redactor — mechanizm rozpoznający i zastępujący placeholderami typowe dane identyfikujące: imiona (z listy ok. 200 najpopularniejszych polskich imion), adresy e-mail, numery telefonów, numery PESEL.
- Dopiero zanonimizowany tekst jest szyfrowany (tą samą metodą co w trybie zdalnym: X25519 + AES-GCM) i wysyłany do serwera w celu wygenerowania notatki większym modelem językowym (Bielik 11B).
- Notatka wraca zaszyfrowana i zostaje zapisana lokalnie.
Ważne ograniczenie, które podajemy wprost: PII Redactor to mechanizm heurystyczny — rozpoznaje wzorce (listę imion, formaty numerów), a nie znaczenie wypowiedzi. Nie gwarantuje pełnej anonimizacji — kontekst wypowiedzi (np. opisana sytuacja życiowa) może w dalszym ciągu pozwalać na pośrednią identyfikację osoby. Z tego powodu aplikacja oznacza ten tryb jako eksperymentalny/testowy i wyświetla stosowne ostrzeżenie przed jego włączeniem. Jeśli standard anonimizacji ma dla Ciebie krytyczne znaczenie, zalecamy tryb lokalny.
Co dzieje się z modelami AI.
Jakie modele stoją za rozpoznawaniem mowy i notatką?
Whisper — model rozpoznawania mowy (large-v3-turbo, wariant skwantyzowany do ok. 1 GB), używany zarówno on-device, jak i po stronie serwera w trybie zdalnym.
Bielik — polski model językowy trenowany przez Speakleash. Wariant zależy od miejsca przetwarzania: on-device na iPhonie działa mniejszy wariant (od 1,5 do 7 mld parametrów, dobierany automatycznie do możliwości telefonu), a na serwerze — większy wariant, Bielik 11B. Wybrany zamiast modeli anglojęzycznych (Llama, Mistral) ze względu na jakość polskiej terminologii klinicznej i naturalność języka notatek.
Notatka może być generowana w kilku układach (m.in. strukturalny, SOAP, narracyjny, CBT) — wybór szablonu należy do terapeuty w Ustawieniach.
MiędzyNami a inne sposoby robienia notatek.
Bez owijania w bawełnę — jak MiędzyNami wypada obok metod, z których korzysta dziś większość praktyków.
| MiędzyNami | Notatki papierowe | Dyktafon + ręczne spisywanie | Ogólne apki do transkrypcji | |
|---|---|---|---|---|
| Prywatność / RODO | Projektowane pod dane szczególnej kategorii (Art. 9 RODO); opcja pracy w całości on-device | Zależy wyłącznie od fizycznego przechowywania dokumentów przez terapeutę | Nagranie zwykle nieszyfrowane; bezpieczeństwo zależy od dyscypliny użytkownika | Zwykle chmura ogólnego przeznaczenia, rzadko projektowana pod dane zdrowotne |
| Czas | Notatka gotowa automatycznie po sesji (patrz tabela wyżej) | Czas ręcznego pisania w trakcie lub tuż po sesji | Dodatkowy czas na odsłuchanie i ręczne przepisanie nagrania | Szybka transkrypcja, ale bez gotowej struktury klinicznej — trzeba ją dopisać ręcznie |
| Język polski | Model dobrany pod polską terminologię kliniczną (Bielik) | Nie dotyczy | Nie dotyczy — zależy od terapeuty | Jakość rozpoznawania polskiego bywa różna, zależnie od dostawcy |
| Dopasowanie do sesji | Struktura notatki dopasowana do kontekstu terapeutycznego (SOAP / strukturalny / narracyjny / CBT) | W pełni zależne od terapeuty | Brak automatycznej struktury | Generyczna transkrypcja, bez sekcji klinicznych |
Czego MiędzyNami (jeszcze) nie robi / o czym warto wiedzieć.
- AI może się pomylić — notatka wygenerowana przez model językowy to szkic do weryfikacji, nie gotowy dokument. Terapeuta zawsze czyta, poprawia i ponosi odpowiedzialność za treść dokumentacji.
- PII Redactor to heurystyka, nie gwarancja — w trybie hybrydowym rozpoznaje wzorce (imiona, e-maile, numery), a nie znaczenie wypowiedzi. Kontekst opowiadanej sytuacji może nadal pozwalać na pośrednią identyfikację.
- Tryb hybrydowy jest eksperymentalny — oznaczony w aplikacji jako testowy, z wyraźnym ostrzeżeniem przed włączeniem.
- Aplikacja działa tylko na iOS — nie ma wersji na Androida ani desktop.
- Jesteśmy w fazie zamkniętej bety — funkcje, wydajność i zakres testerów mogą się jeszcze zmieniać przed premierą.
- Nie diagnozuje pacjenta i nie wyciąga wniosków klinicznych poza tym, co zostało powiedziane na sesji.
- Nie zapisuje automatycznie danych identyfikacyjnych pacjenta w treści notatki — to decyzja i praktyka terapeuty.
- Nie udostępnia i nie sprzedaje danych nikomu poza rolą operatora infrastruktury opisaną w polityce prywatności.
- Nie wykorzystuje treści sesji do trenowania własnych modeli.
Przetestuj MiędzyNami przed premierą.
Dołącz do wąskiego grona testerów. Zapraszamy imiennie — napisz, a odezwiemy się z linkiem do TestFlight.