MiędzyNami Jak to działa Bezpieczeństwo Dla kogo FAQ Kontakt Dołącz do bety
Jak to działa

Trzy tryby przetwarzania — co dokładnie dzieje się z Twoimi danymi.

MiędzyNami zawsze nagrywa audio lokalnie, na Twoim iPhonie. To, co dzieje się dalej — gdzie powstaje transkrypcja i gdzie generowana jest notatka — zależy od wybranego trybu. Tryb wybierasz przy pierwszym uruchomieniu i możesz go zmienić w każdej chwili w Ustawieniach.

Zasada wspólna dla wszystkich trybów: samo nagranie audio nigdy nie opuszcza urządzenia w postaci niezaszyfrowanej. W trybie zdalnym audio jest wysyłane wyłącznie zaszyfrowane end-to-end; w trybie hybrydowym audio w ogóle nie opuszcza telefonu — wysyłany jest wyłącznie zanonimizowany, zaszyfrowany tekst.

W skrócie

Tabela porównawcza.

Zanim przejdziesz do szczegółów każdego trybu — zestawienie najważniejszych różnic.

LokalnyZdalny (E2E)Hybrydowy
Audio opuszcza telefon?Nie, nigdyTak, zaszyfrowaneNie
Tekst opuszcza telefon?NieTak (wynik), zaszyfrowanyTak, po anonimizacji, zaszyfrowany
Wymaga internetuNieTakTak (tylko do etapu notatki)
Transkrypcja wykonywana przezWhisper, on-deviceWhisper, na serwerzeWhisper, on-device
Notatka generowana przezBielik 1,5B–7B, on-deviceBielik 11B, na serwerzeBielik 11B, na serwerze
Orientacyjny czas notatki po sesjiok. 2–3 minok. 30–60 spośredni
Statusprodukcyjnyprodukcyjnyoznaczony w aplikacji jako eksperymentalny

Wariant modelu językowego dobierany jest do miejsca przetwarzania: on-device na iPhonie działa mniejszy Bielik (1,5–7 mld parametrów, dopasowany automatycznie do możliwości telefonu), a na serwerze — większy Bielik 11B.

Tryb 1 — Lokalny (on-device)

Cały model, w całości na Twoim iPhonie.

To domyślny i najbardziej rygorystyczny prywatnościowo tryb pracy.

Krok po kroku

  1. Nagrywasz sesję — audio zapisywane jest lokalnie w fragmentach po ok. 15 minut (co pozwala zacząć przetwarzanie fragmentu, zanim skończysz całą sesję, i bezpiecznie wznowić pracę po przerwaniu).
  2. Po zamknięciu fragmentu, na urządzeniu uruchamia się Whisper (rozpoznawanie mowy działające na Neural Engine Apple) i zamienia audio na tekst.
  3. Transkrypcja trafia do Bielika — polskiego modelu językowego (Speakleash), również działającego lokalnie (na GPU telefonu przez llama.cpp) — który tworzy zwięzłe streszczenie fragmentu.
  4. Po zakończeniu sesji streszczenia wszystkich fragmentów są łączone w jedną notatkę kliniczną z sekcjami (m.in. główne tematy, stan emocjonalny, interwencje terapeutyczne, plan na kolejną sesję).
  5. Notatka i transkrypcja zostają zapisane lokalnie na urządzeniu, zaszyfrowane mechanizmem ochrony danych Apple i wykluczone z automatycznych kopii zapasowych iCloud.

Czego wymaga: iPhone 12 lub nowszy, ok. 5 GB wolnego miejsca na modele (pobierane jednorazowo), brak wymogu stałego połączenia internetowego po instalacji modeli.

Co jeśli telefon się przegrzeje albo przerwiesz pracę? Przetwarzanie można zatrzymać i wznowić później — nic z tego, co już zostało przetworzone, nie ginie.

Tryb 2 — Zdalny (End-to-End Encrypted)

Moc serwera, prywatność Twojego iPhone'a.

Dla osób, które chcą szybszego przetwarzania i nie chcą, by telefon dźwigał cały model językowy — przy zachowaniu szyfrowania na całej trasie.

Krok po kroku

  1. Audio nagrywane jest lokalnie, tak samo jak w trybie lokalnym.
  2. Na urządzeniu generowany jest klucz szyfrujący dla danej sesji (protokół X25519 do uzgodnienia klucza, AES-GCM do szyfrowania danych). Audio jest szyfrowane tym kluczem, zanim opuści telefon.
  3. Zaszyfrowany strumień trafia przez połączenie TLS do serwera przetwarzającego. Serwer widzi wyłącznie zaszyfrowane dane — nie ma dostępu do treści audio w postaci jawnej bez odpowiedniego klucza.
  4. Po stronie serwera odbywa się transkrypcja i generowanie notatki, po czym wynik jest szyfrowany kluczem publicznym Twojego urządzenia i odsyłany z powrotem — odszyfrować go może wyłącznie Twój telefon.
  5. Tryb wymaga jednorazowego enrollmentu urządzenia (parowanie przez kod QR), które ustanawia zaufaną tożsamość Twojego iPhone'a wobec serwera (Trust On First Use) — dzięki temu przypadkowy lub złośliwy serwer nie może podszyć się pod właściwy backend.
  6. Dostęp do aplikacji w tym trybie wymaga Face ID przy każdym uruchomieniu.

Co widzi operator infrastruktury: metadane sesji (czas trwania, status) oraz zaszyfrowany strumień danych — nigdy treść w postaci jawnej. Więcej na stronie Bezpieczeństwo.

Tryb 3 — Hybrydowy

Transkrypcja zostaje na telefonie, do serwera trafia wyłącznie oczyszczony tekst.

Tryb pośredni — dla osób, które chcą jakości większego modelu przy generowaniu notatki, ale wolą, by samo audio nigdy nie opuszczało urządzenia.

Krok po kroku

  1. Nagrywanie i transkrypcja (Whisper) odbywają się lokalnie — identycznie jak w trybie lokalnym. Audio nie opuszcza telefonu.
  2. Zanim tekst transkrypcji zostanie wysłany dalej, przechodzi przez PII Redactor — mechanizm rozpoznający i zastępujący placeholderami typowe dane identyfikujące: imiona (z listy ok. 200 najpopularniejszych polskich imion), adresy e-mail, numery telefonów, numery PESEL.
  3. Dopiero zanonimizowany tekst jest szyfrowany (tą samą metodą co w trybie zdalnym: X25519 + AES-GCM) i wysyłany do serwera w celu wygenerowania notatki większym modelem językowym (Bielik 11B).
  4. Notatka wraca zaszyfrowana i zostaje zapisana lokalnie.

Ważne ograniczenie, które podajemy wprost: PII Redactor to mechanizm heurystyczny — rozpoznaje wzorce (listę imion, formaty numerów), a nie znaczenie wypowiedzi. Nie gwarantuje pełnej anonimizacji — kontekst wypowiedzi (np. opisana sytuacja życiowa) może w dalszym ciągu pozwalać na pośrednią identyfikację osoby. Z tego powodu aplikacja oznacza ten tryb jako eksperymentalny/testowy i wyświetla stosowne ostrzeżenie przed jego włączeniem. Jeśli standard anonimizacji ma dla Ciebie krytyczne znaczenie, zalecamy tryb lokalny.

Dla ciekawych szczegółów technicznych

Co dzieje się z modelami AI.

Jakie modele stoją za rozpoznawaniem mowy i notatką?

Whisper — model rozpoznawania mowy (large-v3-turbo, wariant skwantyzowany do ok. 1 GB), używany zarówno on-device, jak i po stronie serwera w trybie zdalnym.

Bielik — polski model językowy trenowany przez Speakleash. Wariant zależy od miejsca przetwarzania: on-device na iPhonie działa mniejszy wariant (od 1,5 do 7 mld parametrów, dobierany automatycznie do możliwości telefonu), a na serwerze — większy wariant, Bielik 11B. Wybrany zamiast modeli anglojęzycznych (Llama, Mistral) ze względu na jakość polskiej terminologii klinicznej i naturalność języka notatek.

Notatka może być generowana w kilku układach (m.in. strukturalny, SOAP, narracyjny, CBT) — wybór szablonu należy do terapeuty w Ustawieniach.

Whisper large-v3-turboBielik 1,5B–7B on-deviceBielik 11B na serwerze
Uczciwe porównanie

MiędzyNami a inne sposoby robienia notatek.

Bez owijania w bawełnę — jak MiędzyNami wypada obok metod, z których korzysta dziś większość praktyków.

MiędzyNamiNotatki papieroweDyktafon + ręczne spisywanieOgólne apki do transkrypcji
Prywatność / RODOProjektowane pod dane szczególnej kategorii (Art. 9 RODO); opcja pracy w całości on-deviceZależy wyłącznie od fizycznego przechowywania dokumentów przez terapeutęNagranie zwykle nieszyfrowane; bezpieczeństwo zależy od dyscypliny użytkownikaZwykle chmura ogólnego przeznaczenia, rzadko projektowana pod dane zdrowotne
CzasNotatka gotowa automatycznie po sesji (patrz tabela wyżej)Czas ręcznego pisania w trakcie lub tuż po sesjiDodatkowy czas na odsłuchanie i ręczne przepisanie nagraniaSzybka transkrypcja, ale bez gotowej struktury klinicznej — trzeba ją dopisać ręcznie
Język polskiModel dobrany pod polską terminologię kliniczną (Bielik)Nie dotyczyNie dotyczy — zależy od terapeutyJakość rozpoznawania polskiego bywa różna, zależnie od dostawcy
Dopasowanie do sesjiStruktura notatki dopasowana do kontekstu terapeutycznego (SOAP / strukturalny / narracyjny / CBT)W pełni zależne od terapeutyBrak automatycznej strukturyGeneryczna transkrypcja, bez sekcji klinicznych
Wprost

Czego MiędzyNami (jeszcze) nie robi / o czym warto wiedzieć.

  • AI może się pomylić — notatka wygenerowana przez model językowy to szkic do weryfikacji, nie gotowy dokument. Terapeuta zawsze czyta, poprawia i ponosi odpowiedzialność za treść dokumentacji.
  • PII Redactor to heurystyka, nie gwarancja — w trybie hybrydowym rozpoznaje wzorce (imiona, e-maile, numery), a nie znaczenie wypowiedzi. Kontekst opowiadanej sytuacji może nadal pozwalać na pośrednią identyfikację.
  • Tryb hybrydowy jest eksperymentalny — oznaczony w aplikacji jako testowy, z wyraźnym ostrzeżeniem przed włączeniem.
  • Aplikacja działa tylko na iOS — nie ma wersji na Androida ani desktop.
  • Jesteśmy w fazie zamkniętej bety — funkcje, wydajność i zakres testerów mogą się jeszcze zmieniać przed premierą.
  • Nie diagnozuje pacjenta i nie wyciąga wniosków klinicznych poza tym, co zostało powiedziane na sesji.
  • Nie zapisuje automatycznie danych identyfikacyjnych pacjenta w treści notatki — to decyzja i praktyka terapeuty.
  • Nie udostępnia i nie sprzedaje danych nikomu poza rolą operatora infrastruktury opisaną w polityce prywatności.
  • Nie wykorzystuje treści sesji do trenowania własnych modeli.
Zamknięta beta

Przetestuj MiędzyNami przed premierą.

Dołącz do wąskiego grona testerów. Zapraszamy imiennie — napisz, a odezwiemy się z linkiem do TestFlight.