W maju 2026 roku świat obiegła informacja, że sztuczna inteligencja została wykorzystana do odtworzenia głosów zmarłych pilotów na podstawie archiwalnych nagrań z kabin i komunikacji radiowej. Projekt, opisany przez TechCrunch, miał na celu rekonstrukcję przebiegu wypadków lotniczych - ale natychmiast wywołał dyskusję wykraczającą daleko poza branżę lotniczą. Jeśli AI potrafi wiernie odtworzyć głos konkretnej osoby z kilku minut nagrań, co to oznacza dla bezpieczeństwa Twojej firmy?
To nie jest pytanie teoretyczne. Technologie klonowania głosu - takie jak ElevenLabs, Resemble AI czy VALL-E od Microsoftu - potrzebują dziś zaledwie kilku sekund próbki audio, żeby wygenerować realistyczną kopię głosu. Według raportu firmy Pindrop z 2025 roku liczba prób oszustw głosowych (voice fraud) wzrosła o 350% w ciągu dwóch lat. Polskie firmy nie są wyjątkiem - a małe i średnie przedsiębiorstwa, które rzadko mają rozbudowane procedury weryfikacji, stają się szczególnie łatwym celem.
Ten artykuł nie ma na celu straszyć. Chcę pokazać Ci konkretnie, jakie ryzyka niesie ta technologia, jakie szanse otwiera przed polskimi firmami i co możesz zrobić już teraz, żeby się zabezpieczyć.
Klonowanie głosu - jak to działa i dlaczego jest tak skuteczne
Klonowanie głosu opiera się na modelach generatywnych, które analizują cechy charakterystyczne mowy danej osoby - barwę, tempo, intonację, sposób akcentowania - a następnie generują nowe wypowiedzi w tym samym stylu. Współczesne narzędzia potrafią to zrobić na podstawie próbki trwającej od 3 do 30 sekund. Wystarczy fragment rozmowy telefonicznej, nagranie z webinaru albo filmik opublikowany na LinkedIn.
W przypadku pilotów badacze wykorzystali nagrania z czarnych skrzynek i komunikacji z wieżą kontroli lotów. Ale pomyśl o tym w kontekście biznesowym - ile nagrań Twojego głosu krąży w internecie? Podcasty, prezentacje na YouTube, nagrania ze spotkań na Zoomie, wiadomości głosowe na WhatsAppie. Każde z nich to potencjalna próbka do sklonowania.
Narzędzia takie jak ElevenLabs oferują klonowanie głosu w ramach płatnych planów (od 5 dolarów miesięcznie), ale w darknecie dostępne są modele open source, które nie mają żadnych zabezpieczeń etycznych. Projekt OpenVoice, udostępniony publicznie przez badaczy z MyShell, pokazał, że barierą wejścia nie jest już ani koszt, ani wiedza techniczna.
Realne zagrożenia dla polskich firm
W lutym 2024 roku pracownik oddziału międzynarodowej firmy w Hongkongu przelał 25 milionów dolarów po wideokonferencji, w której uczestniczyli - jak sądził - jego przełożeni. Wszyscy byli wygenerowani przez AI, łącznie z głosem dyrektora finansowego. To skrajny przypadek, ale mniejsze oszustwa zdarzają się codziennie i dotykają firm każdej wielkości.
W polskim kontekście widzę trzy główne scenariusze zagrożeń:
- Fałszywe polecenia przelewu. Oszust dzwoni do księgowej, podszywając się pod właściciela firmy, i prosi o pilny przelew. Głos brzmi identycznie. W firmie zatrudniającej 20 osób, gdzie wszyscy się znają, nikt nie podejrzewa oszustwa. Według danych CERT Polska w 2025 roku zgłoszono ponad 800 przypadków vishingu (phishingu głosowego) wymierzonego w polskie MŚP.
- Wyłudzanie informacji poufnych. Ktoś dzwoni do działu IT, podając się za prezesa, i prosi o reset hasła albo dostęp do systemu. W firmach bez formalnych procedur weryfikacji tożsamości to zaskakująco skuteczna metoda.
- Szkodzenie reputacji. Wygenerowane nagranie, w którym właściciel firmy wypowiada kontrowersyjne słowa, trafia do mediów społecznościowych. Zanim uda się udowodnić, że to fałszywka, szkoda wizerunkowa jest już zrobiona.
Nie chcę tworzyć wrażenia, że każda polska firma jest na celowniku zaawansowanych cyberprzestępców. Ale faktem jest, że automatyzacja ataków obniża ich koszt - i to, co kiedyś było opłacalne tylko przy dużych korporacjach, dziś może być skierowane przeciwko firmie z Radomia czy Bielska-Białej.
Pozytywna strona - jak polskie firmy mogą wykorzystać technologię głosu
Klonowanie głosu to nie tylko zagrożenie. To też narzędzie, które przy odpowiedzialnym użyciu może dać polskim firmom konkretną przewagę.
Obsługa klienta i voiceboty. Polska firma e-commerce może stworzyć voicebota, który mówi głosem jej założyciela - ciepło, naturalnie, z charakterystycznym akcentem. Narzędzia takie jak ElevenLabs czy Play.ht pozwalają na generowanie polskojęzycznych komunikatów głosowych w jakości, która jeszcze dwa lata temu była nieosiągalna. Koszt? Od kilkudziesięciu złotych miesięcznie za podstawowy plan, zamiast tysięcy za profesjonalnego lektora przy każdej aktualizacji.
Szkolenia i onboarding. Firma produkcyjna z Wielkopolski, z którą rozmawiałem w ramach konsultacji, rozważała stworzenie biblioteki szkoleń BHP nagranych głosem kierownika produkcji - osoby, którą pracownicy znają i której ufają. Zamiast nagrywać każdy moduł od zera, wystarczyło przygotować 15 minut próbki i wygenerować resztę. Oszczędność czasu szacowali na około 40 godzin rocznie.
Lokalizacja treści marketingowych. Agencja marketingowa z Krakowa wykorzystuje syntezę głosu do tworzenia wersji audio postów blogowych i materiałów na social media. Jeden konsultant "nagrywa" treści w trzech językach, mimo że mówi tylko po polsku i angielsku. Oczywiście z pełną transparencją - każdy materiał jest oznaczony jako wygenerowany przez AI.
Dostępność. Dla firm, które chcą dotrzeć do osób niewidomych lub słabowidzących, automatyczne generowanie wersji audio dokumentów, ofert czy instrukcji staje się realne bez dużych budżetów. To nie tylko etyczne - to też potencjalnie nowy segment klientów.
Trzeba jednak uczciwie powiedzieć, że jakość polskojęzycznej syntezy głosu wciąż ustępuje angielskiej. Intonacja bywa nienaturalna, a odmiana przez przypadki potrafi sprawiać kłopoty. Poprawia się to z miesiąca na miesiąc, ale jeśli planujesz wykorzystać tę technologię w kontakcie z klientem, testuj dokładnie i zbieraj feedback.
Jak chronić swoją firmę - konkretne kroki
Nie musisz wydawać fortuny na cyberbezpieczeństwo, żeby znacząco zmniejszyć ryzyko związane z deepfake'ami głosowymi. Oto praktyczne działania, które możesz wdrożyć w ciągu tygodnia:
- Wprowadź hasło weryfikacyjne. Ustal z kluczowymi osobami w firmie (księgowość, IT, zarząd) słowo-klucz, które musi paść przy każdym poleceniu finansowym wydanym przez telefon. To prymitywne, ale skuteczne - AI nie zna Waszego umówionego hasła.
- Zasada dwóch kanałów. Każde polecenie przelewu powyżej ustalonej kwoty (np. 5000 zł) wymaga potwierdzenia drugim kanałem - jeśli przyszło telefonicznie, potwierdź mailem lub SMS-em. Jeśli przyszło mailem, zadzwoń.
- Przeszkol zespół. Przeprowadź 30-minutowe szkolenie z rozpoznawania vishingu. Pokaż przykłady sklonowanych głosów (ElevenLabs ma publiczne demo). Ludzie, którzy wiedzą, że taka technologia istnieje, są znacznie trudniejsi do oszukania.
- Ogranicz publiczne nagrania głosu. Nie chodzi o paranoję, ale o świadomość. Jeśli nie musisz publikować nagrania ze spotkania w otwartym internecie - nie publikuj. Webinary chroń hasłem. Podcasty to świadoma decyzja, ale warto ją podjąć ze świadomością ryzyka.
- Monitoruj nowe regulacje. AI Act, który wszedł w życie w UE, klasyfikuje systemy deepfake jako wymagające oznaczenia. W Polsce trwają prace nad wdrożeniem tych przepisów. Jeśli Twoja firma korzysta z syntezy głosu - upewnij się, że oznaczasz wygenerowane treści zgodnie z wymogami.
Warto też wiedzieć o narzędziach do wykrywania deepfake'ów głosowych. Pindrop, Resemble Detect czy Reality Defender oferują API, które można zintegrować z systemami telefonicznymi. Na razie to rozwiązania raczej dla większych firm (ceny zaczynają się od kilkuset dolarów miesięcznie), ale rynek się demokratyzuje i w ciągu roku spodziewam się dostępnych opcji dla MŚP.
Co dalej - regulacje i etyka
Historia z głosami pilotów otwiera jeszcze jeden ważny temat - etyczny. Czy mamy prawo odtwarzać głos zmarłej osoby? Kto jest właścicielem "cyfrowego głosu"? W Polsce prawo do wizerunku (a głos jest jego częścią) chroni Kodeks cywilny, ale przepisy nie nadążają za technologią.
Jeśli planujesz wykorzystać syntezę głosu komercyjnie - np. do stworzenia voicebota głosem pracownika - potrzebujesz jego pisemnej zgody. To nie jest opcja, to wymóg prawny. Dobrą praktyką jest też informowanie klientów, że rozmawiają z wygenerowanym głosem, a nie z żywą osobą.
AI Act nakłada obowiązek oznaczania treści generowanych przez sztuczną inteligencję, w tym syntetycznej mowy. Za naruszenie grożą kary do 35 milionów euro lub 7% rocznego obrotu. Nawet jeśli Twoja firma jest mała, lepiej od początku budować procesy zgodne z regulacjami niż później je przebudowywać.
Technologia klonowania głosu nie zniknie - będzie tylko lepsza i tańsza. Polskie firmy, które zrozumieją to wcześniej, zyskają podwójnie: zabezpieczą się przed oszustwami i znajdą sposoby na wykorzystanie syntezy głosu do realnych celów biznesowych. Klucz leży w świadomości, rozsądnych procedurach i otwartości na nowe narzędzia - ale z zachowaniem zdrowego rozsądku. Jeśli coś brzmi zbyt dobrze (lub zbyt znajomo), żeby było prawdziwe, warto to zweryfikować drugim kanałem. Ta zasada sprawdza się zarówno w świecie AI, jak i w codziennym biznesie.
Źródło: TechCrunch - AI is being used to resurrect the voices of dead pilots