Cybersecurity12. Mai 202611 min read

Deepfake-Betrug und Voice Cloning: So schützen Sie Ihr Unternehmen vor CEO-Fraud

Eine geklonte Stimme und dreißig Sekunden Zeitdruck genügen, um sechsstellige Beträge aus Ihrem Unternehmen zu bewegen. Hier ist der Kontrollstack, der das verhindert, vom Rückrufprotokoll bis zur Zahlungsrichtlinie als Code.

Von Innovation T Team


Die Stimme Ihres CFO ist öffentliches Material. Jede Bilanzpressekonferenz, jeder Konferenzvortrag, jeder Podcast-Ausschnitt ist Trainingsmaterial für einen Klon, der praktisch nichts mehr kostet. Die Frage lautet nicht mehr, ob jemand Ihre Führungskräfte imitieren wird. Sie lautet, ob Ihre Kontrollen davon ausgehen, dass es bereits geschehen ist.

Voice Cloning ist Massenware geworden

Vor fünf Jahren brauchte ein überzeugender Stimmklon Minuten sauberes Studiomaterial und echtes Machine-Learning-Know-how. Heute erzeugen Zero-Shot-Text-to-Speech-Modelle aus wenigen Sekunden Referenzaudio einen brauchbaren Klon, zusammengesucht aus LinkedIn-Videos, YouTube oder einer Mailbox-Ansage. Open-Weight-Modelle laufen auf einer Consumer-GPU. Gehostete Dienste erledigen das Ganze im Browser-Tab.

Zwei technische Entwicklungen machen das für Unternehmen konkret gefährlich:

  • Echtzeit-Stimmkonversion. Ältere Angriffe spielten vorproduzierte Clips ab und scheiterten, sobald das Opfer eine Rückfrage stellte. Moderne Echtzeit-Pipelines wandeln die Live-Sprache des Angreifers mit so geringer Latenz in die Zielstimme um, dass ein natürliches Gespräch möglich ist. Der Angreifer improvisiert. Der Klon hält mit.
  • Das Telefonnetz ist der perfekte Übertragungskanal. Klassische Telefonie komprimiert Audio auf ein schmales Band um 8 kHz. Diese Kompression zerstört genau die hochfrequenten Artefakte, an denen synthetische Sprache erkennbar wäre. Ein Klon, der über Studiomonitore leicht künstlich klingt, klingt durch einen Telefonlautsprecher perfekt. Rufnummern-Spoofing vervollständigt die Illusion. Die Bundesnetzagentur geht zwar inzwischen gegen gefälschte Rufnummern vor, und in den USA existiert mit STIR/SHAKEN ein Attestierungsverfahren, doch auf internationalen Routen, über die die meisten dieser Anrufe laufen, wird beides nur lückenhaft durchgesetzt.

Das Ergebnis: Der Telefonanruf ist heute der schwächste Authentifizierungsfaktor in Ihrem Unternehmen, und die meisten Finanzabteilungen behandeln ihn nach wie vor als den stärksten.

Deepfake-Video ist im Call angekommen

Video war lange die Rückfallebene der Verifikation. "Lassen Sie uns kurz per Video sprechen, dann sehe ich, dass Sie es wirklich sind." Dieses Sicherheitsnetz gibt es nicht mehr.

Echtzeit-Face-Swap-Modelle laufen auf einer einzelnen Consumer-GPU und leiten ihre Ausgabe über eine virtuelle Kamera aus, sodass die Videokonferenz-Plattform eine normale Webcam sieht. Die Plattform komprimiert den Stream anschließend aggressiv und verdeckt damit Blending-Artefakte an Haaransatz und Brille, genau wie Telefon-Codecs Audioartefakte verdecken. In einem viel zitierten Fall aus dem Jahr 2024 nahm ein Finanzmitarbeiter in Hongkong an einer Videokonferenz teil, in der jeder andere Teilnehmer synthetisch war, einschließlich des CFO, und gab Überweisungen von umgerechnet rund 25 Millionen US-Dollar frei.

Zwei Techniken sollte man auseinanderhalten, weil sie unterschiedlich versagen:

  • Face Swap ersetzt das Gesicht des Angreifers durch das des Ziels und behält dessen Mimik bei. Schwächen: extreme Kopfhaltungen, Verdeckung (eine Hand vor dem Gesicht) und Profilansichten.
  • Face Reenactment animiert ein Foto oder Video der Zielperson, gesteuert durch die Bewegungen des Angreifers. Schwächen: konsistente Beleuchtungswechsel und Interaktion mit physischen Objekten.

Diese Schwachstellen sind relevant für Live-Liveness-Prüfungen, dazu gleich mehr. Bauen Sie Ihre Verteidigung aber nicht darauf. Beide Lücken schrumpfen mit jeder Modellgeneration, Teil einer größeren Verschiebung, die wir in unserem Beitrag zur Industrialisierung KI-gestützter Angriffe beschrieben haben.

Wo das Geld tatsächlich abfließt

Synthetische Medien sind der Köder, nicht der Diebstahl. Nach unserer Erfahrung konzentrieren sich die Schäden auf wenige, wiederkehrende Szenarien:

  • Eilüberweisung auf Zuruf. Eine geklonte Führungskraft ruft in der Buchhaltung an: vertrauliche Übernahme, enge Frist, absolute Verschwiegenheit, die Anzahlung muss heute raus. Das Muster ist als CEO-Fraud oder Chef-Masche seit Jahren bekannt, BKA und BSI warnen regelmäßig davor. Neu ist nur: Die Stimme stimmt jetzt. Der Deepfake liefert die Glaubwürdigkeit, der Vorwand (Dringlichkeit, Autorität, Geheimhaltung) erledigt den Rest.
  • Geänderte Lieferanten-Bankverbindung. Ein Angreifer gibt sich als realer Lieferant aus, oft nach Kompromittierung von dessen E-Mail-Konto, und bittet um eine "Aktualisierung der Bankverbindung". Die nächste legitime Rechnung bezahlt den Angreifer. Ganz ohne Zeitdruck, was die Masche schwerer erkennbar macht.
  • Helpdesk-Resets. Der Angreifer ruft mit geklonter Mitarbeiterstimme und einer rührseligen Geschichte beim IT-Support an und geht mit einem MFA-Reset wieder raus. So begannen mehrere aufsehenerregende Angriffe auf Casino- und Cloud-Konzerne: nicht mit Malware, mit einem Anruf.
  • Umgehung von KYC und Onboarding. Injection-Angriffe speisen synthetisches Video über virtuelle Kameras oder manipulierte Apps direkt in Identifikationsstrecken ein, auch in VideoIdent-Verfahren, und hebeln naive Selfie-Prüfungen bei der Kontoeröffnung aus.
  • Bewerbungsbetrug. Synthetische Kandidaten bestehen Remote-Videointerviews, um an Stellen mit Systemzugriff zu kommen oder Gehalts- und Hardware-Betrug zu betreiben.

Legen Sie diese Szenarien über Ihre eigenen Prozesse. Überall dort, wo eine Stimme oder ein Gesicht eine Aktion autorisiert, tragen Sie ein unbepreistes Risiko in den Büchern.

Warum Detektion allein verliert

Der reflexhafte Griff geht zum "Deepfake-Detektor". Widerstehen Sie ihm, oder verstehen Sie zumindest genau, was Sie da kaufen.

Detektions-Klassifikatoren werden auf die Artefakte bekannter Generatoren trainiert. Jede neue Modellgeneration erzeugt andere Artefakte, also verfällt die Genauigkeit zwischen dem Labor-Benchmark und dem Anruf, den Ihre Kreditorenbuchhaltung acht Monate später erhält. Kompression, Transcoding und Hintergrundgeräusche (in echten Anrufen garantiert) verschlechtern die Erkennung weiter. Und das Basisraten-Problem ist gnadenlos: Wenn einer von hunderttausend Anrufen betrügerisch ist, ertränkt selbst ein starker Klassifikator Ihr Team in Fehlalarmen oder wiegt es mit falschen Entwarnungen in Sicherheit.

Das schlimmste Ergebnis ist nicht die verpasste Erkennung. Es ist der Mitarbeiter, der das Geld überweist, weil "der Detektor nichts angezeigt hat". Ein mittelmäßiger Detektor plus fehlplatziertes Vertrauen ist schlechter als gar kein Detektor.

Detektion hat ihren Platz: als ein schwaches Signal unter mehreren in gestaffelten Kontrollen, in Contact Centern und in KYC-Pipelines, in denen Sie den Aufnahmepfad kontrollieren und Challenge-Response-Liveness erzwingen können. Als Fundament der Verteidigung taugt sie nicht.

Der Kontrollstack, der funktioniert

Die Gewinnerstrategie besteht darin, synthetische Medien irrelevant zu machen. Gestalten Sie Ihre Prozesse so, dass ein perfekter Klon, in Ton und Bild, dem Angreifer nichts einbringt.

Out-of-Band-Verifikation, formalisiert

Die Kontrolle mit dem höchsten Nutzen: Jede sensible Anfrage, die über einen Kanal eingeht, muss über einen anderen, unabhängig etablierten Kanal verifiziert werden.

  • Rückrufnummern kommen aus Ihrem Verzeichnis oder den Lieferantenstammdaten. Niemals aus der Anfrage selbst, niemals aus einer E-Mail-Signatur, niemals aus der angezeigten Rufnummer.
  • Die Verifikation geht ausgehend raus. Eingehende "Bestätigungsanrufe" verifizieren nichts.
  • Verbale Codephrasen können im Führungskreis helfen, aber behandeln Sie sie als Stolperdraht, nicht als Authentifikator. Geteilte Geheimnisse sickern durch, und ein Angreifer, der nach der Phrase fischt, ist selbst schon ein Erkennungssignal.

Schreiben Sie das Protokoll auf, geben Sie ihm einen Namen und machen Sie seine Auslösung zu einer geschützten Handlung. Gerade in Unternehmen mit ausgeprägten Hierarchien, und davon gibt es im DACH-Raum genug, braucht das Rückendeckung von ganz oben: Wer einer Stimme, die exakt wie die Geschäftsführung klingt, sagt "Ich muss das Rückrufverfahren durchführen", muss mit absoluter Sicherheit wissen, dass daraus kein Nachteil entsteht. Die echte Geschäftsführung sollte die Erste sein, die sich dem Verfahren sichtbar unterwirft.

Zahlungskontrollen als Code

Eine Richtlinie, die in einem PDF lebt, wird unter Druck übersprungen. Kodieren Sie sie in Ihrem ERP, Ihrer Banking-Plattform oder Ihrem Freigabe-Workflow, sodass der riskante Pfad technisch blockiert ist, nicht bloß unerwünscht:

# Zahlungsrichtlinie: Änderung der Lieferanten-Bankverbindung
trigger: vendor_bank_details_change
controls:
  - out_of_band_callback:
      target: contact_number_on_file   # niemals aus der Anfrage selbst
      performed_by: someone_other_than_requester
  - dual_approval:
      roles: [ap_manager, finance_controller]
  - cooling_off_hours: 24              # keine Zahlung auf neue Bankverbindung am selben Tag
  - first_payment_cap: low_value_test_transaction
notify: security_team

Dieselbe Staffelung gilt für Überweisungen oberhalb eines Schwellenwerts: Vier-Augen-Prinzip, wobei der zweite Freigebende out of band kontaktiert wird, und eine harte Regel, dass Dringlichkeit den Workflow niemals aushebelt. Für vertrauliche Transaktionen gibt es einen vorab vereinbarten Ausnahmepfad, an dem trotzdem zwei Menschen beteiligt sind, denn "die Sache ist geheim" ist exakt der Vorwand, den Angreifer benutzen werden.

Die Stimme als Authentifikator abschaffen

Stimmerkennung durch einen Menschen ist als Identitätsnachweis wertlos geworden. Entfernen Sie sie überall dort, wo sie tragend ist:

  • Helpdesk-Resets erfordern eine Verifikation über Ihren Identity Provider (ein Push auf ein bereits registriertes Gerät, eine Bestätigung der Führungskraft im HR-System), niemals "Ich habe die Stimme erkannt" oder Wissensfragen, deren Antworten längst in Datenlecks stehen.
  • Stellen Sie die Mitarbeiter-Authentifizierung auf Phishing-resistente Faktoren um. Passkeys und FIDO2-Hardware-Keys lassen sich am Telefon nicht vorlesen, geklonte Stimme hin oder her. Den Migrationspfad beschreiben wir in unserem Leitfaden zu Passkeys und passwortloser Authentifizierung.
  • Verbieten Sie Freigaben per Antwort-Mail für Finanzaktionen. "Bestätige wie telefonisch besprochen" in einem E-Mail-Verlauf ist keine Kontrolle.

Die E-Mail-Flanke absichern

Deepfake-Anrufe reisen selten allein. Der Anruf erzeugt den Zeitdruck, eine gefälschte oder täuschend ähnliche E-Mail liefert die Überweisungsdaten. Schließen Sie die Spoofing-Hälfte mit strikter E-Mail-Authentifizierung:

_dmarc.yourcompany.com. IN TXT "v=DMARC1; p=reject; rua=mailto:dmarc-reports@yourcompany.com; adkim=s; aspf=s"

DMARC auf p=reject mit striktem Alignment, plus Registrierung oder Monitoring von Lookalike-Domains, zwingt Angreifer auf Freemail-Adressen, die Ihr Secure Email Gateway über Regeln für externe Absender und abweichende Anzeigenamen markieren kann.

Provenienz und Liveness, wo Sie die Pipeline kontrollieren

Bei kundenseitigen Identifikationsstrecken konfrontieren Sie Ihren KYC-Anbieter mit konkreten Fragen: randomisierte Challenge-Response-Liveness (keine passiven Selfie-Prüfungen), Injection-Attack-Detection, die virtuelle Kameras und Emulatoren erkennt, sowie Device Attestation in den Mobile SDKs. Klären Sie dabei auch das Datenschutz-Fundament: Biometrische Daten fallen unter Art. 9 DSGVO, also Auftragsverarbeitungsvertrag prüfen, Verarbeitungsstandort erfragen und EU-Hosting bevorzugen. Für Ihre eigenen veröffentlichten Medien erlauben C2PA Content Credentials das Signieren offizieller Vorstandskommunikation, sodass das Fehlen einer gültigen Signatur selbst zum Signal wird. Provenienz wird den Betrug dieses Jahr nicht stoppen, aber sie ist billig früh einzuführen und verzinst sich.

Ein Stufenmodell für die Verifikation

Führen Sie das der Reihe nach ein. Die meisten Organisationen schaffen die Schritte 1 bis 4 in wenigen Wochen.

  1. Inventarisieren Sie risikoreiche Aktionen. Alles, was Geld bewegt, Bankverbindungen ändert, Zugangsdaten zurücksetzt, Zugriffe gewährt oder sensible Daten freigibt. Wenn eine Stimme oder ein Videoanruf es auslösen kann, gehört es auf die Liste.
  2. Ordnen Sie jeder Aktion eine Stufe zu. Stufe 1 (irreversibel und hochwertig): Out-of-Band-Rückruf, Vier-Augen-Prinzip, Karenzzeit. Stufe 2 (reversibel oder mittlerer Wert): Out-of-Band-Rückruf durch eine Person. Stufe 3: authentifizierter Standard-Workflow, Ad-hoc-Kanäle werden gar nicht akzeptiert.
  3. Definieren Sie den vertrauenswürdigen Kanal pro Stufe. Rufnummern aus dem Verzeichnis, persönliche Bestätigung oder ein authentifizierter Ticketing-Prozess. Dokumentieren Sie, wo die vertrauenswürdigen Kontaktdaten liegen und wer sie pflegt.
  4. Machen Sie den sicheren Weg schnell. Wenn die Verifikation zwei Tage dauert, arbeiten die Leute daran vorbei. Ein Rückruf sollte fünf Minuten kosten. Geschwindigkeit ist ein Sicherheitsmerkmal.
  5. Üben Sie es. Spielen Sie ein Tabletop durch, in dem "der Geschäftsführer" freitagnachmittags in der Finanzabteilung anruft. Danach, mit Einwilligung der Betroffenen, Freigabe der Rechtsabteilung und, wo vorhanden, in Abstimmung mit Betriebsrat und Datenschutzbeauftragtem, ein Red-Team-Test mit einer tatsächlich geklonten Stimme. Stimmdaten sind personenbezogene Daten, das gehört sauber geregelt. Die erste Live-Übung ist immer ernüchternd, und sie überzeugt Skeptiker schneller als jedes Richtlinien-Memo.

Das ist Zero Trust, angewandt auf menschliche Prozesse: Vertrauen niemals daraus ableiten, wie eine Anfrage klingt oder aussieht, sondern immer aus einem unabhängig verifizierten Kanal. Die architektonische Version dieses Prinzips behandeln wir in Zero-Trust-Architektur erklärt.

Schulen Sie auf den Vorwand, nicht auf das Artefakt

Bringen Sie Ihren Mitarbeitern nicht bei, ruckelnde Lippensynchronisation zu erkennen. Diese Fähigkeit veraltet monatlich und züchtet falsche Sicherheit. Bringen Sie ihnen bei, den Vorwand zu erkennen, der sich seit langem vor den Deepfakes nicht verändert hat:

  • Dringlichkeit: Es muss heute passieren, sofort, vor Geschäftsschluss.
  • Autorität: Die Anfrage kommt von jemandem in leitender Position oder beruft sich darauf. In hierarchisch geprägten Organisationen wirkt dieser Hebel besonders stark.
  • Geheimhaltung: Niemandem etwas sagen, das ist vertraulich, das bleibt unter uns.
  • Kanalwechsel: Weg von den offiziellen Systemen, hin zu Privathandys und privaten Chats.

Zwei dieser Merkmale zusammen sollten das Verifikationsprotokoll automatisch auslösen, egal wie echt die Person wirkt. Belohnen Sie die Auslösung. Würdigen Sie öffentlich den Mitarbeiter, der eine legitime Anfrage verifiziert hat, denn genau so sieht ein funktionierendes System aus.

Wenn es trotzdem passiert

Geschwindigkeit entscheidet darüber, wie viel Sie zurückholen. Bereiten Sie diese Schritte vor, damit freitags um 18 Uhr niemand improvisieren muss:

  1. Rufen Sie sofort die Betrugshotline Ihrer Bank an und beauftragen Sie den Rückruf der Überweisung. Die Rückholquote fällt nach den ersten 24 bis 48 Stunden steil ab, während die Gelder über Finanzagenten-Konten weiterspringen. Seit Echtzeitüberweisungen im SEPA-Raum flächendeckend verfügbar sind, schrumpft dieses Fenster teils auf Minuten.
  2. Frieren Sie zugehörige Zahlläufe ein und sperren Sie alle Konten, die der Vorwand berührt hat, einschließlich der Ziele von Helpdesk-Resets.
  3. Sichern Sie Beweise: Gesprächsaufzeichnungen, Meeting-Metadaten, E-Mail-Header, die anrufende Nummer. Lassen Sie Aufzeichnungen nicht automatisch ablaufen.
  4. Erstatten Sie Anzeige bei der Polizei und melden Sie den Vorfall Ihrem Cyberversicherer innerhalb der Fristen. Viele Policen haben enge Meldefenster für Zahlungsbetrug.
  5. Führen Sie die Nachbereitung über den Prozess, nicht über die Person. Der Mitarbeiter, den ein Klon auf dem Stand der Technik getäuscht hat, ist nicht das Versagen. Der Prozess, in dem ein einzelner Anruf Geld bewegen konnte, ist es.

Verankern Sie diese Schritte in Ihrem übergreifenden Playbook und proben Sie sie zusammen mit Ihren anderen Szenarien. Die Struktur dafür liefert unser Incident-Response-Playbook.

Synthetischer Betrug ist kein Zukunftsrisiko. Er ist ein gegenwärtiger Massenangriff, der gezielt das informelle Vertrauen attackiert, auf dem Ihr Unternehmen läuft. Die Lösung ist keine magische Detektion. Sie ist langweiliges, rigoroses Prozess-Engineering: Out-of-Band-Verifikation, Zahlungen unter der Kontrolle von Code, Phishing-resistente Identität und Menschen, die Dringlichkeit selbst als Warnsignal behandeln.

Wie Innovation T helfen kann

Innovation T baut und härtet die Systeme, von denen dieses Playbook abhängt: Freigabe-Workflows, die in Ihrem ERP und Ihren Banking-Integrationen durchgesetzt werden, Rollouts Phishing-resistenter Authentifizierung, Identifikationsstrecken mit echten Liveness-Kontrollen und Social-Engineering-Übungen inklusive Voice-Cloning-Szenarien. Wir sind zuerst Ingenieure, also werden Kontrollen als funktionierende Software ausgeliefert, nicht als Foliensatz. Einen Überblick geben unsere Security- und Engineering-Leistungen.

Wenn eine Stimme oder ein Gesicht in Ihrer Organisation derzeit Geld bewegen kann, ist das ein Befund. Sprechen Sie mit uns, und wir helfen Ihnen, die Lücke zu schließen, bevor jemand anderes sie zuerst findet.

#Deepfakes#Betrug#Social Engineering#Sicherheit

Bereit, mit Innovation T zu bauen?

Ob Sicherheit, Wachstum oder Engineering, unser Team hilft Ihnen, es gut umzusetzen.