Fraunhofer
Deepfakes in Echtzeit erkennen
Fraunhofer-Forschende haben eine KI-basierte Lösung entwickelt, die Deepfakes in Videokonferenzen in Echtzeit erkennen soll. Die Analyse von Bild und Ton erfolgt lokal und damit datenschutzkonform.

In ihrer Arbeit erstellen die Forschenden am Fraunhofer SIT zunächst selbst Deepfakes, um das System zu trainieren. Hier ein beispielhafter Vergleich zwischen der Detektion des authentischen Forschers links und mit dem Gesicht von Tom Cruise rechts.
© Fraunhofer SIT
Videokonferenzen erleichtern die Kommunikation über Standorte hinweg und ermöglichen es trotzdem, sich in die Augen zu schauen. Doch immer öfter darf man zweifeln, ob die Augen des Gegenübers echt sind. Denn Deepfake-Technologien können heute Stimmen und Bilder in Echtzeit so realistisch wie noch nie fälschen. Und das Problem ist global. Nach Prüfung von über einer Milliarde Fälle weltweit resümiert der Entrust Identity Fraud Report 2026: „Identitätsbetrug ist nicht mehr opportunistisch, sondern inzwischen industrialisiert, global organisiert und kommerziell optimiert.“ Grund genug für Fraunhofer-Forschende wie Prof. Martin Steinebach, Chef-IT-Forensiker am Fraunhofer-Institut für Sichere Informationstechnologie SIT in Darmstadt, mit Hochdruck an diesem Thema zu arbeiten.
Lokale Lösung für Echtzeiterkennung.
Steinebach und sein Team aus Experten am Fraunhofer SIT und am Fraunhofer Heilbronn Forschungs- und Innovationszentrum (HNFIZ) für Cybersicherheit haben im Rahmen eines Athene-Forschungsprojekts eine Lösung entwickelt, die Video- und Audio-Deepfake-Erkennung kombiniert. Die KI-basierte Software soll Teilnehmenden bei sicherheitskritischen Videocalls kontinuierlich Hinweise liefern, wie wahrscheinlich ein Deepfake ist. Die Warnung erfolgt visuell: „Wenn ein Gespräch im Augenblick viele Indikatoren aufweist, gibt das System eine Wahrscheinlichkeit aus, ob es sich hier um Deepfake handeln könnte“, so der Forscher. „Dann ist aber immer noch der Mensch gefragt, der mit gezielten Rückfragen oder auch einem Rückruf auf einem anderen Kanal die Echtheit seines Gegenübers verifizieren muss.“
Datenschutzkonform.
Die Analyse kann lokal auf einem leistungsfähigen Laptop laufen, ohne dass Bild- oder Tondaten an einen externen Server übertragen werden müssen. Damit ist sie datenschutzkonform und für Unternehmen geeignet, die vertrauliche Gespräche führen, etwa mit Vorständen, Finanzabteilungen oder externen Partnern. „Für die lokale Echtzeitanalyse unserer Lösung reicht ein Rechner mit moderner Grafikkarte und zwölf Gigabyte Grafikspeicher“, sagt Steinebach. Interessant dürfte die Lösung auch für Anbieter von Videokonferenzsystemen sein, die sie als Plugin oder fest eingebaute Sicherheitsfunktion in Systemen wie Teams, Zoom oder vergleichbaren Unternehmenslösungen integrieren könnten. Ebenso möglich wäre eine zentrale Unternehmensinfrastruktur: ein geschützter Serverbereich, über den besonders wichtige Gespräche analysiert werden. Die genaue Form hängt vom Einsatzszenario, den vorhandenen Ressourcen und den Datenschutzanforderungen ab.


