WhatsApp implementiert eine optionale Funktion namens Scam Alert, die auf dem Gerät des Nutzers ein Machine-Learning-Modell zur Erkennung potenzieller Betrugsnachrichten ausführt. Die Architektur ist so konzipiert, dass die Ende-zu-Ende-Verschlüsselung der Nachrichten vollständig erhalten bleibt.
Systemarchitektur der Erkennungsschicht
Das ML-Modell läuft vollständig on-device. Kein Nachrichteninhalt verlässt das Gerät zur Klassifizierung. Nutzer müssen die Funktion explizit aktivieren. Bei einer erkannten potenziellen Betrugsnachricht erscheint eine Warnung ausschließlich für den Empfänger; der Absender erhält keine Information darüber. Es erfolgt keine automatische Weiterleitung oder Meldung an WhatsApp, Meta oder Dritte.
Verifizierbare Telemetrie-Ebene mit Confidential Federated Analytics
Zur modellseitigen Verbesserung werden ausschließlich minimale, aggregierte und anonymisierte Zählwerte (beispielsweise Häufigkeit von Warnungen und nachfolgende Nutzeraktionen) erfasst. Diese Metriken werden innerhalb einer vertraulichen Computing-Umgebung auf Basis von Trusted Execution Environments (TEEs) verarbeitet. Differenzielle Privatsphäre und k-Anonymität werden angewendet, um Rückschlüsse auf Individuen auszuschließen. Die gesamte Pipeline ist so gestaltet, dass Sicherheitsforscher ihre Funktionsweise unabhängig verifizieren können.
Verifizierbare Modellbereitstellung und Transparenzschicht
Jede Modellversion wird vor der Auslieferung in einem öffentlichen, append-only Transparenz-Ledger bei Cloudflare registriert. Der WhatsApp-Client prüft die Ed25519-Signatur des Modells und validiert den Hash gegen das Ledger, bevor das Modell geladen wird. Nutzer können unter „Account > Request Info > Scam Alert Activity“ einsehen, welche Nachrichten markiert wurden und welche Modellversion aktiv war.
WhatsApp hat zudem sein Bug-Bounty-Programm erweitert, um externe Forscher zur Überprüfung der Architektur und Modellintegrität einzuladen. Die zugrundeliegende Technologie basiert auf dem PAPAYA Federated Analytics Stack, der auf der USENIX NSDI 2025 vorgestellt wurde.
Quelle: Meta Engineering
FAQ
Wie wird sichergestellt, dass keine Nachrichteninhalte WhatsApp-Server erreichen?
Das ML-Modell zur Betrugserkennung läuft ausschließlich on-device. Die Klassifizierung findet lokal statt; keine Rohdaten verlassen das Gerät.
Kann ein Nutzer nachvollziehen, welche Modellversion bei ihm aktiv ist?
Ja. Über den Pfad „Account > Request Info > Scam Alert Activity“ sind sowohl die verwendete Modellversion als auch die markierten Nachrichten einsehbar.
Ist Scam Alert verpflichtend oder optional?
Die Funktion ist vollständig optional und muss vom Nutzer explizit aktiviert werden. Es gibt keine automatische Aktivierung.