Prompt Injection
Sprachmodelle folgen jedem, der überzeugend genug fragt. Wie Angreifer mit reiner Sprache Regeln aushebeln, Daten abziehen und Werkzeuge kapern. Und was dagegen hält.
KI-Systeme laufen in vielen Firmen als Blackbox. Als Sicherheitsforscher zerlege ich die Angriffe, die sie treffen, und zeige, wie man sie schützt. Im Journal dokumentiere ich, was bricht und was standhält.
Scrollen, um zu ermitteln ↓
These 01
Jede neue Technologie wirft neue Schatten.
These 02
Wer KI einsetzt, trägt Verantwortung für das, was er nicht sieht.
These 03
Meine Arbeit: Licht hineinbringen, bevor es jemand anderes tut.
08 Dossiers · horizontal ermitteln
Sprachmodelle folgen jedem, der überzeugend genug fragt. Wie Angreifer mit reiner Sprache Regeln aushebeln, Daten abziehen und Werkzeuge kapern. Und was dagegen hält.
Rollenspiele, Kodierungen, mehrstufige Dialoge: die Techniken, mit denen Schutzvorgaben von Sprachmodellen fallen. Und was ihre Stabilität wirklich bestimmt.
Sprachmodelle mit Zugriff auf Mail, Datenbanken und Werkzeuge: Aus einem Textproblem wird ein Systemproblem. Die Angriffsfläche der Agenten, bevor sie überall laufen.
Ein Modell ist nur so vertrauenswürdig wie seine Trainingsdaten. Wie vergiftete Datensätze Hintertüren einbauen und die Lieferkette des maschinellen Lernens zum Angriffsziel machen.
Filter, Klassifikatoren, Regelwerke um das Modell herum. Was Guardrails wirklich leisten, wann sie fallen und warum sie eine Schicht sind, keine Verteidigung.
Filter beruhigen, Architektur schützt: Rechte begrenzen, Ausgaben misstrauen, kritische Aktionen entkoppeln. Baupläne für KI-Anwendungen, die einen Angriff aushalten.
Das eigene System angreifen, bevor es jemand anderes tut: Methodik, Erfolgskriterien und Nachweise für das adversariale Testen von KI-Systemen.
Der EU AI Act verlangt nachweisbare Sorgfalt. Zwischen Gesetzestext und Systemarchitektur liegt ein weites Feld. Ich übersetze in beide Richtungen.