1. Die Doppelrolle der KI in der modernen Cybersicherheit
Die fortschreitende Digitalisierung und die zunehmende Komplexität von Cyberangriffen stellen Unternehmen, Behörden und IT-Sicherheitsverantwortliche vor immense Herausforderungen. Angriffe erfolgen mit hoher Geschwindigkeit, nutzen automatisierte Angriffsmuster und erfordern reaktionsschnelle Verteidigungsmechanismen. In diesem dynamischen Umfeld hat sich Künstliche Intelligenz (KI) zu einer zentralen Schlüsseltechnologie entwickelt. KI-Systeme ermöglichen die Echtzeitanalyse riesiger Datenmengen, die automatische Erkennung ungewöhnlicher Muster im Netzwerkverkehr und die Priorisierung von Sicherheitsmeldungen.
Gleichzeitig erzeugt der Einsatz von KI jedoch neuartige Risiken und erweitert die digitale Angriffsfläche. Wie das Bundesamt für Sicherheit in der Informationstechnik (BSI) in seinen Veröffentlichungen und Whitepapern betont, stehen Organisationen vor einem Dilemma: Während KI-gestützte Werkzeuge wie Network Intrusion Detection Systeme (NIDS), automatisierte Code-Analysen oder Sprachmodelle (LLMs) die Verteidigung stärken, sind die zugrunde liegenden Modelle selbst anfällig für gezielte Manipulationen, Erklärungsfälschungen und Datenlecks.
Besonders die mangelnde Nachvollziehbarkeit komplexer KI-Modelle – das sogenannte Blackbox-Problem – erschwert fundierte Sicherheitsentscheidungen. Methoden der erklärbaren Künstlichen Intelligenz (Explainable AI, XAI) versprechen Abhilfe, bringen jedoch ihrerseits spezifische Sicherheitsrisiken mit sich. Dieser Beitrag beleuchtet auf Basis der BSI-Grundlagen die zentralen Sicherheitslücken beim Einsatz von KI, stellt wirksame Gegenmaßnahmen vor und bietet einen praxisnahen Prüfkatalog für die systematische Sicherheitsbewertung.
2. Risiken und Sicherheitslücken beim Einsatz von KI und XAI
Der Einsatz von KI-Systemen unterscheidet sich grundlegend von klassischer Software. KI-Modelle basieren auf statistischen Mustern und komplexen Parameterstrukturen, was neuartige Angriffsvektoren eröffnet. Das BSI unterteilt die Risiken in direkte Angriffe auf KI-Modelle, Missbrauch von Erklärungsmechanismen (XAI) sowie betriebliche und architektonische Schwachstellen.
2.1 Wie Angreifer Erklärungen (XAI) als Angriffsvektor missbrauchen
Erklärbare Künstliche Intelligenz soll Transparenz schaffen, indem sie aufzeigt, welche Eingabemerkmale (Features) zu einer konkreten Entscheidung beigetragen haben – beispielsweise bei der Erkennung eines Angriffs durch ein Intrusion Detection System mittels SHAP-Werten (SHapley Additive exPlanations). Allerdings können genau diese Erklärungen von Angreifern als Informationsquelle missbraucht werden:
- Erleichterung von Modelldiebstahl (Model Extraction Attacks): Beim Modelldiebstahl versucht ein Angreifer, ein urheberrechtlich geschütztes oder sicherheitsrelevantes KI-Modell (beispielsweise einen KI-basierten Virenscanner) durch systematische Abfragen nachzubilden. Normale Modelldiebstähle erfordern eine sehr hohe Anzahl an Abfragen, was durch Monitoring-Systeme erkannt wird. Durch den Zugriff auf XAI-Erklärungen erhält der Angreifer jedoch detaillierte Informationen über die lokalen Entscheidungsgrenzen und die Relevanz einzelner Merkmale. Dies ermöglicht es, das Modell mit einer signifikant geringeren Abfragerate und extrem hoher Präzision zu rekonstruieren.
- Missbrauch kontrafaktischer Erklärungen zur Malware-Generierung: Kontrafaktische XAI-Methoden beantworten die Frage, welche minimalen Änderungen an einer Eingabe erforderlich sind, um eine andere Modellentscheidung hervorzurufen. Angreifer können diesen Mechanismus zweckentfremden: Sie analysieren, welche spezifischen Code-Zeilen oder Datei-Eigenschaften verändert werden müssen, damit eine Schadsoftware von einem KI-basierten Antivirenprogramm nicht mehr als maliziös eingestuft wird, während ihre funktionale Schadwirkung vollständig erhalten bleibt.
2.2 Gezielte Manipulationen und Angriffe auf Erklärungsmechanismen
XAI-Systeme sind selbst Ziel von Angriffen. Durch gezielte Manipulation soll das tatsächliche Verhalten eines KI-Modells verschleiert werden, um Kontrollstellen oder Sicherheitsanalysten in trügerischer Sicherheit zu wiegen:
- Verdeckte Manipulationen bei Backdoor-Angriffen: In einem White-Box-Szenario (beispielsweise bei der Bösartigkeit eines Insiders oder einer Kompromittierung der Lieferkette) kann ein KI-Modell so präpariert werden, dass es bei normalen Eingaben korrekte Ergebnisse liefert. Sobald jedoch ein bestimmter Auslöser (Trigger) vorliegt, trifft das Modell eine Fehlentscheidung. Zeitgleich wird die XAI-Methode so manipuliert, dass auch die generierte Erklärung unauffällig bleibt und keinerlei Hinweise auf das Fehlverhalten liefert.
- Black-Box-Manipulation von Erklärungen: Forschungsarbeiten des BSI belegen, dass Erklärungen auch ohne internen Modellzugriff durch gezielt strukturierte Eingaben (Adversarial Perturbations) manipuliert werden können. Die ausgegebene Erklärung täuscht dann eine falsche Entscheidungsgrundlage vor, wodurch kritische Sicherheitsalarme von Analysten als Fehlalarm verworfen werden.
2.3 Betriebliche Herausforderungen und architektonische Systemgrenzen
Neben vorsätzlichem Missbrauch ergeben sich aus den technischen Eigenschaften von XAI und KI-Systemen strukturelle Schwachstellen im Regelbetrieb:
- Das Uneinigkeitsproblem (Disagreement Problem): Verschiedene post-hoc Erklärbarkeitsoberflächen verwenden unterschiedliche mathematische Annahmen zur Berechnung von Erklärungen. In der Praxis führt dies häufig dazu, dass zwei etablierte XAI-Methoden für exakt dieselbe Modellvorhersage widersprüchliche Erklärungen liefern. Diese Uneinigkeit lässt sich technisch nicht ohne Weiteres auflösen und kann bei IT-Sicherheitsanalysen zu Verzögerungen oder Fehlbeurteilungen führen.
- Fehlinterpretationen durch fehlendes Domänenwissen: XAI-Ausgaben sind für Laien selten intuitiv verständlich. Ohne tiefgehendes Fachwissen im jeweiligen Anwendungsfall (wie etwa Netzwerkprotokolle bei NIDS) besteht das Risiko, dass Sicherheitsbeauftragte falsche Schlussfolgerungen aus Erklärungsdiagrammen ziehen.
- Zielkonflikt mit der Berechnungskomplexität (Computational Costs): Die nachträgliche Berechnung komplexer Erklärungen erfordert erhebliche Rechenressourcen. Dies führt zu erhöhten Latenzzeiten und steigenden Hardwarekosten, was insbesondere bei Echtzeit-Anwendungen zur Deaktivierung von Schutzmechanismen verleiten kann.
2.4 Sicherheitslücken in Generativer KI und Sprachmodellen (LLMs)
Beim Einsatz von universellen Sprachmodellen (Large Language Models) und generativer KI identifiziert das BSI spezifische Angriffsmuster:
- Evasion Attacks & Indirect Prompt Injection: In dokumentenbasierten LLM-Chats oder KI-Programmierassistenten können Angreifer über nicht vertrauenswürdige Datenquellen (beispielsweise präparierte PDF-Dokumente oder Webseiten) versteckte Steuerbefehle einspeisen. Diese indirekten Prompt Injections veranlassen das Modell dazu, Sicherheitsvorgaben zu ignorieren, vertrauliche Daten zu exfiltrieren oder fehlerhaften Programmcode zu generieren.
- Bias und mangelnde Trainingsdatenqualität: Verzerrungen (Bias) in den Trainingsdaten führen dazu, dass KI-Modelle in bestimmten Szenarien systematische Fehlentscheidungen treffen. Fehlt eine transparente Überprüfung der Datenhistorie, bleiben diese Schwachstellen bis zum Sicherheitsvorfall unentdeckt.
3. Schutzmaßnahmen und Sicherheitsstrategien für KI-Ökosysteme
Um KI-Systeme und XAI-Komponenten wirkungsvoll zu härten, empfiehlt das BSI eine Kombination aus technischen, organisatorischen und personellen Schutzmaßnahmen.
3.1 Technische Schutzmaßnahmen und mehrstufige Filterung
Die technische Absicherung einer KI-Architektur erfordert eine mehrstufige Validierungskette, um schädliche Eingaben abzufangen und den Informationsabfluss zu begrenzen:
- Abfragebeschränkung (Rate Limiting): Zur Abwehr von Modelldiebstahl und automatisiertem XAI-Scraping wird die Anzahl der zulässigen Modellabfragen pro Zeiteinheit strikt limitiert (beispielsweise maximal 5 Abfragen pro Minute mit erzwungenen Pausen bei Überschreitung).
- Need-to-know-Prinzip für Erklärungen: Detaillierte Erklärungsdaten dürfen nicht uneingeschränkt offengelegt werden. Über ein feingranulares Rollen- und Rechtemanagement erhalten Nutzer nur die für ihre spezifische Aufgabe absolut notwendigen Erklärungsdetails.
- Adversarielles Training: KI-Modelle werden bereits während der Trainingsphase gezielt mit manipulierten Eingaben (Adversarial Examples) konfrontiert und gehärtet, um die Robustheit gegenüber Evasion Attacks zu steigern.
- Basisschutz gegen Indirect Prompt Injection: Trennung von System-Prompts und nicht vertrauenswürdigen Dateninhalten, strikte Eingabe- und Ausgabe-Validierung sowie Abschottung von LLM-Schnittstellen gegenüber externen Netzwerkaufrufen.
3.2 Organisatorische Governance und Supply Chain Security
- Red Teaming & Unabhängige Audits: Regelmäßige adversarielle Tests (Red Teaming), bei denen Sicherheitsteams gezielt versuchen, das KI-Modell und die XAI-Komponenten zu täuschen, aufzudecken und zu umgehen.
- Software Bill of Materials for AI (SBOM for AI): Transparente Dokumentation der gesamten KI-Lieferkette gemäß den G7- und BSI-Empfehlungen. Eine SBOM for AI erfasst Trainingsdatensätze, Modellarchitekturen, Hyperparameter, verwendete Bibliotheken und Vorverarbeitungsschritte.
- Überwachung der Computational Costs: Regelmäßiges Monitoring des Ressourcenverbrauchs von XAI-Algorithmen, um Performance-Engpässe und Denial-of-Service-Risiken frühzeitig zu vermeiden.
3.3 Personelle Maßnahmen und Kompetenzaufbau
- Aufklärung über XAI-Limitationen: Schulung von Sicherheitsbeauftragten und Analysten zur kritischen Hinterfragung von XAI-Ausgaben und zur Vermeidung von Blindvertrauen (Overreliance).
- Kompetenzaufbau für Domänenwissen: Befähigung des Personals, Modellergebnisse im Kontext des spezifischen Fachbereichs zu validieren und das Uneinigkeitsproblem bei XAI-Methoden sachgerecht einzuordnen.
4. Prüfkatalog zur Sicherheitsbewertung von KI-Systemen
Der folgende Prüfkatalog unterstützt IT-Sicherheitsbeauftragte, Entwickler und Prüforganisationen bei der systematischen Bewertung von KI-Anwendungen und XAI-Lösungen. Er basiert auf den Checklisten und Kriterienkatalogen des BSI (unter anderem QUAIDAL, AIC4 und das XAI-Whitepaper).
4.1 Kategorie I: Wissensmanagement & Awareness
Die organisatorische Verankerung von Sicherheitswissen bildet das Fundament für den sicheren Betrieb von KI-Lösungen. Die folgende Übersicht definiert die zentralen Anforderungen an Personalschulungen und Informationsprozesse.
| Prüfkriterium | Anforderung & Prüfgegenstand | Umsetzungsstatus |
|---|---|---|
| WM-01: Personalschulung | Nutzende und Analysten sind über Chancen, Grenzen und Angriffsrisiken von KI und XAI geschult. | Offen / In Prüfung / Erfüllt |
| WM-02: Stand der Technik | Die Entwicklungsteams beobachten fortlaufend den aktuellen Forschungsstand zu KI-Schwachstellen. | Offen / In Prüfung / Erfüllt |
| WM-03: Cyber Threat Intelligence | Aktuelle Bedrohungsinformationen zu eingesetzten KI-Bibliotheken und XAI-Tools werden ausgewertet. | Offen / In Prüfung / Erfüllt |
4.2 Kategorie II: Organisatorische Governance & Auditierung
Ein strukturierter Audit-Prozess stellt sicher, dass Risiken über den gesamten Lebenszyklus überwacht werden. Nachfolgend sind die Kriterien für Risikomanagement und kontinuierliche Überprüfung zusammengestellt.
| Prüfkriterium | Anforderung & Prüfgegenstand | Umsetzungsstatus |
|---|---|---|
| OG-01: Spezifische Risikoanalyse | Eine anwendungsfallbezogene Risikoanalyse für das KI-Modell inklusive der XAI-Komponenten liegt vor. | Offen / In Prüfung / Erfüllt |
| OG-02: Red Teaming | Gezielte Penetrationstests und adversarielle Angriffe auf Modell und Erklärungen wurden durchgeführt. | Offen / In Prüfung / Erfüllt |
| OG-03: Regelmäßige Audits | Bei kontinuierlichem Nachtraining des Modells finden periodische Überprüfungen der Modellgüte statt. | Offen / In Prüfung / Erfüllt |
| OG-04: Cost & Performance Monitoring | Die Rechenzeit und Latenz der XAI-Erklärungen wird überwacht, um DoS-Risiken zu vermeiden. | Offen / In Prüfung / Erfüllt |
4.3 Kategorie III: Technische Härtung & Systemarchitektur
Technische Schutzmechanismen minimieren die Angriffsfläche an den Schnittstellen des KI-Systems. Die Tabelle nennt die wesentlichen Kontrollen für API-Schutz und Modellhärtung.
| Prüfkriterium | Anforderung & Prüfgegenstand | Umsetzungsstatus |
|---|---|---|
| TH-01: Rate Limiting | Die Abfrageanzahl an die API ist wirksam beschränkt, um Modelldiebstahl zu verhindern. | Offen / In Prüfung / Erfüllt |
| TH-02: Need-to-know bei XAI | Erklärungsdaten werden im Sinne des Minimalprinzips nur autorisierten Rollen bereitgestellt. | Offen / In Prüfung / Erfüllt |
| TH-03: Adversarielles Training | Das Modell wurde mit gelabelten Adversarial Examples gegen Evasion Attacks gehärtet. | Offen / In Prüfung / Erfüllt |
| TH-04: Prompt-Injection-Schutz | Bei LLM-Anwendungen sind System-Prompts und Eingabedaten strikt getrennt und validiert. | Offen / In Prüfung / Erfüllt |
| TH-05: XAI-Methodenevaluation | Eingesetzte XAI-Methoden wurden hinsichtlich ihrer Anfälligkeit für Manipulationen bewertet. | Offen / In Prüfung / Erfüllt |
4.4 Kategorie IV: Datenqualität, Transparenz & Supply Chain
Sicherheit beginnt bei der Datenakquise und erfordert vollständige Transparenz über alle Modellkomponenten. Die Kriterien in dieser Kategorie decken Trainingsdaten und Lieferkettenabdeckung ab.
| Prüfkriterium | Anforderung & Prüfgegenstand | Umsetzungsstatus |
|---|---|---|
| DT-01: Trainingsdaten-Qualität | Qualitätskriterien der Trainingsdaten (beispielsweise gemäß BSI QUAIDAL) wurden systematisch geprüft. | Offen / In Prüfung / Erfüllt |
| DT-02: Bias-Detektion & Mitigation | Trainingsdaten und Modellausgaben wurden auf systematische Verzerrungen (Bias) untersucht. | Offen / In Prüfung / Erfüllt |
| DT-03: Software Bill of Materials (SBOM) | Eine transparente SBOM for AI dokumentiert Datenquellen, Modellarchitektur und Bibliotheken. | Offen / In Prüfung / Erfüllt |
| DT-04: Menschliche Aufsicht (Human-in-the-Loop) | Sicherheitskritische Entscheidungen erfordern eine finale Validierung durch qualifizierte Fachkräfte. | Offen / In Prüfung / Erfüllt |
5. Fazit & Ausblick
Künstliche Intelligenz bietet enorme Potenziale zur Stärkung der IT-Resilienz, stellt Sicherheitsteams jedoch vor völlig neue Herausforderungen. Wie die Analysen des BSI zeigen, ist erklärbare KI (XAI) ein wertvolles Hilfsmittel zur Modelloptimierung und Fehlerdiagnose, kann jedoch aufgrund bestehender Limitationen – wie dem Uneinigkeitsproblem oder der Anfälligkeit für Modelldiebstahl – nicht als alleinige Sicherheitsgarantie dienen.
Ein verlässlicher Schutz erfordert daher einen ganzheitlichen Ansatz: Technische Härtungsmaßnahmen wie Rate Limiting und Prompt-Filtering müssen mit organisatorischer Governance, transparenter Lieferketten-Dokumentation (SBOM for AI) und kontinuierlichem Personaltraining kombiniert werden. Mit dem vorgestellten Prüfkatalog erhalten Organisationen ein praxistaugliches Instrument an die Hand, um KI-Anwendungen von der Entwicklung bis zum Betrieb systematisch auf Sicherheitsrisiken zu überprüfen und nachhaltig abzusichern.
