Definition: Explainable AI (XAI), auf Deutsch erklärbare KI, umfasst Methoden und Gestaltungsprinzipien, die nachvollziehbar machen, wie ein KI-System zu einem Ergebnis gelangt. Ziel ist, dass Entwickler, Anwender, Prüfer und Betroffene die Entscheidung in einer für sie angemessenen Tiefe verstehen, überprüfen und gegebenenfalls anfechten können.
Warum Erklärbarkeit nötig ist
Viele leistungsfähige Modelle, etwa tiefe neuronale Netze oder große Ensembles aus Entscheidungsbäumen, sind sogenannte Black Boxes: Ihre Millionen Parameter lassen keinen direkten Schluss darauf zu, warum eine bestimmte Eingabe zu einem bestimmten Ergebnis führt. Das ist unproblematisch, solange ein Modell etwa Produktempfehlungen ausspielt. Sobald es aber über Menschen entscheidet oder in sicherheitskritische Abläufe eingreift, entstehen Fragen: Beruht die Ablehnung eines Kreditantrags auf nachvollziehbaren Kriterien? Hat das Modell bei der Bewerbervorauswahl unzulässige Merkmale gelernt? Erkennt die Qualitätskontrolle den Fehler oder nur zufällig mitkorrelierte Bildmerkmale?
Erklärbarkeit dient deshalb mehreren Zwecken zugleich: Fehlersuche und Qualitätssicherung in der Entwicklung, Aufdeckung von Verzerrungen (Bias), wirksame menschliche Aufsicht im Betrieb und die Erfüllung rechtlicher Informationspflichten gegenüber Betroffenen.
Wichtige Methoden
Interpretierbare Modelle
Lineare und logistische Regression, kleine Entscheidungsbäume, Regelsysteme oder generalisierte additive Modelle (GAM) sind aus sich heraus verständlich. Für viele tabellarische Geschäftsdaten erreichen sie eine ähnliche Güte wie komplexe Modelle. Wo das der Fall ist, ist ein interpretierbares Modell meist die robustere Wahl als eine nachträgliche Erklärung.
Nachträgliche (post-hoc) Erklärungen
- SHAP (SHapley Additive exPlanations): verteilt den Beitrag zu einer Vorhersage auf die einzelnen Eingangsmerkmale, basierend auf Shapley-Werten aus der Spieltheorie. Eignet sich für lokale Erklärungen einzelner Entscheidungen und aggregiert für globale Übersichten.
- LIME (Local Interpretable Model-agnostic Explanations): nähert das Modell in der Umgebung einer konkreten Eingabe durch ein einfaches Ersatzmodell an.
- Kontrafaktische Erklärungen: beantworten die Frage „Was hätte anders sein müssen, damit das Ergebnis anders ausfällt?“ – etwa „Bei einem um X höheren Einkommen wäre der Antrag angenommen worden“. Für Betroffene oft am verständlichsten.
- Saliency-Methoden wie Grad-CAM oder Integrated Gradients: markieren bei Bild- und Textmodellen die Bereiche, die das Ergebnis am stärksten beeinflusst haben.
- Globale Verfahren: Permutation Feature Importance oder Partial-Dependence-Plots zeigen, welche Merkmale das Modell insgesamt nutzt.
Grenzen und Risiken von XAI
Post-hoc-Erklärungen sind Näherungen. Sie können plausibel wirken und trotzdem nicht widerspiegeln, was im Modell tatsächlich passiert. Verschiedene Methoden liefern für dieselbe Entscheidung mitunter unterschiedliche Erklärungen, und Forschungsarbeiten haben gezeigt, dass sich Erklärverfahren gezielt täuschen lassen. Bei großen Sprachmodellen ist zusätzlich Vorsicht geboten: Eine vom Modell selbst formulierte Begründung ist nicht zwingend der tatsächliche Entscheidungsweg. Zudem können detaillierte Erklärungen Angreifern helfen, ein Modell nachzubauen oder gezielt zu umgehen – Erklärtiefe und Zielgruppe sollten daher bewusst gewählt werden.
Regulatorische Anforderungen
- EU AI Act: Hochrisiko-KI-Systeme müssen so gestaltet sein, dass Betreiber die Ausgaben interpretieren und angemessen verwenden können (Art. 13), und eine wirksame menschliche Aufsicht ermöglichen (Art. 14). Art. 86 gibt betroffenen Personen bei bestimmten Entscheidungen auf Basis von Hochrisiko-Systemen nach Anhang III ein Recht auf eine klare und aussagekräftige Erläuterung. Nach dem Digital Omnibus (in Kraft seit 27. Juli 2026) gelten die Hochrisiko-Pflichten für Systeme nach Anhang III ab 2. Dezember 2027 und für KI in Produkten nach Anhang I ab 2. August 2028.
- DSGVO: Bei automatisierten Entscheidungen nach Art. 22 verlangen Art. 13–15 aussagekräftige Informationen über die involvierte Logik.
- Normen und Rahmenwerke: ISO/IEC 42001 und das NIST AI Risk Management Framework behandeln Transparenz und Erklärbarkeit als Merkmale vertrauenswürdiger KI.
Vorgehen in der Praxis
- Zielgruppen klären: Datenwissenschaftler brauchen andere Erklärungen als Sachbearbeiter, Auditoren oder Kunden.
- Modellwahl begründen: Prüfen und dokumentieren Sie, ob ein interpretierbares Modell ausreicht, bevor Sie eine Black Box einsetzen.
- Erklärmethoden validieren: Stabilität und Plausibilität der Erklärungen testen, etwa mit mehreren Methoden oder mit Fachexperten.
- Erklärungen in den Prozess einbauen: Sachbearbeiter sollen die Erklärung bei der Entscheidung sehen und begründet abweichen können.
- Dokumentieren: Modellzweck, Einflussfaktoren, Grenzen und bekannte Schwächen in der technischen Dokumentation festhalten.
Fazit
Erklärbarkeit ist kein einzelnes Werkzeug, sondern eine Designentscheidung, die von der Modellwahl bis zur Gestaltung der Sachbearbeiteroberfläche reicht. SecTepe unterstützt dabei, Transparenzanforderungen in KI-Governance und Risikomanagement zu verankern.
Häufige Fragen
Muss jedes KI-System erklärbar sein?
Nein. Rechtlich verpflichtend wird Erklärbarkeit vor allem bei Hochrisiko-Systemen und bei automatisierten Entscheidungen über Personen. Für interne Qualitätssicherung ist sie aber fast immer sinnvoll.
Reicht es, einem Betroffenen die wichtigsten Merkmale zu nennen?
Eine Liste abstrakter Merkmale ist oft zu wenig. Verständlicher sind Erklärungen, die sich auf den konkreten Fall beziehen und zeigen, welche Faktoren das Ergebnis maßgeblich bestimmt haben.
Weitere Begriffe in „KI & Machine Learning“
- Adversarial Machine Learning
- AI Poisoning
- AI Red Teaming
- Algorithmic Accountability
- Algorithmic Bias (algorithmische Verzerrung)
- Chatbot-Sicherheit
- DSGVO-konforme KI-Systeme
- Edge AI
- EU AI Act Compliance
- Federated Learning
- Homomorphe Verschlüsselung (Homomorphic Encryption)
- KI-Backup und Model Recovery