Modellvalidierung in Banken
Eine Validierungseinheit beantwortet zu jedem Modell eine Frage: Würde die Bank genauso entscheiden, wenn sie wüsste, was die Prüfung weiß. Die Arbeit hat eine feste Reihenfolge, von den Daten des Modells bis zum Bericht an die Geschäftsleitung. Die Pflicht folgt aus MaRisk, bei Banken unter EZB-Aufsicht aus dem EZB-Leitfaden zu internen Modellen.
Wo die Validierung in den drei Verteidigungslinien sitzt
Die Validierung gehört in die zweite Linie. Die erste baut und nutzt das Modell, die zweite stellt es infrage, und die interne Revision in der dritten prüft, ob diese Kritik sauber lief. MaRisk AT 4.4 regelt die unabhängige Risikocontrolling- und die Compliance-Funktion der zweiten Linie und hält die Prüfung der Risikoquantifizierung von deren Entwicklern fern.
Unabhängigkeit ist eine Frage der Aufbauorganisation und der Daten. Wer nur das aggregierte Modellergebnis bekommt, kann das Modell nicht prüfen, die Einheit braucht also Zugang zu Trainingsdaten, Code und Parameterhistorie. Kauft eine Bank ein Modell, tritt die Dokumentation des Anbieters an die Stelle des Codes, und das Modellrisiko-Rahmenwerk legt die nötige Tiefe fest.
Drei Fragen, die ein Validierungsbericht beantwortet
Zuerst die Methodenkritik: Passt das Verfahren zur Frage, sind die Annahmen benannt, und haben die Variablen einen Grund im Modell zu stehen, der über die Anpassung an die Stichprobe hinausgeht. Ein Modell kann jeden statistischen Test bestehen und methodisch untauglich sein, weil es eine Variable nutzt, die zum Entscheidungszeitpunkt nicht beobachtbar ist.
Die Ergebnisanalyse vergleicht Prognose und Eintritt. Das Benchmarking stellt dem Modell eine Alternative gegenüber, eine einfachere Spezifikation oder eine externe Schätzung, damit ein schwaches Ergebnis einen Bezugspunkt hat. Der EZB-Leitfaden zu internen Modellen ordnet seine Erwartungen für Kapitalmodelle entlang dieser Linien.
Backtesting und der Riss der eigenen Toleranz
Das Backtesting zählt, wie oft die Realität außerhalb des Modellrahmens lag. Bei einem Marktrisikomodell ist das die Zahl der Tage, an denen der Verlust den Value-at-Risk überstieg, und für diese Zahl steht eine Schwelle in den Kapitalregeln. Ein Überschreiten ist nicht automatisch ein kaputtes Modell, denn ein Hundertjahresereignis tritt etwa an jedem hundertsten Tag ein, die Prüfung fragt also nach Häufungen.
Reißt die Zahl die Schwelle, läuft das Modell unter einer dokumentierten Entscheidung und einem Maßnahmenplan mit Verantwortlichem und Datum weiter. Der Bericht nennt Feststellung, Schwere und Frist, und die offenen Feststellungen sind die Liste, die die Aufsicht bei der nächsten Prüfung zuerst liest.
Laufendes Monitoring und wie Drift auffällt
Validierung zu einem Zeitpunkt und Monitoring über die Zeit beantworten verschiedene Fragen. Das Monitoring beobachtet die Population: Die in diesem Quartal bewerteten Antragsteller sind nicht die der Entwicklung, und der Abstand wächst still. Üblich sind der Population Stability Index, der die heutige Scoreverteilung mit der Entwicklungsverteilung vergleicht, und ein Kolmogorow-Smirnow-Test auf dieselbe Verschiebung; Jensen-Shannon- und Kullback-Leibler-Divergenz sowie die Wasserstein-Distanz leisten dasselbe mit anderer Empfindlichkeit an den Rändern.
Schwerer ist der Konzeptdrift, denn die Eingaben sehen unverändert aus, während sich der Zusammenhang zwischen Eingabe und Ergebnis verschoben hat. Er zeigt sich als Leistungsverfall im gleitenden Fenster, das Monitoring berichtet also Treffergenauigkeit, Präzision, Trefferquote und Fläche unter der Kurve neben der Kalibrierung, nicht an ihrer Stelle. Wer nur eine unveränderte Eingabeverteilung erhält, hat über Konzeptdrift nichts erfahren.
Ein Modell erklären, das die Bank vertreten muss
Lehnt ein Modell einen Antrag ab, muss jemand sagen können, warum. Die Techniken teilen sich in zwei Arten. Global interpretierbare Verfahren beschränken das Modell so, dass die Erklärung darin steckt, etwa ein generalisiertes additives Modell oder ein Boosted Linear Tree. Nachgelagerte Verfahren erklären ein fertiges Modell: SHAP rechnet eine einzelne Entscheidung auf ihre Eingaben um, LIME nähert das Modell lokal an, und Partial-Dependence- sowie ALE-Darstellungen zeigen, wie das Ergebnis mit einer Variablen über die Population wandert.
Eine nachgelagerte Erklärung ist eine Annäherung an das Modell und nicht das Modell, was zählt, sobald sie dem Kunden gezeigt wird. Das deutsche Recht verlangt die Substanz längst: Bundesgerichtshof und Gerichtshof der Europäischen Union haben sich beide mit dem SCHUFA-Score befasst, und KI-Compliance in Deutschland behandelt, was das für eine automatisierte Entscheidung bedeutet.
Datenqualität als eigene Feststellung
Eine Prüfung, die eine Zahl nicht zur Quelle zurückverfolgen kann, hat einen Mangel gefunden, bevor sie irgendetwas testet. BCBS 239, die Grundsätze des Basler Ausschusses für Risikodatenaggregation und Risikoberichterstattung, nennt die Pflicht: Eine Bank muss korrekte Risikodaten liefern und die Aggregation erklären können, auch im Stressfall.
Praktisch kehren drei Mängel wieder. Ein Feld ändert im Quellsystem seine Definition, ohne dass der Modellverantwortliche davon hört, eine manuelle Korrektur schleicht sich zwischen Quelle und Modell in eine Tabelle, und eine Historie wird nach einer Migration mit Werten neu gebaut, die den Originalen nicht mehr entsprechen. Jeder gehört als Datenfeststellung in den Bericht, getrennt von der Modellfeststellung.
Ein Machine-Learning-Modell ohne geschlossene Erklärung validieren
Ein Gradient-Boosting-Modell hat keinen Koeffizienten zum Ablesen, die Methodenkritik läuft also anders. Der Validierer prüft die Merkmale auf Variablen, die die Bank nicht nutzen darf, untersucht die Stabilität über Zeitscheiben und Teilpopulationen und vergleicht das Modell mit einem transparenten Benchmark, damit der Gewinn aus der Komplexität messbar wird.
Die BaFin-Orientierungshilfe zu IKT-Risiken beim Einsatz von KI-Systemen von Dezember 2025 richtet die Prüftiefe an der Kritikalität aus und verlangt Erklärbarkeit auf dem Niveau, das die Nutzung erfordert. Scort das Modell Verbraucherkredite, treten die Dokumentations- und Aufsichtspflichten der KI-Verordnung hinzu, die KI-Governance in Banken darstellt.
Was macht eine Modellvalidierung in der Bank?
Eine Validierungseinheit prüft jedes Modell unabhängig von seinen Erbauern und schreibt einen Bericht, auf den die Geschäftsleitung reagieren kann. Die Prüfung testet, ob die Methode zur Frage passt, vergleicht Prognosen mit Eintritten, stellt dem Modell eine Alternative gegenüber, prüft die Datenherkunft und hält Feststellungen mit Schwere und Frist fest. Nach MaRisk ist die Prüfung von der Modellentwicklung organisatorisch getrennt.
Was steht in einem Validierungsbericht?
Umfang und geprüfte Modellversion, die genutzten Daten und ihre Grenzen, die Methodenkritik, die Ergebnisanalyse samt Backtesting, der Benchmark-Vergleich, eine Liste der Feststellungen mit Schwere und Fristen sowie ein Schluss darüber, ob das Modell so genutzt werden darf. Ein Bericht ohne verwertbaren Schluss lässt die Entscheidung ohne Verantwortlichen.
Was löst eine Revalidierung außerhalb des Jahreszyklus aus?
Ein Marktbruch, der die Daten aus dem kalibrierten Bereich schiebt, ein Quellsystem mit geänderter Felddefinition, ein Anbieter, der ein gekauftes Modell aktualisiert, eine wesentliche Änderung des Portfolios und ein Backtesting-Ergebnis jenseits seiner Schwelle. Eine Bank schreibt diese Auslöser in ihre Modellrichtlinie, damit die Entscheidung nicht davon abhängt, wer es bemerkt.
Modellvalidierung und Finance Loop
Finance Loop ist der Treffpunkt für Validierungseinheiten, Quants und interne Revisoren im deutschen Finanzwesen. Bei Finance-Loop-Events sitzen die Verfasser von Validierungsberichten mit den Aufsehern und Modellverantwortlichen zusammen, die sie lesen.
Finance Loop ist ein Experten-Netzwerk und will neue Technologien im Finanzwesen voranbringen, wie KI, Tokenisierung, Stablecoins und DeFi. Finance Loop hilft seinen Mitgliedern, Fähigkeiten und persönliche Netzwerke in diesen Feldern aufzubauen: Investment & digitale Vermögenswerte, Payments & digitales Geld, Digitale Infrastruktur & Souveränität und Risk & Compliance.