ChatGPT und Claude im Vergleich für die Arbeit eines Finanzteams
Gesucht wird der Vergleich ChatGPT gegen Claude, und die meisten Antworten im Netz vergleichen sie an allgemeinen Benchmarks, die einer Bank nichts sagen. Diese Seite vergleicht sie nach der Arbeitsweise an Finanzaufgaben: ein langer Aufsichtstext, eine Tabelle, eine Kreditakte, eine Codebasis.
Am Ende steht kein Urteil, und das ist Absicht. Beide Produkte leisten die Arbeit, sie sind unterschiedlich gebaut, und in einem regulierten Haus entscheiden ein Vertrag und eine Datenregel häufiger als die Fähigkeiten eines der beiden.
Die zwei Produkte und ihre Hersteller
ChatGPT stammt von OpenAI. Es läuft im Browser, auf dem Desktop und auf dem Handy, nimmt Dateien an, sucht im Web, schreibt und führt Code in einer abgeschirmten Umgebung aus und verbindet sich mit anderer Software. Die Modellreihe von OpenAI trägt den Namen GPT, und das Unternehmen verkauft ein eigenes Produkt zum Programmieren, OpenAI Codex.
Claude stammt von Anthropic und läuft an denselben Orten. Seine Modellreihe trägt die Namen Opus, Sonnet und Haiku, und das Unternehmen verkauft Claude Code für Entwickler. Beide Unternehmen verkaufen außerdem API-Zugang, und so landet eines der Modelle in Software, die eine Bank schon besitzt.
Beide beschreiben sich als Assistenten, die über das Gegebene nachdenken. Keines wird hier mit dem Marketing des anderen beschrieben, und keines wird hinter das andere gestellt.
Wie beide die Finanzaufgaben angehen
Bei langen Dokumenten legt Claude den Schwerpunkt darauf, eine sehr große Eingabe in einem Stück zu nehmen, und deshalb greifen Teams dazu, wenn ein ganzer Prospekt oder ein Konsultationspapier vorliegt und die Antwort eine Stelle auf Seite 180 berücksichtigen muss. ChatGPT verarbeitet lange Eingaben ebenfalls und setzt stärker auf Abruf und Werkzeuge, was zu einem Bestand aus vielen Dokumenten besser passt als zu einem einzigen riesigen.
Bei Tabellen und Zahlen schreiben und führen beide Code aus, statt Arithmetik zu raten, und auf diese Eigenschaft sollte man bestehen: Eine Zahl aus ausgeführtem Code lässt sich nachrechnen, eine Zahl aus einem Text nicht. Bei Aufsichtstexten sind beide stark, und der Unterschied liegt darin, ob das Werkzeug den Artikel nennt, auf den es sich stützt, wenn man danach fragt.
Beim Entwerfen hat ChatGPT die längere Erfahrung und die größere Bandbreite an Tonlagen. Beim Durchdenken eines unordentlichen internen Dokuments, dessen Struktur nur mitgemeint ist, zeigt sich das Verhalten von Claude bei langem Kontext. Bei Agenten führen inzwischen beide mehrstufige Arbeit mit Werkzeugen aus, und KI-Agenten im Finanzwesen behandelt die nötigen Kontrollen.
Codex gegen Claude Code, der Vergleich beim Programmieren
Wer den Modellvergleich sucht, will oft den beim Programmieren, als „openai codex vs claude code“. Beide sind Agenten für ein Repository, beide laufen aus Terminal, IDE-Erweiterung und Cloud, und beide fragen, bevor sie handeln. Claude Code wird aus Terminal, VS Code, JetBrains, Slack und dem Web gesteuert und fragt vor jeder Dateiänderung und jedem Befehl nach Erlaubnis. OpenAI Codex läuft als CLI, als IDE-Erweiterung, als Cloud-Dienst und in den ChatGPT-Apps, mit Abschirmung, Freigaben für Agenten, automatischer Durchsicht und profilbasierten Rechten.
Beide lesen eine Anweisungsdatei auf Repository-Ebene, und dort hinterlegt eine Bank ihre eigenen Regeln dazu, was ein Agent anfassen darf. Für ein Plattformteam entscheidet meist, welche Cloud und welcher Identitätsanbieter im Haus schon laufen, und nicht, welcher Agent den schöneren Code schreibt.
Was dieser Vergleich nicht klärt
Die zwei Dinge, die in einer Bank entscheiden, fehlen in jedem Funktionsvergleich im Netz. Das erste sind die eigenen Datenregeln des Hauses: welche Datenklassen das Haus überhaupt verlassen dürfen, unter welcher Vereinbarung, und ob der Anbieter damit trainieren darf. Ein Produkt, das daran scheitert, ist draußen, unabhängig von seiner Leistung.
Das zweite ist der Vertrag, den das Haus unterschreiben kann. Regelungen zu Haftung, Protokollierung, Verarbeitungsort, Prüfrechten und Kündigungsfristen gehen auseinander, und sie werden von Beschaffung und Recht verhandelt und nicht im Einstellungsmenü gewählt. Die KI-Verordnung fügt Pflichten hinzu, die dem Anwendungsfall folgen, und damit kann dasselbe Produkt in einem Prozess zulässig sein und im nächsten derselben Bank nicht.
Wer einen Vergleichsartikel liest und diese zwei Punkte überspringt, wählt ein Werkzeug, das er vielleicht nicht nutzen darf.
Wie testet ein Frankfurter Team beide vor der Wahl?
Mit eigenen Dokumenten und einem Bewertungsbogen, der vor dem Test geschrieben wird. Man nimmt zehn echte Aufgaben aus dem Monatsgeschäft, lässt sie durch beide Produkte laufen und bewertet jede Antwort danach, ob sie richtig ist, ob sie eine prüfbare Quelle nennt und wie viel Nacharbeit nötig war. Zehn Aufgaben schlagen jeden Benchmark, weil es die eigenen sind.
Das geschieht auf einem Zugang, dessen Bedingungen die genutzten Daten zulassen, und die Ausgaben werden aufbewahrt. Wenn die Beschaffung fragt, warum ein Produkt gewählt wurde, ist dieser Nachweis die Antwort. KI-Tools für Finanzen nennt, was sonst auf die Auswahlliste gehört, denn die zwei Produkte hier sind nicht die einzige Wahl.
Modellwahl und Finance Loop
Bei Finance Loop erzählen Leute, die diesen Vergleich in einer Bank durchgezogen haben, was am Ende den Ausschlag gab, und das ist selten der Punkt aus den Artikeln. Finance Loop ist in Frankfurt der Treffpunkt für diesen Austausch und ergreift dabei für keinen Anbieter Partei.
Finance Loop ist ein Experten-Netzwerk und will die Verbreitung neuer Technologien im Finanzwesen voranbringen, etwa KI, Tokenisierung, Stablecoins und DeFi. Finance Loop hilft seinen Mitgliedern, Fähigkeiten und persönliche Netzwerke in diesen Feldern aufzubauen: Investment & digitale Vermögenswerte, Payments & digitales Geld, Digitale Infrastruktur & Souveränität und Risk & Compliance.