Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert2 Min.

Laut Mercor-Studie: Claude Opus 5 übertrifft Wirtschaftsprüfer im Monatsabschluss

Eine Untersuchung von Mercor zeigt, dass Claude Opus 5 lizenzierte Wirtschaftsprüfer bei komplexen Monatsabschlüssen in Genauigkeit, Zeitaufwand und Kosten deutlich distanziert.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Die Debatte über die Leistungsfähigkeit künstlicher Intelligenz im Finanzsektor hat eine neue empirische Grundlage erhalten. Am 1. Oktober 2026 veröffentlichte die Talent- und Evaluierungsplattform Mercor die Ergebnisse einer detaillierten Untersuchung des Autors Aden Barton, die auf dem eigens entwickelten APEX-Accounting Benchmark basiert. Die Studie verglich das Vorgehen menschlicher Fachkräfte direkt mit einem modernen Frontier-Modell bei der Bewältigung komplexer buchhalterischer Aufgaben. Die dokumentierten Ergebnisse werfen fundamentale Fragen über die zukünftige Aufgabenverteilung in Wirtschaftsprüfung und Controlling auf.

Für den empirischen Härtetest wählte Mercor zwölf lizenzierte US-Wirtschaftsprüfer aus, die über eine durchschnittliche Berufserfahrung von 5,4 Jahren verfügten. Die Fachleute wurden mit vier realitätsnahen Szenarien des regulären Monatsabschlusses konfrontiert, darunter detaillierte Leasing-Pläne sowie vielschichtige Abstimmungen von Umsätzen und Provisionszahlungen. Diese Testfälle spiegeln den typischen Arbeitsalltag qualifizierter Finanzexperten wider, der traditionell ein hohes Maß an analytischer Sorgfalt erfordert. Bislang galt in vielen Unternehmen die Annahme, dass solche dokumentenübergreifenden Abgleiche von Menschen verlässlicher gelöst werden als von automatisierten Systemen.

Das tatsächliche Abschneiden der menschlichen Prüfer offenbarte jedoch erhebliche Fehlerquellen im manuellen Prozess. Im Durchschnitt erreichten die beteiligten Wirtschaftsprüfer bei den vier Szenarien eine Genauigkeitsquote von lediglich 37 Prozent. Für die Bearbeitung der Aufgaben benötigten die Fachkräfte zwischen 30 und 180 Minuten, da vielschichtige Verträge und Zahlenwerke abgeglichen werden mussten. Diese beträchtliche Arbeitszeit spiegelte sich auch in den Kosten wider, die Mercor auf durchschnittlich rund 10,35 US-Dollar pro geprüftem Kriterium bezifferte.

Demgegenüber lieferte das Frontier-Modell Claude Opus 5 eine fehlerfreie Demonstration automatisierter Datenverarbeitung. Das KI-System bewältigte sämtliche vorgegebenen Aufgabenstellungen autonom mit einer Erfolgsquote von 100 Prozent und benötigte für den gesamten Durchlauf weniger als zehn Minuten. Gleichzeitig brachen die operativen Aufwendungen radikal ein, da die Berechnungskosten für das Modell bei lediglich 0,21 US-Dollar pro Kriterium lagen. Der direkte Vergleich markiert eine drastische Reduktion sowohl des zeitlichen als auch des finanziellen Aufwands.

Die Resultate liefern den ersten belastbaren empirischen Nachweis dafür, dass agentenbasierte Workflows menschlichen Fachkräften bei komplexen Dokumentenabgleichen überlegen sein können. Bislang beschränkte sich der Einsatz von KI in Finanzabteilungen weitgehend auf einfache, repetitive Buchungsabläufe. Die Ergebnisse des APEX-Benchmarks belegen nun, dass autonome Modelle deterministische Fehlerraten bei anspruchsvollen Kontrollmechanismen drastisch senken können. Damit geraten etablierte Annahmen über die Notwendigkeit manueller Überprüfungen im Rechnungswesen ins Wanken.

Für Wirtschaftsprüfungsgesellschaften und Finanzabteilungen zeichnet sich infolge dieser Datenlage eine tiefgreifende Restrukturierung ab. Wenn autonome Agenten Monatsabschlüsse in einem Bruchteil der Zeit und mit fehlerfreier Präzision abwickeln, wird sich das Berufsbild von Buchhaltern und Prüfern grundlegend verändern. Anstelle manueller Tabellenabgleiche rücken künftig die strategische Überwachung der Systeme und die Interpretation übergeordneter Finanzdaten in den Mittelpunkt. Die Studie von Mercor signalisiert, dass die Ära der manuellen Beleg- und Vertragsprüfung im institutionellen Finanzwesen ihrem Ende entgegengehen könnte.

Was heißt das für Sie?

Für Finanzfachleute und Führungskräfte zeigt das Ergebnis, dass operative Buchhaltungs- und Prüfungsprozesse in naher Zukunft grundlegend umstrukturiert werden müssen. Unternehmen sollten ihre Monatsabschlüsse schrittweise für agentenbasierte Abgleiche öffnen, um Fehlerquoten und Kosten zu senken, während Wirtschaftsprüfer sich auf strategische Plausibilitätsprüfungen statt manueller Tabellenabgleiche konzentrieren sollten.

Belege

Solide belegt
61/100
  • Am 1. Oktober 2026 veröffentlichte die Plattform Mercor eine Studie von Aden Barton auf Basis des APEX-Accounting Benchmarks.

    eine Quelle
  • Das Modell Claude Opus 5 schloss alle vier Aufgabenstellungen autonom mit einer Erfolgsquote von 100 Prozent in unter zehn Minuten ab.

    belegt
  • Die Bearbeitungskosten betrugen bei den menschlichen Prüfern rund 10,35 US-Dollar pro Kriterium, während Claude Opus 5 lediglich 0,21 US-Dollar pro Kriterium benötigte.

    eine Quelle

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 04. Oktober 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
2
Verifizierte Aussagen
1 / 3
Beleg-Score
61Solide belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?