Die Debatte über die Leistungsfähigkeit künstlicher Intelligenz im Finanzsektor hat eine neue empirische Grundlage erhalten. Am 1. Oktober 2026 veröffentlichte die Talent- und Evaluierungsplattform Mercor die Ergebnisse einer detaillierten Untersuchung des Autors Aden Barton, die auf dem eigens entwickelten APEX-Accounting Benchmark basiert. Die Studie verglich das Vorgehen menschlicher Fachkräfte direkt mit einem modernen Frontier-Modell bei der Bewältigung komplexer buchhalterischer Aufgaben. Die dokumentierten Ergebnisse werfen fundamentale Fragen über die zukünftige Aufgabenverteilung in Wirtschaftsprüfung und Controlling auf.
Für den empirischen Härtetest wählte Mercor zwölf lizenzierte US-Wirtschaftsprüfer aus, die über eine durchschnittliche Berufserfahrung von 5,4 Jahren verfügten. Die Fachleute wurden mit vier realitätsnahen Szenarien des regulären Monatsabschlusses konfrontiert, darunter detaillierte Leasing-Pläne sowie vielschichtige Abstimmungen von Umsätzen und Provisionszahlungen. Diese Testfälle spiegeln den typischen Arbeitsalltag qualifizierter Finanzexperten wider, der traditionell ein hohes Maß an analytischer Sorgfalt erfordert. Bislang galt in vielen Unternehmen die Annahme, dass solche dokumentenübergreifenden Abgleiche von Menschen verlässlicher gelöst werden als von automatisierten Systemen.
Das tatsächliche Abschneiden der menschlichen Prüfer offenbarte jedoch erhebliche Fehlerquellen im manuellen Prozess. Im Durchschnitt erreichten die beteiligten Wirtschaftsprüfer bei den vier Szenarien eine Genauigkeitsquote von lediglich 37 Prozent. Für die Bearbeitung der Aufgaben benötigten die Fachkräfte zwischen 30 und 180 Minuten, da vielschichtige Verträge und Zahlenwerke abgeglichen werden mussten. Diese beträchtliche Arbeitszeit spiegelte sich auch in den Kosten wider, die Mercor auf durchschnittlich rund 10,35 US-Dollar pro geprüftem Kriterium bezifferte.
Demgegenüber lieferte das Frontier-Modell Claude Opus 5 eine fehlerfreie Demonstration automatisierter Datenverarbeitung. Das KI-System bewältigte sämtliche vorgegebenen Aufgabenstellungen autonom mit einer Erfolgsquote von 100 Prozent und benötigte für den gesamten Durchlauf weniger als zehn Minuten. Gleichzeitig brachen die operativen Aufwendungen radikal ein, da die Berechnungskosten für das Modell bei lediglich 0,21 US-Dollar pro Kriterium lagen. Der direkte Vergleich markiert eine drastische Reduktion sowohl des zeitlichen als auch des finanziellen Aufwands.
Die Resultate liefern den ersten belastbaren empirischen Nachweis dafür, dass agentenbasierte Workflows menschlichen Fachkräften bei komplexen Dokumentenabgleichen überlegen sein können. Bislang beschränkte sich der Einsatz von KI in Finanzabteilungen weitgehend auf einfache, repetitive Buchungsabläufe. Die Ergebnisse des APEX-Benchmarks belegen nun, dass autonome Modelle deterministische Fehlerraten bei anspruchsvollen Kontrollmechanismen drastisch senken können. Damit geraten etablierte Annahmen über die Notwendigkeit manueller Überprüfungen im Rechnungswesen ins Wanken.
Für Wirtschaftsprüfungsgesellschaften und Finanzabteilungen zeichnet sich infolge dieser Datenlage eine tiefgreifende Restrukturierung ab. Wenn autonome Agenten Monatsabschlüsse in einem Bruchteil der Zeit und mit fehlerfreier Präzision abwickeln, wird sich das Berufsbild von Buchhaltern und Prüfern grundlegend verändern. Anstelle manueller Tabellenabgleiche rücken künftig die strategische Überwachung der Systeme und die Interpretation übergeordneter Finanzdaten in den Mittelpunkt. Die Studie von Mercor signalisiert, dass die Ära der manuellen Beleg- und Vertragsprüfung im institutionellen Finanzwesen ihrem Ende entgegengehen könnte.

