Benchmark · Finance

FinanceBench : ATG analyse vite et bien les rapports financiers

Le test : 150 questions pointues dont les réponses sont dans de longs rapports financiers.

Par Jean-Christophe BudinMis à jour le

En bref

  • Sur les 150 questions publiques de FinanceBench, ATG répond correctement à 138 questions (92 %) en cherchant lui-même dans 368 rapports financiers, soit environ 53 900 pages.
  • Dans les mêmes conditions, Mistral annonce 86 % de réponses justes avec son Agentic Search (août 2026), pour une latence moyenne de 71 s, contre 11 s pour ATG.

Le test

Qu'est-ce que FinanceBench ?

FinanceBench est un jeu de questions public publié fin 2023 par Patronus AI pour mesurer la capacité d'une IA à répondre à des questions d'analyste financier à partir de documents réels : rapports annuels (10-K), trimestriels (10-Q), communiqués (8-K) et transcriptions de conférences de résultats.

Les questions ont une réponse unique et vérifiable : un montant, un ratio, une explication tirée du rapport. Leur difficulté vient des documents : rapports de 150 pages en moyenne, chiffres dans des tableaux, calculs à faire à partir de plusieurs lignes, vocabulaire comptable.

150
questions publiques
368
rapports SEC
~53 900
pages à fouiller

Trois familles de questions

Extraction de métriques

Retrouver ou calculer un indicateur : dépenses d'investissement, marge opérationnelle, ratio de liquidité.

Questions d'analyste

Questions génériques qu'un analyste pose sur toute entreprise : l'entreprise est-elle à forte intensité capitalistique ?

Questions spécifiques

Questions propres à une entreprise et à un rapport, qui demandent de raisonner sur son contenu.

Résultats et comparatif

Qui
Conditions de test

Corpus partagé

Tous les rapports dans une seule base, sans indiquer lequel contient la réponse. Les conditions réelles.

  • ATG, Fournisseurs européens uniquement, mode rapideExactitude93 %Latence moyenne31 s
  • ATG, Fournisseurs mondiaux, mode rapideExactitude92 %Latence moyenne11 s
  • Mistral Agentic Search, GLM-5.2, recherche + navigationExactitude86 %Latence moyenne71 s
  • Dewey, Claude Opus 4.6, recherche agentiqueExactitude84 %Latence moyennenon publié
  • Mistral Agentic Search, Mistral Medium 3.5, recherche + navigation *Exactitude83 %Latence moyenne71 s
  • Mistral Agentic Search, Mistral Medium 3.5, recherche seule *Exactitude74 %Latence moyenne108 s
  • Dewey, GPT-5.4, recherche agentiqueExactitude63 %Latence moyennenon publié
  • FinSage, GPT-4o, RAG multi-aspects149 questions, 83 rapportsExactitude57 %Latence moyennenon publié
  • Balyasny, GPT-4o, RAG amélioré, embeddings BAMExactitude55 %Latence moyennenon publié
  • Unstructured, GPT-4, découpage par éléments141 questions, 80 rapportsExactitude53 %Latence moyennenon publié
  • Balyasny, GPT-4o, RAG amélioré, embeddings ada-002Exactitude47 %Latence moyennenon publié
  • Ragie, base partagée (top-k 8)Exactitude27 %Latence moyennenon publié
  • Mistral, Mistral Medium 3.5, RAG en un passageExactitude27 %Latence moyennenon publié
  • GPT-4 Turbo, base vectorielle partagéeExactitude19 %Latence moyennenon publié

Tous les résultats publiés

Le tableau complet, sans filtre : chaque score avec ses conditions de test, son périmètre, sa méthode de notation et sa source.

Tous les résultats publiés
SystèmeConditionsExactitudeLatence moyennePérimètreNotationSource
GPT-4 TurboSans document9 %non publiéBenchmark completRelecture humaineIslam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20
ATGFournisseurs européens uniquement, mode rapideCorpus partagé93 %31 sBenchmark completJuge LLM + relecture humaineCe test (2026-10-02)
ATGFournisseurs mondiaux, mode rapideCorpus partagé92 %11 sBenchmark completJuge LLM + relecture humaineCe test (2026-10-02)
Mistral Agentic SearchGLM-5.2, recherche + navigationCorpus partagé86 %71 sBenchmark completJuge LLMMistral AI, Agentic Search2026-08-20
DeweyClaude Opus 4.6, recherche agentiqueCorpus partagé84 %non publiéBenchmark completComparaison numérique + juge LLMDewey, financebench-eval (GitHub)2026-04-08
Mistral Agentic SearchMistral Medium 3.5, recherche + navigationCorpus partagé83 % *71 sBenchmark completJuge LLMMistral AI, Agentic Search2026-08-20
Mistral Agentic SearchMistral Medium 3.5, recherche seuleCorpus partagé74 % *108 sBenchmark completJuge LLMMistral AI, Agentic Search2026-08-20
DeweyGPT-5.4, recherche agentiqueCorpus partagé63 %non publiéBenchmark completComparaison numérique + juge LLMDewey, financebench-eval (GitHub)2026-04-08
FinSageGPT-4o, RAG multi-aspectsCorpus partagé57 %non publié149 questions, 83 rapportsRelecture humaineWang et al., FinSage (CIKM 2025), arXiv:2504.144932025-04-20
BalyasnyGPT-4o, RAG amélioré, embeddings BAMCorpus partagé55 %non publiéBenchmark completRelecture humaineAnderson et al. (Balyasny Asset Management), arXiv:2411.071422024-11-11
UnstructuredGPT-4, découpage par élémentsCorpus partagé53 %non publié141 questions, 80 rapportsRelecture humaineJimeno Yepes et al. (Unstructured), arXiv:2402.051312024-02-05
BalyasnyGPT-4o, RAG amélioré, embeddings ada-002Corpus partagé47 %non publiéBenchmark completRelecture humaineAnderson et al. (Balyasny Asset Management), arXiv:2411.071422024-11-11
Ragiebase partagée (top-k 8)Corpus partagé27 %non publiéBenchmark completNon préciséeRagie, How Ragie Outperformed the FinanceBench Test2024-10-22
MistralMistral Medium 3.5, RAG en un passageCorpus partagé27 %non publiéBenchmark completJuge LLMMistral AI, Agentic Search2026-08-20
GPT-4 Turbobase vectorielle partagéeCorpus partagé19 %non publiéBenchmark completRelecture humaineIslam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20
FinanceBench_RAGrecherche hybride par pageUn seul rapport, indexé76 %non publiéBenchmark completFiltres entreprise et année appliqués avant la recherche.Non préciséeFinanceBench_RAG (GitHub, aquib8112)2026-02-28
Ragiebase par document (top-k 32)Un seul rapport, indexé51 %non publiéBenchmark completNon préciséeRagie, How Ragie Outperformed the FinanceBench Test2024-10-22
GPT-4 Turbobase vectorielle par documentUn seul rapport, indexé50 %non publiéBenchmark completRelecture humaineIslam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20
GPT-4 TurboRapport entier fourni79 %non publiéBenchmark completRelecture humaineIslam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20
GPT-4 TurboPage exacte fournie85 %non publiéBenchmark completRelecture humaineIslam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20
Pathwaypipeline multi-agents, avec clarifications d'un humainConditions non précisées56 %non publiéNombre de questions non préciséUn humain répond aux demandes de précision : score non autonome. Modèle et notation non précisés.Non préciséePathway, AI for SEC filings analysis2025-07-09
Pathwaypipeline multi-agentsConditions non précisées42 %non publiéNombre de questions non préciséModèle et notation non précisés.Non préciséePathway, AI for SEC filings analysis2025-07-09
PathwayRAG simpleConditions non précisées24 %non publiéNombre de questions non préciséModèle et notation non précisés.Non préciséePathway, AI for SEC filings analysis2025-07-09

Chiffres tiers repris de leurs publications, sans les refaire tourner. Un périmètre réduit (moins de questions ou de rapports) rend le test plus facile. * Calculé à partir des écarts publiés par la source.

Protocole

Comment nous avons testé

  1. 1

    Un seul corpus

    Les 368 rapports sont importés tels quels dans une base de connaissances ATG standard, comme le ferait un client.

  2. 2

    Aucun fichier indiqué

    Chaque question est posée seule, dans une nouvelle conversation. ATG doit trouver le bon document parmi les 368 sans qu'on le lui indique. Pour 11 questions dont l'énoncé d'origine ne nomme ni l'entreprise ni la période, une phrase fixe les précise (« Added note by ATG for disambiguation »), sans changer le reste de la question.

  3. 3

    Notation

    Un juge LLM indépendant (Mistral Medium 3.5) compare chaque réponse à la réponse de référence. Dans chaque test, 4 verdicts ont été corrigés par une relecture humaine, avec sa justification dans le rapport. Une question sans réponse compte comme une erreur.

  4. 4

    Latence de bout en bout

    Temps mesuré entre l'envoi de la question et la fin de la réponse, recherche comprise, avec les questions posées une par une. Les rapports donnent la moyenne, la médiane et le p90.

Transparence

Chaque rapport téléchargeable détaille notre méthodologie puis, pour chacune des 150 questions, la réponse attendue, la réponse obtenue par ATG et le verdict. Chacun peut vérifier une notation et la contester.

Résultats

Ce que donne ATG, politique IA par politique IA

Les configurations testées

Une ligne par politique IA, toutes deux en mode rapide. Chaque ligne est un passage complet sur les 150 questions.

Les configurations testées
Politique IArapide
Fournisseurs mondiaux
Mise en avant

92 %

138 / 150 réponses justes

Moyenne
11 s
Fournisseurs européens uniquement

93 %

139 / 150 réponses justes

Moyenne
31 s

Exactitude et temps de réponse

Plus un point est haut et à gauche, plus la réponse est juste et rapide.

60 %70 %80 %90 %100 %050100150Latence moyenne (secondes)Mistral Agentic Search, Mistral Medium 3.5 *Mistral Agentic Search, Mistral Medium 3.5 *Mistral Agentic Search, GLM-5.2rapiderapide
ATG, Fournisseurs mondiauxATG, Fournisseurs européens uniquementMistral AI, Agentic Search

Comparaison

Face à Mistral Agentic Search

Le 20 août 2026, Mistral a publié ses résultats sur FinanceBench : mêmes 150 questions, mêmes 368 rapports, avec une recherche agentique qui enchaîne les recherches et navigue dans les documents. C'est aujourd'hui le résultat publié le plus proche de nos conditions.

Deux différences avec notre protocole : Mistral note les réponses avec un juge LLM calibré sur des étiquettes humaines, et publie sa latence sur l'ensemble du benchmark (moyenne et p90), pas modèle par modèle.

×6,8

En mode rapide, ATG répond en 11 s en moyenne, contre 71 s pour la configuration la plus rapide publiée par Mistral AI : des réponses 6,8 fois plus rapides.

Exactitude

  • ATG, Fournisseurs européens uniquement, mode rapide

    93 %
  • ATG, Fournisseurs mondiaux, mode rapide

    92 %
  • Mistral Agentic Search, GLM-5.2, recherche + navigation

    86 %
  • Mistral Agentic Search, Mistral Medium 3.5, recherche + navigation *

    83 %
  • Mistral Agentic Search, Mistral Medium 3.5, recherche seule *

    74 %
  • Mistral, Mistral Medium 3.5, RAG en un passage

    27 %

Latence moyenne

  • ATG, Fournisseurs européens uniquement, mode rapide

    31 s
  • ATG, Fournisseurs mondiaux, mode rapide

    11 s
  • Mistral Agentic Search, GLM-5.2, recherche + navigation

    71 s
  • Mistral Agentic Search, Mistral Medium 3.5, recherche + navigation *

    71 s
  • Mistral Agentic Search, Mistral Medium 3.5, recherche seule *

    108 s
  • Mistral, Mistral Medium 3.5, RAG en un passage

    non publié

Chiffres Mistral repris de leur article, non reproduits par nous. * Calculé à partir des écarts publiés par la source.

Exemple

Exemple : une question et la réponse d'ATG

  1. Question (jeu de test, en anglais)

    What is the FY2018 capital expenditure amount (in USD millions) for 3M? Give a response to the question by relying on the details shown in the cash flow statement.

  2. Réponse attendue

    $1577.00

  3. Réponse d'ATG (politique non restreinte, mode rapide)

    $1,577 million. Per 3M's Consolidated Statement of Cash Flows (fiscal year ended December 31, 2018), the line « Purchases of property, plant and equipment (PP&E) » under Cash Flows from Investing Activities is $(1,577) million, which is the capital expenditure figure.

  4. Document cité par ATG

    3M_2018_10K.pdf

Verdict : Correct, réponse en 7 secondes

Télécharger les résultats

Un rapport par configuration, avec le protocole, les résultats et, pour chaque question, la réponse d'ATG et son verdict. Libre d'accès, sans formulaire.

Télécharger les résultats
Politique IArapide
Fournisseurs mondiauxPDF, Fournisseurs mondiaux, rapide
Fournisseurs européens uniquementPDF, Fournisseurs européens uniquement, rapide

Questions fréquentes

Pourquoi FinanceBench plutôt qu'un autre benchmark ?

Chercheurs et éditeurs publient leurs scores sur FinanceBench. C'est ce qui nous permet de nous comparer à des résultats que nous n'avons pas produits nous-mêmes, sur de vrais documents financiers.

Pourquoi ne pas avoir fait tourner vous-mêmes les autres solutions ?

Pour éviter de comparer une solution que nous maîtrisons à des solutions que nous configurerions mal. Nous citons les chiffres que chaque éditeur ou chercheur a publiés, avec leurs conditions de test, et nous les rangeons par niveau de difficulté.

Quelle différence entre fournisseurs mondiaux et européens uniquement ?

C'est la politique IA choisie par l'administrateur. « Fournisseurs européens uniquement » limite le traitement aux fournisseurs européens (Mistral, Scaleway, Nebius) ; « mondiaux » (politique non restreinte) ajoute notamment OpenAI et Google. Nous avons passé le test avec les deux pour que chacun connaisse le prix, en précision et en vitesse, de son choix.

Que signifie le mode rapide ?

Le mode rapide (« Fast » dans les rapports) est le mode d'ATG qui privilégie le temps de réponse. Les deux tests ont été passés dans ce mode. Les modes Auto et Thinking, qui laissent plus de temps au raisonnement, ne font pas partie de ce benchmark.

Les résultats sont-ils valables pour mes documents ?

Ils donnent un ordre de grandeur sur des documents financiers longs et chargés en tableaux. Le meilleur test reste vos propres documents : nous pouvons mesurer la précision d'ATG sur un échantillon de vos questions pendant une démo.

Et sur vos propres rapports ?

Importez vos rapports financiers, posez les questions de vos équipes et mesurez vous-même la précision des réponses.