Benchmark · Finance
FinanceBench : ATG analyse vite et bien les rapports financiers
Le test : 150 questions pointues dont les réponses sont dans de longs rapports financiers.
En bref
- Sur les 150 questions publiques de FinanceBench, ATG répond correctement à 138 questions (92 %) en cherchant lui-même dans 368 rapports financiers, soit environ 53 900 pages.
- Dans les mêmes conditions, Mistral annonce 86 % de réponses justes avec son Agentic Search (août 2026), pour une latence moyenne de 71 s, contre 11 s pour ATG.
Le test
Qu'est-ce que FinanceBench ?
FinanceBench est un jeu de questions public publié fin 2023 par Patronus AI pour mesurer la capacité d'une IA à répondre à des questions d'analyste financier à partir de documents réels : rapports annuels (10-K), trimestriels (10-Q), communiqués (8-K) et transcriptions de conférences de résultats.
Les questions ont une réponse unique et vérifiable : un montant, un ratio, une explication tirée du rapport. Leur difficulté vient des documents : rapports de 150 pages en moyenne, chiffres dans des tableaux, calculs à faire à partir de plusieurs lignes, vocabulaire comptable.
- 150
- questions publiques
- 368
- rapports SEC
- ~53 900
- pages à fouiller
Trois familles de questions
Extraction de métriques
Retrouver ou calculer un indicateur : dépenses d'investissement, marge opérationnelle, ratio de liquidité.
Questions d'analyste
Questions génériques qu'un analyste pose sur toute entreprise : l'entreprise est-elle à forte intensité capitalistique ?
Questions spécifiques
Questions propres à une entreprise et à un rapport, qui demandent de raisonner sur son contenu.
Résultats et comparatif
Corpus partagé
Tous les rapports dans une seule base, sans indiquer lequel contient la réponse. Les conditions réelles.
ATG, Fournisseurs européens uniquement, mode rapideExactitude93 %Latence moyenne31 s
ATG, Fournisseurs mondiaux, mode rapideExactitude92 %Latence moyenne11 s
Mistral Agentic Search, GLM-5.2, recherche + navigationExactitude86 %Latence moyenne71 s
Dewey, Claude Opus 4.6, recherche agentiqueExactitude84 %Latence moyennenon publié
Mistral Agentic Search, Mistral Medium 3.5, recherche + navigation *Exactitude83 %Latence moyenne71 s
Mistral Agentic Search, Mistral Medium 3.5, recherche seule *Exactitude74 %Latence moyenne108 s
Dewey, GPT-5.4, recherche agentiqueExactitude63 %Latence moyennenon publié- FinSage, GPT-4o, RAG multi-aspects149 questions, 83 rapportsExactitude57 %Latence moyennenon publié
Balyasny, GPT-4o, RAG amélioré, embeddings BAMExactitude55 %Latence moyennenon publié
Unstructured, GPT-4, découpage par éléments141 questions, 80 rapportsExactitude53 %Latence moyennenon publié
Balyasny, GPT-4o, RAG amélioré, embeddings ada-002Exactitude47 %Latence moyennenon publié
Ragie, base partagée (top-k 8)Exactitude27 %Latence moyennenon publié
Mistral, Mistral Medium 3.5, RAG en un passageExactitude27 %Latence moyennenon publiéGPT-4 Turbo, base vectorielle partagéeExactitude19 %Latence moyennenon publié
Tous les résultats publiés
Le tableau complet, sans filtre : chaque score avec ses conditions de test, son périmètre, sa méthode de notation et sa source.
| Système | Conditions | Exactitude | Latence moyenne | Périmètre | Notation | Source |
|---|---|---|---|---|---|---|
| Sans document | 9 % | non publié | Benchmark complet | Relecture humaine | Islam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20 | |
| Corpus partagé | 93 % | 31 s | Benchmark complet | Juge LLM + relecture humaine | Ce test (2026-10-02) | |
| Corpus partagé | 92 % | 11 s | Benchmark complet | Juge LLM + relecture humaine | Ce test (2026-10-02) | |
| Corpus partagé | 86 % | 71 s | Benchmark complet | Juge LLM | Mistral AI, Agentic Search2026-08-20 | |
| Corpus partagé | 84 % | non publié | Benchmark complet | Comparaison numérique + juge LLM | Dewey, financebench-eval (GitHub)2026-04-08 | |
| Corpus partagé | 83 % * | 71 s | Benchmark complet | Juge LLM | Mistral AI, Agentic Search2026-08-20 | |
| Corpus partagé | 74 % * | 108 s | Benchmark complet | Juge LLM | Mistral AI, Agentic Search2026-08-20 | |
| Corpus partagé | 63 % | non publié | Benchmark complet | Comparaison numérique + juge LLM | Dewey, financebench-eval (GitHub)2026-04-08 | |
| FinSageGPT-4o, RAG multi-aspects | Corpus partagé | 57 % | non publié | 149 questions, 83 rapports | Relecture humaine | Wang et al., FinSage (CIKM 2025), arXiv:2504.144932025-04-20 |
| Corpus partagé | 55 % | non publié | Benchmark complet | Relecture humaine | Anderson et al. (Balyasny Asset Management), arXiv:2411.071422024-11-11 | |
| Corpus partagé | 53 % | non publié | 141 questions, 80 rapports | Relecture humaine | Jimeno Yepes et al. (Unstructured), arXiv:2402.051312024-02-05 | |
| Corpus partagé | 47 % | non publié | Benchmark complet | Relecture humaine | Anderson et al. (Balyasny Asset Management), arXiv:2411.071422024-11-11 | |
| Corpus partagé | 27 % | non publié | Benchmark complet | Non précisée | Ragie, How Ragie Outperformed the FinanceBench Test2024-10-22 | |
| Corpus partagé | 27 % | non publié | Benchmark complet | Juge LLM | Mistral AI, Agentic Search2026-08-20 | |
| Corpus partagé | 19 % | non publié | Benchmark complet | Relecture humaine | Islam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20 | |
| FinanceBench_RAGrecherche hybride par page | Un seul rapport, indexé | 76 % | non publié | Benchmark completFiltres entreprise et année appliqués avant la recherche. | Non précisée | FinanceBench_RAG (GitHub, aquib8112)2026-02-28 |
| Un seul rapport, indexé | 51 % | non publié | Benchmark complet | Non précisée | Ragie, How Ragie Outperformed the FinanceBench Test2024-10-22 | |
| Un seul rapport, indexé | 50 % | non publié | Benchmark complet | Relecture humaine | Islam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20 | |
| Rapport entier fourni | 79 % | non publié | Benchmark complet | Relecture humaine | Islam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20 | |
| Page exacte fournie | 85 % | non publié | Benchmark complet | Relecture humaine | Islam et al., FinanceBench (Patronus AI), arXiv:2311.119442023-11-20 | |
| Pathwaypipeline multi-agents, avec clarifications d'un humain | Conditions non précisées | 56 % | non publié | Nombre de questions non préciséUn humain répond aux demandes de précision : score non autonome. Modèle et notation non précisés. | Non précisée | Pathway, AI for SEC filings analysis2025-07-09 |
| Pathwaypipeline multi-agents | Conditions non précisées | 42 % | non publié | Nombre de questions non préciséModèle et notation non précisés. | Non précisée | Pathway, AI for SEC filings analysis2025-07-09 |
| PathwayRAG simple | Conditions non précisées | 24 % | non publié | Nombre de questions non préciséModèle et notation non précisés. | Non précisée | Pathway, AI for SEC filings analysis2025-07-09 |
Chiffres tiers repris de leurs publications, sans les refaire tourner. Un périmètre réduit (moins de questions ou de rapports) rend le test plus facile. * Calculé à partir des écarts publiés par la source.
Protocole
Comment nous avons testé
- 1
Un seul corpus
Les 368 rapports sont importés tels quels dans une base de connaissances ATG standard, comme le ferait un client.
- 2
Aucun fichier indiqué
Chaque question est posée seule, dans une nouvelle conversation. ATG doit trouver le bon document parmi les 368 sans qu'on le lui indique. Pour 11 questions dont l'énoncé d'origine ne nomme ni l'entreprise ni la période, une phrase fixe les précise (« Added note by ATG for disambiguation »), sans changer le reste de la question.
- 3
Notation
Un juge LLM indépendant (Mistral Medium 3.5) compare chaque réponse à la réponse de référence. Dans chaque test, 4 verdicts ont été corrigés par une relecture humaine, avec sa justification dans le rapport. Une question sans réponse compte comme une erreur.
- 4
Latence de bout en bout
Temps mesuré entre l'envoi de la question et la fin de la réponse, recherche comprise, avec les questions posées une par une. Les rapports donnent la moyenne, la médiane et le p90.
Transparence
Chaque rapport téléchargeable détaille notre méthodologie puis, pour chacune des 150 questions, la réponse attendue, la réponse obtenue par ATG et le verdict. Chacun peut vérifier une notation et la contester.
Résultats
Ce que donne ATG, politique IA par politique IA
Les configurations testées
Une ligne par politique IA, toutes deux en mode rapide. Chaque ligne est un passage complet sur les 150 questions.
| Politique IA | rapide |
|---|---|
| Fournisseurs mondiaux | Mise en avant 92 % 138 / 150 réponses justes
|
| Fournisseurs européens uniquement | 93 % 139 / 150 réponses justes
|
Exactitude et temps de réponse
Plus un point est haut et à gauche, plus la réponse est juste et rapide.
Comparaison
Face à Mistral Agentic Search
Le 20 août 2026, Mistral a publié ses résultats sur FinanceBench : mêmes 150 questions, mêmes 368 rapports, avec une recherche agentique qui enchaîne les recherches et navigue dans les documents. C'est aujourd'hui le résultat publié le plus proche de nos conditions.
Deux différences avec notre protocole : Mistral note les réponses avec un juge LLM calibré sur des étiquettes humaines, et publie sa latence sur l'ensemble du benchmark (moyenne et p90), pas modèle par modèle.
×6,8
En mode rapide, ATG répond en 11 s en moyenne, contre 71 s pour la configuration la plus rapide publiée par Mistral AI : des réponses 6,8 fois plus rapides.
Exactitude
ATG, Fournisseurs européens uniquement, mode rapide
93 %ATG, Fournisseurs mondiaux, mode rapide
92 %
Mistral Agentic Search, GLM-5.2, recherche + navigation86 %
Mistral Agentic Search, Mistral Medium 3.5, recherche + navigation *83 %
Mistral Agentic Search, Mistral Medium 3.5, recherche seule *74 %
Mistral, Mistral Medium 3.5, RAG en un passage27 %
Latence moyenne
ATG, Fournisseurs européens uniquement, mode rapide
31 sATG, Fournisseurs mondiaux, mode rapide
11 s
Mistral Agentic Search, GLM-5.2, recherche + navigation71 s
Mistral Agentic Search, Mistral Medium 3.5, recherche + navigation *71 s
Mistral Agentic Search, Mistral Medium 3.5, recherche seule *108 s
Mistral, Mistral Medium 3.5, RAG en un passagenon publié
Chiffres Mistral repris de leur article, non reproduits par nous. * Calculé à partir des écarts publiés par la source.
Exemple
Exemple : une question et la réponse d'ATG
Question (jeu de test, en anglais)
What is the FY2018 capital expenditure amount (in USD millions) for 3M? Give a response to the question by relying on the details shown in the cash flow statement.
Réponse attendue
$1577.00
Réponse d'ATG (politique non restreinte, mode rapide)
$1,577 million. Per 3M's Consolidated Statement of Cash Flows (fiscal year ended December 31, 2018), the line « Purchases of property, plant and equipment (PP&E) » under Cash Flows from Investing Activities is $(1,577) million, which is the capital expenditure figure.
Document cité par ATG
3M_2018_10K.pdf
Verdict : Correct, réponse en 7 secondes
Télécharger les résultats
Un rapport par configuration, avec le protocole, les résultats et, pour chaque question, la réponse d'ATG et son verdict. Libre d'accès, sans formulaire.
| Politique IA | rapide |
|---|---|
| Fournisseurs mondiaux | PDF, Fournisseurs mondiaux, rapide |
| Fournisseurs européens uniquement | PDF, Fournisseurs européens uniquement, rapide |
Questions fréquentes
Pourquoi FinanceBench plutôt qu'un autre benchmark ?
Chercheurs et éditeurs publient leurs scores sur FinanceBench. C'est ce qui nous permet de nous comparer à des résultats que nous n'avons pas produits nous-mêmes, sur de vrais documents financiers.
Pourquoi ne pas avoir fait tourner vous-mêmes les autres solutions ?
Pour éviter de comparer une solution que nous maîtrisons à des solutions que nous configurerions mal. Nous citons les chiffres que chaque éditeur ou chercheur a publiés, avec leurs conditions de test, et nous les rangeons par niveau de difficulté.
Quelle différence entre fournisseurs mondiaux et européens uniquement ?
C'est la politique IA choisie par l'administrateur. « Fournisseurs européens uniquement » limite le traitement aux fournisseurs européens (Mistral, Scaleway, Nebius) ; « mondiaux » (politique non restreinte) ajoute notamment OpenAI et Google. Nous avons passé le test avec les deux pour que chacun connaisse le prix, en précision et en vitesse, de son choix.
Que signifie le mode rapide ?
Le mode rapide (« Fast » dans les rapports) est le mode d'ATG qui privilégie le temps de réponse. Les deux tests ont été passés dans ce mode. Les modes Auto et Thinking, qui laissent plus de temps au raisonnement, ne font pas partie de ce benchmark.
Les résultats sont-ils valables pour mes documents ?
Ils donnent un ordre de grandeur sur des documents financiers longs et chargés en tableaux. Le meilleur test reste vos propres documents : nous pouvons mesurer la précision d'ATG sur un échantillon de vos questions pendant une démo.
Et sur vos propres rapports ?
Importez vos rapports financiers, posez les questions de vos équipes et mesurez vous-même la précision des réponses.