Aller au contenu
WorkBench.ai

Benchmark

Première mesure : 27 modèles lisent 100 vraies factures

Le vainqueur coûte 0,0009 $ la facture et n'en rate aucune sur cent. Les deux modèles les plus chers du panel, eux, en ratent une — et trois modèles inventent un numéro de TVA qui n'existe pas.

Le hub publie sa première mesure réelle. Vingt-sept modèles ont lu les mêmes cent factures, et chaque réponse a été comparée à une annotation écrite par un humain.

Les documents ne viennent pas de nous. Ce sont de vraies factures d'achat d'espace publicitaire télévisé, que les chaînes américaines sont tenues de déposer auprès de la Federal Communications Commission et que la loi rend publiques. Des journalistes les ont saisies à la main, champ par champ, pour suivre les dépenses de campagne. C'est cette saisie qui sert de vérité terrain.

Ce que ça donne :

  • Cinq modèles sur vingt-sept lisent le montant total sans une seule erreur sur cent factures.
  • Le premier, GPT-6 Luna, coûte 0,0009 $ la facture — quatre-vingts fois moins que GPT-6 Astra, du même fournisseur, qui en rate une.
  • Trois modèles inventent. Sur un numéro de TVA que ces factures américaines ne portent pas, Kimi K3, Llama 4 Maverick et Mistral Medium ont chacun fabriqué une valeur. Les vingt-quatre autres s'abstiennent correctement.
  • Le dernier du classement laisse près d'une facture sur trois à reprendre à la main, alors qu'il est vendu comme un modèle haut de gamme.

La taille de l'échantillon est ce qui fait la différence entre un classement et une illusion. Sur dix-neuf factures, dix-neuf modèles étaient à égalité parfaite et aucun n'inventait rien. Sur cent, ils ne sont plus que cinq, trois inventions apparaissent, et les deux modèles les plus chers du panel quittent le peloton de tête. Un petit échantillon ne dit pas « ces modèles se valent » : il dit « ce test ne les sépare pas encore ».

Comment on vérifie une réponse, puisque c'est la question qui compte : pas en demandant à une IA de juger une IA. Un comparateur écrit à la main lit la réponse du modèle et l'annotation, et tranche. Un montant est comparé au centime. Quand le comparateur ne sait pas trancher, le document part en relecture humaine plutôt que d'être compté comme faux.

Le barème ne note que ce qui n'admet qu'une seule bonne réponse : le montant total facturé, et le numéro de TVA absent du document. Les autres champs de ces factures — le numéro de contrat, l'annonceur, la période — admettent plusieurs réponses défendables : ces documents portent six identifiants distincts et deux périodes différentes. La question ne leur est donc plus posée du tout, plutôt que d'être posée puis écartée.

Les cent factures ont été lues par les vingt-sept modèles, sans exception. Il a fallu plusieurs reprises pour y arriver : une limite de débit chez un hébergeur ou un modèle trop bavard pour tenir dans la place qu'on lui laisse suffit à rendre une facture inexploitable, et un classement compare des modèles sur les mêmes documents ou ne compare rien.

Ce que cette mesure ne dit pas : les factures sont américaines et en anglais. Elle ne mesure pas l'extraction des lignes de facturation, qui est la vraie difficulté du métier — l'annotation d'origine ne les couvre pas. Et vingt-cinq modèles sur vingt-sept dépassent 97 % : cette tâche reste un seuil d'entrée plutôt qu'un palmarès.

Voir le benchmark — Lecture de factures publicitaires