Décryptage · Le 8 heures IA

Le vrai prix d’une IA, c’est son coût par tâche réussie, pas son tarif au token

Publié le 12 septembre 2026 · · Lecture 5 min

Comparer deux IA sur leur prix au million de tokens revient à choisir une voiture sur le prix du plein. Un banc d’essai publié le 11 septembre 2026 par AWS et OpenAI chiffre l’écart entre le prix affiché et le prix réellement payé par tâche réussie. Voici la méthode pour refaire la mesure chez vous, avec vos propres dossiers.

Le prix au token ne dit pas ce que vous allez payer

Le 11 septembre 2026, AWS et OpenAI ont publié ensemble un banc d’essai open source qui mesure une chose simple : le coût par tâche réussie, et non le prix au million de tokens. La différence est loin d’être théorique.

Sur un test de mathématiques, et après la baisse de prix du 30 juillet 2026, le modèle haut de gamme (« Luna ») revient à 0,0021 dollar par bonne réponse. Le petit modèle « mini », réputé économique, revient à 0,0139 dollar. Soit 6,6 fois plus cher à l’arrivée, alors que son tarif affiché était plus bas au départ.

L’explication tient en deux mots : taux de réussite. Sur le même échantillon, le modèle haut de gamme réussit 75 % des problèmes contre 37 % pour le mini, 82 % contre 59 % sur un test de connaissances générales. Chaque échec se paie deux fois : le calcul raté, puis celui qu’il faut refaire.

6,6×l’écart de coût par bonne réponse entre le modèle haut de gamme et le petit modèle, sur le même testAWS Machine Learning Blog, 11 septembre 2026

Un modèle qui se trompe une fois sur deux ne coûte pas moitié moins cher : il coûte deux fois, plus la reprise humaine.

Les allers-retours, la ligne de facture que personne ne regarde

Quand une IA travaille en plusieurs étapes (chercher, vérifier, reformuler), l’historique complet de la conversation lui est renvoyé à chaque tour. Le volume facturé en entrée gonfle donc beaucoup plus vite que le nombre d’étapes.

Le banc d’essai le chiffre sur 50 questions de recherche web : 7,6 tours par question pour le petit modèle, et 114 000 tokens d’entrée facturés par question, contre 50 000 pour un modèle plus capable qui tranche plus vite. Le coût par réponse validée finit à 0,40 dollar pour le premier, 0,31 dollar pour le second, avec une qualité supérieure.

Même renversement avec le modèle le moins cher du catalogue, « nano » : prix nominal plus bas, mais 18 % de réussite seulement, donc 0,07 dollar par réponse validée contre 0,05 dollar pour le modèle haut de gamme.

114 000 tokensfacturés en entrée par question pour le petit modèle, contre 50 000 pour un modèle plus capable, à cause du nombre d’allers-retoursAWS Machine Learning Blog, 11 septembre 2026

Comment savoir quel modèle d’IA coûte vraiment le moins cher à mon entreprise ?

Divisez votre facture IA du mois par le nombre de tâches passées sans reprise humaine. Ce rapport, le coût par tâche réussie, est le seul comparable d’un modèle à l’autre. Testez ensuite deux modèles sur les mêmes 50 dossiers déjà traités et validés par vos équipes, en comparant leurs réponses aux vôtres. Le classement obtenu ne ressemblera pas à celui des grilles tarifaires.

Le test qui ressemble le plus à votre quotidien

Les tests de mathématiques impressionnent, mais un dirigeant achète des livrables. Le banc d’essai inclut donc 48 livrables professionnels réels, notés à la grille, avec un seuil d’acceptation fixé à 70 % des points.

Résultat : 56 % de livrables acceptés pour le modèle haut de gamme, 42 % pour le mini, 35 % pour le nano. Le coût par livrable accepté suit la même logique inversée : 0,010 dollar contre 0,030 dollar pour le mini. Sur les 48 livrables, le modèle haut de gamme fait mieux 31 fois, moins bien 9 fois, à égalité 8 fois.

Dernier point qui doit vous rendre méfiant vis-à-vis de tout comparatif figé : une baisse de prix de 80 % sur un modèle et de 20 % sur un autre, effective le 30 juillet 2026, a suffi à modifier le classement. Un comparatif daté d’avant l’été ne décrivait plus la même réalité en septembre.

Ce que ces chiffres ne prouvent pas

La méthode est reprenable, le palmarès ne l’est pas. Les auteurs le disent eux-mêmes : échantillons de 48 à 198 items, mode de raisonnement désactivé, notation par un modèle juge, sortie plafonnée qui a tronqué quelques livrables. Le billet est co-signé par les deux entreprises concernées.

Deux réserves comptent particulièrement en France. D’abord, les modèles cités ne sont listés chez AWS que dans trois régions américaines, aucune région européenne : à écarter tels quels pour des données personnelles ou sensibles sans analyse RGPD préalable. Le même protocole s’applique parfaitement aux offres européennes, c’est l’intérêt d’une méthode.

Ensuite, un coût par tâche réussie ne veut rien dire tant que vous n’avez pas écrit ce qu’est une tâche réussie chez vous, relecture humaine comprise.

Et dans votre entreprise ?

Cette semaine, en moins d’une heure : réunissez 50 dossiers traités le mois dernier, et écrivez en trois lignes ce qui fait qu’une réponse est acceptable sans retouche. Le reste de la mesure en découle.

Sources

Partager : LinkedIn X

Le 8 heures IA, le magazine quotidien de l’IA

Un article par jour sur l’actualité de l’intelligence artificielle et ce qu’elle change pour votre entreprise. Publié chaque matin à 8h, lu en 3 minutes.

Gratuit. Un email par jour, désabonnement en un clic. Vos données restent en Europe.

Et dans votre entreprise, l’IA en est où ?

Un expert Oriq analyse gratuitement vos besoins et vous rend un avis clair sous 24 heures. Nous formons aussi vos équipes, dans vos locaux : ateliers, formations métier, conférences.

Demander mon audit gratuit

Gratuit, sans engagement · Formations et conférences IA · Données hébergées en Europe