Décryptage · Le 8 heures IA

Le cache de prompt IA divise par dix le prix du début de vos requêtes

Publié le 23 septembre 2026 · · Lecture 5 min

Article produit par une intelligence artificielle à partir de sources nommées et datées, publié sous la responsabilité éditoriale d’Oriq. Nos systèmes d’IA · Le responsable éditorial

Quand une IA relit le même début de prompt, elle ne le recalcule pas et vous le facture environ un dixième de son prix. Ce mécanisme, appelé cache de prompt, dépend entièrement de l’ordre dans lequel vous écrivez vos instructions. Voici comment il fonctionne, ce qui le casse, et comment le mesurer sur vos propres appels.

Le début de votre prompt est facturé 10 % la deuxième fois

Quand votre logiciel interroge une IA par API, le fournisseur découpe votre texte en tokens et les facture. Le cache de prompt IA introduit une exception : si le début de votre message est exactement identique à celui d’une requête récente, le modèle ne le recalcule pas. La documentation de Mistral AI consacrée au « Prompt caching », consultée le 23 septembre 2026, est explicite : ces tokens réutilisés sont facturés 10 % du prix d’entrée standard, et la réponse arrive plus vite.

Autrement dit, votre longue consigne système, votre procédure de SAV ou votre extrait de catalogue ne coûtent plein tarif qu’une fois. Ensuite, ils coûtent un dixième.

5 tokenssur 1 013 tokens de prompt, seuls 5 sont facturés plein tarif dans l’exemple de facturation publié, les 1 008 autres étant servis depuis le cacheMistral AI, documentation « Prompt caching », consultée le 23 septembre 2026

Le mot à retenir : préfixe

Le cache ne compare pas le sens de vos requêtes, il compare leur début caractère par caractère. Le terme technique est le préfixe. Deux requêtes partagent un préfixe quand elles commencent strictement pareil, jusqu’au premier endroit où elles divergent. À partir de ce point de divergence, tout est recalculé et refacturé.

D’où la règle, simple à réexpliquer à un collègue à midi.

Ce qui ne bouge jamais se met au début du prompt, ce qui change à chaque client se met à la fin. C’est toute la technique.

Deux détails conditionnent le gain. Chez Mistral, le cache fonctionne par blocs de 64 tokens : un prompt plus court que 64 tokens n’obtient jamais de réutilisation. Chez OpenAI, l’annonce « Better prompt caching for GPT-6 » du 22 septembre 2026 indique une remise pouvant aller jusqu’à 90 % sur les tokens d’entrée mis en cache, pour des préfixes éligibles réutilisés dans une fenêtre de 30 minutes. Un assistant sollicité toute la journée en profite. Un script lancé une fois par semaine, non.

Ce qui casse le cache, et la décision qui l’évite

La cause la plus fréquente d’une facture qui double sans explication : quelqu’un a modifié le début du prompt. Une définition d’outil retirée, une consigne glissée en tête, un horodatage automatique inséré à la première ligne. Chaque appel repart alors de zéro.

OpenAI a publié le 22 septembre 2026 un outil de diagnostic qui renvoie directement le motif de l’échec et le volume concerné. L’exemple donné dans l’annonce : motif « tools_changed », 5 629 tokens perdus. Ses recommandations officielles vont toutes dans le même sens : garder les définitions d’outils, les schémas et leur ordre stables, restreindre les outils disponibles plutôt que les supprimer de la liste, ajouter les nouvelles instructions en fin de contexte, et « préchauffer » le cache au démarrage de l’application.

La décision à prendre chez vous tient en une ligne : on verrouille l’en-tête du prompt, on n’ajoute qu’à la fin.

Comment réduire la facture d’un assistant IA sans changer de modèle ?

En réorganisant l’ordre du prompt pour exploiter le cache. Les fournisseurs facturent environ 10 % du prix normal les tokens de début de prompt déjà vus récemment, à condition que ce début soit strictement identique. Il faut donc placer en tête tout ce qui est constant (consignes, procédure, documents de référence) et reléguer en fin de message tout ce qui varie (question du client, date, numéro de dossier). Ce réglage est gratuit et ne modifie ni la qualité ni le contenu des réponses.

Mesurer, plutôt que croire

Pas besoin d’un outil tiers pour vérifier. Chaque réponse d’API renvoie un compteur de tokens mis en cache, à rapporter au total des tokens de prompt. Mistral l’expose dans le champ cached_tokens de la réponse et dans le suivi par modèle de son panneau d’administration. OpenAI a ajouté le 22 septembre 2026 un tableau de bord montrant le taux de réutilisation dans le temps et la part de tokens cachés.

La méthode tient en trois gestes : relever le taux sur dix appels réels, réorganiser le prompt, refaire la mesure. Les retours clients publiés par OpenAI le même jour donnent l’ordre de grandeur atteignable : GitHub Copilot annonce avoir réduit de plus de 50 % la part de tokens de prompt à retraiter, Manus est passé d’environ 85 % à plus de 90 % de taux de cache en moins d’une semaine.

83 % à 91 %progression du taux de cache d’un client cité par OpenAI, avec deux tiers d’écritures de cache en moins et 36 % de coût d’inférence en moinsOpenAI, « Better prompt caching for GPT-6 », 22 septembre 2026

Deux limites à garder en tête. Le cache ne change ni la réponse ni sa qualité : il économise un recalcul, rien d’autre. Et il ne porte jamais sur les tokens de sortie, facturés plein tarif dans tous les cas.

Et dans votre entreprise ?

Premier pas de la semaine, moins d’une heure : demandez à la personne qui gère vos appels API de relever le taux de tokens mis en cache sur dix requêtes réelles, et notez le chiffre. Vous saurez immédiatement s’il y a de l’argent à récupérer, et combien.

Sources

Partager : LinkedIn X

Le 8 heures IA, le magazine quotidien de l’IA

Un article par jour sur l’actualité de l’intelligence artificielle et ce qu’elle change pour votre entreprise. Publié chaque matin à 8h, lu en 3 minutes.

Gratuit. Un email par jour, désabonnement en un clic. Vos données restent en Europe.

Et dans votre entreprise, l’IA en est où ?

Un expert Oriq analyse gratuitement vos besoins et vous rend un avis clair sous 24 heures. Nous formons aussi vos équipes, dans vos locaux : ateliers, formations métier, conférences.

Demander mon audit gratuit

Gratuit, sans engagement · Formations et conférences IA · Données hébergées en Europe