Décryptage · Le 8 heures IA
Le cache de prompt IA divise par dix le prix du début de vos requêtes
Article produit par une intelligence artificielle à partir de sources nommées et datées, publié sous la responsabilité éditoriale d’Oriq. Nos systèmes d’IA · Le responsable éditorial
Quand une IA relit le même début de prompt, elle ne le recalcule pas et vous le facture environ un dixième de son prix. Ce mécanisme, appelé cache de prompt, dépend entièrement de l’ordre dans lequel vous écrivez vos instructions. Voici comment il fonctionne, ce qui le casse, et comment le mesurer sur vos propres appels.
Le début de votre prompt est facturé 10 % la deuxième fois
Quand votre logiciel interroge une IA par API, le fournisseur découpe votre texte en tokens et les facture. Le cache de prompt IA introduit une exception : si le début de votre message est exactement identique à celui d’une requête récente, le modèle ne le recalcule pas. La documentation de Mistral AI consacrée au « Prompt caching », consultée le 23 septembre 2026, est explicite : ces tokens réutilisés sont facturés 10 % du prix d’entrée standard, et la réponse arrive plus vite.
Autrement dit, votre longue consigne système, votre procédure de SAV ou votre extrait de catalogue ne coûtent plein tarif qu’une fois. Ensuite, ils coûtent un dixième.
Le mot à retenir : préfixe
Le cache ne compare pas le sens de vos requêtes, il compare leur début caractère par caractère. Le terme technique est le préfixe. Deux requêtes partagent un préfixe quand elles commencent strictement pareil, jusqu’au premier endroit où elles divergent. À partir de ce point de divergence, tout est recalculé et refacturé.
D’où la règle, simple à réexpliquer à un collègue à midi.
Ce qui ne bouge jamais se met au début du prompt, ce qui change à chaque client se met à la fin. C’est toute la technique.
Deux détails conditionnent le gain. Chez Mistral, le cache fonctionne par blocs de 64 tokens : un prompt plus court que 64 tokens n’obtient jamais de réutilisation. Chez OpenAI, l’annonce « Better prompt caching for GPT-6 » du 22 septembre 2026 indique une remise pouvant aller jusqu’à 90 % sur les tokens d’entrée mis en cache, pour des préfixes éligibles réutilisés dans une fenêtre de 30 minutes. Un assistant sollicité toute la journée en profite. Un script lancé une fois par semaine, non.
Ce qui casse le cache, et la décision qui l’évite
La cause la plus fréquente d’une facture qui double sans explication : quelqu’un a modifié le début du prompt. Une définition d’outil retirée, une consigne glissée en tête, un horodatage automatique inséré à la première ligne. Chaque appel repart alors de zéro.
OpenAI a publié le 22 septembre 2026 un outil de diagnostic qui renvoie directement le motif de l’échec et le volume concerné. L’exemple donné dans l’annonce : motif « tools_changed », 5 629 tokens perdus. Ses recommandations officielles vont toutes dans le même sens : garder les définitions d’outils, les schémas et leur ordre stables, restreindre les outils disponibles plutôt que les supprimer de la liste, ajouter les nouvelles instructions en fin de contexte, et « préchauffer » le cache au démarrage de l’application.
La décision à prendre chez vous tient en une ligne : on verrouille l’en-tête du prompt, on n’ajoute qu’à la fin.
Comment réduire la facture d’un assistant IA sans changer de modèle ?
En réorganisant l’ordre du prompt pour exploiter le cache. Les fournisseurs facturent environ 10 % du prix normal les tokens de début de prompt déjà vus récemment, à condition que ce début soit strictement identique. Il faut donc placer en tête tout ce qui est constant (consignes, procédure, documents de référence) et reléguer en fin de message tout ce qui varie (question du client, date, numéro de dossier). Ce réglage est gratuit et ne modifie ni la qualité ni le contenu des réponses.
Mesurer, plutôt que croire
Pas besoin d’un outil tiers pour vérifier. Chaque réponse d’API renvoie un compteur de tokens mis en cache, à rapporter au total des tokens de prompt. Mistral l’expose dans le champ cached_tokens de la réponse et dans le suivi par modèle de son panneau d’administration. OpenAI a ajouté le 22 septembre 2026 un tableau de bord montrant le taux de réutilisation dans le temps et la part de tokens cachés.
La méthode tient en trois gestes : relever le taux sur dix appels réels, réorganiser le prompt, refaire la mesure. Les retours clients publiés par OpenAI le même jour donnent l’ordre de grandeur atteignable : GitHub Copilot annonce avoir réduit de plus de 50 % la part de tokens de prompt à retraiter, Manus est passé d’environ 85 % à plus de 90 % de taux de cache en moins d’une semaine.
Deux limites à garder en tête. Le cache ne change ni la réponse ni sa qualité : il économise un recalcul, rien d’autre. Et il ne porte jamais sur les tokens de sortie, facturés plein tarif dans tous les cas.
Et dans votre entreprise ?
- Ouvrez le prompt de votre assistant le plus sollicité (support, devis, rédaction d’offres) et déplacez en fin de message tout ce qui varie : nom du client, date, numéro de dossier, question du jour.
- Attribuez un identifiant de session stable par dossier client si votre fournisseur le propose, et figez la version du prompt système au lieu de la retoucher chaque semaine. N’y mettez aucune donnée sensible ni clé d’accès : la documentation de Mistral l’interdit explicitement.
- La prochaine fois que le coût par échange grimpe, cherchez d’abord ce qui a changé au début du prompt avant d’accuser le modèle.
Premier pas de la semaine, moins d’une heure : demandez à la personne qui gère vos appels API de relever le taux de tokens mis en cache sur dix requêtes réelles, et notez le chiffre. Vous saurez immédiatement s’il y a de l’argent à récupérer, et combien.
Sources
Le 8 heures IA, le magazine quotidien de l’IA
Un article par jour sur l’actualité de l’intelligence artificielle et ce qu’elle change pour votre entreprise. Publié chaque matin à 8h, lu en 3 minutes.
Gratuit. Un email par jour, désabonnement en un clic. Vos données restent en Europe.
Et dans votre entreprise, l’IA en est où ?
Un expert Oriq analyse gratuitement vos besoins et vous rend un avis clair sous 24 heures. Nous formons aussi vos équipes, dans vos locaux : ateliers, formations métier, conférences.
Demander mon audit gratuitGratuit, sans engagement · Formations et conférences IA · Données hébergées en Europe