Claude Opus 5.5 est le dernier modèle Opus d’Anthropic, annoncé le 22 septembre 2026. L’essentiel : il coûte environ 40 % de moins qu’Opus 5 sur une charge type, aux réglages par défaut. Et la lecture de cache, elle, baisse de 60 %. Source : l’annonce d’Anthropic, relue en HTML brut le 26 septembre 2026.
C’est la deuxième baisse qui décide de la facture d’une équipe qui fait tourner des agents. Bonne nouvelle pour la ligne de budget que vous regardez en fermant un œil.
Les prix, côte à côte
Tous les chiffres sont au million de tokens, tels qu’Anthropic les publie.
| Opus 5.5 | Opus 5 |
|---|
| Lecture de cache | 0,20 $ | 0,50 $ |
| Tokens d’entrée | 4 $ | 5 $ |
| Tokens de sortie | 20 $ | 25 $ |
| Écriture de cache | 5 $ | 6,25 $ |
L’entrée et la sortie baissent de 20 %. La lecture de cache baisse de 60 %. Retenez la lecture de cache, c’est elle qui décide de votre facture.
Les tarifs des autres modèles, Sonnet et Haiku compris, sont dans notre comparatif Claude Fable 5.1.
Pourquoi la lecture de cache commande tout
Quand une équipe travaille sur un vrai dossier, le modèle relit le même contexte à chaque tour. Vos fichiers, vos règles, l’historique de la conversation. Cette relecture, c’est la lecture de cache.
Anthropic écrit noir sur blanc que ces lectures font la majorité du coût du travail agentique. Autrement dit : vous ne payez pas surtout ce que le modèle écrit, vous payez surtout ce qu’il relit.
Et ce volume a explosé. Les données agrégées vont de mars à septembre 2026. Sur cette période, Anthropic relève que le contexte par requête a été multiplié par 2,6. Le rapport entre tokens d’entrée et de sortie est passé de 189 pour 1 à 324 pour 1. Source : le billet d’Anthropic sur le coût des sessions longues, du 24 septembre 2026.
Donc la même baisse de prix vous fait économiser plus aujourd’hui qu’il y a six mois. La part concernée a grossi, donc la même remise porte sur plus de tokens.
Savoir ce qu’on envoie au modèle, c’est le gros du métier. On le travaille en formation Claude Code.
Non, votre facture ne baissera pas de 40 % automatiquement
Les 40 % valent pour une charge type aux réglages par défaut. C’est une moyenne.
Chez vous, tout dépend d’une seule chose : la part de votre facture qui vient de la relecture. Une équipe qui envoie de gros dossiers à chaque tour prend la baisse en entier. Une équipe qui pose des questions courtes et sans contexte ne verra que les 20 %.
Anthropic cite un client, Zeta Labs. Il observe moins de tours et moins d’appels d’outils qu’avec Opus 5, pour presque moitié moins cher. Deux fois plus de ses tâches les plus dures sont allées au bout.
Le même billet précise l’envers. Sur une tâche bien cadrée, les deux modèles prennent le même nombre de tours. Vous n’avez alors que la baisse de prix. L’écart se creuse sur les tâches ouvertes, là où un modèle peut s’entêter sur une mauvaise piste.
Personne ne peut donc vous donner votre chiffre. Il faut le mesurer.
Les trois gestes qui font baisser la facture pour de bon
Le modèle fait la moitié du travail. L’autre moitié est une question de méthode, et elle ne demande pas de savoir coder.
- Choisir le modèle dès le départ. Changer de modèle en cours de session casse le cache. Un cache cassé se repaye entier. Sur Opus 5.5 et Fable 5.1, changer le niveau d’effort ne le casse plus.
- Ne mettre en contexte que ce qui sert. Chaque fichier inutile est relu à chaque tour, et facturé à chaque tour. C’est le poste d’économie le plus gros et le moins regardé.
- Regarder la part de vos lectures de cache. Dans Claude Code, la commande
/usage la donne. Sans ce chiffre, toute discussion sur le budget est une discussion d’opinion.
Le troisième geste prend trente secondes et il change le ton de la réunion budget. On passe de « l’IA, ça coûte cher » à « voilà ce qu’on paye pour relire le même contexte ». Ensuite on décide quoi retirer.
Le mode rapide, et quand il vaut son prix
Opus 5.5 existe aussi en mode rapide, jusqu’à 2,5 fois plus vite. Il coûte 8 dollars en entrée et 40 en sortie au million, soit le double du tarif normal.
Le mode rapide vaut son prix quand votre attente coûte plus cher que vos tokens. Pour une tâche de fond qui tourne la nuit, non. Pour un livrable attendu par un client dans l’heure, peut-être.
Même en tarif normal, Opus 5.5 produit sa sortie plus de 30 % plus vite qu’Opus 5. Sur une session longue, ça se sent.
Le filigrane, et la question que va poser votre juridique
Un point de l’annonce n’a rien à voir avec le prix, et c’est celui qui remontera en comité.
Opus 5.5 produit un texte qui porte un filigrane, comme Fable 5.1. Anthropic le fait pour se conformer à l’AI Act européen. Depuis le 2 août 2026, l’Europe demande aux fournisseurs d’IA servant son marché de marquer les contenus générés. Anthropic écrit que d’autres éditeurs ont signé le même code de bonnes pratiques. Source : la note d’Anthropic du 14 août 2026.
Votre juridique posera une seule question. Est-ce qu’on peut remonter jusqu’à nous ?
Anthropic répond non, et le détaille. Le filigrane ne contient aucune information identifiante. Il ne se rattache ni à une personne, ni à une organisation, ni à une conversation. Il ne change ni la qualité ni le contenu. Il n’ajoute aucun caractère caché, et il ne consomme pas de tokens.
Ce qu’il permet, c’est d’estimer la probabilité que Claude ait participé à l’écriture d’un texte. Ni plus, ni moins. Pour une entreprise, rien ne change en pratique. Ce qui protège, c’est une règle écrite sur qui publie quoi. Les trois limites du filigrane sont détaillées dans l’AI Act et l’obligation de formation. Le cadre lui-même se travaille en formation AI Act.
Ce qui change aussi, sans être un prix
Trois points de l’annonce qui comptent pour une équipe.
- Les limites d’usage sur cinq heures augmentent sur les plans Pro, Max, Team et Enterprise au siège. Les abonnés reçoivent en plus une remise à zéro de limite. Ils peuvent la conserver et la déclencher au moment de leur choix.
- Côté API et hébergeurs, le contexte peut désormais être gardé en cache une heure. Les abonnés l’avaient déjà.
- Quand un agent en lance un autre, le second repart du contexte déjà payé, sans le repayer. Sur des agents en parallèle, c’est une ligne de facture qui disparaît.
Par où commencer, sans y passer la semaine
Ouvrez /usage et notez votre part de lectures de cache. C’est votre point de départ, et il vous appartient.
Prenez ensuite le dossier sur lequel votre équipe fait tourner le plus d’agents. Regardez ce qui est envoyé en contexte à chaque tour, et demandez pour chaque élément s’il sert. La première fois, il y a toujours un fichier que personne n’a osé retirer depuis trois mois.
Puis mesurez à nouveau. Deux ajustements suffisent en général, et ensuite ça tourne.
Chez Digital.Green, j’ai formé une équipe en neuf jours sur Claude Code et n8n. Des cheffes de projet, des graphistes, des créatives. Au départ, aucune ne savait tirer pleinement parti de l’IA. Elles sont reparties en sachant ce qu’elles envoient au modèle et pourquoi. La formation Claude Code pose ce cadre chez vous, sur vos propres dossiers. Votre OPCO la finance, souvent jusqu’à 100 %. Votre facture monte sans que personne sache dire d’où ça vient ? Appelez-moi, on regarde ensemble où part le contexte.