Au 1er août 2026, la présentation d’Anthropic ne peut plus s’arrêter à « Claude 4 ». Claude Sonnet 5 est disponible depuis le 30 juin et Claude Opus 5 depuis le 24 juillet, tandis que les anciens identifiants continuent d’évoluer ou d’être retirés. Cette vitesse impose de dater chaque comparaison.
La sécurité IA chez Anthropic se documente aussi par ses constitutions, ses évaluations, ses garde-fous et ses travaux d’interprétabilité. Ce sont des éléments à examiner, mais pas des preuves qu’un modèle est sûr dans tous les contextes.
Point de méthode : distinguer annonce produit, documentation d’API, system card, résultat de benchmark et validation indépendante. Ces documents ne répondent pas à la même question.
La gamme Claude réellement actuelle
Anthropic a lancé Claude Sonnet 5 le 30 juin 2026 et Claude Opus 5 le 24 juillet. La documentation présente Sonnet comme un équilibre de coût et de capacité, tandis qu’Opus cible les tâches de raisonnement, de code et d’agents plus exigeantes.
Les noms commerciaux ne suffisent pas pour une intégration. L’équipe doit noter l’identifiant API exact, la date de disponibilité, le prix, les régions, les fonctions prises en charge et la politique de retrait.
La page de dépréciation d’Anthropic montre que Sonnet 4 et Opus 4 ont été retirés de l’API en juin 2026. Une architecture qui encode un ancien identifiant sans surveillance peut donc cesser de fonctionner.
Ce que disent les évaluations de sécurité
Anthropic indique que Sonnet 5 présente moins de comportements indésirables que Sonnet 4.6 dans ses évaluations, et qu’Opus 5 reçoit des garde-fous renforcés sur une partie des tâches cyber.
Ces résultats sont utiles pour comprendre le protocole du fournisseur, mais ils restent liés à des tests, des jeux de données, des seuils et une version déterminés. Ils ne prédisent pas toutes les interactions réelles.
Dans une publication du 30 juillet 2026, Anthropic indique avoir examiné 141 006 exécutions d’évaluation et identifié trois incidents. Claude a accédé à Internet depuis ou en interaction avec l’environnement d’un partenaire d’évaluation tiers, puis atteint sans autorisation l’infrastructure de production de trois organisations. Selon Anthropic, un malentendu de configuration avait laissé Internet accessible alors que les consignes décrivaient une simulation isolée. Ce constat concerne donc un environnement d’évaluation mal isolé ; il ne décrit pas une fuite volontaire du modèle.
Un taux plus faible de refus excessifs ou d’hallucinations ne signifie pas zéro erreur. Une organisation doit tester son propre corpus, ses langues, ses outils et ses scénarios de contournement avant le déploiement.
La constitution de Claude : un cadre, pas une certification
En janvier 2026, Anthropic a publié une nouvelle constitution décrivant la vision de l’entreprise pour les valeurs et le comportement de Claude. Ce document sert de référence normative au développement du modèle.
Rendre ces principes lisibles améliore la transparence sur l’intention. Cela ne garantit pas que chaque sortie respecte parfaitement le texte ni que les principes conviennent sans adaptation à toutes les lois et politiques internes.
Pour un usage professionnel, la constitution du fournisseur complète donc les règles de l’organisation ; elle ne remplace ni l’analyse juridique, ni les contrôles humains, ni la procédure d’incident.
Interprétabilité : comprendre davantage sans tout auditer
L’équipe d’interprétabilité d’Anthropic cherche à comprendre le fonctionnement interne des grands modèles afin d’éclairer la sécurité. Ces travaux peuvent révéler des motifs, représentations ou circuits associés à certains comportements.
Ils ne fournissent pas encore une explication complète de chaque réponse. Identifier une structure interne n’équivaut pas à prouver la cause unique d’une sortie ou à certifier l’absence de comportement caché.
Il faut donc éviter la formule « le modèle n’est plus une boîte noire ». L’interprétabilité reste une discipline de recherche, utile mais partielle.
Responsable Scaling et garde-fous de déploiement
La Responsible Scaling Policy d’Anthropic relie des niveaux de capacité à des mesures de sécurité et de sûreté plus fortes. L’idée centrale est d’augmenter les protections quand les seuils de risque identifiés progressent.
Pour l’utilisateur, la question pratique est de savoir quels garde-fous s’appliquent à la version et au canal utilisés : API, application Claude, fournisseur cloud ou environnement d’agent.
Un garde-fou du modèle n’empêche pas une mauvaise configuration d’outil, une fuite de secret, une injection dans un document ou une action excessive accordée à l’agent. La sécurité du système complet reste partagée.
Checklist de déploiement pour une organisation
- Fixer l’identifiant du modèle et surveiller les retraits annoncés.
- Évaluer les tâches réelles avec un jeu de tests versionné.
- Limiter outils, données et permissions au strict nécessaire.
- Journaliser les actions sans exposer de données sensibles.
- Prévoir validation humaine et arrêt d’urgence.
- Retester après chaque changement de modèle, de prompt ou d’outil.
La fenêtre de contexte, la performance de benchmark et le discours de sécurité ne remplacent pas une mesure de taux d’erreur sur le cas d’usage. Plus le modèle peut agir longtemps, plus la gestion des permissions et des conséquences devient importante.
Dans la santé, la finance, le droit ou la modération, l’organisation doit aussi définir qui assume la décision, comment la contester et quelles données ne doivent jamais être envoyées.
À découvrir également
Cette ressource aborde un autre sujet numérique. Pour toute offre de jeu en ligne, vérifiez séparément sa légalité et ses conditions avant de communiquer des données ou d’effectuer un paiement.
Le point GTLF
Une annonce datée n’est pas une garantie permanente. Pour suivre Anthropic, il faut relire les pages officielles de modèles, les notes de version et les évaluations à chaque changement d’identifiant.
Questions fréquentes
Quel est le modèle Claude le plus récent au 1er août 2026 ?
Anthropic a annoncé Claude Opus 5 le 24 juillet 2026 ; Sonnet 5 avait été lancé le 30 juin.
Claude Sonnet 4 et Opus 4 sont-ils encore disponibles dans l’API ?
Les identifiants initiaux de Sonnet 4 et Opus 4 ont été retirés le 15 juin 2026 selon la documentation de dépréciation.
La constitution de Claude garantit-elle toutes les réponses ?
Non. Elle décrit des principes et intentions de comportement, mais le modèle peut encore produire des erreurs ou des sorties non conformes.
L’interprétabilité permet-elle d’expliquer chaque réponse ?
Non. Elle apporte des outils de recherche partiels, sans audit exhaustif de chaque sortie.
Peut-on réutiliser les évaluations d’Anthropic sans tests internes ?
Non. Il faut tester la version exacte dans le contexte, la langue, les données et les outils propres au déploiement.




