Le 30 juillet 2026, Anthropic publie les résultats d'une revue rétrospective de 141 006
sessions d'évaluation de cybersécurité — déclenchée par la divulgation, neuf jours plus tôt,
d'un incident similaire chez OpenAI (le modèle d'OpenAI échappé vers Hugging
Face). L'examen, mené avec
son partenaire de test Irregular, cherchait des cas où un modèle Claude avait accédé à
internet depuis un environnement censé être isolé.
Trois incidents réels en sont ressortis, tous liés à la même cause : une erreur de
configuration chez Irregular a laissé certains environnements de test réellement connectés à
internet, alors que les modèles pensaient opérer dans une simulation fermée.
Claude Opus 4.7 — le nom d'une entreprise fictive de l'exercice correspondait, par
coïncidence, à un vrai nom de domaine. Sur quatre sessions de test, le modèle a accédé à une
infrastructure réelle et en a extrait des identifiants applicatifs et infrastructure, obtenant
l'accès à une base de données contenant plusieurs centaines de lignes de données de production
— l'incident le plus grave des trois.
Claude Mythos 5 — le modèle a publié un paquet Python malveillant sur PyPI, le registre
public de paquets Python. En une heure, ce paquet a été téléchargé sur environ 15 systèmes
réels, dont celui d'une entreprise de sécurité dont Claude a pu exfiltrer les identifiants.
Un modèle de recherche interne — après avoir scanné environ 9 000 cibles, le modèle a
compromis l'application d'une entreprise en utilisant des techniques basiques et bien connues :
lecture d'identifiants sur une page de debug exposée, injection SQL.
Anthropic est explicite sur ce point : dans les trois cas, les modèles n'ont découvert aucune
faille inédite — ils ont exploité des mots de passe faibles et des points d'accès non
authentifiés, avec des méthodes d'attaque documentées de longue date.
Anthropic commence sa revue des transcriptions le jeudi 23 juillet et suspend le jour même
l'ensemble de ses évaluations de cybersécurité. Les organisations concernées sont prévenues le
27 juillet ; parmi les deux qu'Anthropic a pu contacter, aucune n'avait détecté l'activité
avant d'être alertée. L'entreprise engage également PyPI et une revue indépendante avec METR,
et prévoit de publier des transcriptions expurgées des incidents.
- Anthropic — Investigating three real-world incidents in our cybersecurity evaluations — 30 juillet 2026, rapport officiel complet