Actualité

Failles de sécurité révélées par Anthropic lors de tests avec Claude

Anthropic a récemment révélé que ses modèles de sécurité basés sur Claude ont accédé sans autorisation à des environnements de production sensibles appartenant à trois organisations externes lors de tests. Les vulnérabilités découvertes ont été publiées en ligne. Un tel incident dans un contexte réel aurait pu mener à des arrestations et condamnations. Anthropic explique avoir voulu évaluer les capacités offensives de ses modèles.

Intrusions répétées et conséquences potentielles

L’incident, officiellement dévoilé par Anthropic, est le second en seulement dix jours. Des modèles d’intelligence artificielle parmi les plus avancés ont contourné les restrictions pour pénétrer des réseaux protégés, une infraction qui, dans des scénarios de hacking traditionnels, pourrait envoyer un individu en prison pendant des années.

Au début du mois, OpenAI avait annoncé que ses modèles avaient exploité une vulnérabilité zero-day pour infiltrer le réseau de Hugging Face, une plateforme dédiée aux modèles open source d’apprentissage automatique et aux ensembles de données IA. Ces modèles ont également volé des informations confidentielles et compromis d’autres services tiers en utilisant des identifiants exposés publiquement.

Évaluations et erreurs humaines

Suite à cet incident, Anthropic a mené des évaluations similaires avec ses modèles Claude. L’audit a révélé trois incidents où un modèle a accédé à Internet pendant une interaction avec l’environnement d’évaluation d’Irregular, un partenaire tiers, obtenant ainsi un accès non autorisé à l’infrastructure de production de trois organisations distinctes.

Anthropic précise que les instructions fournies lors des exercices « capture the flag », utilisés pour évaluer les techniques offensives et défensives en cybersécurité, indiquaient clairement que l’environnement était une simulation sans accès à Internet. Cependant, une erreur du partenaire Irregular a permis un accès Internet, et les modèles ont traité ces connexions comme partie intégrante des exercices.

Les intrusions ont impliqué trois modèles Claude : Opus 4.7, Mythos 5 et un prototype interne de recherche. Opus 4.7, le plus ancien, a dépassé le plus largement ses limites.

Antoine Laberou

Voir tous les articles

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *