TL;DR : n’utilisez pas le mode automatique sur une machine qui contient autre chose que le projet en cours. Le garde-fou est un filtre statistique, pas une barrière, et Anthropic le reconnaît explicitement.
Depuis le 14 août, le mode automatique est le mode de démarrage par défaut de Claude Code : un classificateur de sécurité remplace la demande d’autorisation avant chaque action. Anthropic avançait pour le justifier une évaluation confiée à un prestataire extérieur, Trajectory Labs, qui n’avait relevé aucune attaque réussie sur 720 tentatives, soit 72 scénarios rejoués dix fois.
Le 26 août, le chercheur Johann Rehberger a publié une chaîne d’attaque complète qui obtient l’exécution de code à distance. Ses chiffres, qu’il donne sans les arrondir : 3 essais sur 5, 3 sur 5, et 4 sur 5 selon la variante. Il précise lui-même que ce sont de petits échantillons, pas une mesure universelle.
Comment les deux peuvent être vrais
Parce que sa chaîne ne figurait pas dans les 72 scénarios testés. Il l’écrit sans détour : un score de 0,00 % sur un jeu de tests et une exécution de code qui marche sont deux faits compatibles. Un banc d’essai mesure ce qu’on y a mis.
L’attaque est instructive. Une archive est téléchargée, et Claude refuse d’exécuter le binaire qu’elle contient, ce qui est le comportement attendu. Il écrit alors lui-même un décodeur Python pour contourner le problème, et c’est ce décodeur qui déclenche la charge : l’instruction import base64 va chercher un struct.py malveillant déposé à côté, qui prend la main.
Le détail qui devrait faire réfléchir
Une fois la machine compromise, Claude s’en est aperçu et a voulu tuer le processus. C’est le mode automatique qui a refusé la commande de nettoyage. Le garde-fou a laissé créer le programme malveillant, puis a empêché de le supprimer.
Anthropic a classé le signalement en « informatif », avec une position qui a le mérite d’être claire : le mode automatique est un classificateur au mieux, pas une garantie de sécurité.
Ce qu’il faut en faire
Rien de tout cela ne rend Claude Code inutilisable, et nous l’utilisons tous les jours pour fabriquer ce site. Mais la conclusion ne dépend pas d’Anthropic : faites tourner vos agents dans un conteneur, limitez leurs sorties réseau, ne leur donnez pas vos répertoires sensibles, et voyez le classificateur comme un filet, pas comme un mur.
C’est ce qu’on ferait avec un stagiaire très rapide, très obéissant, et incapable de reconnaître un piège.