geeks.fr
IA

Comment vérifier le travail d'une IA : Anthropic a posé la question à 129 utilisateurs, et le frein n'est pas celui qu'on croit

La moitié des utilisateurs interrogés confrontent la réponse de Claude à quelque chose d'extérieur. Ce qui les bloque n'est pas le manque de temps mais le manque d'expertise : on juge mal une réponse quand on ne sait pas à quoi ressemble la bonne. Les cinq outils proposés, et la limite que l'étude assume.

Echo 22 septembre 2026 6 min de lecture

Anthropic a interrogé 129 utilisateurs réguliers de Claude sur une question qu’on pose rarement : comment savez-vous que la réponse est juste ? Le rapport, publié le 10 septembre, ne contient aucune promesse. Il contient des habitudes, et un aveu.

La question est plus difficile à étudier qu’il n’y paraît, et les auteurs le disent : la vérification se passe en dehors de l’outil. Personne ne voit l’utilisateur ouvrir un classeur, appeler un collègue ou relancer un test. Il fallait donc le leur demander.

Ce que les gens font vraiment

Le premier résultat casse une intuition. On imagine que vérifier une réponse d’IA, c’est la relire attentivement. 51 % des personnes interrogées décrivent autre chose : confronter la réponse à quelque chose d’extérieur à la conversation. Une documentation officielle, leurs propres données, un test qui passe ou qui casse, un collègue, ou une autre IA.

Le détail change selon le métier, et c’est logique. Sur du code, ce sont les tests. Sur de la recherche, ce sont les recoupements de sources et les seconds avis. Sur de l’écriture, c’est la connaissance du domaine et la relecture d’un pair. Dix récits décrivent l’usage d’une deuxième IA pour contrôler la première, et 10 % des vérificateurs combinent plusieurs contrôles indépendants.

La simple relecture, sans rien d’extérieur, est la pratique minoritaire. Surtout sur les tâches techniques.

Le frein n’est pas le temps

Deuxième résultat, et c’est celui qui mérite d’être retenu. Soixante-deux participants ont nommé ce qui les empêche de vérifier. Les auteurs s’attendaient à ce que le manque de temps arrive en tête. C’est le manque d’expertise dans le domaine qui l’emporte.

La formulation du rapport est la bonne : il est difficile de juger une réponse quand on ne sait pas à quoi ressemble une bonne réponse. Des participants non techniciens racontent s’être fait guider par Claude dans des décisions d’architecture logicielle sans pouvoir distinguer un bon choix d’un mauvais. Un autre a regardé des vidéos de jardinage en ligne, le temps d’acquérir juste assez de bases pour évaluer ce que Claude lui recommandait.

C’est exactement le point aveugle de l’IA générative comme outil de montée en compétence : elle vous emmène là où vous n’avez pas les moyens de la contredire.

Ce qui change quand une erreur passe

Dix-huit récits racontent une erreur de Claude qui est passée entre les mailles. La moitié de ceux qui la racontent disent qu’elle a changé leur façon de travailler.

Et la parade n’a jamais été de relire plus fort. Elle a été de réorganiser le travail :

  • Exiger la citation avant l’analyse : demander à Claude de citer le passage source d’abord, et seulement ensuite de recommander quelque chose.
  • Mettre des points de validation à chaque étape d’une tâche longue, au lieu de tout contrôler à la fin.
  • Faire produire par un agent et contrôler par d’autres, chacun sur une partie différente.

Personne n’est devenu expert d’un nouveau domaine en une nuit. Ils ont changé la structure du travail.

Les cinq outils proposés

Le rapport se termine par une boîte à outils, avec les invites prêtes à copier :

  1. Écrire un test pour ce que vous produisez souvent. Un développeur a des tests ; un rédacteur peut avoir une grille de ton et de format, un juriste des règles pour contrôler une clause générée. L’invite fournie fait poser quatre ou cinq questions à Claude avant d’écrire quoi que ce soit, pour que la grille soit la vôtre.
  2. Installer la compétence discernment-nudge, publiée par Anthropic, qui repère les tâches complexes et propose une pause de vérification. Les premiers essais en entreprise suggèrent qu’insérer des pauses augmente la vérification, et les auteurs prennent soin de parler d’indice, pas de preuve.
  3. Utiliser la revue adverse dans Claude Code : lancer un sous-agent neuf, qui n’a pas participé au travail, pour le relire depuis une autre perspective.
  4. Se constituer un carnet d’experts. Savoir qui appeler pour un second regard dans les domaines qui ne sont pas les vôtres, et rendre le service quand on vous le demande.
  5. Demander à Claude d’étiqueter ses sources, passage cité et lien à l’appui, et de marquer « non sourcé » ce qui vient de sa mémoire. C’est ce qui reste à vérifier en priorité.

L’aveu, et pourquoi il compte

La section « Limitations » est plus intéressante que la plupart des études du secteur. L’échantillon est auto-sélectionné, composé de gens venus apprendre à mieux travailler avec l’IA : leurs pratiques sont donc au dessus de la moyenne, et le rapport refuse explicitement d’en tirer des proportions valables ailleurs. Tout est déclaratif. Et le codage thématique des entretiens a été assisté par un modèle de langage, avec une relecture humaine d’au moins 10 % de chaque thème et un recodage complet après révision de la grille.

Une étude sur la vérification du travail d’une IA, dont l’analyse a été faite avec une IA, et qui l’écrit. C’est cohérent, et c’est la meilleure illustration du propos.

Notre avis

Le résultat le plus utile n’est pas la liste d’outils, c’est le diagnostic : le problème n’est pas la confiance, c’est la compétence. Vérifier demande de savoir à quoi ressemble le juste, et l’IA nous pousse en permanence là où nous ne le savons pas.

Ici, ce n’est pas une nouveauté : chaque article de ce site est choisi et relu par un humain, et quand nous n’avons pas pu vérifier quelque chose, nous l’écrivons dans l’article. Le cinquième outil de la liste, demander à l’IA d’étiqueter ce qui n’est pas sourcé, est le plus simple à adopter dès aujourd’hui, et probablement celui qui rapporte le plus.

Il existe une autre piste, moins citée : les modèles qui rendent un chiffre de confiance plutôt qu’une phrase assurée. Sur une clause de contrat, celui que nous avons mesuré cette semaine donne la bonne date limite à 93 % et se trompe sur la conséquence à 62 %. La réponse fausse se repère au chiffre, pas au ton. Ça ne remplace aucun des cinq outils, mais ça déplace le problème au bon endroit : une réponse qui sait dire qu’elle hésite est plus facile à vérifier qu’une réponse qui affirme.

Le rapport est en accès libre sur Claude Academy, lecture annoncée en dix minutes.

#IA #Claude #Anthropic #méthode #vérification #étude
Ajouter geeks.fr à mes sources préférées Un réglage Google, une fois, pour nous retrouver plus souvent dans vos résultats.
Écrit par Echo Rédac IA de geeks.fr Relu et vérifié par Cyril Verglas Fondateur et directeur de la publication

Continuer la lecture