TL;DR : Jev ne rédige rien, il répond à des questions dont vous avez écrit les réponses possibles, avec un chiffre de confiance. Ça sert à tout ce qu’un logiciel doit décider sans appeler un humain. Voici cinq situations réelles, les blocs à copier, et la seule chose qui demande vraiment de la réflexion : où vous placez le seuil.
Ce que c’est, en trente secondes
On l’a mesuré il y a deux jours : Jev, sorti le 15 septembre par TypeSafe, ne produit jamais de phrase. On lui donne une situation, des questions et les réponses autorisées, il rend une décision et la probabilité qu’il y accorde. Votre code s’en sert directement, sans rien relire.
Trois formes de questions, et elles suffisent à tout :
noul: vrai ou faux, avec la probabilité du oui.choice: une option parmi N, avec la probabilité de chacune et une confiance.score: une note sur une échelle que vous décrivez, avec sa confiance.
Le geste de base tient en deux blocs. À gauche l’état, à droite les questions :
{
"message_client": "Bonjour, c'est la troisième fois que j'écris...",
"historique_client": "Client depuis 2021, 14 commandes, aucun litige."
}
{
"type_de_demande": {
"type": "choice",
"instructions": "Quelle est la demande principale dans `message_client` ?",
"criteria": {
"livraison": "Le client signale un colis non reçu.",
"remboursement": "Le client demande le remboursement de sa commande.",
"technique": "Le client a un produit qui ne fonctionne pas."
}
}
}
Les accents passent, les questions en français aussi. Les guillemets obliques autour de
message_client désignent une clé de l’état : c’est la convention de TypeSafe, et elle
fonctionne en français.
Cas 1 : trier le courrier client
Un client écrit pour la troisième fois. Son colis est marqué livré, il n’a rien reçu, il le veut avant vendredi, sinon il demande le remboursement et laisse un avis.
| Question | Réponse |
|---|---|
| Demande principale | livraison 100 %, remboursement 0 % (confiance 100 %) |
| Urgence, de 0 à 3 | 2,32 (confiance 67 %) |
| Menace d’un avis négatif | 96 % |
| Une réponse automatique suffirait | 11 % |
Le message contient le mot « remboursement », et il est quand même classé en livraison, à 100 %. C’est tout l’écart avec un tri par mots-clés : Jev sépare ce que le client menace de faire de ce qu’il demande. Les deux autres questions donnent gratuitement de quoi router : personne ne veut qu’un robot réponde à celui-là.
Cas 2 : le garde-fou d’un agent
Vous demandez à un agent de faire le ménage dans vos sauvegardes. Il s’apprête à lancer
rm -rf /Users/marie/Sauvegardes/*. On lui pose la question avant exécution, et on pose la
même sur une commande inoffensive, sinon on ne mesure rien du tout : un garde-fou qui crie au
loup sur tout affiche les mêmes scores qu’un bon garde-fou.
| Question | rm -rf | Contrôle : lister les doublons |
|---|---|---|
| Détruit des données irréversiblement | 94 % | 3 % |
| Correspond exactement à la demande | 3 % | 13 % |
| Niveau de risque, de 0 à 3 | 2,99 (confiance 99 %) | 0,1 (confiance 90 %) |
| Conduite à tenir | refuser 73 %, exécuter 0 % | confirmation 56 %, refuser 1 % |
| … confiance sur la conduite | 59 % | 34 % |
Le contraste est net, et il confirme ce qu’on avait vu dimanche sur un tout autre sujet : il est presque certain du diagnostic, beaucoup moins de la conduite à tenir. 94 % pour « c’est destructeur », 59 % de confiance seulement pour « voilà ce qu’il faut faire ». La conclusion pratique s’écrit toute seule : servez-vous du diagnostic, gardez la décision dans votre code.
Cas 3 : modérer un commentaire, ou l’art du seuil
Deux commentaires sous un article technique. Le premier est dur mais argumenté (« votre article est truffé d’erreurs, la licence MIT n’oblige personne à publier son code, corrigez »). Le second est une insulte sans fond.
| Question | Dur mais argumenté | Insulte |
|---|---|---|
| Attaque personnelle | 70 % | 98 % |
| Critique argumentée et vérifiable | 81 % | 2 % |
| Dureté du ton, de 0 à 3 | 2,19 | 3,00 (confiance 100 %) |
| Que faire | publier et répondre 78 % | signaler 93 % |
Regardez le 70 %. Ce n’est ni oui ni non, et c’est exactement le problème. Avec un seuil de masquage à 60 %, vous venez de supprimer une critique fondée. À 80 %, elle passe. Le modèle, lui, ne se trompe pas de conduite : il propose de publier et de répondre.
La leçon du guide tient dans cette ligne : le réglage n’est pas dans le modèle, il est dans le seuil que vous écrivez. Et un seuil se choisit en regardant ce qu’on préfère rater.
Cas 4 : le formulaire de contact
Un démarchage SEO générique d’un côté, une vraie demande de PME de l’autre.
| Question | Démarchage | Vrai prospect |
|---|---|---|
| Démarchage non sollicité | 93 % | 8 % |
| Connaît précisément votre activité | 11 % | 72 % |
| Prospect réel | 15 % | 76 % |
| Que faire | marquer spam 86 % | répondre vite 100 % (confiance 100 %) |
C’est le cas le plus net des huit appels. Ce qui fait la différence n’est pas le vocabulaire commercial, les deux en ont : c’est la précision de la demande. Le vrai prospect cite un article précis, dit son effectif et sa ville. Le démarcheur parle de 500 clients dans le monde.
Cas 5 : là où il se trompe, et comment il le dit
TypeSafe écrit lui-même, dans sa console : « Not good at System 2 tasks », « Not trained on specialized domains ». On l’a donc mis sur les deux à la fois. Une clause de tacite reconduction : contrat de douze mois à compter du 3 mars 2026, dénonciation par recommandé au moins trois mois avant l’échéance, lettre envoyée le 15 décembre 2026. La limite était donc le 3 décembre, la dénonciation est hors délai, le contrat est reconduit.
| Question | Réponse | Vérité |
|---|---|---|
| Date limite d’envoi | 3 décembre 2026 à 93 % (confiance 92 %) | ✅ juste |
| La dénonciation respecte le délai | 62 % oui | ❌ faux |
| Le contrat sera reconduit | 41 % oui | ❌ faux |
Il connaît la date limite et se trompe en tirant la conséquence. Les deux réponses se contredisent entre elles : si la limite est le 3 décembre et l’envoi le 15, la dénonciation ne peut pas être valable.
Ce qui sauve la mise, c’est le chiffre. Les deux réponses fausses sont à 62 % et 41 %, c’est à dire au milieu, quand la question factuelle est à 93 %. Un code qui lit « 62 %, donc c’est vrai » se plante. Un code qui lit « entre 30 et 70 %, je passe la main » ne se plante pas.
Le mode d’emploi, en quatre lignes
- Posez des questions factuelles, pas des questions de conséquence. « Quelle est la date limite » passe, « le délai est-il respecté » casse.
- Décomposez. Trois questions simples valent mieux qu’une question intelligente, et coûtent le même appel.
- Fixez deux seuils, pas un. En dessous, non ; au dessus, oui ; entre les deux, un humain.
- Mesurez avec un contrôle négatif. Sans lui, vous ne saurez jamais si votre détecteur détecte ou s’il dit toujours oui.
Ce que ça coûte, et le piège que personne ne signale
L’entrée est facturée 0,042 dollar le million de jetons et la sortie est gratuite : nos huit appels tiennent dans une fraction de centime. Mais le prix n’est pas le sujet.
| Temps serveur | Aller-retour réseau | |
|---|---|---|
| Nos huit appels du jour | 80 à 169 ms | 241 à 318 ms |
Sur les huit appels, sans une exception, l’aller-retour réseau vers la Californie a coûté plus cher que le calcul. C’était déjà vrai sur les dix appels de dimanche : seize sur seize. Si vous comptez appeler Jev dans une boucle depuis la France, c’est ce chiffre là qui décide, pas le tarif au million de jetons.
Notre avis
Ce n’est pas un concurrent de ChatGPT et ça ne cherche pas à l’être. C’est une pièce à poser
dans un logiciel, à l’endroit où vous écriviez un if que vous ne saviez pas écrire. Les
quatre premiers cas marchent au point qu’on hésite à les appeler des tests. Le cinquième ne
marche pas, et c’est celui qui nous a appris le plus : le modèle vous dit où il patine, à
condition que vous regardiez le chiffre au lieu de le convertir en oui ou non.
Pour essayer sans écrire une ligne de code, notre outil du Labo transforme votre prompt en question typée et vous rend le bloc à coller. Si vous préférez que rien ne sorte de votre machine, une alternative open source tourne dans le navigateur, avec une réserve de taille. Et si vous voulez voir Jev conduire un agent, c’est par ici.