Blog

Jev ou LLM : lequel choisir pour router et classer ?

Beaucoup d’équipes utilisent Claude, GPT ou Gemini comme routeur : un ticket entre, un label sort. Jev fait le même travail sans générer de texte. Voici ce qui change vraiment, chiffres à l’appui, et quand garder le LLM.

Par Étienne Lescot · 23 septembre 2026

Jev ou LLM : la réponse courte

Pour une décision fermée et répétée, Jev est plus rapide et bien moins cher qu’un LLM de milieu de gamme. Face aux plus petits LLM, l’écart de prix se réduit. Le gain tient alors à la forme de la réponse et à ses probabilités.

  • Gardez le LLM pour rédiger, raisonner en plusieurs étapes ou traiter autre chose que du texte.
  • Passez à Jev quand la réponse tient dans une liste d’options connue et que le volume est élevé.
  • Combinez les deux le plus souvent : Jev d’abord, le LLM quand Jev hésite.

Jev vs LLM : le comparatif

CritèreLLM génératif (Claude, GPT, Gemini)Jev
SortieDu texte ou du JSON généréUne valeur typée parmi vos options
FormatGaranti avec les sorties structurées, sauf troncature ou refusGaranti par construction
ConfianceVerbalisée, ou logprobs selon le fournisseurUne probabilité par option, plus une confiance
LatenceEnviron 1,2 s estimée pour Claude Haiku 4.5 sans raisonnement, plus de 10 s avecDe 70 à 500 ms selon TypeSafe
Coût dans notre exempleDe 0,000045 $ à 0,0015 $ par décision0,000021 $ par décision
FacturationEntrée et sortieEntrée seulement
LanguesMultilingueAnglais d’abord
HébergementRégions européennes possibles selon le cloudÉtats-Unis
DisponibilitéOuverteOuvert le 20/09/2026, inscriptions suspendues depuis le 22/09

Comment un LLM et Jev produisent-ils une décision ?

Un LLM écrit sa réponse, Jev la choisit. Cette différence explique presque tous les écarts qui suivent.

  • Le LLM lit les labels dans votre prompt, puis génère sa réponse token par token, souvent en JSON. Votre code la parse et vérifie que le label existe.
  • Les modèles de raisonnement ajoutent des tokens de réflexion invisibles, facturés comme des tokens de sortie chez OpenAI.
  • Jev reçoit un contenu et des questions typées. Il les évalue en parallèle, en un appel, et renvoie une réponse par question : l’option retenue, une probabilité par option et une confiance.
  • Seuls les tokens d’entrée de Jev sont facturés, à 0,042 $ par million. La sortie est gratuite.

Le détail est dans notre article d’introduction à Jev.

Combien coûte une décision ? Réduire le coût d’un routeur LLM

Dans notre exemple, Jev coûte environ 70 fois moins cher par décision que Claude Sonnet 5. Face à GPT-5 nano, l’écart tombe à 2 fois.

Hypothèses : 100 000 décisions par mois, 500 tokens d’entrée par décision, proche des 499 de notre test Jev, et 50 tokens de sortie pour le LLM, sans raisonnement. Prix publics du 23 septembre 2026, sans cache. 1 € = 1,1463 $ (BCE).

Calcul par décision : (500 × prix d’entrée + 50 × prix de sortie) ÷ 1 000 000, en dollars par million de tokens.

  • Jev (0,042 $, sortie gratuite) : 500 × 0,042 ÷ 1 000 000 = 0,000021 $. Soit 2,10 $ (1,83 €) par mois.
  • GPT-5 nano (0,05 $ et 0,40 $) : 0,000045 $. Soit 4,50 $ (3,93 €) par mois.
  • Gemini 3.5 Flash-Lite (0,30 $ et 2,50 $) : 0,000275 $. Soit 27,50 $ (23,99 €) par mois.
  • Claude Haiku 4.5 (1 $ et 5 $) : 0,00075 $. Soit 75 $ (65,43 €) par mois.
  • Claude Sonnet 5 (2 $ et 10 $) : 0,0015 $. Soit 150 $ (130,86 €) par mois.
  • Le cache de prompt baisse la facture du LLM sur la partie fixe du prompt.
  • Les tokenizers diffèrent : selon Anthropic, celui de Claude 4.7 et suivants, dont Sonnet 5, compte environ 30 % de tokens en plus.
  • Le raisonnement multiplie les tokens de sortie, donc la facture.

TypeSafe annonce 193,6 fois plus rapide et 444,6 fois moins cher. Ce sont des benchmarks de l’éditeur, sur ses propres workflows, que TypeSafe situe lui-même dans le haut de la fourchette réelle.

Quelle latence attendre d’un routeur ?

Jev répond en quelques centaines de millisecondes. Un LLM rapide sans raisonnement met un peu plus d’une seconde. Devant un agent, cet écart s’ajoute à chaque réponse.

La sortie est-elle fiable ?

Les sorties structurées ont réglé l’essentiel du problème côté LLM. Il reste des cas limites que Jev n’a pas.

TypeSafe affiche « Zero Hallucinations » sur son site. C’est une promesse d’éditeur : Jev ne sort jamais d’une option inventée. L’option choisie peut rester fausse.

Que vaut la « confiance » de chaque côté ?

C’est la différence la plus sous-estimée. Un routeur utile doit savoir dire « je ne sais pas ».

Côté LLM : deux options imparfaites

  • La confiance verbalisée est un nombre généré comme le reste. Selon une étude présentée à ICLR 2024, les LLM ont tendance à être surconfiants quand ils l’expriment.
  • Les logprobs donnent la probabilité de chaque token. Gemini sur Vertex AI les expose, OpenAI sur certains modèles, l’API Claude non.
  • L’entraînement conversationnel abîme la calibration : le rapport technique de GPT-4 le constate après le post-entraînement.

Côté Jev : une distribution sur vos options

  • Chaque choice ou score donne une probabilité par option, et une confidence qui résume leur répartition.
  • TypeSafe entraîne Jev pour des probabilités calibrées : une option notée 0,8 devrait être juste 8 fois sur 10 environ.
  • La calibration se mesure sur un groupe de décisions, pas sur une réponse isolée. Elle se vérifie sur vos données : c’est l’objet de notre audit.

Quand faut-il garder le LLM ?

Jev ne remplace pas un LLM. Il remplace un LLM utilisé comme un if. Gardez le LLM quand :

  • il faut générer une réponse, un résumé ou une valeur libre ;
  • la décision demande du calcul, des dates ou plusieurs étapes, des limites connues de Jev 1.13 ;
  • le contenu n’est pas en anglais, la langue principale de Jev, et l’enjeu est fort ;
  • l’entrée n’est pas du texte : image, audio, vidéo ;
  • les données doivent rester en Europe : Jev est hébergé aux États-Unis et TypeSafe n’apparaît pas dans la liste Data Privacy Framework ;
  • le volume est faible : l’économie ne paie pas la migration ;
  • vous ne pouvez pas dépendre d’un service tout neuf, lancé le 15 septembre 2026, inscriptions suspendues pour l’instant.

Le modèle hybride : Jev d’abord, le LLM en repli

La bonne réponse est souvent « les deux ». Jev traite chaque décision. Le LLM ne reprend que celles où Jev hésite.

  1. Jev répond à chaque décision.
  2. Si la confiance atteint le seuil, votre code agit.
  3. Sinon, ou en cas d’erreur, la décision part au LLM actuel ou à un humain.
const SEUIL = 0.8 // calibré en mode shadow, jamais deviné

async function router(ticket) {
  try {
    const r = await jev(ticket) // POST https://api.typesafe.ai/v1/systemone
    const equipe = r.answers.equipe
    if (equipe.confidence >= SEUIL) return { equipe: equipe.choice, par: 'jev' }
  } catch (e) {} // délai dépassé, 429 ou 529 : repli sur le LLM
  return { equipe: await routerLLM(ticket), par: 'llm' }
}

Le seuil se calibre, il ne se devine pas. En mode shadow, on rejoue des décisions passées sur Jev et sur le LLM actuel, sans toucher la production. On retient le seuil qui atteint votre taux d’accord cible, et on mesure la part du trafic que Jev couvre.

Si 20 % des décisions restaient sous le seuil, hypothèse à mesurer sur vos données, l’exemple donnerait : 2,10 $ pour Jev sur tout le trafic, plus 0,20 × 150 $ = 30 $ pour Sonnet 5. Soit 32,10 $ (28,00 €) par mois, contre 150 $ avec Sonnet seul.

Voyez ce schéma dans notre démo, ou montez-le avec notre guide Jev dans n8n.

Par où commencer ?

Mesurez avant de migrer. Un audit en mode shadow dit quelle part de vos décisions Jev peut prendre, à quel taux d’accord et pour quelle économie. Vous hésitez aussi avec un classifieur classique ? Lisez Jev face aux autres classifieurs de texte.

Jev et TypeSafe sont des marques de TypeSafe AI, Inc. Cet article est indépendant et n’est pas affilié à TypeSafe AI.