KAHN1
EN FR

Modèles System One

Un modèle System One répond à des questions typées sur un texte en une seule passe, et renvoie chaque réponse avec une probabilité pour chaque option permise. Jev, de TypeSafe, a popularisé le terme en septembre 2026 ; des modèles ouverts font aujourd'hui la même chose.

Mis à jour le 2 octobre 2026

01 · Définition

Le nom vient du Système 1 de Daniel Kahneman (Système 1 / Système 2, 2011) : des jugements rapides et bon marché qui règlent la plupart des cas, et laissent les cas difficiles à un Système 2 plus lent (un modèle de pointe ou une personne). TypeSafe écrit « System One » ; on lit aussi « System 1 », « modèle de décision » (decision model) et « modèle de classe Jev ».

Un tel modèle reçoit un état (un message, un document, un ticket) et des questions typées. Il rend pour chacune une valeur typée et une distribution de probabilité : rien n'est généré, donc rien n'est à parser, et une réponse hors schéma ne peut pas arriver.

Type de questionCe qu'on poseCe qui revient
ChoiceUne liste d'options fixeUne option + une probabilité par option
ScoreDes niveaux ordonnésUn niveau + une espérance sur les niveaux
Noul (oui / non)Une affirmation à vérifierUne probabilité que le texte l'appuie

02 · Fonctionnement

Le prompt contient l'état, la question et les options, chacune repérée par une lettre. Le modèle fait une passe ; à la position de la réponse, on ne garde que les logits des tokens d'option (A, B, C… ou oui / non), et le softmax les transforme en probabilités. Pour un Score, l'espérance Σ i · pi donne une valeur continue.

Deux réglages rendent ces probabilités utilisables. Le débiaisage par permutation pose la question avec les options dans k ordres et moyenne les résultats. La calibration (une température par type de question) aligne la confiance sur la précision ; on la mesure par l'ECE. Enfin, sur un état long, le cache de préfixe réutilise le calcul de l'état d'une question à l'autre ; sur un état court, le moteur le recalcule pour chaque question, et la latence croît avec le nombre de questions.

Modèle System OneLLM qui génère du JSON
SortieUne valeur typée avec sa distributionDu texte à valider et parser
Erreur de formatImpossible par constructionRare avec structured outputs, possible sinon
ProbabilitésUne par option, toujoursLogprobs selon le fournisseur, souvent aucune
Ce qui fait la latenceUne passe par question, sur l'étatLa longueur de la réponse générée
Ce qui fait le coûtLes tokens d'entréeLes tokens d'entrée et de sortie

03 · Les familles

Sept familles donnent une décision typée à partir d'un texte ; seuls les modèles de décision combinent un format garanti, une probabilité par option et une seule passe. Le détail, produit par produit, avec licences et sources, est sur la page Paysage.

FamilleExemplesLicenceOù ça tourne
Modèles de décision hébergésJev (TypeSafe), d1 (Liquid AI), Decisions API (OpenAI, accès anticipé limité)FerméeAPI
Modèles de décision ouvertsClef (Cloudflare), JevK5, Kahn1, Tev1 (Together), LayaApache 2.0 le plus souventLocal, parfois aussi hébergé
LLM avec structured outputsOpenAI, Anthropic, GoogleFerméeAPI
Décodage contraintOutlines, XGrammar, vLLM, llama.cpp, GuidanceApache 2.0 ou MITLocal, avec n'importe quel modèle
Classification cloudGoogle Natural Language, AWS Comprehend, Azure LanguageFerméeAPI
Encodeurs zero-shotbart-large-mnli, DeBERTa-v3 zeroshot, GLiClass, SetFitMIT ou Apache 2.0CPU
Guardrails et jugesLlama Guard 4, ShieldGemma, Granite Guardian, Qwen3Guard, Prometheus 2MixteLocal

04 · Comment choisir

  • Vos données peuvent-elles sortir ? Non : un modèle ouvert en local. Oui : une API hébergée devient possible.
  • Quelle langue ? Jev est entraîné d'abord pour l'anglais, selon sa documentation ; vérifiez la langue de chaque modèle.
  • Quelle licence ? Apache 2.0 et MIT permettent l'usage commercial ; certaines licences (Qwen Research, CC BY-NC) le limitent.
  • La calibration tient-elle sur vos données ? Mesurez l'ECE sur quelques centaines d'exemples annotés avant de fixer un seuil.
  • Combien d'options et quelle longueur de texte ? Le nombre d'options et la fenêtre de contexte varient d'un modèle à l'autre.
  • Quel débit et quel matériel ? Un GPU pour la production ; un CPU suffit pour tester, à quelques secondes par question.
  • Un encodeur suffit-il ? Pour des intentions courtes et fixes, un encodeur zero-shot sur CPU est souvent plus rapide et assez bon.

05 · Comment on les mesure

JevBench est le benchmark indépendant de la catégorie : des états et des grilles bornées, une réponse typée, quatre axes (précision, calibration, vitesse, coût). Les éditeurs citent aussi leurs propres indices : Cloudflare et Liquid AI annoncent chacun dépasser Jev sur un « Decision Index », chiffres non reproduits ici.

Une comparaison n'a de sens qu'à périmètre égal : les mêmes exemples, les mêmes options, les mêmes labels. C'est la règle de nos résultats : sur 14 663 exemples réservés, Jev 1.13.0 obtient 73,2 % et Kahn1 4B 72,4 %. Sur les 231 exemples publics de JevBench, Jev obtient 86,6 % dans l'exécution de JevBench, Kahn1 4B 87,4 % dans la nôtre (k = 3, calibré ; écart non significatif, p = 0,84) et JevK5 v0.2 85,3 % dans celle de JevBench (86,1 % dans celle de ses auteurs) : trois exécutions distinctes sur les mêmes exemples.

06 · Limites

  • Ce ne sont pas des modèles de raisonnement : calculer une date, une durée ou un montant en une passe reste un point faible.
  • La calibration vaut pour la distribution sur laquelle elle a été ajustée : recalibrez sur votre domaine.
  • La confiance n'est pas la probabilité d'avoir raison : fixez vos seuils sur vos propres données.
  • La réglementation s'applique toujours (AI Act, règles sectorielles) : gardez une personne ou un modèle plus grand sur les cas peu sûrs.

Le détail, pour Kahn1, est sur la page Points de vigilance.

07 · Termes clés

  • Modèle System One. Un modèle qui répond à des questions typées sur un texte en une seule passe, avec une probabilité pour chaque réponse permise. On dit aussi modèle de décision ou modèle de classe Jev.
  • Choice. Une question à liste d'options fixe ; la réponse est une option et une probabilité pour chacune.
  • Score. Une question sur des niveaux ordonnés (faible, moyen, élevé) ; la réponse est un niveau et une espérance sur les niveaux.
  • Noul. Le nom donné par Jev à une question oui / non : le texte appuie-t-il cette affirmation ? Kahn1 reprend ce nom.
  • Logit. Le score brut qu'un modèle de langage donne à chaque token avant que le softmax en fasse des probabilités.
  • Calibration. L'accord entre probabilités et réalité : sur les réponses données à 80 % de confiance, environ 80 % doivent être justes.
  • ECE. Expected calibration error : l'écart moyen entre confiance et précision, par tranches de confiance. 0 est parfait.
  • Débiaisage par permutation. Poser la même question avec les options dans k ordres différents et moyenner les probabilités, pour que la position d'une option ne pèse pas sur la réponse.
  • Cache de préfixe. Réutiliser le calcul d'un début de prompt commun (l'état) d'une question à l'autre, quand le moteur le peut : vLLM met le préfixe de Kahn1 4B en cache par blocs de 528 tokens, seuls les états plus longs qu'un bloc en profitent.