
Kahneman, Système 1.
Le nom rend hommage au Système 1 de Daniel Kahneman : des jugements rapides et peu coûteux qui tranchent la plupart des cas et aiguillent les autres avant qu'un Système 2 plus lent (un modèle de pointe ou une personne) prenne le relais.
Kahneman, psychologue lauréat en 2002 du prix de la Banque de Suède en sciences économiques en mémoire d'Alfred Nobel, a décrit les deux systèmes dans Système 1 / Système 2 : les deux vitesses de la pensée (2011). Le Système 1 est rapide, automatique et intuitif ; le Système 2 est lent, réfléchi et coûteux en effort.
Un état. Trois questions typées.
On m'a débité deux fois la commande n° 4821 et personne ne répond. Réglez ça avant vendredi ou je résilie mon compte.
Choice
UNE PARMI NQue veut le client ?
Score
ÉCHELLE ORDONNÉEQuelle est l'urgence ?
Noul
VRAI / FAUXLe client menace de partir.
Tirer une décision d'un texte
Kahn1
OUVERT · LOCALLit des réponses typées dans les logits des options, chacune avec une distribution calibrée. Poids ouverts, tourne sur votre matériel, aucun prix à l'appel. Le débit de production demande un GPU, et les seuils sont à recalibrer sur votre domaine.
JEV
API HÉBERGÉEUne API hébergée, précise, sans rien à faire tourner soi-même. Chaque appel est payant, passe par le réseau et envoie vos données à un tiers.
Autres LLM open source
OUVERT · LOCALDes modèles généralistes qui tournent en local. Ils génèrent leur réponse sous forme de texte : il faut l'analyser, la latence croît avec la sortie et la confiance est rarement calibrée.
Mode JSON
TOUT MODÈLE DE CHATDisponible sur presque tous les modèles et API. Le modèle écrit du JSON sous forme de texte : il faut le valider et l'analyser, des réponses mal formées arrivent et aucune probabilité ne revient.
Sorties structurées
TOUT MODÈLE DE CHATLe décodage structuré contraint les tokens qu'un modèle génère, et le résultat doit encore être analysé. La sortie respecte le schéma, mais sans distribution calibrée.
Classifieurs
ENTRAÎNÉSBERT, XGBoost… Moins de 1 à 10 ms sur CPU et solides sur les données tabulaires. L'ontologie est figée : une nouvelle catégorie impose de réannoter, réentraîner, redéployer.
Kahn1 ou ML classique ?
| ML classique (BERT, XGBoost…) | Kahn1 | |
|---|---|---|
| Nouvelle catégorie | Réannoter, réentraîner, redéployer | Modifier le schéma dans la requête |
| Données annotées | Des centaines à des milliers par classe | Aucune pour démarrer, quelques-unes pour recalibrer |
| Latence | Moins de 1 à 10 ms, CPU | 36 ms (3B) à 89 ms (4B) en médiane, GPU |
| Matériel | Petits CPU, objets embarqués | Un GPU pour le débit de production |
| Explications | Importance des variables, arbres | Distributions complètes, sans attribution |
| Déterminisme | Même entrée, même sortie | Mêmes poids, prompt et noyaux : mêmes logits ; rien n'est échantillonné |
| Traçabilité | Un score ou une étiquette par décision | Une distribution de probabilités complète par décision, prête à journaliser |
Préférez le ML classique quand l'ontologie est figée pour des années, que la latence doit rester sous 5 ms, que le matériel est modeste ou que les données sont tabulaires. Préférez Kahn1 quand les catégories changent souvent, quand vous partez sans annotations, ou quand le signal est dans du texte libre.
Une décision qu'on ne peut pas reproduire est une décision qu'on ne peut pas défendre.
Un LLM génératif échantillonne sa réponse : posez deux fois la question, et le même dossier peut recevoir deux décisions différentes. Pour les usages à haut risque listés par l'AI Act européen, comme la notation de crédit, le recrutement ou l'accès aux services essentiels, les fournisseurs doivent conserver des journaux et permettre un contrôle humain. Une décision qui change d'une exécution à l'autre est difficile à documenter, à auditer ou à contester.
Kahn1 n'échantillonne rien. La même entrée donne les mêmes logits, et chaque réponse arrive avec sa distribution complète : chaque décision peut être rejouée et journalisée telle qu'elle a été prise. Les cas à faible confiance peuvent être confiés à une personne, par seuil.
Lire les logits plutôt qu'analyser du JSON supprime les erreurs de format, pas les obligations liées à l'usage d'un modèle neuronal pour décider (AI Act, règles sectorielles). Gardez une personne ou un modèle plus gros sur la voie à faible confiance, et journalisez les décisions.
Cas d'usage
Kahn1 est pensé comme la première couche, rapide, d'une chaîne de traitement : il prend les décisions de routine et confie le reste à des systèmes plus lents et plus coûteux.
Tri et routage
Classer tickets, e-mails ou déclarations par intention, urgence et risque en une passe. Pour changer les catégories, on modifie le schéma : ni réannotation, ni réentraînement.
Garde-fous pour agents
Avant qu'un appel d'outil s'exécute, posez des questions oui/non : fuit-il des données personnelles, enfreint-il une règle, l'utilisateur l'a-t-il approuvé ? Chaque réponse est une probabilité sur laquelle bloquer.
Notation de documents
Évaluer le ton, l'urgence, la complexité ou la qualité sous forme d'espérances continues plutôt que d'étiquettes grossières, et indexer les documents dessus.
Escalade sélective
Automatiser les cas sûrs et envoyer les autres à un modèle plus gros ou à une personne. Avec une confiance calibrée, le seuil devient une décision de risque mesurable.
Démarrage à froid
Une nouvelle gamme, une nouvelle taxonomie : ça marche en zero-shot dès le premier jour. Recalibrez sur vos propres exemples annotés avec sysone calibrate dès que vous en avez.
Boucles de contrôle
Une question Choice par tour suffit à piloter une politique : Kahn1 joue à Snake aussi bien qu'une heuristique gloutonne, à condition que l'état décrive ce qui entoure la tête.
À lire avant de vraies décisions
Kahn1 existe en deux tailles, 4 et 3 milliards de paramètres. À lire avant de confier de vraies décisions à l'un ou à l'autre.
- Ce n'est pas un modèle de pointe.
- La précision dépend de la primitive.
- La calibration vaut pour sa propre distribution.
- La confiance n'est pas la probabilité d'avoir raison.
- Calcul déterministe ne veut pas dire vérité déterministe.
- La réglementation s'applique toujours.
- La vitesse vient de l'ingénierie.
- Les démos navigateur utilisent un checkpoint plus ancien.