KAHN1
EN FR

Points de vigilance

Kahn1 existe en deux tailles, 4 et 3 milliards de paramètres. À lire avant de confier de vraies décisions à l'un ou à l'autre.

Ce n'est pas un modèle de pointe.

Sur des jugements subjectifs ou ambigus, il se trompe plus souvent qu'un grand modèle. Sur le niveau difficile du benchmark externe JevBench, Kahn1 4B est au niveau de Jev (75,7 % contre 73,0 %, écart non significatif) et le 3B n'obtient que 42,3 %. JEV est devant sur le holdout, au global et en Choice. Calculer une date, une durée ou un montant en une seule passe est un point faible.

La précision dépend de la primitive.

Choice est solide (92 % pour le 4B, 91 % pour le 3B sur les datasets d'intentions du holdout, 8 options par question). Score est la primitive la plus faible : 52 % (4B) et 51 % (3B) de correspondance exacte sur des échelles à 5 niveaux, même si les deux sont à un niveau près dans environ 95 % des cas sur SST-5. Noul : 86 % sur RTE et 74 % sur SciTail (implication scientifique, hors domaine) pour le 4B, 83 % et 65 % pour le 3B.

La calibration vaut pour sa propre distribution.

Les températures ont été ajustées sur un split de calibration tiré de la distribution d'entraînement et tenu à l'écart de l'entraînement, pas sur vos données, et l'erreur de calibration de Noul reste de 0,13 pour le 4B, 0,23 pour le 3B. Recalibrez sur votre domaine avant de vous fier à un seuil : sysone calibrate, décrit dans le guide.

La confiance n'est pas la probabilité d'avoir raison.

La confiance vaut (p_max − 1/n) / (1 − 1/n) : elle mesure l'écart à un tirage uniforme. Fixez vos seuils sur des données réservées de votre domaine et regardez la courbe risque-couverture.

Calcul déterministe ne veut pas dire vérité déterministe.

Mêmes poids, même prompt, mêmes noyaux : mêmes logits. Cela ne rend pas la réponse juste : un texte adverse ou hors distribution peut encore le tromper, et il n'offre aucune garantie formelle.

La réglementation s'applique toujours.

Lire les logits plutôt qu'analyser du JSON supprime les erreurs de format, pas les obligations liées à l'usage d'un modèle neuronal pour décider (AI Act, règles sectorielles). Gardez une personne ou un modèle plus gros sur la voie à faible confiance, et journalisez les décisions.

La vitesse vient de l'ingénierie.

Une seule position de sortie par question explique la latence, pas une architecture nouvelle. Elle augmente quand même à chaque question, presque linéairement sur un état court, que vLLM ne peut pas réutiliser pour Kahn1 4B ; les états longs sont mis en cache. Sur CPU, comptez des secondes par question ; dans un navigateur sans WebGPU, des minutes.

Les démos navigateur utilisent un checkpoint plus ancien.

Le playground et Snake chargent un GGUF 4 bits plus léger du 3B (merci à mradermacher), plus ancien que les poids publiés du 3B ; la page inverse ses réponses Noul, que ce build a apprises à l'envers. Les résultats sont ceux de Kahn1 4B et de Kahn1 3B non quantifiés, sur vLLM.