KAHN1
EN FR

Kahn1 vs Clef-flash

Deux modèles de décision ouverts qui répondent à des questions typées sur un texte avec une probabilité par option : Kahn1 4B et Clef-flash de Cloudflare, sur les mêmes exemples, sur le même GPU.

Mis à jour le 2 octobre 2026

01 · La réponse courte

Clef-flash est plus précis sur notre holdout (74,8 % contre 72,4 %, un écart significatif), surtout en Choice (98,6 % contre 92,3 %). Kahn1 4B est devant en Noul (75,5 % contre 69,7 %), mieux calibré (ECE 0,072 contre 0,101) et au même niveau sur JevBench (87,4 % contre 83,5 %, non significatif ; niveau difficile 75,7 % contre 67,6 %). Kahn1 4B fait la moitié de la taille et tourne en bf16 sur une carte de 16 Go ; Clef-flash lit aussi les images et la vidéo, et parle le format de requête de Jev tel quel.

02 · Côte à côte

Kahn1 4BClef-flash
ÉditeurKahn1, indépendantCloudflare
LicencePoids Apache 2.0, code MITApache 2.0
Construit surQwen3.5-4B + LoRA, fusionnéQwen3.5-9B + une tête de schéma jointe
Taille4B ; 8,4 Go en bf169B ; 18,8 Go en bf16
EntréesTexteTexte, JSON, images, vidéo ; jusqu'à 16 384 tokens par défaut
Lecture des réponsesLogits des tokens d'option, 3 ordres d'options moyennés, calibration par températureUne tête qui note toutes les options de toutes les questions ensemble ; calibration selon l'éditeur
Format de requêteChamps de question de Jev sous une clé « schema » sur /v1/evaluate/jev (adaptateur pour un client Jev)Corps de requête et de réponse /v1/systemone de Jev (code publié), hébergé sur Workers AI
Tourne surUn GPU de 16 Go en bf16 (vLLM), ou un CPU (transformers)Un GPU de plus de 16 Go en bf16 (l'éditeur a testé un H200) ; nous l'avons fait tourner en int8 sur 16 Go
LatenceMédiane 88,7 ms par requête, k = 3, RTX 5070 Ti (notre mesure)Médiane 38,8 ms par requête selon l'éditeur ; pas mesurée de façon comparable ici

03 · Mesuré sur les mêmes exemples

Holdout Kahn1 (14 663 exemples, Choice sur les mêmes 8 options) :

GroupeExemplesKahn1 4BClef-flash
Global14 66372,4 %74,8 %
Choice6 05092,3 %98,6 %
Score6 21051,9 %53,7 %
Noul2 40375,5 %69,7 %
BANKING773 07691,8 %99,3 %
MASSIVE2 97492,9 %97,8 %
SST-52 21055,0 %58,2 %
App reviews4 00050,2 %51,2 %
SciTail2 12674,1 %67,6 %
RTE27785,9 %85,9 %

JevBench public (231 exemples) :

NiveauExemplesKahn1 4BClef-flash
Tous23187,4 %83,5 %
Standard7297,2 %97,2 %
Facile48100,0 %100,0 %
Difficile11175,7 %67,6 %

Apparié exemple par exemple (test exact de McNemar) : sur le holdout, Clef-flash réussit 1 187 exemples que Kahn1 rate et Kahn1 836 que Clef-flash rate (p = 6 × 10−15) ; sur JevBench, 12 contre 21 (p = 0,16). ECE : Kahn1 4B 0,072, Clef-flash 0,101. Méthode complète et biais : Modèles ouverts, mesurés à périmètre égal.

04 · Lequel choisir

Prenez Clef-flash si

  • Vous voulez la meilleure précision mesurée sur des questions Choice de type intention.
  • Vos états contiennent des images, de la vidéo ou du JSON long.
  • Vous voulez le format de requête et de réponse de Jev sans adaptateur, ou l'hébergement de Cloudflare (Workers AI).
  • Vous avez un GPU de plus de 16 Go, ou acceptez l'int8 sur 16 Go.

Prenez Kahn1 si

  • Vous fixez des seuils sur la confiance : Kahn1 est le mieux calibré des deux.
  • Vos questions sont surtout de l'implication et des vérifications de règles (Noul).
  • Vous avez un GPU de 16 Go, ou seulement un CPU.
  • Vous voulez le plus petit modèle, au même niveau sur JevBench.

05 · Ce qu'il faut garder en tête

  • Les données d'entraînement de Clef-flash ne sont pas publiées. Notre sonde sur les splits train ne trouve aucune mémorisation, ce qui n'exclut pas une exposition, et Clef-flash supprime 92 % des erreurs de son modèle de base sur BANKING77, là où Kahn1 en supprime 27 % : son avance en Choice n'est peut-être pas zero-shot (voir la page méthode).
  • Clef-flash a tourné en int8 (bitsandbytes), pas en bf16 comme publié.
  • Kahn1 moyenne 3 ordres d'options et se calibre ; Clef-flash répond en une passe, avec ses probabilités telles que livrées.
  • Le holdout est celui de Kahn1 ; JevBench est indépendant, mais seule sa moitié publique a tourné.

06 · Questions fréquentes

Clef-flash est-il plus précis que Kahn1 ?

Sur le holdout de Kahn1, oui : 74,8 % contre 72,4 % sur les mêmes 14 663 exemples, un écart significatif, porté par Choice. Sur les 231 exemples publics de JevBench, les deux sont au même niveau (87,4 % pour Kahn1 4B, 83,5 % pour Clef-flash, test exact de McNemar p = 0,16).

Clef-flash tourne-t-il sur un GPU de 16 Go ?

Pas en bf16 : ses poids pèsent 18,8 Go. Nous l'avons fait tourner en int8 avec bitsandbytes sur une RTX 5070 Ti de 16 Go, ce qui modifie légèrement le modèle.

Lequel est le mieux calibré ?

Kahn1 4B : ECE 0,072 contre 0,101 pour Clef-flash sur le holdout, chacun tel que livré.

Clef-flash a-t-il vu les données de test ?

On ne peut pas le dire. Ses données d'entraînement ne sont pas publiées. Une sonde sur les splits train des sources du test ne trouve aucune mémorisation, mais un modèle entraîné sans sur-apprentissage n'en montrerait pas non plus. Face à son propre modèle de base (Qwen3.5-9B), Clef-flash supprime 92 % des erreurs sur BANKING77 ; Kahn1 4B, qui ne l'a jamais vu, en supprime 27 % de celles du sien.