Kahn1 vs Clef-flash
Deux modèles de décision ouverts qui répondent à des questions typées sur un texte avec une probabilité par option : Kahn1 4B et Clef-flash de Cloudflare, sur les mêmes exemples, sur le même GPU.
Mis à jour le 2 octobre 2026
01 · La réponse courte
Clef-flash est plus précis sur notre holdout (74,8 % contre 72,4 %, un écart significatif), surtout en Choice (98,6 % contre 92,3 %). Kahn1 4B est devant en Noul (75,5 % contre 69,7 %), mieux calibré (ECE 0,072 contre 0,101) et au même niveau sur JevBench (87,4 % contre 83,5 %, non significatif ; niveau difficile 75,7 % contre 67,6 %). Kahn1 4B fait la moitié de la taille et tourne en bf16 sur une carte de 16 Go ; Clef-flash lit aussi les images et la vidéo, et parle le format de requête de Jev tel quel.
02 · Côte à côte
| Kahn1 4B | Clef-flash | |
|---|---|---|
| Éditeur | Kahn1, indépendant | Cloudflare |
| Licence | Poids Apache 2.0, code MIT | Apache 2.0 |
| Construit sur | Qwen3.5-4B + LoRA, fusionné | Qwen3.5-9B + une tête de schéma jointe |
| Taille | 4B ; 8,4 Go en bf16 | 9B ; 18,8 Go en bf16 |
| Entrées | Texte | Texte, JSON, images, vidéo ; jusqu'à 16 384 tokens par défaut |
| Lecture des réponses | Logits des tokens d'option, 3 ordres d'options moyennés, calibration par température | Une tête qui note toutes les options de toutes les questions ensemble ; calibration selon l'éditeur |
| Format de requête | Champs de question de Jev sous une clé « schema » sur /v1/evaluate/jev (adaptateur pour un client Jev) | Corps de requête et de réponse /v1/systemone de Jev (code publié), hébergé sur Workers AI |
| Tourne sur | Un GPU de 16 Go en bf16 (vLLM), ou un CPU (transformers) | Un GPU de plus de 16 Go en bf16 (l'éditeur a testé un H200) ; nous l'avons fait tourner en int8 sur 16 Go |
| Latence | Médiane 88,7 ms par requête, k = 3, RTX 5070 Ti (notre mesure) | Médiane 38,8 ms par requête selon l'éditeur ; pas mesurée de façon comparable ici |
03 · Mesuré sur les mêmes exemples
Holdout Kahn1 (14 663 exemples, Choice sur les mêmes 8 options) :
| Groupe | Exemples | Kahn1 4B | Clef-flash |
|---|---|---|---|
| Global | 14 663 | 72,4 % | 74,8 % |
| Choice | 6 050 | 92,3 % | 98,6 % |
| Score | 6 210 | 51,9 % | 53,7 % |
| Noul | 2 403 | 75,5 % | 69,7 % |
| BANKING77 | 3 076 | 91,8 % | 99,3 % |
| MASSIVE | 2 974 | 92,9 % | 97,8 % |
| SST-5 | 2 210 | 55,0 % | 58,2 % |
| App reviews | 4 000 | 50,2 % | 51,2 % |
| SciTail | 2 126 | 74,1 % | 67,6 % |
| RTE | 277 | 85,9 % | 85,9 % |
JevBench public (231 exemples) :
| Niveau | Exemples | Kahn1 4B | Clef-flash |
|---|---|---|---|
| Tous | 231 | 87,4 % | 83,5 % |
| Standard | 72 | 97,2 % | 97,2 % |
| Facile | 48 | 100,0 % | 100,0 % |
| Difficile | 111 | 75,7 % | 67,6 % |
Apparié exemple par exemple (test exact de McNemar) : sur le holdout, Clef-flash réussit 1 187 exemples que Kahn1 rate et Kahn1 836 que Clef-flash rate (p = 6 × 10−15) ; sur JevBench, 12 contre 21 (p = 0,16). ECE : Kahn1 4B 0,072, Clef-flash 0,101. Méthode complète et biais : Modèles ouverts, mesurés à périmètre égal.
04 · Lequel choisir
Prenez Clef-flash si
- Vous voulez la meilleure précision mesurée sur des questions Choice de type intention.
- Vos états contiennent des images, de la vidéo ou du JSON long.
- Vous voulez le format de requête et de réponse de Jev sans adaptateur, ou l'hébergement de Cloudflare (Workers AI).
- Vous avez un GPU de plus de 16 Go, ou acceptez l'int8 sur 16 Go.
Prenez Kahn1 si
- Vous fixez des seuils sur la confiance : Kahn1 est le mieux calibré des deux.
- Vos questions sont surtout de l'implication et des vérifications de règles (Noul).
- Vous avez un GPU de 16 Go, ou seulement un CPU.
- Vous voulez le plus petit modèle, au même niveau sur JevBench.
05 · Ce qu'il faut garder en tête
- Les données d'entraînement de Clef-flash ne sont pas publiées. Notre sonde sur les splits train ne trouve aucune mémorisation, ce qui n'exclut pas une exposition, et Clef-flash supprime 92 % des erreurs de son modèle de base sur BANKING77, là où Kahn1 en supprime 27 % : son avance en Choice n'est peut-être pas zero-shot (voir la page méthode).
- Clef-flash a tourné en int8 (bitsandbytes), pas en bf16 comme publié.
- Kahn1 moyenne 3 ordres d'options et se calibre ; Clef-flash répond en une passe, avec ses probabilités telles que livrées.
- Le holdout est celui de Kahn1 ; JevBench est indépendant, mais seule sa moitié publique a tourné.
06 · Questions fréquentes
Clef-flash est-il plus précis que Kahn1 ?
Sur le holdout de Kahn1, oui : 74,8 % contre 72,4 % sur les mêmes 14 663 exemples, un écart significatif, porté par Choice. Sur les 231 exemples publics de JevBench, les deux sont au même niveau (87,4 % pour Kahn1 4B, 83,5 % pour Clef-flash, test exact de McNemar p = 0,16).
Clef-flash tourne-t-il sur un GPU de 16 Go ?
Pas en bf16 : ses poids pèsent 18,8 Go. Nous l'avons fait tourner en int8 avec bitsandbytes sur une RTX 5070 Ti de 16 Go, ce qui modifie légèrement le modèle.
Lequel est le mieux calibré ?
Kahn1 4B : ECE 0,072 contre 0,101 pour Clef-flash sur le holdout, chacun tel que livré.
Clef-flash a-t-il vu les données de test ?
On ne peut pas le dire. Ses données d'entraînement ne sont pas publiées. Une sonde sur les splits train des sources du test ne trouve aucune mémorisation, mais un modèle entraîné sans sur-apprentissage n'en montrerait pas non plus. Face à son propre modèle de base (Qwen3.5-9B), Clef-flash supprime 92 % des erreurs sur BANKING77 ; Kahn1 4B, qui ne l'a jamais vu, en supprime 27 % de celles du sien.