Kahn1 vs Laya
Kahn1 4B, un modèle de langage de 4B, face à Laya, un encodeur de 421M de Convai Innovations : deux modèles de décision ouverts qui prennent des questions au format de Jev, sur les mêmes exemples, sur le même GPU.
Mis à jour le 2 octobre 2026
01 · La réponse courte
Kahn1 4B est loin devant : 72,4 % contre 59,1 % sur notre holdout, alors que Laya a été entraîné sur ses six sources, et 87,4 % contre 57,6 % sur JevBench (niveau difficile 75,7 % contre 32,4 %). L'écart est le plus grand en Score (51,9 % contre 29,5 %) ; en Noul les deux sont proches (75,5 % contre 74,8 %). Laya est dix fois plus petit, tourne sur CPU et répond en 24 ms environ sur notre GPU.
02 · Côte à côte
| Kahn1 4B | Laya | |
|---|---|---|
| Éditeur | Kahn1, indépendant | Convai Innovations |
| Licence | Poids Apache 2.0, code MIT | Apache 2.0 |
| Construit sur | Qwen3.5-4B + LoRA, fusionné | Encodeur ModernBERT-large (anglais), mmBERT-base (multilingue) |
| Taille | 4B ; 8,4 Go en bf16 | 421M (843 Mo) et 322M (644 Mo) |
| Entrées | Texte | Texte ; 512 tokens (anglais), 1 024 à 8 192 (multilingue) |
| Lecture des réponses | Logits des tokens d'option, 3 ordres d'options moyennés, calibration par température | Une tête de politique entraînée sur des règles de score propres ; températures livrées |
| Format de requête | Champs de question de Jev sous une clé « schema » sur /v1/evaluate/jev (adaptateur pour un client Jev) | Requêtes au format /v1/systemone de Jev via laya-serve |
| Tourne sur | Un GPU de 16 Go en bf16 (vLLM), ou un CPU (transformers) | Un CPU ou n'importe quel GPU |
| Latence | Médiane 88,7 ms par requête, k = 3, RTX 5070 Ti (notre mesure) | Médiane 23,5 ms par question sur notre RTX 5070 Ti (son Router, une question par requête) |
03 · Mesuré sur les mêmes exemples
Holdout Kahn1 (14 663 exemples, Choice sur les mêmes 8 options) :
| Groupe | Exemples | Kahn1 4B | Laya |
|---|---|---|---|
| Global | 14 663 | 72,4 % | 59,1 % |
| Choice | 6 050 | 92,3 % | 83,2 % |
| Score | 6 210 | 51,9 % | 29,5 % |
| Noul | 2 403 | 75,5 % | 74,8 % |
| BANKING77 | 3 076 | 91,8 % | 86,1 % |
| MASSIVE | 2 974 | 92,9 % | 80,1 % |
| SST-5 | 2 210 | 55,0 % | 40,4 % |
| App reviews | 4 000 | 50,2 % | 23,5 % |
| SciTail | 2 126 | 74,1 % | 74,5 % |
| RTE | 277 | 85,9 % | 77,3 % |
JevBench public (231 exemples) :
| Niveau | Exemples | Kahn1 4B | Laya |
|---|---|---|---|
| Tous | 231 | 87,4 % | 57,6 % |
| Standard | 72 | 97,2 % | 70,8 % |
| Facile | 48 | 100,0 % | 95,8 % |
| Difficile | 111 | 75,7 % | 32,4 % |
Apparié exemple par exemple (test exact de McNemar) : sur le holdout, Laya réussit 1 010 exemples que Kahn1 rate et Kahn1 2 969 que Laya rate (p = 6 × 10−221) ; sur JevBench, 8 contre 77 (p = 3 × 10−15). ECE : Kahn1 4B 0,072, Laya 0,184. Méthode complète et biais : Modèles ouverts, mesurés à périmètre égal.
04 · Lequel choisir
Prenez Laya si
- Vous avez besoin d'un modèle pour CPU seul, ou de la latence la plus basse.
- Vos textes sont courts et vos tâches proches de ses données d'entraînement (intentions, sentiment, implication).
- Vous voulez le format de requête de Jev via laya-serve.
Prenez Kahn1 si
- Vous demandez des notes sur une échelle (Score) : sur les avis d'applications, Laya répond surtout les niveaux les plus bas.
- Vos textes dépassent 512 tokens, ou les décisions sont difficiles (niveau difficile de JevBench).
- Vous fixez des seuils sur la confiance : Kahn1 est le mieux calibré (ECE 0,072 contre 0,184).
05 · Ce qu'il faut garder en tête
- Les chiffres de Laya sur le holdout sont in-distribution : sa fiche cite les six sources du holdout dans ses données d'entraînement.
- Le checkpoint anglais de Laya tronque 57 des 231 états JevBench (512 tokens) ; son checkpoint multilingue, qui les lit en entier, fait moins bien.
- Laya répond en une passe avec sa calibration livrée ; Kahn1 moyenne 3 ordres d'options et se calibre.
- Latence : les 23,5 ms de Laya sont une question par requête via son Router sur notre GPU ; les 88,7 ms de Kahn1, k = 3 via vLLM. Réglages différents.
06 · Questions fréquentes
Laya est-il plus précis que Kahn1 ?
Non. Sur les mêmes 14 663 exemples réservés, Laya obtient 59,1 % et Kahn1 4B 72,4 % ; sur les 231 exemples publics de JevBench, 57,6 % contre 87,4 %.
Laya est-il plus rapide ?
Oui : un encodeur de 421M répond en 24 ms environ par question sur notre GPU, et tourne sur CPU. Kahn1 4B prend 89 ms environ à k = 3 sur le même GPU.
Laya a-t-il été testé sur des données qu'il a vues ?
Sa fiche cite BANKING77, MASSIVE, SST-5, SciTail, RTE et app_reviews dans ses données d'entraînement, les six sources du holdout de Kahn1 : ses chiffres de holdout sont donc in-distribution. JevBench n'en fait pas partie.