KAHN1
EN FR

Kahn1 vs Laya

Kahn1 4B, un modèle de langage de 4B, face à Laya, un encodeur de 421M de Convai Innovations : deux modèles de décision ouverts qui prennent des questions au format de Jev, sur les mêmes exemples, sur le même GPU.

Mis à jour le 2 octobre 2026

01 · La réponse courte

Kahn1 4B est loin devant : 72,4 % contre 59,1 % sur notre holdout, alors que Laya a été entraîné sur ses six sources, et 87,4 % contre 57,6 % sur JevBench (niveau difficile 75,7 % contre 32,4 %). L'écart est le plus grand en Score (51,9 % contre 29,5 %) ; en Noul les deux sont proches (75,5 % contre 74,8 %). Laya est dix fois plus petit, tourne sur CPU et répond en 24 ms environ sur notre GPU.

02 · Côte à côte

Kahn1 4BLaya
ÉditeurKahn1, indépendantConvai Innovations
LicencePoids Apache 2.0, code MITApache 2.0
Construit surQwen3.5-4B + LoRA, fusionnéEncodeur ModernBERT-large (anglais), mmBERT-base (multilingue)
Taille4B ; 8,4 Go en bf16421M (843 Mo) et 322M (644 Mo)
EntréesTexteTexte ; 512 tokens (anglais), 1 024 à 8 192 (multilingue)
Lecture des réponsesLogits des tokens d'option, 3 ordres d'options moyennés, calibration par températureUne tête de politique entraînée sur des règles de score propres ; températures livrées
Format de requêteChamps de question de Jev sous une clé « schema » sur /v1/evaluate/jev (adaptateur pour un client Jev)Requêtes au format /v1/systemone de Jev via laya-serve
Tourne surUn GPU de 16 Go en bf16 (vLLM), ou un CPU (transformers)Un CPU ou n'importe quel GPU
LatenceMédiane 88,7 ms par requête, k = 3, RTX 5070 Ti (notre mesure)Médiane 23,5 ms par question sur notre RTX 5070 Ti (son Router, une question par requête)

03 · Mesuré sur les mêmes exemples

Holdout Kahn1 (14 663 exemples, Choice sur les mêmes 8 options) :

GroupeExemplesKahn1 4BLaya
Global14 66372,4 %59,1 %
Choice6 05092,3 %83,2 %
Score6 21051,9 %29,5 %
Noul2 40375,5 %74,8 %
BANKING773 07691,8 %86,1 %
MASSIVE2 97492,9 %80,1 %
SST-52 21055,0 %40,4 %
App reviews4 00050,2 %23,5 %
SciTail2 12674,1 %74,5 %
RTE27785,9 %77,3 %

JevBench public (231 exemples) :

NiveauExemplesKahn1 4BLaya
Tous23187,4 %57,6 %
Standard7297,2 %70,8 %
Facile48100,0 %95,8 %
Difficile11175,7 %32,4 %

Apparié exemple par exemple (test exact de McNemar) : sur le holdout, Laya réussit 1 010 exemples que Kahn1 rate et Kahn1 2 969 que Laya rate (p = 6 × 10−221) ; sur JevBench, 8 contre 77 (p = 3 × 10−15). ECE : Kahn1 4B 0,072, Laya 0,184. Méthode complète et biais : Modèles ouverts, mesurés à périmètre égal.

04 · Lequel choisir

Prenez Laya si

  • Vous avez besoin d'un modèle pour CPU seul, ou de la latence la plus basse.
  • Vos textes sont courts et vos tâches proches de ses données d'entraînement (intentions, sentiment, implication).
  • Vous voulez le format de requête de Jev via laya-serve.

Prenez Kahn1 si

  • Vous demandez des notes sur une échelle (Score) : sur les avis d'applications, Laya répond surtout les niveaux les plus bas.
  • Vos textes dépassent 512 tokens, ou les décisions sont difficiles (niveau difficile de JevBench).
  • Vous fixez des seuils sur la confiance : Kahn1 est le mieux calibré (ECE 0,072 contre 0,184).

05 · Ce qu'il faut garder en tête

  • Les chiffres de Laya sur le holdout sont in-distribution : sa fiche cite les six sources du holdout dans ses données d'entraînement.
  • Le checkpoint anglais de Laya tronque 57 des 231 états JevBench (512 tokens) ; son checkpoint multilingue, qui les lit en entier, fait moins bien.
  • Laya répond en une passe avec sa calibration livrée ; Kahn1 moyenne 3 ordres d'options et se calibre.
  • Latence : les 23,5 ms de Laya sont une question par requête via son Router sur notre GPU ; les 88,7 ms de Kahn1, k = 3 via vLLM. Réglages différents.

06 · Questions fréquentes

Laya est-il plus précis que Kahn1 ?

Non. Sur les mêmes 14 663 exemples réservés, Laya obtient 59,1 % et Kahn1 4B 72,4 % ; sur les 231 exemples publics de JevBench, 57,6 % contre 87,4 %.

Laya est-il plus rapide ?

Oui : un encodeur de 421M répond en 24 ms environ par question sur notre GPU, et tourne sur CPU. Kahn1 4B prend 89 ms environ à k = 3 sur le même GPU.

Laya a-t-il été testé sur des données qu'il a vues ?

Sa fiche cite BANKING77, MASSIVE, SST-5, SciTail, RTE et app_reviews dans ses données d'entraînement, les six sources du holdout de Kahn1 : ses chiffres de holdout sont donc in-distribution. JevBench n'en fait pas partie.