Tous les articles
IA & dev

Clef, Strands Decider, pplx-decider : les modèles de décision ouverts

Par Elouan Laurent

Quels modèles de décision ouverts sont sortis depuis le 23 septembre ?

Quatre éditeurs ont publié cinq modèles de décision aux poids téléchargeables en moins de deux semaines, tous sous licence Apache 2.0. Ils renvoient une probabilité par réponse plutôt que du texte, et chaque chiffre de performance vient de l'éditeur lui-même.

Jev, de TypeSafe, se consomme par son API System One. Je l'ai comparé à GLiDE dans mon article sur les deux modèles. Cette fois, les poids se téléchargent.

Modèle Éditeur Taille Base Publié sur Hugging Face
GLiNER2.5-Decide Fastino 340 millions gliner2-large-v1 23 septembre
Clef Cloudflare 27 milliards Qwen3.8-27B 30 septembre
Clef-flash Cloudflare 9 milliards Qwen3.5-9B 30 septembre
Strands Decider 2B Strands Labs 2 milliards Qwen3.5-2B-Base (adaptateur LoRA) 30 septembre
pplx-decider v1.1 Perplexity 27 milliards Qwen3.8-27B 5 octobre

Clef et Clef-flash (Cloudflare) : 27 et 9 milliards de paramètres, hébergés ou à télécharger

Cloudflare a présenté Clef et Clef-flash le 1er octobre 2026. Les deux lisent du texte, du JSON, des images ou des vidéos. Ils renvoient une probabilité pour chaque option de chaque question, sans générer de texte.

Ils sont hébergés sur Workers AI à 0,24 $ (Clef) et 0,09 $ (Clef-flash) le million de tokens en entrée. La page de prix ne liste pas de tarif de sortie, et le contexte est de 65 536 tokens. Cloudflare déclare ne pas lire, stocker ni réutiliser les requêtes pour s'entraîner, sauf avec son service de fine-tuning.

Le modèle de base reste figé. Cloudflare entraîne une tête de routage et des adaptateurs de rang 256 sur des données synthétiques internes.

Cloudflare indique que l'API de Clef est entièrement compatible avec Jev et SystemOne. Cette compatibilité porte sur le corps JSON : la route hébergée documentée est /client/v4/accounts/{id}/ai/run/@cf/cloudflare/clef, et non /v1/systemone.

Strands Decider 2B (Strands Labs) : le plus petit, avec ses limites écrites noir sur blanc

Strands Decider 2B est un adaptateur LoRA posé sur Qwen3.5-2B-Base, avec une petite tête de lecture qui note les options d'une question. Strands Labs le destine aux workflows construits avec le SDK Strands Agents. Le dépôt GitHub contient le code, la recette d'entraînement et les évaluations, sous Apache 2.0.

Sur JevBench public, il répond juste à 167 tâches sur 231, soit 72,3 %. Ses auteurs listent leurs propres limites. Les documents longs en plusieurs étapes sont son point faible, et la calibration n'est établie que sur de courtes classifications.

Leur conseil : mesurer sur votre propre trafic avant de fixer un seuil. La fiche précise qu'un réentraînement donne des chiffres un peu différents avec les mêmes réponses. Une v21 est d'ailleurs sortie le 5 octobre, cinq jours après la v19.

Il s'installe avec pip install strands-decider. Son serveur local expose POST /v1/systemone, écoute sur 127.0.0.1 et n'a pas d'authentification : l'éditeur le réserve aux essais locaux. L'entraînement utilise des jeux publics, des lignes synthétiques et les sorties d'un modèle enseignant, Qwen3.5-4B.

pplx-decider (Perplexity) et GLiNER2.5-Decide (Fastino) : deux profils à part

pplx-decider-v1.1-27b est un fine-tune de Qwen3.8-27B, publié le 5 octobre sous Apache 2.0. Sa fiche annonce 61,56 au Decision Index, contre 57,9 pour Jev, et demande un GPU avec environ 49 Gio de place pour les poids.

Ce n'est pas un remplaçant direct. Le checkpoint utilise une attention non causale et une tête de lecture à part, sans lm_head. Un serveur d'inférence standard demande donc un export dédié, et Perplexity fournit son propre code.

GLiNER2.5-Decide est d'un autre gabarit : 340 millions de paramètres, pour l'anglais. Sa fiche annonce 60,2 % sur fast-decisions, la suite de Fastino. Elle précise qu'il ne raisonne pas, n'explique pas et ne répond pas aux questions ouvertes.

Ce que valent les chiffres des éditeurs

Chaque fiche cite son propre banc de test. Clef et pplx-decider s'appuient sur le Decision Index, Strands sur JevBench et des jeux internes, GLiNER2.5-Decide sur fast-decisions. Aucune évaluation indépendante n'est citée, et ces résultats ne se comparent pas d'une fiche à l'autre.

Le tableau de Cloudflare lui-même est mixte. Dans son exécution interne du Decision Index 0.2.1, Jev garde l'avantage sur quatre lignes :

  • GPQA Diamond : 78,3 contre 48,0 pour Clef ;
  • MMLU-Pro : 82,7 contre 65,9 ;
  • BBH : 92,9 contre 73,7 ;
  • When2Call : 81,0 contre 72,4.

Clef passe devant sur d'autres : BFCL (98,5 contre 95,8), BANKING77 (94,2 contre 79,7) et CLINC150+OOS (97,4 contre 89,3). Le blog de Cloudflare écrit que Clef est « actuellement le leader » du Decision Index, ce que la fiche nuance ligne par ligne.

Les latences médianes (209,3 ms pour Clef, 38,8 ms pour Clef-flash, 524,1 ms pour Jev) sont mesurées par Cloudflare. Celles des autres éditeurs viendraient d'autres machines.

Lequel essayer ? Mon avis par profil

Mon avis : aucun chiffre ne tranche, il faut essayer sur vos propres décisions. Voici où je commencerais, selon le besoin :

  • hébergé, peu cher, avec des images : Clef-flash sur Workers AI, à 0,09 $ le million de tokens en entrée ;
  • local et léger : Strands Decider 2B, en gardant ses limites sur les documents longs ;
  • GPU de 49 Gio disponible : pplx-decider, livré avec son code d'inférence ;
  • textes en anglais, tri simple, matériel minimal : GLiNER2.5-Decide.

Côté Java, le DecisionModel de LangChain4j appelle POST /v1/systemone. Le serveur local de Strands expose cette route, mais la documentation de LangChain4j ne l'a testé qu'avec TypeSafe, OpenRouter et Ollama.

L'URL hébergée de Clef est différente : il faudra sans doute votre propre client HTTP. Je n'ai testé aucune de ces combinaisons.

Avant de choisir, trois étapes :

  1. Réunir quelques centaines de décisions réelles, avec la bonne réponse connue.
  2. Mesurer les candidats sur ce jeu, seuils compris, sans reprendre les chiffres des fiches.
  3. Figer la version du modèle et la noter avec chaque décision : Strands a publié une v21 cinq jours après la v19.

Vous voulez brancher un modèle de décision ou un agent IA sur une application Java / Spring Boot existante ? Je développe sur cette stack depuis 2015. Réserver un appel découverte de 30 minutes.

À lire ensuite