Cloudflare publie Clef et Clef-flash, deux modèles de décision conçus pour classer rapidement une situation et fournir des réponses structurées aux agents IA. Les poids sont disponibles sous licence Apache 2.0 et les modèles sont aussi proposés sur Workers AI.
Contrairement à un grand modèle de langage chargé de produire du texte libre, Clef reçoit un état, des questions et une liste de réponses possibles. Il renvoie des choix typés accompagnés de probabilités. Un logiciel peut ensuite utiliser ces résultats pour router une demande, déclencher une action ou solliciter une validation humaine.
Dans son annonce du 1er octobre, Cloudflare cite le tri des tickets de support, la classification de domaines et la sélection d’outils pour les agents. L’entreprise ouvre également un service d’ajustement par renforcement, d’abord accompagné par ses ingénieurs avant une future plateforme en libre-service.
Deux modèles pour arbitrer vitesse et précision
Clef utilise Qwen3.8-27B comme base gelée, tandis que Clef-flash s’appuie sur Qwen3.5-9B. Cloudflare a ajouté des adaptateurs et une architecture de scoring qui évalue en parallèle les options valides d’un schéma, sans générer une longue réponse mot après mot.
Cette méthode vise les étapes où un agent doit prendre une décision bornée. Clef accepte jusqu’à 64 000 jetons de contexte et dispose d’un encodeur visuel. Clef-flash sacrifie une partie de la qualité sur certains tests pour réduire fortement la latence.
Cloudflare annonce une latence médiane de 209,3 millisecondes pour Clef et de 38,8 millisecondes pour Clef-flash sur son banc de 43 évaluations. Les résultats varient selon les tâches. Clef atteint par exemple 94,20 en macro-F1 sur BANKING77, tandis que Jev conserve l’avantage sur le test When2Call.
Des résultats à lire avec prudence
Les comparaisons sont publiées par le fournisseur lui-même et ne remplacent pas une évaluation indépendante dans un environnement réel. Les performances d’un modèle de décision dépendent notamment de la définition des choix, de la qualité du contexte et du seuil à partir duquel le système accepte d’agir sans intervention humaine.
Cloudflare indique utiliser Clef en interne pour classer des sites web. Un essai cité dans le billet a pris 2,2 secondes pour charger, afficher et classer un domaine, contre 4,7 secondes avec gpt-oss-120b dans le même flux. Cette mesure englobe cependant davantage que le seul temps d’inférence.
Une nouvelle brique pour les agents IA
Les deux modèles sont téléchargeables sur Hugging Face. Leur compatibilité avec l’API de Jev doit faciliter les essais sans réécrire toute une application. Cloudflare les héberge aussi à proximité de son infrastructure edge afin de réduire le délai réseau.
L’intérêt de Clef tient moins à la conversation qu’à l’orchestration. Un agent peut confier la compréhension ouverte à un grand modèle, puis utiliser un modèle spécialisé pour choisir une catégorie ou un outil. Cette séparation peut réduire les coûts et rendre certaines décisions plus prévisibles, à condition de conserver des garde-fous lorsque l’action présente un risque.
