Judges — évaluation
Les juges évaluent la qualité de vos exécutions et produisent des verdicts (note, pass/fail, raison) rattachés à vos traces.
Types & catégories
Un juge a un type (ce qu'il produit) et une catégorie (la lane de bundle où il compte) :
| Type | Produit |
|---|---|
| Évaluateur | Une note (0–100) et un verdict pass/fail. |
| Extracteur | Des entités structurées extraites du trafic. |
| Politique | Une vérification de règles et la liste des violations. |
| Catégorie | Couvre |
|---|---|
| Sécurité | Toxicité, contenus interdits, robustesse, sûreté. |
| Qualité | Qualité de la réponse : grounding, pertinence, clarté… |
| Politique | Conformité aux règles métier / internes. |
| Conformité | Lens transverse AI Act : lit les verdicts Sécurité / Qualité / Politique article par article (pas de juge granulaire dédié). |
Créer un juge
Trois chemins, depuis le hub de création :
| Mode | Pour qui |
|---|---|
| Formulaire (Wizard) | Éditeur structuré pour des juges à base de règles. |
| Conversationnel | Construction assistée par LLM, en discutant. |
| Import | Upload de définitions YAML / code en masse. |
Import : revue éditable en une passe
À l'import (YAML / code), un écran de revue laisse éditer chaque champ avant de
valider — type, catégorie, modèle managé ou endpoint, fichiers. Trois modes de déploiement :
managed, endpoint, code (le type custom n'est plus
proposé).
Le cockpit d'un juge
| Onglet | Contenu |
|---|---|
| Overview | KPIs : taux de réussite, exécutions, alertes. |
| Playground | Exécuter et déboguer le juge sur des payloads de test. |
| Benchmark | Comparer les performances, détecter les régressions. |
| History | Journal des verdicts (pass / fail / error), filtrable. |
| Settings | Code, métadonnées, connexions (bindings) et clés BYOK. |
Brancher un juge sur un SIA
Un binding connecte un juge à un SIA (et à des champs précis), avec un déclencheur (step_end,
flow_end, session_end), un échantillonnage et un seuil. Les verdicts apparaissent ensuite dans
l'onglet Juges du SIA et dans le détail de trace. Un binding peut aussi cibler des labels
pour n'évaluer qu'un sous-ensemble d'events (voir Exploiter les metadata).
Dans l'onglet Juges du SIA, les juges sont regroupés en bundles (Conformité, Sécurité, Qualité, Politique), chacun avec un interrupteur maître. La plateforme calcule les juges recommandés d'après la classification AI Act (par environnement) : un bouton Configuration automatique branche tout le recommandé, et Appliquer partout ramène un branchement qui a dévié vers sa config recommandée. Le wizard de branchement (Juge → Où → Quand → Exécution → Portée → Contexte → Récap) décrit chaque choix « en clair ».
Déclencheur × type de SIA
La plateforme bloque les combinaisons incompatibles. step_end et
flow_end valent pour tous les types ; session_end n'a de sens que pour
les SIA conversationnels, agent et one-shot. Les nouveaux juges se déclarent
compatibles avec les types canoniques : one-shot, conversational, agent, pipeline.
Scores de session
Pour les juges déclenchés en flow_end / session_end, l'onglet Scores d'une session affiche
une matrice juge × tour : chaque juge en ligne, chaque tour en colonne, avec l'historique des
verdicts et le détail de l'entrée évaluée. Toutes les notes numériques vivent sur une échelle
canonique 0–100 (les scores en ratio 0–1 sont normalisés). Inutile de re-multiplier côté
affichage.
Verdicts raisonnés & note
Au-delà des verdicts individuels, la plateforme produit des méta-verdicts — un « juge de juges » qui synthétise, par catégorie (Conformité, Sécurité, Politique, Qualité) plus un Global, un verdict argumenté avec un niveau de confiance. La catégorie Conformité se décline article par article (AI Act). L'ensemble alimente la note de session/trace : une lettre A→G (une non-conformité critique plafonne la lettre). Un juge en erreur est distingué d'un juge qui n'avait simplement rien à affirmer.
Platform-managed vs client-runtime
La plupart des juges sont exécutés côté plateforme (vous les activez, rien à coder). Vous pouvez aussi pousser vos propres verdicts depuis votre code. Voir Juges & feedback (SDK).