NIA One · Docs
Plateforme

Judges — évaluation

Les juges évaluent la qualité de vos exécutions et produisent des verdicts (note, pass/fail, raison) rattachés à vos traces.

Types & catégories

Un juge a un type (ce qu'il produit) et une catégorie (la lane de bundle où il compte) :

TypeProduit
ÉvaluateurUne note (0–100) et un verdict pass/fail.
ExtracteurDes entités structurées extraites du trafic.
PolitiqueUne vérification de règles et la liste des violations.
CatégorieCouvre
SécuritéToxicité, contenus interdits, robustesse, sûreté.
QualitéQualité de la réponse : grounding, pertinence, clarté…
PolitiqueConformité aux règles métier / internes.
ConformitéLens transverse AI Act : lit les verdicts Sécurité / Qualité / Politique article par article (pas de juge granulaire dédié).

Créer un juge

Trois chemins, depuis le hub de création :

ModePour qui
Formulaire (Wizard)Éditeur structuré pour des juges à base de règles.
ConversationnelConstruction assistée par LLM, en discutant.
ImportUpload de définitions YAML / code en masse.

Import : revue éditable en une passe

À l'import (YAML / code), un écran de revue laisse éditer chaque champ avant de valider — type, catégorie, modèle managé ou endpoint, fichiers. Trois modes de déploiement : managed, endpoint, code (le type custom n'est plus proposé).

Le cockpit d'un juge

OngletContenu
OverviewKPIs : taux de réussite, exécutions, alertes.
PlaygroundExécuter et déboguer le juge sur des payloads de test.
BenchmarkComparer les performances, détecter les régressions.
HistoryJournal des verdicts (pass / fail / error), filtrable.
SettingsCode, métadonnées, connexions (bindings) et clés BYOK.

Brancher un juge sur un SIA

Un binding connecte un juge à un SIA (et à des champs précis), avec un déclencheur (step_end, flow_end, session_end), un échantillonnage et un seuil. Les verdicts apparaissent ensuite dans l'onglet Juges du SIA et dans le détail de trace. Un binding peut aussi cibler des labels pour n'évaluer qu'un sous-ensemble d'events (voir Exploiter les metadata).

Dans l'onglet Juges du SIA, les juges sont regroupés en bundles (Conformité, Sécurité, Qualité, Politique), chacun avec un interrupteur maître. La plateforme calcule les juges recommandés d'après la classification AI Act (par environnement) : un bouton Configuration automatique branche tout le recommandé, et Appliquer partout ramène un branchement qui a dévié vers sa config recommandée. Le wizard de branchement (Juge → Où → Quand → Exécution → Portée → Contexte → Récap) décrit chaque choix « en clair ».

Déclencheur × type de SIA

La plateforme bloque les combinaisons incompatibles. step_end et flow_end valent pour tous les types ; session_end n'a de sens que pour les SIA conversationnels, agent et one-shot. Les nouveaux juges se déclarent compatibles avec les types canoniques : one-shot, conversational, agent, pipeline.

Scores de session

Pour les juges déclenchés en flow_end / session_end, l'onglet Scores d'une session affiche une matrice juge × tour : chaque juge en ligne, chaque tour en colonne, avec l'historique des verdicts et le détail de l'entrée évaluée. Toutes les notes numériques vivent sur une échelle canonique 0–100 (les scores en ratio 0–1 sont normalisés). Inutile de re-multiplier côté affichage.

Verdicts raisonnés & note

Au-delà des verdicts individuels, la plateforme produit des méta-verdicts — un « juge de juges » qui synthétise, par catégorie (Conformité, Sécurité, Politique, Qualité) plus un Global, un verdict argumenté avec un niveau de confiance. La catégorie Conformité se décline article par article (AI Act). L'ensemble alimente la note de session/trace : une lettre A→G (une non-conformité critique plafonne la lettre). Un juge en erreur est distingué d'un juge qui n'avait simplement rien à affirmer.

Platform-managed vs client-runtime

La plupart des juges sont exécutés côté plateforme (vous les activez, rien à coder). Vous pouvez aussi pousser vos propres verdicts depuis votre code. Voir Juges & feedback (SDK).

On this page