Dashboard qualité du plugin

Des skills pour une livraison disciplinée.

Tout ce que livre le plugin SKRAFT — skills, agents, workers et lentilles de revue — avec son profil de contexte, sa couverture d'évaluation et les preuves issues de comparaisons contrôlées skill versus baseline.

Ces filtres s'appliquent au catalogue, à la qualité, à l'efficacité et à la comparaison des modèles.

Ordre d'usage

Préparation produit, puis ingénierie

Les workflows produit autonomes et optionnels précèdent l'unique point d'entrée d'ingénierie. Brownfield et les autres racines restent indépendants.

Catalogue dérivé des sources

Agents, workers, lentilles et skills

Chargement du catalogue…

Comparaison contrôlée

Qualité et activation

Comment lire la qualité

Chaque modèle est comparé avec et sans le skill. Les modèles apparaissent ensemble uniquement quand le même juge les a évalués ; « score le plus élevé » vaut pour ce skill et ce juge, pas pour toutes les tâches.

Baseline
Score sans le skill.
Avec skill
Score du même modèle avec le skill disponible.
Gain
Score avec skill moins baseline. Positif signifie que le skill a aidé sur ce jeu d'essais.
Taux d'activation
Fréquence de chargement du skill quand il était attendu.
Inattendues
Chargements sur des prompts où le skill devait rester inactif. Zéro est la cible.
Verdict
Conclusion statistique sur des essais appariés, pas un succès ou un échec isolé.

Profil d'exécution

Efficacité

Comment lire l'efficacité

Comparez chaque modèle à sa propre baseline. Une consommation plus faible n'est utile que si la qualité reste acceptable ; l'efficacité seule ne désigne pas le meilleur modèle.

Durée
Temps écoulé médian par essai.
Tokens
Volume médian d'entrée et de sortie du modèle par essai.
Tours
Nombre médian de cycles de raisonnement de l'agent.
Appels d'outils
Nombre médian d'actions externes réalisées par l'agent.
Écart
Évolution par rapport à la baseline. Un pourcentage négatif signifie que l'essai avec skill a consommé moins.

Un bras par modèle agent

Comparaison des modèles

Comment comparer les modèles

Une ligne correspond à un modèle agent. Comparez uniquement les lignes d'un même tableau : elles utilisent le même skill et le même juge. « Score le plus élevé » est une preuve locale, jamais un classement universel des modèles.

Modèle agent
Modèle qui a réalisé la tâche.
Juge
Modèle qui a évalué les sorties selon la grille.
Score le plus élevé
Meilleur score avec skill dans ce tableau ; examinez aussi le gain et l'efficacité avant de décider.