Replay de session. Comparer côte à côte les trajectoires enregistrées avec et sans skill.
Ouvrir le replayCes filtres s'appliquent au catalogue, à la qualité, à l'efficacité et à la comparaison des modèles.
Ordre d'usage
Préparation produit, puis ingénierie
Les workflows produit autonomes et optionnels précèdent l'unique point d'entrée d'ingénierie. Brownfield et les autres racines restent indépendants.
Catalogue dérivé des sources
Agents, workers, lentilles et skills
Comparaison contrôlée
Qualité et activation
Comment lire la qualité
Chaque modèle est comparé avec et sans le skill. Les modèles apparaissent ensemble uniquement quand le même juge les a évalués ; « score le plus élevé » vaut pour ce skill et ce juge, pas pour toutes les tâches.
- Baseline
- Score sans le skill.
- Avec skill
- Score du même modèle avec le skill disponible.
- Gain
- Score avec skill moins baseline. Positif signifie que le skill a aidé sur ce jeu d'essais.
- Taux d'activation
- Fréquence de chargement du skill quand il était attendu.
- Inattendues
- Chargements sur des prompts où le skill devait rester inactif. Zéro est la cible.
- Verdict
- Conclusion statistique sur des essais appariés, pas un succès ou un échec isolé.
Profil d'exécution
Efficacité
Comment lire l'efficacité
Comparez chaque modèle à sa propre baseline. Une consommation plus faible n'est utile que si la qualité reste acceptable ; l'efficacité seule ne désigne pas le meilleur modèle.
- Durée
- Temps écoulé médian par essai.
- Tokens
- Volume médian d'entrée et de sortie du modèle par essai.
- Tours
- Nombre médian de cycles de raisonnement de l'agent.
- Appels d'outils
- Nombre médian d'actions externes réalisées par l'agent.
- Écart
- Évolution par rapport à la baseline. Un pourcentage négatif signifie que l'essai avec skill a consommé moins.
Un bras par modèle agent
Comparaison des modèles
Comment comparer les modèles
Une ligne correspond à un modèle agent. Comparez uniquement les lignes d'un même tableau : elles utilisent le même skill et le même juge. « Score le plus élevé » est une preuve locale, jamais un classement universel des modèles.
- Modèle agent
- Modèle qui a réalisé la tâche.
- Juge
- Modèle qui a évalué les sorties selon la grille.
- Score le plus élevé
- Meilleur score avec skill dans ce tableau ; examinez aussi le gain et l'efficacité avant de décider.