Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
Arrêtez de juger chaque analyse : l'échantillonnage d'évaluation est une décision budgétaire, pas une décision de couverture
DEV -
19/07
Il y a une diapositive dans chaque pitch deck de la « plateforme d'évaluation LLM » qui dit : notez chaque réponse, attrapez chaque...
Il y a une diapositive dans chaque présentation de la « plateforme d'évaluation LLM » qui dit : notez chaque réponse, détectez chaque régression. Cela semble responsable. C’est aussi le moyen le plus rapide de mettre le feu à une facture mensuelle à cinq chiffres tout en mesurant la mauvaise chose.
L’erreur est de considérer « marquer à chaque course » comme une exigence de couverture. Ce n'est pas le cas. La couverture et l'échantillonnage sont deux axes différents, et les confondre est la raison pour laquelle les équipes finissent par payer un modèle pour relire 100 % de leur trafic de production afin de produire un 7/10 que personne ne lit.
Permettez-moi de présenter le véritable argument.
La preuve a un axe d’indépendance, pas un axe de coût
Avant de pouvoir décider quoi échantillonner, vous devez décider quel type de preuves vous collectez. C'est là que la plupart des réflexions d'évaluation tournent mal : elles classent les contrôles par coût (regex bon marché ou appel GPT coûteux) plutôt que par indépendance - à quel point il est difficile pour l'agent testé de falsifier le résultat.
C'est la doctrine fondamentale derrière l'évaluation des agents, et elle se divise en trois niveaux :
Niveau 1 : preuve observable de l’extérieur que l’agent ne peut pas falsifier. La sortie a-t-elle été analysée comme JSON val... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité