La meilleure configuration de votre préparation n'a pas gagné. La sélection l’a fait.

DEV - 05:24
Biais de sélection d'évaluation Best-of-K : choisissez la configuration la mieux notée parmi K candidats sur un ensemble d'évaluation et...

Biais de sélection d'évaluation Best-of-K : choisissez la configuration ayant obtenu le score le plus élevé parmi K candidats sur un ensemble d'évaluation et le score observé est biaisé à la hausse. Il rapporte le maximum attendu de K estimations bruyantes, qui dépasse la moyenne du champ chaque fois que K dépasse un. Le biais apparaît même lorsque toutes les configurations K sont vraiment égales, grandissent avec K et diminuent avec n.

Voici la version qui vous mord. Votre préparation a exécuté un lot d'invites sur un ensemble d'évaluation, celui du haut est arrivé en tête et vous l'avez expédié. En production, c'est pire. Cette baisse se lit comme une malchance, une dérive ou une mauvaise semaine. Ce n’est rien de tout cela. Il s'agit d'un nombre que vous auriez pu calculer avant l'expédition, et il augmente à mesure que vous essayez de candidats.

J'ai exécuté un petit script pour rendre l'écart concret. Huit configurations, cent éléments d'évaluation, et voici le piège : j'ai créé les huit configurations vraiment identiques, chacune d'entre elles étant une pièce équitable à 50 %. Il n’y a pas vraiment de meilleur. Rien à régler. Ensuite, je laisse quand même la sélection choisir un gagnant :

configuration 0 : 47/100 = 47,0 % configuration 1 : 50/100 = 50,0 % configuration 2 : 52/100 = 52,0 % configuration 3 : 52/100 = 52,0 % configuration 4 : 50/100 = 50,0 % configuration 5 : 50/100 = 50,0 % configuration 6 : 54/100 = 54,0 % <- gagnant sélectionné (argmax) config 7 : 44/100 = 44,0 % config 6 : 54,0 % (k=54 n=100 SE=4,98) config 2 : 52,0 % (k=52 n=100 SE=5,00) RANG : INDISTINGUABLE - écart 2,00 pp contre 7,06 SE groupé = 0,28 SE < 2,0. Le classement de « config 6 » au-dessus de « config 2 » n'est PAS autorisé. A retenu le gagnant sur 100 nouveaux articles : 48/100 = 48,0 %.
Entrer en mode plein écran Quitter le mode plein écran

La configuration 6 remporte le bake-off à 54,0 %. Ensuite, j'ai demandé à la même garde d'évaluation que j'utilise dans le McNemar et à la règle de trois de classer la configuration 6 par rapport au finaliste. Il a refusé : l'écart est de 0,28 SE, bien en dessous de la barre des deux SE, doncINDISCERNABLE. Le classement ne qualifierait pas la configuration 6 de meilleure. La sélection l’a fait. Et sur un nouvel ensemble maintenu, les 54,0 % retombent à 48,0 %, vers les 50 % réels qu'ils auraient toujours été.

TL;DR

  • La sélection de la meilleure des K configurations en fonction du taux de réussite observé indique le maximum attendu de K estimations bruyantes. Le maximum de K dépasse strictement la moyenne du champ pour K d'au moins 2 (inégalité de Jensen sur une fonction convexe). Le score annoncé par le gagnant est donc biaisé.
  • Le biais ne concerne pas une configuration faible. Dans le monde nul, où toutes les configurations K sont vraiment égales, le meilleur des 16 indique 8,81 pp au-dessus des vrais 50 % et le meilleur des 64 indique 11,67 pp au-dessus. Rien à optimiser ; l'inflation est l'acte de sélection.
  • Il croît avec K : 2,82 pp à K=2, 7,10 pp à K=8, 11,67 pp à K=64 (p=0,5, n=100). L’ajout de candidat...
    [Courte citation de 8% de l'article original]
Loading...