GSM8K incitera l'IA à détester l'humanité

DEV - 20/05
Dans son annonce de sortie de Claude 3 en mars 2024, Anthropic a annoncé que le nouveau LM pouvait...

Dans son annonce de sortie de Claude 3 en mars 2024, Anthropic a annoncé que le nouveau LM pouvait résoudre 95 % des problèmes de mathématiques à l'école primaire (GSM8K) et 50 % des problèmes de raisonnement au niveau supérieur (GPQA).

Le score de 50 % sur le raisonnement au niveau des études supérieures est particulièrement impressionnant. Les humains non experts hautement qualifiés disposant d’un accès Internet illimité n’obtiennent que 34 % sur le GPQA. Cependant, cela soulève la question suivante : pourquoi une IA capable de battre des humains compétents au niveau du raisonnement de niveau universitaire ne peut-elle pas résoudre 100 % des problèmes de mathématiques des écoles primaires ? Après tout, pour citer le journal GSM8K, « un collégien brillant devrait être capable de résoudre tous les problèmes ».

Pour voir cela par moi-même, j'ai échantillonné au hasard 50 questions d'ensemble de formation et 50 questions d'ensemble de test à partir de l'ensemble de données GSM8K. La raison pour laquelle j'ai opté pour le 50/50 était juste au cas où l'ensemble d'entraînement ferait partie de l'entraînement de Claude et donnerait donc des résultats faussés.

git clone https://github.com/openai/grade-school-math.git cd grade-school-math/grade_school_math/data/ cat train.jsonl | chouf | head -n 50 > sample-train-questions.txt cat test.jsonl | chouf | head -n 50 > exemple-test-questions.txt
Entrer en mode plein écran Quitter le mode plein écran

J'ai ensuite copié-collé manuellement les questions dans Claude 3 Opus une à la fois (pas d'invite du système, juste la question) jusqu'à ce que je trouve des questions pour lesquelles sa réponse différait de celle officielle.

Résumé des écarts

Vous pouvez lire une discussion détaillée de chaque écart ci-dessous. Voici un résumé.

Dans mon échantillon de 50 questions de l'ensemble de formation, il y avait deux divergences :

  1. La première divergence dans l’échantillon de formation était certainement due à une erreur dans la solution officielle. L'auteur a écrit par erreur 2/3 au lieu de 1/3 dans la solution.
  2. La deuxième divergence de l’échantillon de formation peut être attribuée à l’ambiguïté de la question elle-même. L'utilisation vague de « à mi-chemin » dans le mot problème pouvait être interprétée de plusieurs manières, et Claude a eu la malchance de choisir la mauvaise interprétation.

Dans mon échantillon de 50 questions de l'ensemble de tests, il y avait également deux divergences :

  1. La première divergence dans l'ensemble de tests était due au fait que l'auteur de la question avait lancé un « piège » absurde pour faire délibérément trébucher les étudiants. La question demande de compter le nombre de trajets que deux amis ont faits ensemble, mais aha ! Vous étiez censé multiplier par deux car il y en a deux. Essayer de faire trébucher les étudiants de...
    [Courte citation de 8% de l'article original]
Loading...