Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
Le bug était dans la niveleuse
DEV -
18/07
Un modèle frontière a obtenu un score de 0,241 sur mon benchmark durci, le même que cinq petits modèles locaux. Ce n’était pas une question de modèles. Il s'agissait de l'examen. Si
Le bug le plus cher que j'ai expédié le mois dernier n'était pas dans un modèle, ni dans une invite. C'était dans la chose qui faisait la notation. Je l'ai retrouvé trois fois, dans trois commerces différents, dans le même mois. À chaque fois, j’avais blâmé la mauvaise chose.
Le meilleur modèle que j'ai pu acheter a obtenu un score de 0,241
Je dirige une petite plateforme de formation. Cinq modèles open source des familles Qwen et DeepSeek, un examen difficile de 54 tâches et une porte qui ne fait la promotion d'un modèle que lorsque les chiffres indiquent que la victoire est réelle. Pendant des semaines, aucun d’entre eux n’a pu franchir la porte. L’explication la plus simple était la plus confortable : petits modèles, examen difficile, continuer à s’entraîner.
J'ai donc branché un modèle frontière, gpt-5.5, exactement sur le même harnais, juste à titre de référence. Mêmes tâches. Mêmes luminaires. Même score.
Il a obtenu un score de 0,241.
C’est la même chose que les cinq petits modèles. Le test apparié de McNemar donne p ... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité