Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
Dernières recherches sur le Stanford Transformer du MIT : le surentraînement peut conduire à une « illumination structurelle » pour les modèles modérés
MSN -
08/12
Les dernières recherches soulignent qu'après un surentraînement, les modèles Transformer modérés peuvent présenter des capacités de généralisation structurelle, un phénomène appelé « épiphanie structurelle ». Dans le traitement du langage naturel, des recherches antérieures ont montré que les modèles de séquence neuronale comme Transformer ont du mal à capturer efficacement la structure hiérarchique des phrases lors de la généralisation à de nouvelles entrées structurelles. Cette découverte devrait attirer davantage d’attention dans les futures recherches sur l’apprentissage profond et fournir des orientations pour la conception de modèles et les stratégies de formation.
Points clés:
Après un surentraînement, des modèles modérés tels que Transformer montrent des capacités de généralisation structurelle, appelées « grokking structurel ».
La recherche a montré que pour les modèles de type Transformateur, après une formation à long terme, le modèle peut capturer efficacement la structure hiérarchique des phrases lors de la généralisation à de nouvelles entrées structurelles.
Les résultats montrent que la profondeur du modèle met à l'échelle la vision structurelle en forme de U inversé... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité