Dernières recherches sur le Stanford Transformer du MIT : le surentraînement peut conduire à une « illumination structurelle » pour les modèles modérés

MSN - 08/12
Les dernières recherches soulignent qu'après un surentraînement, les modèles Transformer modérés peuvent présenter des capacités de généralisation structurelle, un phénomène appelé « épiphanie structurelle ». Dans le traitement du langage naturel, des recherches antérieures ont montré que les modèles de séquence neuronale comme Transformer ont du mal à capturer efficacement la structure hiérarchique des phrases lors de la généralisation à de nouvelles entrées structurelles. Cette découverte devrait attirer davantage d’attention dans les futures recherches sur l’apprentissage profond et fournir des orientations pour la conception de modèles et les stratégies de formation.

Points clés:

Après un surentraînement, des modèles modérés tels que Transformer montrent des capacités de généralisation structurelle, appelées « grokking structurel ».

La recherche a montré que pour les modèles de type Transformateur, après une formation à long terme, le modèle peut capturer efficacement la structure hiérarchique des phrases lors de la généralisation à de nouvelles entrées structurelles.

Les résultats montrent que la profondeur du modèle met à l'échelle la vision structurelle en forme de U inversé...
[Courte citation de 8% de l'article original]

Loading...