Votre LLM ne peut pas réellement regarder de vidéo. Voici le plus petit correctif (MIT)

DEV - 19/07
Chaque fiche modèle indique « multimodal ». Ensuite, vous remettez au modèle un vrai fichier vidéo et découvrez ce que cela...

Chaque fiche modèle indique « multimodal ». Ensuite, vous remettez au modèle un vrai fichier vidéo et découvrez ce que cela signifie en pratique : ChatGPT lit la piste de sous-titres, Claude n'accepte pas du tout les fichiers vidéo. Le modèle raconte une vidéo qu’il n’a pour la plupart jamais vue.

Je décompresse quotidiennement d...
[Courte citation de 8% de l'article original]

Loading...