Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
Évaluation à l'étranger de DeepSeek-V4 : les tâches d'agent occupent la première place dans l'open source, le taux d'hallucinations augmente et la consommation de jetons est importante
MSN -
25/04
Le 24 avril, la version préliminaire de DeepSeek-V4 a été officiellement lancée et open source. Les évaluations à l'étranger montrent que V4-Pro se classe au premier rang parmi les modèles open source dans l'évaluation des tâches d'agent, mais le taux d'hallucinations augmente et la consommation de jetons est élevée. Les analystes ont commenté que le grand modèle DeepSeek-V4 est adapté pour être équipé de puces Huawei, indiquant que les principaux grands modèles chinois peuvent désormais réaliser la mise en œuvre de matériel localisé. Ce changement dans la voie technologique de DeepSeek confirme également les préoccupations antérieures du PDG de Nvidia, Jen-Hsun Huang : Nvidia risque de perdre l’écosystème des développeurs chinois.
Le 24 avril, la version préliminaire de DeepSeek-V4 a été officiellement publiée et simultanément open source. On prétend qu'il a atteint le niveau leader dans les domaines nationaux et open source dans les trois dimensions de la capacité des agents, de la connaissance du monde et des performances de raisonnement.
DeepSeek-V4 est divisé en deux versions, Pro et Flash, toutes deux prenant en charge un contexte ultra long d'un million (1 million) de jetons.
Les deux versions réduisent considérablement les besoins en mémoire informatique et graphique, en réduisant les FLOP d'inférence par balise de 73 % et en réduisant l'utilisation de la mémoire cache KV de 90 %.
Le 24 avril, les données d'OpenRouter, la plus grande plateforme d'agrégation d'interfaces de programmation d'applications de modèles d'IA au monde, ont montré que le nombre d'appels vers V4-Flash atteignait 27 milliards de jetons, et celui de V4-Pro était de 4,79 milliards de jetons, mais ils n'apparaissaient pas dans le classement.
Après la sortie de DeepSeek-V4, les plateformes d'évaluation grand public ont effectué des tests de capacités et des classements.
Artificial Analysis a mené une évaluation spéciale des capacités de raisonnement de DeepSeek-V4. Les résultats montrent que V4-Pro a obtenu 52 points dans l'indice d'intelligence artificielle, soit un bond de 10 points par rapport aux 42 points de la version V3.2, devenant ainsi le deuxième plus grand modèle d'inférence open source au monde après Kimi K2.6.
V4-Flash a marqué 47 points. Ses performances sont plus faibl... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité