La pile sous le modèle : oMLX, lama.cpp, Hermes et pourquoi il y en a tant

DEV - 00:49
Retort est un framework permettant de comparer les piles de codage, avec des résultats pour les versions de Claude et locales...

Retort est un framework permettant de comparer les piles de codage, avec des résultats pour les versions de Claude et des tests locaux sur un M5Pro de 64 Go pour de nombreuses langues. Il a été développé avec Claude, et j'étais confus par tous les composants du harnais et de la pile, alors j'ai demandé à Claude de m'expliquer ce qui existe et comment ils sont testés. C'est ce qui suit :

La plupart des benchmarks répondent « quel modèle est le meilleur ? » Retort insiste sur le fait que ce n'est pas la bonne unité. Un résultat de codage est produit par une pile entière — et le modèle n’en est qu’une couche :

langage × modèle × format de pondération × moteur de service × agent/faisceau × moteur de contexte × échantillonnage × invite

Changez n’importe quel calque et les chiffres bougent. TypeScript est passé d'un échec à 1,00 sur le 80B local en augmentant un bouton du moteur contextuel - même modèle, mêmes poids. Ainsi, avant que les résultats n’aient un sens, vous avez besoin d’une carte des couches. Cet article est cette carte : ce qu'est chaque pièce, d'où elle vient, ce qui rivalise avec quoi, comment elles s'empilent et pourquoi le zoo est si bondé. Ensuite, il explique le méta-harnais – la partie de Retort qui transforme le harnais lui-même en une variable que vous pouvez mesurer.

Si tu as vuoMLX,lama.cpp,Hermès,GGUF,omp,lcm, ouOuvrirRoutersurvolez les autres blogs et hochez la tête sans vraiment savoir de quoi il s'agit, commencez ici.

La pile, de haut en bas

Lisez ceci de bas en haut : chaque couche repose sur celle située en dessous :

┌─────────────────────────────── ───────────────────────────────┐ │ INVITE / MÉTHODOLOGIE "écrire d'abord les tests" · BDD · laconique │ ← comment vous demandez ├─────────────────────────────── ───────────────────────────────┤ │ AGENT / HARNAIS claude-code · Hermes · gemini · omp │ ← la boucle ReAct : │ opencode │ lire → éditer → exécuter → répéter ├─────────────────────────────── ───────────────────────────────┤ │ CONTEXT ENGINE lcm (compaction) · boutons d'échantillonnage │ ← ce que le modèle "voit" ├─────────────────────────────── ───────────────────────────────┤ │ SERVING ENGINE oMLX · llama.cpp · Ollama · cloud API│ ← transforme les poids en jetons ├─────────────────────────────── ───────────────────────────────┤ │ POIDS + FORMAT tenseurs de sécurité · GGUF · MLX (un modèle │ ← les nombres sur le disque │ avec une certaine quantification, par exemple 4 bits) │ ├─────────────────────────────── ───────────────────────────────┤ │ MATÉRIEL Apple Silicon · NVIDIA · un GPU cloud │ ← comment faire le calcul └─────────────────────────────── ───────────────────────────────┘
Entrer en mode plein écran Quitter le mode plein écran

"Quel modèle est le meilleur" ne demande que une bande au milieu. La cornue mesure la colonne. Le reste de cet article parcourt les couches où se trouvent les noms déroutants (poids, service, agent, contexte), puis le méta-harnais, qui fait de la couche d'agent un facteur que vous pouvez balayer.

Couche 1 : poids et leurs formats – safetensors, GGUF, MLX

Un modèle est une grosse pile de nombres (poids). La façon dont ces numéros sont stockés sur le disque est une source surprenante de fragmentation, car le format du fichier est lié au moteur qui le lit.

  • safetensors - les modèles de format neutres et indépendants du framework son...
    [Courte citation de 8% de l'article original]
Loading...