Tester les LLM avec Elixir

DEV - 19/06
avertissement : cet article a été entièrement écrit par un humain 🧬 Introduction sur laquelle j'ai travaillé...

Avertissement : cet article a été entièrement écrit par un humain 🧬

Introduction

Je travaille sur un produit Gen AI depuis un an et j'ai rapidement réalisé que les LLM peuvent être considérés comme des bêtes sauvages qui nécessitent une vigilance constante. Comme quelqu'un avait l'habitude de tirer parti de la couverture des tests pour éviter les régressions, le monde LLM/IA peut être assez frustrant car les résultats du modèle ne sont pas déterministes.

Lorsque vous déployez une solution LLM en production, vous obtenez une masse amorphe de données statistiques qui produit des résultats en constante évolution. Et cela peut devenir encore plus chaotique, pour diverses raisons :

  • les invites devront peut-être être modifiées à mesure que vous commencerez à attirer plus de clients.
  • un nouveau modèle brillant est sorti ! ✨ mais après avoir mis à jour votre modèle sans réfléchir une fois, vous n'êtes pas sûr qu'il ne se cassera pas cette fois
  • les modèles sont modifiés par les fournisseurs sans préavis suffisant, même si leur documentation indique qu'ils sont stables

Une façon d'atténuer ces problèmes est de commencer à évaluer le résultat de votre produit LLM avant d'avoir votre premier client payant 💰

L'approche

L'une des approches de test les plus courantes pour Python consiste à utiliser OpenAI Evals, mais idéalement, nous devrions intégrer nos tests plus près de notre code Elixir, où réside actuellement notre logique métier, afi...
[Courte citation de 8% de l'article original]

Loading...