Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
La dérive des jetons expliquée : pourquoi votre agent devient plus lent et plus cher
DEV -
17/07
Votre agent se sent rapide lors d'une démo. Puis une session réelle atteint vingt tours, plusieurs outils ont...
Votre agent se sent rapide lors d'une démo. Ensuite, une session réelle atteint vingt tours, plusieurs outils ont renvoyé des charges utiles importantes et chaque réponse commence à prendre plus de temps et à coûter plus cher.
Ce modèle est souvent appelé dérive de jeton : le contexte d'entrée effectif augmente à mesure qu'un agent transporte davantage d'historique de conversation, de sortie d'outil, de documents récupérés et d'état dans chaque appel de modèle. Le modèle lui-même ne perd pas progressivement en efficacité. L'application lui demande de traiter plus de matériel à chaque tour.
La dérive des jetons est gérable, mais seulement si le contexte est traité comme une ressource système budgétisée plutôt que comme une transcription illimitée.
Ce que signifie réellement la dérive des jetons
La plupart des agents conversationnels construisent chaque requête à partir de plusieurs sources : une invite système, des définitions d'outils, des messages récents, un contexte récupéré, une mémoire durable et parfois un résumé de travaux plus anciens. Que l'application envoie cet état à chaque requête ou qu'un fournisseur en gère une partie, le modèle a toujours un contexte efficace à traiter.
Considérons une séance illustrative :
Tourner
Contribution efficace
Ce qui a changé
1
1 200 jetons
Invite système, outils et un message utilisateur
8
6 900 jetons
Historique des conversations et résultats de deux outils
20
18 400 jetons
Plus d'historique, de documents récupérés et d'état accumulé
Le prix exact et la latence dépendent du modèle, du fournisseur, du comportement du cache et de la charge de travail. Le signal important est la tendance : les appels ultérieurs traitent de manière répétée un contexte plus large.
Pourquoi les agents accumulent des jetons si rapidement
L’historique des conversations n’est qu’une source de croissance. Les agents de production accumulent souvent des jetons à plusieurs endroits à la fois :
Transcriptions répétées : chaque message précédent de l'utilisateur et de l'assistant reste dans son contexte.
Schémas d'outils : des descriptions d'outils volumineuses et des schémas JSON peuvent être joints à chaque appel de modèle.
Résultats de l'outil : les résultats de recherche, les traces de pile, les lignes de la base de données et les réponses de l'API peuvent être beaucoup plus... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité