La dérive des jetons expliquée : pourquoi votre agent devient plus lent et plus cher

DEV - 17/07
Votre agent se sent rapide lors d'une démo. Puis une session réelle atteint vingt tours, plusieurs outils ont...

Votre agent se sent rapide lors d'une démo. Ensuite, une session réelle atteint vingt tours, plusieurs outils ont renvoyé des charges utiles importantes et chaque réponse commence à prendre plus de temps et à coûter plus cher.

Ce modèle est souvent appelé dérive de jeton : le contexte d'entrée effectif augmente à mesure qu'un agent transporte davantage d'historique de conversation, de sortie d'outil, de documents récupérés et d'état dans chaque appel de modèle. Le modèle lui-même ne perd pas progressivement en efficacité. L'application lui demande de traiter plus de matériel à chaque tour.

La dérive des jetons est gérable, mais seulement si le contexte est traité comme une ressource système budgétisée plutôt que comme une transcription illimitée.

Ce que signifie réellement la dérive des jetons

La plupart des agents conversationnels construisent chaque requête à partir de plusieurs sources : une invite système, des définitions d'outils, des messages récents, un contexte récupéré, une mémoire durable et parfois un résumé de travaux plus anciens. Que l'application envoie cet état à chaque requête ou qu'un fournisseur en gère une partie, le modèle a toujours un contexte efficace à traiter.

Considérons une séance illustrative :

TournerContribution efficaceCe qui a changé
11 200 jetonsInvite système, outils et un message utilisateur
86 900 jetonsHistorique des conversations et résultats de deux outils
2018 400 jetonsPlus d'historique, de documents récupérés et d'état accumulé

Le prix exact et la latence dépendent du modèle, du fournisseur, du comportement du cache et de la charge de travail. Le signal important est la tendance : les appels ultérieurs traitent de manière répétée un contexte plus large.

Pourquoi les agents accumulent des jetons si rapidement

L’historique des conversations n’est qu’une source de croissance. Les agents de production accumulent souvent des jetons à plusieurs endroits à la fois :

  • Transcriptions répétées : chaque message précédent de l'utilisateur et de l'assistant reste dans son contexte.
  • Schémas d'outils : des descriptions d'outils volumineuses et des schémas JSON peuvent être joints à chaque appel de modèle.
  • Résultats de l'outil : les résultats de recherche, les traces de pile, les lignes de la base de données et les réponses de l'API peuvent être beaucoup plus...
    [Courte citation de 8% de l'article original]
Loading...