J'ai heurté ce mur en construisant un assistant IA personnalisé que j'ai nommé Nathaniel. L'invite s'est étendue à plus de 1 000 lignes : cadres comportementaux, protocoles de crise, connaissances spécialisées et procédures opérationnelles. Il semblait que cela fonctionnait à merveille, jusqu'à ce que je commence à remarquer que des instructions ou des directives particulières n'étaient pas suivies, malgré la consommation d'environ 3 000 jetons avant même le début de la conversation. Après quelques recherches et tests, j'ai découvert le problème : pour les invites très longues, le modèle ne traitait pas le contenu de manière fiable plus tard dans le document. Que ce soit en raison de limitations d'attention, d'une lecture de fichiers fragmentée ou d'une génération de réponse prématurée, l'effet était le même : des instructions enfouies profondément dans l'invite étaient manquées.
La solution : placez une table des matières en haut. Lorsque le modèle atteint la table des matières en premier, il dispose d'une carte de référence avant de commencer le traitement. Il sait quelles sections existent et où les trouver. Au lieu d'espérer que le modèle parvienne aux instructions pertinentes avant de répondre, la table des matières lui indique exactement où chercher. En chargeant uniquement les sections pertinentes, ces instructions ne sont plus enfouies profondément, elles sont au premier plan. Cela offrait également la possibilité de pointer le modèle directement vers une section particulière par son nom : "Utilisez votre protocole d'écriture pour améliorer le brouillon suivant."
D'autres praticiens gèrent des invites volumineuses en les divisant en plusieurs documents avec une logique de routage ou en créant des couches d'orchestration multi-invites. Cela fonctionne, mais ajoute de la complexité au déploiement. Je voulais un document dans lequel le modèle puisse réellement naviguer, un moyen de l'empêcher de répondre prématurément après le premier morceau, ou de déprioriser les instructions enfouies plus tard dans le contexte.
Cette approche fonctionne dans les interfaces grand public telles que ChatGPT et Claude, mais s'avère la plus prometteuse dans les agents et les assistants basés sur l'IDE, des environnements dans lesquels vous contrôlez l'invite du système et pouvez appliquer des pratiqu...
[Courte citation de 8% de l'article original]