J'ai construit un agent de codage en ~ 970 lignes de Python et je l'ai comparé honnêtement

DEV - 01:41
TL;DR : J'ai construit nano-harness, un agent de codage en ~ 970 lignes non vierges de Python (5 fichiers, 3 outils, 2...

TL;DR : J'ai construit nano-harness, un agent de codage dans ~ 970 lignes non vierges de Python (5 fichiers, 3 outils, 2 fournisseurs, MIT). Il a obtenu un score de 59,6% (53/89) sur la suite complète Terminal-Bench 2.0 avec Claude Opus 4.8. En cours de route, un modèle de frontière indépendant (GPT Sol 5.6) a révisé le code et lui a attribué une note de 4/10, ce qui s'est avéré être la chose la plus utile qui soit arrivée au projet. C'est tout l'arc, la partition, les bugs et les parties qui ont mal tourné.

Pourquoi ai-je construit un harnais ?

En février, j'ai commencé à lire sur les harnais de nul autre que... Andrej Karpathy, je pense que llm-wiki venait de devenir viral et j'ai vu ce dépôt. Je l'ai donc lu et j'ai commencé à en lire davantage sur les harnais et les boucles. C'était avant que TOUT LE MONDE ne parle de boucles et de harnais et que chaque vidéo YT concernait des invites, etc. Je voulais apprendre quelque chose de nouveau et, à l'époque, je formais mon propre modèle à l'aide d'Azure Machine Learning (ce qui coûtait un bras et une jambe à apprendre), puis j'utilisais PyTorch pour apprendre des modèles au sein de mon système d'exploitation IA. Quoi qu'il en soit, la plupart des projets d'agents que je suivais comportaient des fonctionnalités : plugins, graphiques d'orchestration, tableaux de bord d'interface utilisateur, systèmes de mémoire (leur "second cerveau" d'obsidienne), tout cela était la même chose. J'ai eu plus de mal à trouver de petits harnais lisibles associés à un score de référence complet reproductible (et si vous savez quelque chose sur le fait de vouloir comparer votre harnais, ce n'est PAS BON MARCHÉ !). Cela m'a vraiment marqué et je ne savais pas pourquoi plus de gens en parlaient, pour moi, c'était là que tout se dirigeait et le harnais est la partie d'un agent que vous pouvez réellement concevoir, c'est donc la partie que vous devriez pouvoir coder et mesurer.

Ainsi, la thèse du nano-harnais est celle du score par ligne de code : le plus petit harnais lisible qui affiche encore un nombre réel sur un véritable benchmark. Pensez au nanochat de Karpathys, mais pour les harnais d'ag...
[Courte citation de 8% de l'article original]

Loading...