Exécution de workflows de l'IA multi-agents sur le matériel de bord: une plongée profonde technique

DEV - 18/09
Le défi: aller au-delà des dépendances du cloud (et ma haine de faire des diapositives) permettez-moi d'être ...

Le défi: aller au-delà des dépendances du cloud (et ma haine de faire des diapositives)

Permettez-moi d'être honnête - ce projet a commencé parce que je méprise absolument la création de présentations PowerPoint. Le processus fastidieux de découverte du contenu, de formatage des diapositives, de trouver des images pertinentes et de faire en sorte que tout soit professionnel me rend fou. Je préfère passer des heures à coder que 30 minutes à faire des diapositives.

Alors naturellement, je me suis dit: "Et si je pouvais simplement parler à un appareil et le faire générer toute la présentation pour moi?"

Mais c'est là que ça devient intéressant. La plupart des applications d'IA reposent aujourd'hui sur l'inférence cloud - envoi des données aux serveurs distants, attendant les réponses et traitant de la latence, des coûts et des problèmes de confidentialité. Je voulais explorer si le matériel de bord moderne pouvait gérer quelque chose de plus ambitieux: un workflow IA multi-agent complet fonctionnant entièrement local.

L'objectif est devenu double: résoudre mon problème PowerPoint personnel et repousser les limites de ce qui est possible sur le matériel de bord. Créez un générateur de présentation contrôlé par la voix qui pourrait comprendre la parole, orchestrer plusieurs agents d'IA, générer du contenu structuré et synthétiser les réponses vocales - le tout sur un dispositif à bord unique, avec une dépendance Internet nulle.

Demo: voyez-le en action

Avant de plonger dans les détails techniques, voici le système qui travaille de bout en bout:

Le pipeline complet: "Créer des diapositives sur le génie électrique" → Traitement AI → Présentation formatée avec un contenu détaillé, tous fonctionnant localement sur Jetson Orin Nano.

Prérequis et configuration

Installation du cadre Camel-AI

# Installez Camel-AI avec toutes les dépendances PIP Installez Camel-AI [Tous] # ou installation minimale PIP Installez Camel-AI # dépendances supplémentaires pour ce projet PIP Installez Python-Ppptx Faster-Whisper Sounddevice Soundfile TT
Entrez le mode de sortie en mode plein écran

Configuration de lama.cpp pour l'inférence locale

# Clone and build lama.cpp git clone https://github.com/ggerganov/llama.cpp cd lama.cpp # pour jetson orin (arm64 avec cuda) mkdir build cd bui...
[Courte citation de 8% de l'article original]
Loading...