Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à EXO et au clustering d'IA local
- Présentation du framework EXO et de l'écosystème exo-explore.
- Comparaison entre l'inférence centralisée dans le cloud et l'inférence locale distribuée.
- Architecture : découverte des appareils via libp2p, backend MLX, tableau de bord (dashboard) et couches API.
- Besoins matériels : Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, stockage partagé.
Installation d'EXO sur macOS
- Configuration de Xcode, du Metal ToolChain et des prérequis macOS.
- Installation de uv, Node.js et de la chaîne d'outils Rust nightly.
- Installation de la version forking de macmon dédiée à la surveillance des puces Apple Silicon.
- Clonage du dépôt et compilation du tableau de bord avec npm.
- Lancement d'EXO depuis les sources et vérification du tableau de bord sur localhost:52415.
Installation d'EXO sur Linux
- Installation des dépendances via apt ou Homebrew sous Linux.
- Configuration de uv, Node.js 18+ et Rust nightly.
- Compilation du tableau de bord et lancement d'EXO en mode uniquement CPU.
- Structure des répertoires : chemins XDG Base Directory pour la configuration, les données, le cache et les journaux.
Découverte automatique des appareils et formation du cluster
- Compréhension de l'auto-découverte basée sur libp2p à travers les réseaux locaux.
- Configuration d'espaces de noms personnalisés avec EXO_LIBP2P_NAMESPACE pour l'isolation du cluster.
- Vérification de l'appartenance des nœuds via la vue cluster du tableau de bord.
- Gestion des échecs de découverte et des problèmes de segmentation réseau.
Activation du RDMA sur Thunderbolt 5
- Architecture du RDMA et allégation d'une réduction de latence de 99 %.
- Activation du RDMA en mode Recovery macOS avec rdma_ctl.
- Exigences en matière de câblage et contraintes de topologie des ports sur Mac Studio.
- Cohérence des versions macOS entre tous les nœuds du cluster.
- Débogage de la découverte RDMA et configuration DHCP.
Déploiement de modèles de pointe
- Utilisation du tableau de bord pour charger et partager (sharding) DeepSeek v3.1, Qwen3-235B et la famille Llama.
- Aperçu des placements d'instances via l'endpoint API /instance/previews.
- Création d'instances de modèles avec sharding par pipeline ou parallélisation tensorielle.
- Configuration de cartes de modèles personnalisées depuis le hub HuggingFace.
Surveillance et dépannage
- Lecture des journaux EXO et compréhension du traçage distribué.
- Interprétation de la santé du cluster dans la vue cluster du tableau de bord.
- Diagnostic des défaillances des nœuds de travail et du comportement de reconnexion.
- Utilisation d'EXO_TRACING_ENABLED pour l'analyse des goulets d'étranglement de performance.
Maintenance et mises à jour du cluster
- Mise à jour des binaires EXO et procédures de recompilation du tableau de bord.
- Migration des caches de modèles et gestion des modèles pré-téléchargés via NFS.
- Retrait gracieux des nœuds et rééquilibrage des charges de travail.
Pré requis
- Compréhension des fondamentaux réseau (IP, sous-réseautage, pare-feu).
- Expérience en administration en ligne de commande sous macOS ou Linux.
- Connaissance de la gestion des packages Python (pip/uv) et des outils Node.js.
Audience cible
- Administrateurs système.
- Ingénieurs DevOps.
- Architectes d'infrastructure IA responsables du déploiement de LLMs sur site (on-premise).
21 Heures