Prenez contact avec nous

Plan du cours

Introduction à EXO et au clustering d'IA local

  • Présentation du framework EXO et de l'écosystème exo-explore.
  • Comparaison entre l'inférence centralisée dans le cloud et l'inférence locale distribuée.
  • Architecture : découverte des appareils via libp2p, backend MLX, tableau de bord (dashboard) et couches API.
  • Besoins matériels : Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, stockage partagé.

Installation d'EXO sur macOS

  • Configuration de Xcode, du Metal ToolChain et des prérequis macOS.
  • Installation de uv, Node.js et de la chaîne d'outils Rust nightly.
  • Installation de la version forking de macmon dédiée à la surveillance des puces Apple Silicon.
  • Clonage du dépôt et compilation du tableau de bord avec npm.
  • Lancement d'EXO depuis les sources et vérification du tableau de bord sur localhost:52415.

Installation d'EXO sur Linux

  • Installation des dépendances via apt ou Homebrew sous Linux.
  • Configuration de uv, Node.js 18+ et Rust nightly.
  • Compilation du tableau de bord et lancement d'EXO en mode uniquement CPU.
  • Structure des répertoires : chemins XDG Base Directory pour la configuration, les données, le cache et les journaux.

Découverte automatique des appareils et formation du cluster

  • Compréhension de l'auto-découverte basée sur libp2p à travers les réseaux locaux.
  • Configuration d'espaces de noms personnalisés avec EXO_LIBP2P_NAMESPACE pour l'isolation du cluster.
  • Vérification de l'appartenance des nœuds via la vue cluster du tableau de bord.
  • Gestion des échecs de découverte et des problèmes de segmentation réseau.

Activation du RDMA sur Thunderbolt 5

  • Architecture du RDMA et allégation d'une réduction de latence de 99 %.
  • Activation du RDMA en mode Recovery macOS avec rdma_ctl.
  • Exigences en matière de câblage et contraintes de topologie des ports sur Mac Studio.
  • Cohérence des versions macOS entre tous les nœuds du cluster.
  • Débogage de la découverte RDMA et configuration DHCP.

Déploiement de modèles de pointe

  • Utilisation du tableau de bord pour charger et partager (sharding) DeepSeek v3.1, Qwen3-235B et la famille Llama.
  • Aperçu des placements d'instances via l'endpoint API /instance/previews.
  • Création d'instances de modèles avec sharding par pipeline ou parallélisation tensorielle.
  • Configuration de cartes de modèles personnalisées depuis le hub HuggingFace.

Surveillance et dépannage

  • Lecture des journaux EXO et compréhension du traçage distribué.
  • Interprétation de la santé du cluster dans la vue cluster du tableau de bord.
  • Diagnostic des défaillances des nœuds de travail et du comportement de reconnexion.
  • Utilisation d'EXO_TRACING_ENABLED pour l'analyse des goulets d'étranglement de performance.

Maintenance et mises à jour du cluster

  • Mise à jour des binaires EXO et procédures de recompilation du tableau de bord.
  • Migration des caches de modèles et gestion des modèles pré-téléchargés via NFS.
  • Retrait gracieux des nœuds et rééquilibrage des charges de travail.

Pré requis

  • Compréhension des fondamentaux réseau (IP, sous-réseautage, pare-feu).
  • Expérience en administration en ligne de commande sous macOS ou Linux.
  • Connaissance de la gestion des packages Python (pip/uv) et des outils Node.js.

Audience cible

  • Administrateurs système.
  • Ingénieurs DevOps.
  • Architectes d'infrastructure IA responsables du déploiement de LLMs sur site (on-premise).
 21 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires