Prenez contact avec nous

Plan du cours

Infrastructure EXO as Code

  • Aperçu des modèles de déploiement EXO : monomachine, multi-nœuds et clusters RDMA
  • Automatiser l'installation des dépendances (Xcode, uv, Node.js, Rust) avec la gestion de configuration
  • Utiliser Nix flakes pour des builds EXO reproductibles et des environnements de développement
  • Rédiger des playbooks Ansible ou des scripts shell pour le provisionnement non surveillé des clusters

Builds reproductibles et intégration CI

  • Épingler les dépendances et construire le tableau de bord dans les pipelines CI
  • Exécuter des tests smoke EXO dans GitHub Actions ou GitLab CI runners
  • Créer des images de référence et des workflows de retour arrière basés sur des instantanés pour les machines virtuelles macOS et Linux
  • Versionner les cartes de modèles personnalisées avec le code applicatif

Découverte de cluster et automatisation réseau

  • Configurer mDNS et DNS statique pour une découverte fiable des nœuds libp2p
  • Automatiser la création de profils réseau et la gestion du pont Thunderbolt sur macOS
  • Utiliser des espaces de noms personnalisés (EXO_LIBP2P_NAMESPACE) pour séparer les clusters dev, staging et prod
  • Règles firewall et segmentation réseau pour les environnements multi-locataires

Gestion du cycle de vie des modèles et du stockage

  • Concevoir des stratégies pour EXO_MODELS_DIRS et EXO_MODELS_READ_ONLY_DIRS
  • Monter les partages NFS ou SAN en tant que référentiels de modèles en lecture seule pour un provisionnement rapide
  • Purge des caches obsolètes et politiques de rétention des poids versionnés
  • Automatiser les pré-téléchargements de modèles et les vérifications d'état avant les mises à jour progressives (rolling updates)

Surveillance et alertes

  • Acheminer les logs EXO vers une journalisation centralisée (ELK, Loki ou Splunk)
  • Construire des tableaux de bord Grafana à partir de la sortie EXO_TRACING_ENABLED
  • Configurer des alertes sur les changements d'appartenance au cluster, les événements OOM et les pics de latence d'inférence
  • Corréler la télémétérie matérielle macmon avec les régressions de performance des modèles

Mise à jour, retour arrière et reprise après sinistre

  • Stocker les mises à jour des binaires EXO dans un nœud canari avant le déploiement généralisé
  • Retour arrière au niveau du modèle : basculer entre des versions quantifiées sans télécharger à nouveau
  • Sauvegarder et restaurer l'état du cluster, les espaces de noms personnalisés et les poids mis en cache
  • Documenter les playbooks de récupération pour les scénarios de reconstruction totale du cluster

  • Appliquer TLS au niveau de la couche reverse proxy (nginx, traefik) pour le tableau de bord et l'API
  • Mettre en œuvre une limitation du débit API et l'ajout d'adresses IP sur liste blanche pour les points de terminaison EXO
  • Isolez les clusters avec des VLANs et des politiques réseau zero-trust
  • Auditer les accès et maintenir un inventaire des modèles déployés et des versions

Pré requis

  • Expérience avec les pratiques DevOps (CI/CD, IaC, orchestration de conteneurs)
  • Familiarité avec l'administration système macOS ou Linux et la gestion des paquets
  • Compréhension des concepts de réseau, DNS et stockage

Audience

  • Ingénieurs DevOps
  • Architectes infrastructure
  • SREs responsables des charges de travail IA sur site
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (2)

Cours à venir

Catégories Similaires