Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Infrastructure EXO as Code
- Aperçu des modèles de déploiement EXO : monomachine, multi-nœuds et clusters RDMA
- Automatiser l'installation des dépendances (Xcode, uv, Node.js, Rust) avec la gestion de configuration
- Utiliser Nix flakes pour des builds EXO reproductibles et des environnements de développement
- Rédiger des playbooks Ansible ou des scripts shell pour le provisionnement non surveillé des clusters
Builds reproductibles et intégration CI
- Épingler les dépendances et construire le tableau de bord dans les pipelines CI
- Exécuter des tests smoke EXO dans GitHub Actions ou GitLab CI runners
- Créer des images de référence et des workflows de retour arrière basés sur des instantanés pour les machines virtuelles macOS et Linux
- Versionner les cartes de modèles personnalisées avec le code applicatif
Découverte de cluster et automatisation réseau
- Configurer mDNS et DNS statique pour une découverte fiable des nœuds libp2p
- Automatiser la création de profils réseau et la gestion du pont Thunderbolt sur macOS
- Utiliser des espaces de noms personnalisés (EXO_LIBP2P_NAMESPACE) pour séparer les clusters dev, staging et prod
- Règles firewall et segmentation réseau pour les environnements multi-locataires
Gestion du cycle de vie des modèles et du stockage
- Concevoir des stratégies pour EXO_MODELS_DIRS et EXO_MODELS_READ_ONLY_DIRS
- Monter les partages NFS ou SAN en tant que référentiels de modèles en lecture seule pour un provisionnement rapide
- Purge des caches obsolètes et politiques de rétention des poids versionnés
- Automatiser les pré-téléchargements de modèles et les vérifications d'état avant les mises à jour progressives (rolling updates)
Surveillance et alertes
- Acheminer les logs EXO vers une journalisation centralisée (ELK, Loki ou Splunk)
- Construire des tableaux de bord Grafana à partir de la sortie EXO_TRACING_ENABLED
- Configurer des alertes sur les changements d'appartenance au cluster, les événements OOM et les pics de latence d'inférence
- Corréler la télémétérie matérielle macmon avec les régressions de performance des modèles
Mise à jour, retour arrière et reprise après sinistre
- Stocker les mises à jour des binaires EXO dans un nœud canari avant le déploiement généralisé
- Retour arrière au niveau du modèle : basculer entre des versions quantifiées sans télécharger à nouveau
- Sauvegarder et restaurer l'état du cluster, les espaces de noms personnalisés et les poids mis en cache
- Documenter les playbooks de récupération pour les scénarios de reconstruction totale du cluster
- Appliquer TLS au niveau de la couche reverse proxy (nginx, traefik) pour le tableau de bord et l'API
- Mettre en œuvre une limitation du débit API et l'ajout d'adresses IP sur liste blanche pour les points de terminaison EXO
- Isolez les clusters avec des VLANs et des politiques réseau zero-trust
- Auditer les accès et maintenir un inventaire des modèles déployés et des versions
Pré requis
- Expérience avec les pratiques DevOps (CI/CD, IaC, orchestration de conteneurs)
- Familiarité avec l'administration système macOS ou Linux et la gestion des paquets
- Compréhension des concepts de réseau, DNS et stockage
Audience
- Ingénieurs DevOps
- Architectes infrastructure
- SREs responsables des charges de travail IA sur site
21 Heures
Nos clients témoignent (2)
Craig était très impliqué dans la formation, toujours en s'assurant que nous prêtions attention, en adaptant les exemples à nos activités quotidiennes et en fournissant une réponse chaque fois qu'on lui posait une question, même si l'information n'était pas incluse dans la présentation.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Formation - DevOps Foundation®
Traduction automatique
Niveau élevé d’engagement et de connaissances du formateur
Jacek - Softsystem
Formation - DevOps Engineering Foundation (DOEF)®
Traduction automatique