Neem contact met ons op

Cursusaanbod

EXO als onderdeel van Infrastructure as Code

  • Inzicht in verschillende implementatiemethoden voor EXO: eennodes-, meernodes- en RDMA-clusters
  • Het automatiseren van de installatie van benodigde pakketten (Xcode, uv, Node.js, Rust) met configuratiemanagementtools
  • Gebruik van Nix flakes voor het creëren van reproduceerbare EXO-builds en ontwikkelomgevingen
  • Het schrijven van Ansible-playbooks of shellscripts voor volledig geautomatiseerde clusterinrichting

Reproduceerbare builds en integratie met CI-systemen

  • Het vastleggen van afhankelijkheden en het compileren van de EXO-dashboard in CI-pipelines
  • Het uitvoeren van EXO-smeektesten binnen GitHub Actions of GitLab CI-runners
  • Het creëren van 'golden images' en werkstromen voor rollback via snapshots op zowel macOS- als Linux-VMS
  • Het versioneren van aangepaste modelinformatie tegelijk met de broncode van applicaties

Clusterdetectie en geautomatiseerd netwerkbeheer

  • Het configureren van mDNS en statische DNS om een betrouwbare identificatie van libp2p-knooppunten mogelijk te maken
  • Het automatiseren van het aanmaken van netwerkprofielen en beheer van Thunderbolt-verbindingen onder macOS
  • Gebruik van aangepaste namespaces (EXO_LIBP2P_NAMESPACE) om ontwikkel-, test- en productieclusters te scheiden
  • Instellen van firewallregels en segmentatie van netwerken in multi-tenantomgevingen

Opslagbeheer en beheer van modellifecycle

  • Het definiëren van strategieën voor EXO_MODELS_DIRS en EXO_MODELS_READ_ONLY_DIRS
  • Het monteren van NFS- of SAN-shares als alleen-lezen modellibraries om een snelle clusterinrichting mogelijk te maken
  • Het verwijderen van verouderde cache-data en het beheren van regels rond versiebehoud van modelgewichten
  • Het automatiseren van vooraf laden van modellen en controles op hun werking vóór rollout van updates

Bewaking en alarmgeneratie

  • Verzenden van EXO-logs naar gecentraliseerde loggingsystemen (ELK, Loki of Splunk)
  • Het ontwerpen van Grafana-dashboards gebaseerd op uitvoer uit EXO_TRACING_ENABLED
  • Alarmgeneratie bij veranderingen in clusterlidmaatschap, geheugenoverbelasting of toename van latentie tijdens inferenties
  • Het koppelen van hardwaretelemetrie uit macmon aan eventuele achteruitgang in modelprestaties

Updates, rollback en disaster recovery

  • Tijdelijk implementeren van nieuwe EXO-binaire versies op een testknooppunt alvorens deze over de gehele infrastructuur uit te rollen
  • Rolback naar vorige modellversies zonder dat ernieuw hoeft te worden gedownload gedurende het overschakelen tussen gekwalificeerde varianten
  • Back-up en herstel van clustergegevens, aangepaste namespaces en opgeslagen modelgewichten
  • Dokumenteren van noodprocedures voor geheel nieuwe inrichting van clusters na een catastrofale storing

Versterking van beveiliging en conformiteit

  • Toepassen van TLS-beveiliging op reverse proxies zoals nginx of traefik voor zowel het dashboard als API's
  • Beperken van API-gebruik via beperkingen en toestaan alleen bepaalde IP-adressen om EXO-endpoints te benaderen
  • Scheiding van clusters door middel van VLAN’s en nultrouw-netwerkbeleidregels
  • Controleren op toegangsrechten en bijhouden welke modellen er worden gebruikt en in welke versieopzetten<\/li>

Vereisten

  • Ervaring met DevOps-praktijken (CI/CD, IaC en containerorchestratie)
  • Kennis van systeembeheer en pakketbeheer onder macOS of Linux
  • Begrip van netwerkconcepten, DNS en opslagmechanismen

Doelgroep

  • DevOps-engineers
  • Infrastructuurontwerpers
  • SRE's die verantwoordelijk zijn voor AI-werkbelastingen op locatie
 21 Uren

Aantal deelnemers


Prijs per deelnemer

Getuigenissen (2)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën