Neem contact met ons op

Cursusaanbod

Inleiding tot EXO en lokale AI-clustering

  • Overzicht van het EXO-framework en de exo-explore-ecosysteem
  • Vergelijking tussen gecentraliseerde cloud-gebaseerde inferentie en gedistribueerde lokale verwerking
  • Architectuur: libp2p voor apparaatdetectie, MLX als achterliggende technologie, dashboard en API-lagen
  • Hardwarevereisten: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5 en gedeelde opslagruimte

Installatie van EXO op macOS

  • Xcode, Metal ToolChain en overige macOS-voorwaarden instellen.
  • uv, Node.js en de Rust nightly toolchain installeren.
  • De gespecificeerde macmon-fork installeren voor monitoring van Apple Silicon-apparaten.
  • Het EXO-repository klonen en het dashboard bouwen met npm.
  • EXO draaiend maken en controleren of het localhost:52415-dashboard correct werkt.

Installatie van EXO op Linux

  • Afhankelijkheden installeren via apt of Homebrew.
  • uv, Node.js 18+ en de Rust nightly toolchain configureren.
  • Het dashboard bouwen en EXO in CPU-only-modus uitvoeren.
  • Inzicht krijgen in het bestandssysteem: XDG Base Directory voor configuratie, data, cache en logs.

Automatische apparaatdetectie en clustervorming

  • De werking van libp2p-basis auto-detectie binnen lokale netwerken begrijpen.
  • Aangepaste namespaces instellen met EXO_LIBP2P_NAMESPACE om clusters te isoleren.
  • Controleren of alle nodes correct worden weergegeven in het dashboard.
  • Problemen rondom detectiefouten en netwerksegmentatie oplossen.

RDMA inschakelen over Thunderbolt 5

  • De technische achtergrond van RDMA en het voordeel van een daling in vertraging tot 99 procent.
  • RDMA activeren in de macOS Recovery-modus met behulp van rdma_ctl.
  • Bekijken welke kabels nodig zijn en welke poorten op een Mac Studio gebruikt mogen worden.
  • Zorgen dat alle clusternodes dezelfde versie van macOS draaien.
  • Problemen rond RDMA-detectie en DHCP-configuratie oplossen.

Implementatie van geavanceerde modellen

  • Het dashboard gebruiken om DeepSeek v3.1, Qwen3-235B en modellen uit de Llama-familie te laden en op te delen in onderdelen.
  • Plaatsing van modellen testen met de /instance/previews API-endpoint.
  • Modellen implementeren door middel van pipeline- of tensorparallel-sharding-technieken.
  • Aangepaste modeldefinities creëren op basis van gegevens uit het HuggingFace-hub.

Monitoring en probleemoplossing

  • EXO-logs lezen en distributed tracing begrijpen.
  • De algehele gezondheid van het cluster beoordelen via het dashboard.
  • Fouten in werkende nodes detecteren en herstellen.
  • EXO_TRACING_ENABLED gebruiken om prestatieknelpunten te achterhalen.

Clusteronderhoud en updates

  • Bijwerken van EXO-binaire bestanden en het dashboard opnieuw compileren.
  • Modelcache’s migreren en beheren via NFS, zodat modellen voordien gedownload kunnen worden.
  • Nodes veilig verwijderen uit het cluster en workload-balancering handhaven.

Vereisten

  • Begrip van netwerkprincipes (IP-adressen, subnetten en firewalls)
  • Ervaring met het beheren via de commandoregel op macOS of Linux
  • Kennis van Python-pakketbeheer (pip/uv) en tools voor Node.js

Doelgroep

  • Systeembeheerders
  • DevOps-engineers
  • Architecten van AI-infrastructuur die verantwoordelijk zijn voor lokale implementatie van grote taalmodellen
 21 Uren

Aantal deelnemers


Prijs per deelnemer

Voorlopige Aankomende Cursussen

Gerelateerde categorieën