Neem contact met ons op

Cursusaanbod

Inleiding tot het schalen van Ollama

  • De architectuur van Ollama en belangrijke aspecten bij schaling
  • Veelvoorkomende knelpunten bij multi-user-implementaties
  • Best practices voor voorbereiding van de infrastructuur

Resource-toewijzing en optimalisatie van GPU-gebruik

  • Strategieën voor efficiënt gebruik van CPU/GPU-bronnen
  • Overwegingen rond geheugen en bandbreedte
  • Resourcebeperkingen op containerniveau

Implementatie met containers en Kubernetes

  • Ollama in een Docker-container draaien
  • Ollama uitvoeren binnen Kubernetes-clusters
  • Load balancing en service discovery mechanismen

Autoscaling en batchverwerking

  • Het ontwerpen van autoscaling-beleid voor Ollama
  • Techieken voor het verwerken in batches om de doorvoer te optimaliseren
  • Vergelijkende analyse tussen vertraging en doorvoer

Optimalisatie van systeemvertragingen

  • Prestatiesanalyse bij inferentieverwerking
  • Caching-technieken en het voorverwarmen van modellen
  • Het verminderen van I/O- en communicatieoverhead

Monitoring en observability

  • Het integreren van Prometheus voor het meten van prestaties
  • Het maken van dashboards met behulp van Grafana
  • Alerting- en incidentbeheerprocedures voor Ollama-infrastructuur

Kostenbeheer en schaalstrategieën

  • GPU-toewijzing rekening houdend met kostenbesparing
  • Overwegingen bij cloud- versus on-premises implementaties
  • Blijvende schaalstrategieën voor duurzame groei

Samenvatting en volgende stappen

Vereisten

  • Ervaring met Linux-systeembeheer
  • Inzicht in containerisatie en orkestratie
  • Bekendheid met het implementeren van machine learning-modellen

Doelgroep

  • DevOps-engineers
  • Teams voor ML-infrastructuur
  • SRE’s (Site Reliability Engineers)
 21 Uren

Aantal deelnemers


Prijs per deelnemer

Voorlopige Aankomende Cursussen

Gerelateerde categorieën