Neem contact met ons op
 Duur 21 uren

Cursusaanbod

Inleiding tot het schalen van Ollama

  • De architectuur van Ollama en overwegingen voor schaling
  • Veelvoorkomende knelpunten in multi-gebruikersimplementaties
  • Best practices voor de bereidheid van de infrastructuur

Resourcetoevoeging en GPU-optimalisatie

  • Strategieën voor efficiënt gebruik van CPU/GPU
  • Overwegingen rondom geheugen en bandbreedte
  • Resourcelimieten op container-niveau

Implementatie met containers en Kubernetes

  • Ollama containeriseren met Docker
  • Ollama draaien in Kubernetes-clusters
  • Load balancing en service discovery

Autoscaling en batching

  • Autoscaling-beleid voor Ollama ontwerpen
  • Batch-inferentie-technieken voor optimalisatie van doorvoer
  • Afspraken tussen latentie en doorvoer

Latentie-optimalisatie

  • Profilering van inferentieprestaties
  • Strategieën voor caching en modelwarm-up
  • Verlagen van I/O- en communicatie-overhead

Monitoring en observability

  • Integratie van Prometheus voor metingen
  • Dashboards bouwen met Grafana
  • Waarschuwings- en incidentreactiesystemen voor Ollama-infrastructuur

Kostenbeheer en schaalstrategieën

  • Kostenbewuste GPU-toevoeging
  • Overwegingen bij cloud- versus on-premise-implementatie
  • Strategieën voor duurzame schaling

Samenvatting en vervolgstappen

Vereisten

  • Ervaring met Linux-systeembeheer
  • Verstand van containerisatie en orkestratie
  • Vakbekendheid met het implementeren van machine learning-modellen

Doeleindgroep

  • DevOps-engineers
  • ML-infrastructuurteams
  • Site reliability engineers

Aantal deelnemers


Prijs per deelnemer

Voorlopige Aankomende Cursussen

Gerelateerde categorieën