Bedankt voor uw aanvraag! Een van onze medewerkers neemt binnenkort contact met u op
Bedankt voor uw boeking! Een van onze medewerkers neemt binnenkort contact met u op.
Duur 21 uren
Cursusaanbod
Inleiding tot het schalen van Ollama
- De architectuur van Ollama en overwegingen voor schaling
- Veelvoorkomende knelpunten in multi-gebruikersimplementaties
- Best practices voor de bereidheid van de infrastructuur
Resourcetoevoeging en GPU-optimalisatie
- Strategieën voor efficiënt gebruik van CPU/GPU
- Overwegingen rondom geheugen en bandbreedte
- Resourcelimieten op container-niveau
Implementatie met containers en Kubernetes
- Ollama containeriseren met Docker
- Ollama draaien in Kubernetes-clusters
- Load balancing en service discovery
Autoscaling en batching
- Autoscaling-beleid voor Ollama ontwerpen
- Batch-inferentie-technieken voor optimalisatie van doorvoer
- Afspraken tussen latentie en doorvoer
Latentie-optimalisatie
- Profilering van inferentieprestaties
- Strategieën voor caching en modelwarm-up
- Verlagen van I/O- en communicatie-overhead
Monitoring en observability
- Integratie van Prometheus voor metingen
- Dashboards bouwen met Grafana
- Waarschuwings- en incidentreactiesystemen voor Ollama-infrastructuur
Kostenbeheer en schaalstrategieën
- Kostenbewuste GPU-toevoeging
- Overwegingen bij cloud- versus on-premise-implementatie
- Strategieën voor duurzame schaling
Samenvatting en vervolgstappen
Vereisten
- Ervaring met Linux-systeembeheer
- Verstand van containerisatie en orkestratie
- Vakbekendheid met het implementeren van machine learning-modellen
Doeleindgroep
- DevOps-engineers
- ML-infrastructuurteams
- Site reliability engineers