Bedankt voor uw aanvraag! Een van onze medewerkers neemt binnenkort contact met u op
Bedankt voor uw boeking! Een van onze medewerkers neemt binnenkort contact met u op.
Cursusaanbod
Taalmodelsoevereiniteit en lokaal hosten van LLM's
- Risico’s van cloudgebaseerde LLM's: gegevensopslag, training op invoergegevens en jurisdictieproblemen.
- De architectuur van Ollama: modelserver, registry en OpenAI-compatibele API.
- Vergelijking met vLLM, llama.cpp en Text Generation Inference.
- Licentievoorwaarden voor modellen: Llama, Mistral, Qwen en Gemma.
Installatie en hardware-configuratie
- Ollama installeren op Linux met ondersteuning voor CUDA en ROCm.
- Gebruik maken van CPU-only-modus en optimalisaties zoals AVX/AVX2.
- Implementatie via Docker inclusief persistente volume-toewijzing.
- Opzetten van een multi-GPU-omgeving met efficiënte VRAM-toewijzing.
Modelbeheer
- Modellen downloaden uit de Ollama-registry: bijvoorbeeld ollama pull llama3.
- GGUF-modellen importeren vanaf HuggingFace en TheBloke.
- Kwantificatieniveaus: Q4_K_M, Q5_K_M, Q8_0 – hun voor- en nadelen.
- Mogelijkheden tot modelwisseling en het beheren van gelijktijdige ladingen van meerdere modellen.
Aangepaste Modelfiles maken
- Syntaxis van Modelfiles: gebruik van FROM, PARAMETER, SYSTEM en TEMPLATE.
- Instellingen zoals temperatuur, top_p en repeat_penalty afstemmen.
- Rollengebaseerde systeemprompts ontwerpen om gedrag te sturen.
- Eigen modellen ontwikkelen en publiceren in de lokale registry.
API-integratie
- Gebruik maken van het OpenAI-compatibele /v1/chat/completions-eindpunt.
- Realtime responsstreaming en JSON-uitvoer regelen.
- Integratie met LangChain, LlamaIndex en eigen applicaties.
- Authenticatie en rate limiting instellen via een reverse proxy.
Prestatieoptimalisatie
- Gebruik van contextvensters beheren en KV-cache optimaliseren.
- Batch-inferentie toepassen voor efficiënte verwerking van meerdere aanvragen tegelijk.
- Toewijzing van CPU-threads regelen met rekening voor NUMA-architectuur.
- Gebruik en geheugendruk van de GPU monitoren.
Beveiliging en compliance
- Netwerkisolatie van endpoints voor modelaanbieding bevorderen.
- Invoerfilteren en uitvoerbeheersing doorvoeren via gespecialiseerde pijplijnen.
- Loggen van prompts en gegenereerde teksten om controle mogelijk te maken.
- Verificatie van modelbron en hashwaarden voor betrouwbaarheid.
Vereisten
- Middenniveau-kennis van Linux en containerbeheer.
- Basiskennis over machine learning en transformer-modellen.
- Vertrouwdheid met REST-API's en JSON-formaat.
Doelgroep
- AI-engineers en ontwikkelaars die cloudgebaseerde LLM-API’s willen vervangen.
- Organisaties waarbij gevoelige data een gebruik van cloudmodellen verbiedt.
- Overheids- en defensieorganisaties die luchtgescheiden taalmodellen nodig hebben.
14 Uren