Neem contact met ons op

Cursusaanbod

Taalmodelsoevereiniteit en lokaal hosten van LLM's

  • Risico’s van cloudgebaseerde LLM's: gegevensopslag, training op invoergegevens en jurisdictieproblemen.
  • De architectuur van Ollama: modelserver, registry en OpenAI-compatibele API.
  • Vergelijking met vLLM, llama.cpp en Text Generation Inference.
  • Licentievoorwaarden voor modellen: Llama, Mistral, Qwen en Gemma.

Installatie en hardware-configuratie

  • Ollama installeren op Linux met ondersteuning voor CUDA en ROCm.
  • Gebruik maken van CPU-only-modus en optimalisaties zoals AVX/AVX2.
  • Implementatie via Docker inclusief persistente volume-toewijzing.
  • Opzetten van een multi-GPU-omgeving met efficiënte VRAM-toewijzing.

Modelbeheer

  • Modellen downloaden uit de Ollama-registry: bijvoorbeeld ollama pull llama3.
  • GGUF-modellen importeren vanaf HuggingFace en TheBloke.
  • Kwantificatieniveaus: Q4_K_M, Q5_K_M, Q8_0 – hun voor- en nadelen.
  • Mogelijkheden tot modelwisseling en het beheren van gelijktijdige ladingen van meerdere modellen.

Aangepaste Modelfiles maken

  • Syntaxis van Modelfiles: gebruik van FROM, PARAMETER, SYSTEM en TEMPLATE.
  • Instellingen zoals temperatuur, top_p en repeat_penalty afstemmen.
  • Rollengebaseerde systeemprompts ontwerpen om gedrag te sturen.
  • Eigen modellen ontwikkelen en publiceren in de lokale registry.

API-integratie

  • Gebruik maken van het OpenAI-compatibele /v1/chat/completions-eindpunt.
  • Realtime responsstreaming en JSON-uitvoer regelen.
  • Integratie met LangChain, LlamaIndex en eigen applicaties.
  • Authenticatie en rate limiting instellen via een reverse proxy.

Prestatieoptimalisatie

  • Gebruik van contextvensters beheren en KV-cache optimaliseren.
  • Batch-inferentie toepassen voor efficiënte verwerking van meerdere aanvragen tegelijk.
  • Toewijzing van CPU-threads regelen met rekening voor NUMA-architectuur.
  • Gebruik en geheugendruk van de GPU monitoren.

Beveiliging en compliance

  • Netwerkisolatie van endpoints voor modelaanbieding bevorderen.
  • Invoerfilteren en uitvoerbeheersing doorvoeren via gespecialiseerde pijplijnen.
  • Loggen van prompts en gegenereerde teksten om controle mogelijk te maken.
  • Verificatie van modelbron en hashwaarden voor betrouwbaarheid.

Vereisten

  • Middenniveau-kennis van Linux en containerbeheer.
  • Basiskennis over machine learning en transformer-modellen.
  • Vertrouwdheid met REST-API's en JSON-formaat.

Doelgroep

  • AI-engineers en ontwikkelaars die cloudgebaseerde LLM-API’s willen vervangen.
  • Organisaties waarbij gevoelige data een gebruik van cloudmodellen verbiedt.
  • Overheids- en defensieorganisaties die luchtgescheiden taalmodellen nodig hebben.
 14 Uren

Aantal deelnemers


Prijs per deelnemer

Voorlopige Aankomende Cursussen

Gerelateerde categorieën