Neem contact met ons op

Cursusaanbod

Inleiding tot Visie-Taalmodellen

  • Overzicht van VLMs en hun rol binnen multimodale AI
  • Gebruikelijke architecturen: CLIP, Flamingo, BLIP, etc.
  • Toepassingsgebieden: zoekopdrachten, onderschriften genereren, autonome systemen, contentanalyse

Voorbereiden van de finetuning-omgeving

  • Installatie van OpenCLIP en andere VLM-bibliotheken
  • Formaten voor datasets met afbeelding-tekstparen
  • Preprocessing-pipelines voor visuele en taalkundige gegevens

Finetunen van CLIP en vergelijkbare modellen

  • Contrastieve verliesfunctie en gezamenlijke embedding-ruimtes
  • Praktische oefening: CLIP finetunen op eigen datasets
  • Omgaan met domeingebonden of meertalige data

Gevorderde technieken voor finetuning

  • Het gebruik van LoRA en adapter-gebaseerde methoden ter verbetering van efficiëntie
  • Prompt tuning en visuele prompt-injectie
  • Vergelijking tussen zero-shot evaluatie en finetuning-resultaten

Evaluatie en benchmarking

  • Metingen voor VLMs: zoekprestaties, BLEU, CIDEr, herkenningsnauwkeurigheid
  • Diagnose van de afstemming tussen visuele en tekstuele elementen
  • Visualisatie van embedding-ruimtes en foutanalyse

Implementatie in daadwerkelijke toepassingen

  • Modelexport voor inferentie (TorchScript, ONNX)
  • Integratie van VLMs in werkstromen of API’s
  • Hoe om te gaan met resourcebeperkingen en model-scaling

Casestudy's en praktijkvoorbeelden

  • Media-analyse en contentmoderatie
  • Zoek- en retrieve-functies in e-commerce en digitale bibliotheken
  • Multimodale interactie bij robotsystemen en autonome apparaten

Samenvatting en vervolgstappen

Vereisten

  • Een goed begrip van diepleertechnieken voor computer vision en NLP
  • Ervaring met PyTorch en transformer-gebaseerde modellen
  • Kennis van multimodale modelarchitecturen

Doelgroep

  • Computer vision-engineers
  • AI-ontwikkelaars
 14 Uren

Aantal deelnemers


Prijs per deelnemer

Voorlopige Aankomende Cursussen

Gerelateerde categorieën