Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 21 heures
Plan du cours
Introduction à l'IA multimodale et à Ollama
- Aperçu de l'apprentissage multimodal
- Principaux défis de l'intégration vision-langage
- Capacités et architecture d'Ollama
Mise en place de l'environnement Ollama
- Installation et configuration d'Ollama
- Travail avec le déploiement local de modèles
- Intégration d'Ollama avec Python et Jupyter
Travail avec des entrées multimodales
- Intégration du texte et des images
- Inclusion de l'audio et des données structurées
- Conception de pipelines de prétraitement
Applications de compréhension de documents
- Extraction d'informations structurées à partir de PDF et d'images
- Combinaison du OCR et des modèles de langage
- Construction de flux de travail d'analyse documentaire intelligents
Réponse à des questions visuelles (VQA)
- Configuration de jeux de données et de benchmarks VQA
- Entraînement et évaluation de modèles multimodaux
- Construction d'applications VQA interactives
Conception d'agents multimodaux
- Principes de conception d'agents avec raisonnement multimodal
- Combinaison de la perception, du langage et de l'action
- Déploiement d'agents pour des cas d'usage réels
Intégration avancée et optimisation
- Ajustement fin (fine-tuning) de modèles multimodaux avec Ollama
- Optimisation des performances d'inférence
- Considérations relatives à la scalabilité et au déploiement
Synthèse et étapes suivantes
Pré requis
- Bonne compréhension des concepts de l'apprentissage automatique
- Expérience avec des frameworks d'apprentissage profond tels que PyTorch ou TensorFlow
- Familiarité avec le traitement du langage naturel et la vision par ordinateur
Public cible
- Ingénieurs en apprentissage automatique
- Chercheurs en IA
- Développeurs produit intégrant des flux de travail visuels et textuels