Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Introduction à la multimodalité de Gemini 3
- Capacités couvrant le texte, les images, l'audio et la vidéo
- Sélection des modèles et aperçu des points d'accès
- Concepts clés du raisonnement multimodal
Travail avec le texte et les entrées structurées
- Stratégies de prompting pour la génération de texte
- Métadonnées, fenêtres de contexte et embeddings
- Orchestration textuelle de tâches multimodales
Compréhension des images et flux de travail visuels
- Analyse et interprétation d'images avec Gemini 3
- Création d'outils de recherche visuelle et de balisage (tagging)
- Construction d'interactions image-versus-texte et texte-versus-image
Traitement des entrées audio
- Flux de travail de reconnaissance vocale et de transcription
- Détection et interprétation d'événements audio
- Intégration de l'audio avec les entrées textuelles et visuelles
Intelligence vidéo et analyse de scènes
- Raisonnement vidéo par image et continu
- Construction d'outils de résumés et d'extraction de points saillants
- Automatisation basée sur la vidéo et flux de contenu
Conception d'architectures d'applications multimodales
- Combinaison de plusieurs types d'entrées dans un seul pipeline
- Considérations relatives à la latence, aux coûts et à la puissance de calcul
- Bonnes pratiques pour les systèmes multimodaux évolutifs
Prototypage d'applications multimodales
- Création pratique de prototypes multimodaux
- Itération rapide par l'ingénierie des prompts
- Tests et affinement des parcours d'expérience utilisateur
Déploiement de solutions multimodales
- Stratégies de déploiement et configuration de l'environnement
- Suivi des performances en conditions réelles
- Considérations en matière de sécurité et de conformité
Résumé et prochaines étapes
Pré requis
- Comprendre les concepts modernes de l'IA
- Expérience avec Python ou JavaScript
- Connaissance des API REST
Public cible
- Concepteurs
- Créateurs de contenu
- Équipes techniques de produits
Nos clients témoignent (1)
Fluidez, ambiance et thème de la présentation
Lukasz Kowalczyk - Allegro Sp. z o.o.
Formation - Google Gemini AI for Data Analysis
Traduction automatique