Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Fondamentaux du déploiement de Tencent Hunyuan en production
- Vue d'ensemble des scénarios de serving des modèles Tencent Hunyuan.
- Caractéristiques de production des modèles volumineux et MoE.
- Goulots d'étranglement courants en matière de latence, de débit et de coûts.
- Définition des objectifs de niveau de service (SLO) pour les charges de travail d'inférence.
Architecture de déploiement et flux de serving
- Composants principaux de la pile d'inférence en production.
- Choix entre les modèles de déploiement conteneurisés, on-premise et cloud.
- Fondamentaux du chargement des modèles, du routage des requêtes et de l'allocation des GPU.
- Conception pour la fiabilité et la simplicité opérationnelle.
Optimisation de la latence en pratique
- Utilisation de moteurs d'inférence optimisés tels que TensorRT, lorsque cela est applicable.
- Concepts du KV-cache et réglage pratique du cache.
- Réduction des temps de démarrage, de warmup et de la surcharge de réponse.
- Mesure du temps jusqu'au premier jeton et de la vitesse de génération des jetons.
Débit, batching et efficacité GPU
- Stratégies de continuous batching et de request batching.
- Gestion de la concurrence et du comportement des files d'attente.
- Amélioration de l'utilisation des GPU sans nuire à l'expérience utilisateur.
- Gestion des requêtes à long contexte et des charges de travail mixtes.
Quantification et maîtrise des coûts
- Pourquoi la quantification est cruciale pour le serving en production.
- Compromis pratiques entre FP16, INT8 et autres options de précision courantes.
- Équilibre entre qualité du modèle, latence et coûts d'infrastructure.
- Réalisation d'une checklist simple pour l'optimisation des coûts.
Opérations, surveillance et revue de préparation
- Déclencheurs d'autoscaling pour les services d'inférence.
- Surveillance de la latence, du débit, de l'utilisation du cache et de la santé des GPU.
- Fondamentaux de la journalisation (logging), des alertes et de la gestion des incidents.
- Revue d'un déploiement de référence et création d'un plan d'amélioration.
Pré requis
- Compréhension de base des workflows de déploiement et d'inférence des grands modèles de langage (LLM).
- Expérience avec les conteneurs, l'infrastructure cloud ou on-premise, et les services basés sur des API.
- Connaissance pratique de Python ou des tâches d'ingénierie système.
Public cible
- Ingénieurs ML déployant des LLM en production.
- Ingénieurs plateforme responsables des services d'inférence basés sur GPU.
- Architectes solution conçant des plateformes de serving IA évolutives.