Prenez contact avec nous

Plan du cours

Fondamentaux du déploiement de Tencent Hunyuan en production

  • Vue d'ensemble des scénarios de serving des modèles Tencent Hunyuan.
  • Caractéristiques de production des modèles volumineux et MoE.
  • Goulots d'étranglement courants en matière de latence, de débit et de coûts.
  • Définition des objectifs de niveau de service (SLO) pour les charges de travail d'inférence.

Architecture de déploiement et flux de serving

  • Composants principaux de la pile d'inférence en production.
  • Choix entre les modèles de déploiement conteneurisés, on-premise et cloud.
  • Fondamentaux du chargement des modèles, du routage des requêtes et de l'allocation des GPU.
  • Conception pour la fiabilité et la simplicité opérationnelle.

Optimisation de la latence en pratique

  • Utilisation de moteurs d'inférence optimisés tels que TensorRT, lorsque cela est applicable.
  • Concepts du KV-cache et réglage pratique du cache.
  • Réduction des temps de démarrage, de warmup et de la surcharge de réponse.
  • Mesure du temps jusqu'au premier jeton et de la vitesse de génération des jetons.

Débit, batching et efficacité GPU

  • Stratégies de continuous batching et de request batching.
  • Gestion de la concurrence et du comportement des files d'attente.
  • Amélioration de l'utilisation des GPU sans nuire à l'expérience utilisateur.
  • Gestion des requêtes à long contexte et des charges de travail mixtes.

Quantification et maîtrise des coûts

  • Pourquoi la quantification est cruciale pour le serving en production.
  • Compromis pratiques entre FP16, INT8 et autres options de précision courantes.
  • Équilibre entre qualité du modèle, latence et coûts d'infrastructure.
  • Réalisation d'une checklist simple pour l'optimisation des coûts.

Opérations, surveillance et revue de préparation

  • Déclencheurs d'autoscaling pour les services d'inférence.
  • Surveillance de la latence, du débit, de l'utilisation du cache et de la santé des GPU.
  • Fondamentaux de la journalisation (logging), des alertes et de la gestion des incidents.
  • Revue d'un déploiement de référence et création d'un plan d'amélioration.

Pré requis

  • Compréhension de base des workflows de déploiement et d'inférence des grands modèles de langage (LLM).
  • Expérience avec les conteneurs, l'infrastructure cloud ou on-premise, et les services basés sur des API.
  • Connaissance pratique de Python ou des tâches d'ingénierie système.

Public cible

  • Ingénieurs ML déployant des LLM en production.
  • Ingénieurs plateforme responsables des services d'inférence basés sur GPU.
  • Architectes solution conçant des plateformes de serving IA évolutives.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires