Neem contact met ons op

Cursusaanbod

Grondslagen van Tencent Hunyuan in productie

  • Inleiding tot de verschillende Tencent Hunyuan-implementatiescenario’s;
  • Productie-eigenschappen van grote modellen en MoE-modellen;
  • Vaak voorkomende knelpunten in latency, doorvoer en kosten;
  • Het bepalen van servicelevel-doelstellingen voor inference-workloads.

Implementatie-architectuur en werkingsgang van Tencent Hunyuan

  • Kerncomponenten van een productie-inference-stack;
  • Het kiezen tussen gecontaineriseerde, on-premise of cloud-implementaties;
  • Basisprincipes van model-laden, verzoekroutering en GPU-toewijzing;
  • Ontwerp voor betrouwbaarheid en eenvoudige beheersbaarheid.

Praktische optimalisatie van latency

  • Het gebruik van geoptimaliseerde inference-motoren zoals TensorRT wanneer nodig;
  • Concepten achter KV-caches en praktische tune-opties daarvoor;
  • Verminderen van initiële vertragingen, opstarttijd en antwoordtijden;
  • Bepalen van de tijd tot het eerste token verschijnt en snelheid van token-generatie.

Doorvoer, batching en GPU-gebruiksgraad

  • Gebruik van continue en verzoek-gebaseerde batching-strategieën;
  • Het beheren van gelijktijdigheid en wachtrijgedrag;
  • Verbeteren van GPU-gebruiksgraad zonder de gebruikerservaring te schaden;
  • Afhandelen van lange teksten en gemengde workloadverzoeken.

Kwantisering en kostenoptimalisatie

  • Waarom kwantisering belangrijk is voor productie-implementaties;
  • Praktische afwegingen tussen FP16, INT8 en andere precisiemethoden;
  • Het vinden van een evenwicht tussen modelkwaliteit, latency en infrastructuurkosten;
  • Een eenvoudige checklist voor kostenbeheersing opstellen.

Operaties, monitoring en beoordeling van implementatiegeschiktheid

  • Automatische schaalregels voor inference-diensten;
  • Monitoring van latency, doorvoer, cachegebruik en GPU-status;
  • Basisprincipes van logging, alarmering en incidentrespons;
  • Evaluatie van een referentie-implementatie en opstellen van verbeterplannen.

Vereisten

  • Basiskennis van het opschalen en implementeren van grote taalmodellen en inference-workflows;
  • Ervaring met containers, cloud- of on-premise-infrastructuur en API-gebaseerde diensten;
  • Praktische kennis van Python of systeemengineering-taken.

Doelgroep

  • ML-engineers die LLM’s in productie brengen;
  • Platform-engineers verantwoordelijk voor GPU-gebaseerde inference-diensten;
  • Oplossingsarchitecten die schaalbare AI-implementaties ontwerpen.
 14 Uren

Aantal deelnemers


Prijs per deelnemer

Voorlopige Aankomende Cursussen

Gerelateerde categorieën