Bedankt voor uw aanvraag! Een van onze medewerkers neemt binnenkort contact met u op
Bedankt voor uw boeking! Een van onze medewerkers neemt binnenkort contact met u op.
Duur 14 uren
Cursusaanbod
Grondslagen van Tencent Hunyuan in productie
- Inleiding tot de verschillende Tencent Hunyuan-implementatiescenario’s;
- Productie-eigenschappen van grote modellen en MoE-modellen;
- Vaak voorkomende knelpunten in latency, doorvoer en kosten;
- Het bepalen van servicelevel-doelstellingen voor inference-workloads.
Implementatie-architectuur en werkingsgang van Tencent Hunyuan
- Kerncomponenten van een productie-inference-stack;
- Het kiezen tussen gecontaineriseerde, on-premise of cloud-implementaties;
- Basisprincipes van model-laden, verzoekroutering en GPU-toewijzing;
- Ontwerp voor betrouwbaarheid en eenvoudige beheersbaarheid.
Praktische optimalisatie van latency
- Het gebruik van geoptimaliseerde inference-motoren zoals TensorRT wanneer nodig;
- Concepten achter KV-caches en praktische tune-opties daarvoor;
- Verminderen van initiële vertragingen, opstarttijd en antwoordtijden;
- Bepalen van de tijd tot het eerste token verschijnt en snelheid van token-generatie.
Doorvoer, batching en GPU-gebruiksgraad
- Gebruik van continue en verzoek-gebaseerde batching-strategieën;
- Het beheren van gelijktijdigheid en wachtrijgedrag;
- Verbeteren van GPU-gebruiksgraad zonder de gebruikerservaring te schaden;
- Afhandelen van lange teksten en gemengde workloadverzoeken.
Kwantisering en kostenoptimalisatie
- Waarom kwantisering belangrijk is voor productie-implementaties;
- Praktische afwegingen tussen FP16, INT8 en andere precisiemethoden;
- Het vinden van een evenwicht tussen modelkwaliteit, latency en infrastructuurkosten;
- Een eenvoudige checklist voor kostenbeheersing opstellen.
Operaties, monitoring en beoordeling van implementatiegeschiktheid
- Automatische schaalregels voor inference-diensten;
- Monitoring van latency, doorvoer, cachegebruik en GPU-status;
- Basisprincipes van logging, alarmering en incidentrespons;
- Evaluatie van een referentie-implementatie en opstellen van verbeterplannen.
Vereisten
- Basiskennis van het opschalen en implementeren van grote taalmodellen en inference-workflows;
- Ervaring met containers, cloud- of on-premise-infrastructuur en API-gebaseerde diensten;
- Praktische kennis van Python of systeemengineering-taken.
Doelgroep
- ML-engineers die LLM’s in productie brengen;
- Platform-engineers verantwoordelijk voor GPU-gebaseerde inference-diensten;
- Oplossingsarchitecten die schaalbare AI-implementaties ontwerpen.