Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Introduction à la synthèse vocale et au clonage vocal
- Aperçu de la synthèse vocale texte-à-parole (TTS) et de la synthèse vocale neuronale.
- Clonage vocal vs génération de parole : cas d'usage et limites.
- Modèles clés : Tacotron, WaveNet, FastSpeech, VITS.
Travail avec des plateformes commerciales
- Utilisation d'ElevenLabs et de Resemble AI.
- Création, clonage et édition de voix.
- Accès API et flux de travail de synthèse vocale (texte-à-parole).
Développement avec des outils open source
- Installation et configuration de Coqui TTS.
- Entraînement de voix personnalisées et gestion des jeux de données.
- Génération de parole avec un contrôle fin (tonalité, vitesse, émotion).
Préparation des données et gestion des jeux de données vocaux
- Collecte et nettoyage des échantillons vocaux.
- Segmentation, étiquetage et alignement des transcriptions.
- Acquisition éthique des données et consentement vocal.
Intégration applicative
- Intégration de la TTS dans les sites web et les applications.
- Création de systèmes IVR et de bot interactifs.
- Génération de dialogues synthétiques pour la vidéo et les jeux.
Évaluation de la qualité et du réalisme
- MOS (Mean Opinion Score) et tests d'intelligibilité.
- Contrôle de l'expressivité et de la prosodie.
- Comparaison de la latence, de la fidélité et du réalisme.
Considérations éthiques, légales et de gouvernance
- Risques liés aux deepfakes et utilisation responsable.
- Consentement, attribution et implications en matière de droits d'auteur.
- Réglementations et politiques organisationnelles.
Résumé et prochaines étapes
Pré requis
- Compréhension des fondamentaux de l'apprentissage automatique (machine learning).
- Familiarité avec les formats de fichiers audio et les outils de montage.
- Compétences de programmation Python de base.
Public cible
- Développeurs et ingénieurs IA intéressés par la synthèse vocale.
- Créateurs de contenu et technologues des médias explorant la génération vocale.
- Équipes R&D développant des systèmes audio personnalisés ou dynamiques.