Prenez contact avec nous
 Durée 14 heures

Plan du cours

Introduction à la synthèse vocale et au clonage vocal

  • Aperçu de la synthèse vocale texte-à-parole (TTS) et de la synthèse vocale neuronale.
  • Clonage vocal vs génération de parole : cas d'usage et limites.
  • Modèles clés : Tacotron, WaveNet, FastSpeech, VITS.

Travail avec des plateformes commerciales

  • Utilisation d'ElevenLabs et de Resemble AI.
  • Création, clonage et édition de voix.
  • Accès API et flux de travail de synthèse vocale (texte-à-parole).

Développement avec des outils open source

  • Installation et configuration de Coqui TTS.
  • Entraînement de voix personnalisées et gestion des jeux de données.
  • Génération de parole avec un contrôle fin (tonalité, vitesse, émotion).

Préparation des données et gestion des jeux de données vocaux

  • Collecte et nettoyage des échantillons vocaux.
  • Segmentation, étiquetage et alignement des transcriptions.
  • Acquisition éthique des données et consentement vocal.

Intégration applicative

  • Intégration de la TTS dans les sites web et les applications.
  • Création de systèmes IVR et de bot interactifs.
  • Génération de dialogues synthétiques pour la vidéo et les jeux.

Évaluation de la qualité et du réalisme

  • MOS (Mean Opinion Score) et tests d'intelligibilité.
  • Contrôle de l'expressivité et de la prosodie.
  • Comparaison de la latence, de la fidélité et du réalisme.

Considérations éthiques, légales et de gouvernance

  • Risques liés aux deepfakes et utilisation responsable.
  • Consentement, attribution et implications en matière de droits d'auteur.
  • Réglementations et politiques organisationnelles.

Résumé et prochaines étapes

Pré requis

  • Compréhension des fondamentaux de l'apprentissage automatique (machine learning).
  • Familiarité avec les formats de fichiers audio et les outils de montage.
  • Compétences de programmation Python de base.

Public cible

  • Développeurs et ingénieurs IA intéressés par la synthèse vocale.
  • Créateurs de contenu et technologues des médias explorant la génération vocale.
  • Équipes R&D développant des systèmes audio personnalisés ou dynamiques.

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires