Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Présentation des technologies de reconnaissance vocale
- Histoire et évolution de la reconnaissance vocale
- Modèles acoustiques, modèles linguistiques et décodage
- Architectures modernes : RNN, transformers et Whisper
Prétraitement audio et bases de la transcription
- Gestion des formats audio et des taux d'échantillonnage
- Nettoyage, découpage et segmentation de l'audio
- Génération de texte à partir d'audio : temps réel par lots
Pratique avec Whisper et d'autres API
- Installation et utilisation de Whisper d'OpenAI
- Appel d'API cloud (Google, Azure) pour la transcription
- Comparaison des performances, de la latence et des coûts
Langue, accents et adaptation au domaine
- Travail avec plusieurs langues et accents
- Vocabulaires personnalisés et tolérance au bruit
- Traitement des termes juridiques, médicaux ou techniques
Formatage de la sortie et intégration
- Ajout de horodatage, de ponctuation et d'étiquettes d'orateurs
- Exportation au format texte, SRT ou JSON
- Intégration des transcriptions dans des applications ou des bases de données
Laboratoires d'implémentation de cas d'usage
- Transcription de réunions, d'entretiens ou de podcasts
- Systèmes de commandes vocales vers texte
- Sous-titres en temps réel pour les flux vidéo/audio
Évaluation, limites et éthique
- Métriques de précision et benchmarks de modèles
- Biais et équité dans les modèles vocaux
- Considérations relatives à la confidentialité et à la conformité
Résumé et prochaines étapes
Pré requis
- Une compréhension des concepts généraux de l'IA et de l'apprentissage automatique
- La connaissance des formats et des outils de fichiers audio ou multimédias
Public cible
- Les scientifiques des données et ingénieurs IA travaillant avec des données vocales
- Les développeurs logiciels créant des applications basées sur la transcription
- Les organisations explorant la reconnaissance vocale pour l'automatisation