Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Détails du plan de formation
- Introduction au TLN
- Comprendre le TLN
- Cadres de travail (frameworks) pour le TLN
- Applications commerciales du TLN
- Extraction de données depuis le web (scraping)
- Utilisation de diverses API pour récupérer des données textuelles
- Gestion et stockage de corpus textuels, sauvegarde du contenu et des métadonnées pertinentes
- Avantages de l'utilisation de Python et initiation rapide à NLTK
- Compréhension pratique d'un corpus et d'un jeu de données
- Pourquoi avons-nous besoin d'un corpus ?
- Analyse des corpus
- Types d'attributs de données
- Différents formats de fichiers pour les corpus
- Préparation d'un jeu de données pour les applications de TLN
- Comprendre la structure des phrases
- Composants du TLN
- Compréhension du langage naturel
- Analyse morphologique - tige, mot, jeton, étiquettes partielles (speech tags)
- Analyse syntaxique
- Analyse sémantique
- Gestion des ambiguïtés
- Prétraitement des données textuelles
- Corpus - texte brut
- Tokenisation des phrases
- Stemming (troncature) du texte brut
- Lémmatisation du texte brut
- Suppression des mots vides (stop words)
- Corpus - phrases brutes
- Tokenisation des mots
- Lémmatisation des mots
- Travail avec des matricielles Termes-Document / Document-Terme
- Tokenisation du texte en n-grammes et phrases
- Prétraitement pratique et personnalisé
- Corpus - texte brut
- Analyse des données textuelles
- Fonctionnalités de base du TLN
- Analyseurs (parsers) et analyse syntaxique (parsing)
- Étiquetage partiel (POS tagging) et étiqueteurs
- Reconnaissance des entités nommées
- N-grammes
- Sac de mots (Bag of words)
- Fonctionnalités statistiques du TLN
- Concepts d'algèbre linéaire pour le TLN
- Théorie probabiliste pour le TLN
- TF-IDF
- Vectorisation
- Codeurs et décodeurs (Encoders et Decoders)
- Normalisation
- Modèles probabilistes
- Ingénierie de caractéristiques avancée et TLN
- Fondamentaux de word2vec
- Composants du modèle word2vec
- Logique du modèle word2vec
- Extension du concept word2vec
- Application du modèle word2vec
- Étude de cas : Application du sac de mots : résumé automatique de texte utilisant les algorithmes simplifiés et réels de Luhn
- Fonctionnalités de base du TLN
- Clustering, Classification et Modélisation Thématique de Documents
- Clustering de documents et exploration de motifs (clustering hiérarchique, k-means, etc.)
- Comparaison et classification de documents à l'aide des mesures de distance TFIDF, Jaccard et cosinus
- Classification de documents à l'aide de Bayes Naïf et d'Entropie Maximale
- Identification des éléments textuels importants
- Réduction de dimensionnalité : Analyse en composantes principales (ACP), Décomposition en valeurs singulières (SVD), Factorisation matricielle non négative (NMF)
- Modélisation thématique et récupération d'informations à l'aide de l'Analyse Sémantique Latente (LSA)
- Extraction d'entités, Analyse de Sentiments et Modélisation Thématique Avancée
- Positif vs Négatif : degré de sentiment
- Théorie de la réponse à l'item (Item Response Theory)
- Étiquetage partiel (POS tagging) et ses applications : identification des personnes, lieux et organisations mentionnés dans le texte
- Modélisation thématique avancée : Allocation de Dirichlet Latente (LDA)
- Études de cas
- Extraction d'informations à partir d'avis d'utilisateurs non structurés
- Classification et visualisation des sentiments dans les données d'avis de produits
- Extraction de motifs d'utilisation à partir des journaux de recherche
- Classification de textes
- Modélisation thématique
Pré requis
Connaissances et compréhension des principes du TLN, ainsi qu'une bonne appréhension des applications de l'IA dans le contexte professionnel
21 Heures
Nos clients témoignent (1)
Soutien individuel
Simon the 2nd - Cboost
Formation - ROS: Programming for Robotics
Traduction automatique