Perceptron et Réseaux Multicouches
38 cartesCe cours couvre le perceptron comme fondement des réseaux de neurones, ses limites, les fonctions d'activation, l'optimisation par descente de gradient, l'algorithme de rétropropagation et les applications pratiques en vision, médecine et télécommunications.
20 cartes
Qui a proposé le perceptron et en quelle année?
Le perceptron a été proposé par Frank Rosenblatt en 1957.
Quand le perceptron simple échoue-t-il à classer correctement les données?
Le perceptron simple échoue lorsque les données ne sont pas linéairement séparables. Dans ce cas, il est impossible de tracer une ligne droite (ou un hyperplan) pour distinguer parfaitement les classes.
Quelles sont les étapes principales de l'apprentissage par rétropropagation?
Les étapes principales sont : Initialisation aléatoire des poids, Propagation avant, Calcul de l'erreur, Rétropropagation du gradient, Mise à jour des poids par descente de gradient, et répétition jusqu'à convergence.
Quel est l'impact du taux d'apprentissage (learning rate) trop faible ou trop élevé?
Un taux d'apprentissage trop faible entraîne une convergence lente, tandis qu'un taux trop élevé peut empêcher la convergence, voire provoquer une divergence. Il peut être diminué au fil des itérations.
Quel est l'objectif de la rétropropagation dans l'apprentissage des réseaux?
La rétropropagation vise à ajuster les poids et biais du réseau pour minimiser la fonction de perte. Elle calcule le gradient de cette fonction par rapport à chaque paramètre en utilisant la règle de la chaîne pour remonter l'erreur.
Qu'est-ce que le gradient évanescent et quand se manifeste-t-il?
Le gradient évanescent survient lorsque la dérivée de la fonction d'activation est proche de zéro, ce qui empêche le réseau d'apprendre. Il se manifeste typiquement dans les réseaux de neurones profonds lors de l'apprentissage par rétropropagation.
Quelle est la formule de mise à jour des poids dans la descente de gradient?
La formule de mise à jour des poids par descente de gradient est :
où est le taux d'apprentissage et est le gradient de la fonction de perte.
Que représente le terme w₀ dans l'équation du perceptron w₀ + w₁x₁ + w₂x₂ = 0?
Dans l'équation du perceptron , le terme représente le biais. Ce biais agit comme un seuil, ajustant la position de la frontière de décision indépendamment des entrées et . Il permet de décaler la ligne de décision dans l'espace des caractéristiques.
Décrivez la structure générale d'un réseau de neurones multicouche (MLP).
Un réseau de neurones multicouche (MLP) est composé d'une couche d'entrée, d'une ou plusieurs couches cachées, et d'une couche de sortie. Chaque neurone effectue une combinaison linéaire suivie d'une fonction d'activation (ex: ReLU, tanh, sigmoid).
Qu'est-ce qu'une fonction d'activation et pourquoi est-elle nécessaire?
Une fonction d'activation introduit de la non-linéarité dans un réseau neuronal, permettant d'apprendre des relations complexes. Chaque neurone combine une somme pondérée des entrées avec un biais, puis applique cette fonction. Sans elle, le réseau se comporterait comme un modèle linéaire simple, quelle que soit sa profondeur. Les fonctions courantes incluent Sigmoïde, tanh, et ReLU.
Comment la règle de la chaîne s'applique-t-elle au calcul du gradient dans une rétropropagation?
La règle de la chaîne permet de calculer le gradient de la fonction de perte par rapport à chaque poids dans un réseau de neurones, qui est une fonction composée. Pour un poids , on calcule , où est la perte, la prédiction, l'entrée de la fonction d'activation, et le poids. Ce produit de gradients locaux donne le gradient global utilisé pour la mise à jour des poids par descente de gradient.
Énumérez quatre applications principales des réseaux de neurones.
Les réseaux de neurones ont quatre applications principales : vision par ordinateur (reconnaissance d'images, détection d'objets), médecine (diagnostic assisté, analyse d'imagerie), télécommunications (égalisation de canal, détection de signaux) et reconnaissance de formes (caractères, vocale, biométrie).
Comment le perceptron multiclasse généralise-t-il le perceptron binaire?
Le perceptron multiclasse généralise le perceptron binaire en utilisant plusieurs fonctions de décision linéaires, chacune visant à séparer une classe des autres. La sortie finale est déterminée par la classe ayant le score le plus élevé, obtenu par une combinaison linéaire de poids et d'entrées, telle que . Il apprend en ajustant ces poids via la rétropropagation pour minimiser une fonction de coût.
Nommez trois fonctions d'activation couramment utilisées dans les réseaux de neurones.
Les fonctions d'activation couramment utilisées sont : tanh, sigmoid, et ReLU (Rectified Linear Unit). Chacune transforme la sortie d'un neurone, introduisant de la non-linéarité essentielle pour apprendre des motifs complexes.
Quel est le problème fondamental que les réseaux de neurones résolvent par rapport aux modèles linéaires?
Les modèles linéaires sont limités aux relations non linéaires complexes. Les réseaux de neurones, grâce à leurs couches cachées et fonctions d'activation non linéaires, peuvent modéliser ces relations complexes et généraliser à partir des données.
Expliquez l'erreur quadratique moyenne comme fonction de coût.
L'Erreur Quadratique Moyenne est une fonction de coût utilisée en apprentissage pour mesurer la différence entre la sortie prédite par le modèle () et la sortie désirée (