Voici un réseau de neurones avec le couvercle retiré. C'est le plus petit réseau capable d'apprendre quelque chose — seize entrées, deux neurones cachés, deux sorties — et il est maintenu aussi petit exprès : si petit que chaque multiplication, chaque somme courante, chaque gradient est un nombre que vous pouvez lire à l'écran. Là où la plupart des visualisations vous montrent la forme de l'apprentissage, celle-ci vous montre l'arithmétique.
Appuyez sur Étape et la chronologie avance une opération à la fois. Une carte quatre par quatre se déploie en seize nœuds d'entrée ; des paquets lumineux transportent chaque entrée le long d'un fil et, au-dessus de chacun, la multiplication exacte — entrée fois poids égale produit. Chaque neurone caché totalise ses seize produits comme un reçu, trace la ligne et écrit le total Z ; ReLU soit le laisse passer soit le bloque à zéro et le neurone s'assombrit. Les deux sorties deviennent des probabilités, et l'erreur est exposée comme une soustraction : prédiction moins vérité. Puis l'éclairage s'inverse, des paquets rouges transportent cette erreur en arrière, la règle de la chaîne la répartit sur les fils entrants, et chaque poids se met à jour en plein jour : ancien poids plus gradient égale nouveau poids, et le fil s'épaissit ou s'amincit physiquement en conséquence.
Exécutez l'entraînement à la place et le même moteur sprinte sur tout le jeu de cartes, et vous regardez les deux neurones cachés se spécialiser — leurs champs récepteurs s'affinant dans les caractéristiques qui séparent un 1 d'un 0. Les mathématiques ici sont le vrai article, vérifiées par gradient contre les différences finies. Quand vous êtes prêt à voir la même arithmétique à pleine échelle — des milliers de poids lisant de vrais chiffres — passez à la salle voisine, le Neuron Lab ; cette salle est le gros plan dont vous partez.
Caractéristiques
- Topologie
- 16 → 2 → 2, ReLU caché, sortie softmax
- Entraînement
- Rétropropagation entropie croisée réelle, ∇-vérifiée numériquement
- Pourquoi deux neurones
- Assez petit pour que chaque fil et chaque multiplication reste visible
- Simulé
- Trace avant, flux de gradient, mises à jour de poids en direct
Plus dans Apprentissage automatique