← Danny TobischProjekt 07

Neuronale Netze · zum Nachrechnen

Vier Geraden
ergeben ein Quadrat.

Ein einzelnes Neuron kann nur eine Gerade ziehen. Vier davon, richtig verschaltet, grenzen ein geschlossenes Gebiet ab. Diese Seite rechnet das Stück für Stück vor — siebzehn Zahlen, jede davon nachprüfbar — und zeigt am Ende, wie ein Netz dieselben Zahlen von allein findet.

1 interaktive Grafik alle Zahlen nachgerechnet mit Backpropagation

01 — Der Baustein

Ein Neuron ist eine Gerade

Ein künstliches Neuron rechnet zwei Dinge. Erst eine gewichtete Summe seiner Eingänge, dann drückt es das Ergebnis durch eine S-Kurve:

h = σ(w1x + w2y + b),    σ(z) = 1 / (1 + ez)

Drei Zahlen, mehr steckt nicht darin. Und weil σ streng monoton ist, gilt h > ½ genau dann, wenn die Summe positiv ist. Das Neuron teilt die Ebene mit einer Geraden.

Ein Neuron sagt nicht „ja“ oder „nein“. Es sagt, auf welcher Seite einer Geraden ein Punkt liegt — und wie weit davon entfernt.

Nehmen wir ein konkretes, das wir für den Rest der Seite brauchen:

h1 = σ(4x + 8)     also h1 ≈ 1 für x > −2
x−4−2−10+2
h₁0,00030,50000,98200,99971,0000

Bei x = −2 steht das Neuron genau auf seiner Schwelle. Links davon fällt es rasch auf null, rechts davon steigt es rasch auf eins. Die 4 vor dem x bestimmt, wie rasch — mit einer 1 statt der 4 wäre der Übergang viermal so breit.

02 — Zwei davon

Zwei Neuronen ergeben einen Streifen

Nimm ein zweites Neuron, das in die andere Richtung schaut, und lass ein drittes beide auswerten:

h1 = σ(4x + 8)    h2 = σ(−4x + 8)
p = σ(6 · (h1 + h2 − 1,5))

Die Schwelle 1,5 verlangt, dass beide Neuronen nahe bei eins liegen — eines allein reicht nicht, denn 1 + 0 = 1 < 1,5. Das ist ein logisches UND.

Das Ergebnis

p > ½ beide Neuronen aktiv nur h₂ aktiv nur h₁ aktiv −2 +2 x-Achse · in y ist das Modell blind

Wo genau liegt die Kante?

p = ½ heißt h1 + h2 = 1,5. Bei x = 2 steht h2 genau auf seiner eigenen Schwelle, σ(0) = ½, während h1 längst gesättigt ist, σ(16) ≈ 1. Zusammen also ziemlich genau 1,5.

Nachgerechnet

Die Kante liegt bei x = ±1,99999989. Die Abweichung von 2 beträgt e−16 ≈ 1,1 · 10−7 — genau der Rest, den σ(16) auf 1 noch fehlt.

Beachte, was hier nicht passiert: Beide Neuronen hängen nur von x ab, also hängt auch p nur von x ab. Der Streifen ist nach oben und unten unendlich lang. Ein Punkt bei (0, 1 000 000) bekommt dieselben 95 % wie der Ursprung.

03 — Das Ergebnis

Vier Neuronen ergeben ein Quadrat

Der Streifen begrenzt nur eine Richtung. Nimm zwei weitere Neuronen, die dasselbe für y tun, und verlange, dass alle vier zutreffen:

h1 = σ(4x + 8)   h2 = σ(−4x + 8)   h3 = σ(4y + 8)   h4 = σ(−4y + 8)
p = σ(6 · (h1 + h2 + h3 + h4 − 3,5))
PunktΣhp
(0 | 0)3,99870,9522innen
(1,5 | 1,5)3,76160,8277innen, nahe der Kante
(5 | 0)2,99930,0472außen, eine Bedingung verletzt
(3 | 3)2,03600,0002außen, zwei verletzt

Der Aufbau

EINGABEN VERSTECKTE SCHICHT AUSGABE x y σ(4x + 8) rechts von x = −2 σ(−4x + 8) links von x = +2 σ(4y + 8) über y = −2 σ(−4y + 8) unter y = +2 σ(6·Σh − 21) alle vier zugleich Jedes versteckte Neuron sieht nur eine der beiden Koordinaten.
Vier Neuronen mal drei Zahlen, plus vier Gewichte und ein Schwellenwert im Ausgabeneuron: siebzehn Parameter. Mehr ist dieses Netz nicht.

Interaktiv

Mehr Neuronen, mehr Kanten. Die gezeichnete Linie ist nicht gemalt, sondern die tatsächliche ½-Niveaumenge des Modells, bei jedem Wechsel neu berechnet.

Die Ecken sind rund

Ein echtes Vieleck hätte beim Quadrat ein Verhältnis von Ecke zu Kantenmitte von √2 ≈ 1,414. Gemessen sind es 1,220. Die S-Kurve schleift die Ecken ab, weil dort zwei Bedingungen gleichzeitig knapp werden.

Mit größerer Steilheit nähert sich das Verhältnis dem Ideal — und mit kleinerer zerfließt die Form. Der Schieber zeigt beides.

04 — Die Bedingung

Ohne die S-Kurve bleibt nichts übrig

Man könnte denken, die S-Kurve sei Beiwerk — eine Glättung, die man auch weglassen könnte. Rechnen wir nach, was dann passiert. Dieselben vier Neuronen, nur ohne σ:

(4x + 8) + (−4x + 8) + (4y + 8) + (−4y + 8) = 32

Bei jedem Punkt. Die Steigungen heben sich weg, übrig bleibt eine Konstante. Das UND ist verschwunden, weil eine Summe von Geraden wieder eine Gerade ist.

Die Verkettung linearer Abbildungen ist linear. Fünfzig Schichten ohne Nichtlinearität können exakt so viel wie eine einzige.

Formal: W₂(W₁x + b₁) + b₂ = (W₂W₁)x + (W₂b₁ + b₂) — wieder eine einzige affine Abbildung. Die S-Kurve ist nicht die Verzierung zwischen den Schichten, sie ist der Grund, warum es Schichten gibt.

Was sie genau leistet

Sie trennt ob von wie weit. Eine Gerade liefert einen unbegrenzten Abstand; σ kappt ihn bei 0 und 1. Erst dadurch lässt sich zählen, wie viele Bedingungen erfüllt sind — statt Abstände gegeneinander aufzurechnen, wo ein sehr großes Plus ein Minus überstimmen würde.

Heute steht dort meist ReLU

In der Breite verwendet man max(0, x) statt der S-Kurve. Der Grund ist die Ableitung: σ′ geht bei großen Beträgen gegen null, und über viele Schichten multipliziert verschwindet das Gradientensignal.

Am Prinzip ändert das nichts — ReLU ist ebenso nichtlinear, und die Rechnung oben bricht mit ihr genauso zusammen. Die S-Kurve überlebt am Ausgang, wo eine Wahrscheinlichkeit gebraucht wird.

05 — Die Grenze

Was eine Schicht nicht kann

Mit einer versteckten Schicht lässt sich jedes konvexe Gebiet abgrenzen: Schnitte von Halbebenen sind Vielecke, und mit genug Neuronen wird daraus ein Kreis. Das Ausgabeneuron setzt dabei eine einzige Schwelle.

Schwelle 3,5

Alle vier — UND

Der Schnitt aller Halbebenen. Ergibt das Quadrat.

Schwelle 0,5

Mindestens eine — ODER

Die Vereinigung. Ergibt alles außerhalb eines Kreuzes.

nicht möglich

Zwei getrennte Quadrate

Eine Schwelle kann nicht „drinnen bei A oder drinnen bei B“ sagen, ohne den Zwischenraum mitzunehmen.

Für zwei getrennte Inseln braucht es eine zweite versteckte Schicht: eine, die zwei Quadrate baut, und eine darüber, die sie verodert. Genau hier fängt Tiefe an, nötig zu werden — und nicht früher.

Zur Einordnung

Eine einzige versteckte Schicht genügt im Prinzip für jede vernünftige Trennfläche — das ist der Satz von Cybenko (1989). Nur kann die nötige Breite dabei exponentiell wachsen. Breite gibt Ausdruckskraft überhaupt, Tiefe gibt Ausdruckskraft pro Parameter.

06 — Exkurs

Wie kommt man an die siebzehn Zahlen?

Bis hierher habe ich sie hingeschrieben. Ich wusste, wo das Quadrat liegen soll, und habe die Gewichte danach gewählt. Ein Netz weiß das nicht — es bekommt nur Punkte mit der Angabe innen oder außen und muss den Rest finden.

Der Mechanismus in einem Satz

Man misst den Fehler am Ausgang, fragt für jedes Gewicht „wie sehr trägt es zu diesem Fehler bei“, und verschiebt es ein Stück in die Gegenrichtung. Die Frage nach dem Beitrag beantwortet die Kettenregel — rückwärts durch das Netz, daher der Name.

∂L/∂w = (pt)  ·  vi  ·  hi(1 − hi)  ·  x

Vier Faktoren: der Fehler am Ausgang, das Gewicht auf dem Weg dorthin, die lokale Ableitung der S-Kurve, und der Eingang selbst. Der dritte Faktor h(1−h) ist der Grund für das Verschwinden der Gradienten: Ist ein Neuron gesättigt, also h nahe 0 oder 1, wird er winzig und das Gewicht bewegt sich kaum noch.

Der Versuch

1200 zufällige Punkte im Bereich −6 bis 6, jeder markiert mit innen oder außen. Ein Netz mit derselben Bauform — zwei Eingänge, vier versteckte Neuronen, ein Ausgang — aber mit zufälligen Startgewichten. 4000 Durchläufe, zehn verschiedene Startwerte.

Ergebnis

Alle zehn Anläufe finden das Quadrat: 95,2 bis 98,8 % richtig auf 600 Punkten, die im Training nie vorkamen.

Und jetzt das Interessante

Der beste Lauf liefert diese vier Neuronen:

gelernt, nicht gesetzt
Neuron 1:  σ(+2,73·x  +0,23·y  −5,69)     feuert bei  x > +2,08
Neuron 2:  σ( −0,07·x  +2,48·y  −5,58)     feuert bei  y > +2,25
Neuron 3:  σ( +0,35·x  −2,77·y  −6,07)     feuert bei  y < −2,19
Neuron 4:  σ(−3,08·x  −0,27·y  −6,61)     feuert bei  x < −2,15

Ausgabe :  σ(−7,63·h₁ −8,58·h₂ −7,82·h₃ −9,09·h₄ +3,92)

Die vier Kanten stimmen auf etwa ein Zehntel: 2,08 · 2,25 · −2,19 · −2,15 gegen die wahren ±2. Aus reinen Punkten rekonstruiert, ohne dass jemand „Quadrat“ gesagt hätte.

Aber die Logik ist umgekehrt.

Meine vier Neuronen prüfen, ob ein Punkt innerhalb liegt, und das Ausgabeneuron verlangt, dass alle vier zutreffen — ein UND mit positiven Gewichten. Die gelernten prüfen, ob er außerhalb liegt, und alle Ausgabegewichte sind negativ: Sobald eines feuert, wird die Ausgabe heruntergezogen.

von Handgelernt
Neuronen prüfenliegt innerhalbliegt außerhalb
Ausgabegewichte+6 · +6 · +6 · +6−7,6 … −9,1
Schwellenwert−21+3,92
Verknüpfungalle vier erfülltkeine verletzt
LogischUNDNOR

Beides beschreibt dasselbe Quadrat. Es ist die Regel von De Morgan, und das Netz hat sich für die andere Seite entschieden — weil ihm niemand gesagt hat, welche gemeint war. Es sucht keine Erklärung, es sucht ein Minimum.

Was daran ehrlicherweise nicht selbstverständlich ist

Dass alle zehn Anläufe funktionieren, liegt an der Einfachheit dieser Aufgabe. Die Fehlerfläche eines Netzes ist nicht konvex — anders als bei einer einzelnen logistischen Regression gibt es kein garantiertes Auffinden des Minimums. Bei knapperer Ausstattung, etwa drei statt vier Neuronen, scheitern einzelne Läufe.

Und die kleinen Querterme wie +0,23·y in Neuron 1 zeigen, dass die Kanten leicht schief stehen. Perfekt achsenparallel wird es nie — dafür gibt es in den Daten keinen Anlass.

07 — Quellen

Nachlesen

Der Satz über die universelle Approximation stammt von George Cybenko, Approximation by superpositions of a sigmoidal function (1989); Kurt Hornik verallgemeinerte ihn kurz darauf. Dass Tiefe gegenüber Breite exponentiell sparsamer sein kann, zeigen die Arbeiten von Matus Telgarsky und von Ronen Eldan und Ohad Shamir aus dem Jahr 2016.

Für den Zugang zu Fuß empfehle ich Michael Nielsens frei verfügbares Neural Networks and Deep Learning — es leitet Backpropagation vollständig her, ohne Bibliothek und ohne Vorwissen. Wer lieber zusieht: die Reihe Neural Networks von 3Blue1Brown.

Die Zahlen auf dieser Seite stammen aus einem eigenen Skript von rund vierzig Zeilen Python ohne Bibliotheken — Vorwärtsrechnung, Kettenregel, Gradientenabstieg. Genau die vier Faktoren aus Kapitel 6, mehr braucht es nicht.

Weiterlesen

← Zurück zur Startseite © 2026 Danny Tobisch · Impressum