# But what is a neural network? | Deep learning chapter 1

https://www.youtube.com/watch?v=aircAruvnKk
Translation: de

[00:04] This is a 3.
  Das ist eine 3.

[00:06] It's sloppily written and rendered at an extremely low resolution of 28x28 pixels, but your brain has no trouble recognizing it as a 3.
  Sie ist schlampig geschrieben und in einer extrem niedrigen Auflösung von 28x28 Pixeln gerendert, aber Ihr Gehirn hat keine Probleme, sie als eine 3 zu erkennen.

[00:14] And I want you to take a moment to appreciate how crazy it is that brains can do this so effortlessly.
  Und ich möchte, dass Sie sich einen Moment Zeit nehmen, um zu würdigen, wie verrückt es ist, dass Gehirne dies so mühelos tun können.

[00:19] I mean, this, this and this are also recognizable as 3s, even though the specific values of each pixel is very different from one image to the next.
  Ich meine, dies, dies und dies sind ebenfalls als 3en erkennbar, obwohl die spezifischen Werte jedes Pixels von einem Bild zum nächsten sehr unterschiedlich sind.

[00:28] The particular light-sensitive cells in your eye that are firing when you see this 3 are very different from the ones firing when you see this 3.
  Die speziellen lichtempfindlichen Zellen in Ihrem Auge, die feuern, wenn Sie diese 3 sehen, sind ganz andere als die, die feuern, wenn Sie diese 3 sehen.

[00:37] But something in that crazy-smart visual cortex of yours resolves these as representing the same idea, while at the same time recognizing other images as their own distinct ideas.
  Aber irgendetwas in Ihrem wahnsinnig intelligenten visuellen Kortex löst diese als dieselbe Idee auf, während es gleichzeitig andere Bilder als ihre eigenen, unterschiedlichen Ideen erkennt.

[00:49] But if I told you, hey, sit down and write for me a program that takes in a grid of 28x28 pixels like this and outputs a single number between 0 and 10, telling you what it thinks the digit is, well the task goes from comically trivial to...
  Aber wenn ich Ihnen sagen würde: Hey, setzen Sie sich hin und schreiben Sie mir ein Programm, das ein Raster von 28x28 Pixeln wie dieses entgegennimmt und eine einzelne Zahl zwischen 0 und 10 ausgibt, die Ihnen sagt, was es glaubt, welche Ziffer es ist, nun, dann wird die Aufgabe von komisch trivial zu...

[01:04] Dauntingly difficult.
  Entmutigend schwierig.

[01:07] Unless you've been living under a rock, I think I hardly need to motivate the relevance and importance of machine learning and neural networks to the present and to the future.
  Wenn Sie nicht gerade hinter dem Mond leben, glaube ich, dass ich die Relevanz und Bedeutung von maschinellem Lernen und neuronalen Netzen für die Gegenwart und die Zukunft kaum begründen muss.

[01:15] But what I want to do here is show you what a neural network actually is, assuming no background, and to help visualize what it's doing, not as a buzzword but as a piece of math.
  Aber was ich hier tun möchte, ist Ihnen zu zeigen, was ein neuronales Netz eigentlich ist, ohne Vorkenntnisse vorauszusetzen, und dabei zu helfen, zu visualisieren, was es tut – nicht als Modewort, sondern als ein Stück Mathematik.

[01:25] My hope is that you come away feeling like the structure itself is motivated, and to feel like you know what it means when you read, or you hear about a neural network quote-unquote learning.
  Meine Hoffnung ist, dass Sie das Gefühl haben, die Struktur selbst sei motiviert, und dass Sie das Gefühl haben, zu wissen, was es bedeutet, wenn Sie lesen oder hören, dass ein neuronales Netz in Anführungszeichen „lernt“.

[01:35] This video is just going to be devoted to the structure component of that, and the following one is going to tackle learning.
  Dieses Video wird sich nur der Strukturkomponente widmen, und das folgende wird sich mit dem Lernen befassen.

[01:41] What we're going to do is put together a neural network that can learn to recognize handwritten digits.
  Was wir tun werden, ist ein neuronales Netz zusammenzustellen, das lernen kann, handgeschriebene Ziffern zu erkennen.

[01:49] This is a somewhat classic example for introducing the topic, and I'm happy to stick with the status quo here, because at the end of the two videos I want to point you to a couple good resources where you can learn more, and where you can download the code that does this and play with it on your own computer.
  Dies ist ein etwas klassisches Beispiel zur Einführung in das Thema, und ich bleibe hier gerne beim Status quo, denn am Ende der beiden Videos möchte ich Sie auf ein paar gute Ressourcen hinweisen, wo Sie mehr lernen können und wo Sie den Code herunterladen können, der dies tut, um damit auf Ihrem eigenen Computer zu experimentieren.

[02:05] There are many, many variants of neural networks.
  Es gibt sehr, sehr viele Varianten neuronaler Netze.

[02:07] And in recent years, there's been sort of a boom in research towards these variants.
  Und in den letzten Jahren gab es eine Art Boom in der Forschung zu diesen Varianten.

[02:12] But in these two introductory videos, you and I are just going to look at the simplest plain vanilla form with no added frills.
  Aber in diesen beiden Einführungsvideos werden wir uns nur die einfachste Standardform ohne zusätzlichen Schnickschnack ansehen.

[02:19] This is kind of a necessary prerequisite for understanding any of the more powerful modern variants, and trust me, it still has plenty of complexity for us to wrap our minds around.
  Dies ist eine notwendige Voraussetzung, um die mächtigeren modernen Varianten zu verstehen, und glauben Sie mir, es ist immer noch komplex genug, um es zu durchdringen.

[02:29] But even in this simplest form, it can learn to recognize handwritten digits, which is a pretty cool thing for a computer to be able to do.
  Aber selbst in dieser einfachsten Form kann es lernen, handgeschriebene Ziffern zu erkennen, was eine ziemlich coole Sache für einen Computer ist.

[02:37] And at the same time, you'll see how it does fall short of a couple hopes that we might have for it.
  Und gleichzeitig werden Sie sehen, wie es hinter einigen Hoffnungen zurückbleibt, die wir möglicherweise in es setzen.

[02:43] As the name suggests, neural networks are inspired by the brain, but let's break that down.
  Wie der Name schon sagt, sind neuronale Netze vom Gehirn inspiriert, aber lassen Sie uns das aufschlüsseln.

[02:48] What are the neurons, and in what sense are they linked together?
  Was sind die Neuronen und in welchem Sinne sind sie miteinander verbunden?

[02:52] Right now, when I say neuron, all I want you to think about is a thing that holds a number, specifically a number between 0 and 1.
  Wenn ich jetzt Neuron sage, möchte ich nur, dass Sie an ein Ding denken, das eine Zahl enthält, speziell eine Zahl zwischen 0 und 1.

[03:00] It's really not more than that.
  Es ist wirklich nicht mehr als das.

[03:03] For example, the network starts with a bunch of neurons corresponding to.
  Zum Beispiel beginnt das Netzwerk mit einer Reihe von Neuronen, die entsprechen.

[03:08] Each of the 28x28 pixels of the input image, which is 784 neurons in total.
  Jedes der 28x28 Pixel des Eingangsbildes, was insgesamt 784 Neuronen entspricht.

[03:14] Each one of these holds a number that represents the grayscale value of the corresponding pixel, ranging from 0 for black pixels up to 1 for white pixels.
  Jedes davon enthält eine Zahl, die den Graustufenwert des entsprechenden Pixels darstellt und von 0 für schwarze Pixel bis 1 für weiße Pixel reicht.

[03:25] This number inside the neuron is called its activation, and the image you might have in mind here is that each neuron is lit up when its activation is a high number.
  Diese Zahl innerhalb des Neurons wird als seine Aktivierung bezeichnet, und das Bild, das man sich hier vorstellen könnte, ist, dass jedes Neuron aufleuchtet, wenn seine Aktivierung eine hohe Zahl ist.

[03:36] So all of these 784 neurons make up the first layer of our network.
  All diese 784 Neuronen bilden also die erste Schicht unseres Netzwerks.

[03:46] Now jumping over to the last layer, this has 10 neurons, each representing one of the digits.
  Wenn wir nun zur letzten Schicht springen, diese hat 10 Neuronen, von denen jedes eine der Ziffern repräsentiert.

[03:52] The activation in these neurons, again some number that's between 0 and 1, represents how much the system thinks that a given image corresponds with a given digit.
  Die Aktivierung in diesen Neuronen, wiederum eine Zahl zwischen 0 und 1, stellt dar, wie sehr das System glaubt, dass ein gegebenes Bild mit einer gegebenen Ziffer übereinstimmt.

[04:03] There's also a couple layers in between called the hidden layers, which for the time being should just be a giant question mark for.
  Es gibt auch ein paar Schichten dazwischen, die als verborgene Schichten bezeichnet werden, welche vorerst einfach ein riesiges Fragezeichen sein sollten.

[04:09] How on earth this process of recognizing digits is going to be handled?
  Wie um alles in der Welt dieser Prozess der Ziffernerkennung gehandhabt werden soll?

[04:14] In this network I chose two hidden layers, each one with 16 neurons, and admittedly that's kind of an arbitrary choice.
  In diesem Netzwerk habe ich zwei verborgene Schichten gewählt, jede mit 16 Neuronen, und zugegebenermaßen ist das eine etwas willkürliche Wahl.

[04:21] To be honest I chose two layers based on how I want to motivate the structure in just a moment, and 16, well that was just a nice number to fit on the screen.
  Um ehrlich zu sein, habe ich zwei Schichten gewählt, basierend darauf, wie ich die Struktur gleich motivieren möchte, und 16, nun, das war einfach eine schöne Zahl, die auf den Bildschirm passte.

[04:28] In practice there is a lot of room for experiment with a specific structure here.
  In der Praxis gibt es hier viel Spielraum für Experimente mit einer spezifischen Struktur.

[04:33] The way the network operates, activations in one layer determine the activations of the next layer.
  Die Art und Weise, wie das Netzwerk arbeitet, ist, dass Aktivierungen in einer Schicht die Aktivierungen der nächsten Schicht bestimmen.

[04:39] And of course the heart of the network as an information processing mechanism comes down to exactly how those activations from one layer bring about activations in the next layer.
  Und natürlich läuft das Herzstück des Netzwerks als Informationsverarbeitungsmechanismus genau darauf hinaus, wie diese Aktivierungen von einer Schicht Aktivierungen in der nächsten Schicht hervorrufen.

[04:49] It's meant to be loosely analogous to how in biological networks of neurons, some groups of neurons firing cause certain others to fire.
  Es soll lose analog dazu sein, wie in biologischen neuronalen Netzwerken das Feuern einiger Gruppen von Neuronen dazu führt, dass bestimmte andere feuern.

[04:58] Now the network I'm showing here has already been trained to recognize digits, and let me show you what I mean by that.
  Nun, das Netzwerk, das ich hier zeige, wurde bereits darauf trainiert, Ziffern zu erkennen, und lassen Sie mich Ihnen zeigen, was ich damit meine.

[05:03] It means if you feed in an image, lighting up all 784 neurons of the input layer according to the brightness of each pixel in the image,
  Es bedeutet, wenn man ein Bild einspeist und alle 784 Neuronen der Eingangsschicht entsprechend der Helligkeit jedes Pixels im Bild aufleuchten lässt,

[05:11] That pattern of activations causes some very specific pattern in the next layer.
  Dieses Aktivierungsmuster verursacht ein sehr spezifisches Muster in der nächsten Schicht.

[05:16] Which causes some pattern in the one after it.
  Was ein Muster in der darauffolgenden Schicht verursacht.

[05:18] Which finally gives some pattern in the output layer.
  Was schließlich ein Muster in der Ausgabeschicht ergibt.

[05:22] And the brightest neuron of that output layer is the network's choice, so to speak, for what digit this image represents.
  Und das hellste Neuron dieser Ausgabeschicht ist sozusagen die Wahl des Netzwerks dafür, welche Ziffer dieses Bild darstellt.

[05:32] And before jumping into the math for how one layer influences the next, or how training works, let's just talk about why it's even reasonable to expect a layered structure like this to behave intelligently.
  Und bevor wir uns in die Mathematik stürzen, wie eine Schicht die nächste beeinflusst oder wie das Training funktioniert, lassen Sie uns darüber sprechen, warum es überhaupt vernünftig ist, von einer solchen geschichteten Struktur intelligentes Verhalten zu erwarten.

[05:44] What are we expecting here?
  Was erwarten wir hier?

[05:45] What is the best hope for what those middle layers might be doing?
  Was ist die beste Hoffnung dafür, was diese mittleren Schichten tun könnten?

[05:48] Well, when you or I recognize digits, we piece together various components.
  Nun, wenn Sie oder ich Ziffern erkennen, setzen wir verschiedene Komponenten zusammen.

[05:54] A 9 has a loop up top and a line on the right.
  Eine 9 hat eine Schleife oben und eine Linie auf der rechten Seite.

[05:57] An 8 also has a loop up top, but it's paired with another loop down low.
  Eine 8 hat ebenfalls eine Schleife oben, aber sie ist mit einer weiteren Schleife unten gepaart.

[06:02] A 4 basically breaks down into three specific lines, and things like that.
  Eine 4 lässt sich im Grunde in drei spezifische Linien zerlegen, und ähnliche Dinge.

[06:07] Now in a perfect world, we might hope that each neuron in the second.
  In einer perfekten Welt könnten wir nun hoffen, dass jedes Neuron in der zweiten.

[06:11] To last layer corresponds with one of these subcomponents.
  Die letzte Schicht entspricht einer dieser Unterkomponenten.

[06:15] That anytime you feed in an image with, say, a loop up top, like a 9 or an 8, there's some specific neuron whose activation is going to be close to 1.
  Das bedeutet, dass jedes Mal, wenn man ein Bild mit beispielsweise einer Schleife oben einspeist, wie eine 9 oder eine 8, es ein bestimmtes Neuron gibt, dessen Aktivierung nahe bei 1 liegt.

[06:24] And I don't mean this specific loop of pixels.
  Und ich meine nicht diese spezifische Schleife aus Pixeln.

[06:26] The hope would be that any generally loopy pattern towards the top sets off this neuron.
  Die Hoffnung wäre, dass jedes allgemein schleifenartige Muster im oberen Bereich dieses Neuron auslöst.

[06:32] That way, going from the third layer to the last one just requires learning which combination of subcomponents corresponds to which digits.
  Auf diese Weise erfordert der Übergang von der dritten zur letzten Schicht nur das Lernen, welche Kombination von Unterkomponenten welchen Ziffern entspricht.

[06:41] Of course, that just kicks the problem down the road, because how would you recognize these subcomponents, or even learn what the right subcomponents should be?
  Natürlich verschiebt das das Problem nur, denn wie würde man diese Unterkomponenten erkennen oder gar lernen, was die richtigen Unterkomponenten sein sollten?

[06:48] And I still haven't even talked about how one layer influences the next, but run with me on this one for a moment.
  Und ich habe noch nicht einmal darüber gesprochen, wie eine Schicht die nächste beeinflusst, aber folgen Sie mir für einen Moment bei diesem Gedanken.

[06:53] Recognizing a loop can also break down into subproblems.
  Das Erkennen einer Schleife kann ebenfalls in Teilprobleme zerlegt werden.

[06:57] One reasonable way to do this would be to first recognize the various little edges that make it up.
  Ein vernünftiger Weg dies zu tun wäre, zuerst die verschiedenen kleinen Kanten zu erkennen, aus denen sie besteht.

[07:03] Similarly, a long line, like the kind you might see in the digits 1 or 4 or 7, is really just a long edge, or maybe you think of it as a certain pattern of several.
  Ähnlich ist eine lange Linie, wie man sie bei den Ziffern 1, 4 oder 7 sehen könnte, eigentlich nur eine lange Kante, oder vielleicht betrachtet man sie als ein bestimmtes Muster aus mehreren.

[07:13] Smaller edges.
  Kleinere Kanten.

[07:15] So maybe our hope is that each neuron in the second layer of the network corresponds with the various relevant little edges.
  Vielleicht ist unsere Hoffnung also, dass jedes Neuron in der zweiten Schicht des Netzwerks den verschiedenen relevanten kleinen Kanten entspricht.

[07:23] Maybe when an image like this one comes in, it lights up all of the neurons associated with around 8 to 10 specific little edges, which in turn lights up the neurons associated with the upper loop and a long vertical line, and those light up the neuron associated with a 9.
  Vielleicht leuchten, wenn ein Bild wie dieses eingeht, alle Neuronen auf, die mit etwa 8 bis 10 spezifischen kleinen Kanten assoziiert sind, was wiederum die Neuronen aufleuchten lässt, die mit der oberen Schleife und einer langen vertikalen Linie assoziiert sind, und diese lassen das Neuron aufleuchten, das mit einer 9 assoziiert ist.

[07:40] Whether or not this is what our final network actually does is another question, one that I'll come back to once we see how to train the network, but this is a hope that we might have, a sort of goal with the layered structure like this.
  Ob dies tatsächlich das ist, was unser endgültiges Netzwerk tut, ist eine andere Frage, auf die ich zurückkommen werde, sobald wir sehen, wie man das Netzwerk trainiert, aber dies ist eine Hoffnung, die wir haben könnten, eine Art Ziel mit einer solchen geschichteten Struktur.

[07:53] Moreover, you can imagine how being able to detect edges and patterns like this would be really useful for other image recognition tasks.
  Darüber hinaus kann man sich vorstellen, wie nützlich es wäre, Kanten und Muster wie diese für andere Bilderkennungsaufgaben erkennen zu können.

[08:00] And even beyond image recognition, there are all sorts of intelligent things you might want to do that break down into layers of abstraction.
  Und selbst über die Bilderkennung hinaus gibt es alle möglichen intelligenten Dinge, die man tun möchte und die sich in Abstraktionsebenen unterteilen lassen.

[08:08] Parsing speech, for example, involves taking raw audio and picking out distinct sounds, which combine to make certain syllables, which combine to form words.
  Das Analysieren von Sprache beinhaltet zum Beispiel, rohes Audio zu nehmen und einzelne Laute herauszugreifen, die sich zu bestimmten Silben kombinieren, welche sich wiederum zu Wörtern formen.

[08:16] Which combine to make up phrases and more abstract thoughts, etc.
  Welche sich verbinden, um Phrasen und abstraktere Gedanken usw. zu bilden.

[08:21] But getting back to how any of this actually works, picture yourself right now designing how exactly the activations in one layer might determine the activations in the next.
  Aber um darauf zurückzukommen, wie das alles eigentlich funktioniert: Stellen Sie sich jetzt vor, Sie würden genau entwerfen, wie die Aktivierungen in einer Schicht die Aktivierungen in der nächsten bestimmen könnten.

[08:30] The goal is to have some mechanism that could conceivably combine pixels into edges, or edges into patterns, or patterns into digits.
  Das Ziel ist es, einen Mechanismus zu haben, der sich vorstellen lässt, Pixel zu Kanten, Kanten zu Mustern oder Muster zu Ziffern zu kombinieren.

[08:39] And to zoom in on one very specific example, let's say the hope is for one particular neuron in the second layer to pick up on whether or not the image has an edge in this region here.
  Und um ein ganz spezifisches Beispiel zu betrachten: Nehmen wir an, die Hoffnung besteht darin, dass ein bestimmtes Neuron in der zweiten Schicht erkennt, ob das Bild in diesem Bereich hier eine Kante aufweist oder nicht.

[08:51] The question at hand is what parameters should the network have?
  Die Frage ist, welche Parameter das Netzwerk haben sollte.

[08:55] What dials and knobs should you be able to tweak so that it's expressive enough to potentially capture this pattern, or any other pixel pattern, or the pattern that several edges can make a loop, and other such things?
  An welchen Stellschrauben sollten Sie drehen können, damit es ausdrucksstark genug ist, um dieses Muster, jedes andere Pixelmuster oder das Muster, dass mehrere Kanten eine Schleife bilden können, und andere derartige Dinge potenziell zu erfassen?

[09:08] Well, what we'll do is assign a weight to each one of the connections between our neuron and the neurons from the first layer.
  Nun, was wir tun werden, ist, jeder der Verbindungen zwischen unserem Neuron und den Neuronen der ersten Schicht ein Gewicht zuzuweisen.

[09:16] These weights are just numbers.
  Diese Gewichte sind einfach nur Zahlen.

[09:18] Then take all of those activations from the first layer and compute their weighted sum according to these weights.
  Nehmen Sie dann alle diese Aktivierungen aus der ersten Schicht und berechnen Sie deren gewichtete Summe gemäß diesen Gewichten.

[09:27] I find it helpful to think of these weights as being organized into a little grid of their own, and I'm going to use green pixels to indicate positive weights, and red pixels to indicate negative weights, where the brightness of that pixel is some loose depiction of the weight's value.
  Ich finde es hilfreich, sich diese Gewichte als in einem eigenen kleinen Raster organisiert vorzustellen, und ich werde grüne Pixel verwenden, um positive Gewichte anzuzeigen, und rote Pixel, um negative Gewichte anzuzeigen, wobei die Helligkeit dieses Pixels eine grobe Darstellung des Wertes des Gewichts ist.

[09:42] Now if we made the weights associated with almost all of the pixels zero except for some positive weights in this region that we care about, then taking the weighted sum of all the pixel values really just amounts to adding up the values of the pixel just in the region that we care about.
  Wenn wir nun die Gewichte, die mit fast allen Pixeln verbunden sind, auf Null setzen würden, mit Ausnahme einiger positiver Gewichte in diesem Bereich, der uns interessiert, dann läuft die gewichtete Summe aller Pixelwerte eigentlich nur darauf hinaus, die Werte der Pixel genau in dem Bereich zu addieren, der uns interessiert.

[09:59] And if you really wanted to pick up on whether there's an edge here, what you might do is have some negative weights associated with the surrounding pixels.
  Und wenn Sie wirklich feststellen wollten, ob hier eine Kante vorhanden ist, könnten Sie einige negative Gewichte mit den umgebenden Pixeln verknüpfen.

[10:07] Then the sum is largest when those middle pixels are bright but the surrounding pixels are darker.
  Dann ist die Summe am größten, wenn diese mittleren Pixel hell sind, die umgebenden Pixel aber dunkler.

[10:14] When you compute a weighted sum like this, you might come out with any number,
  Wenn Sie eine solche gewichtete Summe berechnen, könnten Sie eine beliebige Zahl erhalten,

[10:18] But for this network, what we want is for activations to be some value between 0 and 1.
  Aber für dieses Netzwerk möchten wir, dass die Aktivierungen einen Wert zwischen 0 und 1 haben.

[10:24] So a common thing to do is to pump this weighted sum into some function that squishes the real number line into the range between 0 and 1.
  Es ist also üblich, diese gewichtete Summe in eine Funktion einzuspeisen, die den reellen Zahlenstrahl in den Bereich zwischen 0 und 1 staucht.

[10:32] And a common function that does this is called the sigmoid function, also known as a logistic curve.
  Eine gängige Funktion, die dies tut, wird Sigmoidfunktion genannt, auch bekannt als logistische Kurve.

[10:38] Basically very negative inputs end up close to 0, positive inputs end up close to 1, and it just steadily increases around the input 0.
  Im Grunde enden sehr negative Eingaben nahe bei 0, positive Eingaben nahe bei 1, und sie steigt um die Eingabe 0 stetig an.

[10:49] So the activation of the neuron here is basically a measure of how positive the relevant weighted sum is.
  Die Aktivierung des Neurons ist hier also im Grunde ein Maß dafür, wie positiv die relevante gewichtete Summe ist.

[10:57] But maybe it's not that you want the neuron to light up when the weighted sum is bigger than 0.
  Aber vielleicht möchten Sie nicht, dass das Neuron aufleuchtet, wenn die gewichtete Summe größer als 0 ist.

[11:02] Maybe you only want it to be active when the sum is bigger than say 10.
  Vielleicht möchten Sie, dass es nur aktiv ist, wenn die Summe größer als beispielsweise 10 ist.

[11:06] That is, you want some bias for it to be inactive.
  Das heißt, Sie möchten eine gewisse Tendenz dazu, dass es inaktiv bleibt.

[11:11] What we'll do then is just add in some other number like negative 10 to this weighted sum before plugging it through the sigmoid squishification function.
  Was wir dann tun werden, ist einfach eine andere Zahl wie minus 10 zu dieser gewichteten Summe zu addieren, bevor wir sie durch die Sigmoid-Stauchungsfunktion jagen.

[11:20] That additional number is called the bias.
  Diese zusätzliche Zahl wird als Bias bezeichnet.

[11:23] So the weights tell you what pixel pattern this neuron in the second layer is picking up on, and the bias tells you how high the weighted sum needs to be before the neuron starts getting meaningfully active.
  Die Gewichte geben also an, auf welches Pixelmuster dieses Neuron in der zweiten Schicht reagiert, und der Bias gibt an, wie hoch die gewichtete Summe sein muss, bevor das Neuron beginnt, sinnvoll aktiv zu werden.

[11:36] And that is just one neuron.
  Und das ist nur ein einziges Neuron.

[11:38] Every other neuron in this layer is going to be connected to all 784 pixel neurons from the first layer, and each one of those 784 connections has its own weight associated with it.
  Jedes andere Neuron in dieser Schicht wird mit allen 784 Pixel-Neuronen aus der ersten Schicht verbunden sein, und jede dieser 784 Verbindungen hat ihr eigenes zugehöriges Gewicht.

[11:51] Also, each one has some bias, some other number that you add on to the weighted sum before squishing it with the sigmoid.
  Außerdem hat jedes einen Bias, eine weitere Zahl, die man zur gewichteten Summe addiert, bevor man sie mit der Sigmoid-Funktion staucht.

[11:58] And that's a lot to think about!
  Und das ist eine ganze Menge, über die man nachdenken muss!

[12:00] With this hidden layer of 16 neurons, that's a total of 784 times 16 weights, along with 16 biases.
  Mit dieser verborgenen Schicht von 16 Neuronen sind das insgesamt 784 mal 16 Gewichte, zusammen mit 16 Bias-Werten.

[12:08] And all of that is just the connections from the first layer to the second.
  Und das alles betrifft nur die Verbindungen von der ersten zur zweiten Schicht.

[12:12] The connections between the other layers also have a bunch of weights and biases associated with them.
  Die Verbindungen zwischen den anderen Schichten haben ebenfalls eine Reihe von Gewichten und Bias-Werten.

[12:18] All said and done, this network has almost exactly 13,000 total weights and biases.
  Alles in allem hat dieses Netzwerk fast genau 13.000 Gewichte und Bias-Werte insgesamt.

[12:23] 13,000 knobs and dials that can be tweaked and turned to make this network behave in different ways.
  13.000 Knöpfe und Regler, die angepasst und gedreht werden können, damit sich dieses Netzwerk auf unterschiedliche Weise verhält.

[12:31] So when we talk about learning, what that's referring to is getting the computer to find a valid setting for all of these many many numbers so that it'll actually solve the problem at hand.
  Wenn wir also über Lernen sprechen, bezieht sich das darauf, den Computer dazu zu bringen, eine gültige Einstellung für all diese vielen, vielen Zahlen zu finden, damit er das vorliegende Problem tatsächlich lösen kann.

[12:42] One thought experiment that is at once fun and kind of horrifying is to imagine sitting down and setting all of these weights and biases by hand, purposefully tweaking the numbers so that the second layer picks up on edges, the third layer picks up on patterns, etc.
  Ein Gedankenexperiment, das gleichzeitig unterhaltsam und irgendwie erschreckend ist, besteht darin, sich vorzustellen, all diese Gewichte und Biases von Hand einzustellen und die Zahlen gezielt so anzupassen, dass die zweite Schicht Kanten erkennt, die dritte Schicht Muster erkennt usw.

[12:57] I personally find this satisfying rather than just treating the network as a total black box, because when the network doesn't perform the way you anticipate, if you've built up a little bit of a relationship with what those weights and biases actually mean, you have a starting place for experimenting with how to change the structure to improve.
  Ich persönlich finde das befriedigender, als das Netzwerk nur als eine totale Blackbox zu behandeln, denn wenn das Netzwerk nicht so funktioniert, wie man es erwartet, hat man einen Ausgangspunkt, um mit der Veränderung der Struktur zur Verbesserung zu experimentieren, wenn man eine gewisse Beziehung dazu aufgebaut hat, was diese Gewichte und Biases tatsächlich bedeuten.

[13:15] Or when the network does work but not for the reasons you might expect, digging into what the weights and biases are doing is a good way to challenge your assumptions and really expose the full space of possible solutions.
  Oder wenn das Netzwerk zwar funktioniert, aber nicht aus den Gründen, die man erwarten würde, ist es eine gute Möglichkeit, die eigenen Annahmen zu hinterfragen und den gesamten Raum möglicher Lösungen wirklich aufzudecken, indem man untersucht, was die Gewichte und Biases tun.

[13:26] By the way, the actual function here is a little cumbersome to write down, don't you think?
  Übrigens ist die eigentliche Funktion hier etwas umständlich aufzuschreiben, findest du nicht auch?

[13:32] So let me show you a more notationally compact way that these connections are represented.
  Lass mich dir also eine notationell kompaktere Art zeigen, wie diese Verbindungen dargestellt werden.

[13:37] This is how you'd see it if you choose to read up more about neural networks.
  So würdest du es sehen, wenn du dich weiter über neuronale Netze informierst.

[13:40] Organize all of the activations from one layer into a column as a vector.
  Organisiere alle Aktivierungen einer Schicht in einer Spalte als Vektor.

[13:48] Then organize all of the weights as a matrix, where each row of that matrix corresponds to the connections between one layer and a particular neuron in the next layer.
  Organisiere dann alle Gewichte als Matrix, wobei jede Zeile dieser Matrix den Verbindungen zwischen einer Schicht und einem bestimmten Neuron in der nächsten Schicht entspricht.

[13:58] What that means is that taking the weighted sum of the activations in the first layer according to these weights corresponds to one of the terms in the matrix vector product of everything we have on the left here.
  Das bedeutet, dass die gewichtete Summe der Aktivierungen in der ersten Schicht gemäß diesen Gewichten einem der Terme im Matrix-Vektor-Produkt von allem, was wir hier links haben, entspricht.

[14:14] By the way, so much of machine learning just comes down to having a good grasp of linear algebra, so for any of you who want a nice visual understanding for matrices and what matrix vector multiplication means, take a look at the series I did on linear algebra, especially chapter 3.
  Übrigens läuft so vieles beim maschinellen Lernen einfach darauf hinaus, ein gutes Verständnis der linearen Algebra zu haben. Wenn also jemand von euch ein schönes visuelles Verständnis für Matrizen und die Bedeutung der Matrix-Vektor-Multiplikation haben möchte, schaut euch die Serie an, die ich über lineare Algebra gemacht habe, insbesondere Kapitel 3.

[14:29] Back to our expression, instead of talking about adding the bias to each one of these values independently, we represent it by organizing all those biases into a vector, and adding the entire vector to the previous matrix vector product.
  Zurück zu unserem Ausdruck: Anstatt davon zu sprechen, den Bias zu jedem dieser Werte einzeln zu addieren, stellen wir dies dar, indem wir all diese Biases in einem Vektor organisieren und den gesamten Vektor zum vorherigen Matrix-Vektor-Produkt addieren.

[14:43] Then as a final step, I'll wrap a sigmoid around the outside here, and what that's supposed to represent is that you're going to apply the sigmoid function to each specific component of the resulting vector inside.
  Als letzten Schritt lege ich hier außen eine Sigmoid-Funktion an, und das soll bedeuten, dass man die Sigmoid-Funktion auf jede einzelne Komponente des resultierenden Vektors im Inneren anwendet.

[14:55] So once you write down this weight matrix and these vectors as their own symbols, you can communicate the full transition of activations from one layer to the next in an extremely tight and neat little expression, and this makes the relevant code both a lot simpler and a lot faster, since many libraries optimize the heck out of matrix multiplication.
  Sobald man also diese Gewichtsmatrix und diese Vektoren als eigene Symbole aufschreibt, kann man den vollständigen Übergang der Aktivierungen von einer Schicht zur nächsten in einem extrem kompakten und sauberen Ausdruck kommunizieren, und das macht den entsprechenden Code sowohl viel einfacher als auch viel schneller, da viele Bibliotheken die Matrixmultiplikation extrem optimieren.

[15:17] Remember how earlier I said these neurons are simply things that hold numbers?
  Erinnern Sie sich, wie ich vorhin sagte, dass diese Neuronen einfach Dinge sind, die Zahlen enthalten?

[15:22] Well of course the specific numbers that they hold depends on the image you feed in, so it's actually more accurate to think of each neuron as a function,
  Nun, natürlich hängen die spezifischen Zahlen, die sie enthalten, von dem Bild ab, das man einspeist, daher ist es eigentlich genauer, jedes Neuron als eine Funktion zu betrachten,

[15:31] One that takes in the outputs of all the neurons in the previous layer and spits out a number between 0 and 1.
  Eines, das die Ausgaben aller Neuronen der vorherigen Schicht aufnimmt und eine Zahl zwischen 0 und 1 ausgibt.

[15:39] Really the entire network is just a function, one that takes in 784 numbers as an input and spits out 10 numbers as an output.
  Eigentlich ist das gesamte Netzwerk nur eine Funktion, eine, die 784 Zahlen als Eingabe nimmt und 10 Zahlen als Ausgabe ausgibt.

[15:47] It's an absurdly complicated function, one that involves 13,000 parameters in the forms of these weights and biases that pick up on certain patterns, and which involves iterating many matrix vector products and the sigmoid squishification function, but it's just a function nonetheless.
  Es ist eine absurd komplizierte Funktion, die 13.000 Parameter in Form dieser Gewichte und Biases beinhaltet, die bestimmte Muster erkennen, und die die Iteration vieler Matrix-Vektor-Produkte sowie die Sigmoid-Quetschfunktion umfasst, aber es ist dennoch nur eine Funktion.

[16:03] And in a way it's kind of reassuring that it looks complicated.
  Und in gewisser Weise ist es irgendwie beruhigend, dass es kompliziert aussieht.

[16:07] I mean if it were any simpler, what hope would we have that it could take on the challenge of recognizing digits?
  Ich meine, wenn es einfacher wäre, welche Hoffnung hätten wir dann, dass es die Herausforderung der Ziffernerkennung bewältigen könnte?

[16:13] And how does it take on that challenge?
  Und wie nimmt es diese Herausforderung an?

[16:15] How does this network learn the appropriate weights and biases just by looking at data?
  Wie lernt dieses Netzwerk die geeigneten Gewichte und Biases allein durch das Betrachten von Daten?

[16:20] Well that's what I'll show in the next video, and I'll also dig a little more into what this particular network we're seeing is really doing.
  Nun, das werde ich im nächsten Video zeigen, und ich werde auch etwas tiefer darauf eingehen, was dieses spezielle Netzwerk, das wir hier sehen, wirklich tut.

[16:27] Now is the point I suppose I should say subscribe to stay notified about when that video or any new videos come out.
  Jetzt ist der Punkt gekommen, an dem ich wohl sagen sollte: Abonnieren Sie, um benachrichtigt zu werden, wenn dieses Video oder neue Videos erscheinen.

[16:33] But realistically, most of you don't actually receive notifications from YouTube, do you?
  Aber realistisch gesehen erhalten die meisten von euch eigentlich keine Benachrichtigungen von YouTube, oder?

[16:38] Maybe more honestly I should say subscribe so that the neural networks that underlie YouTube's recommendation algorithm are primed to believe that you want to see content from this channel get recommended to you.
  Vielleicht sollte ich ehrlicherweise sagen: Abonniert, damit die neuronalen Netze, die dem Empfehlungsalgorithmus von YouTube zugrunde liegen, darauf eingestellt werden zu glauben, dass ihr Inhalte von diesem Kanal empfohlen bekommen möchtet.

[16:48] Anyway, stay posted for more.
  Wie dem auch sei, bleibt dran für mehr.

[16:50] Thank you very much to everyone supporting these videos on Patreon.
  Vielen Dank an alle, die diese Videos auf Patreon unterstützen.

[16:54] I've been a little slow to progress in the probability series this summer, but I'm jumping back into it after this project, so patrons you can look out for updates there.
  Ich bin diesen Sommer mit der Wahrscheinlichkeitsserie etwas langsam vorangekommen, aber ich steige nach diesem Projekt wieder ein, also könnt ihr Patrons dort nach Updates Ausschau halten.

[17:03] To close things off here I have with me Lisha Li who did her PhD work on the theoretical side of deep learning and who currently works at a venture capital firm called Amplify Partners who kindly provided some of the funding for this video.
  Zum Abschluss habe ich Lisha Li bei mir, die ihre Doktorarbeit über die theoretische Seite des Deep Learning geschrieben hat und derzeit bei einer Risikokapitalfirma namens Amplify Partners arbeitet, die freundlicherweise einen Teil der Finanzierung für dieses Video bereitgestellt hat.

[17:15] So Lisha one thing I think we should quickly bring up is this sigmoid function.
  Also Lisha, eine Sache, die wir meiner Meinung nach kurz ansprechen sollten, ist diese Sigmoid-Funktion.

[17:19] As I understand it early networks use this to squish the relevant weighted sum into that interval between zero and one, you know kind of motivated by this biological analogy of neurons either being inactive or active.
  Soweit ich das verstehe, verwenden frühe Netzwerke diese, um die relevante gewichtete Summe in das Intervall zwischen null und eins zu quetschen, wissen Sie, irgendwie motiviert durch diese biologische Analogie von Neuronen, die entweder inaktiv oder aktiv sind.

[17:30] Exactly.
  Genau.

[17:30] But relatively few modern networks actually use sigmoid anymore.
  Aber relativ wenige moderne Netzwerke verwenden heutzutage tatsächlich noch Sigmoid.

[17:34] Yeah.
  Ja.

[17:34] It's kind of old school, right?
  Es ist irgendwie altmodisch, oder?

[17:35] Yeah, or rather ReLU seems to be much easier to train.
  Ja, oder besser gesagt, ReLU scheint viel einfacher zu trainieren zu sein.

[17:39] And ReLU, ReLU stands for rectified linear unit?
  Und ReLU, ReLU steht für Rectified Linear Unit?

[17:42] Yes, it's this kind of function where you're just taking a max of zero and a, where a is given by what you were explaining in the video.
  Ja, es ist diese Art von Funktion, bei der man einfach das Maximum von null und a nimmt, wobei a durch das gegeben ist, was du im Video erklärt hast.

[17:52] And what this was sort of motivated from, I think, was partially by a biological analogy with how neurons would either be activated or not.
  Und was dies irgendwie motiviert hat, war, glaube ich, teilweise eine biologische Analogie dazu, wie Neuronen entweder aktiviert werden oder nicht.

[18:01] And so if it passes a certain threshold, it would be the identity function, but if it did not, then it would just not be activated, so it'd be zero, so it's kind of a simplification.
  Wenn es also eine bestimmte Schwelle überschreitet, wäre es die Identitätsfunktion, aber wenn nicht, würde es einfach nicht aktiviert werden, also wäre es null; es ist also eine Art Vereinfachung.

[18:11] Using sigmoids didn't help training, or it was very difficult to train at some point, and people just tried ReLU and it happened to work very well for these incredibly deep neural networks.
  Die Verwendung von Sigmoiden half beim Training nicht, oder es war irgendwann sehr schwierig zu trainieren, und die Leute haben einfach ReLU ausprobiert, und es hat für diese unglaublich tiefen neuronalen Netze sehr gut funktioniert.

[18:25] All right, thank you, Lisha.
  Alles klar, danke, Lisha.
