In diesem Kapitel legen wir Hand an mit einigen der spezifischen Algorithmen, die Sie möglicherweise verwenden für Klassifikationsmodellierung. Eine der gängigsten Methoden Klassifikationsmodellierung zu tun ist mit einer logistischen Regression. Nun ist Regression einer der häufigsten Stile des maschinellen Lernens in der Praxis und es hat eine wirklich lange Geschichte. Die logistische Regression basiert auf derselben Theorie als lineare Regression, sondern statt Vorhersage einen bestimmten Wert, sagt er die Wahrscheinlichkeit voraus der Zugehörigkeit zu einer bestimmten Klasse. Dazu verwendet es die logistische oder Sigmoidfunktion. Diese Funktion geht von Null Wahrscheinlichkeit aus zu 100% Wahrscheinlichkeit. Ein Vorteil der Verwendung der logistischen Regression ist, dass Sie diese Wahrscheinlichkeit haben das lässt sich relativ einfach interpretieren. Auf diese Weise können Sie sich eine bestimmte Eingangsvariable ansehen und sehen Sie, wie sich die Werte dieser Eingabevariablen ändern die Gesamtwahrscheinlichkeit eines Datenpunkts beeinflussen Zugehörigkeit zu einer bestimmten Klasse. Mal sehen, wie es funktionieren könnte. Also hier habe ich ein Beispielprogramm das wird ein bestimmtes Modell ausführen auf drei verschiedenen synthetischen Datensätzen. Die synthetischen Datensätze werden eingerichtet damit sie bestimmte Eigenschaften haben Wenn wir also die Ergebnisse der verschiedenen Modelle vergleichen, Wir können feststellen, wo einige der Modelle wirklich gut abschneiden und andere Modelle schneiden relativ schlecht ab. Im Fall der logistischen Regression gilt also: Zuerst muss ich das Modul von SK Learn importieren. Dann muss ich mein Diagramm betiteln, und schließlich muss ich den eigentlichen Klassifikator selbst eingeben dass ich in diesem Fall laufen möchte, es ist die logistische Regression. Wenn wir das also ausführen, zeigt es zuerst die synthetischen Datensätze und dann zeigt es uns die Leistung der logistischen Regression. Der erste Datensatz ist wie zwei ineinandergreifende Monde, der zweite ist wie zwei Kreise, einer um den anderen. Und der letzte ist im Wesentlichen ein Blob das ist ungefähr linear trennbar. Okay, wie hat es geklappt? Das sagt uns die Schattierung in den Ergebnisgrafiken wo das Modell einen Wert im Vergleich zu einem anderen vorhersagt. Also vorhersagen, ob der Datenpunkt gehört zur roten Klasse oder zur blauen Klasse und das Raster zeigt uns, wo das Modell glaubt, dass es sich um eine Region handelt das ist viel eher mit der roten Klasse verbunden oder die blaue Klasse. So können Sie hier im ersten sehen Denken Sie daran, wir haben diese Art von linearer Beziehung zwischen den beiden Variablen im Modell. Das bedeutet also, dass es eine Art Überlagerung geben wird diese wahrscheinlichkeitsbasierte Sigmoidfunktion auf dem Gitter auf lineare Weise. Für unsere Beispiele funktioniert das also nicht wirklich gut es erfasst nicht die Struktur innerhalb der Monde und vor allem nicht innerhalb der Kreise. Nun der letzte, der linear trennbare Datensatz Sie können sehen, dass es tatsächlich viel besser funktioniert, aber das interessante ist die 100% Wahrscheinlichkeit die Bereiche, in denen das Modell ziemlich sicher ist dass der Datenpunkt zu dieser Klasse gehört sind eigentlich ziemlich weit weg. So können Sie die meisten Datenpunkte sehen es kategorisiert sie wirklich sehr nahe bis zu dieser 50%-Marke, entweder knapp darüber oder knapp darunter. Das gibt uns also eine gewisse Intuition in die Arten von Datensätzen das könnte durch logistische Regressionen nicht so gut modelliert werden. Das sollte Ihnen also ein wenig Intuition vermitteln darüber, wie eine logistische Regression funktionieren könnte in realen Daten. Es gibt jedoch Herausforderungen für dieses Modell Es ist eine sehr verbreitete Methode zur Modellierung man kann definitiv sagen, dass es nicht sehr gut funktioniert für bestimmte Arten von Beziehungen zwischen Ihren Eingabevariablen. Tatsächlich wird daraus keinerlei komplexe Beziehung abgeleitet innerhalb Ihrer Eingabevariablen. Sie müssten diese Eingabevariablen erstellen als neue Features, um sie zu nutzen. Das Schöne ist, dass es ziemlich einfach zu interpretieren ist was ist los in dem modell. Wenn Sie also einen Datensatzstil haben das hat ziemlich gute Genauigkeit, dann interpretieren ist recht einfach, da Sie nur wenige Koeffizienten haben die Sie interpretieren müssen, um zu verstehen, wie wichtig jedes dieser Elemente sind. Und Sie können sie direkt in Form von Wahrscheinlichkeiten ausdrücken und Sie können sie in Wahrscheinlichkeiten betrachten Das ist eine wirklich intuitive Art, darüber nachzudenken Klassifikationsmodellierung. Das letzte Problem bei der logistischen Regression ist das es ist ziemlich empfindlich gegenüber Ausreißern. Das bedeutet, dass Ihr Trainingsset wirklich kann beeinflussen das modellierte Ergebnis. Achten Sie also auf Ausreißer in Ihren Daten, es ist etwas, was Sie sowieso immer überprüfen sollten aber es ist wirklich wichtig, wenn Sie die logistische Regression verwenden. Die andere Herausforderung bei der logistischen Regression ist die Es basiert auf einer Reihe von Annahmen, die möglicherweise nicht erfüllt werden mit vielen der verschiedenen Datenquellen, die Sie verwenden. Also zum Beispiel ungleiche Varianz innerhalb Ihrer verschiedenen Eingabevariablen ist etwas, das das Modell massiv beeinflussen kann die du baust. Merken Sie sich also unsere Daten von card deco Wir haben eine Menge ungleicher Varianzen in den Eingabevariablen gesehen. Und in diesem Fall würden wir dann sichergehen wollen dass wir eine Eingabevariable hatten, die in unserem Modell funktionieren würde. Jetzt sollten Sie also eine gute Idee haben wie eine logistische Regression implementiert werden kann Verwenden der SK-Lernbibliothek und Möglichkeiten, die Sie verwenden können einige der Visualisierungen, um sie zu interpretieren was das Modell Ihnen sagt und was los ist mit der Vorhersage. Auf einigen davon können Sie Ihre Intuition aufbauen synthetische Datensätze, damit Sie sich ein Bild machen können wie sich die verschiedenen Modelle vergleichen wenn Sie dies bei Ihren wirklichen Herausforderungen verwenden werden.