
In diesem Artikel werden wir die theoretischen Grundlagen der Transformation der linearen Regression in der inversen Logit-Transformation (auch als logistische Reaktionsfunktion bezeichnet) analysieren.Dann werden wir, unter Nutzung des Arsenal des Maximum-Likelihood-Verfahrens,entsprechend dem Modell der logistischen Regression, die Verlustfunktion Logistic Loss, oder anders gesagt, wir werden die Funktion definieren, mit der in der logistischen Regression die Parameter des Gewichtungsvektors angepasst werden.
.
ArtikelĂŒbersicht:
- Wir werden die lineare AbhÀngigkeit zwischen zwei Variablen wiederholen.
- Die Notwendigkeit der Transformation aufzeigen. der linearen Regression
in der logistischen Reaktionsfunktion 
- Wir werden die Transformationen durchfĂŒhren und ableiten. der logistischen Reaktionsfunktion
- Wir werden versuchen zu verstehen, warum die Methode der kleinsten Quadrate bei der ParameterschÀtzung ungeeignet ist.
Funktionen Logistic Loss - Verwenden Sie Maximum-Likelihood-Verfahren zur Bestimmung der ParameterschÀtzfunktion.
:5.1. Fall 1: Funktion Logistic Loss fĂŒr Objekte mit Klassenbezeichnungen. 0 und 1:

5.2. Fall 2: Funktion Logistic Loss fĂŒr Objekte mit Klassenbezeichnungen. -1 und +1:

Der Artikel ist reich an einfachen Beispielen, bei denen alle Berechnungen leicht mĂŒndlich oder schriftlich durchgefĂŒhrt werden können; in einigen FĂ€llen kann ein Taschenrechner erforderlich sein. Also macht euch bereit đ
Dieser Artikel richtet sich hauptsÀchlich an Data Scientists mit grundlegenden Kenntnissen in den Grundlagen des maschinellen Lernens.
Im Artikel wird auch Code fĂŒr das Zeichnen von Diagrammen und Berechnungen bereitgestellt. Der gesamte Code ist in der Sprache python 2.7geschrieben. Ich möchte im Voraus auf die âNeuheitâ der verwendeten Version hinweisen â dies ist eine der Voraussetzungen fĂŒr den Abschluss eines bekannten Kurses von Yandex auf einer ebenso bekannten Online-Bildungsplattform. Coursera, und, wie man annehmen kann, ist das Material inspiriert von diesem Kurs vorbereitet worden.
01. Lineare AbhÀngigkeit
Es ist sehr vernĂŒnftig, die Frage zu stellen â was haben lineare AbhĂ€ngigkeit und logistische Regression gemeinsam?
Ganz einfach! Die logistische Regression ist eines der Modelle, die zu den linearen Klassifikatoren gehören. Einfach gesagt, besteht die Aufgabe eines linearen Klassifikators darin, Zielwerte
aus Variablen (Regressoren) vorherzusagen.
Dabei wird angenommen, dass die AbhÀngigkeit zwischen den Merkmalen
und den Zielwerten besteht.
linear. Daher stammt auch der Name des Klassifikators â linear. Wenn man es sehr grob zusammenfassen möchte, dann basiert das Modell der logistischen Regression auf der Annahme einer linearen AbhĂ€ngigkeit zwischen den Merkmalen.
und den Zielwerten besteht.
Hier ist sie â die Verbindung.
Im Studio das erste Beispiel, das richtig ĂŒber die lineare AbhĂ€ngigkeit der untersuchten GröĂen handelt. Bei der Vorbereitung des Artikels bin ich auf ein Beispiel gestoĂen, das vielen schon bekannt ist â die AbhĂ€ngigkeit des elektrischen Stroms von der Spannung. ('Angewandte Regressionsanalyse', N. Draper, H. Smith)Das werden wir hier ebenfalls betrachten.
Entsprechend der nach dem Ohmschen Gesetz:

â StromstĂ€rke,
â Spannung,
â Widerstand.
WĂŒssten wir nicht das Ohmsche Gesetz, könnten wir die AbhĂ€ngigkeit empirisch ermitteln, indem wir
variieren und
messen und dabei
konstant halten. Dann wĂŒrden wir sehen, dass das Diagramm der AbhĂ€ngigkeit
ab
eine mehr oder weniger gerade Linie zeigt, die durch den Ursprung verlĂ€uft. Wir sagen âmehr oder wenigerâ, da die AbhĂ€ngigkeit tatsĂ€chlich genau ist, unsere Messungen jedoch kleine Fehler enthalten könnten und die Punkte im Diagramm möglicherweise nicht genau auf der Linie liegen, sondern zufĂ€llig um sie herum verteilt sind.
Diagramm 1 «AbhÀngigkeit
ab
»

Code zum Zeichnen des Diagramms
import matplotlib.pyplot as plt
%matplotlib inline
import numpy as np
import random
R = 13.75
x_line = np.arange(0,220,1)
y_line = []
for i in x_line:
y_line.append(i/R)
y_dot = []
for i in y_line:
y_dot.append(i+random.uniform(-0.9,0.9))
fig, axes = plt.subplots(figsize = (14,6), dpi = 80)
plt.plot(x_line,y_line,color = 'purple',lw = 3, label = 'I = U/R')
plt.scatter(x_line,y_dot,color = 'red', label = 'TatsÀchliche Ergebnisse')
plt.xlabel('I', size = 16)
plt.ylabel('U', size = 16)
plt.legend(prop = {'size': 14})
plt.show()02. Notwendigkeit von Transformationen in der linearen Regression
Betrachten wir ein weiteres Beispiel. Stellen wir uns vor, wir arbeiten in einer Bank und haben die Aufgabe, die Wahrscheinlichkeit der RĂŒckzahlung eines Kredits durch den Kreditnehmer in AbhĂ€ngigkeit von bestimmten Faktoren zu ermitteln. Zur Vereinfachung des Problems betrachten wir nur zwei Faktoren: das monatliche Gehalt des Kreditnehmers und die monatliche RĂŒckzahlungsrate des Kredits.
Das Problem ist sehr hypothetisch, aber an diesem Beispiel können wir verstehen, warum es fĂŒr seine Lösung nicht ausreicht, der linearen Regression, und erfahren, welche Transformationen mit der Funktion durchgefĂŒhrt werden mĂŒssen.
Kehren wir zu unserem Beispiel zurĂŒck. Es ist klar, dass je höher das Gehalt, desto mehr kann der Kreditnehmer monatlich zur Tilgung des Darlehens aufbringen. FĂŒr einen bestimmten Gehaltsbereich wird dieser Zusammenhang durchaus linear sein. Nehmen wir beispielsweise einen Gehaltsbereich von 60.000 R bis 200.000 R an und gehen wir davon aus, dass in diesem Gehaltsbereich die AbhĂ€ngigkeit der Höhe der monatlichen Rate vom Gehalt linear ist. Angenommen, fĂŒr den angegebenen Gehaltsbereich wurde festgestellt, dass das VerhĂ€ltnis von Gehalt zu Zahlung nicht unter 3 fallen darf und der Kreditnehmer noch 5.000 R zur VerfĂŒgung haben sollte. Nur in diesem Fall werden wir Annehmen, dass der Kreditnehmer das Darlehen an die Bank zurĂŒckzahlen wird. Dann hat die Gleichung der linearen Regression die folgende Form:

wo
,
,
,
â Gehalt
des Kreditnehmers,
â Zahlung des Darlehens
des Kreditnehmers.
Indem wir das Gehalt und die Zahlung des Darlehens mit festen Parametern in die Gleichung einsetzen,
kann eine Entscheidung ĂŒber die GewĂ€hrung oder Ablehnung des Darlehens getroffen werden.
Um vorzugreifen, sei bemerkt, dass bei den festgelegten Parametern
die Funktion der linearen Regression, die in der logistischen Antwortfunktion verwendet wird, hohe Werte liefern wird, die die Berechnung der RĂŒckzahlungswahrscheinlichkeiten erschweren. Daher wird vorgeschlagen, unsere Koeffizienten, sagen wir, um 25.000 zu reduzieren. Diese Transformation der Koeffizienten wird die Entscheidung ĂŒber die Kreditausreichung nicht Ă€ndern. Merken wir uns diesen Punkt fĂŒr die Zukunft; nun, um es noch klarer zu machen, worum es geht, betrachten wir die Situation mit drei potenziellen Kreditnehmern.
Tabelle 1 âPotenzielle Kreditnehmerâ

Code zur Erstellung der Tabelle
import pandas as pd
r = 25000.0
w_0 = -5000.0/r
w_1 = 1.0/r
w_2 = -3.0/r
data = {'Der Kreditnehmer':np.array(['Vasya', 'Fedya', 'Lesha']),
'Gehalt':np.array([120000,180000,210000]),
'Zahlung':np.array([3000,50000,70000])}
df = pd.DataFrame(data)
df['f(w,x)'] = w_0 + df['Gehalt']*w_1 + df['Zahlung']*w_2
decision = []
for i in df['f(w,x)']:
if i > 0:
dec = 'Genehmigt'
decision.append(dec)
else:
dec = 'Ablehnung'
decision.append(dec)
df['Entscheidung'] = decision
df[['Der Kreditnehmer', 'Gehalt', 'Zahlung', 'f(w,x)', 'Entscheidung']]Laut den Daten der Tabelle möchte Vasya bei einem Gehalt von 120.000 R einen Kredit aufnehmen, den er mit 3.000 R monatlich tilgen möchte. Wir haben festgestellt, dass das Gehalt von Vasya dreimal höher sein muss als die Zahlung, und dass ihm noch 5.000 R zur VerfĂŒgung stehen sollten. Dieses Kriterium erfĂŒllt Vasya:
. Es bleiben sogar 106.000 R. Trotz der Tatsache, dass wir bei der Berechnung
die Koeffizienten
um das 25.000-fache verringert haben, bleibt das Ergebnis dasselbe â der Kredit kann genehmigt werden. Fedya wird auch einen Kredit erhalten, wĂ€hrend Lesha, obwohl er am meisten verdient, seine WĂŒnsche zurĂŒckschrauben muss.
Lass uns in diesem Fall ein Diagramm zeichnen.
Diagramm 2 âKlassifizierung der Kreditnehmerâ

Code zum Zeichnen des Diagramms
salary = np.arange(60000,240000,20000)
payment = (-w_0-w_1*salary)/w_2
fig, axes = plt.subplots(figsize = (14,6), dpi = 80)
plt.plot(salary, payment, color = 'grey', lw = 2, label = '$f(w,x_i)=w_0 + w_1x_{i1} + w_2x_{i2}$')
plt.plot(df[df['Decision'] == 'Approved']['Salary'], df[df['Decision'] == 'Approved']['Payment'],
'o', color ='green', markersize = 12, label = 'Entscheidung - Kredit genehmigt')
plt.plot(df[df['Decision'] == 'Refusal']['Salary'], df[df['Decision'] == 'Refusal']['Payment'],
's', color = 'red', markersize = 12, label = 'Entscheidung - Kredit abgelehnt')
plt.xlabel('Gehalt', size = 16)
plt.ylabel('Zahlung', size = 16)
plt.legend(prop = {'size': 14})
plt.show()Also, unsere Linie, die gemÀà der Funktion
, trennt âschlechteâ Kreditnehmer von âgutenâ. Die Kreditnehmer, deren WĂŒnsche nicht mit den Möglichkeiten ĂŒbereinstimmen, befinden sich ĂŒber der Linie (Lesha), wĂ€hrend die, die gemÀà den Parametern unseres Modells in der Lage sind, den Kredit zurĂŒckzuzahlen, sich unter der Linie befinden (Vasya und Fedya). Anders ausgedrĂŒckt â unsere Linie teilt die Kreditnehmer in zwei Klassen. Wir bezeichnen sie wie folgt: zur Klasse
gehören die Kreditnehmer, die wahrscheinlich den Kredit zurĂŒckzahlen werden, zur Klasse
oder
gehören die Kreditnehmer, die wahrscheinlich den Kredit nicht zurĂŒckzahlen können.
Fassen wir die Ergebnisse aus diesem einfachen Beispiel zusammen. Nehmen wir einen Punkt
und setzen die Koordinaten des Punktes in die entsprechende Gleichung der Linie ein
, betrachten wir drei Optionen:
- Wenn sich der Punkt unter der Linie befindet und wir ihn der Klasse
zuordnen, dann wird der Wert der Funktion
positiv aus sein.
bis
Das bedeutet, wir können annehmen, dass die Wahrscheinlichkeit der RĂŒckzahlung des Kredits im Bereich von
liegt. Je gröĂer der Funktionswert, desto höher die Wahrscheinlichkeit. - Wenn sich der Punkt ĂŒber der Linie befindet und wir ihn der Klasse
oder
zuordnen, dann wird der Funktionswert negativ aus
bis
. Dann betrachten wir die Wahrscheinlichkeit der RĂŒckzahlung der Schuld im Bereich von
, und je gröĂer der Betrag des Funktionswertes ist, desto höher ist unser Vertrauen. - Der Punkt liegt auf der Linie, an der Grenze zwischen den beiden Klassen. In diesem Fall wird der Funktionswert
gleich
sein und die Wahrscheinlichkeit der RĂŒckzahlung des Kredits betrĂ€gt
.
Nun stellen wir uns vor, dass wir nicht zwei Faktoren, sondern Dutzende haben, und nicht drei Kreditnehmer, sondern Tausende. Dann haben wir anstelle einer Linie. m-metrisch Ebene und Koeffizienten
werden nicht aus der Luft gegriffen, sondern nach allen Regeln abgeleitet, basierend auf den gesammelten Daten ĂŒber Kreditnehmer, die Kredite zurĂŒckgezahlt oder nicht zurĂŒckgezahlt haben. Und tatsĂ€chlich, beachten Sie, wir wĂ€hlen jetzt Kreditnehmer aus, basierend auf bereits bekannten Koeffizienten
. TatsÀchlich besteht die Aufgabe des Modells der logistischen Regression darin, die Parameter zu bestimmen
, bei denen der Wert der Verlustfunktion Logistic Loss minimal streben wird. Doch wie der Vektor berechnet wird,
, erfahren wir noch im fĂŒnften Abschnitt des Artikels. Doch bevor wir zu unserem Banker und seinen drei Kunden zurĂŒckkehren,
wissen wir dank der Funktion
, wem wir einen Kredit gewĂ€hren können und wem nicht. Aber mit solchen Informationen kann man nicht zum Direktor gehen, denn man wollte von uns die Wahrscheinlichkeit der RĂŒckzahlung des Kredits durch jeden Kreditnehmer haben. Was tun? Die Antwort ist einfach â wir mĂŒssen die Funktion
, deren Werte im Bereich
liegen, in eine Funktion umwandeln, deren Werte im Bereich
liegen. Und eine solche Funktion existiert, sie wird genannt logistische Regressionsfunktion oder logit-Transformation. Lernen Sie kennen:

Schauen wir uns Schritt fĂŒr Schritt an, wie die logistische Regressionsfunktionentsteht. Wir werden beachten, dass wir rĂŒckwĂ€rts gehen werden, d.h. wir nehmen an, dass uns der Wert der Wahrscheinlichkeit bekannt ist, der im Bereich von
bis
liegt, und danach werden wir diesen Wert ĂŒber das gesamte Zahlenfeld von
bis
.
03 entfalten. Wir leiten die logistische Regressionsfunktion ein.
Schritt 1. Wir konvertieren die Wahrscheinlichkeiten in den Bereich 
WĂ€hrend der Transformation der Funktion
in der logistischen Reaktionsfunktion
lassen wir unseren Kreditanalytiker in Ruhe, und stattdessen besuchen wir WettbĂŒros. Nein, natĂŒrlich werden wir keine Wetten abschlieĂen, alles was uns dort interessiert, ist die Bedeutung des Ausdrucks, zum Beispiel die Chance von 4 zu 1. Die Chancen, die allen Wettspielern bekannt sind, sind das VerhĂ€ltnis von "Erfolgen" zu "Misserfolgen". Aus der Sicht der Wahrscheinlichkeiten ist die Chance die Wahrscheinlichkeit des Eintretens eines Ereignisses geteilt durch die Wahrscheinlichkeit, dass das Ereignis nicht eintritt. Schreiben wir die Formel fĂŒr die Wahrscheinlichkeit des Eintretens eines Ereignisses auf
:

â Wahrscheinlichkeit des Eintretens des Ereignisses,
â Wahrscheinlichkeit des NICHT-Eintretens des Ereignisses
Zum Beispiel, wenn die Wahrscheinlichkeit, dass das junge, starke und flinke Pferd mit dem Namen âWetterchenâ das alte, schlaffe Weibchen mit dem Namen âMatildaâ bei einem Rennen ĂŒberholt, gleich ist
, dann betragen die Chancen fĂŒr âWetterchenâ
zu
und umgekehrt, wissen wir die Chancen, fÀllt es uns leicht, die Wahrscheinlichkeit zu berechnen
:

So haben wir gelernt, die Wahrscheinlichkeit in Chancen âzu ĂŒbersetzenâ, die Werte von
bis
. Lassen Sie uns einen weiteren Schritt machen und lernen, die Wahrscheinlichkeit auf die gesamte Zahlengerade von
bis
.
Schritt 2. Lassen Sie uns die Wahrscheinlichkeitswerte in den Bereich 
Dieser Schritt ist sehr einfach â wir logarithmieren die Chancen zur Basis der Eulerschen Zahl
und erhalten:

Jetzt wissen wir, dass wenn
, dann ist es sehr einfach, den Wert zu berechnen
, und mehr noch, er sollte positiv sein:
. Das trifft zu.
Aus Neugier werden wir ĂŒberprĂŒfen, dass wenn
, dann erwarten wir, einen negativen Wert zu sehen
. ĂberprĂŒfen wir:
. Alles korrekt.
Jetzt wissen wir, wie wir den Wahrscheinlichkeitswert von
bis
auf die gesamte Zahlengerade von
bis
. Im nÀchsten Schritt machen wir alles umgekehrt.
Bis dahin beachten wir, dass gemÀà den Regeln des Logarithmierens, wenn wir den Funktionswert kennen
, können wir die Chancen berechnen:

Diese Methode zur Bestimmung der Chancen wird uns im nĂ€chsten Schritt nĂŒtzlich sein.
Schritt 3. Lassen Sie uns die Formel zur Bestimmung 
Also haben wir gelernt, dass wir, wenn wir wissen
, die Werte der Funktion finden können
. Aber tatsĂ€chlich brauchen wir alles genau umgekehrt â wenn wir den Wert kennen
, um
zu finden. Dazu gehen wir auf das Konzept der inversen Funktion der Chancen zurĂŒck, gemÀà dem:

In diesem Artikel werden wir die genannte Formel nicht ableiten, aber wir werden sie mit den Zahlen aus dem obigen Beispiel ĂŒberprĂŒfen. Wir wissen, dass bei Chancen von 4 zu 1 (
), die Wahrscheinlichkeit des Eintretens eines Ereignisses 0,8 betrÀgt (
). Lassen Sie uns substituieren:
. Das stimmt mit unseren vorherigen Berechnungen ĂŒberein. Gehen wir weiter.
Im letzten Schritt haben wir abgeleitet, dass
, was bedeutet, dass wir in der inversen Funktion der Chancen substituieren können. Wir erhalten:

Teilen wir sowohl den ZĂ€hler als auch den Nenner durch
, dann:

Um sicherzustellen, dass wir uns nicht geirrt haben, machen wir eine weitere kleine ĂberprĂŒfung. In Schritt 2 haben wir fĂŒr
festgelegt, dass
. Dann, indem wir den Wert
in die logistische Reaktionsfunktion einsetzen, erwarten wir, dass wir
. Wir setzen ein und erhalten: 
Herzlichen GlĂŒckwunsch, geschĂ€tzter Leser, wir haben gerade die logistische Reaktionsfunktion entwickelt und getestet. Lassen Sie uns das Diagramm der Funktion betrachten.
Diagramm 3 âLogistische Reaktionsfunktionâ

Code zum Zeichnen des Diagramms
import math
def logit (f):
return 1/(1+math.exp(-f))
f = np.arange(-7,7,0.05)
p = []
for i in f:
p.append(logit(i))
fig, axes = plt.subplots(figsize = (14,6), dpi = 80)
plt.plot(f, p, color = 'grey', label = '$ 1 / (1+e^{-w^Tx_i})$')
plt.xlabel('$f(w,x_i) = w^Tx_i$', size = 16)
plt.ylabel('$p_{i+}$', size = 16)
plt.legend(prop = {'size': 14})
plt.show()In der Literatur kann man diese Funktion auch unter dem Namen antreffen Sigmoidfunktion. Der Grafik ist gut zu entnehmen, dass die wesentliche Ănderung der Wahrscheinlichkeit, dass ein Objekt einer Klasse angehört, in einem relativ kleinen Bereich erfolgt
, irgendwo von
bis
.
Ich schlage vor, zu unserem Kreditanalytiker zurĂŒckzukehren und ihm bei der Berechnung der RĂŒckzahlungswahrscheinlichkeit zu helfen, sonst lĂ€uft er Gefahr, ohne Bonus dazustehen đ
Tabelle 2 âPotenzielle Kreditnehmerâ

Code zur Erstellung der Tabelle
proba = []
for i in df['f(w,x)']:
proba.append(round(logit(i),2))
df['Probability'] = proba
df[['Der Kreditnehmer', 'Gehalt', 'Zahlung', 'f(w,x)', 'Entscheidung', 'Wahrscheinlichkeit']]So haben wir die Wahrscheinlichkeit der RĂŒckzahlung des Kredits ermittelt. Im GroĂen und Ganzen scheint das der Wahrheit zu entsprechen.
TatsĂ€chlich liegt die Wahrscheinlichkeit, dass Wassja mit einem Gehalt von 120.000 R seine monatlichen Zahlungen von 3.000 R an die Bank leisten kann, nahe bei 100 %. Ăbrigens mĂŒssen wir verstehen, dass die Bank auch Lesha einen Kredit gewĂ€hren kann, wenn die Politik der Bank zum Beispiel die Kreditvergabe an Kunden mit einer Wahrscheinlichkeit der KreditrĂŒckzahlung von mehr als, sagen wir, 0,3 vorsieht. In diesem Fall bildet die Bank einfach einen gröĂeren RĂŒckhalt fĂŒr mögliche Verluste.
Es sollte auch angemerkt werden, dass das VerhĂ€ltnis von Gehalt zu Zahlung von mindestens 3 und mit einem Puffer von 5.000 R willkĂŒrlich gewĂ€hlt wurde. Daher konnten wir den Gewichtungsvektor nicht in seiner ursprĂŒnglichen Form verwenden
. Wir mussten die Koeffizienten stark reduzieren, und in dem Fall haben wir jeden Koeffizienten durch 25.000 geteilt, das heiĂt, im Grunde haben wir das Ergebnis angeglichen. Aber das wurde bewusst gemacht, um das VerstĂ€ndnis des Materials zu Beginn zu vereinfachen. In der RealitĂ€t mĂŒssen wir jedoch nicht erfinden und anpassen, sondern sie finden. Genau in den nĂ€chsten Abschnitten des Artikels werden wir die Gleichungen herleiten, mit denen die Parameter bestimmt werden.
.
04. Methode der kleinsten Quadrate zur Bestimmung des Gewichtungsvektors
in der logistischen Reaktionsfunktion
Uns ist bereits eine solche Methode zur Anpassung des Gewichtungsvektors bekannt
, wie die Methode der kleinsten Quadrate (MNLK) Und warum sollten wir ihn dann nicht in den Aufgaben der binĂ€ren Klassifikation verwenden? TatsĂ€chlich gibt es nichts, was dagegen spricht, ihn zu nutzen. OLS, aber diese Methode in Klassifikationsaufgaben liefert weniger genaue Ergebnisse als Logistic Loss. DafĂŒr gibt es eine theoretische Grundlage. Lassen Sie uns zunĂ€chst ein einfaches Beispiel ansehen.
Angenommen, unsere Modelle (die MSE und Logistic Loss) haben bereits mit der Anpassung des Gewichtungsvektors begonnen
und wir haben die Berechnung in einem bestimmten Schritt gestoppt. Es spielt keine Rolle, ob in der Mitte, am Ende oder am Anfang; wichtig ist, dass wir bereits einige Werte des Gewichtungsvektors haben und annehmen, dass in diesem Schritt die Gewichtungsvektoren
beider Modelle keine Unterschiede aufweisen. Nehmen wir also die erhaltenen Gewichte und setzen sie ein in der logistischen Reaktionsfunktion (
) fĂŒr ein beliebiges Objekt, das zur Klasse gehört
. Wir untersuchen zwei FĂ€lle: einmal, wenn unser Modell gemÀà dem angepassten Gewichtungsvektor stark falsch liegt, und umgekehrt â wenn das Modell sich sehr sicher ist, dass das Objekt zur Klasse gehört
. Lassen Sie uns anschauen, welche Strafzahlungen bei der Verwendung von OLS und Logistic Loss.
Code zur Berechnung der Strafen abhÀngig von der verwendeten Verlustfunktion
# ĐșлаŃŃ ĐŸĐ±ŃĐ”ĐșŃа
y = 1
# ĐČĐ”ŃĐŸŃŃĐœĐŸŃŃŃ ĐŸŃĐœĐ”ŃĐ”ĐœĐžŃ ĐŸĐ±ŃĐ”ĐșŃа Đș ĐșлаŃŃŃ ĐČ ŃĐŸĐŸŃĐČĐ”ŃŃŃĐČОО Ń ĐżĐ°ŃĐ°ĐŒĐ”ŃŃĐ°ĐŒĐž w
proba_1 = 0.01
MSE_1 = (y - proba_1)**2
print 'ĐšŃŃĐ°Ń MSE ĐżŃĐž ĐłŃŃĐ±ĐŸĐč ĐŸŃОбĐșĐ” =', MSE_1
# ĐœĐ°ĐżĐžŃĐ”ĐŒ ŃŃĐœĐșŃĐžŃ ĐŽĐ»Ń ĐČŃŃĐžŃĐ»Đ”ĐœĐžŃ f(w,x) ĐżŃĐž ОзĐČĐ”ŃŃĐœĐŸĐč ĐČĐ”ŃĐŸŃŃĐœĐŸŃŃĐž ĐŸŃĐœĐ”ŃĐ”ĐœĐžŃ ĐŸĐ±ŃĐ”ĐșŃа Đș ĐșлаŃŃŃ +1 (f(w,x)=ln(odds+))
def f_w_x(proba):
return math.log(proba/(1-proba))
LogLoss_1 = math.log(1+math.exp(-y*f_w_x(proba_1)))
print 'ĐšŃŃĐ°Ń Log Loss ĐżŃĐž ĐłŃŃĐ±ĐŸĐč ĐŸŃОбĐșĐ” =', LogLoss_1
proba_2 = 0.99
MSE_2 = (y - proba_2)**2
LogLoss_2 = math.log(1+math.exp(-y*f_w_x(proba_2)))
print '**************************************************************'
print 'ĐšŃŃĐ°Ń MSE ĐżŃĐž ŃОлŃĐœĐŸĐč ŃĐČĐ”ŃĐ”ĐœĐœĐŸŃŃĐž =', MSE_2
print 'ĐšŃŃĐ°Ń Log Loss ĐżŃĐž ŃОлŃĐœĐŸĐč ŃĐČĐ”ŃĐ”ĐœĐœĐŸŃŃĐž =', LogLoss_2Fall mit grobem Fehler â das Modell weist das Objekt mit einer Wahrscheinlichkeit von 0,01 der Klasse zu.
Die Strafe bei der Verwendung von
betrÀgt: OLS Fall mit starker Sicherheit

betrÀgt: Logistic Loss Fall mit starker Sicherheit

mit einer Wahrscheinlichkeit von 0,99. â das Modell weist das Objekt mit einer Wahrscheinlichkeit von 0,01 der Klasse zu.
Dieses Beispiel veranschaulicht gut, dass bei grobem Fehler die Verlustfunktion
betrÀgt: OLS Fall mit starker Sicherheit

betrÀgt: Logistic Loss Fall mit starker Sicherheit

Log Loss das Modell wesentlich stĂ€rker bestraft als . Lassen Sie uns nun herausfinden, welche theoretischen Voraussetzungen fĂŒr die Verwendung der Verlustfunktion MSEin Klassifikationsaufgaben gelten. das Modell wesentlich stĂ€rker bestraft als 05. Maximum-Likelihood-Methode und logistische Regression
Wie zu Beginn versprochen, strotzt der Artikel vor einfachen Beispielen. Im Studio ein weiteres Beispiel und alte Bekannte â die Bankkreditnehmer: Wassja, Fedja und Lesja.
Vorsichtshalber, bevor wir das Beispiel weiterentwickeln, erinnere ich daran, dass wir im wirklichen Leben mit einem Trainingsdatensatz von Tausenden oder Millionen von Objekten mit Dutzenden oder Hunderten von Merkmalen zu tun haben. Hier wurden die Zahlen jedoch so gewÀhlt, dass sie leicht im Kopf eines angehenden Data Scientists verankert werden können.
Um auf Nummer sicher zu gehen, erinnere ich daran, dass wir im Leben mit einem Trainingsdatensatz aus tausenden oder Millionen von Objekten mit Dutzenden oder Hunderten von Merkmalen arbeiten. Die Zahlen wurden hier jedoch so gewÀhlt, dass sie leicht im Kopf eines beginnenden Data Scientists bleiben.
Kehren wir zu unserem Beispiel zurĂŒck. Stellen wir uns vor, der Bankdirektor beschloss, Kredite an alle BedĂŒrftigen zu vergeben, obwohl der Algorithmus angezeigt hatte, dass er es Alex nicht gewĂ€hren sollte. Und so verging genĂŒgend Zeit, und wir erfuhren, wer von den drei Protagonisten den Kredit zurĂŒckgezahlt hat und wer nicht. Wie zu erwarten war, haben Wanja und Fedja den Kredit zurĂŒckgezahlt, Alex jedoch nicht. Stellen wir uns nun vor, dieses Ergebnis wird fĂŒr uns zu einer neuen Trainingsdatenreihe, wĂ€hrend wir gleichzeitig so tun, als ob alle Daten zu den Faktoren, die die Wahrscheinlichkeit der RĂŒckzahlung des Kredits beeinflussen (Einkommen des Kreditnehmers, Höhe der monatlichen Zahlung), verschwunden wĂ€ren. Dann können wir intuitiv annehmen, dass jeder dritte Kreditnehmer dem Kreditgeber den Kredit nicht zurĂŒckzahlt, oder anders gesagt, dass die Wahrscheinlichkeit, dass der nĂ€chste Kreditnehmer den Kredit zurĂŒckzahlt, niedrig ist.
. Dieser intuitive Annahme liegt eine theoretische BestÀtigung zugrunde, die sich auf die Maximum-Likelihood-Methode, die in der Literatur oft als Maximum-Likelihood-Prinzip.
bezeichnet wird. ZunÀchst lassen Sie uns mit dem Begriff vertraut machen.
Die Wahrscheinlichkeit der Stichprobe ist die Wahrscheinlichkeit, genau diese Stichprobe, genau diese Beobachtungen / Ergebnisse zu erhalten, d.h. das Produkt der Wahrscheinlichkeiten fĂŒr jedes der Ergebnisse der Stichprobe (zum Beispiel, dass Wanja, Fedja und Alex gleichzeitig den Kredit zurĂŒckgezahlt oder nicht zurĂŒckgezahlt haben).
Die Likelihood-Funktion verknĂŒpft die Wahrscheinlichkeit der Stichprobe mit den Werten der Verteilungsparameter.
In unserem Fall stellt die Trainingsprobe ein verallgemeinertes Bernoulli-Schema dar, bei dem die Zufallsvariable nur zwei Werte annimmt:
oder
. Daher kann die Wahrscheinlichkeit der Stichprobe als Funktion der Likelihood des Parameters formuliert werden.
folgendermaĂen ausfĂŒhren:


Die obige Darstellung kann wie folgt interpretiert werden. Die gemeinsame Wahrscheinlichkeit, dass Wanja und Fedja den Kredit zurĂŒckzahlen, ist gleich
, die Wahrscheinlichkeit, dass Alex den Kredit NICHT zurĂŒckzahlt, ist gleich
(da tatsĂ€chlich keine RĂŒckzahlung des Kredits stattfand), daher ist die gemeinsame Wahrscheinlichkeit aller drei Ereignisse gleich
.
Die Maximum-Likelihood-Methode ist eine Methode zur SchÀtzung eines unbekannten Parameters durch Maximierung der Likelihood-Funktion. In unserem Fall muss der Wert gefunden werden,
, fĂŒr den
maximal ist.
Woher stammt eigentlich die Idee, den Wert eines unbekannten Parameters zu suchen, bei dem die Likelihood-Funktion ihr Maximum erreicht? Die Wurzeln der Idee stammen aus der Vorstellung, dass die Stichprobe die einzige verfĂŒgbare Informationsquelle ĂŒber die Grundgesamtheit ist. Alles, was wir ĂŒber die Grundgesamtheit wissen, ist in der Stichprobe enthalten. Daher können wir nur sagen, dass die Stichprobe die genaueste Darstellung der Grundgesamtheit ist, die uns zur VerfĂŒgung steht. Folglich mĂŒssen wir einen Parameter finden, bei dem die gegebene Stichprobe am wahrscheinlichsten ist.
Offensichtlich handelt es sich um eine Optimierungsaufgabe, bei der ein Extrempunkt der Funktion gefunden werden muss. Um einen Extrempunkt zu finden, muss die Bedingung erster Ordnung betrachtet werden, das heiĂt, die Ableitung der Funktion wird gleich null gesetzt und die Gleichung nach dem gesuchten Parameter gelöst. Der Versuch, die Ableitung eines Produkts vieler Faktoren zu finden, kann jedoch langwierig sein; um dies zu vermeiden, gibt es eine spezielle Methode â den Ăbergang zum Logarithmus. Likelihood-Funktion. Warum ist ein solcher Ăbergang möglich? Beachten wir, dass wir nicht das Extremum der Funktion selbst suchen,
, sondern den Extrempunkt, also den Wert des unbekannten Parameters,
, fĂŒr den
der das Maximum erreicht. Bei der Umstellung auf den Logarithmus bleibt der Extrempunkt unverÀndert (auch wenn das Extremum selbst anders sein wird), da der Logarithmus eine monotone Funktion ist.
Lassen Sie uns gemÀà dem Vorstehenden unser Beispiel mit den Krediten von Wanja, Fedja und Lesha weiterentwickeln. ZunÀchst wechseln wir zu dem Logarithmus der Likelihood-Funktion.:

Jetzt können wir den Ausdruck leicht nach
:

differenzieren. Und schlieĂlich betrachten wir die Bedingung erster Ordnung â wir setzen die Ableitung der Funktion gleich null:

Somit wurde unsere intuitive SchÀtzung der Wahrscheinlichkeit der Kredittilgung
theoretisch untermauert.
Wunderbar, was sollen wir jetzt mit diesen Informationen tun? Wenn wir annehmen, dass jeder dritte Kreditnehmer das Geld nicht an die Bank zurĂŒckzahlt, wird die Bank unweigerlich bankrottgehen. So ist es, aber wenn wir die Wahrscheinlichkeit der RĂŒckzahlung des Kredits als gleich betrachten
Wir haben die Faktoren, die die RĂŒckzahlung des Kredits beeinflussen, nicht berĂŒcksichtigt: das Gehalt des Kreditnehmers und die Höhe der monatlichen Zahlung. Erinnern wir uns, dass wir zuvor die Wahrscheinlichkeit der RĂŒckzahlung des Kredits fĂŒr jeden Kunden unter BerĂŒcksichtigung dieser Faktoren berechnet haben. Es ist logisch, dass sich auch die Wahrscheinlichkeiten von der konstanten Wahrscheinlichkeit unterscheiden.
.
Lassen Sie uns die Wahrscheinlichkeit der Stichproben bestimmen:
Code zur Berechnung der Wahrscheinlichkeiten der Stichproben
from functools import reduce
def likelihood(y,p):
line_true_proba = []
for i in range(len(y)):
ltp_i = p[i]**y[i]*(1-p[i])**(1-y[i])
line_true_proba.append(ltp_i)
likelihood = []
return reduce(lambda a, b: a*b, line_true_proba)
y = [1.0,1.0,0.0]
p_log_response = df['Probability']
const = 2.0/3.0
p_const = [const, const, const]
print 'Wahrscheinlichkeit der Stichprobe bei konstantem Wert p=2/3:', round(likelihood(y,p_const),3)
print '****************************************************************************************************'
print 'Wahrscheinlichkeit der Stichprobe bei berechnetem Wert p:', round(likelihood(y,p_log_response),3)Wahrscheinlichkeit der Stichprobe bei konstantem Wert
:

Wahrscheinlichkeit der Stichprobe bei Berechnung der RĂŒckzahlungswahrscheinlichkeit unter BerĂŒcksichtigung der Faktoren
:


Die Wahrscheinlichkeit der Stichprobe, die mit berĂŒcksichtigten Faktoren berechnet wurde, war höher als die Wahrscheinlichkeit bei konstantem Wert. Was bedeutet das? Es bedeutet, dass das Wissen ĂŒber die Faktoren es ermöglicht hat, die RĂŒckzahlungswahrscheinlichkeit fĂŒr jeden Kunden genauer zu bestimmen. Daher wĂ€re es bei der Vergabe eines neuen Kredits richtiger, das im letzten Abschnitt 3 des Artikels vorgestellte Modell zur Bewertung der RĂŒckzahlungswahrscheinlichkeit zu verwenden.
Aber wenn wir die Wahrscheinlichkeit maximieren mĂŒssen, die Funktion der Wahrscheinlichkeit der Stichprobe,, warum nicht einen Algorithmus verwenden, der Wahrscheinlichkeiten fĂŒr Wanja, Fedya und Lesha beispielsweise gleich 0,99, 0,99 und 0,01 ausgibt? Möglicherweise wird sich ein solcher Algorithmus auf der Trainingsstichprobe gut bewĂ€hren, da er den Wert der Wahrscheinlichkeit der Stichprobe nĂ€herbringen könnte.
, aber erstens wird ein solcher Algorithmus wahrscheinlich Schwierigkeiten mit der GeneralisierungsfĂ€higkeit haben, zweitens wird dieser Algorithmus sicherlich nicht linear sein. Und wenn die Methoden zur BekĂ€mpfung von Ăberanpassung (also eine schwache GeneralisierungsfĂ€higkeit) offensichtlich nicht Teil dieses Artikels sind, dann lassen Sie uns den zweiten Punkt nĂ€her betrachten. Dazu genĂŒgt es, eine einfache Frage zu beantworten. Kann die Wahrscheinlichkeit der RĂŒckzahlung eines Kredits durch Wassja und Fedja unter BerĂŒcksichtigung der uns bekannten Faktoren gleich sein? Nach gesunden Menschenverstand kann die Antwort natĂŒrlich nein, kann sie nicht. So wird Wassja 2,5% seines Gehalts pro Monat fĂŒr die RĂŒckzahlung des Kredits aufwenden, wĂ€hrend Fedja fast 27,8% aufbringen wird. Auch auf Grafik 2 âKlassifikation der Kundenâ sehen wir, dass Wassja deutlich weiter von der Linie entfernt ist, die die Klassen trennt, als Fedja. Und schlieĂlich wissen wir, dass die Funktion
fĂŒr Wassja und Fedja unterschiedliche Werte annimmt: 4,24 fĂŒr Wassja und 1,0 fĂŒr Fedja. Wenn Fedja zum Beispiel ein Vielfaches mehr verdienen oder einen kleineren Kredit beantragen wĂŒrde, dann wĂ€ren die RĂŒckzahlungswahrscheinlichkeiten fĂŒr Wassja und Fedja Ă€hnlich. Mit anderen Worten, eine lineare AbhĂ€ngigkeit lĂ€sst sich nicht tĂ€uschen. Und hĂ€tten wir tatsĂ€chlich die Koeffizienten
, und nicht aus der Luft gegriffen, könnten wir mit Zuversicht behaupten, dass unsere Werte
am besten die Wahrscheinlichkeit der RĂŒckzahlung des Kredits durch jeden Kreditnehmer einschĂ€tzen, aber da wir vereinbart haben, dass die Bestimmung der Koeffizienten
nach allen Regeln durchgefĂŒhrt wurde, werden wir auch so verfahren â unsere Koeffizienten ermöglichen es uns, die Wahrscheinlichkeit besser einzuschĂ€tzen đ
Aber wir sind abgeschweift. In diesem Abschnitt mĂŒssen wir klĂ€ren, wie der Gewichtungsvektor
, der notwendig ist, um die Wahrscheinlichkeit der RĂŒckzahlung des Kredits durch jeden Kreditnehmer zu bewerten, definiert wird.
Zusammenfassend fassen wir zusammen, mit welchem Arsenal wir auf die Suche nach den Koeffizienten gehen
:
1. Wir nehmen an, dass die AbhĂ€ngigkeit zwischen der Zielvariable (der prognostizierten GröĂe) und dem Faktor, der das Ergebnis beeinflusst â linear ist. Aus diesem Grund wird verwendet, die Funktion der linearen Regression vom Typ
, dessen Linie die Objekte (Kunden) in Klassen einteilt
und
oder
(Kunden, die den Kredit zurĂŒckzahlen können und solche, die dies nicht können). In unserem Fall hat die Gleichung die Form
.
2. Wir verwenden die Funktion der inversen Logit-Transformation vom Typ
um die Wahrscheinlichkeit der Zugehörigkeit eines Objekts zur Klasse zu bestimmen
.
3. Wir betrachten unsere Trainingsstichprobe als eine Umsetzung der Verallgemeinerung Bernoulli-Schemata, das heiĂt, fĂŒr jedes Objekt wird eine ZufallsgröĂe generiert, die mit einer Wahrscheinlichkeit
(eigen fĂŒr jedes Objekt) den Wert 1 annimmt und mit einer Wahrscheinlichkeit
â 0.
4. Wir wissen, dass wir maximieren mĂŒssen die Funktion der Wahrscheinlichkeit der Stichprobe, , unter BerĂŒcksichtigung der angenommenen Faktoren, damit die vorhandene Stichprobe am glaubwĂŒrdigsten wird. Mit anderen Worten, wir mĂŒssen Parameter finden, bei denen die Stichprobe am glaubwĂŒrdigsten ist. In unserem Fall ist der gesuchte Parameter die Wahrscheinlichkeit der KreditrĂŒckzahlung
, die ihrerseits von unbekannten Koeffizienten abhÀngt
. Das bedeutet, wir mĂŒssen einen solchen Gewichtungsvektor finden
, bei dem die GlaubwĂŒrdigkeit der Stichprobe maximal ist.
5. Wir wissen, dass zur Maximierung der GlaubwĂŒrdigkeitsfunktion der Stichprobe kann man verwenden Maximum-Likelihood-Verfahren. Und wir kennen alle Tricks, um mit dieser Methode zu arbeiten.
So ergibt sich eine mehrstufige Vorgehensweise đ
Und jetzt erinnern wir uns, dass wir zu Beginn des Artikels zwei Arten von Verlustfunktionen ableiten wollten Logistic Loss , abhÀngig davon, wie die Klassen der Objekte benannt sind. Es hat sich so ergeben, dass in Klassifikationsaufgaben mit zwei Klassen die Klassen als
und
oder
bezeichnet werden. Je nach Benennung ergibt sich die entsprechende Verlustfunktion.
Fall 1. Klassifikation von Objekten in
und 
FrĂŒher, bei der Bestimmung der GlaubwĂŒrdigkeit der Stichprobe, bei der die Wahrscheinlichkeit der RĂŒckzahlung der Schulden durch den Kreditnehmer aus Faktoren und vorgegebenen Koeffizienten berechnet wurde
, haben wir die Formel angewendet:

TatsÀchlich
â ist das der Wert der logistischen Reaktionsfunktion
fĂŒr einen gegebenen Gewichtungsvektor 
Dann steht uns nichts im Wege, die GlaubwĂŒrdigkeitsfunktion der Stichprobe so zu schreiben:

Es kommt vor, dass es manchmal einigen angehenden Analysten schwerfÀllt, sofort zu verstehen, wie diese Funktion funktioniert. Lassen Sie uns 4 kurze Beispiele betrachten, die alles klarstellen werden:
1. Wenn
(d.h. gemÀà der Trainingsstichprobe gehört das Objekt zur Klasse +1), und unser Algorithmus
bestimmt die Wahrscheinlichkeit, dass das Objekt zur Klasse
gleich 0.9 gehört, dann wird dieser Teil der GlaubwĂŒrdigkeit der Stichprobe so berechnet:

2. Wenn
, und
, dann wird die Berechnung so aussehen:

3. Wenn
, und
, dann wird die Berechnung so aussehen:

4. Wenn
, und
, dann wird die Berechnung so aussehen:

Offensichtlich wird die GlaubwĂŒrdigkeitsfunktion in den FĂ€llen 1 und 3 oder im Allgemeinen maximiert â bei richtig erratenen Werten der Wahrscheinlichkeiten, dass das Objekt zur Klasse gehört
.
In Anbetracht dessen, dass bei der Bestimmung der Wahrscheinlichkeit, dass das Objekt zur Klasse gehört
Uns sind nur die Koeffizienten nicht bekannt
, die wir suchen werden. Wie oben erwĂ€hnt, handelt es sich um ein Optimierungsproblem, bei dem wir zunĂ€chst die Ableitung der Likelihood-Funktion nach dem Gewichtungsvektor finden mĂŒssen
. Es macht jedoch Sinn, die Aufgabe im Vorfeld zu vereinfachen: Wir suchen die Ableitung des Logarithmus Likelihood-Funktion.

Warum wir nach der Logarithmierung in der logistischen Fehlerfunktion, haben wir das Vorzeichen geÀndert von
auf
. Das ist ganz einfach, da es in der Bewertung der ModellqualitĂ€t ĂŒblich ist, den Funktionswert zu minimieren, haben wir die rechte Seite des Ausdrucks mit
multipliziert und anstelle von Maximierung minimieren wir nun die Funktion.
TatsĂ€chlich wurde hier gerade vor Ihren Augen die Verlustfunktion mĂŒhsam abgeleitet - Logistic Loss fĂŒr die Trainingsdaten mit zwei Klassen:
und
.
Um die Koeffizienten zu finden, mĂŒssen wir nur die Ableitung finden der logistischen Fehlerfunktion und anschlieĂend, unter Verwendung numerischer Optimierungsmethoden wie Gradientensenkung oder stochastische Gradientensenkung, die optimalsten Koeffizienten ermitteln
. Aber da der Umfang des Artikels bereits nicht unerheblich ist, wird vorgeschlagen, die Differenzierung selbst durchzufĂŒhren oder vielleicht wird dies das Thema des nĂ€chsten Artikels mit mehr Arithmetik ohne so viele ausfĂŒhrliche Beispiele sein.
Fall 2. Klassifizierung von Objekten in
und 
Der Ansatz hier wird derselbe sein wie bei den Klassen
und
, aber der Weg zur Ableitung der Verlustfunktion Logistic Loss, wird verzweigter sein. Lass uns anfangen. FĂŒr die Likelihood-Funktion verwenden wir den Operator âwennâŠ, dannâŠâ. Das heiĂt, wenn
das Objekt zur Klasse
gehört, verwenden wir zur Berechnung der Wahrscheinlichkeit der Auswahl die Wahrscheinlichkeit
, wenn das Objekt zur Klasse
gehört, setzen wir in die Likelihood ein
. So sieht die Likelihood-Funktion aus:

Um es anschaulich zu machen, betrachten wir 4 FĂ€lle:
1. Wenn
und
, dann wird die Wahrscheinlichkeit der Auswahl âeinflieĂenâ 
2. Wenn
und
, dann wird die Wahrscheinlichkeit der Auswahl âeinflieĂenâ 
3. Wenn
und
, dann wird die Wahrscheinlichkeit der Auswahl âeinflieĂenâ 
4. Wenn
und
, dann wird die Wahrscheinlichkeit der Auswahl âeinflieĂenâ 
Offensichtlich wird im Fall 1 und 3, wenn die Wahrscheinlichkeiten korrekt vom Algorithmus bestimmt wurden, die Likelihood-Funktion maximiert, und genau das wollten wir erreichen. Dieser Ansatz ist jedoch recht umstÀndlich, und wir werden eine kompaktere Darstellung betrachten. ZunÀchst logarithmieren wir die Likelihood-Funktion und Àndern das Vorzeichen, da wir sie jetzt minimieren werden.

Setzen wir anstelle von
den Ausdruck ein
:

Vereinfachen wir den rechten Summanden unter dem Logarithmus mit einfachen arithmetischen Methoden und erhalten:

Jetzt ist es an der Zeit, den Operator loszuwerden âwennâŠ, dannâŠâ. Beachten Sie, dass wenn das Objekt
zur Klasse
gehört, dann im Ausdruck unter dem Logarithmus, im Nenner,
in die Potenz
, wenn das Objekt zur Klasse
gehoben wird, dann wird $e$ in die Potenz
. Folglich kann die Darstellung der Potenz vereinfacht werden â beide FĂ€lle können in einem kombiniert werden:
. Dann die Funktion des logistischen Fehlers nimmt die Form an:

Entsprechend den Regeln der Logarithmierung kehren wir den Bruch um und bringen das Zeichen "
" (Minus) aus dem Logarithmus heraus und erhalten:

Vor Ihnen steht die Verlustfunktion logistic Loss, die in TrainingsdatensÀtzen mit Objekten, die zu Klassen gehören, Anwendung findet:
und
.
Nun, an dieser Stelle verabschiede ich mich und wir beenden den Artikel.
Die vorherige Arbeit des Autors â âWir bringen die lineare Regressionsgleichung in eine Matrixdarstellungâ
Hilfsmaterialien
1. Literatur
1) Angewandte Regressionsanalyse / N. Draper, G. Smith â 2. Aufl. â Moskau: Finanzen und Statistik, 1986 (Ăbersetzung aus dem Englischen)
2) Wahrscheinlichkeitstheorie und mathematische Statistik / V.E. Gmurmаn â 9. Aufl. â Moskau: Hochschule, 2003
3) Wahrscheinlichkeitstheorie / N.I. Tschernowa â Nowosibirsk: Staatliche UniversitĂ€t Nowosibirsk, 2007
4) GeschĂ€ftsanalyse: Von Daten zu Wissen / Paklin N.B., Oreschkow W.I. â 2. Aufl. â Sankt Petersburg: Piter, 2013
5) Data Science Wissenschaft der Daten von Grund auf / Joel Grass â Sankt Petersburg: BHV Petersburg, 2017
6) Praktische Statistik fĂŒr Data Science Spezialisten / P. Bruce, E. Bruce â Sankt Petersburg: BHV Petersburg, 2018
2. Vorlesungen, Kurse (Videos)
1)
2)
3)
4)
5)
3. Internetquellen
1)
2)
3)
4)
5)
6)
7)
8)
Quelle: habr.com

in der logistischen Reaktionsfunktion 
Funktionen Logistic Loss
:

zuordnen, dann wird der Wert der Funktion
positiv aus sein.
bis
Das bedeutet, wir können annehmen, dass die Wahrscheinlichkeit der RĂŒckzahlung des Kredits im Bereich von
liegt. Je gröĂer der Funktionswert, desto höher die Wahrscheinlichkeit.
oder
zuordnen, dann wird der Funktionswert negativ aus
bis
. Dann betrachten wir die Wahrscheinlichkeit der RĂŒckzahlung der Schuld im Bereich von
, und je gröĂer der Betrag des Funktionswertes ist, desto höher ist unser Vertrauen.
gleich
sein und die Wahrscheinlichkeit der RĂŒckzahlung des Kredits betrĂ€gt
.


in der logistischen Reaktionsfunktion
und 
und 